Ai2 Olmo-core 3: بنية مفتوحة لتدريب نماذج MoE
فريق تحرير بوابة الذكاء الاصطناعي
هيئة التحرير والتحليل التقني
يمثل Olmo-core 3 من Ai2 حزمة بنية تحتية مفتوحة لتوسيع نطاق أنظمة mixture-of-experts، مع تصميم يستهدف تدريب نماذج بحجم يصل إلى تريليون مُعامِل، وإتاحة تجارب أكثر مرونة عبر عتاد مختلف.
أبرز النقاط
- يمثل Olmo-core 3 بنية تحتية مفتوحة لتدريب نماذج mixture-of-experts الكبيرة، أو MoE، وليس نقطة وصول إلى نموذج مخصص للمستخدم النهائي.
- تصف Ai2 هذه الحزمة بأنها مصممة لتوسيع نطاق تدريب نماذج MoE إلى مستوى التريليون مُعامِل، مع الحفاظ على الكفاءة الحوسبية.
- ينقل النظام نهج Olmo-core السابق في MoE من تجميع الأوزان وإعادة تقسيمها بالاعتماد على FSDP إلى parallelism موزع للبيانات، أو DDP.
- في التصميم الجديد، تبقى الخبراء مقيمين على وحدات GPU، وتُوجَّه البيانات ذات الصلة إليهم، ما يلغي الحاجة إلى تكرار تجميع الأوزان.
- يهدف المشروع إلى تمكين الباحثين والمطورين من تدريب نماذج MoE الخاصة بهم، وتكييف البنية التحتية مع عتاد مختلف، وتجربة أساليب التوجيه والتوازي.
- توضح أعمال Ai2 الأوسع في البنية التحتية بيئة التشغيل: آلاف وحدات NVIDIA H100 وB200 وB300، وعناقيد تتراوح بين ٨٨ و١٬٠٢٤ وحدة GPU، وطلب على سعة GPU يزيد بمرتين إلى ثلاث مرات على السعة المتاحة.
ما هو Ai2 Olmo-core 3؟
قدمت Ai2 مشروع Olmo-core 3 بوصفه بنية تحتية مفتوحة وقابلة للتوسع لتدريب أنظمة mixture-of-experts الكبيرة. ويُقدَّم المشروع كأساس للجيل المقبل من Olmo لدى المنظمة. ومن المنتظر أن يستخدم ذلك الجيل بنية MoE، كما يُطوَّر بالاعتماد على أكبر مجموعة بيانات لدى Ai2 وأطول نافذة سياق لديها.
النقطة المهمة هي أن Olmo-core 3 يمثل بنية تحتية. فالوصف المتحقق منه لا يعلن عن نموذج مطروح للمستخدم النهائي مع عدد محدد من المُعامِلات أو نتيجة معيارية أو إجمالي رموز تدريب أو API تجاري. بل يعرض نظام تدريب يستطيع الباحثون والمطورون استخدامه لتدريب نماذج MoE الخاصة بهم، وتكييفه مع عتاد مختلف، ودراسة التوجيه والتوازي وسائر أجزاء عملية التدريب.
يضع هذا التوجه Olmo-core 3 في مرحلة تسبق واجهة النموذج المألوفة. فتطبيق الدردشة يعرض نتيجة نموذج مدرَّب، بينما تتولى حزمة البنية التحتية للتدريب أعمال الأنظمة اللازمة لإنتاج ذلك النموذج: توزيع الحوسبة، والحفاظ على انشغال العتاد، ونقل البيانات ذات الصلة، وتكييف عملية التدريب مع تغير تصاميم النماذج وبيئات المسرّعات. ويصف المصدر Olmo-core 3 بأنه أساس يهدف إلى توفير هذه المرونة.
كما تقدم Ai2 المشروع باعتباره جزءاً من التزام أوسع بتطوير النماذج المفتوحة. ووفق هذا النهج، تصبح أوزان النماذج أكثر فائدة عندما تكون البنية التحتية وقرارات التدريب التي تقف وراءها مفتوحة أيضاً. ولا يعني ذلك أن السياق يثبت أفضلية محددة في الأداء أو خفضاً للتكلفة أو نتيجة إنتاجية معينة، بل يعني أن المشروع يركز، وفق ما أُعلن، على إتاحة البنية التحتية وقرارات التدريب التي ستقود تطوير Olmo مستقبلاً.
لماذا تهم بنية تدريب MoE التحتية؟
تقسم نماذج mixture-of-experts النموذج إلى مكونات متخصصة، وتوجه المهام بينها. ويحدد السياق المتحقق منه التوجيه والتوازي باعتبارهما مجالين يمكن للباحثين التجربة فيهما باستخدام Olmo-core 3. كما يذكر أن الحزمة مصممة لتدريب نماذج MoE في نطاق التريليون مُعامِل مع الحفاظ على الكفاءة الحوسبية.
يفرض هذا الهدف تحدياً على مستوى الأنظمة. فالنموذج الكبير من نوع MoE ليس مجرد تعريف لنموذج، بل يحتاج أيضاً إلى طريقة لوضع الخبراء على المسرّعات المتاحة، وإيصال البيانات ذات الصلة إليهم أثناء التدريب الموزع. لذلك يجب أن تراعي البنية كيفية تقسيم الحوسبة بين الأجهزة، وكيف تتغير عملية التدريب عندما يتوزع الخبراء عبر عنقود كبير.
يُقدَّم Olmo-core 3 استجابة لهذا التحدي، وليس إعلاناً عاماً عن تدريب النماذج. ويتمثل هدفه المعلن في منح الباحثين مرونة أكبر مع تطور النماذج والعتاد. وتبرز أهمية ذلك لأن حزمة التدريب المرتبطة بشدة بترتيب واحد للعتاد أو بتصميم واحد للنموذج يصعب تكييفها. ويهدف التصميم المفتوح للمشروع إلى دعم التجارب على عتاد وأساليب توجيه واستراتيجيات توازٍ مختلفة، إلى جانب مكونات أخرى من النظام.
ينبغي فهم عبارة «نطاق التريليون مُعامِل» باعتبارها وصفاً للحجم المستهدف للبنية التحتية، لا دليلاً على إطلاق نموذج يحوي تريليون مُعامِل ضمن السياق المقدم. فالمادة المتحققة لا تقدم إجمالي مُعامِلات لنموذج مكتمل، أو نتيجة تدريب، أو جدولاً معيارياً، أو ادعاءً بأن كل مؤسسة قادرة على تشغيل نظام كهذا. والاستنتاج الموثوق أضيق نطاقاً: تبني Ai2 حزمة تدريب تستهدف أنظمة MoE أكبر بكثير من أعمالها السابقة.
كيف تطور Olmo-core؟
تغير Olmo-core عبر أجيال Olmo المختلفة. وشملت أعمال Ai2 السابقة في النماذج المتناثرة OlmoE، الذي استخدم بنية MoE تضم ٦٤ خبيراً موجهاً. أما Olmo 3 فاستخدم بنية كثيفة. وفي البنية الكثيفة، يكون معظم النموذج نشطاً لكل رمز، وقد بُنيت حزمة التدريب حول هذا التصميم.
يوسع Olmo-core 3 إطار العمل بنظام تدريب مخصص لنماذج MoE أكبر بكثير. ولا تكمن أهمية هذا التطور في ظهور كلمة «MoE» ضمن وصف مشروع جديد فحسب، إذ تختلف افتراضات التدريب بين نموذج كثيف ونموذج متناثر يضم خبراء موزعين. لذلك يجب أن تتطور...
تابع القراءة
سجل دخولك مجاناً لقراءة المقال كاملاً والوصول إلى أدوات الذكاء الاصطناعي.
تسجيل الدخول / إنشاء حساب