Muon يحسّن الإسقاط في Mamba-2 130M

ورقة نشرها الباحثون على arXiv تقارن Muon وAdamW في نموذج SSM Mamba-2 130M تحت بروتوكول محكم يغيّر فقط مجموعات الأوزان التي يتدرب عليها Muon. Muon يستخدم تكرار Newton–Schulz ليؤرثن التحديث لكل مصفوفة وزن ويؤدي نزولًا حادًا تحت معيار الطيف (spectral norm). النتيجة العملية في هذه الدراسة أن تطبيق Muon على إخراج الإسقاط (output projection) وحده يتفوق على تطبيقه على مدخل الإسقاط (input projection) أو على كلا الإسقاطين. الفائدة تترجم أساسًا إلى كفاءة في عدد التوكنات، وتظهر عبر مصدرين نصيين وميزانيتي توكن مختلفتين، وتستمر حتى بعد تجاوز نقطة الكفاءة الحسابية المثلى. تخفيض condition number يحدث للمصفوفة التي يعالجها Muon، لكن هذا التغيير في التكييف لا يفسر سبب الفائدة العملية بحسب مؤلفي الورقة (arXiv).

واتساب

الجديد

الورقة تقارن Muon وAdamW في نموذج SSM واحد هو Mamba-2 130M تحت بروتوكول تجريبي محكم. Muon يؤرثن التحديث لكل مصفوفة وزن باستخدام تكرار Newton–Schulz ويجري نزولًا حادًا تحت معيار الطيف، وفقًا لورقة arXiv. التجربة تباينت فقط في أي مجموعات أوزان تُدرّب باستخدام Muon.

لماذا يهم

النتيجة تظهر أن فائدة Muon على SSM قد تكون محلية لمجموعات أوزان محددة، لا عامة عبر الشبكة كاملة. تطبيق Muon على إخراج الإسقاط وحده أعطى أداءً أفضل من تطبيقه على مدخل الإسقاط أو على كلا الإسقاطين، حسب التقرير على arXiv. الفائدة تجلت كتحسين في كفاءة التوكن، أي أنها تؤدي إلى نتائج أفضل لكل عدد معين من التوكنات المُدَرَّبة.

عندنا في المنطقة

التجربة استخدمت Mamba-2 130M، وهي عائلة SSM ممثلة للتسلسلات الطويلة. لا توجد بيانات مباشرة في الورقة عن لغات محددة أو مهام عربية. مع ذلك، أي فرق في كفاءة التوكن على SSM قد يهم فرق بناء نماذج اللغة العربية إذا اعتمدت على SSMs.

ماذا يعني لك

إذا تستخدم SSM مثل Mamba-2، جرب تطبيق Muon انتقائيًا على إخراج الإسقاط قبل تعميمه على كامل المعمارية. النتائج المبلغ عنها كانت مستقرة عبر مصدرين نصيين وميزانيتي توكن مختلفتين، وتظل الفائدة حتى مع استكمال التدريب بعد نقطة الكفاءة الحسابية المثلى. الورقة تُظهر أيضًا أن Muon يخفض condition number للمصفوفات التي يُطبَّق عليها، لكن هذا لا يشرح سبب الفائدة العملية.

ما زال غير واضح

الورقة تقيّد نتائجها بنموذج واحد وحجم واحد (Mamba-2 130M) ومجموعتي بيانات. لذلك لا يمكن استنتاج تعميم فوري إلى أحجام أكبر أو عائلات معمارية أخرى. السبب الآلي لتميّز إخراج الإسقاط لم يُفسّر بالكامل، وورقة arXiv تقترح أن التكييف (conditioning) ليس التفسير الكامل.

انتهى الخبر، لا السياق.

نحدّث الخبر كل ما وصلتنا معلومة جديدة.

اقرأ أيضاً

أخبار مرتبطة

كل الأخبار

SocietyBench: معيار جديد لتقييم قدرة النماذج على توقع تطورات العالم الاجتماعي في إطار «عوالم مضادة للواقع»

SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.