ميتا تضاعف كفاءة تدريب GEM على نطاق LLM

وفق منشور مهندسي Meta، نموذج التوصية الإعلانية GEM تدرب الآن على مستوى LLM عبر عدة آلاف من أحدث GPUs. حققت الشركة مضاعفة في كفاءة التدريب الشامل (E2E) إلى 20–25% Model FLOPs Utilization ورفع التدريب الكلي FLOPs بمقدار 4× خلال 12 شهراً. توصلت Meta إلى ذلك عبر تصميم مشترك بين نوى مخصصة للتوصية (Jagged Flash Attention — JFA، GDPA، BlockAttention)، وصفات دقة منخفضة مكيّفة (MXFP8)، واستراتيجية توازي متعددة الأبعاد مهيّأة للطوبولوجيا الشبكية (2D FSDP + Expert Parallelism للمعلمات الكثيفة وFully Sharded 2D للمعلمات النادرة)، إضافة إلى اتصالات خالية من SM باستخدام امتدادات NCCLX، حسب منشور Engineering at Meta.

واتساب

الجديد

ميتا أعلنت رفع كفاءة التدريب الشامل لنموذج التوصية الإعلانية GEM إلى 20–25% MFU. وفق منشور مهندسي Meta، أنجزت الشركة زيادة إجمالية في تدريب FLOPs بمقدار 4× خلال 12 شهراً.

التقنيات الأساسية تتضمن نوى مخصصة لأنماط التوصية: Jagged Flash Attention (JFA)، Generalized Dot-Product Attention (GDPA)، وBlockAttention. استخدمت Meta وصفات تدريب بدقة منخفضة مكيّفة (MXFP8) وعدداً من تحسينات التوازي الشبكي: 5D parallelism مع 2D FSDP وExpert Parallelism للمعلمات الكثيفة وFully Sharded 2D للمعلمات sparse. كما استعملت Meta امتدادات شبكية تسمى NCCLX لنقل البيانات دون إشغال SMs.

المنشور يذكر قياسات مكوّنات محددة: JFA v4 ساهمت بحوالي +18.5% في local MFU و+12% في QPS؛ GDPA حققت 2× تسريع أمامي و1.6× رجعي في أشكال ممثلة؛ MXFP8 أعطت >1.3× أمامي و>1.5× رجعي لبعض الأنوية؛ وBlockAttention مع fused rotary حسّن MFU لطبقة الانتباه بـ+30.6% مقارنة بتطبيق Triton المماثل.

لماذا يهم

المشكلة الأساسية أن بنى البنية التحتية المهيّأة لـLLM لا تنتقل مباشرة إلى أحمال توصية الإعلانات بسبب سلاسل إدخال "مجعّدة" (jagged) وجداول تضمين ضخمة جداً. هذا الفارق يقلل استغلال موارد GPU ويزيد تكلفة التدريب.

تحسين Meta يعالج جانبين منفصلين: كفاءة الحوسبة على مستوى GPU (local MFU) وكفاءة التوزيع عبر آلاف الـGPUs (scaling ratio). رفع كلاهما يؤدي إلى تحسين إقلاع نماذج التوصية الأكبر وتخفيض زمن التدريب والتكلفة لكل تجربة تدريبية.

عندنا في المنطقة

المنهجية مفيدة لمشغّلي نماذج التوصية والجهات التي تجمع سلاسل استخدام طويلة ومتغيرة الطول. لكنّ تطبيقها يتطلّب بنية تحتية متقدمة.

القيود العملية تشمل الحاجة إلى: وحدات GPU حديثة تدعم دقة منخفضة على مستوى الهاردوير، وصلات NVLink داخل العقدة، شبكة قادرة على RDMA وميزات تسريع شبكي، وإمكانية تعديل مكتبات مستوى منخفض (TLX/NCCLX مثل ما وصفت Meta).

مزودي السحابة الإقليميون أو مراكز البيانات التي تملك عقداً مزودة بـNVLink وRoCE قد تستفيد مباشرة؛ أما الشركات الأصغر فستستفيد أكثر من مفاهيم التصميم (التعامد بين النوى والدقة والتوازي) دون إمكانية إعادة إنتاج كامل النتائج دون استثمارات بنية تحتية.

ماذا يعني لك

للمهندسين: راجعوا أعباء العمل ذات التسلسلات المبعثرة قبل اعتماد نوى LLM قياسية. اختبروا أفكار مثل jagged-aware kernels وBlockAttention وGDPA قبل اعتماد FlashAttention قياسي. فكّروا في وصفات دقة منخفضة مكيّفة مع آليات تصحيح الانحراف والأوتلاير.

لصانعي القرار التجاري: تحسين كفاءة التدريب يخفض تكلفة التجارب ويُسرّع إطلاق تحسينات جودة الإعلانات. لكنّ العائد يعتمd على حجم البنية التحتية وإمكانية تشغيل آلاف الـGPUs أو الوصول إلى شبكات داخلية عالية الأداء.

لمطوّري النماذج المحلية: يمكن تطبيق مبادئ مثل تقليل الهدر من الـpadding، وإعادة توازن الحِمل (Base Batch Shuffling)، وضغط التنشيطات checkpointing مع كميات متدرجة من الدقة. هذه الأفكار قابلة للتبني تدريجياً قبل استثمار كبير في الأجهزة.

ما زال غير واضح

ما زالت بعض القيود غير مفصّلة في المنشور. المصدر لا يقدّم شيفرة مفتوحة أو وصفاً كاملاً لكيفية الوصول إلى امتدادات مثل NCCLX أو TLX.

مدى نقلية النتائج إلى بنى تحتية دون NVLink أو دون إمكانات RDMA لم يُثبت بعد. لا توضح المشاركة بدقّة نسب التأثير على جودة الإعلانات (CTR/CVR) بعد التكييف بالـMXFP8 خارج العتاد والبيئات التي استخدمت Meta.

المقارنات تعتمد على بنية شبكية داخلية وخوادم ذات آلاف GPUs، لذا قد لا تتحقق نفس المكاسب في مجموعات أصغر أو سحابية عامة بدون ميزات تشبيكية متقدمة.

انتهى الخبر، لا السياق.

نحدّث الخبر كل ما وصلتنا معلومة جديدة.

اقرأ أيضاً

أخبار مرتبطة

كل الأخبار

SocietyBench: معيار جديد لتقييم قدرة النماذج على توقع تطورات العالم الاجتماعي في إطار «عوالم مضادة للواقع»

SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.