Transformers v5.14: إضافة Inkling مفتوح الأوزان
إصدار Transformers v5.14 يضم Inkling، نموذج multimodal كبير مبيّن في ملاحظات الإصدار بأنه مفتوح الأوزان ويقبل نصاً وصوراً وصوتاً وينتج نصاً. أُضيفت أيضاً TIPSv2 وTIPSv2-DPT. على مستوى البنية والأداء جرى إصلاح FlashAttention وتعديل SDPA prefill للاستفادة من StaticCache ما أشار التقرير إلى تسريع يصل حتى ~260% لحالات المدخلات الكبيرة. ملاحظات الإصدار تذكر تغييرات كسرية في تسمية الأوزان ودعم backend الانتباه لتمكين التوافق مع vLLM. يجب على المطورين والشركات مراجعة الترخيص، قياسات الأداء، والتوافق مع بيئة التشغيل قبل اعتماد النموذج في الإنتاج.
الجديد
Transformers v5.14 أضافت نموذج Inkling من Thinking Machines. ملاحظات الإصدار تذكر أن Inkling بحجم 975B إجمالي و41B نشط، ويقبل مدخلات نصية وصورية وصوتية ويولد مخرجات نصية. الملاحظات تشير أيضاً إلى أن Inkling مُصدر "بأوزان مفتوحة" لدعم البحث والتخصيص والدمج من قبل مطورين خارجيين.
الإصدار أضاف كذلك TIPSv2 وTIPSv2 DPT، مع روابط توثيقية في مستودعات Hugging Face. كما شملت التحديثات إصلاحات ونوعيات تحسينات في النوى (kernels)، توليد النصوص (بما في ذلك دعم Multi-Token Prediction و speculative decoding)، وإصلاحات أداء عامة.
تقرير الإصدار ذكر تحديث SDPA prefill لاستخدام FlashAttention مع StaticCache، وذكر زيادة أداء تصل حتى ~260% لحجم مدخلات كبير في الاختبارات الموضحة في المطلب الخاص بالتغيير. كما ذُكرت تغييرات كسرية: إعادة تصنيف embed_out إلى lm_head في GPTNeoX وتمكين _supports_attention_backend = True في GPTBigCode لدعم التوافق مع vLLM.
لماذا يهم
وجود نموذج كبير مفتوح الأوزان على مستوى Inkling يخفض عتبة الوصول للبحث والتجربة على نماذج multimodal كبيرة. التحسينات على FlashAttention وStaticCache قد تخفض زمن الاستدلال لحالات الإدخال الكبيرة وتقلل تكاليف بنية تحتية معينة، وفق ملاحظات الإصدار.
التغييرات الكسرية تعني أن بعض شيفرات التكامل أو استدعاءات الأوزان قد تحتاج تعديل فوري لتجنب توقف العمل مع إصدارات سابقة من النماذج أو أدوات مثل vLLM.
عندنا في المنطقة
ملاحظات الإصدار تصرح أن Inkling موجهة للاستخدام بالإنجليزية ولغات أخرى، لكنها لا تذكر بيانات تدريب أو تقييم مخصصة للّغات العربية. لذلك إمكانية الاستفادة المباشرة من أداء النموذج على المهام العربية لا تزال بحاجة تحقق مستقل.
إمكانية الوصول إلى الأوزان المفتوحة وتعريف بيئات التنفيذ محلياً قد تكون مفيدة للمؤسسات في المنطقة التي تفضل حلولاً على البنية التحتية الخاصة لأسباب خصوصية أو امتثال، لكن التكلفة التشغيلية للـ975B ستبقى عائقاً عملياً لمعظم الفرق دون موارد حوسبة كبيرة.
ماذا يعني لك
راجع ترخيص Inkling وتوافر الأوزان في صفحة الإصدار وHugging Face Hub قبل الاستخدام. اختبر التوافق مع стек التنفيذ لديك (مثلاً vLLM، دعم FlashAttention على العتاد المتوفر، وإعدادات StaticCache). قِس الأداء والدقة على مجموعات بيانات عربية خاصة بحالتك قبل نشر النموذج في الإنتاج.
حدّث أي كود يعتمد على تسميات أوزان قديمة أو على سلوك backend الانتباه، خصوصاً إذا كنت تستخدم GPTNeoX أو GPTBigCode أو مكتبات طرف ثالث للتسريع.
ما زال غير واضح
ملاحظات الإصدار لا تقدم اختبارات معيارية مفصلة لأداء Inkling على مهمات multilingual أو على العربية تحديداً. كما لا توضح الملاحظات شروط الترخيص التفصيلية أو قيود الاستخدام المرتبطة بالأوزان المفتوحة.
لا توجد معلومات مفصّلة عن متطلبات التشغيل الذاكرية والحوسبية لتشغيل Inkling في إعداد نشط (inference) أو للتخصيص (fine-tuning). كما لا ورد تقرير سلامة أو تقييم تحيّزات مرفق في ملاحظات الإصدار.