Transformers v5.14: وصول Inkling (975B، أوزان مفتوحة) وتحسينات أداء وبنية مهمة للمطوّرين

في إصدار v5.14 من مكتبة Transformers أُضيف نموذج Inkling—نموذج عام متعدد الوسائط بقدرة 975 مليار معلمات إجمالية و41 مليار "نشطة"، وتم نشر الأوزان بصيغة مفتوحة لتسهيل البحث والتكييف. أصدر الفريق أيضًا TIPSv2 ونسخته DPT. بجانب ذلك، تضمّن الإصدار إصلاحات وتحسينات بنيوية: تحديث SDPA prefill لاستخدام FlashAttention مع StaticCache (مُبلَّغ عن تسريع يصل إلى 260% للحالات الكبيرة)، إصلاحات أداء Flash Attention وMoE، تبسيط إدارة الكاش، وعدد من إصلاحات الكيرنل والاختبارات. نُبهت الملاحظات إلى تغييرات توافقية تتطلب تحديثات في الكود (مثلاً remap لطبقات GPTNeoX ودعم attention backend في GPTBigCode لملاءمة vLLM). المصدر: صفحة الإصدارات الرسمية على GitHub.

واتساب
إصدار نموذج · غلاف توضيحي للمقال

ماذا حدث؟

أصدرت مكتبة Transformers (v5.14.0) مجموعة تغييرات شاملة تضم إضافة نموذج جديد كبير متعدد الوسائط، إصلاحات أداء وبُنية، وتحسينات تشغيلية للمطوّرين. التفاصيل الرئيسية وفقًا لملاحظات الإصدار على GitHub:

إضافة نموذج Inkling

  • تمت إضافة Inkling (وُصفت في الملاحظة بأنها "fresh from Thinking Machines"): نموذج متعدد الوسائط يقبل مدخلات نصية وصورية وصوتية ويُنتج نصًا. الحجم المعلن: 975B معلمات إجمالية و41B "نشط". الإصدار نُشر مع أوزان مفتوحة لدعم البحث والتكييف ودمجه في منتجات الطرف الثالث.
  • الاستخدام المقترح: بنى عامة للتحدث والتعليمات، تطبيقات وكيلة agentic، مساعدي برمجة، روبوتات محادثة، وأنظمة استرجاع معزز بالتوليد.

ملاحظة مهمة: إعلان الأوزان المفتوحة يتيح للباحثين والشركات تكييف النموذج للغات وأسواق محلية، لكن تفاصيل الترخيص والاستخدام التجاري يجب مراجعتها في بطاقة النموذج (model card) ونص الترخيص المرتبط بالمستودع قبل الاعتماد التجاري.

إضافات TIPSv2

  • أُضيفت نسختا TIPSv2 وTIPSv2 DPT (روابط التوثيق متاحة في ملاحظات الإصدار).

تغييرات توافقية هامة (Breaking changes)

  • GPTNeoX يعيد تسمية embed_out إلى lm_head (remap).
  • GPTBigCode يعين _supports_attention_backend = True لملاءمة vLLM.

إذا اعتمدت أنظمةكم على أسماء الأوزان القديمة أو على سلوك backend لمكون الانتباه، فستحتاجون إلى تحديث الكود أو سكربتات التحميل لتجنّب الأخطاء.

تحسينات الأداء والبنية

  • SDPA prefill تمّ تحديثه لاستخدام FlashAttention kernel مع StaticCache — الملاحظة تشير إلى تسريع يصل إلى 260% للحجم الكبير من الإدخالات (قيمة مُبلَّغ عنها في ملاحظات الإصدار؛ انظر القياسات الخاصة ببيئتكم للتحقق).
  • إصلاح تراجعات أداء في Flash Attention، وتصحيح تحسينات فك تشفير MoE للخبراء الموجودين داخل نماذج فرعية.
  • تحسين مرونة DeepGEMM Triton fallback عندما تكون متغيرات بيئة CUDA غير مضبوطة بشكل سليم.

تغييرات في الكاش والذاكرة

  • تبسيط منطق توجيه الكاش عبر تعيينات صريحة لأنواع الطبقات (sliding/static).
  • إصلاح فشل الكاش في بيئات CI للقراءة فقط، ومعالجة نمو مكدس رسومات MPS على Apple Silicon أثناء التدريب على دفعات متغيرة الطول.

تحسينات التوليد والموثوقية

  • إضافة دعم Multi-Token Prediction (MTP) في توليد النص.
  • إدخال تحقق ensemble ثابت لرفع معدل قبول مسودات speculative decoding.
  • إصلاح حالات تعطل في توليد مدعوم بطريق الجشع عند استخدام توكنيزرات مختلفة.

ثروة من إصلاحات الأخطاء ومساهمات المجتمعات

  • مئات التعديلات تشمل إصلاحات CI، تحسينات الوثائق، تحديثات لبيئات AMD/Neuronal، تصحيحات لبناء Docker لخاصية flash-attn، ودعم تكوينات متغايرة per-layer.
  • قائمة طويلة من المساهمين البارزين ذُكرت في ملاحظة الإصدار.

المصدر: ملاحظات الإصدار الرسمية — Transformers v5.14.0 (GitHub)
https://github.com/huggingface/transformers/releases/tag/v5.14.0

انتهت القصة، لا السياق.

نحدّث تغطيتنا عندما تظهر معلومات موثوقة جديدة.

اقرأ أيضاً

قصص تكمل الصورة

كل الأخبار

مايكروسوفت تُطلق Aurora 1.5: نموذج أساسي مفتوح للتنبؤات الجوية بنطاقات زمنية وبيانات أوسع وتنبؤ احتمالي

أعلنت مايكروسوفت عن Aurora 1.5، توسيع كبير لنموذج Aurora الأرضي المفتوح: 22 متغيّراً جويّاً إضافياً، دقة زمنية بالساعة، وقدرة ensemble احصائية لتمثيل عدم اليقين. النموذج متاح على GitHub ومع نقاط تفتيش على Hugging Face، مع مسارات لعبور البحث إلى خدمات تشغيلية عبر Microsoft Weather.

بحث جديد: هل تستعيد نماذج اللغة الكبيرة قواعد تحسين يغفِلها المجمعون؟

ورقة arXiv تُقدّم SeGaBench، معيارًا تجريبيًا يختبر قدرة نماذج اللغة الكبيرة على استعادة «الدلالات المُمكنة» التي يغفلها تمثيل البرنامج لدى المجمع، وإنتاج تحويهات مُتحقّق منها تحسّن الأداء. أقوى نموذج حقق نسبة صحّة 94.8% وسرعات محسّنة في 83.3% من الإجابات، لكن النتائج غالبًا تغلق جزءًا فقط من الفجوة المثالية.

ما قبل التهيئة بالمنطق: تهيئة نماذج اللغة على استدلالات رسمية تُسرِّع التعلم وتُسهِم في ضغط النماذج

ورقة تقترح Logic-PPT: تهيئة أولية لنماذج اللغة على بيانات استدلال رسمية. على مقياس 100B توكين، تؤدي إلى اكتساب أسرع للمهارات اللغوية (80% دقة مع تقليل ~36B توكين) وتغيّر هندسة التمثيلات داخلياً بما يُسهِم في ضغط أفضل (مطابقة النموذج الكثيف عند ≈33% تشذيب). النتائج من الورقة على arXiv.