vLLM v0.26.0: دعم Inkling وتحسينات أداء متعددة

DeepSeekمن DeepSeekTransformersمن Hugging Face

أصدر مشروع vLLM النسخة v0.26.0 مع 411 التزاماً من 212 مساهماً، حسب ملاحظات الإصدار الرسمية. أبرز الإضافات هي عائلة النماذج Inkling مع دعم LoRA وNVFP4 وميزات speculative decoding، ودفع أداء DeepSeek‑V4 عبر نوى توجيه متخصصة وعمليات kernel مدمجة. تحسّن دعم ROCm وXPU وCPU، وتمت توسيع نظام offloading للـ KV‑cache وطبقات تخزين ثانوية مع مزيد من المقاييس. الإصدار ضمّ أيضاً مسارات جديدة للـ head_dtype لفصل fp32 لدى الرؤوس التوليدية وتوسيع واجهات Transformers إلى إصدارات أحدث. الملاحظات الرسمية لا تذكر تخصيصاً للغة العربية أو نماذج موجهة إقليمياً.

واتساب

الجديد

الإصدار v0.26.0 يجمع 411 التزاماً من 212 مساهماً، وفق ملاحظات الإصدار الرسمية. قدم الإصدار عائلة نماذج جديدة تسمى Inkling مع دعم LoRA وNVFP4 وHopper FA4 relative attention وspeculative decoding. عزز فريق التطوير أداء DeepSeek‑V4 عبر نواة توجيه متخصصة وعمليات مثل fused_topk_bias وإزالة نسخ مكررة. أُضيف دعم fp32 للـ lm_head عبر head_dtype ومرّر إلى مسار LoRA، مع مسار تسريع لـ ROCm. صار بإمكان اختيار attention backend لكل مجموعة KV‑cache ودعم sliding‑window كقابلية مستقلة. نضجت آليات KV offloading وتخزين طبقي ثانوي مع مقاييس وأحداث مملوكة للطبقات وربط إلى object‑store. واجهت واجهة Rust توسعات متعددة الوسائط للفيديو والصوت، وانتقل جزء من النماذج إلى Transformers 5.13.0.

لماذا يهم

التغييرات تقلّل تكلفة التشغيل عبر تحسينات أداء على مستويات الـ kernel والديفرجينس عبر بائعي العتاد. KV offloading وtiered secondary storage يخفضان ذِروة الذاكرة المطلوبة لتشغيل سياقات طويلة. دعم LoRA وNVFP4 وhead_dtype fp32 يحسن دقة التوليد ويمنح خيارات كمّية أوسع لنشر النماذج. توسيع دعم ROCm وXPU وCPU يزيد مرونة النشر على بنى تحتية مختلفة. النشاط المجتمعي الكبير (411 التزاماً و212 مساهماً) يشير إلى استمرار تطوير النظام وإسهام عريض من البائعين والمجتمع.

عندنا في المنطقة

ملاحظات الإصدار لا تذكر خصائص أو نماذج مُهيّأة خصيصاً للغة العربية أو لأسواق الشرق الأوسط وشمال أفريقيا. تقنيّات تحسين الأداء والكمّيات وفصل الرؤوس التوليدية تفيد نشر نماذج تعمل بالعربية من حيث التكلفة والزمن الاستجابي، لكن لا توجد تغييرات مذكورة تتعلّق بتكويد الأحرف أو تحسّنات خاصة بالتقطيع العربي. الاعتماد على هذه الميزات سيعتمد على اختبارها على مجموعات بيانات عربية وبنى تحتية محلية.

ماذا يعني لك

لمشغلي البنية التحتية: اختبروا KV offloading وtiered storage لتقليل ذاكرة GPU المطلوبة لسياقات طويلة. لمهندسي النماذج: جرّبوا head_dtype لفصل fp32 على الرؤوس التوليدية وقيّموا أثره على جودة النص المولّد. لمطوري التكامل: راجعوا دعم ROCm وXPU والـ Rust frontend قبل ترحيل الأنظمة الإنتاجية. للمجتمع البحثي والهندسي: توثيق النوى والأدوات والـ kernels في الملاحظات يساعد إعادة إنتاج تحسينات الأداء ونمذجةها.

ما زال غير واضح

الملاحظات لا تتضمّن قياسات مقارنة مباشرة على أحجام بيانات عربية أو حالات استخدام إقليمية. لم تُنشر هنا تفاصيل أداء مطابقة للبيئات المحلية المتنوعة، لذلك قد تختلف أرباح الأداء عند النشر الفعلي. لم توضح الملاحظات خطوات ترحيل مفصّلة أو نقاط توقف محتملة عند الترقية بين إصدارات كبرى. كما لا توجد معلومات عن دعم مُحدّد للتقنيات اللغوية أو التقطيع الخاصة بالعربية في هذا الإصدار.

انتهى الخبر، لا السياق.

نحدّث الخبر كل ما وصلتنا معلومة جديدة.

اقرأ أيضاً

أخبار مرتبطة

كل الأخبار