vLLM v0.25.0: MRv2 الافتراضي وتحسينات الأداء والتوزيع
أصدرت مشروع vLLM النسخة v0.25.0 التي تضم 558 التزاماً من 232 مساهماً، وفق ملاحظات الإصدار الرسمية. جعلت النسخة Model Runner V2 المسار الافتراضي لجميع النماذج الكثيفة، وأزالت تنفيذ الانتباه القديم PagedAttention. وضم الإصدار محرك Streaming Parser موحّداً لمعالجة نداءات الأدوات والتفكير، ودعم speculative decoding عام لكتالوجات مفردات متباينة (TLI). شملت التحديثات تحسينات أداء واسعة عبر NVIDIA وAMD وIntel وROCm وTPU وCPU وRISC‑V، بالإضافة إلى إصلاحات وتوسعات في التكميم (بما في ذلك NVFP4 وFP8) ودعم نماذج جديدة مثل LLaVA-OneVision-2 وGLM-5/DeepSeek-V3.2. كل الوقائع أدناه مقتطفة من ملاحظات الإصدار الرسمية.
الجديد
إصدار v0.25.0 سجّل 558 التزاماً من 232 مساهماً، بحسب ملاحظات الإصدار الرسمية. جعل الفريق Model Runner V2 (MRv2) المسار الافتراضي لجميع النماذج الكثيفة. أزيل تنفيذ الانتباه القديم PagedAttention. أُدخل محرك Streaming Parser موحّداً لمدمجات نداء الأدوات والتعليل.
أضيفت ميزات جديدة للمواصفات مثل universal speculative decoding لكتالوجات مفردات متباينة (TLI)، وداعمين جديدين للتخمين المُسرّع (DSpark وDFlash). كما نُقل Backend الخاص بـTransformers إلى أداء مماثل للأداء النِّي vLLM وأضاف دعم FP8 MoE وتصحيحات CUDA graph.
النسخة ضمّت أيضاً تحسينات كمية ونوى جديدة وتعديلات على Triton وملفات kernel لموديلات محددة، ودعم واسع عبر NVIDIA (بما في ذلك Blackwell)، AMD/ROCm، Intel XPU، CPU، RISC‑V وPOWER.
لماذا يهم
جعل MRv2 المسار الافتراضي يغيّر المسار التشغيلي للموديلات الكثيفة ويؤثر على الأداء والجدولة واستهلاك الذاكرة، وفق ملاحظات الإصدار. إزالة PagedAttention تبسّط القاعدة البرمجية لأن المسارات الحديثة أصبحت المعيار. محرك Parsing الموحد يسهّل التعامل مع نداءات الأدوات والتفكير البرمجي في سلاسل البث.
التحسينات في speculative decoding وCUDA-graph وNVFP4/FP8 والتكميم تخفض زمن الاستجابة أو ترفع النفاذية لبيئات الإنتاج. كذلك تؤثر تصحيحات التوزيع وPD disaggregation وتحسينات all-reduce وfault-tolerance في خوادم النشر الكبيرة.
عندنا في المنطقة
لا تتضمن ملاحظات الإصدار تغييرات مخصّصة للغة العربية أو بيانات سوق محددة. مع ذلك، التحسينات العامة في النفاذية والتكلفة والقدرة على تشغيل مكدّسات متعددة المعجّلات تنطبق على نشر نماذج عربية كما تنطبق على أي لغة أخرى. تحسينات التكميم والدعم المتعدد للعتاد يمكن أن تخفض تكلفة التشغيل للفرق التي تخدم مستخدمين عربياً.
ماذا يعني لك
- لمهندسي البنية التحتية: استبدال MRv1 بـMRv2 قد يتطلّب اختبار أداء وإعادة ضبط إعدادات الجدولة وpre-fill لبيئات الإنتاج.
- لمطوّري النماذج: النقل إلى Backend Transformers الأسرع قد يبسط اعتماد نماذج موجودة دون فقدان أداء vLLM الأصلي.
- لفرق التشغيل التجاري: التحديثات في التكميم (NVFP4، FP8) وعمليات all-reduce وتوزيع الحمل يمكن أن تقلّل التكاليف وتحسّن سعة المعالجة؛ لكن يلزم اختبار التوافق مع نسخ checkpoints وأدوات الإقلاع الخاصة بكم.
ما زال غير واضح
ملاحظات الإصدار تفصّل العديد من التصحيحات والملفات الفنية، لكنها لا تصف سياسات الترحيل خطوة‑بخطوة أو مخاطر محددة لحالات استخدام مخصّصة. لم تُذكر مقارنات أداء مستقلة أو نتائج قياس تحت عبء عملكم المحدّد. كما لا توجد إرشادات مفصّلة حول كيفية ترقية مجموعات الإنتاج التي تستخدم MoE أو تكوينات Triton معينة.
لمعرفة تأثير التحديث على بيئتكم، يلزم إجراء اختبارات تحميل وقياس وفحص التوافق مع نقاط التفتيش الخاصة بكم.