فيديو

توليد وتحرير الفيديو بالذكاء الاصطناعي من النص والصورة.

آخر الأخبار

أوبن إيه آي / OpenAIبحث

Video-DeepResearch: وكيل متعدد الوسائط لفهم الفيديو مع بحث ويب مرحلي—مقتطفات من ورقة على arXiv

ورقة على arXiv تعرض Video-DeepResearch (Video-DR)، إطارًا لوكلاء يتعاملون مع تدفقات الفيديو المتصلة ويجبرون الوكيل على التأريض عبر الإطارات قبل استخدام بحث الويب. تقدم أيضاً مرجعية Video-DR-Bench (200 حالات VQA متعددة القفز) ووصفة تدريب: ضبط خاضع للإشراف يليه Group Relative Policy Optimization (GRPO). المؤلفون يبلغون عن أداء رائد على المعيار المخصص.

Googleإصدار نموذج

DeepMind تطلق Gemini Robotics ER 2 للروبوتات

Gemini Robotics ER 2 من DeepMind يربط فهم الفيديو، إدارة المهام، وتعاون عدة روبوتات. الإعلان يوضح تقدمًا بحثيًّا لكنه لا يعني جاهزية سوقية فورية.

Googleإطلاق منتج

js-genai v2.14.0 يضيف إعدادات نسخ صوتي وينبّه من ميزات قديمة

إصدار js-genai v2.14.0 أضاف إعدادات AudioTranscriptionConfig وحقل language_codes وسمح بتركيبات مصادقة إضافية، مع تحذيرات إهمال لواجهات Imagen.

DeepSeekإطلاق منتج

vLLM v0.26.0: دعم Inkling وتحسينات أداء متعددة

vLLM v0.26.0 يضيف Inkling ويعزز الأداء عبر DeepSeek‑V4 وROCm/XPU، ويحوِّن المسارات للكمّيات وLoRA وKV offloading.

فيديو

فيديو