OpenAI توسّع الوصول المجاني إلى ChatGPT مع تحسينات GPT-5.6 Sol
أعلنت OpenAI عن تحديثات جديدة لـ ChatGPT تشمل تحسين GPT-5.6 Sol لمستخدمي Plus وPro، وتوسيع الوصول المجاني عبر GPT-5.6 Luna ومحادثات نصية غير محدودة تدريجياً.
أوراق وتجارب تغيّر فهمنا لقدرات النماذج وحدودها.
أعلنت OpenAI عن تحديثات جديدة لـ ChatGPT تشمل تحسين GPT-5.6 Sol لمستخدمي Plus وPro، وتوسيع الوصول المجاني عبر GPT-5.6 Luna ومحادثات نصية غير محدودة تدريجياً.
Meta طرحت نموذجاً متعدد المراحل وطرق تعلم جديدة لدمج سلوك المستخدم مع معرّفات sparse. تقارير الشركة تشير إلى زيادات تحويلية تصل إلى 6% على Instagram.
أوضحت OpenAI حوادث في تقييمات أمنية لطرف ثالث وأعلنت تدابير جديدة لتعزيز اختبارات النماذج. النشر: 4 أغسطس 2026.
ParVL إطار يوسع الحساب الموازي في MLLMs عبر تكرار استخدام ViT وLLM مع بادئات فرعية؛ أظهر تحسناً مقابل أسلوب فرعٍ واحد، والتخصيص الأمثل يختلف حسب المهمة.
SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.
ورقة قيمت ستة frontier LLMs خلال 39 يوماً من كأس العالم 2026 بشكل مُسبق وخالٍ من التسرب، وجمعت 4,494 تنبؤاً مسجلاً وأصدرت البيانات والرمز.
TurnSight يقترح إشرافًا بأثر رجعي على مستوى الدور لتحسين تدريب وكلاء LLM عند استخدام أدوات. الكود متاح على GitHub. الاختبارات أفادت بتحسّن على ثلاث مجموعات معيارية.
PAST-Bench يقيس ما إذا كانت الخبرة المحتفظ بها تُحسن أداء الوكلاء الشخصيين. التجربة تُشغّل مهام متسلسلة مع إيقاف/تشغيل الذاكرة وHermes+ يحسّن النتائج بحسب الورقة ومستودع الكود.
ورقة بحثية (arXiv) تؤطّر "test-time scaling" كاستدلال بميزانية على شجرة البادئات الضمنية لنماذج autoregressive، تميّز ثلاث نظم (مسار واحد، أوراق مع تجميع، ومستوى البادئات)، تقترح ملف تقييم ومواصفات قابلة للتكرار، وتعلن عن تجميع أكثر من 2 مليار أثر استدلالي للإصدار.
دراسة تقترح تعديل FID وIS باستخدام foundation models للباثولوجيا وتظهر ارتباطًا أعلى للمقياس المعدل مع آداء تجزئة النوى.
ورقة arXiv تُقدّم SeGaBench، معيارًا تجريبيًا يختبر قدرة نماذج اللغة الكبيرة على استعادة «الدلالات المُمكنة» التي يغفلها تمثيل البرنامج لدى المجمع، وإنتاج تحويهات مُتحقّق منها تحسّن الأداء. أقوى نموذج حقق نسبة صحّة 94.8% وسرعات محسّنة في 83.3% من الإجابات، لكن النتائج غالبًا تغلق جزءًا فقط من الفجوة المثالية.
ورقة على arXiv تعرض Video-DeepResearch (Video-DR)، إطارًا لوكلاء يتعاملون مع تدفقات الفيديو المتصلة ويجبرون الوكيل على التأريض عبر الإطارات قبل استخدام بحث الويب. تقدم أيضاً مرجعية Video-DR-Bench (200 حالات VQA متعددة القفز) ووصفة تدريب: ضبط خاضع للإشراف يليه Group Relative Policy Optimization (GRPO). المؤلفون يبلغون عن أداء رائد على المعيار المخصص.