بحث جديد: هل تستعيد نماذج اللغة الكبيرة قواعد تحسين يغفِلها المجمعون؟
ورقة arXiv تُقدّم SeGaBench، معيارًا تجريبيًا يختبر قدرة نماذج اللغة الكبيرة على استعادة «الدلالات المُمكنة» التي يغفلها تمثيل البرنامج لدى المجمع، وإنتاج تحويهات مُتحقّق منها تحسّن الأداء. أقوى نموذج حقق نسبة صحّة 94.8% وسرعات محسّنة في 83.3% من الإجابات، لكن النتائج غالبًا تغلق جزءًا فقط من الفجوة المثالية.