Perplexity تقدم WANDR لاختبار وكلاء البحث العميق

معايير التقييم تكشف الفرق بين مساعد يجيب بسرعة ووكيل يستطيع إنجاز بحث موثق.

Perplexityافتح الدليل
واتساب

الخلاصة

قدمت Perplexity Research معيار WANDR لتقييم وكلاء البحث الذين يحتاجون إلى البحث الواسع والعميق وجمع أدلة كثيرة.

معايير التقييم تكشف الفرق بين مساعد يجيب بسرعة ووكيل يستطيع إنجاز بحث موثق.

لماذا يهم

هذا المصدر رسمي وعالي الأولوية، وتم اختيار الخبر لأنه يقدم قيمة عملية للقارئ لا مجرد إعلان عابر.

كيف تستفيد؟

  • اسأل عن جودة المصادر لا جمال الإجابة فقط
  • مفيد لتقييم أدوات البحث
  • يشير إلى وكلاء بحث أكثر تخصصاً

المصدر الرسمي

Perplexity Research: https://research.perplexity.ai/articles/wandr-benchmark-evaluating-research-agents-that-must-search-wide-and-deep

انتهى الخبر، لا السياق.

نحدّث الخبر كل ما وصلتنا معلومة جديدة.

اقرأ أيضاً

أخبار مرتبطة

كل الأخبار

SocietyBench: معيار جديد لتقييم قدرة النماذج على توقع تطورات العالم الاجتماعي في إطار «عوالم مضادة للواقع»

SocietyBench إطار تقييمي يحول تغطية الأخبار ووسائل التواصل إلى جداول زمنية مؤرخة ثم يُجهّلها عبر استبدال الكيانات وتحريك التواريخ لإنتاج «عوالم مضادة». ينتج عن ذلك بنوك أسئلة تنبؤية تُقَيَّم على معايرة الاحتمال والدقة الزمنية؛ أفضل من بين ستة LLMs حقق 75/100 مقابل مرجع بسيط 50. جميع البيانات والشفرات منشورة على arXiv.