Agents’ Last Exam يضع GPT-5.5 في الصدارة ويكشف فجوة الأداء في وكلاء الذكاء الاصطناعي
أطلق باحثون من جامعة كاليفورنيا في بيركلي معيار Agents’ Last Exam لقياس قدرة وكلاء الذكاء الاصطناعي على تنفيذ مهام مهنية طويلة ومعقدة، مع تصدر GPT-5.5 القائمة وتراجع نتائج Claude Fable 5 في اختبار صعب يركز على العمل الحقيقي لا الأسئلة المعزولة.