فيديو مسرّع لمحاولة GPT‑5.6 Sol حل ألغاز معيار ARC-AGI-3، باستخدام منظومة التقييم الرسمية (يسارًا) ومنظومتنا القائمة على واجهة برمجة تطبيقات Responses (يمينًا)، التي تحتفظ بالاستدلال وتفعّل تكثيف السياق. وفق لوحة صدارة هذه اللعبة(يفتح في نافذة جديدة)، لا يحل أي نموذج رائد أي مستوى بعد الأول. أما باستخدام منظومتنا، فيحل GPT‑5.6 Sol المستويات الستة كلها.
عندما رأينا أول مرة درجات GPT‑5.6 Sol المنخفضة في معيار ARC-AGI-3(يفتح في نافذة جديدة)، شعرنا بالحيرة.
حل GPT‑5.6 Sol مسائل رياضية مفتوحة استعصت طويلًا، مثل حدسية الغطاء المزدوج للدورات(يفتح في نافذة جديدة)، وتغلب على ألعاب مثل Pokémon FireRed. لكن في ARC-AGI-3، وهو معيار لألعاب ألغاز ثنائية الأبعاد، لم يسجل GPT‑5.6 Sol سوى 7.8%، بينما عجز GPT‑5.5 تقريبًا عن لعبها، مسجلًا نسبة ضئيلة قدرها 0.4%.
هل كانت ألعاب الألغاز ثنائية الأبعاد صعبة على نحو غير معتاد بالنسبة إلى نماذجنا؟ أم أن سببًا آخر كان وراء ذلك؟
نادرًا ما تقيس المعايير نماذج الذكاء الاصطناعي بمعزل عن غيرها. فهي تقيس أيضًا خيارات أقل وضوحًا تتعلق بإعدادات واجهة برمجة التطبيقات، وتصميم منظومة التقييم، وصياغة الأوامر. في حالة ARC-AGI-3، اكتشفنا أن تفعيل إعدادين من إعدادات واجهة برمجة التطبيقات نستخدمهما في ChatGPT وCodex—الاحتفاظ بالاستدلال وتكثيف السياق—ضاعف الدرجات ثلاث مرات وخفّض رموز المخرجات إلى السدس في مجموعة المهام العامة.
باستخدام منظومة التقييم الرسمية، سجل GPT‑5.6 Sol نسبة 13.3% في المجموعة العامة من ARC-AGI-3. ومع الاحتفاظ بالاستدلال وتكثيف السياق، سجل 38.3%. تقيس الدرجات كفاءة الفعل البشري النسبية (RHAE(يفتح في نافذة جديدة))—وهو مقياس يقارن أداء النموذج بخط أساس بشري. واستنادًا إلى سجلات اللعب الرسمية(يفتح في نافذة جديدة)، نقدّر أن متوسط درجات المختبرين البشر بلغ 48%. لا تُبلَّغ النماذج بطريقة احتساب درجاتها، ولا يمكنها رؤية درجاتها طوال الاختبار—إذ لا تعيد الإجراءات سوى تمثيل نصي لكل إطار والمستوى الحالي.
ARC-AGI-3 معيار مصمم لقياس مدى جودة تعلم وكلاء الذكاء الاصطناعي واستدلالهم. يستكشف الوكلاء ألعابًا ثنائية الأبعاد غير مألوفة ويستنتجون آلية عملها من دون تعليمات صريحة. يمكنك لعب 25 لعبة تجريبية على arcprize.org/tasks(يفتح في نافذة جديدة).
يستخدم ARC-AGI-3 منظومة تقييم عامة عمدًا، من دون أدوات أو ميزات خاصة. كان منطق ARC أن منظومة التقييم البسيطة تجعل أوجه قصور النموذج أوضح والمقارنات بين النماذج أكثر إنصافًا. في المقابل، يحسّن المطورون التجاريون منظومات التقييم بما يلائم ميزات كل نموذج وخصوصياته.
في مجال الألعاب، تغلب GPT‑5.6 Sol على Pokémon FireRed باستخدام منظومة تقييم تعتمد على الرؤية وحدها (كما بث حساب GPT_Plays_Pokemon(يفتح في نافذة جديدة))، وعلى Slay the Spire باستخدام Codex للتحكم في الحاسوب (كما بثت EpochAI(يفتح في نافذة جديدة))، واجتاز المراحل الأولى من Baba Is You (كما شارك Piotr Migdał & Piotr Grabowski(يفتح في نافذة جديدة)). ما الذي كان مختلفًا إلى هذا الحد في ARC-AGI-3؟

يعرض إيثان موليك هنا(يفتح في نافذة جديدة) GPT‑5.6 Sol في Codex وهو يجتاز تحديًا يوميًا عشوائيًا في Slay the Spire 2، وهي لعبة صدرت بعد تاريخ توقف معرفة GPT‑5.6 Sol.
استلهمنا من تحليل ARC لأوجه قصور GPT‑5.5(يفتح في نافذة جديدة)، وفحصنا بعض محاولات GPT‑5.6 Sol. ومثل ARC، لاحظنا أن النموذج لم يبدُ شديد الذكاء. كان يمضي وقتًا طويلًا في كل إجراء ويواجه صعوبة في إحراز تقدم.
لكن مع التعمق في البحث، اكتشفنا أن جزءًا كبيرًا من ارتباك النموذج لم يكن متأصلًا فيه، بل نجم عن إعدادات منظومة التقييم.
أولًا، لاحظنا أنه بعد كل إجراء في اللعبة كان يُتخلص من الاستدلال الخاص بالكامل. وهذا يعني أن GPT‑5.6 Sol كان يُطلب منه مع كل إجراء فهم اللعبة من جديد، من دون القدرة على تذكر تفكيره السابق. ظل النموذج قادرًا على رؤية سجل الحركات السابقة والملاحظات الموجزة المصاحبة لها، لكنه لم يستطع رؤية الخطط أو الاستنتاجات أو الأفكار التي أدت إليها.
ثانيًا، رأينا أن منظومة التقييم تستخدم نافذة اقتطاع متحركة، ما يجعل الإجراءات الأقدم تختفي مع ازدياد طول السجل. وهكذا، لم يكن GPT‑5.6 Sol عاجزًا عن تذكر تفكيره السابق فحسب، بل كان يفقد أيضًا ذاكرة إجراءاته السابقة.
وقد ساعدت هاتان السمتان في منظومة التقييم—حذف الاستدلال والاقتطاع المتحرك—معًا في تفسير صعوبة تعلم GPT‑5.6 Sol بمرور الوقت.
تُدرَّب نماذجنا على التفكير عبر رسائل استدلال خاصة قبل إخراج الردود أو استدعاءات الأدوات. يُحتفظ برسائل التفكير الخاصة هذه ضمن سجل المحادثة. إذا طالت المحادثة أكثر من اللازم، نلخصها ثم نتابع.
هكذا تُدرَّب نماذجنا، وهكذا تُنشر أيضًا في ChatGPT وCodex. لمحاكاة إعدادات بيئة الإنتاج لدينا بصورة أفضل، نفّذنا منظومة تقييم ARC-AGI-3 باستخدام واجهة برمجة تطبيقات Responses(يفتح في نافذة جديدة). تسهّل واجهة برمجة التطبيقات لدينا إدارة السياق: ففي GPT‑5.6، يؤدي تمرير معرّف الاستجابة السابقة إلى الاحتفاظ تلقائيًا بالاستدلال عبر استدعاءات الأدوات والأدوار الحوارية.
عند الاحتفاظ بالاستدلال، لاحظنا تغيرين كبيرين. أولًا، أمضى GPT‑5.6 Sol وقتًا أقل في التفكير قبل كل إجراء، لأنه لم يعد مضطرًا إلى فهم اللعبة من الصفر في كل دور. ثانيًا، عندما أصبح قادرًا على تذكر أفكاره السابقة، تحسنت قدرة GPT‑5.6 Sol كثيرًا على التعلم بمرور الوقت وتطبيق استراتيجيات متماسكة.
جاء التحسين التالي من استبدال الاقتطاع المتحرك بـتكثيف السياق(يفتح في نافذة جديدة)، وهو إعداد آخر في واجهة برمجة تطبيقات Responses.
تعالج منظومة تقييم ARC-AGI-3 حدود السياق باستخدام الاقتطاع المتحرك. عندما يتجاوز سياق المحادثة 175,000 حرف، تُحذف الرسائل الأقدم.
للاقتطاع المتحرك عيبان. أولًا، يفقد النموذج الملاحظات والإجراءات السابقة. ثانيًا، يمضي جزءًا كبيرًا من المهام وهو يعمل ضمن نطاق سياق أكثر امتلاءً، ما قد يضعف الأداء قليلًا.
عندما فعّلنا تكثيف السياق في ARC-AGI-3، تحسنت قدرة GPT‑5.6 Sol على الاحتفاظ بما تعلمه عن كل لعبة خلال عمليات التشغيل الأطول، وحقق درجة أعلى باستخدام رموز مخرجات أقل.
لتوضيح أثر الاحتفاظ بالاستدلال وتفعيل تكثيف السياق، إليك رسمًا متحركًا يعرض نطاق السياق البالغ 175 ألفًا لدى GPT‑5.6 Sol أثناء حله سلسلة من ألغاز ARC-AGI-3 باستخدام كل منظومة تقييم.
يوضح العمودان الأوسطان اختلاف استخدام نطاق سياق النموذج بين منظومتي التقييم. وبفضل تذكر ماضيه بصورة أفضل، يقل تفكير GPT‑5.6 Sol في كل إجراء ويتقدم بسرعة أكبر بكثير. ملاحظة: يستخدم تنفيذنا حدًا يبلغ 175,000 رمز بدلًا من الأحرف، لكن النتيجة متقاربة جدًا لأن الغالبية العظمى من النص عبارة عن شبكات إجراءات، ويقسّمها مُرمِّزنا إلى رموز بنسبة 1:1.
يتيح الاحتفاظ بالاستدلال وتكثيف السياق معًا لـGPT‑5.6 Sol (Max) تحقيق نحو ثلاثة أضعاف الدرجة باستخدام سدس رموز المخرجات.
نأمل أن تكون هذه التجارب تذكيرًا بأن التقييمات نادرًا ما تقيس النماذج بمعزل عن غيرها—فهي تقيس أيضًا حزمة من الخيارات الأقل وضوحًا المتعلقة بإعدادات واجهة برمجة التطبيقات، وتصميم منظومة التقييم، وصياغة الأوامر. ليست هذه المرة الأولى التي تفاجئنا فيها درجات منخفضة على معيار عام، ثم نكتشف أن برنامج تشغيل التقييم يستخدم منظومة تقييم عامة تحذف رسائل الاستدلال.
إذا كنت مطورًا لواجهات برمجة التطبيقات وتسعى إلى تعظيم الأداء، فنوصي باستخدام الإعدادات نفسها التي نعتمدها في منتجاتنا:
- استخدم واجهة برمجة تطبيقات Responses، لا واجهة برمجة تطبيقات إكمال المحادثات القديمة
- احتفظ بالاستدلال
- استخدم تكثيف السياق
وإذا كنت تقارن بين النماذج، فنوصي بالاعتماد على التقييمات التي تستخدم الإعدادات أعلاه، فهي الأقرب إلى الاستخدام الفعلي في ChatGPT وCodex.
نعرب عن امتناننا لـARC على سنوات من العمل المبتكر في تقييم الذكاء الاصطناعي العام (AGI)، وعلى التحليل الذي ألهمنا لإلقاء نظرة أدق هنا.
إذا أردت اختبار قدراتك في مواجهة النماذج الرائدة، فجرّب الألعاب العامة بنفسك على arcprize.org/tasks(يفتح في نافذة جديدة).


