ویدئویی با سرعت افزایشیافته از تلاش GPT‑5.6 Sol برای حل معماهای بنچمارک ARC-AGI-3 با چارچوب آزمون رسمی (چپ) و چارچوب آزمون Responses API ما (راست) که استدلال را حفظ و فشردهسازی را فعال میکند. در جدول امتیازات این بازی(در یک پنجره جدید باز میشود)، هیچ مدل پیشرویی مرحلهای فراتر از مرحله نخست را حل نمیکند. GPT‑5.6 Sol با چارچوب آزمون ما هر شش مرحله را حل میکند.
وقتی نخستین بار امتیازهای پایین GPT‑5.6 Sol را در بنچمارک ARC-AGI-3(در یک پنجره جدید باز میشود) دیدیم، متعجب شدیم.
GPT‑5.6 Sol مسائل حلنشده و دیرپای ریاضی، مانند حدس پوشش دوگانه دورها(در یک پنجره جدید باز میشود) را حل کرده و بازیهایی مانند Pokémon FireRed را شکست داده است. اما GPT‑5.6 Sol در ARC-AGI-3، بنچمارکی از بازیهای معمایی دوبعدی، فقط ۷٫۸٪ امتیاز گرفت و GPT‑5.5 نیز با امتیاز ناچیز ۰٫۴٪ تقریباً اصلاً نمیتوانست بازی کند.
آیا بازیهای معمایی دوبعدی برای مدلهای ما بهطور غیرمعمولی دشوار بودند؟ یا اتفاق دیگری در جریان بود؟
بنچمارکها بهندرت مدلهای هوش مصنوعی را بهتنهایی میسنجند. آنها انتخابهای کمتر آشکاری را نیز میسنجند که به تنظیمات API، طراحی چارچوب آزمون و پرامپتنویسی مربوطاند. در مورد ARC-AGI-3 دریافتیم که فعالکردن دو تنظیم API که در ChatGPT و Codex به کار میبریم—حفظ استدلال و فشردهسازی—در مجموعه وظایف عمومی، امتیازها را سه برابر و توکنهای خروجی را یکششم کرد.
GPT‑5.6 Sol با چارچوب آزمون رسمی در مجموعه عمومی ARC-AGI-3 امتیاز ۱۳٫۳٪ و با حفظ استدلال و فشردهسازی امتیاز ۳۸٫۳٪ را کسب کرد. امتیازها «کارایی نسبی کنش انسان» (RHAE(در یک پنجره جدید باز میشود))—معیاری برای مقایسه عملکرد مدل با خط مبنای انسانی—را میسنجند. بر اساس گزارشهای رسمی بازی(در یک پنجره جدید باز میشود)، برآورد میکنیم میانگین امتیاز آزمایشکنندگان انسانی ۴۸٪ بوده است. به مدلها گفته نمیشود امتیازدهی چگونه انجام میشود و در طول بازی نیز امتیازشان را نمیبینند—هر کنش فقط بازنمایی متنی هر فریم و مرحله فعلی را برمیگرداند.
ARC-AGI-3 بنچمارکی است که برای سنجش توانایی یادگیری و استدلال عاملهای هوش مصنوعی طراحی شده است. عاملها بدون دستورالعمل صریح، بازیهای دوبعدی ناآشنا را کاوش میکنند و سازوکارشان را درمییابند. میتوانید ۲۵ بازی آزمایشی را در arcprize.org/tasks(در یک پنجره جدید باز میشود) بازی کنید.
ARC-AGI-3 عمداً از چارچوب آزمونی عمومی و بدون ابزار یا قابلیت ویژه استفاده میکند. استدلال ARC این بود که یک چارچوب آزمون ساده، کاستیهای مدل را آشکارتر و مقایسه مدلها را منصفانهتر میکند. در مقابل، توسعهدهندگان تجاری چارچوبهای آزمون را برای قابلیتها و ویژگیهای خاص هر مدل بهینه میکنند.
در بازیها، GPT‑5.6 Sol با چارچوب آزمون صرفاً بصری Pokémon FireRed را شکست داده است (با پخش زنده GPT_Plays_Pokemon(در یک پنجره جدید باز میشود))، با قابلیت استفاده از رایانه در Codex بازی Slay the Spire را شکست داده است (با پخش زنده EpochAI(در یک پنجره جدید باز میشود)) و مراحل نخست Baba Is You را پشت سر گذاشته است (طبق مطلب Piotr Migdał & Piotr Grabowski(در یک پنجره جدید باز میشود)). ARC-AGI-3 چه تفاوت مهمی داشت؟

ایتن مولیک نشان میدهد(در یک پنجره جدید باز میشود) که GPT‑5.6 Sol در Codex یک چالش روزانه تصادفی را در Slay the Spire 2 شکست میدهد؛ بازیای که پس از تاریخ قطع دانش GPT‑5.6 Sol منتشر شده است.
با الهام از تحلیل ARC درباره کاستیهای GPT‑5.5(در یک پنجره جدید باز میشود)، برخی تلاشهای GPT‑5.6 Sol را بررسی کردیم. ما نیز مانند ARC دیدیم که مدل چندان هوشمند به نظر نمیرسد. برای هر کنش مدت زیادی درنگ میکرد و بهسختی پیش میرفت.
اما با بررسی عمیقتر دریافتیم که بخش زیادی از سردرگمی مدل ذاتی نبود، بلکه از تنظیمات چارچوب آزمون ناشی میشد.
نخست متوجه شدیم که پس از هر کنش در بازی، تمام استدلال خصوصی کنار گذاشته میشود. یعنی GPT‑5.6 Sol با هر کنش باید بازی را از نو کشف میکرد و نمیتوانست افکار قبلی خود را به یاد بیاورد. مدل همچنان سابقه حرکتهای گذشته و یادداشتهای کوتاه همراهشان را میدید، اما به برنامهها، بینشها یا افکاری که به آنها منجر شده بودند دسترسی نداشت.
دوم، دیدیم که چارچوب آزمون از پنجره برش چرخشی استفاده میکند؛ بنابراین با طولانیشدن سابقه، کنشهای قدیمیتر ناپدید میشوند. در نتیجه GPT‑5.6 Sol نهتنها افکار گذشته، بلکه خاطره کنشهای قبلی خود را نیز از دست میداد.
این دو ویژگی چارچوب آزمون—حذف استدلال و برش چرخشی—در کنار هم توضیح میدادند که چرا GPT‑5.6 Sol نمیتواند بهمرور یاد بگیرد.
مدلهای ما آموزش دیدهاند پیش از ارائه پاسخ یا فراخوانی ابزار، با پیامهای استدلال خصوصی فکر کنند. این پیامهای فکری خصوصی بهعنوان بخشی از سابقه مکالمه حفظ میشوند. اگر مکالمه بیش از حد طولانی شود، آن را خلاصه میکنیم و ادامه میدهیم.
مدلهای ما به همین شیوه آموزش میبینند و در ChatGPT و Codex نیز به همین شکل به کار گرفته میشوند. برای نزدیکترشدن به پیکربندی محیط عملیاتیمان، چارچوب آزمون ARC-AGI-3 را با Responses API(در یک پنجره جدید باز میشود) خود پیادهسازی کردیم. API ما مدیریت زمینه را آسان میکند: در GPT‑5.6، ارسال شناسه پاسخ قبلی باعث میشود استدلال بهطور خودکار میان فراخوانی ابزارها و نوبتها حفظ شود.
با حفظ استدلال، دو تغییر عمده مشاهده کردیم. نخست، GPT‑5.6 Sol پیش از هر کنش زمان کمتری صرف فکرکردن میکرد، زیرا دیگر لازم نبود در هر نوبت بازی را از ابتدا تفسیر کند. دوم، وقتی GPT‑5.6 Sol میتوانست افکار گذشته خود را به یاد بیاورد، بهمرور بسیار بهتر یاد میگرفت و راهبردهای منسجمی به کار میبرد.
بهبود بعدی با جایگزینکردن برش چرخشی با فشردهسازی(در یک پنجره جدید باز میشود)، یکی دیگر از تنظیمات Responses API، حاصل شد.
چارچوب آزمون ARC-AGI-3 محدودیتهای زمینه را با برش چرخشی مدیریت میکند. وقتی زمینه مکالمه از ۱۷۵٬۰۰۰ نویسه فراتر میرود، قدیمیترین پیامها حذف میشوند.
برش چرخشی دو عیب دارد. نخست، مدل مشاهدات و کنشهای قبلی را از دست میدهد. دوم، بخش زیادی از وظایف را با پنجره زمینه پُرتری انجام میدهد که میتواند عملکرد را اندکی کاهش دهد.
وقتی فشردهسازی را در ARC-AGI-3 فعال کردیم، GPT‑5.6 Sol توانست آموختههایش درباره هر بازی را در اجراهای طولانیتر بهتر حفظ کند و با توکنهای خروجی کمتر، امتیاز بالاتری بگیرد.
برای نشاندادن اثر حفظ استدلال و فعالکردن فشردهسازی، این پویانمایی پنجره زمینه ۱۷۵K توکنی GPT‑5.6 Sol را هنگام حل مجموعهای از معماهای ARC-AGI-3 با هر چارچوب آزمون نشان میدهد.
دو ستون میانی نشان میدهند که هر چارچوب آزمون چگونه از پنجره زمینه مدل بهشکلی متفاوت استفاده میکند. GPT‑5.6 Sol با یادآوری بهتر گذشته خود، برای هر کنش کمتر فکر میکند و بسیار سریعتر پیش میرود. توجه: پیادهسازی ما بهجای نویسه، محدودیت ۱۷۵٬۰۰۰ توکن دارد؛ اما نتیجه بسیار مشابه است، زیرا بخش عمده متن را شبکههای کنش تشکیل میدهند که توکنساز ما آنها را با نسبت یکبهیک توکنبندی میکند.
حفظ استدلال و فشردهسازی در کنار هم به GPT‑5.6 Sol (Max) امکان میدهند با یکششم توکنهای خروجی، تقریباً سه برابر امتیاز بگیرد.
امیدواریم این آزمایشها یادآور شوند که ارزیابیها بهندرت مدلها را بهتنهایی میسنجند؛ آنها مجموعهای از انتخابهای کمتر آشکار درباره تنظیمات API، طراحی چارچوب آزمون و پرامپتنویسی را نیز میسنجند. این نخستین بار نیست که از امتیازهای پایین یک بنچمارک عمومی شگفتزده میشویم و سپس درمییابیم اجراکننده ارزیابی از چارچوب آزمونی عمومی استفاده کرده که پیامهای استدلال را حذف میکند.
اگر توسعهدهنده API هستید و میخواهید عملکرد را به حداکثر برسانید، توصیه میکنیم از همان تنظیماتی استفاده کنید که در محصولات خودمان به کار میبریم:
- از Responses API ما استفاده کنید، نه API های انتهای چت قدیمی ما
- استدلال را حفظ کنید
- از فشردهسازی استفاده کنید
همچنین اگر مدلها را مقایسه میکنید، توصیه میکنیم به ارزیابیهایی تکیه کنید که از تنظیمات بالا استفاده میکنند؛ زیرا این تنظیمات بیشترین تطابق را با کاربرد واقعی در ChatGPT و Codex دارند.
از ARC بابت سالها فعالیت خلاقانه در ارزیابی AGI و تحلیلی که ما را به بررسی دقیقتر این موضوع ترغیب کرد، سپاسگزاریم.
اگر میخواهید توانایی خود را در برابر مدلهای پیشرو محک بزنید، بازیهای عمومی را در arcprize.org/tasks(در یک پنجره جدید باز میشود) امتحان کنید.


