پرش به محتوای اصلی
OpenAI

۷ مرداد ۱۴۰۵

تحقیقمقالات

چگونه فعال‌کردن دو تنظیم، امتیاز ما در بنچمارک ARC-AGI-3 را سه برابر کرد

در حال بارگذاری…

ویدئویی با سرعت افزایش‌یافته از تلاش GPT‑5.6 Sol برای حل معماهای بنچمارک ARC-AGI-3 با چارچوب آزمون رسمی (چپ) و چارچوب آزمون Responses API ما (راست) که استدلال را حفظ و فشرده‌سازی را فعال می‌کند. در جدول امتیازات این بازی(در یک پنجره جدید باز می‌شود)، هیچ مدل پیشرویی مرحله‌ای فراتر از مرحله نخست را حل نمی‌کند. GPT‑5.6 Sol با چارچوب آزمون ما هر شش مرحله را حل می‌کند.

وقتی نخستین بار امتیازهای پایین GPT‑5.6 Sol را در بنچمارک ARC-AGI-3(در یک پنجره جدید باز می‌شود) دیدیم، متعجب شدیم.

GPT‑5.6 Sol مسائل حل‌نشده و دیرپای ریاضی، مانند حدس پوشش دوگانه دورها(در یک پنجره جدید باز می‌شود) را حل کرده و بازی‌هایی مانند Pokémon FireRed را شکست داده است. اما GPT‑5.6 Sol در ARC-AGI-3، بنچمارکی از بازی‌های معمایی دوبعدی، فقط ۷٫۸٪ امتیاز گرفت و GPT‑5.5 نیز با امتیاز ناچیز ۰٫۴٪ تقریباً اصلاً نمی‌توانست بازی کند.

آیا بازی‌های معمایی دوبعدی برای مدل‌های ما به‌طور غیرمعمولی دشوار بودند؟ یا اتفاق دیگری در جریان بود؟

بنچمارک‌ها به‌ندرت مدل‌های هوش مصنوعی را به‌تنهایی می‌سنجند. آن‌ها انتخاب‌های کمتر آشکاری را نیز می‌سنجند که به تنظیمات API، طراحی چارچوب آزمون و پرامپت‌نویسی مربوط‌اند. در مورد ARC-AGI-3 دریافتیم که فعال‌کردن دو تنظیم API که در ChatGPT و Codex به کار می‌بریم—حفظ استدلال و فشرده‌سازی—در مجموعه وظایف عمومی، امتیازها را سه برابر و توکن‌های خروجی را یک‌ششم کرد.

GPT‑5.6 Sol با چارچوب آزمون رسمی در مجموعه عمومی ARC-AGI-3 امتیاز ۱۳٫۳٪ و با حفظ استدلال و فشرده‌سازی امتیاز ۳۸٫۳٪ را کسب کرد. امتیازها «کارایی نسبی کنش انسان» (RHAE(در یک پنجره جدید باز می‌شود))معیاری برای مقایسه عملکرد مدل با خط مبنای انسانی—را می‌سنجند. بر اساس گزارش‌های رسمی بازی(در یک پنجره جدید باز می‌شود)، برآورد می‌کنیم میانگین امتیاز آزمایش‌کنندگان انسانی ۴۸٪ بوده است. به مدل‌ها گفته نمی‌شود امتیازدهی چگونه انجام می‌شود و در طول بازی نیز امتیازشان را نمی‌بینندهر کنش فقط بازنمایی متنی هر فریم و مرحله فعلی را برمی‌گرداند.

ARC-AGI-3

ARC-AGI-3 بنچمارکی است که برای سنجش توانایی یادگیری و استدلال عامل‌های هوش مصنوعی طراحی شده است. عامل‌ها بدون دستورالعمل صریح، بازی‌های دوبعدی ناآشنا را کاوش می‌کنند و سازوکارشان را درمی‌یابند. می‌توانید ۲۵ بازی آزمایشی را در arcprize.org/tasks(در یک پنجره جدید باز می‌شود) بازی کنید.

ARC-AGI-3 عمداً از چارچوب آزمونی عمومی و بدون ابزار یا قابلیت ویژه استفاده می‌کند. استدلال ARC این بود که یک چارچوب آزمون ساده، کاستی‌های مدل را آشکارتر و مقایسه مدل‌ها را منصفانه‌تر می‌کند. در مقابل، توسعه‌دهندگان تجاری چارچوب‌های آزمون را برای قابلیت‌ها و ویژگی‌های خاص هر مدل بهینه می‌کنند.

در بازی‌ها، GPT‑5.6 Sol با چارچوب آزمون صرفاً بصری Pokémon FireRed را شکست داده است (با پخش زنده GPT_Plays_Pokemon(در یک پنجره جدید باز می‌شود))، با قابلیت استفاده از رایانه در Codex بازی Slay the Spire را شکست داده است (با پخش زنده EpochAI(در یک پنجره جدید باز می‌شود)) و مراحل نخست Baba Is You را پشت سر گذاشته است (طبق مطلب Piotr Migdał & Piotr Grabowski(در یک پنجره جدید باز می‌شود)). ARC-AGI-3 چه تفاوت مهمی داشت؟

GPT-5.6 Sol در Codex در حال تکمیل یک چالش روزانه تصادفی در Slay the Spire 2.

ایتن مولیک نشان می‌دهد(در یک پنجره جدید باز می‌شود) که GPT‑5.6 Sol در Codex یک چالش روزانه تصادفی را در Slay the Spire 2 شکست می‌دهد؛ بازی‌ای که پس از تاریخ قطع دانش GPT‑5.6 Sol منتشر شده است.

با الهام از تحلیل ARC درباره کاستی‌های GPT‑5.5(در یک پنجره جدید باز می‌شود)، برخی تلاش‌های GPT‑5.6 Sol را بررسی کردیم. ما نیز مانند ARC دیدیم که مدل چندان هوشمند به نظر نمی‌رسد. برای هر کنش مدت زیادی درنگ می‌کرد و به‌سختی پیش می‌رفت.

اما با بررسی عمیق‌تر دریافتیم که بخش زیادی از سردرگمی مدل ذاتی نبود، بلکه از تنظیمات چارچوب آزمون ناشی می‌شد.

نخست متوجه شدیم که پس از هر کنش در بازی، تمام استدلال خصوصی کنار گذاشته می‌شود. یعنی GPT‑5.6 Sol با هر کنش باید بازی را از نو کشف می‌کرد و نمی‌توانست افکار قبلی خود را به یاد بیاورد. مدل همچنان سابقه حرکت‌های گذشته و یادداشت‌های کوتاه همراهشان را می‌دید، اما به برنامه‌ها، بینش‌ها یا افکاری که به آن‌ها منجر شده بودند دسترسی نداشت.

دوم، دیدیم که چارچوب آزمون از پنجره برش چرخشی استفاده می‌کند؛ بنابراین با طولانی‌شدن سابقه، کنش‌های قدیمی‌تر ناپدید می‌شوند. در نتیجه GPT‑5.6 Sol نه‌تنها افکار گذشته، بلکه خاطره کنش‌های قبلی خود را نیز از دست می‌داد.

این دو ویژگی چارچوب آزمون—حذف استدلال و برش چرخشی—در کنار هم توضیح می‌دادند که چرا GPT‑5.6 Sol نمی‌تواند به‌مرور یاد بگیرد.

عامل‌ها وقتی عملکرد بهتری دارند که کارهای گذشته خود را به یاد بسپارند

مدل‌های ما آموزش دیده‌اند پیش از ارائه پاسخ یا فراخوانی ابزار، با پیام‌های استدلال خصوصی فکر کنند. این پیام‌های فکری خصوصی به‌عنوان بخشی از سابقه مکالمه حفظ می‌شوند. اگر مکالمه بیش از حد طولانی شود، آن را خلاصه می‌کنیم و ادامه می‌دهیم.

نموداری که نحوه همکاری استدلال مدل، فراخوانی ابزارها، سابقه مکالمه و فشرده‌سازی را در طول یک وظیفه بلندمدت نشان می‌دهد.

مدل‌های ما به همین شیوه آموزش می‌بینند و در ChatGPT و Codex نیز به همین شکل به کار گرفته می‌شوند. برای نزدیک‌ترشدن به پیکربندی محیط عملیاتی‌مان، چارچوب آزمون ARC-AGI-3 را با Responses API(در یک پنجره جدید باز می‌شود) خود پیاده‌سازی کردیم. API ما مدیریت زمینه را آسان می‌کند: در GPT‑5.6، ارسال شناسه پاسخ قبلی باعث می‌شود استدلال به‌طور خودکار میان فراخوانی ابزارها و نوبت‌ها حفظ شود.

با حفظ استدلال، دو تغییر عمده مشاهده کردیم. نخست، GPT‑5.6 Sol پیش از هر کنش زمان کمتری صرف فکرکردن می‌کرد، زیرا دیگر لازم نبود در هر نوبت بازی را از ابتدا تفسیر کند. دوم، وقتی GPT‑5.6 Sol می‌توانست افکار گذشته خود را به یاد بیاورد، به‌مرور بسیار بهتر یاد می‌گرفت و راهبردهای منسجمی به کار می‌برد.

بهبود بعدی با جایگزین‌کردن برش چرخشی با فشرده‌سازی(در یک پنجره جدید باز می‌شود)، یکی دیگر از تنظیمات Responses API، حاصل شد.

چارچوب آزمون ARC-AGI-3 محدودیت‌های زمینه را با برش چرخشی مدیریت می‌کند. وقتی زمینه مکالمه از ۱۷۵٬۰۰۰ نویسه فراتر می‌رود، قدیمی‌ترین پیام‌ها حذف می‌شوند.

برش چرخشی دو عیب دارد. نخست، مدل مشاهدات و کنش‌های قبلی را از دست می‌دهد. دوم، بخش زیادی از وظایف را با پنجره زمینه پُرتری انجام می‌دهد که می‌تواند عملکرد را اندکی کاهش دهد.

وقتی فشرده‌سازی را در ARC-AGI-3 فعال کردیم، GPT‑5.6 Sol توانست آموخته‌هایش درباره هر بازی را در اجراهای طولانی‌تر بهتر حفظ کند و با توکن‌های خروجی کمتر، امتیاز بالاتری بگیرد.

برای نشان‌دادن اثر حفظ استدلال و فعال‌کردن فشرده‌سازی، این پویانمایی پنجره زمینه ۱۷۵K توکنی GPT‑5.6 Sol را هنگام حل مجموعه‌ای از معماهای ARC-AGI-3 با هر چارچوب آزمون نشان می‌دهد.

دو ستون میانی نشان می‌دهند که هر چارچوب آزمون چگونه از پنجره زمینه مدل به‌شکلی متفاوت استفاده می‌کند. GPT‑5.6 Sol با یادآوری بهتر گذشته خود، برای هر کنش کمتر فکر می‌کند و بسیار سریع‌تر پیش می‌رود. توجه: پیاده‌سازی ما به‌جای نویسه، محدودیت ۱۷۵٬۰۰۰ توکن دارد؛ اما نتیجه بسیار مشابه است، زیرا بخش عمده متن را شبکه‌های کنش تشکیل می‌دهند که توکن‌ساز ما آن‌ها را با نسبت یک‌به‌یک توکن‌بندی می‌کند.

حفظ استدلال و فشرده‌سازی در کنار هم به GPT‑5.6 Sol ‏(Max) امکان می‌دهند با یک‌ششم توکن‌های خروجی، تقریباً سه برابر امتیاز بگیرد.

جمع‌بندی و توصیه‌ها

امیدواریم این آزمایش‌ها یادآور شوند که ارزیابی‌ها به‌ندرت مدل‌ها را به‌تنهایی می‌سنجند؛ آن‌ها مجموعه‌ای از انتخاب‌های کمتر آشکار درباره تنظیمات API، طراحی چارچوب آزمون و پرامپت‌نویسی را نیز می‌سنجند. این نخستین بار نیست که از امتیازهای پایین یک بنچمارک عمومی شگفت‌زده می‌شویم و سپس درمی‌یابیم اجراکننده ارزیابی از چارچوب آزمونی عمومی استفاده کرده که پیام‌های استدلال را حذف می‌کند.

اگر توسعه‌دهنده API هستید و می‌خواهید عملکرد را به حداکثر برسانید، توصیه می‌کنیم از همان تنظیماتی استفاده کنید که در محصولات خودمان به کار می‌بریم:

  • از Responses API ما استفاده کنید، نه API های انتهای چت قدیمی ما
  • استدلال را حفظ کنید
  • از فشرده‌سازی استفاده کنید

همچنین اگر مدل‌ها را مقایسه می‌کنید، توصیه می‌کنیم به ارزیابی‌هایی تکیه کنید که از تنظیمات بالا استفاده می‌کنند؛ زیرا این تنظیمات بیشترین تطابق را با کاربرد واقعی در ChatGPT و Codex دارند.

از ARC بابت سال‌ها فعالیت خلاقانه در ارزیابی AGI و تحلیلی که ما را به بررسی دقیق‌تر این موضوع ترغیب کرد، سپاسگزاریم.

اگر می‌خواهید توانایی خود را در برابر مدل‌های پیشرو محک بزنید، بازی‌های عمومی را در arcprize.org/tasks(در یک پنجره جدید باز می‌شود) امتحان کنید.

نویسنده

Ilan Bigio،‏ Ted Sanders