Преминаване към основното съдържание
OpenAI

Как включването на две настройки утрои резултатите ни в бенчмарка ARC-AGI-3

Зареждане…

Ускорено видео, в което GPT‑5.6 Sol се опитва да решава задачи от бенчмарка ARC-AGI-3 с официалната рамка (вляво) и с нашата рамка за Responses API (вдясно), която запазва структуриранoто анализиране и активира сбиването. В класацията за тази игра(отваря се в нов прозорец) нито един авангарден модел не решава ниво след първото. С нашата рамка GPT‑5.6 Sol решава и шестте.

Когато за първи път видяхме ниските резултати на GPT‑5.6 Sol в бенчмарка ARC-AGI-3(отваря се в нов прозорец), бяхме озадачени.

GPT‑5.6 Sol реши отдавна нерешени задачи в математиката, като хипотезата за двойно покритие с цикли(отваря се в нов прозорец), и победи в игри като Pokémon FireRed. Но в ARC-AGI-3 — бенчмарк с 2D логически игри — GPT‑5.6 Sol постигна едва 7,8%, а GPT‑5.5 почти не успя да играе и отбеляза нищожните 0,4%.

Нима 2D логическите игри бяха необичайно трудни за нашите модели? Или причината беше друга?

Бенчмарковете рядко измерват моделите с ИИ изолирано. Те измерват и по-малко видимите решения за настройките на API, проектирането на рамката и съставянето на подканите. При ARC-AGI-3 установихме, че включването на две настройки на API, които използваме в ChatGPT и Codex — запазено структурирано анализиране и сбиване — утрои резултатите и намали изходните токени шест пъти върху публичния набор от задачи.

С официалната рамка GPT‑5.6 Sol постигна 13,3% на публичния набор ARC-AGI-3. Със запазено структурирано анализиране и сбиване резултатът беше 38,3%. Оценките измерват относителната ефективност на човешките действия (RHAE(отваря се в нов прозорец))показател, който сравнява представянето на модела с базовото човешко ниво. Въз основа на официалните дневници от игрите(отваря се в нов прозорец) изчисляваме, че средният резултат на хората тестери е 48%. На моделите не се казва как ще бъдат оценявани и те не виждат резултата си по време на игратадействията връщат само текстово представяне на всеки кадър и информация за текущото ниво.

ARC-AGI-3

ARC-AGI-3 е бенчмарк, предназначен да измерва колко добре агентите с ИИ се учат и разсъждават. Агентите изследват непознати 2D игри и без изрични инструкции сами разбират как работят. Можете да играете 25 демонстрационни игри на arcprize.org/tasks(отваря се в нов прозорец).

ARC-AGI-3 умишлено използва универсална рамка без инструменти или специални функции. Логиката на ARC беше, че простата рамка прави недостатъците на моделите по-видими, а сравненията между тях — по-обективни. За разлика от тях разработчиците на търговски продукти оптимизират рамките според особеностите и слабостите на всеки модел.

В игрите GPT‑5.6 Sol победи Pokémon FireRed с рамка, използваща само зрение (излъчено от GPT_Plays_Pokemon(отваря се в нов прозорец)), Slay the Spire чрез компютърното управление на Codex (излъчено от EpochAI(отваря се в нов прозорец)) и първите етапи на Baba Is You (споделено от Пьотр Мигдал и Пьотр Грабовски(отваря се в нов прозорец)). Какво беше толкова различно при ARC-AGI-3?

GPT-5.6 Sol в Codex изпълнява произволно генерирано ежедневно предизвикателство в Slay the Spire 2.

Итън Молик показва(отваря се в нов прозорец) как GPT‑5.6 Sol в Codex побеждава в произволно генерирано ежедневно предизвикателство в Slay the Spire 2 — игра, издадена след крайната дата на знанията на GPT‑5.6 Sol.

Вдъхновени от анализа на ARC за недостатъците на GPT‑5.5(отваря се в нов прозорец), разгледахме някои от опитите на GPT‑5.6 Sol. Подобно на ARC, и ние видяхме, че моделът не изглежда особено съобразителен. Той обмисляше дълго всяко действие и трудно напредваше.

Но при по-задълбочен преглед установихме, че голяма част от объркването не е присъщо на самия модел, а се дължи на настройките в рамката.

Първо забелязахме, че след всяко действие в играта цялото частно структурирано анализиране се изтрива. Това означаваше, че при всяко действие GPT‑5.6 Sol трябва отново да разгадава играта, без да помни предишните си разсъждения. Моделът все още виждаше запис на предишните ходове и кратки съпътстващи бележки, но не и плановете, прозренията или мислите, довели до тях.

Второ, видяхме, че рамката използва плъзгащ се прозорец за съкращаване, заради който по-старите действия изчезват с нарастването на хронологията. Така GPT‑5.6 Sol не само не можеше да помни предишните си разсъждения, но губеше и спомена за предишните си действия.

Заедно тези две особености на рамката — изтриването на структуриранoто анализиране и плъзгащото се съкращаване — обясниха защо GPT‑5.6 Sol толкова трудно се учи с времето.

Агентите се справят най-добре, когато помнят какво са направили

Нашите модели са обучени да обмислят задачите чрез частни съобщения за структурирано анализиране, преди да изведат отговор или да извикат инструмент. Тези частни съобщения с разсъждения се запазват като част от хронологията на разговора. Ако разговорът стане твърде дълъг, го обобщаваме и продължаваме.

Диаграма, показваща как структуриранoто анализиране на модела, извикванията на инструменти, хронологията на разговора и сбиването на контекста работят заедно при продължителна задача.

Така са обучени нашите модели и така се използват в ChatGPT и Codex. За да се доближим повече до производствената си конфигурация, реализирахме рамката за ARC-AGI-3 с нашия Responses API(отваря се в нов прозорец). Нашият API улеснява управлението на контекста: при GPT‑5.6 подаването на идентификатора на предишния отговор автоматично запазва структуриранoто анализиране между извикванията на инструменти и отделните реплики.

При запазено структурирано анализиране забелязахме две големи промени. Първо, GPT‑5.6 Sol отделяше по-малко време за обмисляне преди всяко действие, защото вече не трябваше да разгадава играта отначало при всеки ход. Второ, когато можеше да помни предишните си мисли, GPT‑5.6 Sol се учеше много по-добре с времето и прилагаше последователни стратегии.

Следващото подобрение дойде от замяната на плъзгащото се съкращаване със сбиване(отваря се в нов прозорец) — друга настройка в Responses API.

Рамката за ARC-AGI-3 се справя с ограниченията на контекста чрез плъзгащо се съкращаване. Когато контекстът на разговора надхвърли 175 000 знака, най-старите съобщения се изтриват.

Плъзгащото се съкращаване има два недостатъка. Първо, моделът губи по-ранните наблюдения и действия. Второ, той изпълнява голяма част от задачите с по-запълнен контекстен прозорец, което може леко да влоши представянето.

Когато активирахме сбиването в ARC-AGI-3, GPT‑5.6 Sol успяваше по-добре да запази наученото за всяка игра при по-продължителни изпълнения и постигна по-висок резултат с по-малко изходни токени.

За да илюстрираме ефекта от запазването на структуриранoто анализиране и активирането на сбиването, тази анимация показва как GPT‑5.6 Sol използва контекстния си прозорец от 175K, докато решава поредица от задачи от ARC-AGI-3 с всяка от рамките.

Двете средни колони показват как всяка рамка използва контекстния прозорец на модела по различен начин. Благодарение на по-добрата памет за предишните си действия GPT‑5.6 Sol обмисля по-малко всяко действие и напредва много по-бързо. Забележка: нашата реализация използва ограничение от 175 000 токена вместо знаци, но крайният резултат е много сходен, защото по-голямата част от текста са решетки с действия, които нашият токенизатор преобразува в токени в съотношение 1:1.

Взети заедно, запазеното структурирано анализиране и сбиването позволяват на GPT‑5.6 Sol (Max) да постигне приблизително три пъти по-висок резултат с шест пъти по-малко изходни токени.

Заключение и препоръки

Надяваме се тези експерименти да напомнят, че оценките рядко измерват моделите изолирано — те измерват и съвкупност от по-малко видими решения за настройките на API, проектирането на рамката и съставянето на подканите. Това не е първият случай, в който ниските резултати в публичен бенчмарк ни изненадват, а после установяваме, че системата за оценяване използва универсална рамка, която изтрива съобщенията за структурирано анализиране.

Ако разработвате с API и искате да постигнете максимална производителност, препоръчваме да използвате същите настройки, които прилагаме в собствените си продукти:

  • Използвайте нашия Responses API, а не остарелия API за завършване на чат
  • Запазвайте структуриранoто анализиране
  • Използвайте сбиване

А ако сравнявате модели, препоръчваме да се опирате на оценки, които използват горните настройки, тъй като те най-точно отразяват реалната употреба в ChatGPT и Codex.

Благодарни сме на ARC за дългогодишната им творческа работа по оценяването на AGI и за анализа, който ни вдъхнови да разгледаме въпроса по-задълбочено.

Ако искате да премерите сили с авангардни модели, изпробвайте сами публичните игри на arcprize.org/tasks(отваря се в нов прозорец).

Автор

Ilan Bigio, Ted Sanders