Како су два подешавања утростручила наше резултате на мерилу ARC-AGI-3
Убрзани снимак покушаја модела GPT‑5.6 Sol да реши логичке игре у мерилу ARC-AGI-3, са званичним окружењем (лево) и нашим окружењем заснованим на Responses API-ју (десно), које задржава резоновање и омогућава компакцију. На ранг-листи за ову игру(отвара се у новом прозору), ниједан гранични модел не решава ниједан ниво после првог. Са нашим окружењем, GPT‑5.6 Sol решава свих шест.
Када смо први пут видели ниске резултате модела GPT‑5.6 Sol на мерилу ARC-AGI-3(отвара се у новом прозору), били смо збуњени.
GPT‑5.6 Sol је решио дугогодишње отворене математичке проблеме, попут хипотезе о двоструком покривању циклусима(отвара се у новом прозору) и савладао игре попут Pokémon FireRed. Али на мерилу ARC-AGI-3, састављеном од 2D логичких игара, GPT‑5.6 Sol је постигао свега 7,8%, док GPT‑5.5 готово уопште није могао да игра те игре и остварио је мршавих 0,4%.
Да ли су 2D логичке игре биле необично тешке за наше моделе? Или се дешавало нешто друго?
Мерила ретко мере AI моделе изоловано. Она мере и мање видљиве одлуке о подешавањима API-ја, дизајну окружења и задавању инструкција. У случају ARC-AGI-3, о подешавањима API-ја које користимо у производима ChatGPT и Codex – задржавање резоновања и компакција – утростручиле резултате и шестоструко смањиле број излазних токена на јавном скупу задатака.
Са званичним окружењем, модел GPT‑5.6 Sol је постигао 13,3% на јавном скупу ARC-AGI-3. Са задржаним резоновањем и компакцијом постигао је 38,3%. Резултати мере релативну ефикасност људских радњи (RHAE(отвара се у новом прозору))–метрику која пореди учинак модела са људским полазиштем. На основу званичних записа играња(отвара се у новом прозору), процењујемо да је просечан резултат људских тестера био 48%. Моделима није речено како ће бити оцењивани и током игре не могу да виде свој резултат – радње враћају само текстуални приказ сваког кадра и ниво на којем се налазе.
ARC-AGI-3 је мерило осмишљено да мери колико добро AI агенти уче и резонују. Агенти истражују непознате 2D игре и без изричитих упутстава закључују како оне функционишу. Можете да одиграте 25 демонстрационих игара на адреси arcprize.org/tasks(отвара се у новом прозору).
ARC-AGI-3 намерно користи генеричко окружење, без алатки или посебних функција. Резоновање ARC-а било је да једноставно окружење јасније показује недостатке модела и омогућава праведније поређење модела. Насупрот томе, комерцијални програмери прилагођавају окружења функцијама и функцијама сваког модела.
Када је реч о играма, модел GPT‑5.6 Sol је савладао Pokémon FireRed помоћу окружења заснованог искључиво на виду (у преносу канала GPT_Plays_Pokemon(отвара се у новом прозору)), Slay the Spire користећи рачунар преко услуге Codex (у преносу канала EpochAI(отвара се у новом прозору)) и прве нивое игре Baba Is You (у објави аутора Пјотра Мигдала и Пјотра Грабовског(отвара се у новом прозору)). Шта је било толико другачије код ARC-AGI-3?

Итан Молик приказује(отвара се у новом прозору) како GPT‑5.6 Sol у услузи Codex савладава насумични дневни изазов у игри Slay the Spire 2, објављеној након крајњег датума знања модела GPT‑5.6 Sol.
Подстакнути ARC-овом анализом недостатака модела GPT‑5.5(отвара се у новом прозору), испитали смо неке од покушаја модела GPT‑5.6 Sol. Као и ARC, видели смо да модел није деловао нарочито паметно. Предуго се задржавао на свакој радњи и тешко је напредовао.
Међутим, када смо детаљније испитали проблем, открили смо да велики део збуњености модела није потицао од самог модела, већ од подешавања окружења.
Прво смо приметили да је после сваке радње у игри целокупно приватно резоновање одбацивано. То је значило да је при свакој радњи модел GPT‑5.6 Sol морао изнова да схвата игру, без могућности да се сети претходног размишљања. Модел је и даље могао да види запис претходних потеза и кратке пратеће белешке, али не и планове, увиде или мисли који су до њих довели.
Затим смо видели да окружење користи покретни прозор за одсецање, због чега старије радње постају невидљиве како историја расте. Дакле, GPT‑5.6 Sol не само што није могао да се сети свог претходног размишљања већ је губио и сећање на претходне радње.
Ове две одлике окружења – одбацивање резоновања и покретно одсецање – заједно су помогле да објаснимо зашто је модел GPT‑5.6 Sol тешко учио током времена.
Наши модели су обучени да размишљају кроз приватне поруке резоновања пре него што дају одговор или позову алатку. Ове приватне поруке размишљања чувају се у оквиру историје разговора. Ако разговор постане предугачак, резимирамо га и настављамо.
Тако се наши модели обучавају, а тако се и примењују у производима ChatGPT и Codex. Да бисмо се боље ускладили са нашим продукционим окружењем, применили смо окружење ARC-AGI-3 помоћу нашег Responses API-ја(отвара се у новом прозору). Наш API олакшава управљање контекстом: код модела GPT‑5.6, прослеђивање ID-а претходног одговора аутоматски задржава резоновање кроз позиве алатки и интеракције.
Када смо задржали резоновање, приметили смо две велике промене. Прво, GPT‑5.6 Sol је трошио мање времена на размишљање пре сваке радње јер више није морао да при сваком потезу тумачи игру од почетка. Друго, када је могао да се сети претходних мисли, GPT‑5.6 Sol је знатно боље учио током времена и примењивао кохерентне стратегије.
Следеће побољшање донела је замена покретног одсецања компакцијом(отвара се у новом прозору), још једним подешавањем Responses API-ја.
Окружење ARC-AGI-3 решава ограничења контекста помоћу покретног одсецања. Када контекст разговора премаши 175.000 знакова, најстарије поруке се одбацују.
Покретно одсецање има два недостатка. Прво, модел губи ранија запажања и радње. Друго, велики део задатка обавља са попуњенијим прозором контекста, што може благо да умањи учинак.
Када смо омогућили компакцију на ARC-AGI-3, GPT‑5.6 Sol је током дужих извршавања боље чувао оно што је научио о свакој игри и постигао виши резултат уз мање излазних токена.
Да бисмо приказали ефекат задржавања резоновања и омогућавања компакције, ево анимације која показује како GPT‑5.6 Sol користи прозор контекста од 175 хиљада док решава низ логичких игара ARC-AGI-3 у сваком окружењу.
У две средишње колоне приказано је како свако окружење другачије користи прозор контекста модела. Захваљујући бољем памћењу претходних радњи, GPT‑5.6 Sol мање размишља при свакој радњи и напредује много брже. Напомена: наша примена користи ограничење од 175.000 токена уместо знакова, али је исход веома сличан јер огромну већину текста чине мреже радњи, које наш токенизатор токенизује у односу 1:1.
Задржавање резоновања и компакција заједно омогућавају моделу GPT‑5.6 Sol (Max) да постигне приближно троструко бољи резултат уз шест пута мање излазних токена.
Надамо се да ће ови експерименти послужити као подсетник да евалуације ретко мере моделе изоловано – оне мере и скуп мање видљивих одлука о подешавањима API-ја, дизајну окружења и задавању упита. Ово није први пут да су нас изненадили ниски резултати на јавном мерилу, након чега смо открили да покретач евалуације користи генеричко окружење које одбацује поруке резоновања.
Ако сте API програмер који жели да постигне најбољи могући учинак, препоручујемо да користите иста подешавања која примењујемо у сопственим производима:
- Користите наш Responses API, а не застарели API за довршавање ћаскања
- Задржите резоновање
- Користите компакцију
И ако поредите моделе, препоручујемо да се ослоните на евалуације које користе наведена подешавања, јер она најбоље одговарају стварној употреби у производима ChatGPT и Codex.
Захвални смо ARC-у на вишегодишњем креативном раду на евалуацији AGI-ја и на анализи која нас је подстакла да ово детаљније испитамо.
Ако желите да одмерите своје способности са граничним моделима, испробајте јавне игре на адреси arcprize.org/tasks(отвара се у новом прозору).


