Прескокни до главната содржина
OpenAI

Како две поставки тројно го зголемија нашиот резултат на тестот ARC-AGI-3

Се вчитува...

Забрзано видео од GPT‑5.6 Sol како се обидува да реши загатки од тестот ARC-AGI-3, со официјалната рамка (лево) и со нашата рамка на API Responses (десно), која го зачувува расудувањето и овозможува компакција. На ранг-листата за оваа игра(се отвора во нов прозорец), ниту еден граничен модел не решава ниво по првото. Со нашата рамка, GPT‑5.6 Sol ги решава сите шест.

Кога првпат ги видовме ниските резултати на GPT‑5.6 Sol на тестот ARC-AGI-3(се отвора во нов прозорец), бевме збунети.

GPT‑5.6 Sol реши долгогодишни отворени проблеми во математиката, како претпоставката за двојно покривање со циклуси(се отвора во нов прозорец), и победи во игри како Pokémon FireRed. Но на ARC-AGI-3, тест составен од 2D логички игри, GPT‑5.6 Sol постигна само 7,8%, а GPT‑5.5 едвај можеше воопшто да ги игра игрите и постигна скромни 0,4%.

Дали 2D логичките игри беа невообичаено тешки за нашите модели? Или, пак, се случуваше нешто друго?

Тестовите ретко ги мерат моделите на ВИ изолирано. Тие ги мерат и помалку видливите одлуки за поставките на API, дизајнот на рамката и формулирањето на инструкциите. Кај ARC-AGI-3 откривме дека вклучувањето две поставки на API што ги користиме во ChatGPT и Codex — зачувано расудување и компакција — тројно ги зголеми резултатите и шесткратно го намали бројот на излезни токени на јавниот сет задачи.

Со официјалната рамка, GPT‑5.6 Sol постигна 13,3% на јавниот сет ARC-AGI-3. Со зачувано расудување и компакција, постигна 38,3%. Резултатите ја мерат релативната ефикасност на човечките дејства (RHAE(се отвора во нов прозорец))метрика што ги споредува перформансите на моделот со човечко појдовно ниво. Врз основа на официјалните записи од играњето(се отвора во нов прозорец), проценуваме дека просечниот човечки тестер постигнал 48%. На моделите не им е кажано како ќе бидат оценувани и не можат да го видат својот резултат додека играатдејствата враќаат само текстуален приказ на секоја слика и нивото на кое се наоѓаат.

ARC-AGI-3

ARC-AGI-3 е тест наменет да мери колку добро агентите со ВИ учат и расудуваат. Агентите истражуваат непознати 2D игри и без изречни упатства заклучуваат како функционираат. Може да играте 25 демонстративни игри на arcprize.org/tasks(се отвора во нов прозорец).

ARC-AGI-3 намерно користи општа рамка, без алатки или посебни функции. Образложението на ARC беше дека едноставната рамка појасно ги открива недостатоците на моделите и овозможува поправедна споредба меѓу нив. За разлика од нив, комерцијалните програмери ги оптимизираат рамките според функциите и особеностите на секој модел.

Кај видеоигрите, GPT‑5.6 Sol го победи Pokémon FireRed со рамка што користи само визуелен влез (како што пренесуваше GPT_Plays_Pokemon(се отвора во нов прозорец)), го победи Slay the Spire преку компјутерското управување на Codex (како што пренесуваше EpochAI(се отвора во нов прозорец)) и ги заврши првите нивоа на Baba Is You (како што споделија Piotr Migdał & Piotr Grabowski(се отвора во нов прозорец)). Што беше толку различно кај ARC-AGI-3?

GPT-5.6 Sol во Codex завршува случајно избран дневен предизвик во Slay the Spire 2.

Итан Молик прикажува(се отвора во нов прозорец) како GPT‑5.6 Sol во Codex совладува случајно избран дневен предизвик во Slay the Spire 2, игра објавена по крајниот датум на знаењето на GPT‑5.6 Sol.

Поттикнати од анализата на ARC за недостатоците на GPT‑5.5(се отвора во нов прозорец), разгледавме некои од обидите на GPT‑5.6 Sol. Како и ARC, видовме дека моделот не делуваше особено способно. Предолго се задржуваше на секое дејство и тешко напредуваше.

Но кога погледнавме подлабоко, откривме дека голем дел од збунетоста не произлегуваше од самиот модел, туку од поставките на рамката.

Прво забележавме дека по секое дејство во играта се отфрлаше целото приватно расудување. Тоа значеше дека при секое дејство од GPT‑5.6 Sol се бараше одново да ја разбере играта, без да може да се сети на претходното размислување. Моделот сè уште можеше да види запис од претходните потези и кратките придружни белешки, но не и плановите, сознанијата или мислите што довеле до нив.

Второ, видовме дека рамката користеше лизгачки прозорец за отсекување, поради што постарите дејства стануваа невидливи со растењето на историјата. Значи, GPT‑5.6 Sol не само што не можеше да се сети на претходното размислување, туку го губеше и сеќавањето на претходните дејства.

Заедно, овие две функции на рамката — отфрлањето на расудувањето и лизгачкото отсекување — помогнаа да се објасни зошто GPT‑5.6 Sol тешко учеше со текот на времето.

Агентите се најуспешни кога паметат што направиле

Нашите модели се обучени да размислуваат преку приватни пораки за расудување пред да дадат одговор или да повикаат алатка. Овие приватни пораки со размислувања се зачувуваат како дел од историјата на разговорот. Ако разговорот стане предолг, го сумираме и продолжуваме.

Дијаграм што покажува како расудувањето на моделот, повиците кон алатки, историјата на разговорот и компакцијата на контекстот функционираат заедно во долготрајна задача.

На овој начин се обучуваат нашите модели, а така се применуваат и во ChatGPT и Codex. За подобро да ја пресликаме нашата продукциска конфигурација, ја имплементиравме рамката ARC-AGI-3 со нашиот API Responses(се отвора во нов прозорец). Нашиот API го олеснува управувањето со контекстот: кај GPT‑5.6, проследувањето на ID-то на претходниот одговор автоматски го зачувува расудувањето меѓу повиците кон алатките и репликите.

Кога расудувањето се зачувуваше, забележавме две големи промени. Прво, GPT‑5.6 Sol трошеше помалку време на размислување пред секое дејство, бидејќи веќе не мораше од почеток да ја толкува играта при секој потег. Второ, кога можеше да се сети на претходните мисли, GPT‑5.6 Sol многу подобро учеше со текот на времето и применуваше доследни стратегии.

Следното подобрување дојде од замената на лизгачкото отсекување со компакција(се отвора во нов прозорец), уште една поставка во API Responses.

Рамката ARC-AGI-3 ги решава ограничувањата на контекстот со лизгачко отсекување. Кога контекстот на разговорот ќе надмине 175.000 знаци, најстарите пораки се отфрлаат.

Лизгачкото отсекување има два недостатока. Прво, моделот ги губи претходните набљудувања и дејства. Второ, голем дел од задачите ги извршува со пополнет прозорец за контекст, што може малку да ги влоши перформансите.

Кога вклучивме компакција на ARC-AGI-3, GPT‑5.6 Sol можеше подобро да го зачува наученото за секоја игра во подолги извршувања и постигна повисок резултат со помалку излезни токени.

За да го прикажеме ефектот од зачувувањето на расудувањето и вклучувањето компакција, еве анимација што го прикажува прозорецот за контекст од 175K на GPT‑5.6 Sol додека решава низа загатки од ARC-AGI-3 со секоја рамка.

Двете централни колони прикажуваат како секоја рамка различно го користи прозорецот за контекст на моделот. Благодарение на подоброто паметење на минатото, GPT‑5.6 Sol размислува помалку при секое дејство и напредува многу побрзо. Забелешка: нашата имплементација користи ограничување од 175.000 токени наместо знаци, но резултатот е многу сличен бидејќи огромното мнозинство од текстот се мрежи на дејства, кои нашиот токенизатор ги токенизира во сооднос 1:1.

Заедно, зачувувањето на расудувањето и компакцијата му овозможуваат на GPT‑5.6 Sol (Max) да постигне приближно тројно повисок резултат со шесткратно помалку излезни токени.

Заклучок и препораки

Се надеваме дека овие експерименти ќе послужат како потсетник дека евалуациите ретко ги мерат моделите изолирано — тие мерат и збир од помалку видливи одлуки за поставките на API, дизајнот на рамката и формулирањето на инструкциите. Ова не е првпат да нè изненадат ниски резултати на јавен тест, а потоа да откриеме дека системот за евалуација користел општа рамка што ги отфрлала пораките за расудување.

Ако развивате со API и сакате да ги зголемите перформансите, препорачуваме да ги користите истите поставки што ги применуваме во нашите производи:

  • Користете го нашиот API Responses, а не наследениот API за завршување на разговори
  • Зачувајте го расудувањето
  • Користете компакција

Ако споредувате модели, препорачуваме да се потпрете на евалуации што ги користат горенаведените поставки, бидејќи тие најдобро ја отсликуваат реалната употреба во ChatGPT и Codex.

Му благодариме на ARC за долгогодишната креативна работа на евалуацијата на AGI и за анализата што нè поттикна овде да погледнеме повнимателно.

Ако сакате да ги испробате своите способности против граничните модели, одиграјте ги јавните игри на arcprize.org/tasks(се отвора во нов прозорец).

Автор

Ilan Bigio и Ted Sanders