Ugrás a fő tartalomra
OpenAI

2026. július 29.

KutatásokPublikáció

Két beállítással megháromszoroztuk pontszámunkat az ARC-AGI-3 teljesítményteszten

Betöltés…

Gyorsított videó arról, ahogy a GPT‑5.6 Sol megpróbálja megoldani az ARC-AGI-3 feladványait a hivatalos végrehajtási környezetben (balra), illetve az érvelést és a kontextust megőrző Responses API-alapú környezetünkben (jobbra). Ennek a játéknak(új ablakban nyílik meg) a ranglistáján egyetlen élvonalbeli modell sem jut túl az első pályán. A mi végrehajtási környezetünkkel a GPT‑5.6 Sol mind a hatot megoldja.

Amikor először megláttuk a GPT‑5.6 Sol alacsony pontszámait az ARC-AGI-3(új ablakban nyílik meg) teljesítményteszten, értetlenül álltunk előttük.

A GPT‑5.6 Sol olyan régóta megoldatlan matematikai problémákat oldott meg, mint a kettős körfedési sejtés(új ablakban nyílik meg), és olyan játékokat győzött le, mint a Pokémon FireRed. Az ARC-AGI-3 kétdimenziós logikai játékain azonban a GPT‑5.6 Sol mindössze 7,8%-ot ért el, a GPT‑5.5 pedig alig tudott játszani velük: szerény 0,4%-os eredményt kapott.

Vajon a kétdimenziós logikai játékok szokatlanul nehezek voltak a modelljeinknek? Vagy valami más állt a háttérben?

A teljesítménytesztek ritkán mérik elszigetelten az AI-modelleket. Az API-beállításokkal, a végrehajtási környezet kialakításával és az utasítások megfogalmazásával kapcsolatos, kevésbé látható döntéseket is mérik. Az ARC-AGI-3 esetében kiderült, hogy a ChatGPT‑ben és a Codexben is használt két API-beállítás—az érvelés megőrzése és a kontextusmegőrzés—bekapcsolásával a nyilvános feladatsoron megháromszorozódott a pontszám, a kimeneti tokenek száma pedig a hatodára csökkent.

A hivatalos végrehajtási környezetben a GPT‑5.6 Sol 13,3%-ot ért el az ARC-AGI-3 nyilvános feladatsorán. Az érvelés megőrzésével és kontextusmegőrzéssel 38,3%-ot ért el. A pontszám a relatív emberi cselekvési hatékonyságot (RHAE(új ablakban nyílik meg))vagyis a modell teljesítményét egy emberi viszonyítási alaphoz mérő mutatót jelzi. A hivatalos játéknaplók(új ablakban nyílik meg) alapján becslésünk szerint az emberi tesztelők átlagosan 48%-ot értek el. A modellek nem tudják, hogyan pontozzák majd őket, és menet közben sem látják a pontszámukata műveletek csak az egyes képkockák szöveges leírását és az aktuális pályát adják vissza.

ARC-AGI-3

Az ARC-AGI-3 azt méri, mennyire jól tanulnak és érvelnek az AI-ügynökök. Az ügynökök ismeretlen kétdimenziós játékokat fedeznek fel, és egyértelmű utasítások nélkül következtetik ki a működésüket. Az arcprize.org/tasks(új ablakban nyílik meg) oldalon 25 demójátékot próbálhat ki.

Az ARC-AGI-3 szándékosan általános, eszközök és különleges funkciók nélküli végrehajtási környezetet használ. Az ARC megfontolása szerint az egyszerű végrehajtási környezet láthatóbbá teszi a modellek hiányosságait, és igazságosabb összehasonlítást tesz lehetővé. A kereskedelmi fejlesztők ezzel szemben az egyes modellek funkcióihoz és sajátosságaihoz optimalizálják a végrehajtási környezetet.

A játékok terén a GPT‑5.6 Sol kizárólag képi információkra épülő végrehajtási környezetben győzte le a Pokémon FireRedet (az eseményt a GPT_Plays_Pokemon(új ablakban nyílik meg) közvetítette), a Codex számítógép-használati funkciójával a Slay the Spire-t (az eseményt az EpochAI(új ablakban nyílik meg) közvetítette), valamint a Baba Is You első pályáit (az eredményt Piotr Migdał & Piotr Grabowski(új ablakban nyílik meg) osztotta meg). Mi volt ennyire más az ARC-AGI-3 esetében?

A Codexben futó GPT-5.6 Sol teljesít egy véletlenszerű napi kihívást a Slay the Spire 2-ben.

Ethan Mollick bemutatja(új ablakban nyílik meg), amint a Codexben futó GPT‑5.6 Sol teljesít egy véletlenszerű napi kihívást a Slay the Spire 2-ben, amely a GPT‑5.6 Sol ismereteinek lezárása után jelent meg.

A GPT‑5.5 hiányosságairól készült ARC-elemzés(új ablakban nyílik meg) nyomán megvizsgáltuk a GPT‑5.6 Sol néhány próbálkozását. Az ARC-hoz hasonlóan mi is úgy láttuk, hogy a modell nem tűnt túl értelmesnek. Sokáig töprengett minden egyes műveleten, és nehezen haladt előre.

Alaposabban megvizsgálva azonban rájöttünk, hogy a modell zavarodottsága nagyrészt nem magából a modellből, hanem a végrehajtási környezet beállításaiból fakadt.

Először azt vettük észre, hogy minden játékbeli művelet után törlődött a teljes belső érvelés. Ez azt jelentette, hogy a GPT‑5.6 Solnak minden műveletnél újra fel kellett térképeznie a játékot, mert nem emlékezhetett a korábbi gondolatmenetére. A modell továbbra is látta a korábbi lépések naplóját és a hozzájuk tartozó rövid jegyzeteket, de az azokhoz vezető terveket, felismeréseket és gondolatokat nem.

Másodszor azt láttuk, hogy a végrehajtási környezet gördülő csonkítási ablakot használt, így az előzmények bővülésével a régebbi műveletek láthatatlanná váltak. A GPT‑5.6 Sol tehát nemcsak a korábbi gondolatmenetére nem emlékezhetett, hanem a korábbi műveleteit is kezdte elfelejteni.

A végrehajtási környezet e két jellemzője—az érvelés törlése és a gördülő csonkítás—együttesen megmagyarázta, miért tanult nehezen a GPT‑5.6 Sol hosszabb távon.

Az ügynökök akkor teljesítenek a legjobban, ha emlékeznek arra, amit tettek

Modelljeinket úgy tanítjuk, hogy a válaszok vagy eszközhívások kiadása előtt belső érvelési üzenetekkel gondolkodjanak. Ezeket a belső gondolkodási üzeneteket megőrizzük a beszélgetési előzmények részeként. Ha egy beszélgetés túl hosszúra nyúlik, összefoglaljuk, majd folytatjuk.

Ábra arról, hogyan működik együtt a modell érvelése, az eszközhívások, a beszélgetési előzmények és a kontextusmegőrzés egy hosszan futó feladat során.

Modelljeinket így tanítjuk, és a ChatGPT‑ben, illetve a Codexben is így helyezzük üzembe őket. Hogy jobban megközelítsük az éles rendszerünk működését, az ARC-AGI-3 végrehajtási környezetét a Responses API(új ablakban nyílik meg)-val valósítottuk meg. API-nk megkönnyíti a kontextus kezelését: a GPT‑5.6 esetében az előző válasz azonosítójának átadása automatikusan megőrzi az érvelést az eszközhívások és a beszélgetési fordulók között.

Az érvelés megőrzése két jelentős változást hozott. Először is, a GPT‑5.6 Sol kevesebb időt töltött gondolkodással az egyes műveletek előtt, mert már nem kellett minden körben az alapoktól újraértelmeznie a játékot. Másodszor, amikor emlékezhetett korábbi gondolataira, a GPT‑5.6 Sol idővel sokkal jobban tanult, és következetes stratégiákat alkalmazott.

A következő javulást az hozta, hogy a gördülő csonkítást felváltottuk a kontextusmegőrzéssel(új ablakban nyílik meg), a Responses API egy másik beállításával.

Az ARC-AGI-3 végrehajtási környezete gördülő csonkítással kezeli a kontextus korlátait. Amikor a beszélgetési kontextus meghaladja a 175 000 karaktert, a rendszer törli a legrégebbi üzeneteket.

A gördülő csonkításnak két hátránya van. Először is, a modell elveszíti a korábbi megfigyeléseket és műveleteket. Másodszor, a feladatok nagy részében telítettebb kontextusablakkal működik, ami kissé ronthatja a teljesítményt.

Amikor bekapcsoltuk a kontextusmegőrzést az ARC-AGI-3-on, a GPT‑5.6 Sol hosszabb futások során is jobban megőrizte az egyes játékokról tanultakat, és kevesebb kimeneti tokennel ért el magasabb pontszámot.

Az érvelés és a kontextus megőrzésének hatását egy animáció szemlélteti: azt mutatja, hogyan használja a GPT‑5.6 Sol a 175 ezres kontextusablakát, miközben az egyes végrehajtási környezetekben ARC-AGI-3-feladványokat old meg.

A két középső oszlop azt szemlélteti, hogyan használja eltérően a modell kontextusablakát a két végrehajtási környezet. Mivel a GPT‑5.6 Sol jobban emlékszik a korábbiakra, kevesebbet gondolkodik műveletenként, és sokkal gyorsabban halad. Megjegyzés: a megvalósításunk 175 000 tokenes korlátot használ a karakterek helyett, de ez végül nagyon hasonló eredményt ad, mivel a szöveg túlnyomó részét műveleti rácsok alkotják, amelyeket a tokenizálónk 1:1 arányban tokenizál.

Az érvelés és a kontextus együttes megőrzésével a GPT‑5.6 Sol (Max) körülbelül háromszoros pontszámot ér el, hatszor kevesebb kimeneti tokennel.

Összegzés és ajánlások

Reméljük, ezek a kísérletek emlékeztetnek arra, hogy a kiértékelések ritkán mérik elszigetelten a modelleket—az API-beállításokkal, a végrehajtási környezet kialakításával és az utasítások megfogalmazásával kapcsolatos, kevésbé látható döntések együttesét is mérik. Nem most fordult elő először, hogy megleptek bennünket egy nyilvános teljesítményteszt alacsony pontszámai, majd kiderült, hogy a kiértékelést futtató rendszer általános végrehajtási környezetet használt, amely elvetette az érvelési üzeneteket.

Ha API-fejlesztőként a lehető legjobb teljesítményre törekszik, javasoljuk, hogy ugyanazokat a beállításokat használja, mint mi a saját termékeinkben:

  • A korábbi csevegés-befejezési API helyett használja a Responses API-t
  • Őrizze meg az érvelést
  • Használjon kontextusmegőrzést

Ha pedig modelleket hasonlít össze, olyan kiértékelésekre érdemes támaszkodnia, amelyek a fenti beállításokat használják, mivel ezek tükrözik legjobban a ChatGPT és a Codex valós használatát.

Hálásak vagyunk az ARC-nak az AGI kiértékelésén végzett sokéves kreatív munkájáért, valamint azért az elemzésért, amely arra ösztönzött bennünket, hogy közelebbről is megvizsgáljuk ezt a kérdést.

Ha próbára tenné magát az élvonalbeli modellekkel szemben, játsszon a nyilvános játékokkal az arcprize.org/tasks(új ablakban nyílik meg) oldalon.

Szerző

Ilan Bigio és Ted Sanders