Siirry pääsisältöön
OpenAI

29. heinäkuuta 2026

TutkimusJulkaisu

Kaksi asetusta kolminkertaisti tuloksemme ARC-AGI-3-vertailutestissä

Ladataan...

Nopeutettu video, jossa GPT‑5.6 Sol yrittää ratkaista ARC-AGI-3-vertailutestin pulmia virallisella arviointikehyksellä (vasemmalla) ja Responses API -arviointikehyksellämme (oikealla), joka säilyttää päättelyn ja ottaa kontekstin tiivistämisen käyttöön. Tämän pelin(avautuu uudessa ikkunassa) tulostaulukossa yksikään edistynyt malli ei ratkaise ensimmäistä tasoa pidemmälle. Meidän arviointikehyksellämme GPT‑5.6 Sol ratkaisee kaikki kuusi tasoa.

Kun näimme GPT‑5.6 Solin heikot tulokset ARC-AGI-3(avautuu uudessa ikkunassa)-vertailutestissä ensimmäisen kerran, olimme ymmällämme.

GPT‑5.6 Sol on ratkaissut matematiikan pitkäaikaisia avoimia ongelmia, kuten syklisen kaksoispeitteen konjektuurin(avautuu uudessa ikkunassa), ja päihittänyt Pokémon FireRedin kaltaisia pelejä. Kaksiulotteisista pulmapeleistä koostuvassa ARC-AGI-3-vertailutestissä GPT‑5.6 Sol sai kuitenkin vain 7,8 %, ja GPT‑5.5 pystyi hädin tuskin pelaamaan pelejä lainkaan: sen vaatimaton tulos oli 0,4 %.

Olivatko kaksiulotteiset pulmapelit malleillemme poikkeuksellisen vaikeita? Vai oliko taustalla jotakin muuta?

Vertailutesteissä tekoälymalleja mitataan harvoin erillään muusta järjestelmästä. Niissä mitataan myös vähemmän näkyviä API-asetuksia sekä arviointikehystä ja kehotteita koskevia valintoja. ARC-AGI-3:n tapauksessa havaitsimme, että kahden ChatGPT:ssä ja Codexissa käyttämämme API-asetuksen – päättelyn säilyttämisen ja kontekstin tiivistämisen – käyttöönotto kolminkertaisti tulokset ja vähensi tuotostokenien määrän kuudesosaan julkisessa tehtäväjoukossa.

Virallisella arviointikehyksellä GPT‑5.6 Sol sai ARC-AGI-3:n julkisessa tehtäväjoukossa tuloksen 13,3 %. Kun päättely säilytettiin ja kontekstin tiivistäminen otettiin käyttöön, tulos oli 38,3 %. Tulokset mittaavat suhteellista ihmisen toimintatehokkuutta (RHAE(avautuu uudessa ikkunassa))mittaria, joka vertaa mallin suorituskykyä ihmisten vertailutasoon. Virallisten pelilokien(avautuu uudessa ikkunassa) perusteella arvioimme, että ihmistestaajien keskimääräinen tulos oli 48 %. Malleille ei kerrota arviointitapaa, eivätkä ne näe tulostaan suorituksen aikanatoiminnot palauttavat vain kunkin kuvan tekstiesityksen ja tiedon nykyisestä tasosta.

ARC-AGI-3

ARC-AGI-3 on vertailutesti, joka mittaa tekoälyagenttien oppimis- ja päättelykykyä. Agentit tutkivat ennestään tuntemattomia kaksiulotteisia pelejä ja päättelevät ilman nimenomaisia ohjeita, miten ne toimivat. Voit pelata 25 demopeliä osoitteessa arcprize.org/tasks(avautuu uudessa ikkunassa).

ARC-AGI-3 käyttää tarkoituksella yleiskäyttöistä arviointikehystä, jossa ei ole työkaluja eikä erityisominaisuuksia. ARC perusteli valintaa sillä, että yksinkertainen arviointikehys tuo mallien puutteet selvemmin esiin ja tekee niiden vertailusta oikeudenmukaisempaa. Kaupalliset kehittäjät puolestaan optimoivat arviointikehykset kunkin mallin ominaisuuksien ja erityispiirteiden mukaan.

Pelien saralla GPT‑5.6 Sol on päihittänyt Pokémon FireRedin pelkkää konenäköä käyttävällä arviointikehyksellä (GPT_Plays_Pokemonin(avautuu uudessa ikkunassa) striimaamana), Slay the Spiren Codexin tietokoneenkäytöllä (EpochAI:n(avautuu uudessa ikkunassa) striimaamana) sekä Baba Is Youn ensimmäiset tasot (Piotr Migdałin ja Piotr Grabowskin(avautuu uudessa ikkunassa) jakamana). Mikä ARC-AGI-3:ssa oli niin erilaista?

GPT-5.6 Sol suorittaa Codexissa Slay the Spire 2:n satunnaistetun päivähaasteen.

Ethan Mollick näyttää(avautuu uudessa ikkunassa), kuinka GPT‑5.6 Sol päihittää Codexissa Slay the Spire 2:n satunnaistetun päivähaasteen. Peli julkaistiin GPT‑5.6 Solin tietojen katkaisupäivän jälkeen.

ARC:n analyysi GPT‑5.5:n puutteista(avautuu uudessa ikkunassa) innosti meitä tutkimaan joitakin GPT‑5.6 Solin yrityksiä. ARC:n tavoin havaitsimme, ettei malli vaikuttanut kovin älykkäältä. Se pohti jokaista toimintoa pitkään eikä juuri edistynyt.

Kun perehdyimme asiaan tarkemmin, havaitsimme kuitenkin, ettei suuri osa mallin hämmennyksestä johtunut itse mallista vaan arviointikehyksen asetuksista.

Ensinnäkin huomasimme, että kaikki yksityinen päättely hylättiin jokaisen pelitoiminnon jälkeen. Siksi GPT‑5.6 Sol joutui selvittämään pelin toiminnan uudelleen jokaisen toiminnon yhteydessä muistamatta aiempaa ajatteluaan. Malli näki edelleen aiempien siirtojen tiedot ja niiden lyhyet muistiinpanot, mutta ei niiden taustalla olleita suunnitelmia, oivalluksia tai ajatuksia.

Toiseksi havaitsimme, että arviointikehys käytti liukuvaa katkaisuikkunaa, minkä vuoksi vanhemmat toiminnot katosivat näkyvistä historian kasvaessa. GPT‑5.6 Sol ei siis ainoastaan unohtanut aiempaa ajatteluaan vaan menetti myös muistinsa aiemmista toiminnoistaan.

Nämä arviointikehyksen kaksi ominaisuutta – päättelyn hylkääminen ja liukuva katkaisu – selittivät yhdessä, miksi GPT‑5.6 Solin oli vaikea oppia ajan mittaan.

Agentit suoriutuvat parhaiten, kun ne muistavat aiemmat toimintonsa

Mallimme on koulutettu ajattelemaan yksityisten päättelyviestien avulla ennen vastausten tai työkalukutsujen tuottamista. Nämä yksityiset ajatteluviestit säilytetään osana keskusteluhistoriaa. Jos keskustelusta tulee liian pitkä, teemme siitä yhteenvedon ja jatkamme.

Kaavio siitä, miten mallin päättely, työkalukutsut, keskusteluhistoria ja kontekstin tiivistäminen toimivat yhdessä pitkäkestoisen tehtävän aikana.

Näin mallimme koulutetaan, ja samalla tavalla niitä käytetään ChatGPT:ssä ja Codexissa. Jotta toteutus vastaisi paremmin tuotantoympäristöämme, toteutimme ARC-AGI-3-arviointikehyksen Responses API(avautuu uudessa ikkunassa) -rajapinnallamme. API:mme helpottaa kontekstin hallintaa: GPT‑5.6:ssa edellisen vastauksen tunnuksen välittäminen säilyttää päättelyn automaattisesti työkalukutsujen ja keskusteluvuorojen välillä.

Kun päättely säilytettiin, havaitsimme kaksi merkittävää muutosta. Ensinnäkin GPT‑5.6 Sol käytti vähemmän aikaa ajatteluun ennen kutakin toimintoa, koska sen ei enää tarvinnut tulkita peliä alusta jokaisella vuorolla. Toiseksi GPT‑5.6 Sol oppi ajan mittaan huomattavasti paremmin ja käytti johdonmukaisia strategioita, kun se pystyi muistamaan aiemmat ajatuksensa.

Seuraava parannus saatiin korvaamalla liukuva katkaisu kontekstin tiivistämisellä(avautuu uudessa ikkunassa), joka on toinen Responses API -rajapinnan asetus.

ARC-AGI-3-arviointikehys hallitsee kontekstirajoja liukuvan katkaisun avulla. Kun keskustelukonteksti ylittää 175 000 merkkiä, vanhimmat viestit hylätään.

Liukuvassa katkaisussa on kaksi haittapuolta. Ensinnäkin malli menettää aiemmat havainnot ja toiminnot. Toiseksi se suorittaa suuren osan tehtävistä täydemmässä konteksti-ikkunassa, mikä voi hieman heikentää suorituskykyä.

Kun otimme kontekstin tiivistämisen käyttöön ARC-AGI-3:ssa, GPT‑5.6 Sol pystyi säilyttämään pitkäkestoisten suoritusten aikana paremmin kustakin pelistä oppimansa asiat ja saavutti paremman tuloksen vähemmillä tuotostokeneilla.

Seuraava animaatio havainnollistaa päättelyn säilyttämisen ja kontekstin tiivistämisen vaikutusta näyttämällä, miten GPT‑5.6 Solin 175 000 tunnisteen konteksti-ikkuna täyttyy sen ratkaistessa ARC-AGI-3-pulmia kummallakin arviointikehyksellä.

Kaksi keskimmäistä saraketta havainnollistavat, miten arviointikehykset käyttävät mallin konteksti-ikkunaa eri tavoin. Kun GPT‑5.6 Sol muistaa aiemmat tapahtumat paremmin, se ajattelee vähemmän toimintoa kohden ja etenee paljon nopeammin. Huomautus: toteutuksemme raja on 175 000 tokenia merkkien sijaan. Käytännössä ero on kuitenkin melko pieni, sillä suurin osa tekstistä on toimintoruudukoita, jotka tokenisoidaan suhteessa 1:1 tokenisoijamme avulla.

Yhdessä päättelyn säilyttäminen ja kontekstin tiivistäminen auttavat GPT‑5.6 Solia (Max) saavuttamaan noin kolminkertaisen tuloksen kuusi kertaa vähemmillä tuotostokeneilla.

Johtopäätökset ja suositukset

Toivomme näiden kokeiden muistuttavan siitä, että arvioinneissa mitataan harvoin vain malleja. Niissä mitataan myös API-asetuksia sekä arviointikehystä ja kehotteita koskevien vähemmän näkyvien valintojen kokonaisuutta. Tämä ei ole ensimmäinen kerta, kun julkisen vertailutestin heikot tulokset ovat yllättäneet meidät ja olemme sitten havainneet arvioinnin käyttävän yleiskäyttöistä arviointikehystä, joka jätti päättelyviestit pois.

Jos olet API-kehittäjä ja haluat maksimoida suorituskyvyn, suosittelemme käyttämään samoja asetuksia kuin omissa tuotteissamme:

  • Käytä Responses API -rajapintaamme vanhan Keskustelun täydennys-API:n sijaan
  • Säilytä päättely
  • Käytä kontekstin tiivistämistä

Jos vertailet malleja, suosittelemme käyttämään arviointeja, joissa käytetään edellä mainittuja asetuksia. Ne vastaavat parhaiten todellista käyttöä ChatGPT:ssä ja Codexissa.

Kiitämme ARC:tä sen vuosia jatkuneesta luovasta työstä AGI:n arvioinnin parissa sekä analyysistä, joka sai meidät perehtymään asiaan tarkemmin.

Jos haluat mitata omia kykyjäsi edistyneitä malleja vastaan, kokeile julkisia pelejä osoitteessa arcprize.org/tasks(avautuu uudessa ikkunassa).

Tekijä

Ilan Bigio ja Ted Sanders