Fara beint í aðalefni
OpenAI

29. júlí 2026

RannsóknirÚtgáfa

Hvernig tvær stillingar þrefölduðu skor okkar í ARC-AGI-3-prófinu

Hleður inn...

Hraðspólað myndband af GPT‑5.6 Sol að reyna að leysa þrautir í ARC-AGI-3-viðmiðunarprófinu, með opinbera beislinu (vinstra megin) og Responses API-beislinu okkar (hægra megin), sem varðveitir rök og virkjar þjöppun. Á stigatöflunni fyrir þennan leik(opnast í nýjum glugga) leysir ekkert líkan sem stendur framarlega neitt borð eftir það fyrsta. Með beislinu okkar leysir GPT‑5.6 Sol öll sex.

Þegar við sáum fyrst lágt skor GPT‑5.6 Sol í ARC-AGI-3(opnast í nýjum glugga)-viðmiðunarprófinu urðum við undrandi.

GPT‑5.6 Sol hefur leyst langvarandi, óleyst stærðfræðivandamál á borð við tilgátuna um tvöfalda þekju með rásum(opnast í nýjum glugga) og sigrað leiki á borð við Pokémon FireRed. En í ARC-AGI-3, viðmiðunarprófi með tvívíðum þrautaleikjum, fékk GPT‑5.6 Sol aðeins 7,8% og GPT‑5.5 gat varla spilað leikina; það fékk einungis 0,4%.

Voru tvívíðir þrautaleikir óvenjulega erfiðir fyrir líkönin okkar? Eða var eitthvað annað á seyði?

Viðmiðunarpróf mæla sjaldnast gervigreindarlíkön ein og sér. Þau mæla líka síður sýnilegar ákvarðanir um API-stillingar, hönnun beislis og kvaðningar. Í tilviki ARC-AGI-3 komumst við að því að þegar kveikt var á tveimur API-stillingum sem við notum í ChatGPT og Codex—varðveittum rökum og þjöppun—þrefaldaðist skorið og úttakstókum fækkaði sexfalt í opinbera verkefnasafninu.

Með opinbera beislinu fékk GPT‑5.6 Sol 13,3% á opinbera ARC-AGI-3-safninu. Með varðveittum rökum og þjöppun fékk það 38,3%. Stigin mæla hlutfallslega skilvirkni mannlegra aðgerða (RHAE(opnast í nýjum glugga))mælikvarða sem ber frammistöðu líkans saman við viðmið manna. Út frá opinberum leikjaskrám(opnast í nýjum glugga) áætlum við að meðalstig mannlegra prófenda hafi verið 48%. Líkönum er ekki sagt hvernig stig eru reiknuð og þau sjá þau ekki á meðanaðgerðir skila aðeins textalýsingu á hverjum ramma og hvaða borði þau eru á.

ARC-AGI-3

ARC-AGI-3 er viðmiðunarpróf sem mælir hversu vel gervigreindarfulltrúar læra og beita rökum. Fulltrúar kanna ókunnuga tvívíða leiki og átta sig á virkni þeirra án beinna leiðbeininga. Þú getur spilað 25 kynningarleiki á arcprize.org/tasks(opnast í nýjum glugga).

ARC-AGI-3 notar vísvitandi almennt beisli, án verkfæra eða séreiginleika. Rök ARC voru þau að einfalt beisli gerði annmarka líkans sýnilegri og samanburð líkana sanngjarnari. Þróunaraðilar á markaði fínstilla hins vegar beisli fyrir eiginleika og sérkenni hvers líkans.

Í tölvuleikjum hefur GPT‑5.6 Sol sigrað Pokémon FireRed með beisli sem notar aðeins sjón (í streymi frá GPT_Plays_Pokemon(opnast í nýjum glugga)), Slay the Spire með tölvunotkun Codex (í streymi frá EpochAI(opnast í nýjum glugga)) og fyrstu borðin í Baba Is You (eins og Piotr Migdał & Piotr Grabowski(opnast í nýjum glugga) sýndu). Hvað var svona ólíkt við ARC-AGI-3?

GPT-5.6 Sol í Codex lýkur slembivalinni daglegri áskorun í Slay the Spire 2.

Ethan Mollick sýnir(opnast í nýjum glugga) GPT‑5.6 Sol í Codex sigra slembivalda daglega áskorun í Slay the Spire 2, leik sem kom út eftir þekkingarmörk GPT‑5.6 Sol.

Innblásin af greiningu ARC á annmörkum GPT‑5.5(opnast í nýjum glugga) skoðuðum við nokkrar tilraunir GPT‑5.6 Sol. Líkt og ARC virtist okkur líkanið ekki sérlega skarpt. Það dvaldi lengi við hverja aðgerð og átti erfitt með að komast áfram.

Við nánari skoðun komumst við þó að því að ruglingur líkansins stafaði að miklu leyti ekki af líkaninu sjálfu heldur stillingum beislisins.

Fyrst tókum við eftir því að eftir hverja leikjaaðgerð var öllum einkarökum eytt. Því þurfti GPT‑5.6 Sol við hverja aðgerð að átta sig á leiknum upp á nýtt, án þess að geta munað fyrri hugsun sína. Líkanið gat enn séð skrá yfir fyrri leiki og stuttar athugasemdir með þeim, en ekki áætlanirnar, innsýnina eða hugsanirnar að baki.

Næst sáum við að beislið notaði færanlegan styttingarglugga, svo eldri aðgerðir hurfu úr sýn þegar ferillinn lengdist. GPT‑5.6 Sol gat því hvorki munað fyrri hugsun sína né fyrri aðgerðir.

Þessir tveir eiginleikar beislisins—eyðing raka og færanleg stytting—skýrðu saman hvers vegna GPT‑5.6 Sol átti erfitt með að læra með tímanum.

Gerendum gengur best þegar þeir muna hvað þeir hafa gert

Líkönin okkar eru þjálfuð til að hugsa með einkaskilaboðum um rök áður en þau skila svörum eða verkfæraköllum. Þessi einkaskilaboð um hugsun eru varðveitt sem hluti af samtalsferlinum. Ef samtal verður of langt tökum við það saman og höldum áfram.

Skýringarmynd sem sýnir hvernig rök líkans, verkfæraköll, samtalsferill og samhengisþjöppun vinna saman í langvinnu verkefni.

Þannig eru líkönin okkar þjálfuð og þannig eru þau einnig notuð í ChatGPT og Codex. Til að líkja betur eftir framleiðsluumhverfi okkar útfærðum við ARC-AGI-3-beislið með Responses API(opnast í nýjum glugga) okkar. API okkar auðveldar umsýslu samhengis: fyrir GPT‑5.6 varðveitir tilvísun í auðkenni fyrra svars sjálfkrafa rök milli verkfærakalla og umferða.

Þegar rökin voru varðveitt tókum við eftir tvennum stórum breytingum. Í fyrsta lagi eyddi GPT‑5.6 Sol minni tíma í að hugsa fyrir hverja aðgerð því það þurfti ekki lengur að túlka leikinn frá grunni í hverri umferð. Í öðru lagi lærði GPT‑5.6 Sol mun betur með tímanum og beitti samfelldari aðferðum þegar það gat munað fyrri hugsanir sínar.

Næsta framför fólst í að skipta færanlegri styttingu út fyrir þjöppun(opnast í nýjum glugga), aðra stillingu í Responses API.

ARC-AGI-3-beislið bregst við samhengismörkum með færanlegri styttingu. Þegar samhengi samtalsins fer yfir 175.000 stafi er elstu skilaboðunum eytt.

Færanleg stytting hefur tvo ókosti. Í fyrsta lagi glatar líkanið fyrri athugunum og aðgerðum. Í öðru lagi vinnur það stóran hluta verkefnanna með fyllri samhengisglugga, sem getur dregið lítillega úr frammistöðu.

Þegar við virkjuðum þjöppun í ARC-AGI-3 gat GPT‑5.6 Sol betur varðveitt það sem það hafði lært um hvern leik í lengri keyrslum og náði hærra skori með færri úttakstókum.

Til að sýna áhrif varðveittra raka og þjöppunar er hér hreyfimynd af 175K samhengisglugga GPT‑5.6 Sol þegar það leysir röð ARC-AGI-3-þrauta með hvoru beisli.

Miðdálkarnir tveir sýna hvernig beislin nota samhengisglugga líkansins á ólíkan hátt. Með betra minni um fyrri aðgerðir hugsar GPT‑5.6 Sol minna fyrir hverja aðgerð og vinnur mun hraðar. Athugið: útfærsla okkar miðar við 175.000 tóka í stað stafa, en niðurstaðan er mjög svipuð þar sem langstærstur hluti textans er aðgerðareitir sem tókarinn okkar skiptir í tóka í hlutfallinu 1:1.

Saman gera varðveitt rök og þjöppun GPT‑5.6 Sol (Max) kleift að fá um þrefalt hærra skor með sexfalt færri úttakstókum.

Niðurstöður og ráðleggingar

Við vonum að þessar tilraunir minni á að matspróf mæla sjaldnast líkön ein og sér—þau mæla líka safn síður sýnilegra ákvarðana um API-stillingar, hönnun beislis og fyrirmæli. Þetta er ekki í fyrsta sinn sem lágt skor í opinberu viðmiðunarprófi kemur okkur á óvart og við komumst síðan að því að matskeyrslukerfið notaði almennt beisli sem sleppti skilaboðum um rök.

Ef þú ert API-þróunaraðili sem vill hámarka frammistöðu mælum við með sömu stillingum og við notum í eigin vörum:

  • Notaðu Responses API okkar, ekki eldra API fyrir spjalllok
  • Varðveittu rök
  • Notaðu þjöppun

Ef þú berð saman líkön mælum við með matsprófum sem nota stillingarnar hér að ofan, enda endurspegla þær best raunverulega notkun í ChatGPT og Codex.

Við erum ARC þakklát fyrir áralangt, skapandi starf að mati á AGG og fyrir greininguna sem hvatti okkur til að skoða þetta betur.

Ef þú vilt reyna þig gegn líkönum sem standa framarlega skaltu prófa opinberu leikina sjálf(ur) á arcprize.org/tasks(opnast í nýjum glugga).

Höfundur

Ilan Bigio, Ted Sanders