Ruka hadi kwenye maudhui kuu
OpenAI

29 Julai 2026

UtafitiUchapishaji

Jinsi kuwasha mipangilio miwili kulivyozidisha mara tatu alama zetu kwenye ARC-AGI-3

Inapakia…

Video iliyoharakishwa ya GPT‑5.6 Sol ikijaribu kutatua mafumbo katika kipimo cha ARC-AGI-3, kwa mazingira rasmi ya uendeshaji (kushoto) na mazingira yetu ya Responses API (kulia), ambayo huhifadhi uwazaji na kuwezesha ukandamizaji wa muktadha. Kwenye ubao wa wanaoongoza wa mchezo huu(fungua katika dirisha jipya), hakuna muundo wa AI ya kiwango cha juu zaidi unaotatua kiwango chochote zaidi ya cha kwanza. Kwa mazingira yetu ya uendeshaji, GPT‑5.6 Sol hutatua viwango vyote sita.

Tulipoona kwa mara ya kwanza alama za chini za GPT‑5.6 Sol kwenye kipimo cha ARC-AGI-3(fungua katika dirisha jipya), tulishangaa.

GPT‑5.6 Sol imetatua matatizo ya muda mrefu ambayo hayakuwa yametatuliwa katika hisabati, kama vile dhana ya ufunikaji maradufu wa mzunguko(fungua katika dirisha jipya), na kushinda michezo kama Pokémon FireRed. Lakini kwenye ARC-AGI-3, kipimo cha michezo ya mafumbo ya 2D, GPT‑5.6 Sol ilipata 7.8% pekee, huku GPT‑5.5 ikishindwa karibu kabisa kucheza michezo hiyo na kupata alama duni ya 0.4%.

Je, michezo ya mafumbo ya 2D ilikuwa migumu isivyo kawaida kwa miundo yetu? Au kulikuwa na jambo jingine?

Ni nadra kwa vipimo kupima miundo ya AI pekee. Pia hupima maamuzi yasiyoonekana sana kuhusu mipangilio ya API, usanifu wa mazingira ya uendeshaji na uandishi wa maelekezo. Kwa ARC-AGI-3, tuligundua kuwa kuwasha mipangilio miwili ya API tunayotumia katika ChatGPT na Codex—uwazaji uliohifadhiwa na ukandamizaji wa muktadha—kulizidisha alama mara tatu na kupunguza tokeni za matokeo kwa mara 6 kwenye seti ya kazi za umma.

Kwa mazingira rasmi ya uendeshaji, GPT‑5.6 Sol ilipata 13.3% kwenye seti ya umma ya ARC-AGI-3. Kwa uwazaji uliohifadhiwa na ukandamizaji wa muktadha, ilipata 38.3%. Alama hupima Ufanisi Linganishi wa Vitendo vya Binadamu (RHAE(fungua katika dirisha jipya))kipimo kinacholinganisha utendaji wa muundo na kiwango cha msingi cha binadamu. Kulingana na rekodi rasmi za uchezaji(fungua katika dirisha jipya), tunakadiria kuwa wastani wa alama za wajaribu binadamu ulikuwa 48%. Miundo haiambiwi jinsi itakavyopimwa na haiwezi kuona alama zake wakati wotevitendo hurudisha tu maelezo ya maandishi ya kila fremu na kiwango ilichofikia.

ARC-AGI-3

ARC-AGI-3 ni kipimo kilichoundwa kupima jinsi ajenti za AI zinavyojifunza na kufanya uwazaji. Ajenti huchunguza michezo isiyofahamika ya 2D na kubaini jinsi inavyofanya kazi bila maelekezo ya moja kwa moja. Unaweza kucheza michezo 25 ya majaribio kwenye arcprize.org/tasks(fungua katika dirisha jipya).

ARC-AGI-3 hutumia kwa makusudi mazingira ya jumla ya uendeshaji, bila zana wala vipengele maalum. Uwazaji wa ARC ulikuwa kwamba mazingira rahisi ya uendeshaji huonyesha upungufu wa muundo wazi zaidi na kufanya ulinganishaji wa miundo uwe wa haki zaidi. Kwa upande mwingine, wasanidi wa kibiashara huboresha mazingira ya uendeshaji kulingana na vipengele na upekee wa kila muundo.

Katika michezo, GPT‑5.6 Sol imeshinda Pokémon FireRed kwa mazingira ya uendeshaji yanayotumia picha pekee (kama ilivyotiririshwa na GPT_Plays_Pokemon(fungua katika dirisha jipya)), Slay the Spire kwa matumizi ya kompyuta kupitia Codex (kama ilivyotiririshwa na EpochAI(fungua katika dirisha jipya)), na hatua za kwanza za Baba Is You (kama ilivyoshirikiwa na Piotr Migdał & Piotr Grabowski(fungua katika dirisha jipya)). Ni nini kilichokuwa tofauti sana kuhusu ARC-AGI-3?

GPT-5.6 Sol katika Codex ikikamilisha changamoto ya kila siku iliyochaguliwa nasibu katika Slay the Spire 2.

Ethan Mollick anaonyesha(fungua katika dirisha jipya) GPT‑5.6 Sol katika Codex ikishinda changamoto ya kila siku iliyochaguliwa nasibu katika Slay the Spire 2, mchezo uliotolewa baada ya kikomo cha maarifa ya GPT‑5.6 Sol.

Kwa kuhamasishwa na uchanganuzi wa ARC kuhusu upungufu wa GPT‑5.5(fungua katika dirisha jipya), tulichunguza baadhi ya majaribio ya GPT‑5.6 Sol. Kama ARC, tuliona kwamba muundo haukuonekana kuwa na uwezo mkubwa. Ulitumia muda mrefu katika kila kitendo na ukapata shida kusonga mbele.

Lakini tulipochunguza kwa kina, tuligundua kuwa sehemu kubwa ya mkanganyiko wa muundo haikutokana na muundo wenyewe, bali na mipangilio ya mazingira ya uendeshaji.

Kwanza, tuligundua kuwa baada ya kila kitendo cha mchezo, uwazaji wote wa faragha ulifutwa. Hivyo, katika kila kitendo GPT‑5.6 Sol iliombwa kuuelewa mchezo upya, bila uwezo wa kukumbuka mawazo yake ya awali. Muundo bado uliweza kuona rekodi ya hatua za awali na maelezo mafupi yaliyoandamana nazo, lakini haukuweza kuona mipango, ufahamu au mawazo yaliyosababisha hatua hizo.

Pili, tuliona kuwa mazingira ya uendeshaji yalitumia dirisha la upunguzaji unaosonga, hivyo vitendo vya zamani viliacha kuonekana kadiri historia ilivyoongezeka. Kwa hiyo, GPT‑5.6 Sol haikuwa tu haiwezi kukumbuka mawazo yake ya awali, bali pia ilikuwa ikipoteza kumbukumbu ya vitendo vyake vya awali.

Kwa pamoja, vipengele hivi viwili vya mazingira ya uendeshaji—kufuta uwazaji na upunguzaji unaosonga—vilisaidia kueleza kwa nini GPT‑5.6 Sol ilishindwa kujifunza kadiri muda ulivyopita.

Ajenti hufanya vizuri zaidi zinapokumbuka zilichofanya

Miundo yetu imefunzwa kufikiri kwa ujumbe wa faragha wa uwazaji kabla ya kutoa majibu au miito ya zana. Ujumbe huu wa faragha wa mawazo huhifadhiwa kama sehemu ya historia ya mazungumzo. Mazungumzo yakirefuka sana, tunayafupisha na kuendelea.

Mchoro unaoonyesha jinsi uwazaji wa muundo, miito ya zana, historia ya mazungumzo na ukandamizaji wa muktadha hufanya kazi pamoja katika kazi ya muda mrefu.

Hivi ndivyo miundo yetu inavyofunzwa na pia kutumiwa katika ChatGPT na Codex. Ili kuendana vyema na mfumo wetu wa uzalishaji, tulitekeleza mazingira ya uendeshaji ya ARC-AGI-3 kwa kutumia Responses API(fungua katika dirisha jipya) yetu. API yetu hurahisisha kudhibiti muktadha: kwa GPT‑5.6, kupitisha kitambulisho cha jibu la awali huhifadhi kiotomatiki uwazaji katika miito ya zana na zamu mbalimbali.

Uwazaji ulipohifadhiwa, tuliona mabadiliko mawili makubwa. Kwanza, GPT‑5.6 Sol ilitumia muda mchache kufikiri kabla ya kila kitendo kwa sababu haikuhitaji tena kutafsiri mchezo upya katika kila zamu. Pili, ilipoweza kukumbuka mawazo yake ya awali, GPT‑5.6 Sol ilijifunza vizuri zaidi kadiri muda ulivyopita na kutumia mikakati thabiti.

Uboreshaji uliofuata ulitokana na kubadilisha upunguzaji unaosonga na kutumia ukandamizaji wa muktadha(fungua katika dirisha jipya), mpangilio mwingine katika Responses API.

Mazingira ya uendeshaji ya ARC-AGI-3 hushughulikia vikomo vya muktadha kwa upunguzaji unaosonga. Muktadha wa mazungumzo unapozidi herufi 175,000, ujumbe wa zamani zaidi hufutwa.

Upunguzaji unaosonga una dosari mbili. Kwanza, muundo hupoteza uchunguzi na vitendo vya awali. Pili, hutumia sehemu kubwa ya kazi ukiwa na dirisha la muktadha lililojaa zaidi, jambo linaloweza kupunguza utendaji kidogo.

Tulipowezesha ukandamizaji wa muktadha kwenye ARC-AGI-3, GPT‑5.6 Sol iliweza kuhifadhi vizuri zaidi ilichojifunza kuhusu kila mchezo katika vipindi virefu, na kupata alama ya juu kwa tokeni chache za matokeo.

Ili kuonyesha athari ya kuhifadhi uwazaji na kuwezesha ukandamizaji wa muktadha, huu ni uhuishaji unaoonyesha dirisha la muktadha la 175K la GPT‑5.6 Sol inapovitatua mfululizo wa mafumbo ya ARC-AGI-3 kwa kila mazingira ya uendeshaji.

Safu mbili za katikati zinaonyesha jinsi dirisha la muktadha la muundo linavyotumiwa kwa njia tofauti na kila mazingira ya uendeshaji. Kwa kumbukumbu bora ya yaliyopita, GPT‑5.6 Sol hufikiri kidogo kwa kila kitendo na kusonga mbele kwa kasi zaidi. Kumbuka: utekelezaji wetu hutumia kikomo cha tokeni 175,000 badala ya herufi, lakini matokeo yake yanafanana sana kwa sababu sehemu kubwa ya maandishi ni gridi za vitendo ambazo kigawanya-tokeni chetu hugawanya kwa uwiano wa 1:1.

Kwa pamoja, kuhifadhi uwazaji na ukandamizaji wa muktadha huwezesha GPT‑5.6 Sol (Max) kupata takribani mara 3 ya alama kwa tokeni za matokeo zilizopungua mara 6.

Hitimisho na mapendekezo

Tunatumaini majaribio haya yatakumbusha kwamba tathmini ni nadra kupima miundo pekee—pia hupima mkusanyiko wa maamuzi yasiyoonekana sana kuhusu mipangilio ya API, usanifu wa mazingira ya uendeshaji na uandishi wa maelekezo. Hii si mara ya kwanza kushangazwa na alama za chini kwenye kipimo cha umma, kisha kugundua kuwa mfumo wa kuendesha tathmini ulitumia mazingira ya jumla ya uendeshaji yaliyofuta ujumbe wa uwazaji.

Ikiwa wewe ni msanidi wa API anayetaka kuongeza utendaji, tunapendekeza utumie mipangilio ileile tunayotumia katika bidhaa zetu:

  • Tumia Responses API yetu, si Chat Completions API yetu ya zamani
  • Hifadhi uwazaji
  • Tumia ukandamizaji wa muktadha

Na ikiwa unalinganisha miundo, tunapendekeza utegemee tathmini zinazotumia mipangilio iliyo hapo juu, ambayo inalingana vyema zaidi na matumizi halisi katika ChatGPT na Codex.

Tunaishukuru ARC kwa miaka yake ya ubunifu katika kutathmini AGI, na kwa uchanganuzi wake uliotuhamasisha kuchunguza suala hili kwa kina zaidi.

Ukitaka kupima uwezo wako dhidi ya miundo ya AI ya kiwango cha juu zaidi, jaribu mwenyewe michezo ya umma kwenye arcprize.org/tasks(fungua katika dirisha jipya).

Mwandishi

Ilan Bigio, Ted Sanders