Video e përshpejtuar e GPT‑5.6 Sol teksa përpiqet të zgjidhë enigmat e standardit ARC-AGI-3, me strukturën zyrtare (majtas) dhe strukturën tonë të API-së Responses (djathtas), e cila ruan arsyetimin dhe mundëson kompaktimin. Në renditjen për këtë lojë(hapet në një dritare të re), asnjë model avangardë nuk zgjidh ndonjë nivel pas nivelit të parë. Me strukturën tonë, GPT‑5.6 Sol i zgjidh të gjashtë.
Kur pamë për herë të parë rezultatet e ulëta të GPT‑5.6 Sol në standardin ARC-AGI-3(hapet në një dritare të re), mbetëm të habitur.
GPT‑5.6 Sol ka zgjidhur probleme të hapura prej kohësh në matematikë, si hamendësimi i mbulimit të dyfishtë të cikleve(hapet në një dritare të re), dhe ka mposhtur lojëra si Pokémon FireRed. Por në ARC-AGI-3, një referencë për lojërat 2D me enigma, GPT‑5.6 Sol shënoi vetëm 7,8%, ndërsa GPT‑5.5 mezi arrinte t'i luante, me një shënim të dobët prej 0,4%.
A ishin lojërat 2D me enigma jashtëzakonisht të vështira për modelet tona? Apo po ndodhte diçka tjetër?
Standardet rrallë i matin modelet e IA-së në izolim. Ato matin edhe zgjedhje më pak të dukshme për cilësimet e API-së, projektimin e strukturës dhe formulimin e udhëzimeve. Në rastin e ARC-AGI-3, zbuluam se aktivizimi i dy cilësimeve të API-së që përdorim në ChatGPT dhe Codex—ruajtja e arsyetimit dhe kompaktimi—i trefishoi rezultatet dhe i uli 6 herë tokenët e daljes në grupin publik të detyrave.
Me strukturën zyrtare, GPT‑5.6 Sol shënoi 13,3% në grupin publik ARC-AGI-3. Me ruajtjen e arsyetimit dhe kompaktimit, shënoi 38,3%. Rezultatet matin Efikasitetin Relativ të Veprimeve Njerëzore (RHAE(hapet në një dritare të re))—një metrikë që krahason performancën e modelit me një pikë reference njerëzore. Bazuar në regjistrat zyrtarë të lojës(hapet në një dritare të re), vlerësojmë se testuesi mesatar njerëzor shënoi 48%. Modeleve nuk u tregohet se si do të vlerësohen dhe ato nuk mund ta shohin rezultatin gjatë të gjithë procesit—veprimet kthejnë vetëm një paraqitje tekstuale të çdo kuadri dhe nivelin ku ndodhen.
ARC-AGI-3 është një standard i krijuar për të matur sa mirë mësojnë dhe arsyetojnë agjentët e IA-së. Agjentët eksplorojnë lojëra të panjohura 2D dhe kuptojnë si funksionojnë pa udhëzime të qarta. Mund të luash 25 lojëra demonstruese në arcprize.org/tasks(hapet në një dritare të re).
ARC-AGI-3 përdor qëllimisht një strukturë të përgjithshme, pa mjete ose veçori të posaçme. Arsyetimi i ARC-së ishte se një strukturë e thjeshtë i bën më të dukshme mangësitë e modelit dhe më të drejta krahasimet ndërmjet modeleve. Ndërsa zhvilluesit komercialë i optimizojnë strukturat sipas veçorive dhe veçantive të çdo modeli.
Në lojëra, GPT‑5.6 Sol ka mposhtur Pokémon FireRed me një strukturë që përdor vetëm shikimin (transmetuar nga GPT_Plays_Pokemon(hapet në një dritare të re)), Slay the Spire duke përdorur kompjuterin përmes Codex (transmetuar nga EpochAI(hapet në një dritare të re)) dhe fazat e para të Baba Is You (siç u publikua nga Piotr Migdał & Piotr Grabowski(hapet në një dritare të re)). Çfarë kishte kaq ndryshe ARC-AGI-3?

Ethan Mollick tregon(hapet në një dritare të re) se si GPT‑5.6 Sol në Codex mposht një sfidë të rastësishme ditore në Slay the Spire 2, një lojë e publikuar pas kufirit kohor të njohurive të GPT‑5.6 Sol.
Të frymëzuar nga analiza e ARC-së për mangësitë e GPT‑5.5(hapet në një dritare të re), shqyrtuam disa nga përpjekjet e GPT‑5.6 Sol. Ashtu si ARC, pamë se modeli nuk dukej fort i zgjuar. Ai ndalej gjatë te çdo veprim dhe e kishte të vështirë të përparonte.
Por, kur e shqyrtuam më thellë, zbuluam se pjesa më e madhe e hutimit nuk ishte e qenësishme për vetë modelin, por vinte nga cilësimet e strukturës.
Së pari, vumë re se pas çdo veprimi në lojë, i gjithë arsyetimi privat fshihej. Kjo do të thoshte se, me çdo veprim, GPT‑5.6 Sol duhej ta kuptonte lojën nga e para, pa mundur të kujtonte mendimet e mëparshme. Modeli mund të shihte ende regjistrin e lëvizjeve të mëparshme dhe shënimet e shkurtra shoqëruese, por jo planet, njohuritë apo mendimet që kishin çuar tek ato.
Së dyti, pamë se struktura e testimit përdorte një dritare rrëshqitëse shkurtimi, duke bërë që veprimet më të vjetra të bëheshin të padukshme ndërsa historiku zgjerohej. Pra, GPT‑5.6 Sol jo vetëm që nuk mund t'i kujtonte mendimet e veta të mëparshme, por po humbiste edhe kujtesën e veprimeve të mëparshme.
Së bashku, këto dy veçori të strukturës—fshirja e arsyetimit dhe shkurtimi rrëshqitës—ndihmuan të shpjegohej pse GPT‑5.6 Sol e kishte të vështirë të mësonte me kalimin e kohës.
Modelet tona trajnohen të mendojnë përmes mesazheve private të arsyetimit para se të japin përgjigje ose të thërrasin mjete. Këto mesazhe private të mendimit ruhen si pjesë e historikut të bisedës. Nëse një bisedë zgjatet tepër, e përmbledhim dhe vazhdojmë.
Kështu trajnohen modelet tona dhe gjithashtu vihen në përdorim në ChatGPT dhe Codex. Për t'iu përshtatur më mirë konfigurimit tonë në prodhim, e zbatuam strukturën ARC-AGI-3 me API-në Responses(hapet në një dritare të re). API-ja jonë e lehtëson menaxhimin e kontekstit: për GPT‑5.6, kalimi i ID-së së përgjigjes së mëparshme e ruan automatikisht arsyetimin ndërmjet thirrjeve të mjeteve dhe radhëve të bisedës.
Me ruajtjen e arsyetimit, vumë re dy ndryshime të mëdha. Së pari, GPT‑5.6 Sol shpenzonte më pak kohë duke menduar para çdo veprimi, sepse nuk duhej më ta interpretonte lojën nga e para në çdo radhë. Së dyti, kur mund të kujtonte mendimet e mëparshme, GPT‑5.6 Sol mësonte shumë më mirë me kalimin e kohës dhe përdorte strategji koherente.
Përmirësimi tjetër erdhi nga zëvendësimi i shkurtimit rrëshqitës me kompaktimin(hapet në një dritare të re), një tjetër cilësim i API-së Responses.
Struktura ARC-AGI-3 i trajton kufijtë e kontekstit me shkurtim rrëshqitës. Kur konteksti i bisedës tejkalon 175 000 karaktere, mesazhet më të vjetra fshihen.
Shkurtimi rrëshqitës ka dy mangësi. Së pari, modeli humbet vëzhgimet dhe veprimet e mëparshme. Së dyti, ai e kryen pjesën më të madhe të detyrave me një dritare konteksti më të mbushur, çka mund ta dëmtojë pak performancën.
Kur aktivizuam kompaktimin në ARC-AGI-3, GPT‑5.6 Sol arriti të ruante më mirë njohuritë e fituara për çdo lojë gjatë ekzekutimeve më të gjata dhe shënoi rezultat më të lartë me më pak tokenë daljeje.
Për të ilustruar efektin e ruajtjes së arsyetimit dhe aktivizimit të kompaktimit, ja një animacion që tregon dritaren e kontekstit prej 175 mijë tokenësh të GPT‑5.6 Sol, teksa zgjidh një varg enigmash ARC-AGI-3 me secilën strukturë.
Dy kolonat qendrore tregojnë se si secila strukturë e përdor ndryshe dritaren e kontekstit të modelit. Duke kujtuar më mirë të kaluarën, GPT‑5.6 Sol mendon më pak për çdo veprim dhe përparon shumë më shpejt. Shënim: zbatimi ynë përdor një kufi prej 175 000 tokenësh në vend të karaktereve, por rezultati është mjaft i ngjashëm, pasi pjesa dërrmuese e tekstit përbëhet nga rrjeta veprimesh, të cilat tokenizuesi ynë i tokenizon në raportin 1:1.
Së bashku, ruajtja e arsyetimit dhe kompaktimi i mundësojnë GPT‑5.6 Sol (Max) të arrijë rezultat rreth 3 herë më të lartë me 6 herë më pak tokenë daljeje.
Shpresojmë që këto eksperimente të na kujtojnë se vlerësimet rrallë i matin modelet në izolim—ato matin edhe një sërë zgjedhjesh më pak të dukshme për cilësimet e API-së, projektimin e strukturës dhe formulimin e udhëzimeve. Nuk është hera e parë që habitemi nga rezultatet e ulëta në një standard publik dhe më pas zbulojmë se sistemi i vlerësimit përdorte një strukturë të përgjithshme që i hiqte mesazhet e arsyetimit.
Nëse je zhvillues API-je dhe synon të maksimizosh performancën, rekomandojmë të përdorësh të njëjtat cilësime që zbatojmë në produktet tona:
- Përdor API-në Responses, jo API-në tonë të vjetër të përfundimeve të bisedës
- Ruaj arsyetimin
- Përdor kompaktimin
Dhe nëse po krahason modele, rekomandojmë të mbështetesh në vlerësime që përdorin cilësimet e mësipërme, të cilat përputhen më mirë me përdorimin real në ChatGPT dhe Codex.
I jemi mirënjohës ARC-së për vitet e punës krijuese në vlerësimin e AGI-së dhe për analizën që na frymëzoi ta shqyrtonim më nga afër këtë çështje.
Nëse dëshiron të vësh në provë aftësitë e tua përballë modeleve avangardë, provoji vetë lojërat publike në arcprize.org/tasks(hapet në një dritare të re).


