Aqbeż għall-kontenut prinċipali
OpenAI

29 ta’ Lulju 2026

RiċerkaPubblikazzjoni

Kif l-attivazzjoni ta’ żewġ settings ittriplikat il-punteġġi tagħna fil-benchmark ARC-AGI-3

Qed jillowdja…

Vidjo aċċellerat ta’ GPT‑5.6 Sol li qed jipprova jsolvi puzzles fil-benchmark ARC-AGI-3, bil-harness uffiċjali (fuq ix-xellug) u l-harness tagħna tal-Responses API (fuq il-lemin), li jżomm ir-raġunament u jippermetti l-kompattazzjoni. Fil-klassifika għal din il-logħba(jinfetaħ f’tieqa ġdida), l-ebda mudell frontier ma jsolvi xi livell lil hinn mill-ewwel wieħed. Bil-harness tagħna, GPT‑5.6 Sol isolvi s-sitta kollha.

Meta rajna għall-ewwel darba l-punteġġi baxxi ta’ GPT‑5.6 Sol fil-benchmark ARC-AGI-3(jinfetaħ f’tieqa ġdida), ma stajniex nifhmu għaliex.

GPT‑5.6 Sol solva problemi tal-matematika li kienu ilhom żmien twil mhux solvuti, bħall-konġettura tal-kopertura doppja taċ-ċiklu(jinfetaħ f’tieqa ġdida), u rnexxielu jtemm logħob bħal Pokémon FireRed. Iżda f’ARC-AGI-3, benchmark ta’ logħob 2D ta’ taħbil il-moħħ, GPT‑5.6 Sol kiseb punteġġ ta’ 7.8% biss, filwaqt li GPT‑5.5 bilkemm seta’ jilgħab il-logħob u kiseb biss 0.4%.

Il-logħob 2D ta’ taħbil il-moħħ kien diffiċli b’mod mhux tas-soltu għall-mudelli tagħna? Jew kien hemm xi ħaġa oħra għaddejja?

Il-benchmarks rarament ikejlu l-mudelli tal-IA waħedhom. Ikejlu wkoll għażliet inqas viżibbli dwar il-konfigurazzjoni tal-API, id-disinn tal-harness u t-tfassil tal-prompts. Fil-każ ta’ ARC-AGI-3, skoprejna li l-attivazzjoni ta’ żewġ konfigurazzjonijiet tal-API li nużaw f’ChatGPT u Codex—iż-żamma tar-raġunament u l-kompattazzjoni—ittriplikat il-punteġġi u naqqset b’fattur ta’ sitta t-tokens tal-output fis-sett pubbliku ta’ kompiti.

Bil-harness uffiċjali, GPT‑5.6 Sol kiseb punteġġ ta’ 13.3% fuq is-sett pubbliku ARC-AGI-3. B’raġunament miżmum u kompattazzjoni, kiseb 38.3%. Il-punteġġi jkejlu l-Effiċjenza Relattiva tal-Azzjoni Umana (RHAE(jinfetaħ f’tieqa ġdida))metrika li tqabbel il-prestazzjoni tal-mudell ma’ linja bażi umana. Abbażi tal- logs uffiċjali tal-logħob(jinfetaħ f’tieqa ġdida), nistmaw li t-tester uman medju kiseb punteġġ ta’ 48%. Il-mudelli ma jiġux infurmati kif se jingħatalhom il-punteġġ, u ma jistgħux jaraw il-punteġġ tagħhom matul il-proċess kollul-azzjonijiet jirritornaw biss rappreżentazzjoni testwali ta’ kull frejm u f’liema livell jinsabu.

ARC-AGI-3

ARC-AGI-3 huwa benchmark imfassal biex ikejjel kemm l-aġenti tal-IA jitgħallmu u jirraġunaw tajjeb. Aġenti jesploraw logħob 2D mhux familjari u jiddeduċu kif jaħdmu mingħajr struzzjonijiet espliċiti. Tista’ tilgħab 25 logħba demo fuq arcprize.org/tasks(jinfetaħ f’tieqa ġdida).

ARC-AGI-3 juża harness ġeneriku b’mod apposta, mingħajr għodod jew karatteristiċi speċjali. Ir-raġunament ta’ ARC kien li harness sempliċi jagħti viżibilità akbar lin-nuqqasijiet tal-mudell u jagħmel il-paraguni bejn il-mudelli aktar ġusti. L-iżviluppaturi kummerċjali, għall-kuntrarju, jottimizzaw il-harness għall-karatteristiċi u l-partikolaritajiet ta’ kull mudell.

Fil-qasam tal-logħob, GPT‑5.6 Sol għeleb Pokémon FireRed b’harness tal-viżjoni biss (kif imxandar fi streaming minn GPT_Plays_Pokemon(jinfetaħ f’tieqa ġdida)), Slay the Spire bl-użu tal-kompjuter ta’ Codex (kif imxandar fi streaming minn EpochAI(jinfetaħ f’tieqa ġdida)), u l-ewwel stadji ta’ Baba Is You (kif inqassmu minn Piotr Migdał & Piotr Grabowski(jinfetaħ f’tieqa ġdida)). X’kien daqshekk differenti dwar ARC-AGI-3?

GPT-5.6 Sol f’Codex qed itemm sfida ta’ kuljum magħżula b’mod każwali f’Slay the Spire 2.

Ethan Mollick juri(jinfetaħ f’tieqa ġdida) GPT‑5.6 Sol fil-Codex jegħleb sfida ta’ kuljum bla ordni fi Slay the Spire 2, logħba li ġiet rilaxxata wara d-data limitu tal-għarfien ta’ GPT‑5.6 Sol.

Ispirati minn l-analiżi ta’ ARC dwar in-nuqqasijiet ta’ GPT‑5.5(jinfetaħ f’tieqa ġdida), eżaminajna wħud mill-GPT‑5.6 It-tentattivi ta’ Sol. Bħal ARC, rajna li l-mudell ma deherx wisq intelliġenti. Dam ħafna ħin fuq kull azzjoni u sabha diffiċli biex jagħmel progress.

Iżda hekk kif ħarisna aktar fil-fond, skoprejna li ħafna mill-konfużjoni tal-mudell ma kinitx inerenti għall-mudell innifsu, iżda kienet minħabba l-konfigurazzjonijiet fil-harness.

L-ewwel, innutajna li wara kull azzjoni tal-logħba, ir-raġunament privat kollu kien jiġi skartat. Dan kien ifisser li ma’ kull azzjoni, GPT‑5.6 Sol kien jintalab jifhem il-logħba mill-ġdid, mingħajr ma jkun jista’ jiftakar il-ħsieb preċedenti tiegħu. Il-mudell xorta seta’ jara rekord ta’ mossi passati u noti qosra li kienu jakkumpanjawhom, iżda ma setax jara l-pjanijiet, l-għarfien, jew il-ħsibijiet li wasslu għalihom.

It-tieni, rajna li harness kien juża tieqa li tgħaddi kontinwament, u b’hekk azzjonijiet eqdem bdew ma jidhrux hekk kif l-istorja kibret. Għalhekk, GPT‑5.6 Sol mhux biss ma kienx kapaċi jiftakar fil-ħsieb tiegħu ta’ qabel, iżda kien qed jitlef il-memorja tal-azzjonijiet tiegħu ta’ qabel ukoll.

Flimkien, dawn iż-żewġ karatteristiċi tal-harness—ir-rimi tar-raġunament u t-tronkament kontinwu—għenu biex jispjegaw għaliex GPT‑5.6 Sol kien qed isibha diffiċli jitgħallem maż-żmien.

L-aġenti jaħdmu l-aħjar meta jiftakru dak li jkunu għamlu

Il-mudelli tagħna huma mħarrġa biex jaħsbu permezz ta’ messaġġi privati ta’ raġunament qabel ma joħorġu tweġibiet jew sejħiet ta’ għodod. Dawn il-messaġġi privati tal-ħsieb jinżammu bħala parti mill-istorja tal-konverżazzjoni. Jekk konverżazzjoni ssir twila wisq, nissummarjawha u nkomplu.

Dijagramma li turi kif ir-raġunament tal-mudell, is-sejħiet lill-għodod, l-istorja tal-konverżazzjoni, u l-kompattazzjoni tal-kuntest jaħdmu flimkien matul kompitu fit-tul.

Dan huwa kif il-mudelli tagħna jiġu mħarrġa u kif jiġu implimentati f’ChatGPT u Codex. Biex nallinjaw aħjar mal-konfigurazzjoni tal-produzzjoni tagħna, implimentajna l-harness ARC-AGI-3 bl-użu tal- Responses API(jinfetaħ f’tieqa ġdida) tagħna. L-API tagħna tagħmilha faċli biex timmaniġġja l-kuntest: għal GPT‑5.6, Meta tgħaddi l-ID tat-tweġiba preċedenti, ir-raġunament jinżamm awtomatikament bejn sejħiet għall-għodod u dawriet.

Bir-raġunament miżmum, innutajna żewġ bidliet kbar. L-ewwel, GPT‑5.6 Sol qatta’ inqas ħin jaħseb qabel kull azzjoni, għax ma kellux għalfejn jibqa’ jinterpreta l-logħba mill-bidu nett f’kull dawra. It-tieni, meta kien kapaċi jiftakar il-ħsibijiet preċedenti tiegħu, GPT‑5.6 Sol kien ħafna aħjar biex jitgħallem maż-żmien u juża strateġiji koerenti.

It-titjib li jmiss ġie mill-bidla tat-trunkazzjoni kontinwa għal kompattazzjoni(jinfetaħ f’tieqa ġdida), issettjar ieħor fir-Responses API.

Il-harness ARC-AGI-3 jimmaniġġja l-limiti tal-kuntest billi juża tronkament progressiv. Meta l-kuntest tal-konverżazzjoni jaqbeż il-175,000 karattru, l-eqdem messaġġi jitwarrbu.

It-tronkazzjoni mobbli għandha żewġ żvantaġġi. L-ewwel, il-mudell jitlef osservazzjonijiet u azzjonijiet preċedenti. It-tieni, iqatta’ ħafna mill-kompiti jaħdem b’tieqa tal-kuntest aktar mimlija, li tista’ tnaqqas xi ftit il-prestazzjoni.

Meta attivajna l-kompattazzjoni fuq ARC-AGI-3, GPT‑5.6 Sol kien kapaċi jippreserva aħjar dak li kien tgħallem dwar kull logħba matul eżekuzzjonijiet itwal, u kiseb punteġġ ogħla b’inqas token tal-output.

Biex jintwera l-effett taż-żamma tar-raġunament u l-attivazzjoni tal-kompattazzjoni, hawn animazzjoni li turi t-tieqa tal-kuntest ta’ 175,000 ta’ GPT‑5.6 Sol waqt li ssolvi serje ta’ puzzles ARC-AGI-3 b’kull harness.

Iż-żewġ kolonni ċentrali juru kif it-tieqa tal-kuntest tal-mudell tintuża b’mod differenti minn kull harness. B’memorja aħjar tal-passat tiegħu, GPT‑5.6 Sol jaħseb inqas għal kull azzjoni u jimxi ’l quddiem ħafna aktar malajr. Nota: l-implimentazzjoni tagħna tuża limitu ta’ 175,000 token minflok karattri, iżda dan jispiċċa jkun pjuttost simili, peress li l-maġġoranza kbira tat-test hija grilji ta’ azzjoni li jiġu tokenizzati bi proporzjon ta’ 1:1 mit-tokenizzatur tagħna.

Flimkien, iż-żamma tar-raġunament u l-kompattazzjoni jippermettu lil GPT‑5.6 Sol (max) jikseb madwar 3x il-punteġġ b’6x inqas tokens tal-output.

Konklużjoni u rakkomandazzjonijiet

Nittamaw li dawn l-esperimenti jservu bħala tfakkira li l-evalwazzjonijiet spiss ma jkejlux il-mudelli b’mod iżolat—jekejlu wkoll serje ta’ għażliet inqas viżibbli dwar is-settings tal-API, id-disinn tal-harness, u l-prompting. Din mhijiex l-ewwel darba li ġejna sorpriżi b’punteġġi baxxi fuq benchmark pubbliku u mbagħad skoprejna li l-magna tal-evalwazzjoni kienet qed tuża harness ġeneriku li ma kinitx tinkludi messaġġi tar-raġunament.

Jekk int żviluppatur tal-API li qed tipprova timmassimizza l-prestazzjoni, nirrakkomandaw li tuża l-istess issettjar li nużaw fil-prodotti tagħna stess:

  • Uża l-API tar-Risposti tagħna, mhux l-API preċedenti tagħna tat-tlestija taċ-chats
  • Żomm ir-raġunament
  • Uża l-kompattazzjoni

U jekk qed tqabbel mudelli, nirrakkomandaw li tistrieħ fuq evalwazzjonijiet li jużaw l-issettjar ta’ hawn fuq, li jikkorrispondi l-aħjar mal-użu fid-dinja reali f’ChatGPT u Codex.

Nirringrazzjaw lil ARC għas-snin ta’ xogħol kreattiv tagħhom fuq l-evalwazzjoni tal-AGI, u għall-analiżi tagħhom li wassalna biex nagħtu ħarsa aktar mill-qrib hawnhekk.

Jekk trid tittestja l-ħila tiegħek kontra l-mudelli l-aktar avvanzati, ipprova l-logħob pubbliku int stess fuq arcprize.org/tasks(jinfetaħ f’tieqa ġdida).

Awtur

Ilan Bigio u Ted Sanders