GPT‑5.6 Sol ARC-AGI-3 жишиг сорилын эвлүүлдэг тоглоомуудыг албан ёсны хамгаалалт (зүүн) болон сэтгэн бодолтыг хадгалж, шахалт идэвхжүүлдэг манай Responses API хамгаалалтаар (баруун) шийдэхийг оролдож буйг хурдасган харуулсан видео. Энэ тоглоомын(шинэ цонхонд нээгдэнэ) тэргүүлэгчдийн жагсаалтад хил хязгаарын нэг ч загвар эхний түвшнээс цааш гарч чадаагүй. Харин манай хамгаалалтаар GPT‑5.6 Sol бүх зургаан түвшнийг шийдсэн.
GPT‑5.6 Sol-ын ARC-AGI-3(шинэ цонхонд нээгдэнэ) жишиг сорилын оноо анх доогуур гарсныг хараад бид гайхсан.
GPT‑5.6 Sol нь математикийн олон жил шийдэгдээгүй циклийн давхар бүрхүүлийн таамаглал(шинэ цонхонд нээгдэнэ) зэрэг бодлогыг шийдэж, Pokémon FireRed зэрэг тоглоомыг ялсан. Гэвч 2D эвлүүлдэг тоглоомуудаас бүрдэх ARC-AGI-3 жишиг сорилд GPT‑5.6 Sol ердөө 7.8% авсан бол GPT‑5.5 бараг тоглож чадахгүй, дөнгөж 0.4% авсан.
2D эвлүүлдэг тоглоомууд манай загваруудад ер бусын хэцүү байсан уу? Эсвэл өөр шалтгаан байв уу?
Жишиг сорилууд AI загварыг дангаар нь хэмжих нь ховор. Тэд API тохиргоо, хамгаалалтын загварчлал, промпттой холбоотой төдийлөн ил харагддаггүй сонголтуудыг ч хэмждэг. ARC-AGI-3-ын хувьд ChatGPT болон Codex-д ашигладаг сэтгэн бодолтыг хадгалах, шахалт гэсэн хоёр API тохиргоог идэвхжүүлэхэд нийтэд нээлттэй даалгаврын багцын оноо гурав дахин өсөж, гаралтын токены тоо 6 дахин буурсныг бид тогтоосон.
Албан ёсны хамгаалалтаар GPT‑5.6 Sol нь ARC-AGI-3-ын нийтэд нээлттэй багцад 13.3%-ийн оноо авсан. Сэтгэн бодолтыг хадгалж, шахалт ашиглахад 38.3% авсан. Оноог загварын гүйцэтгэлийг хүний суурь түвшинтэй харьцуулдаг Хүний үйлдлийн харьцангуй үр ашиг (RHAE(шинэ цонхонд нээгдэнэ))—хэмжүүрээр тооцдог. Тоглолтын албан ёсны бүртгэлүүдэд(шинэ цонхонд нээгдэнэ) үндэслэн хүний дундаж оноог 48% гэж тооцоолсон. Загваруудад оноог хэрхэн тооцохыг хэлдэггүй бөгөөд явцын дундах оноогоо харах боломжгүй—үйлдэл бүр зөвхөн тухайн кадрын текстэн дүрслэл болон тоглож буй түвшнийг буцаана.
ARC-AGI-3 нь AI агентууд хэр сайн суралцаж, сэтгэн бодож байгааг хэмжихэд зориулсан жишиг сорил юм. Агентууд танил бус 2D тоглоомуудыг судалж, тодорхой зааваргүйгээр хэрхэн ажилладгийг нь таамаглана. Та arcprize.org/tasks(шинэ цонхонд нээгдэнэ) сайтад 25 демо тоглоом тоглох боломжтой.
ARC-AGI-3 нь хэрэгсэл, тусгай боломжгүй, зориуд ерөнхий байдлаар хийсэн хамгаалалт ашигладаг. Энгийн хамгаалалт нь загварын сул талыг илүү тод харуулж, загваруудыг илүү шударгаар харьцуулах боломж олгоно гэж ARC үзсэн. Харин арилжааны хөгжүүлэгчид хамгаалалтыг загвар бүрийн онцлог, өвөрмөц зан төлөвт тохируулан оновчилдог.
Тоглоомын хувьд GPT‑5.6 Sol зөвхөн харааны хамгаалалт ашиглан Pokémon FireRed-ийг (GPT_Plays_Pokemon(шинэ цонхонд нээгдэнэ)-ы дамжуулснаар), Codex-ийн компьютер ашиглах боломжийг ашиглан Slay the Spire-ийг (EpochAI(шинэ цонхонд нээгдэнэ)-ийн дамжуулснаар), мөн Baba Is You-ийн эхний үе шатуудыг (Piotr Migdał & Piotr Grabowski(шинэ цонхонд нээгдэнэ)-гийн хуваалцсанаар) ялсан. ARC-AGI-3 юугаараа тийм өөр байсан бэ?

Ethan Mollick нь Codex дахь GPT‑5.6 Sol мэдлэгийн хязгаарын хугацаанаас нь хойш гарсан Slay the Spire 2 тоглоомын санамсаргүй өдөр тутмын сорилтыг ялж буйг харуулжээ(шинэ цонхонд нээгдэнэ).
GPT‑5.5‑ын сул талын талаарх ARC-ийн шинжилгээнээс(шинэ цонхонд нээгдэнэ) санаа авч, бид GPT‑5.6 Sol-ын зарим оролдлогыг судалсан. ARC-ийн нэгэн адил бидэнд ч загвар төдийлөн ухаалаг харагдсангүй. Тэр үйлдэл бүр дээр удаан саатаж, урагшлахад хүндрэлтэй байв.
Гэвч нарийвчлан судлахад загварын будилааны ихэнх нь өөрийнх нь төрөлх сул тал бус, хамгаалалтын тохиргооноос үүдэлтэйг олж мэдсэн.
Нэгдүгээрт, тоглоомын үйлдэл бүрийн дараа дотоод сэтгэн бодох үйл явцыг бүхэлд нь устгаж байгааг анзаарсан. Ингэснээр GPT‑5.6 Sol өмнөх бодлоо санах боломжгүй болж, үйлдэл бүрдээ тоглоомыг шинээр ойлгох шаардлагатай болсон. Загвар өмнөх нүүдлүүдийн бүртгэл болон дагалдах товч тэмдэглэлүүдийг харж чадсан ч тэдгээрт хүргэсэн төлөвлөгөө, ололт, бодлуудыг харах боломжгүй байв.
Хоёрдугаарт, хамгаалалт гүйлгэн тайрах цонх ашигласнаар түүх уртсах тусам хуучин үйлдлүүд харагдахаа больж байв. Иймээс GPT‑5.6 Sol өмнөх бодлоо санаж чадахгүйгээс гадна өмнөх үйлдлүүдээ ч мартаж байлаа.
Сэтгэн бодолтыг устгах, гүйлгэн тайрах гэсэн хамгаалалтын энэ хоёр онцлог нь GPT‑5.6 Sol яагаад явцын дунд суралцаж чадахгүй байсныг тайлбарлахад тусалсан.
Манай загварууд хариу эсвэл хэрэгслийн дуудлага гаргахаасаа өмнө дотоод сэтгэн бодох мессежээр бодохоор сургагдсан. Эдгээр дотоод бодлын мессежийг харилцан ярианы түүхийн нэг хэсэг болгон хадгалдаг. Харилцан яриа хэт урт болбол бид хураангуйлж, үргэлжлүүлдэг.
Манай загваруудыг ийм байдлаар сургадаг бөгөөд ChatGPT болон Codex-д мөн ингэж нэвтрүүлдэг. Үйлдвэрлэлийн орчинтойгоо илүү сайн нийцүүлэхийн тулд бид ARC-AGI-3 хамгаалалтыг Responses API(шинэ цонхонд нээгдэнэ)-аараа хэрэгжүүлсэн. Манай API контекстийг удирдахад хялбар болгодог: GPT‑5.6‑д өмнөх хариултын ID-г дамжуулахад хэрэгслийн дуудлага болон ээлжүүдийн хоорондох сэтгэн бодолт автоматаар хадгалагдана.
Сэтгэн бодолтыг хадгалахад хоёр том өөрчлөлт ажиглагдсан. Нэгдүгээрт, GPT‑5.6 Sol ээлж бүрд тоглоомыг эхнээс нь тайлбарлах шаардлагагүй болсон тул үйлдэл бүрийн өмнө бодоход бага хугацаа зарцуулсан. Хоёрдугаарт, GPT‑5.6 Sol өмнөх бодлуудаа санаж чаддаг болсноор явцын дунд хавьгүй сайн суралцаж, уялдаатай стратеги хэрэглэдэг болсон.
Дараагийн сайжруулалт нь гүйлгэн тайралтыг Responses API-ийн өөр нэг тохиргоо болох шахалтаар(шинэ цонхонд нээгдэнэ) сольсноор бий болсон.
ARC-AGI-3-ын хамгаалалт контекстийн хязгаарыг гүйлгэн тайрах аргаар зохицуулдаг. Харилцан ярианы контекст 175,000 тэмдэгтээс хэтрэхэд хамгийн хуучин мессежүүдийг устгадаг.
Гүйлгэн тайрах арга хоёр сул талтай. Нэгдүгээрт, загвар өмнөх ажиглалт, үйлдлүүдээ алддаг. Хоёрдугаарт, даалгаврын ихэнх хугацаанд илүү дүүрэн контекстийн цонхтой ажилладаг нь гүйцэтгэлийг бага зэрэг муутгаж болно.
ARC-AGI-3 дээр шахалтыг идэвхжүүлэхэд GPT‑5.6 Sol урт хугацааны турш тоглоом бүрийн талаар сурсан зүйлээ илүү сайн хадгалж, цөөн гаралтын токеноор өндөр оноо авсан.
Сэтгэн бодолтыг хадгалж, шахалтыг идэвхжүүлсний нөлөөг харуулахын тулд хамгаалалт тус бүрээр ARC-AGI-3-ын цуврал эвлүүлдэг тоглоомыг шийдэх үеийн GPT‑5.6 Sol-ын 175K контекстийн цонхыг харуулсан хөдөлгөөнт дүрсийг үзүүлье.
Голын хоёр багана нь хамгаалалт бүр загварын контекстийн цонхыг хэрхэн өөрөөр ашигладгийг харуулна. GPT‑5.6 Sol өмнөхөө илүү сайн санадаг болсноор үйлдэл бүрд бага бодож, хавьгүй хурдан урагшилна. Тайлбар: манай хэрэгжүүлэлт тэмдэгтийн оронд 175,000 токены хязгаар ашигладаг ч текстийн дийлэнх нь манай токенжуулагчаар 1:1 харьцаагаар токенждог үйлдлийн торнууд тул үр дүн нь нэлээд төстэй.
Сэтгэн бодолтыг хадгалах болон шахалтыг хамтад нь ашигласнаар GPT‑5.6 Sol (Max) ойролцоогоор 3 дахин өндөр оноог 6 дахин цөөн гаралтын токеноор авдаг.
Эдгээр туршилт жишиг үнэлгээ загварыг дангаар нь хэмжих нь ховор бөгөөд API тохиргоо, хамгаалалтын загварчлал, промпттой холбоотой төдийлөн ил харагддаггүй олон сонголтыг хамтад нь хэмждэгийг сануулна гэж найдаж байна. Нийтийн жишиг сорилын доогуур оноонд гайхаж, дараа нь үнэлгээ ажиллуулагч нь сэтгэн бодох мессежүүдийг устгадаг ерөнхий хамгаалалт ашигласныг олж мэдсэн анхны тохиолдол энэ биш.
Хэрэв та гүйцэтгэлийг дээд хэмжээнд хүргэхийг зорьж буй API хөгжүүлэгч бол бид өөрсдийн бүтээгдэхүүнд ашигладаг дараах тохиргоог хэрэглэхийг зөвлөж байна:
- Хуучин чат боловсруулах API бус, манай Responses API-г ашиглах
- Сэтгэн бодолтыг хадгалах
- Шахалт ашиглах
Мөн загваруудыг харьцуулж байгаа бол ChatGPT болон Codex дахь бодит хэрэглээтэй хамгийн сайн нийцэх дээрх тохиргоонуудыг ашигласан үнэлгээнд тулгуурлахыг зөвлөж байна.
AGI үнэлгээний чиглэлээр олон жилийн турш бүтээлчээр ажилласан ARC-ийн хамт олон болон энэ асуудлыг илүү нарийвчлан судлахад бидэнд түлхэц өгсөн шинжилгээнд нь талархаж байна.
Хэрэв та хил хязгаарын загваруудтай чадвараа сорихыг хүсвэл arcprize.org/tasks(шинэ цонхонд нээгдэнэ) дахь нийтэд нээлттэй тоглоомуудыг өөрөө тоглоод үзээрэй.


