Екі параметрді қосу ARC-AGI-3 бенчмаркіндегі ұпайымызды қалай үш есе арттырды
GPT‑5.6 Sol моделінің ARC-AGI-3 бенчмаркіндегі есептерді шешу әрекеті жылдамдатылып көрсетілген: сол жақта ресми тапсырма ортасы, ал оң жақта ой қорыту барысын сақтап, ықшамдауды қосатын Responses API тапсырма ортамыз берілген. Бұл ойынның(жаңа терезеде ашылады) көшбасшылар кестесінде ешбір озық модель бірінші деңгейден әрі өте алмайды. Ал біздің тапсырма ортамызбен GPT‑5.6 Sol алты деңгейдің бәрін шешеді.
GPT‑5.6 Sol моделінің ARC-AGI-3(жаңа терезеде ашылады) бенчмаркіндегі төмен нәтижелерін алғаш көргенде, біз аң-таң болдық.
GPT‑5.6 Sol математикадағы көптен бері шешілмеген циклдерді қосарлап жабу болжамы(жаңа терезеде ашылады) сияқты есептерді шешіп, Pokémon FireRed секілді ойындарды жеңген. Алайда екіөлшемді логикалық ойындардан тұратын ARC-AGI-3 бенчмаркіндегі GPT‑5.6 Sol нәтижесі небәрі 7,8% болды, ал GPT‑5.5 ойындарды әрең ойнап, бар-жоғы 0,4% жинады.
Екіөлшемді логикалық ойындар біздің модельдер үшін соншалық қиын болды ма? Әлде мәселе басқада ма еді?
Бенчмарктер ЖИ модельдерін оқшау күйде сирек бағалайды. Олар API параметрлері, тапсырма ортасының құрылымы және көмексөздерді құрастыру тәсілі сияқты көзге түсе бермейтін шешімдерді де бағалайды. ARC-AGI-3 жағдайында ChatGPT пен Codex жүйелерінде қолданылатын екі API параметрін — ой қорыту барысын сақтау мен ықшамдауды — қосу ашық тапсырмалар жиынтығындағы ұпайды үш есе арттырып, шығыс токендер санын алты есе азайтқанын анықтадық.
Ресми тапсырма ортасын пайдаланғанда GPT‑5.6 Sol ARC-AGI-3 ашық жиынтығында 13,3% жинады. Ой қорыту сақталып, ықшамдау қолданылғанда нәтиже 38,3%-ға жетті. Ұпай адам әрекетінің салыстырмалы тиімділігін (RHAE(жаңа терезеде ашылады))—модель нәтижесін адам көрсеткішімен салыстыратын метриканы өлшейді. Ресми ойын журналдарына(жаңа терезеде ашылады) сүйеніп, қатысушылардың орташа нәтижесі 48% болды деп бағалаймыз. Модельдерге бағалау әдісі айтылмайды және олар ойын барысында өз ұпайын көрмейді—әрекеттер тек әр кадрдың мәтіндік көрінісін және ағымдағы деңгейді қайтарады.
ARC-AGI-3 — ЖИ агенттерінің үйрену және ой қорыту қабілетін бағалауға арналған бенчмарк. Агенттер бейтаныс екіөлшемді ойындарды зерттеп, нақты нұсқауларсыз олардың қалай жұмыс істейтінін анықтайды. 25 демонстрациялық ойынды arcprize.org/tasks(жаңа терезеде ашылады) сайтында ойнай аласыз.
ARC-AGI-3 құралдары мен арнайы мүмкіндіктері жоқ, әдейі әмбебап етіп жасалған тапсырма ортасын пайдаланады. ARC-тың ой қорытуы бойынша, қарапайым тапсырма ортасы модельдердің кемшіліктерін анығырақ көрсетіп, модельдерді әділірек салыстыруға мүмкіндік береді. Ал коммерциялық әзірлеушілер, керісінше, тапсырма орталарын әр модельдің мүмкіндіктері мен өзіндік ерекшеліктеріне қарай оңтайландырады.
Ойындарда GPT‑5.6 Sol тек көру мүмкіндігі бар тапсырма ортасы арқылы Pokémon FireRed ойынын (GPT_Plays_Pokemon(жаңа терезеде ашылады)трансляциясында), Codex-тің компьютерді пайдалану мүмкіндігі арқылы Slay the Spire ойынын (EpochAI(жаңа терезеде ашылады) трансляциясында) және Baba Is You ойынының алғашқы кезеңдерін (Пиотр Мигдал мен Пиотр Грабовски(жаңа терезеде ашылады) бөліскен материалда) жеңді. ARC-AGI-3 несімен соншалық ерекшеленді?

Итан Моллик Codex жүйесіндегі(жаңа терезеде ашылады) GPT‑5.6 Sol моделінің Slay the Spire 2 ойынындағы кездейсоқ күнделікті сынақты жеңгенін көрсетеді. Бұл ойын GPT‑5.6 Sol моделінің білім қорының шекті мерзімінен кейін шыққан.
ARC ұйымының GPT‑5.5 моделінің кемшіліктері туралы талдауы(жаңа терезеде ашылады) бізге түрткі болып, GPT‑5.6 Sol моделінің кейбір талпыныстарын зерттедік. ARC ұйымы сияқты, бізге де модель аса зерек болып көрінбеді. Ол әр әрекетті ұзақ ойластырып, ілгерілеуге қиналды.
Алайда тереңірек зерттегенде, модельдің шатасуына көбіне оның өз ерекшеліктері емес, тапсырма ортасының параметрлері себеп болғанын анықтадық.
Біріншіден, әр ойын әрекетінен кейін бүкіл құпия ой қорыту барысы жойылып отырғанын байқадық. Сондықтан GPT‑5.6 Sol бұрынғы ойларын есінде сақтай алмай, әр әрекет сайын ойынды қайтадан түсінуге мәжбүр болды. Модель бұрынғы жүрістер мен оларға қоса жазылған қысқа ескертпелерді көре алғанымен, сол әрекеттерге алып келген жоспарларды, түйіндерді немесе ойларды көре алмады.
Екіншіден, тапсырма ортасы жылжымалы қысқарту терезесін қолданғандықтан, тарих ұзарған сайын ескі әрекеттер көрінбей қалатынын байқадық. Осылайша GPT‑5.6 Sol бұрынғы ойларын ғана емес, бұрынғы әрекеттерін де ұмытып отырды.
Тапсырма ортасының осы екі ерекшелігі — ой қорыту барысын жою және жылжымалы қысқарту — GPT‑5.6 Sol моделінің уақыт өте үйрене алмай қиналу себебін түсіндіруге көмектесті.
Модельдеріміз жауап немесе құрал шақыруын бермес бұрын құпия ой қорыту хабарлары арқылы ойлануға үйретілген. Бұл құпия ой қорыту хабарлары әңгіме тарихының бір бөлігі ретінде сақталады. Әңгіме тым ұзарып кетсе, оны қысқаша қорытындылап, жалғастырамыз.
Модельдеріміз осылай үйретіледі және ChatGPT пен Codex жүйелерінде де дәл осылай жұмыс істейді. Өндірістік ортамызға барынша сәйкестендіру үшін ARC-AGI-3 тапсырма ортасын Responses API(жаңа терезеде ашылады)арқылы іске асырдық. API жүйеміз мәнмәтінді басқаруды жеңілдетеді: GPT‑5.6 үшін алдыңғы жауап идентификаторын беру құрал шақырулары мен диалог кезектері арасында ой қорыту барысын автоматты түрде сақтайды.
Ой қорыту барысы сақталғанда екі үлкен өзгерісті байқадық. Біріншіден, GPT‑5.6 Sol әр кезекте ойынды басынан қайта түсінуге мәжбүр болмағандықтан, әр әрекет алдында ойлануға азырақ уақыт жұмсады. Екіншіден, бұрынғы ойларын есте сақтай алған кезде, GPT‑5.6 Sol уақыт өте әлдеқайда жақсы үйреніп, бірізді стратегияларды қолданды
Келесі жақсартуға жылжымалы қысқартуды Responses API жүйесіндегі тағы бір параметр — ықшамдаумен(жаңа терезеде ашылады) алмастыру арқылы қол жеткіздік.
ARC-AGI-3 тапсырма ортасы мәнмәтін шектерін жылжымалы қысқарту арқылы басқарады. Әңгіме мәнмәтіні 175 000 таңбадан асқанда, ең ескі хабарлар жойылады.
Жылжымалы қысқартудың екі кемшілігі бар. Біріншіден, модель бұрынғы бақылаулары мен әрекеттерін жоғалтады. Екіншіден, модель тапсырмалардың көп бөлігінде мәнмәтін терезесі көбірек толған күйде жұмыс істейді, бұл өнімділікті сәл төмендетуі мүмкін
ARC-AGI-3 үшін ықшамдауды қосқанда, GPT‑5.6 Sol ұзақ орындалу барысында әр ойын туралы үйренгенін жақсырақ сақтап, азырақ шығыс токенмен жоғары ұпайға қол жеткізді.
Ой қорыту барысын сақтау мен ықшамдауды қосудың әсерін көрсету үшін GPT‑5.6 Sol әр тапсырма ортасында ARC-AGI-3 басқатырғыштарының топтамасын шешкен кезде оның 175K мәнмәтін терезесі қалай пайдаланылатынын көрсететін анимацияны ұсынамыз.
Ортадағы екі баған әр тапсырма ортасының модельдің мәнмәтін терезесін қалай пайдаланатынын көрсетеді. Бұрынғы әрекеттерін жақсырақ есте сақтаған GPT‑5.6 Sol әр әрекет алдында азырақ ойланып, әлдеқайда жылдам ілгерілейді. Ескертпе: біздің іске асыру нұсқамызда таңбалар орнына 175 000 токендік шек қолданылады. Алайда нәтиже шамалас, өйткені мәтіннің басым бөлігі әрекет торларынан тұрады және токенизаторымызда олар 1:1 қатынасымен токендерге бөлінеді.
Ой қорыту барысын сақтау мен ықшамдау GPT‑5.6 Sol (max) моделіне алты есе аз шығыс токенмен шамамен үш есе жоғары ұпай жинауға мүмкіндік береді.
Бұл тәжірибелер бағалаулардың модельдерді оқшау күйде сирек өлшейтінін еске салады деп үміттенеміз: олар API параметрлері, тапсырма ортасының құрылымы және нұсқау беру тәсілі сияқты көзге түсе бермейтін шешімдер жиынтығын да бағалайды. Ашық бенчмарктегі төмен ұпайларға таңғалып, кейін бағалау жүйесі ой қорыту хабарларын алып тастайтын әмбебап тапсырма ортасын қолданғанын анықтауымыз бірінші рет емес.
Егер өнімділікті барынша арттырғысы келетін API әзірлеушісі болсаңыз, өз өнімдерімізде қолданылатын параметрлерді пайдалануды ұсынамыз:
- Бұрынғы чат жауаптарын құратын API орнына Responses API жүйесін пайдаланыңыз
- Ой қорыту барысын сақтаңыз
- Ықшамдауды пайдаланыңыз
Ал модельдерді салыстырсаңыз, ChatGPT пен Codex жүйелеріндегі нақты қолданысқа барынша сәйкес келетін жоғарыдағы параметрлерді пайдаланатын бағалауларға сүйенуді ұсынамыз.
AGI жүйесін бағалау саласындағы көпжылдық шығармашылық еңбегі және осы мәселені мұқият зерттеуімізге түрткі болған талдауы үшін ARC ұйымына алғыс айтамыз.
Өз қабілетіңізді озық модельдермен салыстырып көргіңіз келсе, arcprize.org/tasks(жаңа терезеде ашылады) сайтындағы ашық ойындарды өзіңіз ойнап көріңіз.


