Անցնել հիմնական բովանդակությանը
OpenAI

Ինչպես երկու կարգավորման միացումը եռապատկեց ARC-AGI-3-ի բենչմարկում մեր միավորները

Բեռնվում է…

Արագացված տեսանյութ, որտեղ GPT‑5.6 Sol-ը փորձում է լուծել ARC-AGI-3 հենանիշային թեստի գլուխկոտրուկները՝ պաշտոնական հարնեսով (ձախից) և մեր Responses API-ի հարնեսով (աջից), որը պահպանում է դատողությունը և միացնում խտացումը։ Այս խաղի(բացվում է նոր պատուհանում) վարկանիշային աղյուսակում ոչ մի առաջադեմ մոդել առաջինից մակարդակից այն կողմ որևէ մակարդակ չի լուծում։ Մեր հարնեսով GPT‑5.6 Sol-ը լուծում է բոլոր վեցը։

Երբ առաջին անգամ տեսանք GPT‑5.6 Sol-ի ցածր միավորները ARC-AGI-3(բացվում է նոր պատուհանում) հենանիշային թեստում, տարակուսեցինք։

GPT‑5.6 Sol-ը լուծել է մաթեմատիկայի վաղուց չլուծված խնդիրներ, օրինակ՝ ցիկլային կրկնակի ծածկույթի վարկածը(բացվում է նոր պատուհանում), և հաղթել է Pokémon FireRed-ի պես խաղերում։ Սակայն երկչափ գլուխկոտրուկ խաղերի ARC-AGI-3 հենանիշային թեստում GPT‑5.6 Sol-ը հավաքեց ընդամենը 7.8%, իսկ GPT‑5.5‑ը գրեթե ընդհանրապես չկարողացավ խաղալ՝ հավաքելով չնչին 0.4%։

Մի՞թե 2D գլուխկոտրուկ խաղերն անսովոր դժվար էին մեր մոդելների համար, թե՞ պատճառն այլ էր։

Հենանիշային թեստերը հազվադեպ են ԱԲ մոդելները գնահատում մյուս գործոններից անկախ։ Դրանք նաև չափում են API-ի կարգավորումների, հարնեսի նախագծման և հուշումների հետ կապված պակաս տեսանելի ընտրությունների ազդեցությունը։ ARC-AGI-3-ի դեպքում պարզեցինք, որ ChatGPT‑ում և Codex-ում մեր կիրառած API-ի երկու կարգավորումների՝ դատողության պահպանման և խտացման միացումը հանրային առաջադրանքների հավաքածուում եռապատկել է միավորները և 6 անգամ կրճատել ելքային թոքենների քանակը։

Պաշտոնական հարնեսով GPT‑5.6 Sol-ը ARC-AGI-3-ի հանրային հավաքածուում գրանցվել է 13.3%։ Պահպանված դատողությամբ և խտացմամբ այն գրանցել է 38.3%։ Միավորները չափում են մարդու գործողությունների հարաբերական արդյունավետությունը (RHAE(բացվում է նոր պատուհանում))՝ գնահատման չափանիշ, որը մոդելի արդյունավետությունը համեմատում է մարդկային ելակետի հետ։ Հիմնվելով խաղերի պաշտոնական մատյանների(բացվում է նոր պատուհանում) վրա՝ գնահատում ենք, որ փորձարկող մարդը միջինում հավաքել է 48%։ Մոդելներին չեն ասում, թե ինչպես են գնահատելու, և ամբողջ ընթացքում նրանք չեն տեսնում իրենց միավորըգործողությունները վերադարձնում են միայն յուրաքանչյուր կադրի տեքստային ներկայացումը և ընթացիկ մակարդակը։

ARC-AGI-3

ARC-AGI-3-ը հենանիշային թեստ է, որը նախատեսված է չափելու, թե ԱԲ գործակալները որքան լավ են սովորում և դատողություններ անում։ Գործակալներն ուսումնասիրում են անծանոթ 2D խաղերը և առանց հստակ հրահանգների եզրակացնում դրանց աշխատանքի կանոնները։ Դուք կարող եք 25 դեմո խաղ խաղալ arcprize.org/tasks(բացվում է նոր պատուհանում) կայքում։

ARC-AGI-3-ը միտումնավոր օգտագործում է ընդհանուր նշանակության հարնես՝ առանց գործիքների կամ հատուկ հնարավորությունների։ ARC-ի հիմնավորումն այն էր, որ պարզ հարնեսն ավելի տեսանելի է դարձնում մոդելի թերությունները և ապահովում մոդելների ավելի արդար համեմատություն։ Ի հակադրություն՝ կոմերցիոն մշակողները հարնեսները հարմարեցնում են յուրաքանչյուր մոդելի հնարավորություններին և առանձնահատկություններին։

Խաղերում GPT‑5.6 Sol-ը հաղթել է Pokémon FireRed-ը՝ միայն տեսողության վրա հիմնված հարնեսով (հեռարձակել է GPT_Plays_Pokemon(բացվում է նոր պատուհանում)-ը), Slay the Spire-ը՝ Codex-ի համակարգչի օգտագործման միջոցով (հեռարձակել է EpochAI(բացվում է նոր պատուհանում)-ը), և Baba Is You-ի առաջին փուլերը (ներկայացրել են Պյոտր Միգդալը և Պյոտր Գրաբովսկին(բացվում է նոր պատուհանում))։ Ի՞նչն էր այդքան տարբեր ARC-AGI-3-ի դեպքում։

GPT-5.6 Sol-ը Codex-ում ավարտում է Slay the Spire 2-ի պատահականորեն ստեղծված ամենօրյա մարտահրավերը։

Իթան Մոլիկը ցույց է տալիս(բացվում է նոր պատուհանում), թե ինչպես է GPT‑5.6 Sol-ը Codex-ում հաղթահարում Slay the Spire 2-ի պատահականացված ամենօրյա մարտահրավերը։ Խաղը թողարկվել է GPT‑5.6 Sol-ի գիտելիքների վերջին թարմացված ամսաթվից հետո։

Ոգեշնչվելով GPT‑5.5‑ի թերությունների վերաբերյալ ARC-ի վերլուծությունից(բացվում է նոր պատուհանում)՝ ուսումնասիրեցինք GPT‑5.6 Sol-ի փորձերից մի քանիսը։ ARC-ի պես մենք էլ տեսանք, որ մոդելն առանձնապես խելացի չէր թվում։ Այն երկար էր խորհում յուրաքանչյուր գործողության շուրջ և դժվարությամբ էր առաջ շարժվում։

Սակայն ավելի խոր ուսումնասիրության արդյունքում պարզեցինք, որ մոդելի շփոթության մեծ մասը ոչ թե բուն մոդելից էր, այլ հարնեսի կարգավորումներից։

Նախ նկատեցինք, որ խաղային յուրաքանչյուր գործողությունից հետո ամբողջ մասնավոր դատողությունը հեռացվում էր։ Սա նշանակում էր, որ յուրաքանչյուր գործողության ժամանակ GPT‑5.6 Sol-ից պահանջվում էր խաղը նորից հասկանալ՝ առանց նախորդ մտքերը հիշելու հնարավորության։ Մոդելը դեռ կարող էր տեսնել նախորդ քայլերի գրառումն ու դրանց կից համառոտ նշումները, բայց չէր տեսնում այդ քայլերին հանգեցրած ծրագրերը, բացահայտումները կամ մտքերը։

Այնուհետև տեսանք, որ հարնեսն օգտագործում էր շարժական կրճատման պատուհան, որի պատճառով պատմության ընդլայնմանը զուգահեռ` հին գործողությունները դառնում էին անտեսանելի։ Այսպիսով, GPT‑5.6 Sol-ը ոչ միայն չէր կարողանում հիշել իր նախորդ մտքերը, այլև կորցնում էր նախորդ գործողությունների հիշողությունը։

Հարնեսի այս երկու առանձնահատկությունները՝ դատողության հեռացումն ու շարժական կրճատումը, միասին բացատրում էին, թե ինչու էր GPT‑5.6 Sol-ը ժամանակի ընթացքում ունենում սովորելու հետ կապված դժվարություններ։

Ագենտները ամենալավ արդյունքն են ցույց տալիս, երբ հիշում են իրենց արածը

Մեր մոդելները վարժեցված են՝ նախ մասնավոր դատողության հաղորդագրություններով մտածելու, ապա պատասխաններ կամ գործիքների կանչեր արտածելու համար։ Մասնավոր մտածողության այս հաղորդագրությունները պահպանվում են որպես զրույցի պատմության մաս։ Եթե զրույցը չափազանց երկարում է, մենք ամփոփում ենք այն և շարունակում։

Գծապատկեր, որը ցույց է տալիս, թե երկարատև առաջադրանքի ընթացքում ինչպես են միասին աշխատում մոդելի դատողությունը, գործիքների կանչերը, զրույցի պատմությունը և համատեքստի խտացումը։

Մեր մոդելներն այսպես են վարժեցվում և նույն կերպ ներդրված են ChatGPT‑ում ու Codex-ում։ Մեր արտադրական միջավայրին ավելի մոտ լինելու համար ARC-AGI-3-ի հարնեսը ստեղծեցինք մեր Responses API(բացվում է նոր պատուհանում)-ով։ Մեր API-ն հեշտացնում է համատեքստի կառավարումը․ GPT‑5.6‑ի դեպքում նախորդ պատասխանի ID-ի փոխանցումն ինքնաբերաբար պահպանում է դատողությունը գործիքների կանչերի և հերթերի միջև։

Դատողությունը պահպանելուց հետո նկատեցինք երկու մեծ փոփոխություն։ Նախ՝ GPT‑5.6 Sol-ը յուրաքանչյուր գործողությունից առաջ ավելի քիչ էր մտածում, քանի որ այլևս ստիպված չէր ամեն հերթում խաղը զրոյից մեկնաբանել։ Երկրորդ՝ երբ GPT‑5.6 Sol-ը կարողանում էր հիշել իր նախորդ մտքերը, ժամանակի ընթացքում շատ ավելի լավ էր սովորում և հետևողական ռազմավարություններ կիրառում։

Հաջորդ բարելավումն ապահովեց շարժական կրճատումը խտացմամբ(բացվում է նոր պատուհանում) փոխարինելը, որը Responses API-ի ևս մեկ կարգավորում է։

ARC-AGI-3-ի հարնեսը համատեքստի սահմանափակումները կառավարում է շարժական կրճատմամբ։ Երբ զրույցի համատեքստը գերազանցում է 175,000 նիշը, ամենահին հաղորդագրությունները հեռացվում են։

Շարժական կրճատումն ունի երկու թերություն։ Նախ՝ մոդելը կորցնում է ավելի վաղ դիտարկումներն ու գործողությունները։ Երկրորդ՝ առաջադրանքների մեծ մասը կատարում է ավելի ամբողջական համատեքստային պատուհանով, ինչը կարող է փոքր-ինչ վատացնել արդյունավետությունը։

Երբ ARC-AGI-3-ում միացրինք խտացումը, GPT‑5.6 Sol-ը երկարատև փորձերի ընթացքում ավելի լավ պահպանեց յուրաքանչյուր խաղի մասին սովորածը և ավելի քիչ ելքային թոքեններով ավելի բարձր միավոր ստացավ։

Դատողության պահպանման և խտացման ազդեցությունը պատկերելու համար ներկայացնում ենք անիմացիա, որը ցույց է տալիս GPT‑5.6 Sol-ի 175K համատեքստային պատուհանը, երբ այն յուրաքանչյուր հարնեսով լուծում է ARC-AGI-3-ի մի շարք գլուխկոտրուկներ։

Կենտրոնական երկու սյունակները ցույց են տալիս, թե յուրաքանչյուր հարնես ինչպես է տարբեր կերպ օգտագործում մոդելի համատեքստային պատուհանը։ Ավելի լավ հիշելով անցյալը՝ GPT‑5.6 Sol-ը յուրաքանչյուր գործողության վրա ավելի քիչ է մտածում և շատ ավելի արագ առաջ շարժվում։ Նշում․ մեր իրականացումն օգտագործում է 175,000 թոքենի սահմանաչափ նիշերի փոխարեն, սակայն արդյունքը բավականին նման է, քանի որ տեքստի ճնշող մասը գործողությունների ցանցեր են, որոնք մեր թոքենիզատորը թոքենացնում է 1:1 հարաբերակցությամբ։

Դատողության պահպանումն ու խտացումը միասին GPT‑5.6 Sol-ին (Max) թույլ են տալիս մոտ 3 անգամ ավելի բարձր միավոր ստանալ՝ 6 անգամ ավելի քիչ ելքային թոքեններով։

Եզրակացություն և առաջարկություններ

Հուսով ենք՝ այս փորձերը կհիշեցնեն, որ գնահատումները հազվադեպ են մոդելները չափում մեկուսացված․ դրանք նաև գնահատում են API-ի կարգավորումների, հարնեսի նախագծման և հուշումների հետ կապված՝ պակաս տեսանելի ընտրությունների ամբողջությունը։ Սա առաջին դեպքը չէ, երբ հանրային հենանիշային թեստի ցածր միավորները զարմացրել են մեզ, իսկ հետո պարզվել է, որ գնահատման գործարկիչն օգտագործել է ընդհանուր նշանակության հարնես, որը հեռացրել է դատողության հաղորդագրությունները։

Եթե API մշակող եք և փորձում եք առավելագույն արդյունավետություն ստանալ, խորհուրդ ենք տալիս կիրառել նույն կարգավորումները, որոնք օգտագործում ենք մեր արտադրանքներում․

  • Օգտագործեք մեր Responses API-ն, ոչ թե հին զրույցի ավարտման API-ն
  • Պահպանեք դատողությունը
  • Օգտագործեք խտացում

Իսկ մոդելներ համեմատելիս խորհուրդ ենք տալիս հիմնվել վերը նշված կարգավորումներն օգտագործող գնահատումների վրա, քանի որ դրանք առավել լավ են համապատասխանում ChatGPT‑ում և Codex-ում իրական կիրառմանը։

Շնորհակալ ենք ARC-ին AGI-ի գնահատման ուղղությամբ տարիների ստեղծագործ աշխատանքի և այն վերլուծության համար, որը ոգեշնչեց մեզ այստեղ ավելի խորը ուսումնասիրություն կատարել։

Եթե ցանկանում եք ձեր ուժերը փորձել առաջադեմ մոդելների դեմ, ինքներդ խաղացեք հանրային խաղերը arcprize.org/tasks(բացվում է նոր պատուհանում) կայքում։

Հեղինակ

Ilan Bigio, Ted Sanders