Անցնել հիմնական բովանդակությանը
OpenAI

Ինչպես է GPT‑5.6‑ը համադրում առաջադեմ բանականությունն ու առաջադեմ արդյունավետությունը

Բեռնվում է…

GPT‑5.6 մոդելների ընտանիքը նախագծել ենք՝ մեր մոդելներով մարդկանց կատարած առաջադրանքների ամբողջ տիրույթում հնարավորություններն ու ծախսը հավասարակշռելու համար։ Մեր ֆլագմանային մոդելը՝ GPT‑5.6 Sol-ը, Max հիմնավորմամբ գերազանցում է Claude Fable 5-ին Artificial Analysis Coding Agent Index-ում՝ արժենալով դրա կեսից էլ քիչ։ Terra-ն բանականության չափորոշիչային թեստերում GPT‑5.5-ին համարժեք արդյունք է ցույց տալիս կես գնով, իսկ Luna-ն մեր ամենաարագ ու մատչելի մոդելն է և արժե Sol-ից 80%-ով պակաս։ Այս արդյունավետությունն ապահովելու համար մեր հետազոտական և տեխնիկական թիմերը զգալիորեն օպտիմալացրել են մեր ստեկի բոլոր հիմնական շերտերը։ Այս բարելավումներն ընդգրկում են մեր մոդելները, ինֆերենսը՝ ելք ստեղծելու համար մոդելների գործարկման եղանակը, և մեր ագենտային հարնեսը, որն օգտագործում են թե՛ Codex-ը, թե՛ ChatGPT Աշխատանքը։

Վերջին չորս տարում, երբ մեր մոդելների օգտագործումը հասցրել ենք 1 միլիարդ ակտիվ օգտատիրոջ և ավելի քան 2 միլիոն բիզնեսի, արդյունավետությունը վճռորոշ է եղել բանականության առավելությունները բոլորին հասցնելու համար։ Մեր առաքելությունն է ապահովել, որ արհեստական ընդհանուր բանականությունը ծառայի ողջ մարդկությանը։ Այս տարիներին շարունակաբար առավելագույնս օպտիմալացրել ենք մեր ամբողջ ստեկը, որպեսզի ծախս-բանականություն կորի յուրաքանչյուր կետում առաջարկենք լավագույն արդյունավետությամբ մոդելները։ GPT‑5.6‑ի միջոցով հասել ենք մեկ թոքենի հաշվով բանականության մեր մինչ այժմ լավագույն արդյունավետությանը․ այն ուսուցանվել է՝ յուրաքանչյուր թոքենով ավելի շատ աշխատանք կատարելու համար։ Ուսուցման ընթացքում օպտիմալացնում ենք թե՛ առաջադրանքի հաջող կատարումը, թե՛ արդյունավետությունը՝ մոդելին սովորեցնելով առաջադրանքը կատարել ավելի ուղիղ ճանապարհով։

Այս հրապարակումը դուրս է գալիս մեր մոդելների շրջանակից և ներկայացնում, թե ինչպես ենք արդյունավետություն ապահովել ստեկի ևս երկու հիմնական մասի առաջընթացի միջոցով․ 1) ինֆերենսում՝ օպտիմալացնելով բեռնվածության հավասարակշռումը, սպեկուլյատիվ ապակոդավորումը, քեշավորումն ու միջուկները՝ նույն սարքավորումներից ավելի շատ ելք ստանալու համար, և 2) մեր ագենտային հարնեսում՝ ավելի լավ կառավարելով համատեքստի ուռճացումը, գործիքների օգտագործումն ու կրկնվող աշխատանքը։ Կներկայացնենք նաև, թե GPT‑5.6 Sol-ն ինչպես է ինքնուրույն ապահովել այս բարելավումներից մի քանիսը։ Թեև առանձին վերցրած յուրաքանչյուր բարելավում կարող է սահմանափակ թվալ, միասին դրանք կուտակվում են և թույլ տալիս առաջատար լինել թե՛ բանականությամբ, թե՛ արդյունավետությամբ։

Գծապատկեր, որը ցույց է տալիս GPT-5.6-ի արդյունավետությունը ագենտային հարնեսում, API-ի կառավարման և մոդելի ինֆերենսի փուլերում՝ ապահովելով ավելի քիչ ցանցային տվյալներ, CPU-ի քիչ աշխատանք և GPU-ի ավելի մեծ ելք։

Ինֆերենսի արագացում GPT‑5.6 Sol-ով

Հաշվարկային ռեսուրսներով սահմանափակ աշխարհում, որտեղ մոդելների պահանջարկն ավելի արագ է աճում, քան հզորությունները, արդյունավետությունը յուրաքանչյուր համակարգի նախագծման հիմքում է։ Սա հատկապես վերաբերում է մեր ինֆերենսի ստեկին, որը գործարկում է ուսուցանված մոդելները՝ պատասխաններ ստեղծելու համար։ Մեր գլխավոր նպատակն է նույն սարքավորումներով ավելի շատ թոքեններ սպասարկել՝ պահպանելով օգտատերերի ակնկալած բանականությունը, ուշացումը, հասանելիությունն ու հուսալիությունը։

Դրա համար անհրաժեշտ է օպտիմալացնել ամբողջ համակարգը։ Առանձին վերցրած մոդելը կարող է շատ արդյունավետ լինել, բայց դրա սպասարկումը՝ թանկ, եթե հարցումները վատ են բաշխվում, սարքավորումներն անգործության են մատնված կամ տվյալների տեղաշարժը դանդաղեցնում է հաշվարկը։ Յուրաքանչյուր շերտի բարելավումները կուտակվում են․ օգուտը գալիս է երթուղավորման (ուր են ուղարկվում հարցումները), պլանավորման (երբ են դրանք ուղարկվում), միջուկների (GPU-ներում աշխատող ծրագրակազմ), քեշավորման (պահված և վերաօգտագործված աշխատանք) և մոդելի իրականացման (GPU կոդի կատարման հերթականություն) օպտիմալացումներից։ Codex-ում GPT‑5.6 Sol-ը առանցքային դեր է խաղացել այս բոլոր օպտիմալացումներում։

Առաջին կարևոր օրինակը բեռնվածության հավասարակշռումն է։ Ամբողջ աշխարհում հարցումները երթուղավորում ենք՝ հաշվի առնելով աշխարհագրությունը, հասանելի հզորությունը և արագացուցիչի տեսակը՝ մոդելը գործարկող GPU-ի կամ մասնագիտացված չիպի տեսակը։ Կլաստերի ներսում աշխատանքը բաշխում ենք մոդելի օրինակների միջև՝ ըստ բեռնվածության, համատեքստի երկարության, քեշի հասանելիության և հարցման այլ հատկությունների։ Այնուհետև յուրաքանչյուր օրինակի ներսում աշխատանքը պետք է արդյունավետորեն բաժանվի արագացուցիչների, մոդելի ենթացանցերի և հաշվարկային միջուկների միջև։ Codex-ում GPT‑5.6 Sol-ն օգնում է վերլուծել արտադրական տրաֆիկը, բացահայտել նախկինում անտեսված անհավասարակշռության աղբյուրները, փորձարկել երթուղավորման նոր ռազմավարություններ և մշտապես ճշգրտել այս էվրիստիկաները։ Միայն բեռնվածության հավասարակշռման այս բարելավումները կտրուկ նվազեցրել են մեր մոդելների սպասարկման ծախսը։

GPT‑5.6 Sol-ն օգտագործել ենք նաև մոդելի ուղիղ անցումը՝ մուտքային տվյալները հաջորդ թոքենի կանխատեսումների վերածող հաշվարկը, օպտիմալացնելու համար։ Նույնիսկ երբ առանձին գործողություններն արագ են, հիշողության ավելորդ տեղաշարժը, համաժամացումն ու տվյալների անարդյունավետ դասավորությունը կարող են GPU-ները պարապ թողնել։ Դրանից խուսափելու համար GPT‑5.6 Sol-ը գտել է աշխատանք, որը հնարավոր էր նախապես հաշվարկել, շրջանցել կամ զուգահեռացնել։ Codex-ի միջոցով GPT‑5.6 Sol-ն ինքնուրույն վերաշարադրել և օպտիմալացրել է մեր արտադրական միջուկները՝ մոդելը կազմող մաթեմատիկական գործողությունները կատարող հիմնական կոդը։ Սա մասամբ հաջողվել է, քանի որ GPT‑5.6‑ին ուսուցանել ենք արդյունավետորեն գրել և կատարելագործել միջուկներ Triton(բացվում է նոր պատուհանում) և Gluon(բացվում է նոր պատուհանում) լեզուներով՝ OpenAI-ի սպասարկած բաց կոդով GPU ծրագրավորման երկու լեզուներով։ Այս աշխատանքը, GPT‑5.6 Sol-ի ապահոված միջուկների ավելի լայն բարելավումների հետ միասին, 20%-ով նվազեցրել է սպասարկման ամբողջական ծախսերը։ Մենք նաև մեծ ներդրումներ ենք կատարել ստուգման գործիքներում, օրինակ՝ բաց կոդով FpSan(բացվում է նոր պատուհանում) (լողացող ստորակետի սանիտարիզատոր) գործիքում, որն օգնում է ստուգել GPT‑5.6 Sol-ի գրած միջուկների ճշտությունը։

Սպեկուլյատիվ ապակոդավորումը արագությունն ու արդյունավետությունը բարձրացնելու ևս մեկ միջոց է։ Այս մեթոդով հիմնական մոդելի հետ մեկտեղ գործարկվում է ավելի փոքր նախնական (կամ «կանխատեսող») մոդել, որն առաջարկում է մի քանի թոքեն՝ հիմնական մոդելի կողմից զուգահեռ ստուգման համար։ Երբ այդ առաջարկներն ընդունվում են, համակարգը հիմնական մոդելի մեկ անցումով կարող է ստեղծել մի քանի ելքային թոքեն՝ նվազեցնելով թանկարժեք հաջորդական հաշվարկների ծավալը։ GPT‑5.6 Sol-ը կատարելագործել է իր նախնական մոդելը՝ դրա ճարտարապետության վերաբերյալ հարյուրավոր փորձեր նախագծելով ու անցկացնելով և չափի, կառուցվածքի ու գործառույթների փոփոխություններ փորձարկելով։ Բացի այդ, GPT‑5.6 Sol-ը գործարկել և վերահսկել է կանխատեսող մոդելի ուսուցումը՝ խնդիրների, այդ թվում՝ սարքավորման խափանումների ու ուսուցման անկայունության դեպքում ինքնուրույն միջամտելով։ Արդյունքում թոքենների ստեղծման արդյունավետությունն աճել է ավելի քան 15%-ով։

Չքեշավորված մուտքային թոքենները մշակելիս մոդելը հաշվարկատար մեկ անցումով կառուցում է բանալի-արժեք (KV) քեշը, իսկ ելք ստեղծելիս բազմիցս կարդում և ընդլայնում է այն։ Սպասարկման օպտիմալ կազմաձևը՝ օրինակ խմբավորումը, մասնատումը և KV-ի կառավարումը, մեծապես կախված է աշխատանքային բեռնվածությունից՝ հարցման ու ելքի երկարությունից, խմբաքանակի չափից, քեշի համընկնման մակարդակից, հարցման բնութագրերից և այլ գործոններից։ Սակայն նախկինում կազմաձևերի տիրույթը չափազանց մեծ էր համակարգված կարգաբերման համար, ուստի ինժեներները ստիպված էին ապավինել ընդհանուր էվրիստիկաների։ Codex-ում GPT‑5.6 Sol-ի շնորհիվ կարողացանք վերլուծել արտադրական բեռնվածությունները, ստեղծել ու գնահատել հնարավոր կազմաձևերը և յուրաքանչյուր սցենարի համար առավելագույնս օպտիմալացնել շարժիչի ու մոդելի կարգավորումները։ Սա գործնական է դարձնում աշխատանքային բեռնվածությանը հատուկ օպտիմալացման նոր մակարդակը՝ նույն սարքավորումներից ստանալով ավելի օգտակար ինֆերենս։

Ինֆերենսի օպտիմալացումը շարունակական հետադարձ կապի ցիկլ է։ Մենք չափում ենք արտադրական միջավայրի վարքը, բացահայտում խոշորագույն բացերը, իրականացնում փոփոխություններ և ստուգում, որ դրանք բարելավեն ամբողջ համակարգը, ոչ թե միայն մեկ չափորոշիչային թեստ։ GPT‑5.6 Sol-ը և Codex-ն արագացնում են այդ ցիկլի յուրաքանչյուր մասը։ Դրա շնորհիվ մեր թիմը կարող է ավելի շատ գաղափարներ ուսումնասիրել, արագ արձագանքել փոփոխվող բեռնվածություններին և օգտատերերի համար ստեղծել ավելի ցածր ուշացումով, մեծ հզորությամբ ու քիչ ծախսատար ինֆերենսի ստեկ։

Ինչպես է մեր ագենտային հարնեսը պարզեցնում կրկնվող աշխատանքը

ChatGPT Աշխատանքը և Codex-ը բարդ առաջադրանքները կատարում են մոդելին ուղղված մի շարք հարցումների և գործիքների կանչերի միջոցով։ Մեկ քայլի ընթացքում՝ օգտատիրոջ հարցումից մինչև վերջնական պատասխանը, Codex-ը կարող է ուսումնասիրել սկզբնաղբյուր կոդը, որոնել տեղակայման պատմությունը, կարդալ միջադեպերի զեկույցները, խմբագրել ֆայլ և թեստեր գործարկել։ Յուրաքանչյուր քայլի համար կարող է հարցում պահանջվել։

Համատեքստի պատրաստումը, տվյալների փոխանցումը, ինֆերենսի գործարկումը, գործիքների կանչն ու գործընթացների մեկնարկը ժամանակ և հաշվարկային ռեսուրսներ են պահանջում։ Եթե առաջադրանքը մոդելին ուղղված 30 հարցում է պահանջում, յուրաքանչյուր հարցման մեկ լրացուցիչ վայրկյանը զգալի ժամանակ է դառնում։ Ընդհանուր արդյունավետությունը բարձրացնելու համար պետք է ամբողջ համակարգում կրճատել կրկնվող աշխատանքը, ոչ թե պարզապես արագացնել մոդելը։

Օգտատիրոջ առաջադրանքը մուտքագրվում է մոդել, որը կարող է կանչել գործիք, ստանալ արդյունքը և բազմիցս նոր որոշում կայացնել՝ մինչև առաջադրանքն ավարտելը։

Օգտատիրոջ մեկ հարցումը կարող է ներառել մոդելի և գործիքների բազմաթիվ կրկնություններ։ Կրկնվող հատվածում ցանկացած ծախս կարող է բազմիցս կատարվել։

Այս բազմապատկիչ գործոնները հաշվի ենք առել մեր ագենտային հարնեսը նախագծելիս․ այն Rust-ով գրված կառավարման շերտ է, որը կապում է մեր մոդելները, գործիքներն ու օգտատիրոջ միջավայրը։ Հաջորդիվ կանդրադառնանք, թե ինչպես են համատեքստի ավելորդ ուռճացումից խուսափելը, գործիքների բեռնումն ու աշխատանքի վերաօգտագործումն ավելի արդյունավետ դարձնում յուրաքանչյուր հարցում։

Խուսափել համատեքստի ավելորդ ուռճացումից

Երբ ագենտներին հասանելի են դառնում ավելի շատ գործիքներ, հմտություններ, փլագիններ և զրույցի պատմություն, Համատեքստային պատուհանները կարող են հեշտությամբ ընդարձակվել։ Սա մեծացնում է ծախսը, շեղում մոդելի ուշադրությունը և ավելորդ հիմնավորում առաջացնում։ Հարնեսը կարող է նվազեցնել այս լրացուցիչ ծախսը հետաձգված հայտնաբերման միջոցով, որի շնորհիվ ինտեգրումները, հատուկ MCP գործիքները, հմտություններն ու փլագինները հասանելի են դառնում միայն անհրաժեշտության դեպքում։ Հարնեսը նաև թույլ չի տալիս առանձին գործիքներին ու MCP ինտեգրումներին անսպասելիորեն սպառել Համատեքստային պատուհանը։ Գործիքի ելքը լռելյայն սահմանափակվում է 10 000 թոքենով, եթե մոդելն այլ սահմանաչափ չի պահանջում։

Պահպանել ճշգրիտ նախածանցերը՝ հարցումների քեշավորման համար

Ինչպես արդեն նշվել է, ագենտի ցիկլը մեկ քայլի ընթացքում կարող է նույն հրահանգները, զրույցի պատմությունը, գործիքների սահմանումներն ու նախորդ արդյունքները մի քանի անգամ ուղարկել GPU-ներին։ Այս կրկնվող մուտքային տվյալների մշակումը ծախսատար է, ուստի հարցումների քեշավորումը վերաօգտագործում է նախկինում մշակված հարցման նախածանցի հետ կապված հաշվարկը։ Այդ նախածանցը պահպանելու համար հարնեսը մոդելին տեսանելի ամբողջ պատմությունը դիտարկում է որպես միայն համալրվող․ նոր հաղորդագրությունները, գործիքների արդյունքներն ու միջավայրի թարմացումները ավելացվում են վերջում՝ նախորդ համատեքստում ներդրվելու փոխարեն։ Գործիքները նույնպես ներկայացվում են կանխորոշված հերթականությամբ, իսկ կատարման միջավայրի կարգավորումները, օրինակ՝ հաստատման կանոնները, կիրառվում են կատարման պահին՝ գործիքների սահմանումներում ներառվելու փոխարեն։ Նախագծային այս ընտրությունը նպաստում է Codex-ի և ChatGPT Աշխատանքի հարցումների քեշի համընկնման ընդհանուր բարձր ցուցանիշներին։

Երեք հարցումներ համեմատում են մշտական կապով ուղարկված բայթերը մոդելին հասանելի աճող համատեքստի և քեշում վերաօգտագործելի նախածանցի հետ։

Աճողական փոխանցումը փոխում է ցանցով փոխանցվող տվյալները, իսկ հարցումների քեշավորումը՝ այն, ինչ մոդելը կարող է կրկին չհաշվարկել։ Լայնությունները պայմանական են, իսկ սեղմման լրացուցիչ շերտը ցուցադրված չէ։

Արդյունավետություն բանականության ողջ կորի երկայնքով

GPT‑5.6‑ով ապահովված արդյունավետության աճը հետազոտությունների, ինֆերենսի և մեր ագենտային հարնեսի ընդգրկմամբ ամբողջ տեխնոլոգիական ստեկում տարիներ շարունակ կուտակված բարելավումների արդյունքն է։ Այս բարելավումներից շատերում GPT‑5.6‑ի դերը մեզ լավատեսությամբ է տրամադրում օպտիմալացման տեմպի հետագա արագացման հարցում։ Մենք կշարունակենք ավելի մեծ օպտիմալացումներ կատարել այնպիսի ոլորտներում, ինչպիսին է միջուկների օպտիմալացումը, ինչպես նաև հիմնովին բարելավել մեր ստեկը։ Ակնկալում ենք այս շարունակական, ներքին բարելավումները հասանելի դարձնել մեր օգտատերերին ու հաճախորդներին՝ ավելի լայնորեն հասանելի և ծախսարդյունավետ բանականության տեսքով։

Հատուկ շնորհակալություն տեխնիկական անձնակազմի անդամներ Մեթյու Ֆերարիին, Ֆիլիպ Տիլեին, Ահմեդ Իբրահիմին, Ջո Գերշենսոնին և Սթիվ Քոֆիին՝ այս հրապարակման մեջ ունեցած ներդրման համար։

Հեղինակ

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey