GPT‑5.6-ի ուղեցույց՝ մշակողների համար
Տեխնիկական դասեր արտադրական միջավայրում աշխատող ստարտափներից
GPT‑5.6 մոդելների ընտանիքն առաջադեմ մակարդակի ագենտների արդյունավետությունը դարձնում է անհամեմատ ավելի մատչելի՝ միաժամանակ ընդլայնելով հնարավորի սահմանները։
Այս ուղեցույցում ներկայացնում ենք, թե ինչպես են ստարտափներն ավելի խելացի մոդելի ընտրությամբ և API-ի նոր կառավարիչներով ապահովում դատողության շարունակականությունը, բազմաագենտ համակարգումը և ծրագրային գործիքների կանչը՝ շատ ավելի ցածր գնով ստեղծելով ավելի արագ ու ունակ ագենտներ։
GPT‑5‑ից ի վեր մոդելների յուրաքանչյուր սերունդ նպատակ է ունեցել ավելի քիչ թոքեններով լուծել ավելի երկարատև խնդիրներ։ GPT‑5.6‑ը շարունակում է այդ ընթացքը՝ առաջարկելով ագենտների ավելի բարձր արդյունավետություն և ցածր ծախսեր՝ հիմքում ընկած հարնեսում նվազագույն փոփոխություններով։
Ընդհանուր ծախսարդյունավետության բարելավմանը գումարվում է ավելի բարձր ճշգրտությունը՝ դատողության ավելի ցածր ջանքերի դեպքում։ Օրինակ՝ Agents’ Last Exam-ում GPT‑5.6 Sol-ը «ցածր» դատողությամբ գերազանցեց «բարձր» դատողությամբ GPT‑5.5‑ին, երբ հարնեսը մնաց անփոփոխ։ Նման հաջողություններ ենք տեսել նաև արտադրական փորձարկումներում․ ստարտափները հաղորդում են տարբեր աշխատանքային հոսքերում ծախսերի զգալի նվազման մասին՝ դատողության ջանքերը նախկին լռելյայն մակարդակից իջեցնելու շնորհիվ։
Պատմականորեն երկարատև կիրառությունների համար լավագույն տարբերակը եղել է առավելագույն հասանելի դատողությամբ ֆլագմանային մոդելին անցնելը։ Դա հիմնականում պայմանավորված էր նրանով, որ երկար համատեքստերի և գործիքների կանչերի դեպքում այս մոդելները զգալիորեն ավելի ունակ էին, քան ծախսերի համար օպտիմալացված մոդելները։ 5.6 ընտանիքը փոխել է իրավիճակը․ փորձարկման պահին ավելի շատ հաշվարկային ռեսուրս կիրառելիս Luna-ն և Terra-ն հաճախ GPT‑5.4‑ին ու 5.5-ին համադրելի արդյունք են տալիս՝ զգալիորեն ավելի ցածր գնով։
Դիտարկենք BrowseComp-ի առաջադրանքները՝ որոնման վրա հիմնված չափորոշիչ, որը ստուգում է քիչ հայտնի փաստեր գտնելու մոդելի կարողությունը։ Երեք ամիս առաջ GPT‑5.5‑ը (Գերհզոր) այս չափորոշիչում հավաքեց 84,36%՝ ընդհանուր $33,27 ծախսով։ Թողարկման պահին GPT‑5.6 Luna-ն (Գերհզոր) գրեթե նույն արդյունքն է տալիս՝ հավաքելով 84,04% ընդամենը $1,33 ծախսով։ Այդ ժամանակից ի վեր գներն էլ ավելի ենք նվազեցրել։ Գների մեր վերջին կրճատումների մասին կարդացեք ավելին։
5.6 ընտանիքի փոքր մոդելները հիանալի են մեծածավալ ծանրաբեռնվածությունների, հապաղման նկատմամբ զգայուն փոխազդեցությունների և ագենտային աշխատանքային հոսքերի կրկնվող քայլերի համար։ Օրինակ՝ եթե ղեկավարում եք իրավական տեխնոլոգիաների ստարտափ, որը նախքան ագենտային վերլուծությունը մշակում է ձեռագիր հուշագրեր, այլևս պետք չէ ամբողջ գործընթացում առաջադեմ մոդել օգտագործել․ արդյունահանման համար կարող եք ընտրել Terra-ն կամ Luna-ն և զգալիորեն խնայել։
GPT‑5.6‑ի սկզբնական արդյունավետությունը բարձրացնելուց բացի՝ Responses API-ում ավելացրել ենք նոր հիմնատարրեր՝ լրացուցիչ առավելություններ ապահովելու համար։ GPT‑5.6‑ը սկզբից մինչև վերջ վարժեցրել ենք միմյանց լրացնող երեք ճարտարապետական մոտեցմամբ, որոնք ագենտներին օգնում են ավելի արդյունավետ աշխատել․
- Կրկին օգտագործել արդեն կատարված աշխատանքը․ մոդելի քայլերի միջև պահպանելով դատողությունը(բացվում է նոր պատուհանում) և երկարատև զրույցները սեղմելու համար կիրառելով ներկառուցված խտացում(բացվում է նոր պատուհանում)՝ մոդելը կարող է երկարատև առաջադրանքներում պահպանել աշխատանքի հետևողականությունը՝ առանց շփոթվելու կամ նախկին համատեքստը վերականգնելու։
- Անհրաժեշտության դեպքում զուգահեռ տարրալուծել․ ներկառուցված բազմաագենտ համակարգումը(բացվում է նոր պատուհանում) թույլ է տալիս զուգահեռ աշխատանքային հոսքերում համակարգել մի քանի ագենտի՝ բարդ առաջադրանքներն ավելի արագ ավարտելու համար։
- Կանխորոշված աշխատանքը տեղափոխել կոդ․ ծրագրային գործիքների կանչի(բացվում է նոր պատուհանում) միջոցով մոդելի Համատեքստային պատուհանից դուրս զտել, միավորել և համակարգել գործիքների ելքերը՝ մոդելի թոքենները պահելով գնահատողական աշխատանքի համար և նվազեցնելով ծախսը, հապաղումն ու համատեքստի վատթարացումը։
Համատեղ կիրառելիս տարբերությունը կարող է հսկայական լինել։ Օրինակ՝ ARC-AGI-3-ում GPT‑5.6 Sol-ը ստանդարտ հարնեսով հավաքեց 13,3%։ Սակայն պահպանվող դատողությունն ու խտացումը միացնելուց հետո ցուցանիշը հասավ 38,3%-ի՝ մոտ վեց անգամ պակաս ելքային թոքեն օգտագործելով։ Մոդելն անփոփոխ է, իսկ արդյունավետությունը՝ գրեթե եռապատկված։ Մանրամասներին կարող եք ծանոթանալ ARC-AGI-3-ի հարնեսի մեր ուսումնասիրությունում։
Ագենտային աշխատանքային հոսքերը հաճախ երկու տեսակի աշխատանք են ներառում․
- Գնահատողական մոտեցում պահանջող առաջադրանքներ
- Աշխատանք, որը հիմնականում պահանջում է տվյալներ տեղափոխել, զտել և միավորել
Երբ ագենտը ստանում է 100 հաշվետվություն, զտում դրանք ըստ ամսաթվի և գտնում համապատասխան գործարքները, մոդելը չպետք է ստիպված լինի իր Համատեքստային պատուհանում վերլուծել յուրաքանչյուր միջանկյալ արդյունք։ Ծրագրային գործիքների կանչը GPT‑5.6‑ին թույլ է տալիս JavaScript գրել՝ գործիքները համակարգելու, անկախ կանչերը զուգահեռ գործարկելու և դրանց ելքերը Համատեքստային պատուհանից դուրս մշակելու համար։ Մոդելը կարող է կենտրոնանալ բանականություն պահանջող աշխատանքի՝ գնահատողական մոտեցման վրա։
Բարդ և զուգահեռ կատարման ենթակա առաջադրանքներում գործողություններն ու դատողությունը ագենտների մի քանի աշխատանքային հոսքերի միջև բաշխելը թույլ է տալիս ավելի արագ ավարտել աշխատանքն ու հասնել ավելի բարձր բանականության։ Այս կարգավորումներում հիմնական ագենտը համակարգում է ենթաագենտներին և առաջադրանքներ պատվիրակում նրանց։ Ենթաագենտները զուգահեռ հետապնդում են իրենց նպատակները, ապա արդյունքները փոխանցում հիմնական ագենտին՝ վերջնական ամփոփման համար։ Թիմերը կարող են անմիջապես օգտվել բազմաագենտ համակարգից՝ Responses API-ում միացնելով բազմաագենտ ռեժիմը(բացվում է նոր պատուհանում)։ ChatGPT‑ի Ultra հնարավորությունների կարգավորումը նույնպես այսպես է աշխատում։
“Qualia-ն անորոշ ավարտով հետազոտական խնդիրների վրա աշխատեցնում է ագենտների թիմեր, և GPT‑5.6 Sol-ը պարզապես լիովին արդարացրեց իրեն։ Այն ակնհայտորեն գերազանցեց GPT‑5.5‑ին, աշխատանքն ավարտեց մեր փորձարկած գրեթե բոլոր մյուս մոդելներից արագ և շուտով դարձավ OpenAI-ի մեր նախընտրելի մոդելը։”
“GPT‑5.6‑ը OpenAI-ի՝ մեր տեսած լավագույն համակարգողն է։ Մենք միանգամից վեց տեխնիկական առաջադրանք տվեցինք դրան՝ պահանջելով գրել, կառուցել և քննարկել բոլորը, իսկ այն հետևեց ամեն ինչին՝ չկորցնելով որակը։”
Թեև GPT‑5.6‑ը լավ է որոշում ենթաագենտների համապատասխան քանակն ու դրանց գործարկման պահը, բազմաագենտ վարքագիծը հեշտ է ուղղորդել։ Մոդելին հուշելով՝ երբ կանչել ենթաագենտներին, կարելի է մեծացնել հավանականությունը, որ ագենտները կգործարկվեն միայն այն դեպքերում, երբ թոքենների լրացուցիչ ծախսը կապահովի ավելի լավ արդյունք։
Մոդելների ամբողջ ընտանիքում հարցումների քեշի TTL-ը երկարացվել է մինչև առնվազն 30 րոպե, իսկ քեշի բաժանարար կետերն այժմ կարելի է կանխորոշված կերպով սահմանել մոդելի Համատեքստային պատուհանում։ Դրա շնորհիվ ստարտափները կարողացել են զգալիորեն բարձրացնել քեշից հաջող ընթերցումների գործակիցը։
Քեշի բաժանարար կետեր սահմանելու հետ մեկտեղ համապատասխան prompt_cache_key(բացվում է նոր պատուհանում)-ի շարունակական օգտագործումը մեծացնում է հավանականությունը, որ հարցումը կհասնի նույն եզրակացության շարժիչին, որը նախկինում մշակել է նույն նախածանցը՝ այդպիսով նվազեցնելով հապաղումը։
Այս օրինակներում հատկապես աչքի է ընկնում, թե որքան է փոխվել ագենտներ ստեղծելու տնտեսագիտությունը։
Այն կիրառությունները, որոնց յուրաքանչյուր քայլի համար նախկինում առաջադեմ մոդել էր պահանջվում, այժմ կարող են համադրելի կամ ավելի լավ արդյունքներ ապահովել շատ ավելի ցածր գնով՝ օգտագործելով փոքր մոդելներ, կարգավորելով դատողության ջանքը և կատարելով արդյունավետ ճարտարապետական ընտրություններ։
Անհամբեր սպասում ենք՝ տեսնելու, թե ինչ կստեղծեք։
- 2026
- API Platform-ը
Հեղինակների մասին
Այս ուղեցույցը մշակել են Սամարթ Մադուրուն(բացվում է նոր պատուհանում), Պրաշանտ Միտալը(բացվում է նոր պատուհանում), Դեյվ Լեոն(բացվում է նոր պատուհանում) և Ժյուլիեն Ռեյմանը(բացվում է նոր պատուհանում)՝ հիմնվելով վաղ փորձարկումներից մինչև արտադրական փուլ GPT‑5.6-ով լուծումներ ստեղծող ստարտափների հետ սերտ աշխատանքի իրենց փորձի վրա։


