Ներկայացնում ենք GPT‑6 Sol-ը և Luna-ն
Առաջադեմ բանականությունն ամենօրյա աշխատանքում կիրառելու ավելի շատ եղանակներ։
Այս ամսվա սկզբին ներկայացրինք GPT‑6 Astra-ն՝ աշխարհի ամենախելացի և մեր նպատակներին առավել համապատասխանեցված մոդելը։ Թեև ամենաբարդ ու կարևոր նախագծերը դեռ պահանջում են Astra-ի ամբողջ ներուժը, աշխատանքները տարբերվում են իրենց ծավալով, տեմպով և բյուջեով։
Ուստի GPT‑6‑ի ընտանիքն ընդլայնում ենք GPT‑6 Sol և GPT‑6 Luna մոդելներով։ GPT‑6 Astra-ն սկիզբ դրեց բանականության նոր սերնդի, իսկ այս մոդելներն այդ բանականության առավելությունները հասանելի են դարձնում՝ առաջադեմ արդյունավետություն ապահովելով ծախսերի առումով։ GPT‑6 Sol-ը և Luna-ն վարժեցրել ենք GPT‑6 Astra-ի մեթոդներին նման մեթոդներով՝ ավելի արագ և մատչելի մոդելներում ներդնելով Astra-ի առաջատար ձեռքբերումները մասնագիտական աշխատանքի, փաստական ճշգրտության, ծրագրավորման, համակարգչի օգտագործման և համապատասխանեցման ոլորտներում։
GPT‑6 մոդելներն առաջատար են ծախս–բանականություն ամբողջ կորի երկայնքով՝ յուրաքանչյուր մակարդակի բացառիկ կարողությունները համադրելով դրանք մեծ մասշտաբով արդյունավետ մատուցող ենթակառուցվածքի հետ։ Քեշավորման և ինֆերենսի բարելավումները թույլ են տալիս այս մոդելները տրամադրել ավելի ցածր արժեքով, իսկ այդ խնայողություններն ուղղակիորեն փոխանցում ենք օգտատերերին ու հաճախորդներին՝ GPT‑5.6-ի գովազդային գների համեմատ Sol-ի և Luna-ի API գները նվազեցնելով 50%-ով։ Այս բարելավումները միասին առաջադեմ ԱԲ-ն գործնական են դարձնում ավելի շատ առօրյա առաջադրանքների և մեծածավալ կիրառությունների համար։
Մոդել | Մուտք | Ելք | Գնի նվազում |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50%-ով էժան |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50%-ով էժան |
Գները նշված են 1 միլիոն թոքենի համար։
GPT‑6 Astra-ն շարունակում է բոլոր առումներով մնալ մեր լավագույն մոդելը։ Ընտրեք այն, երբ ցանկանում եք լավագույն արդյունքներն ու անզիջում փորձառություն։
GPT‑6 Sol-ը և Luna-ն բանականության բարելավումներ ու ծախսային արդյունավետություն են բերում ձեզ արդեն ծանոթ և կիրառվող մոդելներին՝ բարդ աշխատանքն ավարտին հասցնելու համար առավել օգտակար կարողությունների շրջանակում։
GPT‑6 Sol-ը կարող է կատարել բարդ աշխատանքային առաջադրանքներ՝ օգտագործման ավելի բարձր սահմանաչափերի և ցածր արժեքի շնորհիվ կրկնակի մշակումների համար ավելի մեծ հնարավորություն տալով։ Այն նաև ավելի բարձր բանականություն և ավելի լավ արդյունքներ է ապահովում համադրելի գին ունեցող մրցակից մոդելների համեմատ։
Հավելվածներում բիզնես աշխատանքային հոսքերը ստուգող AutomationBench թեստում GPT‑6 Sol-ը գերհզոր ջանքով գերազանցում է առավելագույն ջանքով Claude Opus 5-ին՝ մեկ առաջադրանքի համար արժենալով Opus 5-ի արժեքի ընդամենը 9%-ը։ Հզոր ջանքի դեպքում GPT‑6 Luna-ն իր նախորդին գերազանցում է 5.4 տոկոսային կետով՝ մեկ առաջադրանքի արժեքը նվազեցնելով 58%-ով։
AutomationBench 1.0.6(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները ստուգվում են սկզբից մինչև վերջ աշխատանքային հոսքերում՝ վաճառքի, մարքեթինգի, գործառնությունների, աջակցության, ֆինանսների և կադրերի ոլորտների 47 գործիքով։ Claude Fable 5.1-ի տվյալը թերագնահատում է դրա իրական արժեքը, քանի որ չի ներառում Opus 5 պահուստային գործարկումների արժեքը, որոնք կիրառվել են առաջադրանքների մոտ 40%-ում։
GPT‑6 Sol-ը նաև շատ ավելի ցածր արժեքով գերազանցում է Claude Fable 5.1-ին և նույնիսկ առաջ է անցնում ցածր ջանքով GPT‑6 Astra-ից։
Մոդել (և ջանք) | Արդյունք | Մեկ առաջադրանքի արժեքը |
|---|---|---|
GPT‑6 Sol (գերհզոր) | 33.2% | $0.27 |
GPT‑6 Astra (ցածր) | 30.3% | GPT‑6 Sol-ից 3.9 անգամ |
Claude Opus 5 (Max) | 26.9% | GPT‑6 Sol-ից 11.1 անգամ |
Claude Fable 5.1՝ Opus 5 պահուստային տարբերակով (Max) | 31.4% | GPT‑6 Sol-ից >8.9 անգամ (պահուստային տարբերակի արժեքը չի հաղորդվել) |
Բարդ մասնագիտական աշխատանքային հոսքերում ագենտներին գնահատող Agents’ Last Exam թեստում առավելագույն ջանքով GPT‑6 Sol-ը հավաքում է 56.4%՝ գերազանցելով գնահատման ընթացքում Claude Opus 5-ի ամենաբարձր արդյունքը և մեկ առաջադրանքի համար արժենալով 60%-ով պակաս։
Agents’ Last Exam V1(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները գնահատվում են երկարատև և տնտեսական արժեք ունեցող առաջադրանքներում, որոնք ներառում են 55 ենթաճյուղ և համակարգչով կատարվող մասնագիտական աշխատանքի հիմնական ոլորտների մեծ մասը։
Պատասխանի օգտակարությունը կախված է փաստերի ճշգրտությունից, և մենք շարունակում ենք բարելավել փաստական հուսալիությունը։ Փաստական ճշգրտության մեր ներքին գնահատման ժամանակ, որը հիմնված է ինքնությունը չբացահայտող իրական զրույցների վրա, որոնցում օգտատերերը նշել էին մեր մոդելների սխալները, GPT‑6 Sol-ը մոտ երկու անգամ քիչ սխալ է թույլ տալիս, քան իր նախորդը՝ շատ ավելի ցածր արժեքով մոտենալով Astra-ի հուսալիությանը։ GPT‑6 Luna-ն նույնպես զգալիորեն բարելավվել է. ջանքի ավելի բարձր մակարդակներում այն մոտ հարյուրապատիկ ցածր արժեքով հավասարվում է GPT‑5.6 Sol-ին։
Այստեղ փաստական ճշգրտությունը գնահատում ենք ինքնությունը չբացահայտող ChatGPT զրույցներում, որոնցում օգտատերերը նշել էին նախորդ մոդելի փաստական սխալը։ Սխալներ առաջացնող այս զրույցները բնորոշ օգտագործումը չեն ներկայացնում, որտեղ փաստական սխալներն ավելի հազվադեպ են։ Արդյունքները պատասխանի երկարության նկատմամբ չեն ճշգրտվել, սակայն ծավալունության մեր փորձարկումները գրեթե ոչ մի կախվածություն չեն ցույց տվել պատասխանի երկարությունից։
Այս տարի ծրագրավորող ագենտներն սկսել են կատարել աննախադեպ բարդություն, ծավալ և տևողություն ունեցող առաջադրանքներ։ OpenAI-ում մեր ներքին օգտագործումն աճել է երկրաչափական պրոգրեսիայով։ API-ի գներով հաշվարկելիս թոքենների օրական օգտագործումը միջին հետազոտողի համար գերազանցել է $600-ը, իսկ 90-րդ պերսենտիլում գտնվող հետազոտողների համար՝ $7,000-ը (Հետազոտությունների արագացում. հայացք OpenAI-ի ներսից)։ Քանի որ ծրագրավորող ագենտները ստանձնում են ավելի երկար և պահանջկոտ առաջադրանքներ, շարունակական օգտագործման արժեքն ավելի է կարևորվում։ GPT‑6 Sol-ը և Luna-ն ծրագրավորման բարձր արդյունավետությունը համադրում են API-ի ավելի ցածր գների հետ՝ մշակողներին կրկնակի մշակումների ավելի մեծ հնարավորություն տալով, իսկ թիմերին՝ վստահություն, որ Codex-ին կարող են ավելի հավակնոտ առաջադրանքներ հանձնարարել։
Իրական կոդային բազաներում ծրագրավորող ագենտների՝ միավորման պատրաստ փոփոխություններ ստեղծելու կարողությունը գնահատող FrontierCode թեստում GPT‑6 Sol-ը զգալիորեն գերազանցում է GPT‑5.6 Sol-ին և շատ ավելի ցածր արժեքով հավասարվում գերհզոր ջանքով Claude Fable 5.1-ին։
FrontierCode 1.1 Main(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները կոդ են գրում, որը գնահատվում է ոչ միայն ճշգրտությամբ, այլև «միավորելիությամբ», օրինակ՝ թեստերի որակով, շրջանակի պահպանմամբ, կոդի ոճով և կոդային բազայի չափորոշիչներին համապատասխանությամբ։
Իրական կոդային բազաներում ծրագրային ապահովման մշակման բարդ առաջադրանքների կատարումը ստուգող DeepSWE v1.1 թեստում առավելագույն ջանքով GPT‑6 Sol-ը հավաքում է 68.8%՝ ընդամենը 1.1 տոկոսային կետով զիջելով գնահատման ընթացքում Claude Fable 5-ի ամենաբարձր՝ գերհզոր ջանքով 69.9% արդյունքին, իսկ մեկ առաջադրանքի արժեքը մոտ 80%-ով ցածր է։
Առավելագույն ջանքով GPT‑6 Luna-ն հավաքում է 66.6%՝ համադրելի միջին ջանքով Claude Opus 5-ի և Fable 5-ի հետ։ Այս համեմատություններում Luna-ի մեկ առաջադրանքի արժեքը Opus 5-ից 93%-ով, իսկ Fable 5-ից՝ 96%-ով ցածր է։
DeepSWE 1.1(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները լուծում են ծրագրային ապահովման մշակման ինքնատիպ, երկարատև առաջադրանքներ։
Թեև GPT‑6 Astra-ն շարունակում է մնալ համակարգչի օգտագործման աշխարհի լավագույն մոդելը, GPT‑6 Sol-ը և Luna-ն իրենց նախորդներից ավելի ծախսարդյունավետ են։ OSWorld 2.0 անցանց թեստում գերհզոր ջանքով GPT‑6 Sol-ը միջին ջանքով Claude Opus 5-ին մոտ արդյունք է գրանցում՝ 60.5%՝ 60.3%-ի դիմաց, իսկ մեկ առաջադրանքի արժեքը մոտ 80%-ով ցածր է։ GPT‑6 Luna-ն (Max) կարող է իր արժեքի մեկ տասներորդով գերազանցել GPT‑5.6 Sol-ին (Միջին)։
OSWorld 2.0(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները փորձում են կատարել համակարգչի օգտագործման երկարատև աշխատանքային հոսքեր, որոնք ներառում են առօրյա և մասնագիտական առաջադրանքներ։ Ներկայացնում ենք v2026.08.08 թողարկման անցանց հավաքածուի մասնակի պարգևը։
GPT‑6 Astra-ի հաղորդակցման բարելավված ոճը ներդրել ենք նաև Sol-ում և Luna-ում, ինչը, մեր կարծիքով, հատկապես նկատելի կլինի տեխնիկական և ծրագրավորման թեմաներով զրույցներում։ Ակնկալեք ավելի հստակ ձևակերպումներ, քիչ մասնագիտական ժարգոն, ավելի քիչ տարօրինակ արտահայտություններ ու անօգուտ մանրամասներ և ընդհանուր առմամբ փոքր-ինչ կարճ պատասխաններ՝ առանց բովանդակության կորստի։
Թեև ոճը սուբյեկտիվ է, այստեղ նախընտրում ենք GPT‑6 Sol-ի պատասխանը։ Այն այդքան արագ եզրակացություններ չի անում, ավելի քիչ ժամանակ է ծախսում հարց տվողի համար ակնհայտ մանրամասները կրկնելու վրա (օրինակ՝ որ կայքն ունի չորս էջ), ավելի քիչ անորոշ լեզու է գործածում (օրինակ՝ «բենտոյի տպավորություն», «վերաձևավորում… այդ համակարգի շուրջ»), ավելի բաց է ներկայացնում՝ ինչ է ստուգել և ինչ՝ ոչ, ու անհարկի չի կիսվում իրականացման մանրամասներով, օրինակ՝ պատկերների գործիքին տված իր հարցումով։
Թոքենների ավելի ցածր գներից բացի՝ GPT‑6‑ի հիման վրա արտադրանք ստեղծող մշակողներին օգնում ենք ավելի շատ խնայել իրենց հավելվածների վերօգտագործած համատեքստի վրա։ Բարելավել ենք GPT‑6‑ի հարցումների քեշավորումը՝ լռելյայն ապահովելով քեշի համընկնման ավելի բարձր ցուցանիշներ։ Սա ագենտներին օգնում է վերօգտագործել ավելի շատ համատեքստ, ավելի արագ պատասխանել և քեշավորված մուտքային թոքենների ընթերցման համար ստանալ 90% զեղչ։
Մշակողները նաև քեշավորման արդյունավետությունը չափելու և օպտիմալացնելու ավելի շատ եղանակներ ունեն։
Վերահսկեք և ախտորոշեք։ Հարցումների քեշավորման կառավարման վահանակը(բացվում է նոր պատուհանում) ցույց է տալիս, թե մուտքային տվյալների որ մասն է քեշավորվում և ինչպես է դա փոխվում ժամանակի ընթացքում։ Ախտորոշման գործիքը(բացվում է նոր պատուհանում) պարզաբանում է քեշավորման բաց թողնված հնարավորությունները և հուշում՝ ինչ շտկել։
Կարգավորեք դատողության ջանքն ու գործիքների հասանելիությունը՝ առանց քեշը խախտելու։ Բարդ առաջադրանքների համար ավելացրեք դատողության ջանքը(բացվում է նոր պատուհանում), իսկ պարզ շարունակական հարցերի համար՝ նվազեցրեք այն։ Կարող եք նաև միացնել կամ անջատել գործիքները(բացվում է նոր պատուհանում)՝ ըստ ձեր ագենտի փոփոխվող կարիքների։ Այժմ երկու կարգավորումն էլ պահպանում են նախորդ համատեքստը՝ քեշում վերօգտագործելու համար։
Օպտիմալացրեք, թե որ նախածանցներն են քեշավորվում։ Հստակ սահմանված ընդհատման կետերը մշակողներին թույլ են տալիս ընտրել, թե որտեղ են ավարտվում քեշավորված հարցումների նախածանցները։ Սա մշակողներին ավելի մեծ վերահսկողություն է տալիս քեշի վերօգտագործման նկատմամբ և կարող է բարելավել արդյունավետությունը։
GitHub-ի տվյալներով՝ վերջին մի քանի ամսվա ընթացքում այս բարելավումները OpenAI-ի մոդելներին ուղղված միլիարդավոր հարցումներում ավելի քան 50%-ով նվազեցրել են նորից մշակման կարիք ունեցող հարցման թոքենների բաժինը՝ օգնելով Copilot-ին ավելի արագ պատասխանել։
GPT‑6 Sol-ը և Luna-ն հիմնվում են Astra-ի հետ ներդրված համապատասխանեցման աշխատանքների վրա. Astra-ն մինչ օրս մեր նպատակներին առավել համապատասխանեցված մոդելն է։ Համապատասխանեցման մեր գնահատումներում թե՛ Sol-ը, թե՛ Luna-ն բարելավումներ են ցուցաբերում իրենց GPT‑5.6 տարբերակների համեմատ, այդ թվում՝ ավելի հազվադեպ են իրենց ծրագրավորման աշխատանքի վերաբերյալ մոլորեցնող պնդումներ անում։
Ստորև ներկայացված գնահատումները դիտավորյալ ստուգում են բարդ իրավիճակներ և չեն չափում բնորոշ օգտագործման ընթացքում ձախողումների հաճախականությունը։ Ամբողջական արդյունքները տեսեք համակարգի քարտում(բացվում է նոր պատուհանում)։
Այսօրվանից GPT‑6 Sol-ը և GPT‑6 Luna-ն հասանելի են ChatGPT Աշխատանքում և Codex-ում Plus, Pro, Business, Enterprise և Edu բոլոր օգտատերերին։ Free և Go օգտատերերը կարող են GPT‑6 Luna-ն օգտագործել աշխատասեղանի հավելվածում։ Այս մոդելները դեռ հասանելի չեն Զրույցում։ OpenAI API-ում դրանք հասանելի են որպես gpt-6-sol և gpt-6-luna։
Ծառայությունը բոլորի համար կայուն պահելու նպատակով նախատեսում ենք օրվա ընթացքում այս մոդելները ChatGPT‑ում հասանելի դարձնել աստիճանաբար։ Եթե նոր մոդելները չեք տեսնում ChatGPT Աշխատանքում կամ Codex-ում, խնդրում ենք ավելի ուշ կրկին փորձել։
GPT‑ի գնահատումներն իրականացվել են մեր հետազոտական միջավայրում կամ API-ի միջոցով, որոնք համակարգային հարցումների, հասանելի գործիքների և այլ տարբերությունների պատճառով կարող են փոքր-ինչ այլ արդյունք տալ, քան արտադրական ChatGPT‑ը։ Մրցակից մոդելների գնահատումները վերցվել են հրապարակայնորեն հասանելի զեկույցներից։ Claude Fable 5-ի արդյունքները ներկայացվել են այն դեպքերում, երբ Claude Fable 5.1-ի արդյունքները հասանելի չեն եղել։


