Անցնել հիմնական բովանդակությանը
OpenAI

Ներկայացնում ենք GPT‑6 Sol-ը և Luna-ն

Առաջադեմ բանականությունն ամենօրյա աշխատանքում կիրառելու ավելի շատ եղանակներ։

Բեռնվում է…

Այս ամսվա սկզբին ներկայացրինք GPT‑6 Astra-ն՝ աշխարհի ամենախելացի և մեր նպատակներին առավել համապատասխանեցված մոդելը։ Թեև ամենաբարդ ու կարևոր նախագծերը դեռ պահանջում են Astra-ի ամբողջ ներուժը, աշխատանքները տարբերվում են իրենց ծավալով, տեմպով և բյուջեով։

Ուստի GPT‑6‑ի ընտանիքն ընդլայնում ենք GPT‑6 Sol և GPT‑6 Luna մոդելներով։ GPT‑6 Astra-ն սկիզբ դրեց բանականության նոր սերնդի, իսկ այս մոդելներն այդ բանականության առավելությունները հասանելի են դարձնում՝ առաջադեմ արդյունավետություն ապահովելով ծախսերի առումով։ GPT‑6 Sol-ը և Luna-ն վարժեցրել ենք GPT‑6 Astra-ի մեթոդներին նման մեթոդներով՝ ավելի արագ և մատչելի մոդելներում ներդնելով Astra-ի առաջատար ձեռքբերումները մասնագիտական աշխատանքի, փաստական ճշգրտության, ծրագրավորման, համակարգչի օգտագործման և համապատասխանեցման ոլորտներում։

GPT‑6 մոդելներն առաջատար են ծախս–բանականություն ամբողջ կորի երկայնքով՝ յուրաքանչյուր մակարդակի բացառիկ կարողությունները համադրելով դրանք մեծ մասշտաբով արդյունավետ մատուցող ենթակառուցվածքի հետ։ Քեշավորման և ինֆերենսի բարելավումները թույլ են տալիս այս մոդելները տրամադրել ավելի ցածր արժեքով, իսկ այդ խնայողություններն ուղղակիորեն փոխանցում ենք օգտատերերին ու հաճախորդներին՝ GPT‑5.6-ի գովազդային գների համեմատ Sol-ի և Luna-ի API գները նվազեցնելով 50%-ով։ Այս բարելավումները միասին առաջադեմ ԱԲ-ն գործնական են դարձնում ավելի շատ առօրյա առաջադրանքների և մեծածավալ կիրառությունների համար։

GPT‑6 API-ի գները

Մոդել

Մուտք

Ելք

Գնի նվազում

GPT‑6 Sol
GPT‑5.6 Sol-ի համեմատ

$4 → $2

$20 → $10

50%-ով էժան

GPT‑6 Luna
GPT‑5.6 Luna-ի համեմատ

$0.20 → $0.10

$1.20 → $0.50

50%-ով էժան

Գները նշված են 1 միլիոն թոքենի համար։

GPT‑6 Astra-ն շարունակում է բոլոր առումներով մնալ մեր լավագույն մոդելը։ Ընտրեք այն, երբ ցանկանում եք լավագույն արդյունքներն ու անզիջում փորձառություն։

Առաջընթաց մոդելների ամբողջ ընտանիքում

GPT‑6 Sol-ը և Luna-ն բանականության բարելավումներ ու ծախսային արդյունավետություն են բերում ձեզ արդեն ծանոթ և կիրառվող մոդելներին՝ բարդ աշխատանքն ավարտին հասցնելու համար առավել օգտակար կարողությունների շրջանակում։

Մասնագիտական աշխատանք

GPT‑6 Sol-ը կարող է կատարել բարդ աշխատանքային առաջադրանքներ՝ օգտագործման ավելի բարձր սահմանաչափերի և ցածր արժեքի շնորհիվ կրկնակի մշակումների համար ավելի մեծ հնարավորություն տալով։ Այն նաև ավելի բարձր բանականություն և ավելի լավ արդյունքներ է ապահովում համադրելի գին ունեցող մրցակից մոդելների համեմատ։

Հավելվածներում բիզնես աշխատանքային հոսքերը ստուգող AutomationBench թեստում GPT‑6 Sol-ը գերհզոր ջանքով գերազանցում է առավելագույն ջանքով Claude Opus 5-ին՝ մեկ առաջադրանքի համար արժենալով Opus 5-ի արժեքի ընդամենը 9%-ը։ Հզոր ջանքի դեպքում GPT‑6 Luna-ն իր նախորդին գերազանցում է 5.4 տոկոսային կետով՝ մեկ առաջադրանքի արժեքը նվազեցնելով 58%-ով։

AutomationBench 1.0.6⁠(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները ստուգվում են սկզբից մինչև վերջ աշխատանքային հոսքերում՝ վաճառքի, մարքեթինգի, գործառնությունների, աջակցության, ֆինանսների և կադրերի ոլորտների 47 գործիքով։ Claude Fable 5.1-ի տվյալը թերագնահատում է դրա իրական արժեքը, քանի որ չի ներառում Opus 5 պահուստային գործարկումների արժեքը, որոնք կիրառվել են առաջադրանքների մոտ 40%-ում։

GPT‑6 Sol-ը նաև շատ ավելի ցածր արժեքով գերազանցում է Claude Fable 5.1-ին և նույնիսկ առաջ է անցնում ցածր ջանքով GPT‑6 Astra-ից։

Մոդել (և ջանք)

Արդյունք

Մեկ առաջադրանքի արժեքը

GPT‑6 Sol (գերհզոր)

33.2%

$0.27

GPT‑6 Astra (ցածր)

30.3%

GPT‑6 Sol-ից 3.9 անգամ

Claude Opus 5 (Max)

26.9%

GPT‑6 Sol-ից 11.1 անգամ

Claude Fable 5.1՝ Opus 5 պահուստային տարբերակով (Max)

31.4%

GPT‑6 Sol-ից >8.9 անգամ

(պահուստային տարբերակի արժեքը չի հաղորդվել)

Բարդ մասնագիտական աշխատանքային հոսքերում ագենտներին գնահատող Agents’ Last Exam թեստում առավելագույն ջանքով GPT‑6 Sol-ը հավաքում է 56.4%՝ գերազանցելով գնահատման ընթացքում Claude Opus 5-ի ամենաբարձր արդյունքը և մեկ առաջադրանքի համար արժենալով 60%-ով պակաս։

Agents’ Last Exam V1⁠(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները գնահատվում են երկարատև և տնտեսական արժեք ունեցող առաջադրանքներում, որոնք ներառում են 55 ենթաճյուղ և համակարգչով կատարվող մասնագիտական աշխատանքի հիմնական ոլորտների մեծ մասը։

Փաստական ճշգրտություն

Պատասխանի օգտակարությունը կախված է փաստերի ճշգրտությունից, և մենք շարունակում ենք բարելավել փաստական հուսալիությունը։ Փաստական ճշգրտության մեր ներքին գնահատման ժամանակ, որը հիմնված է ինքնությունը չբացահայտող իրական զրույցների վրա, որոնցում օգտատերերը նշել էին մեր մոդելների սխալները, GPT‑6 Sol-ը մոտ երկու անգամ քիչ սխալ է թույլ տալիս, քան իր նախորդը՝ շատ ավելի ցածր արժեքով մոտենալով Astra-ի հուսալիությանը։ GPT‑6 Luna-ն նույնպես զգալիորեն բարելավվել է. ջանքի ավելի բարձր մակարդակներում այն մոտ հարյուրապատիկ ցածր արժեքով հավասարվում է GPT‑5.6 Sol-ին։

Այստեղ փաստական ճշգրտությունը գնահատում ենք ինքնությունը չբացահայտող ChatGPT զրույցներում, որոնցում օգտատերերը նշել էին նախորդ մոդելի փաստական սխալը։ Սխալներ առաջացնող այս զրույցները բնորոշ օգտագործումը չեն ներկայացնում, որտեղ փաստական սխալներն ավելի հազվադեպ են։ Արդյունքները պատասխանի երկարության նկատմամբ չեն ճշգրտվել, սակայն ծավալունության մեր փորձարկումները գրեթե ոչ մի կախվածություն չեն ցույց տվել պատասխանի երկարությունից։

Ծրագրավորում

Այս տարի ծրագրավորող ագենտներն սկսել են կատարել աննախադեպ բարդություն, ծավալ և տևողություն ունեցող առաջադրանքներ։ OpenAI-ում մեր ներքին օգտագործումն աճել է երկրաչափական պրոգրեսիայով։ API-ի գներով հաշվարկելիս թոքենների օրական օգտագործումը միջին հետազոտողի համար գերազանցել է $600-ը, իսկ 90-րդ պերսենտիլում գտնվող հետազոտողների համար՝ $7,000-ը (Հետազոտությունների արագացում. հայացք OpenAI-ի ներսից⁠)։ Քանի որ ծրագրավորող ագենտները ստանձնում են ավելի երկար և պահանջկոտ առաջադրանքներ, շարունակական օգտագործման արժեքն ավելի է կարևորվում։ GPT‑6 Sol-ը և Luna-ն ծրագրավորման բարձր արդյունավետությունը համադրում են API-ի ավելի ցածր գների հետ՝ մշակողներին կրկնակի մշակումների ավելի մեծ հնարավորություն տալով, իսկ թիմերին՝ վստահություն, որ Codex-ին կարող են ավելի հավակնոտ առաջադրանքներ հանձնարարել։

Իրական կոդային բազաներում ծրագրավորող ագենտների՝ միավորման պատրաստ փոփոխություններ ստեղծելու կարողությունը գնահատող FrontierCode թեստում GPT‑6 Sol-ը զգալիորեն գերազանցում է GPT‑5.6 Sol-ին և շատ ավելի ցածր արժեքով հավասարվում գերհզոր ջանքով Claude Fable 5.1-ին։

FrontierCode 1.1 Main⁠(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները կոդ են գրում, որը գնահատվում է ոչ միայն ճշգրտությամբ, այլև «միավորելիությամբ», օրինակ՝ թեստերի որակով, շրջանակի պահպանմամբ, կոդի ոճով և կոդային բազայի չափորոշիչներին համապատասխանությամբ։

Իրական կոդային բազաներում ծրագրային ապահովման մշակման բարդ առաջադրանքների կատարումը ստուգող DeepSWE v1.1 թեստում առավելագույն ջանքով GPT‑6 Sol-ը հավաքում է 68.8%՝ ընդամենը 1.1 տոկոսային կետով զիջելով գնահատման ընթացքում Claude Fable 5-ի ամենաբարձր՝ գերհզոր ջանքով 69.9% արդյունքին, իսկ մեկ առաջադրանքի արժեքը մոտ 80%-ով ցածր է։

Առավելագույն ջանքով GPT‑6 Luna-ն հավաքում է 66.6%՝ համադրելի միջին ջանքով Claude Opus 5-ի և Fable 5-ի հետ։ Այս համեմատություններում Luna-ի մեկ առաջադրանքի արժեքը Opus 5-ից 93%-ով, իսկ Fable 5-ից՝ 96%-ով ցածր է։

DeepSWE 1.1⁠(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները լուծում են ծրագրային ապահովման մշակման ինքնատիպ, երկարատև առաջադրանքներ։

Համակարգչի օգտագործում

Թեև GPT‑6 Astra-ն շարունակում է մնալ համակարգչի օգտագործման աշխարհի լավագույն մոդելը, GPT‑6 Sol-ը և Luna-ն իրենց նախորդներից ավելի ծախսարդյունավետ են։ OSWorld 2.0 անցանց թեստում գերհզոր ջանքով GPT‑6 Sol-ը միջին ջանքով Claude Opus 5-ին մոտ արդյունք է գրանցում՝ 60.5%՝ 60.3%-ի դիմաց, իսկ մեկ առաջադրանքի արժեքը մոտ 80%-ով ցածր է։ GPT‑6 Luna-ն (Max) կարող է իր արժեքի մեկ տասներորդով գերազանցել GPT‑5.6 Sol-ին (Միջին)։

OSWorld 2.0⁠(բացվում է նոր պատուհանում)-ում ԱԲ ագենտները փորձում են կատարել համակարգչի օգտագործման երկարատև աշխատանքային հոսքեր, որոնք ներառում են առօրյա և մասնագիտական առաջադրանքներ։ Ներկայացնում ենք v2026.08.08 թողարկման անցանց հավաքածուի մասնակի պարգևը։

Համագործակցության ոճ

GPT‑6 Astra-ի հաղորդակցման բարելավված ոճը ներդրել ենք նաև Sol-ում և Luna-ում, ինչը, մեր կարծիքով, հատկապես նկատելի կլինի տեխնիկական և ծրագրավորման թեմաներով զրույցներում։ Ակնկալեք ավելի հստակ ձևակերպումներ, քիչ մասնագիտական ժարգոն, ավելի քիչ տարօրինակ արտահայտություններ ու անօգուտ մանրամասներ և ընդհանուր առմամբ փոքր-ինչ կարճ պատասխաններ՝ առանց բովանդակության կորստի։

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Թեև ոճը սուբյեկտիվ է, այստեղ նախընտրում ենք GPT‑6 Sol-ի պատասխանը։ Այն այդքան արագ եզրակացություններ չի անում, ավելի քիչ ժամանակ է ծախսում հարց տվողի համար ակնհայտ մանրամասները կրկնելու վրա (օրինակ՝ որ կայքն ունի չորս էջ), ավելի քիչ անորոշ լեզու է գործածում (օրինակ՝ «բենտոյի տպավորություն», «վերաձևավորում… այդ համակարգի շուրջ»), ավելի բաց է ներկայացնում՝ ինչ է ստուգել և ինչ՝ ոչ, ու անհարկի չի կիսվում իրականացման մանրամասներով, օրինակ՝ պատկերների գործիքին տված իր հարցումով։

Ագենտների և երկար զրույցների քեշավորման բարելավում

Թոքենների ավելի ցածր գներից բացի՝ GPT‑6‑ի հիման վրա արտադրանք ստեղծող մշակողներին օգնում ենք ավելի շատ խնայել իրենց հավելվածների վերօգտագործած համատեքստի վրա։ Բարելավել ենք GPT‑6‑ի հարցումների քեշավորումը՝ լռելյայն ապահովելով քեշի համընկնման ավելի բարձր ցուցանիշներ։ Սա ագենտներին օգնում է վերօգտագործել ավելի շատ համատեքստ, ավելի արագ պատասխանել և քեշավորված մուտքային թոքենների ընթերցման համար ստանալ 90% զեղչ։

Մշակողները նաև քեշավորման արդյունավետությունը չափելու և օպտիմալացնելու ավելի շատ եղանակներ ունեն։

GitHub-ի տվյալներով՝ վերջին մի քանի ամսվա ընթացքում այս բարելավումները OpenAI-ի մոդելներին ուղղված միլիարդավոր հարցումներում ավելի քան 50%-ով նվազեցրել են նորից մշակման կարիք ունեցող հարցման թոքենների բաժինը՝ օգնելով Copilot-ին ավելի արագ պատասխանել։

Շարունակում ենք բարելավել համապատասխանեցումը

GPT‑6 Sol-ը և Luna-ն հիմնվում են Astra-ի հետ ներդրված համապատասխանեցման աշխատանքների վրա. Astra-ն մինչ օրս մեր նպատակներին առավել համապատասխանեցված մոդելն է։ Համապատասխանեցման մեր գնահատումներում թե՛ Sol-ը, թե՛ Luna-ն բարելավումներ են ցուցաբերում իրենց GPT‑5.6 տարբերակների համեմատ, այդ թվում՝ ավելի հազվադեպ են իրենց ծրագրավորման աշխատանքի վերաբերյալ մոլորեցնող պնդումներ անում։

Ստորև ներկայացված գնահատումները դիտավորյալ ստուգում են բարդ իրավիճակներ և չեն չափում բնորոշ օգտագործման ընթացքում ձախողումների հաճախականությունը։ Ամբողջական արդյունքները տեսեք համակարգի քարտում⁠(բացվում է նոր պատուհանում)։

Հասանելիություն

Այսօրվանից GPT‑6 Sol-ը և GPT‑6 Luna-ն հասանելի են ChatGPT Աշխատանքում և Codex-ում Plus, Pro, Business, Enterprise և Edu բոլոր օգտատերերին։ Free և Go օգտատերերը կարող են GPT‑6 Luna-ն օգտագործել աշխատասեղանի հավելվածում։ Այս մոդելները դեռ հասանելի չեն Զրույցում։ OpenAI API-ում դրանք հասանելի են որպես gpt-6-sol և gpt-6-luna։

Ծառայությունը բոլորի համար կայուն պահելու նպատակով նախատեսում ենք օրվա ընթացքում այս մոդելները ChatGPT‑ում հասանելի դարձնել աստիճանաբար։ Եթե նոր մոդելները չեք տեսնում ChatGPT Աշխատանքում կամ Codex-ում, խնդրում ենք ավելի ուշ կրկին փորձել։


GPT‑ի գնահատումներն իրականացվել են մեր հետազոտական միջավայրում կամ API-ի միջոցով, որոնք համակարգային հարցումների, հասանելի գործիքների և այլ տարբերությունների պատճառով կարող են փոքր-ինչ այլ արդյունք տալ, քան արտադրական ChatGPT‑ը։ Մրցակից մոդելների գնահատումները վերցվել են հրապարակայնորեն հասանելի զեկույցներից։ Claude Fable 5-ի արդյունքները ներկայացվել են այն դեպքերում, երբ Claude Fable 5.1-ի արդյունքները հասանելի չեն եղել։

Հեղինակ

OpenAI