GPT-6.1Sol
Astra-ին մոտ բանականություն՝ հինգ անգամ ցածր գնով, կայուն առաջադեմ արդյունավետության համար
Ներկայացնում ենք GPT‑6.1 Sol-ը՝ GPT‑6 Sol-ի բարելավված տարբերակը, որը բացառիկ բարձր արդյունքներ է ցույց տալիս ագենտային կոդավորման, համակարգչի օգտագործման և մասնագիտական աշխատանքի մեջ։ Բարդ առաջադրանքներում այն Sol-ին մոտեցնում է GPT‑6 Astra-ին՝ մուտքային և ելքային թոքենների համար Astra-ի ստանդարտ գների ընդամենը մեկ հինգերորդով։ Սա ծրագրավորողներին ավելի մեծ հնարավորություն է տալիս նույն բյուջեով ստեղծելու և գործարկելու հզոր ագենտներ։
GPT‑6.1 Sol-ն ապահովում է Astra-ին մոտ արդյունավետություն՝ Sol-ի գնով, և իր արդյունավետության մակարդակում այսօր հասանելի ամենածախսարդյունավետ մոդելն է։ Մեկ միլիոն քեշավորված մուտքային թոքենն արժե ընդամենը $0,10՝ 95% զեղչ մուտքային թոքենների ստանդարտ գնից։ Սա ավելի մատչելի է դարձնում այն ագենտային աշխատանքային ծանրաբեռնվածությունները, որոնք պահանջում են կրկնվող հարցումներում վերօգտագործել համատեքստը։
GPT‑6 Astra-ն ընդհանուր առմամբ մնում է մեր ամենահզոր առաջադեմ մոդելը։ GPT‑6.1 Sol-ն առաջարկում է հնարավորությունների և արժեքի նոր հավասարակշռություն՝ այն կարևոր աշխատանքների համար, որոնք օգտատերերը ցանկանում են ավելի հաճախ կատարել և API-ի հաճախորդների համար, որոնք մեծ մասշտաբով հավելվածներ են ստեղծում և գործարկում։

GPT‑6.1 Sol-ը զգալիորեն գերազանցում է GPT‑6 Sol-ին բարդ մասնագիտական աշխատանքներում՝ կոդ գրելուց ու վրիպազերծելուց մինչև փաստաթղթեր հասկանալն ու բազմաքայլ բիզնես գործընթացներ կատարելը։ Այս գնահատումներից մի քանիսում այն մոտենում է GPT‑6 Astra-ի արդյունավետությանը՝ զգալիորեն ցածր գնով։
DeepSWE v1.1 թեստում, որը գնահատում է իրական կոդային բազաներում ծրագրային ճարտարագիտության բարդ առաջադրանքների կատարումը, GPT‑6.1 Sol-ը հավասարվում է GPT‑6 Astra-ին՝ մոտ հինգ անգամ ցածր գնով։ Միաժամանակ այն դատողության ավելի ցածր ինտենսիվությամբ և ավելի ցածր գնով 6,4 տոկոսային կետով գերազանցում է GPT‑6 Sol-ի լավագույն արդյունքը։
DeepSWE 1.1(բացվում է նոր պատուհանում) թեստում ԱԲ գործակալները լուծում են ծրագրային ճարտարագիտության ինքնատիպ, երկարատև աշխատանք պահանջող առաջադրանքներ։
GDP.pdf թեստը չափում է՝ որքան ճշգրիտ են մոդելները պատասխանում մասնագիտական հարցերին՝ օգտագործելով բարդ PDF փաստաթղթեր՝ աղյուսակներով, գրաֆիկներով, գծապատկերներով և մանրատառ մանրամասներով։ Դատողության փորձարկված կարգավորումներում GPT‑6.1 Sol-ն ավելի բարձր արդյունք է ցույց տալիս, քան պահուստային տարբերակներով Opus 5.5-ը՝ մեկ առաջադրանքի համար ավելի քան երկու անգամ ցածր գնով։ Այն նաև մեկ առաջադրանքի համար մոտ հինգ անգամ ցածր գնով մոտենում է GPT‑6 Astra-ի՝ ոլորտում լավագույն արդյունավետությանը։
GDP.pdf(բացվում է նոր պատուհանում) թեստում մոդելները պետք է պատասխանեն ֆինանսների, առողջապահության, իրավունքի և յոթ այլ մասնագիտական ոլորտների աշխատանքային գործընթացներից վերցված բարդ PDF փաստաթղթերի վերաբերյալ իրական հարցումներին։
AutomationBench թեստում, որը չափում է՝ արդյոք ագենտները ճիշտ են կատարում բազմաքայլ բիզնես գործընթացները, GPT‑6.1 Sol-ը դատողության միջին ինտենսիվության դեպքում 2.2 տոկոսային կետով գերազանցում է Opus 5.5-ին՝ մոտ երեք անգամ ցածր գնով։ Այս արդյունքը նաև 4.8 տոկոսային կետով բարձր է նույն կարգավորմամբ GPT‑6 Sol-ի արդյունքից։
In AutomationBench 1.0.6(բացվում է նոր պատուհանում), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol-ը նաև զգալի առաջընթաց է գրանցում համակարգչային հավելվածների հետ փոխգործակցություն պահանջող առաջադրանքներում։ OSWorld 2.0-ի անցանց հավաքածուում, որը գնահատում է ագենտներին համակարգչի օգտագործման բարդ աշխատանքային գործընթացներում, GPT‑6.1 Sol-ը դատողության առավելագույն ինտենսիվության դեպքում յոթ տոկոսային կետով գերազանցում է GPT‑6 Sol-ին՝ ավելի քան երկու անգամ ցածր գնով։ Դատողության առավելագույն ինտենսիվության դեպքում այն Astra-ի արդյունքից հետ է մնում ընդամենը 2.1 տոկոսային կետով՝ մեկ առաջադրանքի համար մոտ յոթ անգամ ցածր գնով։
In OSWorld 2.0(բացվում է նոր պատուհանում), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Terminal-Bench Science 0.1 թեստը գնահատում է գիտական աշխատանքային գործընթացները, այդ թվում՝ տվյալների վերլուծությունը, մոդելավորումը և թեորեմների ապացուցումը։ Այստեղ GPT‑6.1 Sol-ը դատողության առավելագույն ինտենսիվության դեպքում ավելի քան կրկնապատկում է GPT‑6 Sol-ի արդյունքը՝ մեկ առաջադրանքի համար ավելի քան երկու անգամ ցածր գնով։ Առավելագույն ինտենսիվության դեպքում GPT‑6.1 Sol-ով մեկ առաջադրանքն արժե միջինը $5.47՝ Opus 5.5-ի $23.21-ի և Astra-ի $23.80-ի համեմատ։ Այն ապահովում է գիտական աշխատանքի զգալի կարողություններ՝ երկու մոդելներից յուրաքանչյուրի համեմատ ավելի քան 75%-ով ցածր գնով։
GPT‑6 Astra-ն շարունակում է փորձարկված մոդելների շարքում գրանցել ամենաբարձր արդյունքը՝ 68.1%, և այն պետք է օգտագործել ամենաբարդ գիտահետազոտական առաջադրանքների համար։
Terminal-Bench Science 0.1(բացվում է նոր պատուհանում) թեստում գործակալները կոդի և տերմինալի գործիքների միջոցով իրականացնում են գիտահետազոտական աշխատանքներ՝ ներառյալ տվյալների վերլուծությունը, սիմուլյացիաների գործարկումը և մոդելների համապատասխանեցումը տվյալներին։
GPT‑6.1 Sol-ը նաև բարելավում է բարդ հարցումների պատասխանների փաստական ճշտությունը։ Դատողության գերբարձր ինտենսիվության դեպքում դրա փաստական սխալների հաճախականությունը 4,1% է՝ GPT‑6 Sol-ի 4,5%-ի համեմատ, և մոտենում է նույն կարգավորմամբ Astra-ի 4,0% ցուցանիշին։ Ընդ որում, մեկ առաջադրանքի արժեքը մոտ 83%-ով ցածր է Astra-ի արժեքից։
Այս գնահատումը չափում է առնվազն մեկ փաստական սխալ պարունակող պատասխանների բաժինը՝ օգտագործելով ապանձնավորված զրույցներ, որոնցում օգտատերերը նշել էին նախորդ մոդելի սխալը։ Դիտավորյալ ընտրված այս բարդ հարցումները չեն արտացոլում սովորական օգտագործումը։
Փաստական ճշտությունը գնահատում ենք ChatGPT‑ի ապանձնավորված զրույցներով, որոնցում օգտատերերը նշել էին նախորդ մոդելի փաստական սխալը։ Սխալներ առաջացնող այս զրույցները չեն արտացոլում սովորական օգտագործումը, որի դեպքում փաստական սխալներն ավելի հազվադեպ են։
Օգտատիրոջ մտադրությանն ու անվտանգության պահանջներին համապատասխանության մեր գնահատումներում GPT‑6.1 Sol-ը զգալի բարելավումներ է ցույց տալիս GPT‑6 Sol-ի համեմատ՝ մոտենալով GPT‑6 Astra-ին։
GPT‑6.1 Sol-ն ավելի թափանցիկ է իր սահմանափակումների հարցում և ավելի հուսալիորեն է հետևում օգտատիրոջ մտադրությանը և անվտանգության սահմանափակումներին։ Բարդ գնահատումներում այն ավելի հազվադեպ է ձախողվում, քան GPT‑6 Sol-ը՝ որոնման գործիքների խափանումների մասին հայտնելու, հստակ սահմանափակումները պահպանելու և ագենտային առաջադրանքների ընթացքում չարտոնված արդյունքներից խուսափելու հարցում։ Անվտանգության ավտոմատ ստուգիչը շրջանցելու փորձեր չենք արձանագրել, ինչպես և GPT‑6 Astra-ի ու GPT‑6 Sol-ի դեպքում։
Ստորև ներկայացված գնահատումներում դիտավորյալ փորձարկվում են բարդ իրավիճակներ․ դրանք չեն չափում սովորական օգտագործման ընթացքում ձախողումների հաճախականությունը։
GPT‑6.1 Sol-ն այսօրվանից հասանելի է Plus, Pro, Business, Enterprise և Edu պլանների բոլոր օգտատերերին՝ ChatGPT Work և Codex միջավայրերում։ Այս մոդելները դեռ հասանելի չեն Զրույց ռեժիմում։ Ծրագրավորողները կարող են այն օգտագործել նաև OpenAI API-ի միջոցով՝ gpt-6.1-sol անվամբ։ API-ի ստանդարտ գներն են՝ $2՝ մեկ միլիոն մուտքային թոքենի, $0.10՝ մեկ միլիոն քեշավորված մուտքային թոքենի և $10՝ մեկ միլիոն ելքային թոքենի համար։
Միաժամանակ թողարկում ենք GPT‑6 Astra Ultrafast-ը՝ աշխարհի ամենաարագ առաջադեմ մոդելը, որը մինչև 8 անգամ ավելի արագ է GPT‑6 Astra-ից, ինչպես նաև GPT‑6.1 Sol Ultrafast-ը։ Դրանք հասանելի են API-ում, ինչպես նաև ChatGPT Work և Codex միջավայրերում՝ մեր նոր՝ օգտագործման ամենաբարձր սահմանաչափերով Pro պլանի օգտատերերին՝ ամսական $500-ով։ GPT‑6.1 Sol Ultrafast-ի շնորհիվ ծրագրավորողները կարող են ստանալ Astra-ին մոտ բանականություն՝ մինչև 8 անգամ ավելի արագ՝ API-ի համար ծախսելով մոտավորապես այնքան, որքան նախկինում GPT‑6 Astra-ի դեպքում։
Հեղինակ
GPT-ի գնահատումներն իրականացվել են մեր հետազոտական միջավայրում կամ մեր API-ի միջոցով։ Արդյունքները կարող են փոքր-ինչ տարբերվել օգտատերերին հասանելի ChatGPT-ի արդյունքներից՝ համակարգային հարցումների, հասանելի գործիքների, դատողության ինտենսիվության և այլ տարբերությունների պատճառով։ Մրցակից մոդելների գնահատումները վերցված են հանրամատչելի զեկույցներից։

