Բանականության նոր սերունդ
2026թ. սեպտեմբերի 22-ի թարմացում․ մենք ընդլայնում ենք մեր GPT‑6 ընտանիքը՝ GPT‑6 Sol և GPT‑6 Luna մոդելներով։ Իմացեք ավելին։
Ներկայացնում ենք GPT‑6 Astra-ն՝ աշխարհի ամենախելացի և լավագույնս համահունչ մոդելը։
GPT‑6 Astra-ն համադրում է նախնական ուսուցման, ամրապնդումով ուսուցման և համապատասխանեցման ոլորտներում տարիների հետազոտություններն ու խոշոր ներդրումները։ Astra-ն առաջատար մակարդակի է համակարգչի օգտագործման, վեբ դիտարկման, ծրագրային ապահովման ճարտարագիտության, կիբեռանվտանգության, գիտության և մասնագիտական աշխատանքի ոլորտներում։ Astra-ն FrontierMath-ի 4-րդ մակարդակում գրանցում է 98% արդյունք՝ արդեն իսկ օգնած լինելով մաթեմատիկայում լուծել երկար ժամանակ բաց մնացած խնդիրներ։ Astra-ն նաև ARC-AGI-3-ում գրանցում է 99.9% արդյունք, իսկ ExploitBench-ում՝ 100% արդյունք։ Այն նաև նոր առաջադեմ մակարդակ է սահմանում համակարգիչների և դիտարկիչների օգտագործման ոլորտում՝ անզուգական արագությամբ, ճշգրտությամբ և դատողությամբ կատարելով ամենաբարդ մասնագիտական աշխատանքը։
GPT‑6 Astra-ն այսօր հասանելի է դառնում սահմանափակ թվով կազմակերպությունների համար, իսկ առաջիկա օրերին հասանելի կլինի ChatGPT Plus, Pro, Business և Enterprise բոլոր օգտատերերին, ինչպես նաև OpenAI API-ի, Microsoft Azure-ի և AWS Bedrock-ի միջոցով։
Astra-ն մեր ամենահամապատասխանեցված մոդելն է՝ օգտատիրոջ մտադրությունն ու մոդելի վարքագիծը հասկանալու զգալի բարելավումներով․ կարող եք առաջադրանքներ պատվիրակել՝ ավելի մեծ վստահությամբ ապավինելով Astra-ի դատողությանը։ Սա փորձարկելու եղանակներից մեկի շրջանակում մենք Hugging Face-ի միջադեպի հիման վրա մշակել ենք նոր գնահատում, որը ստուգում է՝ բարդ կամ անհնարին առաջադրանքի առջև կանգնած մոդելը դուրս կգա՞ արդյոք իր նախատեսված շրջանակից։ GPT‑5.6 Sol-ի համեմատ, որը առանց արտադրական պաշտպանական միջոցների 48% դեպքերում դուրս է եկել լիազորված թիրախի սահմաններից, GPT‑6 Astra-ն դա արել է 0% դեպքերում։
Աշխարհի լավագույն համակարգչից օգտվելու մոդելը
GPT‑6 Astra-ն նոր սահմանագիծ է կերտում համակարգչի օգտագործման արագության, ճշգրտության և անվտանգության ոլորտներում։ Այն կարող է իր վրա վերցնել այնպիսի ձանձրալի և ժամանակատար առաջադրանքներ, ինչպիսիք են առցանց ձևաթղթերի լրացումը, CRM համակարգում հաճախորդների տվյալների թարմացումը և օրացույցի կազմակերպումը։ Այն կարող է առցանց հետազոտություն կատարել և ամփոփագրեր պատրաստել ձեր էլեկտրոնային փոստում կամ փաստաթղթերի խմբագրման ծրագրում։ Այն կարող է վերլուծել գիտական տվյալները, ստեղծել գծապատկերներ, մշակել կայք և իրականացնել կայքի օգտատիրական միջերեսի որակի ստուգումներ՝ համոզվելու համար, որ կայքի բոլոր գործառույթները ճիշտ են աշխատում։ Այն կարող է ինքնուրույն օգնել ծրագրային ապահովման տեղադրման և փորձարկման հարցում, ինչպես նաև հայտնաբերել ու լուծել էկրանին երևացող խնդիրները։ Այս բարելավումներն արտացոլվում են նաև մեր առաջատար մակարդակի գնահատման արդյունքներում։
Այս բարելավումները նաև զգալիորեն բարձրացնում են արդյունավետությունը իրական գիտելիքահեն աշխատանքային առաջադրանքներում։ OSWorld 2.0-ում հապաղման մոդելավորումներում Astra-ն մեկ առաջադրանքի համար մոտ 47%-ով պակաս ժամանակում համակարգչից օգտվելու ավելի հզոր կատարողականություն է ցուցաբերում, քան GPT‑5.6-ը Sol-ը՝ յուրաքանչյուր առաջադրանքի համար մոտավորապես 40 րոպեում գրանցելով 72,6% արդյունք՝ համեմատած մոտավորապես 75 րոպեում 65,7%-ի հետ։3
GPT‑6 Astra-ի համակարգչից օգտվելու հնարավորությունները տեսանելի են տարբեր ոլորտների արդյունքներում, ներառյալ խաղերի մշակումը, էլեկտրատեխնիկական ճարտարագիտությունը և առօրյա գիտելիքահեն աշխատանքը:
Astra-ի հետ մեկտեղ մենք նաև թարմացնում ենք Codex-ի գործարկման միջավայրը՝ համակարգչի օգտագործման արագությունը զգալիորեն բարձրացնելու համար։ Astra-ի արդյունավետության հետ համատեղ՝ սա Mind2Web բենչմարքում ապահովում է առաջադրանքների 1.9 անգամ ավելի արագ կատարում՝ ներկայիս GPT‑5.6 Sol փորձի համեմատ։ Մոդելի արագության բարելավումների շնորհիվ այն կարող է ձեր փոխարեն կատարել բազմաթիվ ժամանակատար առօրյա առաջադրանքներ՝ ավելի արագ, քան դուք ինքներդ կկարողանայիք։4
Արմատական փոփոխություն մասնագիտական աշխատանքում
GPT‑6 Astra-ն համակարգչի օգտագործման ոլորտում առաջընթացը համադրում է մասնագիտական միջավայրերի համար նախատեսված նպատակային ուսուցման հետ՝ օգնելով կատարել բարդ աշխատանքային առաջադրանքներ։ Այն համադրում է բարդ խնդիրներ լուծելու համար անհրաժեշտ ինտելեկտը բազմափուլ աշխատանքային գործընթացներ իրականացնելու և բարձրորակ փաստաթղթեր, աղյուսակներ ու շնորհանդեսներ պատրաստելու կարողության հետ։
GPT‑6 Astra-ն մեր լավագույն մոդելն է առկա ձևանմուշներին հետևելու և լավ դասավորված, կառուցվածքային շարադրանքով հիմնական կետերը հակիրճ ներկայացնող սլայդներ ստեղծելու համար։ Այն ստեղծում է հստակ, լավ կառուցվածքով փաստաթղթեր, ներկայացումներ, էլեկտրոնային աղյուսակներ և վերլուծություններ, որոնք հետևում են ձեր ձևանմուշներին և համապատասխանում են ձեր գրավոր և տեսողական ոճին։ Astra-ն նաև հատուկ ուսուցանված է այնպես, որ ելքային արդյունքներում ներառի միայն կարևոր համատեքստը՝ տվյալ աշխատանքի համար անհարկի տեղեկատվությունը կրկնելու փոխարեն։ Այս ամենը նշանակում է, որ այն կարող է ստեղծել ավելի անմիջապես օգտագործելի արտեֆակտներ, որոնք համապատասխանում են ձեր բիզնես համատեքստին և չափանիշներին։
GPT‑6 Astra-ն նաև ավելի բարձր տեսողական գնահատման կարողություն ունի իր ստեղծած կայքերի, խաղերի, հավելվածների և վիզուալիզացիաների մշակման ընթացքում։ ChatGPT‑ում Կայքեր(բացվում է նոր պատուհանում) գործառույթի միջոցով Astra-ն կարող է անմիջապես տեքստային հրահանգից ստեղծել, հոսթինգ անել և տարածել կայքեր, վեբ հավելվածներ ու խաղեր։
Երբ հրահանգները միանշանակ չեն և մեկնաբանության տեղ են թողնում, GPT‑6 Astra-ն նախորդ մոդելների համեմատ ավելի լավ է ճիշտ որոշում կայացնում։ Այն օգտագործում է համատեքստը՝ սովորական բացերը լրացնելու համար, իսկ երբ պատասխանը կարող է ազդել վերջնական արդյունքի վրա, տալիս է հստակ և նպատակային հարցեր։ Codex-ում այն կարող է հարցերը տալ ասինխրոն կերպով՝ միաժամանակ շարունակելով այն աշխատանքը, որը կախված չէ ձեր պատասխանից։ Եթե չպատասխանեք, այն, անհրաժեշտության դեպքում, աշխատանքը կշարունակի՝ հիմնվելով ողջամիտ ենթադրությունների վրա, սակայն կարևոր հետևանքներ ունեցող որոշումների դեպքում կսպասի ձեր պատասխանին։
Ստորև բերված օրինակները ցույց են տալիս, թե ինչպես է Astra-ն համագործակցում առօրյա առաջադրանքների կատարման ընթացքում, երբ բացակայող տեղեկությունը կարող է էապես ազդել պատասխանի վրա։
Astra-ն նաև ավելի լավ է պահպանում առաջադրանքի ընթացքի և փոփոխությունների ընդհանուր պատկերը։ Նախորդ մոդելները երբեմն ուղղորդող հաղորդագրություններն ընկալում էին որպես նոր նպատակ՝ կորցնելով սկզբնական հարցման կամ ավելի վաղ սահմանված պայմանների ու սահմանափակումների հետքը։ Astra-ն հաշվի է առնում նոր պահանջները, անհրաժեշտության դեպքում փոխում է աշխատանքի ուղղությունը և պատասխանում է լրացուցիչ հարցերին՝ առանց հիմնական առաջադրանքը տեսադաշտից կորցնելու։
Կոդավորում
GPT‑6 Astra-ն մինչ օրս ծրագրային ճարտարագիտության համար լավագույն մոդելն է։
«GPT‑6 Astra-ն մեր ներքին ծրագրավորման բենչմարքներում ցուցադրում է առաջատար մակարդակի արդյունքներ և GPT‑5.6 Sol-ի համեմատ հստակ առաջընթաց է արձանագրում թրեյդինգային ինտուիցիայի գնահատումներում։ Երբ GPT‑6 Astra-ն օգտագործվում է ագենտային ծրագրավորման համար, այն հաղորդակցվում է մշակողների համար ավելի հեշտ հետևելի ձևով և ստեղծում է կոդ, որը արտադրական որակի հասնելու համար ավելի քիչ կրկնակի մշակում և շտկումներ է պահանջում»։
«Մենք Astra-ն փորձարկեցինք մեր առաջին սերնդի գնահատումներից մեկում՝ ցածր, Միջին և բարձր ջանքի մակարդակներով, և այն զգալիորեն գերազանցեց GPT 5.6 Sol-ին։ Բարձր ջանքը հնարավորություն է տալիս նոր կառուցվածքի վրա ավելի շատ իտերացիաներ կատարել, դիտարկիչի միջոցով ավելի շատ ստուգումներ անցկացնել և apply-patch-ի փոխարեն նախապատվություն տալ կոդի գործարկմանը։ Հասկանալը, թե ինչպես է մոդելն օգտագործում իր ջանքերը, մեզ թույլ է տալիս միլիոնավոր կառուցողների համար ապահովել գաղափարից մինչև աշխատող հավելված տանող ավելի արագ և հուսալի ուղի։»
Astra-ի միջոցով մենք Codex-ում ներդնում ենք համատեքստը պահպանելու և անհրաժեշտության դեպքում վերականգնելու նոր եղանակ, երբ համատեքստային պատուհանը լցվում է։ Պատմականորեն երկարատև աշխատանքային սեսիաների ընթացքում մոդելները կիրառել են համատեքստի խտացում՝ կատարված աշխատանքն ամփոփելու համար, օրինակ՝ բարդ խնդիրների կարգաբերման կամ լայնածավալ վերակառուցումների ժամանակ։ Յուրաքանչյուր խտացման ընթացքում կարող են դուրս մնալ կարևոր մանրամասներ, օրինակ՝ թե ինչու որևէ ուղղում չի աշխատել կամ ինչպես է տվյալ բաղադրիչը գործում։ Codex-ում Astra-ն կարող է նշումներ պահպանել համատեքստային տարբեր պատուհանների միջև՝ կուտակված մանրամասները պահելով առանց դրանք ամեն անգամ մեկ ընդհանուր ամփոփագրի մեջ սեղմելու։ Ավելի վաղ համատեքստային պատուհանները շարունակում են հասանելի մնալ որոնման համար, այնպես որ Astra-ն կարող է գտնել նախորդ հաղորդագրություններում կամ գործիքների արդյունքներում եղած պահանջները կամ թեստավորման արդյունքները, նույնիսկ եթե այդ տեղեկությունը չի պահպանվել իր նշումներում։ Այս փորձարարական գործառույթը կարող եք միացնել ձեր Codex-ի config.toml ֆայլում,(բացվում է նոր պատուհանում) և առաջիկա շաբաթների ընթացքում այն կդառնա Astra-ի կանխադրված տարբերակը։
Գիտական բացահայտումների առաջխաղացում
GPT‑6 Astra-ն զգալի առաջընթաց է գիտական հայտնագործությունների, մաթեմատիկայի և առողջապահության ոլորտներում։ Այսօր ներկայացնում ենք ևս երկու նոր արդյունք՝ պարզ թվերի միջև եղած տարբերությունների վերաբերյալ։9, 10։
Astra-ն նաև նոր ռեկորդային արդյունքներ է գրանցում մաթեմատիկայի և գիտության մի շարք գնահատումներում։
Astra-ն կարող է օգնել գիտական հայտնագործությունների հիմքում ընկած գործնական աշխատանքներում։ Համադրելով գիտական դատողությունն ու համակարգչի օգտագործման կարողությունները՝ այն կարող է անմիջապես աշխատել մասնագիտացված ծրագրերում, ուսումնասիրել տվյալներն ու վերլուծել արդյունքները՝ օգնելով հետազոտողներին գնահատել առկա ապացույցները և որոշել, թե ինչն է պետք ուսումնասիրել հաջորդիվ։
Կիբերանվտանգություն
Ինչպես նշել ենք մեր անվտանգության թարմացման մեջ, Astra-ն կիբեռանվտանգության կարողությունների առումով զգալի առաջընթաց է և Կրիտիկական շեմին է հասնում կիբեռանվտանգության ոլորտում՝ մեր Պատրաստվածության շրջանակի համաձայն։ Նախկինում անհայտ խոցելիությունները (zero-day) հայտնաբերելու և դրանց համար էքսփլոյթներ մշակելու կարողությունը կարող է օգնել պաշտպանական թիմերին գտնել ու շտկել թույլ կողմերը, սակայն միաժամանակ ավելի ուժեղ անվտանգության միջոցների անհրաժեշտություն է ստեղծում։ Այս կարողությունների իրական սահմանները հասկանալու համար մենք Astra-ն փորձարկել ենք ինչպես ներքին, այնպես էլ անկախ երրորդ կողմի փորձագետների գնահատումներով։
Սկզբում մոդելը, առանց արտադրական անվտանգության պաշտպանական միջոցների, փորձարկել ենք ExploitBench և ExploitGym բենչմարքներով, որոնք գնահատում են՝ արդյոք մոդելները կարող են հայտնի ծրագրային խոցելիությունները վերածել գործունակ էքսփլոյթների։ ExploitBench-ում Astra-ն ստացավ կատարյալ՝ 100% արդյունք՝ համեմատած մեր նախորդ՝ առաջադեմ կիբերանվտանգության կարողություններով օժտված GPT‑5.6 Sol մոդելի 78.5%-ի հետ։ ExploitGym-ում Astra-ն հասել է 42,4% հաջողության ցուցանիշի՝ GPT‑5.6 Sol-ի 30,3%-ի համեմատ, միաժամանակ օգտագործելով զգալիորեն ավելի քիչ ելքային թոքեններ։13
Հաշվի առնելով մտահոգությունները, որ նախկինում հայտնի ծրագրային խոցելիությունների մասին տեղեկությանը ծանոթ լինելը կարող էր ազդել բենչմարքների արդյունքների վրա, մենք Astra-ն գնահատել ենք նաև երկու նոր բենչմարքով։ Դրանցից մեկի համար մենք մշակել ենք ներքին «ExploitBench (2026թ․ հունիս–օգոստոս)» գնահատումը՝ նախորդ երեք ամիսների ընթացքում հայտնաբերված խոցելիությունների հիման վրա էքսփլոյթների մշակման կարողությունը ստուգելու համար։14 Astra-ն կամայական կոդի կատարման զգալիորեն ավելի բարձր ցուցանիշներ է գրանցել, քան GPT‑5.6‑ը Sol-ը՝ այս տվյալների հավաքածուում, միաժամանակ օգտագործելով շատ ավելի քիչ ելքային թոքեն։ Գնահատման ընթացքում Astra-ն նույնիսկ հայտնաբերեց և օգտագործեց նախկինում անհայտ երկու զրոյական օրվա խոցելիություն։ Մենք երկու խոցելիության մասին էլ տեղեկացնում ենք դրանց սպասարկողներին։
Մենք Astra-ն փորձարկել ենք նաև SRE-Bench15բենչմարքով, որը գնահատում է՝ արդյոք մոդելները կարող են հակադարձ ինժեներիայի միջոցով վերլուծել ծրագրային բինար ֆայլերը և հասկանալ դրանց հիմնական տրամաբանությունը՝ առանց սկզբնական կոդին հասանելիություն ունենալու։ Astra-ն առաջադրանքների 88.0%-ը լուծել է առաջին իսկ փորձից, իսկ չորս փորձի ընթացքում՝ 99.2%-ը։ Համեմատության համար՝ GPT‑5.6 Sol-ի համապատասխան ցուցանիշներն են 55.9% և 68.7%։
Բենչմարկներից բացի, փորձագետների ղեկավարությամբ անցկացված գնահատումները ցույց տվեցին, որ Astra-ն, երբ գործարկվում էր առանց արտադրական պաշտպանական միջոցների, կարող էր օգտագործել նախկինում անհայտ խոցելիություններ՝ լավ պաշտպանված դիտարկիչներում կամայական կոդի կատարում ապահովելու և լավ պաշտպանված օպերացիոն համակարգերի համար արտոնությունների բարձրացման էքսփլոյթներ ստեղծելու նպատակով։
Ինչպես քննարկել ենք Պաշտպանի պատուհանը-ում, առաջադեմ կիբերանվտանգության հնարավորությունները կարող են օգնել պաշտպաններին ավելի արագ հայտնաբերել խոցելիությունները, սակայն նաև հեշտացնում են այդ խոցելիությունների շահագործումը՝ մեծացնելով պաշտպանների հարմարվելու հրատապությունը։ Այսօր գործարկվող Astra-ի տարբերակի միջոցով պաշտպանական թիմերը կարող են կատարել այնպիսի առաջադրանքներ, ինչպիսիք են կոդի անվտանգության ստուգումն ու խոցելիությունների շտկումը։
Սակայն Astra-ն կհրաժարվի կատարել կիբերանվտանգության ավելի առաջադեմ առաջադրանքներ, օրինակ՝ խոցելիությունների համար proof-of-concept էքսփլոյթների ստեղծումը։ OpenAI Daybreak ծրագրի միջոցով մենք նախատեսում ենք առաջիկա շաբաթներին ընդլայնել հասանելիությունը և աստիճանաբար ներդնել ավելի քիչ սահմանափակող անվտանգության միջոցներ։ Սա հնարավորություն կտա իրականացնել ավելի լայն պաշտպանական աշխատանքային գործընթացներ, այդ թվում՝ խոցելիությունների և proof-of-concept օրինակների վավերացում, վնասաբեր ծրագրերի վերլուծություն և հայտնաբերման մեխանիզմների մշակում։
Մենք նաև ուժեղացրել ենք կիբեռոլորտում հնարավոր չարաշահումների դեմ մեր պաշտպանական միջոցները՝ զարգացնելով GPT‑5.6 Sol-ի համար կիրառված անվտանգության մեխանիզմների համակարգը։ Դրանք ներառում են մոդելի ավելի բարձր դիմակայունություն՝ հնարավոր jailbreak-ներին ավելի լավ դիմանալու համար, ինչպես նաև ավելի հարուստ համատեքստ մեր մոնիթորինգի համակարգերի համար։ Մենք շարունակել ենք խիստ ներքին և արտաքին փորձարկումները, այդ թվում՝ ավտոմատացված գնահատումները մեր ներքին նախափորձարկման հարձակվողների միջոցով։ Մեր կիբեռանվտանգության միջոցների և փորձարկումների մասին լրացուցիչ մանրամասներ հասանելի են Astra-ի անվտանգության ակնարկում և համակարգի քարտում(բացվում է նոր պատուհանում)։
GPT‑6 Astra-ի պատասխանատու համապատասխանեցում և տեղակայում
Astra-ն մեր նպատակներին ամենից լավ համապատասխանեցված մոդելն է։ Astra-ն առանձնանում է զգուշավոր գործելակերպով, առաջադրանքի սահմանները պահպանելու և թափանցիկ հաղորդակցվելու կարողությամբ։ Այս աշխատանքը մեր երկարաժամկետ հետազոտական ծրագրի նորագույն արդյունքն է, որի նպատակն է ստեղծել մոդելներ, որոնք ամբողջ գործընթացի ընթացքում՝ սկզբից մինչև վերջ, հավատարիմ են մնում մարդու նպատակներին և մտադրություններին։
Զգայուն միջավայրերում Astra-ն գործում է ռիսկի մակարդակին համապատասխան զգուշությամբ։ Համակարգչի օգտագործման այնպիսի առաջադրանքների գնահատման ժամանակ, որոնք միտումնավոր ընտրվել էին սխալ վարքագիծ հրահրելու համար, Astra-ն ավելի հաջող էր խուսափում չնախատեսված հետևանքներից։ Առաջարկվող կանխադրված լրացուցիչ անվտանգության միջոցներով գործարկելիս արդյունքներն ավելի բարձր էին։
Astra-ն փորձարկված բոլոր առաջատար մոդելների համեմատ ավելի քիչ անհամապատասխան արդյունքներ է տալիս։ Արդար համեմատություն ապահովելու համար մենք օգտագործել ենք համակարգիչ օգտագործող ագենտի ընդհանուր harness՝ հիմնված ինչպես OpenAI Responses API(բացվում է նոր պատուհանում)-ում, թե՛ Anthropic Messages API(բացվում է նոր պատուհանում)-ում հասանելի ներկառուցված համակարգչային գործիքների վրա, և առանց այն լրացուցիչ պաշտպանական մեխանիզմների, որոնք սովորաբար կիրառվում են Codex և ChatGPT Work օգտատերերի համար՝ օրինակ՝ ավտոմատ վերանայում և հաստատման քաղաքականություն։
Astra-ն նաև ավելի հաճախ է գործում օգտատիրոջ սահմանած և աշխատանքային միջավայրից բխող սահմանների շրջանակում։ Ներքին գնահատման ընթացքում Astra-ն ոչ մի անգամ չի փորձել շրջանցել Codex Auto-Review-ի մերժումը։ Սա պահպանվել է նույնիսկ այն դեպքերում, երբ Auto-Review-ն միտումնավոր այնպես էր կարգավորված, որ հնարավոր լիներ այն շրջանցել, իսկ առաջադրանքը այլ կերպ կատարել հնարավոր չէր։ Աշխատանքային միջավայրի սահմանափակումների նկատմամբ այս հետևողականությունը համապատասխանում է ինչպես այս գրառման սկզբում ներկայացված՝ անիրագործելի կիբերանվտանգության առաջադրանքների գնահատման արդյունքներին, այնպես էլ մեր համակարգի քարտում(բացվում է նոր պատուհանում) փաստագրված այլ դիտարկումներին։
Astra-ն նաև նոր նշաձող է սահմանում օգտատերերի հետ թափանցիկ հաղորդակցության ոլորտում։ Գնահատումներից մեկում Astra-ն GPT‑5.6 Sol-ի համեմատ երեք անգամ քիչ է հավանական, որ ոչ ճշգրիտ ներկայացնի իր հնարավորություններն ու հասանելի գործառույթները։
Մեր կարողությունների վերաբերյալ հալյուցինացիաների գնահատման շրջանակում Astra-ն GPT‑5.6 Sol-ի համեմատ զգալի բարելավում է ցուցաբերում՝ իր կարողությունների մասին ավելի քիչ մոլորեցնող պնդումներ անելով։
Մեր գնահատումները պարզեցին, որ Astra-ի գրավոր դատողությունն ավելի դժվար է մշտադիտարկել, քան GPT‑5.6 Sol-ինը՝ հիմնված այն թեստերի վրա, որոնցում նրան հստակորեն հանձնարարվել էր խուսափել մշտադիտարկումից։ Մենք դա պայմանավորում ենք նրանով, որ Astra-ն ավելի պարզ առաջադրանքների դեպքում ավելի լավ է վերահսկում գրավոր դատողության ընթացքը և կարողանում է խնդիրները լուծել ավելի քիչ գրավոր քայլերով։ Թվում է, որ Astra-ն դեռևս դժվարանում է թաքցնել բարդ առաջադրանքների լուծման համար անհրաժեշտ դատողության ընթացքը, սակայն մենք այս ցուցանիշի անկումը լուրջ ենք ընդունում։ Դիտարկելիության բարելավումը շարունակում է մնալ հետազոտական առաջնահերթություն, իսկ կից համակարգի քարտում(բացվում է նոր պատուհանում) մանրամասն ներկայացված են մեր արդյունքներն ու շարունակվող աշխատանքները։
Համապատասխանեցման ուսուցումը մեր մոդելների գործարկման մոտեցման առանցքային մասն է։ Որպես պաշտպանության լրացուցիչ շերտ՝ մենք նաև ներդնում ենք համակարգային պաշտպանական մեխանիզմներ, օրինակ՝ Codex-ի ավտոմատ ստուգում(բացվում է նոր պատուհանում) գործառույթը, ինչպես նաև վերահսկում ենք գործակալների տրամաբանությունն ու գործողությունները՝ վտանգավոր վարքագիծը հայտնաբերելու և զսպելու համար։ Ինչպես նկարագրված է մեր անվտանգության թարմացման մեջ, Astra դասի մոդելների համար մենք արտադրական միջավայրում ներդնում ենք նաև անհամապատասխանության մոնիթորինգ, որպեսզի կարողանանք տեսանելիություն ունենալ նման դեպքերի նկատմամբ և սահմանափակել դրանց առավել վտանգավոր դրսևորումները։ Այս անվտանգության միջոցները նման են մեր ներքին գործարկումների մոնիթորինգին և ներառում են դասակարգիչների համակարգ, որը ստուգում է մոդելի դատողություններն ու գործողությունները՝ չարտոնված վարքագիծ հայտնաբերելու համար, և ավտոմատ կերպով դադարեցնում է հնարավոր չարտոնված գործողությունները։
Հաշվի առնելով Astra-ի կիբեռանվտանգության կարողությունների զգալի աճը՝ մենք առանձնահատուկ զգուշությամբ ենք մոտենում դրա գործարկմանը՝ ապահովելու համար անվտանգ և պաշտպանված կիրառումը։ Անվտանգության լրացուցիչ ստուգումները երբեմն կարող են դանդաղեցնել, ժամանակավորապես դադարեցնել կամ ամբողջությամբ կանգնեցնել նաև օրինական աշխատանքը, այդ թվում՝ պաշտպանական կիբերանվտանգության առաջադրանքները։ Եթե ChatGPT‑ում կամ Codex-ում առաջադրանքի կատարումը ժամանակավորապես դադարեցվի, շարունակելուց առաջ հնարավոր է ձեզ առաջարկվի վերանայել և հաստատել տվյալ գործողությունը։ API-ում առաջադրանքը կդադարի։ Այս ստուգումները երբեմն կարող են ընդհատել նաև օրինական աշխատանքը, և մենք շարունակում ենք կատարելագործել համակարգը՝ ավելորդ ընդհատումները նվազեցնելու համար։ Անհամապատասխանության մշտադիտարկումը չի կարող փոխարինել համապատասխանեցմանը․ մեր նպատակն է ստեղծել մոդելներ, որոնք հուսալիորեն գործում են իրենց թույլատրված սահմանների շրջանակում, որպեսզի այդ պաշտպանական մեխանիզմները միջամտելու անհրաժեշտություն չունենան։
Հասանելիություն
GPT‑6 Astra-ն այսօր հասանելի է դառնում սահմանափակ թվով կազմակերպությունների համար, իսկ առաջիկա օրերին հասանելի կլինի ChatGPT Plus, Pro, Business և Enterprise բոլոր օգտատերերին, ինչպես նաև OpenAI API-ի, Microsoft Azure-ի և AWS Bedrock-ի միջոցով։ Astra-ի օգտագործումը ներառված է գործող բաժանորդագրության շրջանակում նախատեսված օգտագործման սահմանաչափերում, իսկ օգտատերերն ու կազմակերպությունները կարող են նաև լրացուցիչ օգտագործման համար կրեդիտներ ձեռք բերել։ Pro, Business և Enterprise պլանների օգտատերերին հասանելի կլինի նաև GPT‑6 Astra Pro մոդելը։ Enterprise պլանի ադմինիստրատորները կարող են Astra-ն միացնել իրենց աշխատատարածքի համար։ Գործարկման պահին այն ըստ կանխադրման անջատված է։
Astra-ն աջակցում է «Ոչ մի պահվող տվյալ» ռեժիմն իրավասու API հաճախորդների համար և, ինչպես անցյալ ամիս հայտնել էինք, մենք փորձարկում ենք Մասնավոր անվտանգության մշակումը՝ ուժեղացնելու անվտանգության մոնիթորինգը՝ միաժամանակ պահպանելով հաճախորդների գաղտնիությունը։
Ծրագրավորողների համար GPT‑6 Astra-ն հասանելի կլինի OpenAI API-ում՝ որպես gpt-6-astra, ինչպես նաև Microsoft Azure-ի և Amazon Bedrock-ի միջոցով։
OpenAI API-ի Standard սակագնով արժեքը կազմում է 10 ԱՄՆ դոլար՝ յուրաքանչյուր 1 միլիոն մուտքային թոքենի համար և 50 ԱՄՆ դոլար՝ յուրաքանչյուր 1 միլիոն ելքային թոքենի համար։ Քեշից ընթերցումների և քեշում գրառումների համար կիրառվում են առանձին սակագներ։ API-ում GPT‑6 Astra-ի համար հասանելի է Fast ռեժիմը, որն ապահովում է մինչև 2 անգամ ավելի բարձր արագություն՝ Standard մշակման համեմատ, սակայն Standard սակագնի կրկնակի արժեքով։
Համակարգչի օգտագործում
Մասնագիտական
Մասնագիտական | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83.3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore լարային քառյակներ (1 - OMR-NED) | 0.84 | 0,19 | - | - | - | - |
Ներքին դիզայնի առաջադրանքներ | 50.0% | 47,4% | - | 35,8% | - | - |
Տվյալների գիտության ներքին առաջադրանքներ | 40,9% | 30,5% | - | 34,7% | - | - |
Արհեստական բանականության վերլուծության ինդեքս v4.1.1 | 61,2 | 60,9 | 65,7 | 62.1 | 63,1 | 58,7 |
Կոդավորում
| Ծրագրավորում | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Ընդլայնված (միավոր) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (միավոր) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Ներքին տվյալների բազայի միգրացիայի առաջադրանքներ | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis կոդավորման ագենտի ինդեքս v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Ակադեմիական
Ակադեմիական | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21.4% | 30,0% | - |
FrontierMath 4-րդ մակարդակ (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93.7% | 92.6% | 93.7% | 95.3% |
Մարդկության վերջին քննությունը (գործիքներով) | 57.2% | - | 65,0% | 63,8% | 63,6% | - |
Գիտություն և առողջություն
Համապատասխանեցում
Համապատասխանեցում | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Համակարգչի օգտագործման անվտանգության ներքին բենչմարք (որքան ցածր, այնքան լավ) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Համակարգչի օգտագործման անվտանգության ներքին բենչմարք՝ AutoReview-ով (որքան ցածր, այնքան լավ) | 1,8% | 4,3% | - | - | - | - |
Շրջանցման ներքին բենչմարք (որքան ցածր, այնքան լավ) | 0.00% | 0,29% | - | - | - | - |
ExploitGym խայծային համակարգ (ավելի ցածրն ավելի լավ է) | 0,0% | 48,2% | - | - | - | - |
Անհնարին ExploitGym | 100,0% | - | - | - | - | - |
Հալյուցինացիաների ներքին բենչմարք (որքան ցածր, այնքան լավ) | 4,2% | 12,2% | - | - | - | - |
Երկար համատեքստ
Երկար համատեքստ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-ասեղային 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-ասեղային 512K-1M | 96,3% | 73,8% | - | - | - | - |
Աբստրակտ մտածողություն
| Վերացական դատողություն | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Գնահատման միավորները առավելագույնն են ցանկացած ջանքի դեպքում։ GPT‑ի գնահատումները կատարվել են մեր հետազոտական միջավայրում կամ API-ի միջոցով, ուստի արդյունքները կարող են փոքր-ինչ տարբերվել արտադրական ChatGPT‑ի արդյունքներից՝ համակարգային հրահանգների, հասանելի գործիքների և այլ պայմանների տարբերությունների պատճառով։
ԾԱՆՈԹԱԳՐՈՒԹՅՈՒՆՆԵՐ
- 1
ARC-AGI-3-ում GPT-6 Astra-ն գործարկվել է մեր պատասխանների API հարնեսով, որը փոխում է երկու կարգավորում՝ իրական աշխարհի կատարողականին ավելի լավ համապատասխանելու համար։ Փոփոխությունները հատուկ ուղղված չեն ARC-AGI-3-ին։
- 2
GPT-5.6 Sol-ը վերաբերում է մեր API-ում, ChatGPT Codex-ում և ChatGPT Աշխատանքում հասանելի տարբերակին։ ChatGPT-ի Զրույցում առկա տարբերակը փոքր-ինչ տարբերվում է։
- 3
OSWorld V2-Offline-ը սկզբնական OSWorld V2-ի ենթաբազմություն է, որն աշխատում է առանց ինտերնետ հասանելիության։ OSWorld-V2 Offline-ում Claude մոդելի արդյունավետությունը հեղինակների կողմից վերարտադրվել է պաշտոնական առաջատարների աղյուսակում(բացվում է նոր պատուհանում)։ OSWorld 2.0-ում Claude-ի միավորների համար օգտագործվում են պաշտոնական կարգավորումները, այլ ոչ թե Fable 5.1 համակարգի քարտում կիրառված փոփոխված առաջադրանքներն ու գնահատման փոփոխված մեթոդը։
- 4
- 5
BenchCAD-ում Claude-ի միավորներն արտացոլում են գնահատման 3 փոփոխություն, որոնք մանրամասն ներկայացված են Fable 5.1 համակարգի քարտում(բացվում է նոր պատուհանում)։
- 6
Գուանգ Յանգ, Վիկտորիա Էբերտ, Նազիֆ Թամեր, Բրայան Սիյուան Չժենգ, Լուիզա Պոցցոբոն և Նոա Ա. Սմիթ։ «LEGATO: լայնածավալ, ծայրից ծայր ընդհանրացվող մոտեցում տպագիր OMR-ի համար(բացվում է նոր պատուհանում)»։ arXiv:2506.19065, 2025.
- 7
Մարկ Ռ. Հ. Գոթեմ, Մորին Ռեդբոնդ, Բրունո Բաուեր և Փիթեր Ջոնաս։ «OpenScore լարային քառյակների կորպուսը(բացվում է նոր պատուհանում)։» «Թվային գրադարաններ երաժշտագիտության համար» 10-րդ միջազգային համաժողովի նյութեր, էջ 49–57. ACM, 2023.
- 8
FrontierCode-ում GPT-6 Astra-ն գործարկվել է մշակողի հաղորդագրությամբ, որը նման էր Codex-ում իր մշակողի հաղորդագրության մի հատվածին(բացվում է նոր պատուհանում)՝ «Խուսափեք չափազանց շատ թեստային ֆայլեր ստեղծելուց։ Ստեղծեք նոր թեստային ֆայլ միայն այն դեպքում, երբ դա պահանջվում է պահոցի կանոններով կամ երբ գոյություն ունեցող որևէ ֆայլ համապատասխան տեղ չէ։ Խուսափեք կապ չունեցող մաքրումներից և ավելորդ բարդացումներից։ Վերօգտագործեք համապատասխան առկա օժանդակ գործիքները։ Կարդացեք պահոցի համապատասխան հրահանգները և ուսումնասիրեք մոտակա կոդը, թեստերը, փաստաթղթավորումը և CI-ը։ Հետևեք ընդունված կանոններին։ Նպատակը մաքուր, միաձուլման ենթակա կոդն է»։ Հարցումը չէր օպտիմալացվել գնահատման համար։
- 9
Առաջին արդյունքը վերաբերում է նրան, թե թվային առանցքի վրա որքան էլ հեռու գնանք, պարզ թվերը որքան մոտ կարող են գտնվել միմյանց։ Ավելի քան մեկ տասնամյակ լավագույն հայտնի արդյունքը ցույց էր տալիս, որ գոյություն ունեն անվերջ շատ պարզ թվերի զույգեր, որոնց միջև տարբերությունը առավելագույնը 246 է։ Յուլիա Շտադլմանը(բացվում է նոր պատուհանում) վերջերս բարելավեց այդ սահմանը՝ հասցնելով այն 240-ի։ Astra-ն օգնեց ստանալ ավելի խիստ՝ 186-ի սահմանը՝ ցույց տալով, որ գոյություն ունեն անվերջ շատ պարզ թվերի զույգեր, որոնց միջև տարբերությունը չի գերազանցում 186-ը։ Պարզ թվերի միջև կարճ բացեր․ Ապացույց(բացվում է նոր պատուհանում) և օժանդակ հետազոտություններ(բացվում է նոր պատուհանում)։
- 10
Երկրորդ արդյունքը վերաբերում է պարզ թվերի միջև անսովոր մեծ հեռավորություններին։ Astra-ն բարելավել է այս հեռավորությունների վերին սահմանի մի անդամ, որը ավելի քան 80 տարի անփոփոխ էր մնացել։ Մենք հրապարակում ենք երկու արդյունքների ապացույցները, ինչպես նաև դատողությունների կրճատ ներկայացումն ու ստուգման նյութերը։ Պարզ թվերի միջև մեծ բացեր: Ապացույց(բացվում է նոր պատուհանում) և հիմնավորող հետազոտություններ(բացվում է նոր պատուհանում)։
- 11
Մենք ինքնուրույն գնահատել ենք Claude-ի բոլոր մոդելները՝ հետևելով HealthBench Professional-ի նախատեսված գնահատման ընթացակարգին, օգտագործելով GPT-5.4-ի գնահատումը և պատասխանի երկարությունը հաշվի առնող՝ չսահմանափակված միավորները։ Fable 5.1-ի դեպքում մատակարարի կողմից մերժումների դեպքում որպես պահուստային տարբերակ օգտագործել ենք Opus 5-ը։
- 12
- 13
- 14
ExploitBench-ը (2026 թ. հունիս–օգոստոս) ներառում է V8-ի բարձր վտանգավորության 20 խոցելիություն Chrome-ի 13 կայուն թողարկումներում։ Հենանիշային թեստը ստուգում է՝ արդյոք ագենտները կարող են հասնել կամայական կոդի կատարման V8-ում և Linux-ի համար Chrome-ի պաշտոնական թողարկումներում՝ շահագործելով նշված յուրաքանչյուր խոցելիություն։ Ներառված խոցելիություններից որոշները գնահատման սահմանափակումների պայմաններում կարող են թույլ չտալ կամայական կոդի կատարում, ուստի 100% հաջողության ցուցանիշը միշտ չէ, որ հնարավոր է ապահովել։ Նշում․ GPT-5.6 Sol-ի 5.5% ցուցանիշը պայմանավորված է բենչմարքում սահմանված 300 քայլի սահմանափակմամբ, մինչդեռ max ռեժիմից օգտվող իրական հաճախորդների համար նման սահմանափակում չկա։ Նմանատիպ կարգավորումներով մոդելը, ավելի քիչ սահմանափակումների բախվելու դեպքում, գրանցել է 11.5% արդյունք։
- 15
Ջերեմի Սփենս և այլք։ «Ագենտային կիբեռանվտանգության հաջորդ մարտահրավերը․ իրատեսական, տվյալների արտահոսքից զերծ հակադարձ ինժեներիայի բենչմարք(բացվում է նոր պատուհանում)»։ arXiv:2608.11469v1, 2026։
- 16
Երբ փորձարկում ենք տարբեր երրորդ կողմի մոդելներ, օգտագործում ենք ավելի պարզ հետազոտական կարգավորում։ Codex-ն ունի ավելի բարդ արտադրական կոնֆիգուրացիա, ինչի պատճառով մոդելի հում սխալների մակարդակները կարող են տարբերվել։ Մատակարարների կողմից կիրառվող անվտանգության միջոցներն ու համակարգչային գործիքների իրականացումները նույնպես տարբեր են։ Codex-ում օգտատերերը չեն հանդիպում առանց հաստատման աշխատող սցենարի, քանի որ այն կիրառվում է միայն ներքին հետազոտական կարգավորումներում։
- 17
