Բանականության նոր սերունդ
Ներկայացնում ենք GPT‑6 Astra-ն՝ աշխարհի ամենախելացի և լավագույնս համահունչ մոդելը։
GPT‑6 Astra-ն համադրում է նախնական ուսուցման, ամրապնդումով ուսուցման և համապատասխանեցման ոլորտներում տարիների հետազոտություններն ու խոշոր ներդրումները։ Astra-ն առաջատար մակարդակի է համակարգչի օգտագործման, վեբ դիտարկման, ծրագրային ապահովման ճարտարագիտության, կիբեռանվտանգության, գիտության և մասնագիտական աշխատանքի ոլորտներում։ Astra-ն FrontierMath-ի 4-րդ մակարդակում գրանցում է 98% արդյունք՝ արդեն իսկ օգնած լինելով մաթեմատիկայում լուծել երկար ժամանակ բաց մնացած խնդիրներ։ Astra-ն նաև ARC-AGI-3-ում գրանցում է 99.9% արդյունք, իսկ ExploitBench-ում՝ 100% արդյունք։ Այն նաև նոր առաջադեմ մակարդակ է սահմանում համակարգիչների և դիտարկիչների օգտագործման ոլորտում՝ անզուգական արագությամբ, ճշգրտությամբ և դատողությամբ կատարելով ամենաբարդ մասնագիտական աշխատանքը։
GPT‑6 Astra-ն այսօր հասանելի է դառնում սահմանափակ թվով կազմակերպությունների համար, իսկ առաջիկա օրերին հասանելի կլինի ChatGPT Plus, Pro, Business և Enterprise բոլոր օգտատերերին, ինչպես նաև OpenAI API-ի, Microsoft Azure-ի և AWS Bedrock-ի միջոցով։
Astra-ն մեր ամենահամապատասխանեցված մոդելն է՝ օգտատիրոջ մտադրությունն ու մոդելի վարքագիծը հասկանալու զգալի բարելավումներով․ կարող եք առաջադրանքներ պատվիրակել՝ ավելի մեծ վստահությամբ ապավինելով Astra-ի դատողությանը։ Սա փորձարկելու եղանակներից մեկի շրջանակում մենք Hugging Face-ի միջադեպի հիման վրա մշակել ենք նոր գնահատում, որը ստուգում է՝ բարդ կամ անհնարին առաջադրանքի առջև կանգնած մոդելը դուրս կգա՞ արդյոք իր նախատեսված շրջանակից։ GPT‑5.6 Sol-ի համեմատ, որը առանց արտադրական պաշտպանական միջոցների 48% դեպքերում դուրս է եկել լիազորված թիրախի սահմաններից, GPT‑6 Astra-ն դա արել է 0% դեպքերում։
Աշխարհի լավագույն համակարգչից օգտվելու մոդելը
GPT‑6 Astra-ն նոր սահմանագիծ է կերտում համակարգչի օգտագործման արագության, ճշգրտության և անվտանգության ոլորտներում։ Այն կարող է իր վրա վերցնել այնպիսի ձանձրալի և ժամանակատար առաջադրանքներ, ինչպիսիք են առցանց ձևաթղթերի լրացումը, CRM համակարգում հաճախորդների տվյալների թարմացումը և օրացույցի կազմակերպումը։ Այն կարող է առցանց հետազոտություն կատարել և ամփոփագրեր պատրաստել ձեր էլեկտրոնային փոստում կամ փաստաթղթերի խմբագրման ծրագրում։ Այն կարող է վերլուծել գիտական տվյալները, ստեղծել գծապատկերներ, մշակել կայք և իրականացնել կայքի օգտատիրական միջերեսի որակի ստուգումներ՝ համոզվելու համար, որ կայքի բոլոր գործառույթները ճիշտ են աշխատում։ Այն կարող է ինքնուրույն օգնել ծրագրային ապահովման տեղադրման և փորձարկման հարցում, ինչպես նաև հայտնաբերել ու լուծել էկրանին երևացող խնդիրները։ Այս բարելավումներն արտացոլվում են նաև մեր առաջատար մակարդակի գնահատման արդյունքներում։
Այս բարելավումները նաև զգալիորեն բարձրացնում են արդյունավետությունը իրական գիտելիքահեն աշխատանքային առաջադրանքներում։ OSWorld 2.0-ում հապաղման մոդելավորումներում Astra-ն մեկ առաջադրանքի համար մոտ 47%-ով պակաս ժամանակում համակարգչից օգտվելու ավելի հզոր կատարողականություն է ցուցաբերում, քան GPT‑5.6-ը Sol-ը՝ յուրաքանչյուր առաջադրանքի համար մոտավորապես 40 րոպեում գրանցելով 72,6% արդյունք՝ համեմատած մոտավորապես 75 րոպեում 65,7%-ի հետ։3
GPT‑6 Astra-ի համակարգչից օգտվելու հնարավորությունները տեսանելի են տարբեր ոլորտների արդյունքներում, ներառյալ խաղերի մշակումը, էլեկտրատեխնիկական ճարտարագիտությունը և առօրյա գիտելիքահեն աշխատանքը:
Astra-ի հետ մեկտեղ մենք նաև թարմացնում ենք Codex հարնեսը՝ համակարգիչ օգտագործելու արագությունը զգալիորեն բարելավելու համար։ Astra-ի արդյունավետության հետ համատեղ՝ Mind2Web հենանիշում սա ապահովում է առաջադրանքների 1,9 անգամ ավելի արագ կատարում՝ համեմատած GPT‑5.6 Sol-ի ներկայիս փորձառության հետ։ Մոդելի արագության բարելավումները նշանակում են, որ այն կարող է ձեզ համար կատարել առօրյա բազմաթիվ ժամանակատար առաջադրանքներ՝ ձեզնից ավելի արագ։
Արմատական փոփոխություն մասնագիտական աշխատանքում
GPT‑6 Astra-ն համակարգչի օգտագործման ոլորտում առաջընթացը համադրում է մասնագիտական միջավայրերի համար նախատեսված նպատակային ուսուցման հետ՝ օգնելով կատարել բարդ աշխատանքային առաջադրանքներ։ Այն համադրում է բարդ խնդիրներ լուծելու համար անհրաժեշտ ինտելեկտը բազմափուլ աշխատանքային գործընթացներ իրականացնելու և բարձրորակ փաստաթղթեր, աղյուսակներ ու շնորհանդեսներ պատրաստելու կարողության հետ։
GPT‑6 Astra-ն մեր լավագույն մոդելն է առկա ձևանմուշներին հետևելու և լավ դասավորված, կառուցվածքային շարադրանքով հիմնական կետերը հակիրճ ներկայացնող սլայդներ ստեղծելու համար։ Այն ստեղծում է հստակ, լավ կառուցվածքով փաստաթղթեր, ներկայացումներ, էլեկտրոնային աղյուսակներ և վերլուծություններ, որոնք հետևում են ձեր ձևանմուշներին և համապատասխանում են ձեր գրավոր և տեսողական ոճին։ Astra-ն նաև հատուկ ուսուցանված է այնպես, որ ելքային արդյունքներում ներառի միայն կարևոր համատեքստը՝ տվյալ աշխատանքի համար անհարկի տեղեկատվությունը կրկնելու փոխարեն։ Այս ամենը նշանակում է, որ այն կարող է ստեղծել ավելի անմիջապես օգտագործելի արտեֆակտներ, որոնք համապատասխանում են ձեր բիզնես համատեքստին և չափանիշներին։
GPT‑6 Astra-ն նաև ավելի բարձր տեսողական գնահատման կարողություն ունի իր ստեղծած կայքերի, խաղերի, հավելվածների և վիզուալիզացիաների մշակման ընթացքում։ ChatGPT‑ում Կայքեր(բացվում է նոր պատուհանում) գործառույթի միջոցով Astra-ն կարող է անմիջապես տեքստային հրահանգից ստեղծել, հոսթինգ անել և տարածել կայքեր, վեբ հավելվածներ ու խաղեր։
Երբ հրահանգները միանշանակ չեն և մեկնաբանության տեղ են թողնում, GPT‑6 Astra-ն նախորդ մոդելների համեմատ ավելի լավ է ճիշտ որոշում կայացնում։ Այն օգտագործում է համատեքստը՝ սովորական բացերը լրացնելու համար, իսկ երբ պատասխանը կարող է ազդել վերջնական արդյունքի վրա, տալիս է հստակ և նպատակային հարցեր։ Codex-ում այն կարող է հարցերը տալ ասինխրոն կերպով՝ միաժամանակ շարունակելով այն աշխատանքը, որը կախված չէ ձեր պատասխանից։ Եթե չպատասխանեք, այն, անհրաժեշտության դեպքում, աշխատանքը կշարունակի՝ հիմնվելով ողջամիտ ենթադրությունների վրա, սակայն կարևոր հետևանքներ ունեցող որոշումների դեպքում կսպասի ձեր պատասխանին։
Ստորև բերված օրինակները ցույց են տալիս, թե ինչպես է Astra-ն համագործակցում առօրյա առաջադրանքների կատարման ընթացքում, երբ բացակայող տեղեկությունը կարող է էապես ազդել պատասխանի վրա։
Astra-ն նաև ավելի լավ է պահպանում առաջադրանքի ընթացքի և փոփոխությունների ընդհանուր պատկերը։ Նախորդ մոդելները երբեմն ուղղորդող հաղորդագրություններն ընկալում էին որպես նոր նպատակ՝ կորցնելով սկզբնական հարցման կամ ավելի վաղ սահմանված պայմանների ու սահմանափակումների հետքը։ Astra-ն հաշվի է առնում նոր պահանջները, անհրաժեշտության դեպքում փոխում է աշխատանքի ուղղությունը և պատասխանում է լրացուցիչ հարցերին՝ առանց հիմնական առաջադրանքը տեսադաշտից կորցնելու։
Կոդավորում
GPT‑6 Astra-ն մինչ օրս ծրագրային ճարտարագիտության համար լավագույն մոդելն է։
«GPT‑6 Astra-ն մեր ներքին ծրագրավորման բենչմարքներում ցուցադրում է առաջատար մակարդակի արդյունքներ և GPT‑5.6 Sol-ի համեմատ հստակ առաջընթաց է արձանագրում թրեյդինգային ինտուիցիայի գնահատումներում։ Երբ GPT‑6 Astra-ն օգտագործվում է ագենտային ծրագրավորման համար, այն հաղորդակցվում է մշակողների համար ավելի հեշտ հետևելի ձևով և ստեղծում է կոդ, որը արտադրական որակի հասնելու համար ավելի քիչ կրկնակի մշակում և շտկումներ է պահանջում»։
«Մենք Astra-ն փորձարկեցինք մեր առաջին սերնդի գնահատումներից մեկում՝ ցածր, Միջին և բարձր ջանքի մակարդակներով, և այն զգալիորեն գերազանցեց GPT 5.6 Sol-ին։ Բարձր ջանքը հնարավորություն է տալիս նոր կառուցվածքի վրա ավելի շատ իտերացիաներ կատարել, դիտարկիչի միջոցով ավելի շատ ստուգումներ անցկացնել և apply-patch-ի փոխարեն նախապատվություն տալ կոդի գործարկմանը։ Հասկանալը, թե ինչպես է մոդելն օգտագործում իր ջանքերը, մեզ թույլ է տալիս միլիոնավոր կառուցողների համար ապահովել գաղափարից մինչև աշխատող հավելված տանող ավելի արագ և հուսալի ուղի։»
Astra-ի միջոցով մենք Codex-ում ներդնում ենք համատեքստը պահպանելու և անհրաժեշտության դեպքում վերականգնելու նոր եղանակ, երբ համատեքստային պատուհանը լցվում է։ Պատմականորեն երկարատև աշխատանքային սեսիաների ընթացքում մոդելները կիրառել են համատեքստի խտացում՝ կատարված աշխատանքն ամփոփելու համար, օրինակ՝ բարդ խնդիրների կարգաբերման կամ լայնածավալ վերակառուցումների ժամանակ։ Յուրաքանչյուր խտացման ընթացքում կարող են դուրս մնալ կարևոր մանրամասներ, օրինակ՝ թե ինչու որևէ ուղղում չի աշխատել կամ ինչպես է տվյալ բաղադրիչը գործում։ Codex-ում Astra-ն կարող է նշումներ պահպանել համատեքստային տարբեր պատուհանների միջև՝ կուտակված մանրամասները պահելով առանց դրանք ամեն անգամ մեկ ընդհանուր ամփոփագրի մեջ սեղմելու։ Ավելի վաղ համատեքստային պատուհանները շարունակում են հասանելի մնալ որոնման համար, այնպես որ Astra-ն կարող է գտնել նախորդ հաղորդագրություններում կամ գործիքների արդյունքներում եղած պահանջները կամ թեստավորման արդյունքները, նույնիսկ եթե այդ տեղեկությունը չի պահպանվել իր նշումներում։ Այս փորձարարական գործառույթը կարող եք միացնել ձեր Codex-ի config.toml ֆայլում,(բացվում է նոր պատուհանում) և առաջիկա շաբաթների ընթացքում այն կդառնա Astra-ի կանխադրված տարբերակը։
Գիտական բացահայտումների առաջխաղացում
GPT‑6 Astra-ն մեծ առաջընթաց է գիտական հայտնագործությունների, մաթեմատիկայի և առողջապահության համար։ Այսօր ներկայացնում ենք պարզ թվերի միջև եղած բացերի վերաբերյալ ևս երկու արդյունք [WITH LINK]։ Astra-ն նաև նոր ռեկորդներ է սահմանում գիտական գնահատումների ամբողջ շարքում։
Astra-ն կարող է օգնել գիտական հայտնագործությունների հիմքում ընկած գործնական աշխատանքներում։ Համադրելով գիտական դատողությունն ու համակարգչի օգտագործման կարողությունները՝ այն կարող է անմիջապես աշխատել մասնագիտացված ծրագրերում, ուսումնասիրել տվյալներն ու վերլուծել արդյունքները՝ օգնելով հետազոտողներին գնահատել առկա ապացույցները և որոշել, թե ինչն է պետք ուսումնասիրել հաջորդիվ։
Կիբերանվտանգություն
Astra-ն բեկումնային փոփոխություն է կիբերանվտանգության կարողությունների ոլորտում։ Զրոյական օրվա էքսփլոյթներ հայտնաբերելու և մշակելու դրա կարողությունը կարող է օգնել պաշտպաններին շտկել խոցելիությունները, սակայն դա նաև ավելի ուժեղ պաշտպանական միջոցների անհրաժեշտություն է առաջացնում։ Հասկանալու համար, թե որքան լայն է այս կարողությունների շրջանակը, մենք օգտագործել ենք ներքին և երրորդ կողմի փորձագիտական գնահատումներ։
Նախ Astra-ն փորձարկեցինք ExploitBench-ում և ExploitGym-ում, որոնք չափում են, թե արդյոք մոդելները կարող են խոցելի կոդային բազաներում կամայական կոդ գործարկել։
Հաշվի առնելով հնարավոր մտահոգությունները, որ նախկինում հայտնի ծրագրային ապահովման խոցելիություններին ծանոթ լինելը կարող էր ազդել հենանիշի արդյունքների վրա, մենք Astra-ն գնահատեցինք նաև երկու նոր հենանիշի վրա։ Նախ՝ մենք ստեղծեցինք ներքին «ExploitBench (2026 թ. հունիս–օգոստոս)» գնահատում՝ նախորդ երեք ամիսների խոցելիություններն օգտագործելով շահագործման միջոցների մշակումը փորձարկելու համար։ 2 Այս տվյալների հավաքածուում Astra-ն կամայական կոդի կատարման զգալիորեն ավելի բարձր ցուցանիշներ է գրանցել, քան GPT‑5.6 Sol-ը՝ միաժամանակ օգտագործելով շատ ավելի քիչ ելքային թոքեն։ Գնահատման ընթացքում Astra-ն հայտնաբերեց և կիրառեց Chrome V8-ի heap սանդբոքսից դուրս գալու նախկինում անհայտ երկու տեխնիկա։ Մենք երկու խոցելիության մասին էլ տեղեկացնում ենք դրանց սպասարկողներին։
Մենք նաև Astra-ն փորձարկեցինք SRE-Bench-ում՝ չափանիշում, որը գնահատում է, թե արդյոք մոդելները կարող են հակադարձ ինժեներիայի միջոցով վերլուծել երկուական ծրագրային ապահովումը՝ դրա հիմնական տրամաբանությունը հասկանալու համար։ Չափանիշի հեղինակները ծրագրակազմը ստեղծել են զրոյից և դրա սկզբնական կոդը գաղտնի են պահել։ Astra-ն մեկ փորձով լուծել է առաջադրանքների 88,0%-ը, իսկ չորս փորձի ընթացքում՝ 99,2%-ը՝ GPT‑5.6 Sol-ի համապատասխանաբար 55,9%-ի և 68,7%-ի համեմատ։
Բենչմարկներից բացի, փորձագետների ղեկավարությամբ անցկացված գնահատումները ցույց տվեցին, որ Astra-ն կարող էր օգտագործել նախկինում անհայտ խոցելիություններ՝ անվտանգության առումով խստացված զննարկիչներում կամայական կոդի կատարում ապահովելու և անվտանգության առումով խստացված օպերացիոն համակարգերի համար արտոնությունների բարձրացման էքսփլոյթներ ստեղծելու նպատակով։ Այս արդյունքները միասին հիմք հանդիսացան մեր որոշման համար, որ Astra-ն մեր Պատրաստվածության շրջանակի համաձայն հասել է կիբեռանվտանգության ոլորտում կրիտիկական շեմին։
Ինչպես քննարկել ենք Պաշտպանի պատուհանը-ում, առաջադեմ կիբերանվտանգության հնարավորությունները կարող են օգնել պաշտպաններին ավելի արագ հայտնաբերել խոցելիությունները, սակայն նաև հեշտացնում են այդ խոցելիությունների շահագործումը՝ մեծացնելով պաշտպանների հարմարվելու հրատապությունը։
Այսօր թողարկվող Astra-ի տարբերակում մենք աջակցում ենք կարևոր պաշտպանական առաջադրանքների կատարմանը, ինչպիսիք են կոդի անվտանգության վերանայումը, շտկումների կիրառումը և սպառնալիքների մոդելավորումը։ Այնուամենայնիվ, լռելյայն կարգավորումներով Astra-ն կհրաժարվի կատարել առաջադեմ կիբեռանվտանգության առաջադրանքներ, օրինակ՝ էքսփլոյթների հայտնաբերումը։ OpenAI Daybreak-ի միջոցով մենք սկսում ենք, սկսում ենք ավելի քիչ սահմանափակ հասանելիություն տրամադրել վստահելի կիբեռանվտանգության պաշտպանների ալֆա խմբին՝ OpenAI Daybreak ծրագրում։ Սա ընդլայնում է հասանելիությունը պաշտպանական աշխատանքային հոսքերին, ներառյալ խոցելիությունների առաջնահերթության գնահատումը և վավերացումը, վնասաբեր ծրագրերի վերլուծությունը, հայտնաբերման մեխանիզմների մշակումը և շտկումների վավերացումը։ Մենք նախատեսում ենք հետագայում ընդլայնել հասանելիությունը Daybreak Blue-ի միջոցով։
Մենք նաև ուժեղացրել ենք հնարավոր կիբեռչարաշահման դեմ մեր պաշտպանական միջոցները՝ հիմնվելով GPT‑5.6 Sol-ի համար նախատեսված մեր պաշտպանական համալիրի վրա։ Դրանք ներառում են մոդելի դիմակայունության ավելի ուժեղ ուսուցում՝ հնարավոր հաքերային հարձակման գործընթացներին ավելի լավ դիմակայելու համար, ինչպես նաև ավելի շատ համատեքստ՝ մեր մոնիթորինգի համակարգերի համար։ Մենք շարունակել ենք խիստ ներքին և արտաքին փորձարկումները, ներառյալ մեր ներքին նախափորձարկման հարձակվողների միջոցով իրականացվող ավտոմատացված թեստերը։ Մեր կիբեռպաշտպանական միջոցների և փորձարկումների մասին ավելի մանրամասն տեղեկություններ հասանելի են Astra-ի համակարգի քարտում և մեր բլոգում։
GPT‑6 Astra-ի պատասխանատու համապատասխանեցում և տեղակայում
Astra-ն մեր նպատակներին ամենից լավ համապատասխանեցված մոդելն է։ Astra-ն առանձնանում է զգուշավոր գործելակերպով, առաջադրանքի սահմանները պահպանելու և թափանցիկ հաղորդակցվելու կարողությամբ։ Այս աշխատանքը մեր երկարաժամկետ հետազոտական ծրագրի նորագույն արդյունքն է, որի նպատակն է ստեղծել մոդելներ, որոնք ամբողջ գործընթացի ընթացքում՝ սկզբից մինչև վերջ, հավատարիմ են մնում մարդու նպատակներին և մտադրություններին։
Զգայուն միջավայրերում Astra-ն գործում է ռիսկի մակարդակին համապատասխան զգուշությամբ։ Համակարգչի օգտագործման այնպիսի առաջադրանքների գնահատման ժամանակ, որոնք միտումնավոր ընտրվել էին սխալ վարքագիծ հրահրելու համար, Astra-ն ավելի հաջող էր խուսափում չնախատեսված հետևանքներից։ Առաջարկվող կանխադրված լրացուցիչ անվտանգության միջոցներով գործարկելիս արդյունքներն ավելի բարձր էին։
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(բացվում է նոր պատուհանում) and Anthropic Messages API(բացվում է նոր պատուհանում)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra-ն նաև ավելի հաճախ է գործում օգտատիրոջ սահմանած և աշխատանքային միջավայրից բխող սահմանների շրջանակում։ Ներքին գնահատման ընթացքում Astra-ն ոչ մի անգամ չի փորձել շրջանցել Codex Auto-Review-ի մերժումը։ Սա պահպանվել է նույնիսկ այն դեպքերում, երբ Auto-Review-ն միտումնավոր այնպես էր կարգավորված, որ հնարավոր լիներ այն շրջանցել, իսկ առաջադրանքը այլ կերպ կատարել հնարավոր չէր։ Աշխատանքային միջավայրի սահմանափակումների նկատմամբ այս հետևողականությունը համապատասխանում է ինչպես այս գրառման սկզբում ներկայացված՝ անիրագործելի կիբերանվտանգության առաջադրանքների գնահատման արդյունքներին, այնպես էլ մեր համակարգի քարտում(բացվում է նոր պատուհանում) փաստագրված այլ դիտարկումներին։
Astra-ն նաև ցույց է տալիս խաբուսիկ վարքագծի զգալի նվազում։ Աշխատանք պատվիրակող մարդկանց անհրաժեշտ է հստակ հասկանալ մոդելի կարողությունները և ազնիվ կերպով տեղեկացվել դրա առաջընթացի մասին։ Սա չափում է ազնվության մեկ կողմը․ միտումնավոր խաբեության նվազեցումը շարունակում է մնալ մեր համապատասխանեցման աշխատանքների ավելի լայն ուշադրության կենտրոնում։
Մեր կարողությունների վերաբերյալ հալյուցինացիաների գնահատման շրջանակում Astra-ն GPT‑5.6 Sol-ի համեմատ զգալի բարելավում է ցուցաբերում՝ իր կարողությունների մասին ավելի քիչ մոլորեցնող պնդումներ անելով։
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(բացվում է նոր պատուհանում) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(բացվում է նոր պատուհանում) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Հասանելիություն
GPT‑6 Astra-ն այսօր աստիճանաբար հասանելի է դառնում ձեռնարկությունների և մեր Trusted Access Program-ի հաճախորդների համար, իսկ առաջիկա մի քանի օրերի ընթացքում լայն հասանելիություն կունենան ChatGPT Plus, Pro, Business և Enterprise բաժանորդները։ Astra-ի օգտագործումը ներառված է 100 ԱՄՆ դոլար և 200 ԱՄՆ դոլար արժողությամբ Pro պլանների և 100 ԱՄՆ դոլար արժողությամբ Business պլանի գործող օգտագործման սահմանաչափում՝ առանց լրացուցիչ արագության սահմանաչափերի կամ սահմանափակումների։ 20 ԱՄՆ դոլար արժողությամբ Plus բաժանորդագրություն ունեցողները և ստանդարտ Business պլանի հաճախորդները կարող են օգտվել GPT‑6 Astra-ից ավելի ցածր սահմանաչափերով՝ լրացուցիչ հասանելիության համար կրեդիտներ ձեռք բերելու հնարավորությամբ։ Enterprise-ի ադմինիստրատորները կարող են միացնել Astra-ն իրենց աշխատատարածքում․ թողարկման պահին հասանելիությունը կանխադրված անջատված է։
Pro Lite, Pro, Business և Enterprise պլանների օգտատերերը կարող են նաև Զրույցում օգտվել GPT‑6 Astra-ից։ Astra-ն աջակցում է ոչ մի պահվող տվյալ սկզբունքին իրավասու API հաճախորդների համար, և, ինչպես անցյալ ամիս հայտնել էինք, մենք փորձարկում ենք Մասնավոր անվտանգության մշակումը՝ ուժեղացնելու անվտանգության մոնիթորինգը՝ միաժամանակ պահպանելով հաճախորդների գաղտնիությունը։
Ծրագրավորողների համար GPT‑6 Astra-ն OpenAI API-ում հասանելի է որպես gpt-6-astra, ինչպես նաև հասանելի է AWS Bedrock-ում։ OpenAI API-ի Standard սակագինը կազմում է 10 ԱՄՆ դոլար յուրաքանչյուր միլիոն մուտքային թոքենի համար և 50 ԱՄՆ դոլար՝ յուրաքանչյուր միլիոն արտածման թոքենի համար։ Քեշից ընթերցումների և քեշում գրառումների համար կիրառվում են առանձին սակագներ։ API-ում GPT‑6 Astra-ի համար հասանելի է Արագ ռեժիմը, որն ապահովում է Standard մշակման մինչև 2,5 անգամ արագությունը՝ Standard-ի կրկնակի գնով։
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Համապատասխանեցում
Համապատասխանեցում | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Համակարգչի օգտագործման անվտանգության ներքին բենչմարք (որքան ցածր, այնքան լավ) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Համակարգչի օգտագործման անվտանգության ներքին բենչմարք՝ AutoReview-ով (որքան ցածր, այնքան լավ) | 1,8% | 4,3% | - | - | - | - |
Շրջանցման ներքին բենչմարք (որքան ցածր, այնքան լավ) | 0.00% | 0,29% | - | - | - | - |
ExploitGym խայծային համակարգ (ավելի ցածրն ավելի լավ է) | 0,0% | 48,2% | - | - | - | - |
Անհնարին ExploitGym | 100,0% | - | - | - | - | - |
Հալյուցինացիաների ներքին բենչմարք (որքան ցածր, այնքան լավ) | 4,2% | 12,2% | - | - | - | - |
Երկար համատեքստ
Երկար համատեքստ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-ասեղային 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-ասեղային 512K-1M | 96,3% | 73,8% | - | - | - | - |
Աբստրակտ մտածողություն
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Գնահատման միավորները առավելագույնն են ցանկացած ջանքի դեպքում։ GPT‑ի գնահատումները կատարվել են մեր հետազոտական միջավայրում կամ API-ի միջոցով, ուստի արդյունքները կարող են փոքր-ինչ տարբերվել արտադրական ChatGPT‑ի արդյունքներից՝ համակարգային հրահանգների, հասանելի գործիքների և այլ պայմանների տարբերությունների պատճառով։
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(բացվում է նոր պատուհանում). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(բացվում է նոր պատուհանում).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(բացվում է նոր պատուհանում).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(բացվում է նոր պատուհանում).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(բացվում է նոր պատուհանում): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(բացվում է նոր պատուհանում) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(բացվում է նոր պատուհանում) and supporting research(բացվում է նոր պատուհանում).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(բացվում է նոր պատուհանում) and supporting research(բացվում է նոր պատուհանում).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(բացվում է նոր պատուհանում).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
