OpenAI

GPT-6 Astra: A new generation of intelligence

Ойлау деңгейі жаңа буыны

2026 жылғы 22 қыркүйектегі жаңарту: GPT‑6 Sol және GPT‑6 Luna модельдерімен GPT‑6 топтамасын кеңейтіп жатырмыз. Толығырақ біліңіз.

Біз әлемдегі ең зияткер және мақсатқа ең жақсы сәйкестендірілген GPT‑6 Astra моделін таныстырамыз.

GPT‑6 Astra алдын ала оқыту, күшейту арқылы оқыту және сәйкестендіру бағыттарындағы көпжылдық зерттеулер мен батыл бастамаларды біріктіреді. Astra компьютерді пайдалану, интернетті шолу, бағдарламалық жасақтама инженериясы, киберқауіпсіздік, ғылым және кәсіби жұмыс салаларында ең озық деңгейде. Astra математикадағы ұзақ уақыттан бері шешілмей келе жатқан ашық мәселелерді шешуге⁠ бұған дейін-ақ көмектесіп үлгеріп, FrontierMath Tier 4 деңгейін 98% нәтижемен шегіне жеткізді. Astra ARC-AGI-3 бенчмаркінде 99,9% ұпаймен, ал ExploitBench бенчмаркінде 100% ұпаймен де шекті нәтижеге жетті. Ол сондай-ақ компьютер мен браузерді пайдалану саласында жаңа озық деңгей орнатып, ең талапшыл кәсіби жұмыстарды теңдессіз жылдамдықпен, дәлдікпен және пайыммен орындайды. 

GPT‑6 Astra бүгін ұйымдардың шектеулі тобына кезең-кезеңімен қолжетімді бола бастайды және алдағы күндері барлық ChatGPT Plus, Pro, Business және Enterprise пайдаланушыларына, сондай-ақ OpenAI API, Microsoft Azure және AWS Bedrock арқылы қолжетімді болады.

«ARC-AGI-3 бағалауында Astra деңгейлердің 96%-ында адам әрекетінің тиімділігі бойынша базалық көрсеткішімізден асып, іс жүзінде бенчмаркте адам деңгейіне жетті. Бұл біз сынаған ең үздік модель ғана емес, сонымен бірге озық модельдер өнімділігіндегі елеулі сапалық өзгерісті білдіреді — ол жаңа орталарды бағдарлап, шешу қабілетінде ғана емес, мұны қаншалықты тиімді үйренетінінде де көрінеді».
Грег Камрадт, ARC Prize Foundation

Astra — пайдаланушы ниеті мен модель мінез-құлқын түсінуде елеулі жақсартулары бар, ең үйлесімді моделіміз; Astra-ның пайымына көбірек сенім артып, тапсырмаларды тапсыра аласыз. Мұны сынаудың бір тәсілі ретінде Hugging Face оқиғасына сүйене отырып, қиын немесе орындалмайтын тапсырмаға тап болған модельдің көзделген аясынан шығып кететін-кетпейтінін бағалайтын жаңа сынақ әзірледік. Өндірістік қорғаныс шаралары жоқ кезде рұқсат етілген мақсаттан 48% жағдайда асып кеткен GPT‑5.6 Sol-мен салыстырғанда, GPT‑6 Astra мұны 0% жағдайда жасады.

Компьютерді пайдалануға арналған әлемдегі ең үздік модель

GPT‑6 Astra компьютерді пайдалану жылдамдығы, дәлдігі мен қауіпсіздігі саласында жаңа озық деңгейге жол ашады. Ол онлайн формаларды толтыру, CRM жүйесіндегі тұтынушы жазбаларын жаңарту және күнтізбеңізді реттеу сияқты жалықтыратын тапсырмаларды орындай алады. Ол онлайн зерттеу жүргізіп, электрондық поштаңызда немесе құжат редакторыңызда қысқаша қорытындылардың жобасын дайындай алады. Ол ғылыми деректерді талдай алады, графиктер жасай алады, веб-сайт құра алады және сол сайттағы барлық мүмкіндіктердің жұмыс істейтініне көз жеткізу үшін фронтенд сапасын тексере алады. Ол сізге бағдарламалық жасақтаманы өздігінен орнатып, сынауға және экранда көріп тұрған мәселелерді анықтап, жоюға көмектесе алады. Бұл жақсартулар біздің ең озық бағалау нәтижелерімізде де көрініс тапқан.

Бұл жақсартулар да нақты, білімге негізделген жұмыс тапсырмаларында тиімділіктің айтарлықтай артуына әкеледі. OSWorld 2.0 жүйесіндегі кідіріс симуляцияларында Astra әр тапсырмаға GPT‑5.6-ға қарағанда шамамен 47% аз уақыт жұмсап, компьютерді пайдалану өнімділігінің жоғарырақ деңгейіне қол жеткізеді Sol әр тапсырмаға шамамен 40 минут жұмсап, 72,6% нәтиже көрсетті; салыстыру үшін, шамамен 75 минутта бұл көрсеткіш 65,7% болды.3

GPT‑6 Astra-ның компьютерді пайдалану мүмкіндіктерін ойын әзірлеу, электротехника және күнделікті білімге негізделген жұмыс сияқты әртүрлі салалардағы нәтижелерден көруге болады:

Astra-мен қатар компьютерді пайдалану жылдамдығын айтарлықтай арттыру үшін Codex тапсырма ортасын да жаңартып жатырмыз. Astra-ның тиімділігімен үйлескенде, бұл Mind2Web бенчмаркінде қазіргі GPT‑5.6 Sol тәжірибесімен салыстырғанда тапсырмаларды 1,9 есе жылдамырақ аяқтауға мүмкіндік береді. Модель жылдамдығының жақсаруы оның сіз үшін көп уақытты қажет ететін көптеген күнделікті тапсырмаларды сізден де жылдамырақ орындай алатынын білдіреді.4

«Біз GPT‑6 Astra моделін іске қосылған күні Devin-нің тапсырма ортасына біріктіреміз, онда ол ішкі тестілеу бенчмаркімізде ең озық деңгейдегі өнімділік көрсетеді. Оның компьютерді тамаша пайдалануы, жазу қабілеті және код базасын түсінуі тестілеуді бірден жақсартты: бейнелерді түсіну айтарлықтай жеңілдеді, ал есептер анығырақ әрі ықшамырақ болды»
Сайлас Альберти, Cognition компаниясының зерттеу жөніндегі аға вице-президенті

Кәсіби жұмыстағы сапалы серпіліс

GPT‑6 Astra күрделі жұмыс тапсырмаларын шешуге көмектесу үшін компьютерді пайдаланудағы жетістіктерді кәсіби орталарға арналған мақсатты оқытумен ұштастырады. Ол күрделі мәселелерге қажетті ойлау деңгейін көпсатылы жұмыс процестерін орындау және сапалы құжаттар, электрондық кестелер мен презентациялар әзірлеу қабілетімен біріктіреді.

GPT‑6 Astra — бар үлгілерді сақтауға және құрылымды баяндау арқылы негізгі ойларды ықшам жеткізетін, макеті жақсы жасалған слайдтар әзірлеуге арналған ең үздік модель. Ол сіздің үлгілеріңізге сай келетін және жазу мәнеріңіз бен визуалды стиліңізге сәйкес келетін анық, жақсы құрылымдалған құжаттар, презентациялар, электрондық кестелер және талдаулар жасайды. Astra сондай-ақ нәтижелерге тек маңызды контекстті ғана енгізуге арнайы үйретілген, осылайша ағымдағы тапсырмаға қажетсіз ақпаратты қайталамайды. Мұның бәрі оның бизнес контекстіңіз бен стандарттарыңызға сәйкес келетін, бірден қолдануға анағұрлым дайын артефактілерді шығара алатынын білдіреді.

GPT‑6 Astra веб-сайттарды, ойындарды, қолданбаларды және рендерлерді жасауда көрнекі пайымдау қабілетін де күшейтеді. ChatGPT ішіндегі Сайттар⁠(жаңа терезеде ашылады) арқылы Astra веб-сайттарды, веб-қолданбаларды және ойындарды көмексөз арқылы тікелей жасап, хостингке орналастырып, бөлісе алады.

«Astra бізге мүмкіндіктер мен тиімділік тұрғысынан айтарлықтай артықшылық береді. Ол біз сынақтан өткізген басқа модельдерге қарағанда токендерді 20%-ға дейін аз пайдалана отырып, ең күрделі шығармашылық жұмыс процестерімізді сәтті орындайды. Ең маңыздысы, бұл тұтынушыларымыз үшін жоғары сапалы нәтиже дегенді білдіреді».
Алекс Машрабов, Higgsfield AI бас директоры және тең құрылтайшысы

Нұсқаулар әртүрлі түсіндіруге мүмкіндік бергенде, GPT‑6 Astra дұрыс шешім қабылдауда алдыңғы модельдерден жақсырақ. Ол контексті пайдаланып, әдеттегі олқылықтардың орнын толтырады және жауап нәтижені өзгертуі мүмкін болған кезде нақты сұрақтар қояды. Codex-те ол жауабыңызға тәуелді емес жұмысты жалғастыра отырып, сұрақтарды асинхронды түрде қоя алады. Жауап бермесеңіз, орынды болған жағдайда негізді болжамдарға сүйеніп жұмысты жалғастырады, бірақ маңызды шешімдерде сіздің жауабыңызды күтеді.

Төмендегі мысалдар жетіспейтін ақпарат жауапты елеулі түрде өзгерте алатын күнделікті тапсырмаларда Astra-ның қалай бірлесіп жұмыс істейтінін көрсетеді.

Astra тапсырма өзгеріп отырған сайын бағдарын сақтауда да жақсырақ. Бұрынғы модельдер кейде бағыттаушы хабарларды жаңа мақсат ретінде қабылдап, бастапқы сұрауды немесе алдыңғы шектеулерді естен шығаратын. Astra жаңа талаптарды ескереді, сұралғанда бағытын өзгертеді және жалпы тапсырманы назардан тыс қалдырмай, қосымша сұрақтарға жауап береді.

«Astra күрделі құқықтық тапсырмаларда GPT‑5.6 Sol-мен салыстырғанда сапаны едәуір жақсартады. Алғашқы сынақтарымызда Astra заңгерлік жұмысқа пайымды заңгер сияқты қарайтынымен ерекшеленді: ол құжаттарды қалыптасқан жазбалардан ажыратады, дәлелденбеген болжамдарды анықтайды және олқылықтарды құжат жобалау бойынша нақты ұстанымдарға айналдырады».
Нико Групен, Harvey компаниясының қолданбалы зерттеулер бөлімінің басшысы

Кодтау

GPT‑6 Astra — бүгінгі күнге дейін бағдарламалық жасақтама инженериясына арналған ең үздік модель.

2 ішінен 1
«GPT‑6 Astra ішкі бағдарламалау бенчмарктерімізде озық деңгейдегі өнімділік көрсетіп, GPT‑5.6 Sol-пен салыстырғанда трейдинг интуициясын бағалауда айқын ілгерілеуді көрсетеді. Агенттік бағдарламалау үшін қолданылғанда, GPT‑6 Astra әзірлеушілерге түсінуге оңайырақ түрде байланысып, өндірістік сапаға жету үшін азырақ итерацияны қажет ететін код жасайды».
Джон Крепецци, ЖИ ассистенттері, Jane Street

Astra көмегімен мәнмәтін терезесі толған кезде Codex-тің мәнмәтінді сақтап, қайта алуына арналған жаңа тәсілді ұсынып отырмыз. Бұрын модельдер күрделі мәселелерді жөндеу немесе ауқымды қайта құрулармен жұмыс істеу сияқты ұзақ сеанстар кезінде жұмысты қорытындылау үшін ықшамдауды қолданатын. Әрбір ықшамдау түзетудің неліктен сәтсіз болғаны немесе компоненттің қалай жұмыс істейтіні туралы кейбір мәліметтерді қамтымай қалуы мүмкін. Codex-те Astra жазбаларды мәнмәтін терезелері арасында сақтай алады, осылайша жинақталған мәліметтерді қайта-қайта бір ғана қорытындыға ықшамдамай сақтайды. Бұрынғы мәнмәтін терезелері іздеуге қолжетімді болып қалады, сондықтан Astra талаптарды немесе тест нәтижелерін алдыңғы хабарламалар мен құралдардың нәтижелерінен таба алады, тіпті бұл ақпарат оның жазбаларында қамтылмаса да. Бұл эксперименттік функцияны Codex config.toml,⁠(жаңа терезеде ашылады) файлында қоса аласыз, ал ол алдағы апталарда Astra үшін әдепкі болады.

Ғылыми жаңалықтарды ілгерілету

«Әңгіме мынада: бір дәуірдің соңы, екіншісінің басы».
Грег Бернхэм, EpochAI

GPT‑6 Astra ғылыми жаңалық ашу, математика және денсаулық сақтау салаларындағы елеулі ілгерілеу болып табылады. Бүгін біз жай сандар арасындағы аралықтар туралы тағы екі нәтижемен бөлісеміз.9 және 10

Astra сондай-ақ математика және ғылым бойынша бірқатар бағалауларда жаңа рекордтар орнатады.

Astra ғылыми жаңалық ашу жолындағы практикалық жұмысқа көмектесе алады. Ғылыми ой қорытуды компьютерді пайдаланумен ұштастыра отырып, ол деректерді тексеру және нәтижелерді зерттеу үшін арнайы бағдарламалық жасақтамада тікелей жұмыс істей алады, бұл зерттеушілерге дәлелдерді бағалауға және келесіде нені зерттеу керегін шешуге көмектеседі.

Киберқауіпсіздік

Біз қауіпсіздік⁠ туралы жаңартуымызда талқылағанымыздай, Astra — кибермүмкіндіктердегі елеулі серпіліс және біздің Дайындық шеңберіміз аясында киберқауіпсіздік бойынша Критикалық шекке сәйкес келеді. Оның нөлдік күндік эксплойттарды анықтау және әзірлеу қабілеті қорғаушыларға осалдықтарды табуға және түзетуге көмектесе алады, бірақ бұл күштірек қорғаныс шараларының қажеттілігін де туындатады. Бұл мүмкіндіктердің қаншалықты ауқымды екенін түсіну үшін біз Astra-ны ішкі және үшінші тарап сарапшыларының бағалауларында сынақтан өткіздік.

Алдымен модельді өндірістік қауіпсіздік шараларынсыз ExploitBench және ExploitGym сынақтарынан өткіздік; бұл сынақтар модельдердің белгілі бағдарламалық жасақтама осалдықтарын жұмыс істейтін эксплойттарға айналдыра алатынын бағалайды. ExploitBench сынағында Astra 100% мінсіз нәтиже көрсетті, ал бұған дейінгі озық кибермүмкіндіктері бар моделіміз GPT‑5.6 Sol 78,5% нәтиже көрсетті. ExploitGym-де Astra шығыс токендерін айтарлықтай азырақ пайдалана отырып, GPT‑5.6 Sol-дың 30,3%-ымен салыстырғанда 42,4% сәттілік көрсеткішіне жетті.13

Бұрынғы бағдарламалық жасақтама осалдықтарының әсеріне ұшырау бенчмарк нәтижелеріне әсер еткен болуы мүмкін деген алаңдаушылықтарды ескере отырып, біз Astra-ны екі жаңа бенчмаркте де бағаладық. Мысалы, біз алдыңғы үш айдағы осалдықтарды пайдалана отырып, эксплойт әзірлеуді сынау үшін ішкі «ExploitBench (2026 жылғы маусым–тамыз)» бағалауды әзірледік.14 Astra GPT‑5.6‑мен салыстырғанда еркін код орындаудың айтарлықтай жоғары көрсеткіштеріне жетті Sol бұл деректер жиынында шығыс токендерін әлдеқайда азырақ пайдалана отырып. Бағалау барысында Astra тіпті бұрын белгісіз болған екі zero-day осалдығын анықтап, қолданды. Біз екі осалдық туралы да олардың сүйемелдеушілеріне хабарлап жатырмыз.

Сондай-ақ Astra моделін SRE-Bench15 бенчмаркінде сынадық. Бұл бенчмарк модельдердің бастапқы кодқа қол жеткізбей-ақ бағдарламалық жасақтаманың негізгі логикасын түсіну үшін оның екілік файлдарын кері инженериялай алатынын өлшейді. Astra тапсырмалардың 88,0%-ын бір әрекетте және 99,2%-ын төрт әрекет ішінде шешті, ал GPT‑5.6 Sol көрсеткіштері тиісінше 55,9% және 68,7% болды.

Бенчмарк сынақтарынан бөлек, сарапшылар жүргізген бағалаулар Astra өндірістік ортаға арналған қорғаныс шараларысыз іске қосылған кезде, бұрын белгісіз болған осалдықтарды пайдаланып, қорғанысы күшейтілген браузерлерде ерікті кодты орындауға қол жеткізе алатынын және қорғанысы күшейтілген операциялық жүйелер үшін артықшылық көтеруге арналған эксплойттар жасай алатынын көрсетті.

Қорғаушының мүмкіндіктер терезесі материалында талқылағанымыздай, озық кибермүмкіндіктер қорғаушыларға осалдықтарды тезірек табуға көмектесе алады, бірақ бұл осалдықтарды пайдалануды да жеңілдетіп, қорғаушылардың бейімделуін шұғыл етеді. Astra-ның бүгін іске қосылатын нұсқасын қорғаушылар код қауіпсіздігін тексеру және патчтау сияқты тапсырмаларды орындау үшін пайдалана алады.

Алайда, Astra осалдықтарға арналған эксплойттардың тұжырымдамалық дәлелдерін жасау сияқты киберқауіпсіздік бойынша одан да күрделі тапсырмаларды орындаудан бас тартады. OpenAI Daybreak⁠ арқылы біз алдағы апталарда қолжетімділікті кеңейтуді және шектеуі азырақ қорғау шараларын енгізуді жоспарлап отырмыз. Бұл осалдықтар мен тұжырымдамалық дәлелдерді тексеру, зиянды бағдарламаларды талдау және анықтау инженериясын қоса алғанда, көбірек қорғанысқа бағытталған жұмыс процестерін іске асыруға мүмкіндік береді.

GPT‑5.6 Sol үшін қорғаныс кешенімізге сүйене отырып, ықтимал кибертеріс пайдаланудан қорғайтын шараларымызды да күшейттік. Оларға ықтимал қорғанысты айналып өту үлгілеріне жақсырақ төтеп беру үшін модельдің төзімділігін арттыру және мониторинг жүйелеріміз үшін кеңірек контекст кіреді. Ішкі редтиминг шабуылшыларымызбен автоматтандырылған бағалауларды қоса алғанда, қатаң ішкі және сыртқы тестілеуді жалғастырдық. Киберқорғаныс шараларымыз бен тестілеу туралы толығырақ ақпарат Astra қауіпсіздік шолуында⁠ және жүйе картасында⁠(жаңа терезеде ашылады) қолжетімді..

GPT‑6 Astra-ны жауапкершілікпен үйлестіру және орналастыру

Astra — мақсатқа ең сай модель. Astra мұқият әрекет етуімен, тапсырма шекараларын сақтауымен және ашық қарым-қатынас жасауымен ерекшеленеді. Бұл жұмыс — модельдерді басынан аяғына дейін адам ниетіне сай болып қалатындай етіп үйретуге бағытталған, ұзақ уақыт бойы жүргізіліп келе жатқан зерттеу бағдарламамыздың соңғы нәтижесі.

Сезімтал орталарда Astra тәуекел деңгейіне сай сақтықпен әрекет етеді. Теріс әрекетке итермелейтіндей етіп әдейі іріктелген компьютерді пайдалану тапсырмаларын бағалау барысында Astra көзделмеген салдарларды болдырмауда анағұрлым табысты болды. Әдепкі бойынша ұсынылатын қосымша қауіпсіздік шараларымен іске қосылғанда, өнімділік одан да жоғары болды.

Astra сыналған кез келген басқа озық модельге қарағанда сәйкессіз нәтижелерді азырақ тудырады. Әділ салыстыру үшін біз жалпы компьютермен жұмыс істейтін агенттің тапсырма ортасын (екі OpenAI Responses API⁠(жаңа терезеде ашылады) және Anthropic Messages API⁠(жаңа терезеде ашылады) ішінде қолжетімді нативті компьютерді пайдалану құралдарына негізделген) және Codex пен ChatGPT Work пайдаланушылары үшін әдетте қолданылатын қосымша қорғаныстарсыз (автоматты тексеру, растау саясаты) пайдаландық.

Сондай-ақ Astra пайдаланушы белгілеген және оның ортасы меңзейтін шектер аясында жұмыс істеуге бейім. Ішкі бағалауда Astra Codex Auto-Review бас тартуын айналып өтуге ешқашан әрекет жасаған жоқ. Бұл Auto-review әдейі айналып өтуге болатындай етіп бапталған және әйтпесе тапсырманы орындау мүмкін болмаған жағдайда да өз күшінде қалды. Орта шектеулерін бұлай құрметтеу осы жазбаның кіріспесінде бөліскен орындалуы мүмкін емес кибертапсырма бағалауымыздың нәтижелерімен және жүйе картасында⁠(жаңа терезеде ашылады) құжатталған басқа тұжырымдармен сәйкес келеді.

Astra сонымен қатар пайдаланушылармен ашық қарым-қатынаста жаңа стандарттар белгілейді. Бір бағалауда Astra-ның GPT‑5.6-ға қарағанда ықтималдығы үш есе төмен Sol моделіне қарағанда өзінің мүмкіндіктері мен ұсынатын функциялары туралы дәл емес мәлімдемелер жасау.

Мүмкіндіктерге қатысты галлюцинацияны бағалауымызда Astra GPT‑5.6 Sol-пен салыстырғанда айтарлықтай жақсарып, өз мүмкіндіктері туралы адастыруы мүмкін мәлімдемелерді азырақ жасайды.

Біздің бағалауларымыз Astra-ның жазбаша ой қорытуын GPT‑5.6‑ға қарағанда бақылау қиынырақ екенін анықтады Sol-дікі, оған бақылаудан жалтаруды тікелей сұраған сынақтарға негізделген. Мұны Astra-ның қарапайым тапсырмаларда жазбаша ой қорытуын көбірек басқара алатынымен және мәселелерді жазбаша қадамдарды азырақ қолданып шеше алуымен байланыстырамыз. Astra күрделі тапсырмаларға қажетті ой қорытуды жасыруда әлі де қиналатын сияқты, алайда біз бұл төмендеуге байыппен қараймыз. Бақыланғыштықты жақсарту зерттеудің басым бағыты болып қала береді, ал қоса берілген жүйе картасында⁠(жаңа терезеде ашылады) қорытындыларымыз бен жалғасып жатқан жұмысымыз егжей-тегжейлі сипатталған.

Сәйкестендіру бойынша оқыту — енгізуге қатысты тәсіліміздің өзегі. Қорғаныстың қосымша қабаты ретінде қауіпті мінез-құлықты анықтап, тоқтатуға көмектесу үшін Codex автоматты тексеруі⁠(жаңа терезеде ашылады) сияқты жүйелік қорғаныс шараларын әзірлейміз және агенттердің ой қорытуы мен әрекеттерін бақылаймыз. Қауіпсіздік туралы жаңартуымызда⁠ сипатталғандай, сәйкессіздікті көру мүмкіндігіне ие болу және оның ең ауыр көріністерін тоқтатуға көмектесу үшін Astra санатындағы модельдерге өндірістік ортада сәйкессіздік мониторингін де енгізіп жатырмыз. Бұл қорғаныс шаралары ішкі өрістетулерімізге арналған мониторингке ұқсайды. Онда модельдің ой қорытуы мен әрекеттерінің рұқсатсыз мінез-құлыққа қатыстылығын тексеріп, ықтимал рұқсатсыз әрекетті автоматты түрде тоқтататын жіктеуіштер жүйесі қолданылады.

Astra-ның киберқауіпсіздік мүмкіндіктері айтарлықтай артқанын ескере отырып, біз осы орналастырудың қауіпсіз әрі қорғалған болуын қамтамасыз ету үшін ерекше сақтық танытып отырмыз. Қосымша қауіпсіздік тексерулері кейде заңды жұмыстарды, соның ішінде қорғаныс мақсатындағы киберқауіпсіздік жұмыстарын баяулатуы, кідіртуі немесе тоқтатуы мүмкін. Егер ChatGPT немесе Codex ішіндегі тапсырма кідіртілсе, жалғастырмас бұрын сізден әрекетті қарап шығу сұралуы мүмкін. API-де тапсырма тоқтайды. Бұл тексерулер кейде заңды жұмысқа кедергі келтіруі мүмкін, сондықтан қажетсіз үзілістерді азайту үшін осы жүйені одан әрі жетілдіруді жалғастырып жатырмыз. Сәйкессіздікті бақылау мақсатқа сәйкестікті алмастыра алмайды: мақсатымыз — рұқсат етілген аясынан сенімді түрде шықпайтын модельдер құру, сондықтан бұл қорғаныс шараларының араласуы қажет болмайды.

Қолжетімділік

GPT‑6 Astra бүгін ұйымдардың шектеулі тобына кезең-кезеңімен қолжетімді бола бастайды және алдағы күндері барлық ChatGPT Plus, Pro, Business және Enterprise пайдаланушыларына, сондай-ақ OpenAI API, Microsoft Azure және AWS Bedrock арқылы қолжетімді болады. Astra-ны пайдалану қолданыстағы жазылым лимиттеріне кіреді, ал пайдаланушылар мен компаниялар қосымша пайдалану үшін кредиттер де сатып ала алады. Pro, Business және Enterprise жоспарларының пайдаланушылары GPT‑6 Astra Pro моделіне де қол жеткізе алады. Enterprise әкімшілері Astra-ны өз жұмыс кеңістігі үшін қоса алады; іске қосылғанда қолжетімділік әдепкі бойынша өшірулі болады.

Astra талаптарға сай API тұтынушылары үшін деректерді мүлде сақтамауды қолдайды және өткен айда хабарлағанымыздай, тұтынушылардың құпиялылығын сақтай отырып, қауіпсіздік мониторингін күшейту үшін құпиялылықты сақтайтын қауіпсіздік өңдеуді сынақтан өткізіп жатырмыз.

Әзірлеушілер үшін GPT‑6 Astra OpenAI API-де gpt-6-astra атауымен және Microsoft Azure мен Amazon Bedrock арқылы қолжетімді болады.

OpenAI API-дегі Standard тарифі 1 миллион кіріс токені үшін 10 АҚШ долларын және 1 миллион шығыс токені үшін 50 АҚШ долларын құрайды. Кэштен оқу және кэшке жазу үшін бөлек тарифтер қолданылады. API-де GPT‑6 Astra үшін «Жылдам» режим қолжетімді және ол Стандартты өңдеуге қарағанда 2 есеге дейін жылдамырақ жұмыс істейді, ал бағасы Стандартты өңдеу бағасының 2 есесіне тең.

Компьютерді пайдалану

Компьютерді пайдалану

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Агенттердің соңғы емтиханы

59,3%

53,6%

-

48,7%

55,5%

-

OSWorld 2.0 (v2026.08.08, офлайн жиынтық, ішінара ұпай)

72,6%

65,7%

-

-

70,2%3

-

ScreenSpot-Pro (құралдарсыз)

92,7%

76,9%

-

87,3%17

-

-

Кәсіби

Кәсіби

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4%

18,1%

31,4%

17,4%

26,9%

-

BenchCAD

95,9%

83,3%

84,3% 5

67,5% 5

82,1% 5

-

BrowseComp

91,5%

90,4%

-

87,4%

90,8%

-

OpenScore ішекті квартеттері (1 - OMR-NED)

0,84

0,19

-

-

-

-

Ішкі дизайн тапсырмалары

50,0%

47,4%

-

35,8%

-

-

Деректер ғылымы бойынша ішкі тапсырмалар

40,9%

30,5%

-

34,7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Кодтау

БағдарламалауGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 кеңейтілген (ұпай)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Негізгі (ұпай)53,3% 847,5%50,9%53,5%53,4%43,6%
Ішкі дерекқорды көшіру тапсырмалары63,9%42,7%57,8%50,3%--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Академиялық

Академиялық

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6%

22,4%

52,6%

21,4%

30,0%

-

FrontierMath 4-деңгей (v2)

97,6%

83,0%

87,8%

90,2%

73,2%

-

GPQA Diamond

96,0%

94,6%

93,7%

92,6%

93,7%

95,3%

Humanity's Last Exam (құралдармен)

57,2%

-

65,0%

63,8%

63,6%

-

Ғылым және денсаулық

Ғылым және ДенсаулықGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (ішкі)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (ұзындық бойынша түзетілген)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Киберқауіпсіздік

КиберқауіпсіздікGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70%-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (2026 ж. маусым–тамыз)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Сәйкестік

Сәйкестік

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Компьютерді ішкі пайдалану қауіпсіздігінің эталондық көрсеткіші (төмен болғаны жақсы)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Компьютерді пайдалану қауіпсіздігінің ішкі бенчмаркі, AutoReview көмегімен (төмен болғаны жақсы)

1,8%

4,3%

-

-

-

-

Айналып өтудің ішкі бенчмаркі (төмен болғаны жақсы)

0,00%

0,29%

-

-

-

-

ExploitGym ханипоты (төмен болғаны жақсы)

0,0%

48,2%

-

-

-

-

Impossible ExploitGym

100,0%

-

-

-

-

-

Ішкі галлюцинация бенчмаркі (төмен болғаны жақсы)

4,2%

12,2%

-

-

-

-

Ұзақ контекст

Ұзақ контекст

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256 мың–512 мың

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512 мың–1 млн

96,3%

73,8%

-

-

-

-

Абстрактілі ой қорыту

Абстрактілі ой қорытуGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9% 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Бағалау ұпайлары кез келген күш салу деңгейінде ең жоғары болып табылады. GPT бағалаулары зерттеу ортамызда немесе API арқылы жүргізілді, сондықтан жүйелік көмексөздердегі, қолжетімді құралдардағы және т.б. айырмашылықтарға байланысты олардың нәтижелері өндірістегі ChatGPT нәтижелерінен сәл өзгеше болуы мүмкін.

ЕСКЕРТПЕЛЕР

  1. 1

    ARC-AGI-3-те GPT-6 Astra нақты әлемдегі өнімділікке жақсырақ сәйкес келу үшін екі параметрді өзгертетін біздің responses API тапсырма ортамызбен⁠ іске қосылды. Бұл өзгерістер ARC-AGI-3-ке арнайы бағытталмаған.

  2. 2

    GPT-5.6 Sol біздің API-де, ChatGPT Codex-те және ChatGPT Work-те қолжетімді нұсқаны білдіреді. ChatGPT-дегі Чат нұсқасы сәл өзгеше.⁠

  3. 3

    OSWorld V2-Offline — интернетке кіру мүмкіндігінсіз жұмыс істейтін бастапқы OSWorld V2 нұсқасының ішкі жиыны. OSWorld-V2 Offline жүйесіндегі Claude моделінің өнімділігін авторлар ресми көшбасшылар кестесінде⁠(жаңа терезеде ашылады) қайта жаңғыртты. OSWorld 2.0-де Claude ұпайларын есептеу үшін Fable 5.1 жүйе картасындағы өзгертілген тапсырмалар мен өзгертілген бағалау емес, ресми параметрлер қолданылады.

  4. 4

    Модель уақыттары — тиісті демонстрациялық іске қосылымдар үшін хабарланған өткен уақыт. Көрсетілген клиптер — өңделген үзінділер.

  5. 5

    BenchCAD жүйесінде Claude бағалары бағалауға енгізілген үш өзгерісті көрсетеді, олар Fable 5.1 Жүйе картасында⁠(жаңа терезеде ашылады) егжей-тегжейлі сипатталған.

  6. 6

    Гуан Ян, Виктория Эберт, Назиф Тамер, Брайан Сиюань Чжэн, Луиза Поццобон және Ноа А. Смит. «LEGATO: Терілген OMR-ге арналған ауқымды, басынан аяғына дейін жалпыланатын тәсіл⁠(жаңа терезеде ашылады).» arXiv:2506.19065, 2025.

  7. 7

    Марк Р. Х. Готэм, Морин Редбонд, Бруно Бауэр және Питер Джонас. «OpenScore ішекті квартеттер корпусы⁠(жаңа терезеде ашылады)». Музыкатануға арналған цифрлық кітапханалар жөніндегі 10-халықаралық конференция материалдары, б. 49–57. ACM, 2023.

  8. 8

    FrontierCode жүйесінде GPT-6 Astra Codex-тегі әзірлеуші хабарламасының бір бөлігіне⁠(жаңа терезеде ашылады) ұқсас әзірлеуші  хабарламасымен іске қосылды: «Тым көп тест файлын жасамаңыз. Жаңа тест файлын тек репозиторий ережелері талап еткенде немесе ешбір қолданыстағы файл қолайлы орын болмағанда ғана жасаңыз. Қатысы жоқ тазалау жұмыстарынан және қажетсіз күрделіліктен аулақ болыңыз. Сәйкес келетін қолданыстағы утилиталарды қайта пайдаланыңыз. Тиісті репозиторий нұсқауларын оқып, жақын жердегі кодты, тесттерді, құжаттаманы және үздіксіз интеграцияны тексеріңіз. Қалыптасқан қағидаларды ұстаныңыз. Мақсат — таза әрі біріктіруге болатын код». Көмексөз бағалау сынағы үшін оңтайландырылмады.

  9. 9

    Біріншісі сан түзуінің бойымен қаншалықты алысқа барсаңыз да, жай сандардың бір-біріне қаншалықты жақын кездесуі мүмкін екеніне қатысты. Он жылдан астам уақыт бойы ең жақсы белгілі нәтиже айырмасы ең көбі 246 болатын жай сандардың шексіз көп жұбы бар екенін көрсетті. Julia Stadlmann⁠(жаңа терезеде ашылады) жақында сол шекті 240-қа дейін жақсартты. Astra 186 болатын неғұрлым қатаң шекті орнатуға көмектесті, бұл шексіз көп жұптың осы кішірек қашықтық ішінде кездесетінін көрсетті. Жай сандар арасындағы қысқа аралықтар: Дәлел⁠(жаңа терезеде ашылады) және растайтын зерттеулер⁠(жаңа терезеде ашылады).

  10. 10

    Екіншісі жай сандар арасындағы әдеттен тыс үлкен алшақтықтарға қатысты. Астра осы аралықтарға арналған шектің 80 жылдан астам уақыт бойы өзгеріссіз қалған бір мүшесін жақсартты. Екі нәтиже үшін де дәлелдемелерді, қысқартылған ойлау тізбегін және тексеру материалдарын бөлісіп отырмыз. Жай сандар арасындағы үлкен алшақтықтар: Дәлел⁠(жаңа терезеде ашылады) және растайтын зерттеулер⁠(жаңа терезеде ашылады).

  11. 11

    Біз барлық Claude модельдерін HealthBench Professional-дың көзделген рәсіміне сай дербес бағалап, GPT‑5.4 бағалауын және ұзындық бойынша түзетілген, шектелмеген ұпайларды қолдандық. Fable 5.1 үшін провайдер бас тартқан жағдайларда резервтік нұсқа ретінде Opus 5 қолдандық.

  12. 12

    Claude Fable 5 және 5.1 LifeSciBench Gold v1, GeneBench Pro v13 және MedChemBench бағалауларына қосылмаған, себебі олар осы бағалаулардағы сұрақтардың көпшілігіне жауап беруден бас тартады.

  13. 13

    ExploitGym платформасында біз Astra мен Sol жүйелерін олардың толық кибер мүмкіндіктерін жақсырақ бағалау үшін алты сағаттық уақыт шектеуінсіз сынақтан өткіздік. Олар жеткілікті жылдам, сондықтан мұның әсері шамалы.

  14. 14

    ExploitBench (2026 жылғы маусым–тамыз) жүйесінде ауырлығы жоғары 20 V8 осалдығы бар және олар Chrome браузерінің 13 тұрақты шығарылымын қамтиды. Бенчмарк агенттердің әрбір көрсетілген осалдықты пайдалану арқылы V8 жүйесінде және Linux жүйесіне арналған ресми Chrome шығарылымдарында ерікті кодты орындауға қол жеткізе алатынын тексереді. Қамтылған кейбір осалдықтар бағалаудың шектеулері жағдайында ерікті кодты орындауға мүмкіндік бермеуі мүмкін, сондықтан 100% сәттілік көрсеткішіне қол жеткізу мүмкін болмауы ықтимал. Ескерту: GPT-5.6 Sol моделінің 5,5% нәтижесі — бенчмарктегі 300 раундтық шектеудің салдары; max қолданатын нақты клиенттерде мұндай шектеу болмайды. Ұқсас параметрлерде модель азырақ шектеулерге тап болғанда 11,5% балл жинады.

  15. 15
  16. 16

    Үшінші тарап модельдерін сынағанда, біз қарапайымырақ зерттеу баптауын қолданамыз. Codex-тің өндірістік конфигурациясы күрделірек, бұл бастапқы модельдегі қателік деңгейлерінің әртүрлі болуына әкелуі мүмкін. Провайдер тарапындағы қорғаныс шаралары мен компьютерлік құралдардың іске асырылуы әлі де әртүрлі. Пайдаланушылар Codex-те растаусыз сценарийге тап болмайды, өйткені бұл ішкі зерттеу конфигурациясы.

  17. 17

    ScreenSpot-Pro және ExploitGym үшін біз келтіретін Fable нәтижелері қауіпсіздік шаралары азырақ Fable болып табылатын Mythos-тан алынған.