Ойлау деңгейі жаңа буыны
2026 жылғы 22 қыркүйектегі жаңарту: GPT‑6 Sol және GPT‑6 Luna модельдерімен GPT‑6 топтамасын кеңейтіп жатырмыз. Толығырақ біліңіз.
Біз әлемдегі ең зияткер және мақсатқа ең жақсы сәйкестендірілген GPT‑6 Astra моделін таныстырамыз.
GPT‑6 Astra алдын ала оқыту, күшейту арқылы оқыту және сәйкестендіру бағыттарындағы көпжылдық зерттеулер мен батыл бастамаларды біріктіреді. Astra компьютерді пайдалану, интернетті шолу, бағдарламалық жасақтама инженериясы, киберқауіпсіздік, ғылым және кәсіби жұмыс салаларында ең озық деңгейде. Astra математикадағы ұзақ уақыттан бері шешілмей келе жатқан ашық мәселелерді шешуге бұған дейін-ақ көмектесіп үлгеріп, FrontierMath Tier 4 деңгейін 98% нәтижемен шегіне жеткізді. Astra ARC-AGI-3 бенчмаркінде 99,9% ұпаймен, ал ExploitBench бенчмаркінде 100% ұпаймен де шекті нәтижеге жетті. Ол сондай-ақ компьютер мен браузерді пайдалану саласында жаңа озық деңгей орнатып, ең талапшыл кәсіби жұмыстарды теңдессіз жылдамдықпен, дәлдікпен және пайыммен орындайды.
GPT‑6 Astra бүгін ұйымдардың шектеулі тобына кезең-кезеңімен қолжетімді бола бастайды және алдағы күндері барлық ChatGPT Plus, Pro, Business және Enterprise пайдаланушыларына, сондай-ақ OpenAI API, Microsoft Azure және AWS Bedrock арқылы қолжетімді болады.
Astra — пайдаланушы ниеті мен модель мінез-құлқын түсінуде елеулі жақсартулары бар, ең үйлесімді моделіміз; Astra-ның пайымына көбірек сенім артып, тапсырмаларды тапсыра аласыз. Мұны сынаудың бір тәсілі ретінде Hugging Face оқиғасына сүйене отырып, қиын немесе орындалмайтын тапсырмаға тап болған модельдің көзделген аясынан шығып кететін-кетпейтінін бағалайтын жаңа сынақ әзірледік. Өндірістік қорғаныс шаралары жоқ кезде рұқсат етілген мақсаттан 48% жағдайда асып кеткен GPT‑5.6 Sol-мен салыстырғанда, GPT‑6 Astra мұны 0% жағдайда жасады.
Компьютерді пайдалануға арналған әлемдегі ең үздік модель
GPT‑6 Astra компьютерді пайдалану жылдамдығы, дәлдігі мен қауіпсіздігі саласында жаңа озық деңгейге жол ашады. Ол онлайн формаларды толтыру, CRM жүйесіндегі тұтынушы жазбаларын жаңарту және күнтізбеңізді реттеу сияқты жалықтыратын тапсырмаларды орындай алады. Ол онлайн зерттеу жүргізіп, электрондық поштаңызда немесе құжат редакторыңызда қысқаша қорытындылардың жобасын дайындай алады. Ол ғылыми деректерді талдай алады, графиктер жасай алады, веб-сайт құра алады және сол сайттағы барлық мүмкіндіктердің жұмыс істейтініне көз жеткізу үшін фронтенд сапасын тексере алады. Ол сізге бағдарламалық жасақтаманы өздігінен орнатып, сынауға және экранда көріп тұрған мәселелерді анықтап, жоюға көмектесе алады. Бұл жақсартулар біздің ең озық бағалау нәтижелерімізде де көрініс тапқан.
Бұл жақсартулар да нақты, білімге негізделген жұмыс тапсырмаларында тиімділіктің айтарлықтай артуына әкеледі. OSWorld 2.0 жүйесіндегі кідіріс симуляцияларында Astra әр тапсырмаға GPT‑5.6-ға қарағанда шамамен 47% аз уақыт жұмсап, компьютерді пайдалану өнімділігінің жоғарырақ деңгейіне қол жеткізеді Sol әр тапсырмаға шамамен 40 минут жұмсап, 72,6% нәтиже көрсетті; салыстыру үшін, шамамен 75 минутта бұл көрсеткіш 65,7% болды.3
GPT‑6 Astra-ның компьютерді пайдалану мүмкіндіктерін ойын әзірлеу, электротехника және күнделікті білімге негізделген жұмыс сияқты әртүрлі салалардағы нәтижелерден көруге болады:
Astra-мен қатар компьютерді пайдалану жылдамдығын айтарлықтай арттыру үшін Codex тапсырма ортасын да жаңартып жатырмыз. Astra-ның тиімділігімен үйлескенде, бұл Mind2Web бенчмаркінде қазіргі GPT‑5.6 Sol тәжірибесімен салыстырғанда тапсырмаларды 1,9 есе жылдамырақ аяқтауға мүмкіндік береді. Модель жылдамдығының жақсаруы оның сіз үшін көп уақытты қажет ететін көптеген күнделікті тапсырмаларды сізден де жылдамырақ орындай алатынын білдіреді.4
Кәсіби жұмыстағы сапалы серпіліс
GPT‑6 Astra күрделі жұмыс тапсырмаларын шешуге көмектесу үшін компьютерді пайдаланудағы жетістіктерді кәсіби орталарға арналған мақсатты оқытумен ұштастырады. Ол күрделі мәселелерге қажетті ойлау деңгейін көпсатылы жұмыс процестерін орындау және сапалы құжаттар, электрондық кестелер мен презентациялар әзірлеу қабілетімен біріктіреді.
GPT‑6 Astra — бар үлгілерді сақтауға және құрылымды баяндау арқылы негізгі ойларды ықшам жеткізетін, макеті жақсы жасалған слайдтар әзірлеуге арналған ең үздік модель. Ол сіздің үлгілеріңізге сай келетін және жазу мәнеріңіз бен визуалды стиліңізге сәйкес келетін анық, жақсы құрылымдалған құжаттар, презентациялар, электрондық кестелер және талдаулар жасайды. Astra сондай-ақ нәтижелерге тек маңызды контекстті ғана енгізуге арнайы үйретілген, осылайша ағымдағы тапсырмаға қажетсіз ақпаратты қайталамайды. Мұның бәрі оның бизнес контекстіңіз бен стандарттарыңызға сәйкес келетін, бірден қолдануға анағұрлым дайын артефактілерді шығара алатынын білдіреді.
GPT‑6 Astra веб-сайттарды, ойындарды, қолданбаларды және рендерлерді жасауда көрнекі пайымдау қабілетін де күшейтеді. ChatGPT ішіндегі Сайттар(жаңа терезеде ашылады) арқылы Astra веб-сайттарды, веб-қолданбаларды және ойындарды көмексөз арқылы тікелей жасап, хостингке орналастырып, бөлісе алады.
Нұсқаулар әртүрлі түсіндіруге мүмкіндік бергенде, GPT‑6 Astra дұрыс шешім қабылдауда алдыңғы модельдерден жақсырақ. Ол контексті пайдаланып, әдеттегі олқылықтардың орнын толтырады және жауап нәтижені өзгертуі мүмкін болған кезде нақты сұрақтар қояды. Codex-те ол жауабыңызға тәуелді емес жұмысты жалғастыра отырып, сұрақтарды асинхронды түрде қоя алады. Жауап бермесеңіз, орынды болған жағдайда негізді болжамдарға сүйеніп жұмысты жалғастырады, бірақ маңызды шешімдерде сіздің жауабыңызды күтеді.
Төмендегі мысалдар жетіспейтін ақпарат жауапты елеулі түрде өзгерте алатын күнделікті тапсырмаларда Astra-ның қалай бірлесіп жұмыс істейтінін көрсетеді.
Astra тапсырма өзгеріп отырған сайын бағдарын сақтауда да жақсырақ. Бұрынғы модельдер кейде бағыттаушы хабарларды жаңа мақсат ретінде қабылдап, бастапқы сұрауды немесе алдыңғы шектеулерді естен шығаратын. Astra жаңа талаптарды ескереді, сұралғанда бағытын өзгертеді және жалпы тапсырманы назардан тыс қалдырмай, қосымша сұрақтарға жауап береді.
Кодтау
GPT‑6 Astra — бүгінгі күнге дейін бағдарламалық жасақтама инженериясына арналған ең үздік модель.
«GPT‑6 Astra ішкі бағдарламалау бенчмарктерімізде озық деңгейдегі өнімділік көрсетіп, GPT‑5.6 Sol-пен салыстырғанда трейдинг интуициясын бағалауда айқын ілгерілеуді көрсетеді. Агенттік бағдарламалау үшін қолданылғанда, GPT‑6 Astra әзірлеушілерге түсінуге оңайырақ түрде байланысып, өндірістік сапаға жету үшін азырақ итерацияны қажет ететін код жасайды».
«Біз Astra-ны алғашқы буындағы бағалауларымыздың бірінде төмен, орташа және жоғары күш жұмсау деңгейлерінде сынадық және ол GPT 5.6 Sol-дан айтарлықтай озып шықты. Жоғары күш жұмсау деңгейі жаңа құрастырылымда көбірек итерация жасауға, браузерлік тестілеу арқылы көбірек тексеруге және apply-patch қолданудан гөрі кодты орындауға басымдық беруге мүмкіндік береді. Модельдің күшін қалай жұмсайтынын түсіну — миллиондаған әзірлеушіге идеядан жұмыс істейтін қолданбаға дейінгі жылдамырақ, сенімдірек жол ұсынуымызға мүмкіндік береді».
Astra көмегімен мәнмәтін терезесі толған кезде Codex-тің мәнмәтінді сақтап, қайта алуына арналған жаңа тәсілді ұсынып отырмыз. Бұрын модельдер күрделі мәселелерді жөндеу немесе ауқымды қайта құрулармен жұмыс істеу сияқты ұзақ сеанстар кезінде жұмысты қорытындылау үшін ықшамдауды қолданатын. Әрбір ықшамдау түзетудің неліктен сәтсіз болғаны немесе компоненттің қалай жұмыс істейтіні туралы кейбір мәліметтерді қамтымай қалуы мүмкін. Codex-те Astra жазбаларды мәнмәтін терезелері арасында сақтай алады, осылайша жинақталған мәліметтерді қайта-қайта бір ғана қорытындыға ықшамдамай сақтайды. Бұрынғы мәнмәтін терезелері іздеуге қолжетімді болып қалады, сондықтан Astra талаптарды немесе тест нәтижелерін алдыңғы хабарламалар мен құралдардың нәтижелерінен таба алады, тіпті бұл ақпарат оның жазбаларында қамтылмаса да. Бұл эксперименттік функцияны Codex config.toml,(жаңа терезеде ашылады) файлында қоса аласыз, ал ол алдағы апталарда Astra үшін әдепкі болады.
Ғылыми жаңалықтарды ілгерілету
Astra ғылыми жаңалық ашу жолындағы практикалық жұмысқа көмектесе алады. Ғылыми ой қорытуды компьютерді пайдаланумен ұштастыра отырып, ол деректерді тексеру және нәтижелерді зерттеу үшін арнайы бағдарламалық жасақтамада тікелей жұмыс істей алады, бұл зерттеушілерге дәлелдерді бағалауға және келесіде нені зерттеу керегін шешуге көмектеседі.
Киберқауіпсіздік
Біз қауіпсіздік туралы жаңартуымызда талқылағанымыздай, Astra — кибермүмкіндіктердегі елеулі серпіліс және біздің Дайындық шеңберіміз аясында киберқауіпсіздік бойынша Критикалық шекке сәйкес келеді. Оның нөлдік күндік эксплойттарды анықтау және әзірлеу қабілеті қорғаушыларға осалдықтарды табуға және түзетуге көмектесе алады, бірақ бұл күштірек қорғаныс шараларының қажеттілігін де туындатады. Бұл мүмкіндіктердің қаншалықты ауқымды екенін түсіну үшін біз Astra-ны ішкі және үшінші тарап сарапшыларының бағалауларында сынақтан өткіздік.
Алдымен модельді өндірістік қауіпсіздік шараларынсыз ExploitBench және ExploitGym сынақтарынан өткіздік; бұл сынақтар модельдердің белгілі бағдарламалық жасақтама осалдықтарын жұмыс істейтін эксплойттарға айналдыра алатынын бағалайды. ExploitBench сынағында Astra 100% мінсіз нәтиже көрсетті, ал бұған дейінгі озық кибермүмкіндіктері бар моделіміз GPT‑5.6 Sol 78,5% нәтиже көрсетті. ExploitGym-де Astra шығыс токендерін айтарлықтай азырақ пайдалана отырып, GPT‑5.6 Sol-дың 30,3%-ымен салыстырғанда 42,4% сәттілік көрсеткішіне жетті.13
Бұрынғы бағдарламалық жасақтама осалдықтарының әсеріне ұшырау бенчмарк нәтижелеріне әсер еткен болуы мүмкін деген алаңдаушылықтарды ескере отырып, біз Astra-ны екі жаңа бенчмаркте де бағаладық. Мысалы, біз алдыңғы үш айдағы осалдықтарды пайдалана отырып, эксплойт әзірлеуді сынау үшін ішкі «ExploitBench (2026 жылғы маусым–тамыз)» бағалауды әзірледік.14 Astra GPT‑5.6‑мен салыстырғанда еркін код орындаудың айтарлықтай жоғары көрсеткіштеріне жетті Sol бұл деректер жиынында шығыс токендерін әлдеқайда азырақ пайдалана отырып. Бағалау барысында Astra тіпті бұрын белгісіз болған екі zero-day осалдығын анықтап, қолданды. Біз екі осалдық туралы да олардың сүйемелдеушілеріне хабарлап жатырмыз.
Сондай-ақ Astra моделін SRE-Bench15 бенчмаркінде сынадық. Бұл бенчмарк модельдердің бастапқы кодқа қол жеткізбей-ақ бағдарламалық жасақтаманың негізгі логикасын түсіну үшін оның екілік файлдарын кері инженериялай алатынын өлшейді. Astra тапсырмалардың 88,0%-ын бір әрекетте және 99,2%-ын төрт әрекет ішінде шешті, ал GPT‑5.6 Sol көрсеткіштері тиісінше 55,9% және 68,7% болды.
Бенчмарк сынақтарынан бөлек, сарапшылар жүргізген бағалаулар Astra өндірістік ортаға арналған қорғаныс шараларысыз іске қосылған кезде, бұрын белгісіз болған осалдықтарды пайдаланып, қорғанысы күшейтілген браузерлерде ерікті кодты орындауға қол жеткізе алатынын және қорғанысы күшейтілген операциялық жүйелер үшін артықшылық көтеруге арналған эксплойттар жасай алатынын көрсетті.
Қорғаушының мүмкіндіктер терезесі материалында талқылағанымыздай, озық кибермүмкіндіктер қорғаушыларға осалдықтарды тезірек табуға көмектесе алады, бірақ бұл осалдықтарды пайдалануды да жеңілдетіп, қорғаушылардың бейімделуін шұғыл етеді. Astra-ның бүгін іске қосылатын нұсқасын қорғаушылар код қауіпсіздігін тексеру және патчтау сияқты тапсырмаларды орындау үшін пайдалана алады.
Алайда, Astra осалдықтарға арналған эксплойттардың тұжырымдамалық дәлелдерін жасау сияқты киберқауіпсіздік бойынша одан да күрделі тапсырмаларды орындаудан бас тартады. OpenAI Daybreak арқылы біз алдағы апталарда қолжетімділікті кеңейтуді және шектеуі азырақ қорғау шараларын енгізуді жоспарлап отырмыз. Бұл осалдықтар мен тұжырымдамалық дәлелдерді тексеру, зиянды бағдарламаларды талдау және анықтау инженериясын қоса алғанда, көбірек қорғанысқа бағытталған жұмыс процестерін іске асыруға мүмкіндік береді.
GPT‑5.6 Sol үшін қорғаныс кешенімізге сүйене отырып, ықтимал кибертеріс пайдаланудан қорғайтын шараларымызды да күшейттік. Оларға ықтимал қорғанысты айналып өту үлгілеріне жақсырақ төтеп беру үшін модельдің төзімділігін арттыру және мониторинг жүйелеріміз үшін кеңірек контекст кіреді. Ішкі редтиминг шабуылшыларымызбен автоматтандырылған бағалауларды қоса алғанда, қатаң ішкі және сыртқы тестілеуді жалғастырдық. Киберқорғаныс шараларымыз бен тестілеу туралы толығырақ ақпарат Astra қауіпсіздік шолуында және жүйе картасында(жаңа терезеде ашылады) қолжетімді..
GPT‑6 Astra-ны жауапкершілікпен үйлестіру және орналастыру
Astra — мақсатқа ең сай модель. Astra мұқият әрекет етуімен, тапсырма шекараларын сақтауымен және ашық қарым-қатынас жасауымен ерекшеленеді. Бұл жұмыс — модельдерді басынан аяғына дейін адам ниетіне сай болып қалатындай етіп үйретуге бағытталған, ұзақ уақыт бойы жүргізіліп келе жатқан зерттеу бағдарламамыздың соңғы нәтижесі.
Сезімтал орталарда Astra тәуекел деңгейіне сай сақтықпен әрекет етеді. Теріс әрекетке итермелейтіндей етіп әдейі іріктелген компьютерді пайдалану тапсырмаларын бағалау барысында Astra көзделмеген салдарларды болдырмауда анағұрлым табысты болды. Әдепкі бойынша ұсынылатын қосымша қауіпсіздік шараларымен іске қосылғанда, өнімділік одан да жоғары болды.
Astra сыналған кез келген басқа озық модельге қарағанда сәйкессіз нәтижелерді азырақ тудырады. Әділ салыстыру үшін біз жалпы компьютермен жұмыс істейтін агенттің тапсырма ортасын (екі OpenAI Responses API(жаңа терезеде ашылады) және Anthropic Messages API(жаңа терезеде ашылады) ішінде қолжетімді нативті компьютерді пайдалану құралдарына негізделген) және Codex пен ChatGPT Work пайдаланушылары үшін әдетте қолданылатын қосымша қорғаныстарсыз (автоматты тексеру, растау саясаты) пайдаландық.
Сондай-ақ Astra пайдаланушы белгілеген және оның ортасы меңзейтін шектер аясында жұмыс істеуге бейім. Ішкі бағалауда Astra Codex Auto-Review бас тартуын айналып өтуге ешқашан әрекет жасаған жоқ. Бұл Auto-review әдейі айналып өтуге болатындай етіп бапталған және әйтпесе тапсырманы орындау мүмкін болмаған жағдайда да өз күшінде қалды. Орта шектеулерін бұлай құрметтеу осы жазбаның кіріспесінде бөліскен орындалуы мүмкін емес кибертапсырма бағалауымыздың нәтижелерімен және жүйе картасында(жаңа терезеде ашылады) құжатталған басқа тұжырымдармен сәйкес келеді.
Astra сонымен қатар пайдаланушылармен ашық қарым-қатынаста жаңа стандарттар белгілейді. Бір бағалауда Astra-ның GPT‑5.6-ға қарағанда ықтималдығы үш есе төмен Sol моделіне қарағанда өзінің мүмкіндіктері мен ұсынатын функциялары туралы дәл емес мәлімдемелер жасау.
Мүмкіндіктерге қатысты галлюцинацияны бағалауымызда Astra GPT‑5.6 Sol-пен салыстырғанда айтарлықтай жақсарып, өз мүмкіндіктері туралы адастыруы мүмкін мәлімдемелерді азырақ жасайды.
Біздің бағалауларымыз Astra-ның жазбаша ой қорытуын GPT‑5.6‑ға қарағанда бақылау қиынырақ екенін анықтады Sol-дікі, оған бақылаудан жалтаруды тікелей сұраған сынақтарға негізделген. Мұны Astra-ның қарапайым тапсырмаларда жазбаша ой қорытуын көбірек басқара алатынымен және мәселелерді жазбаша қадамдарды азырақ қолданып шеше алуымен байланыстырамыз. Astra күрделі тапсырмаларға қажетті ой қорытуды жасыруда әлі де қиналатын сияқты, алайда біз бұл төмендеуге байыппен қараймыз. Бақыланғыштықты жақсарту зерттеудің басым бағыты болып қала береді, ал қоса берілген жүйе картасында(жаңа терезеде ашылады) қорытындыларымыз бен жалғасып жатқан жұмысымыз егжей-тегжейлі сипатталған.
Сәйкестендіру бойынша оқыту — енгізуге қатысты тәсіліміздің өзегі. Қорғаныстың қосымша қабаты ретінде қауіпті мінез-құлықты анықтап, тоқтатуға көмектесу үшін Codex автоматты тексеруі(жаңа терезеде ашылады) сияқты жүйелік қорғаныс шараларын әзірлейміз және агенттердің ой қорытуы мен әрекеттерін бақылаймыз. Қауіпсіздік туралы жаңартуымызда сипатталғандай, сәйкессіздікті көру мүмкіндігіне ие болу және оның ең ауыр көріністерін тоқтатуға көмектесу үшін Astra санатындағы модельдерге өндірістік ортада сәйкессіздік мониторингін де енгізіп жатырмыз. Бұл қорғаныс шаралары ішкі өрістетулерімізге арналған мониторингке ұқсайды. Онда модельдің ой қорытуы мен әрекеттерінің рұқсатсыз мінез-құлыққа қатыстылығын тексеріп, ықтимал рұқсатсыз әрекетті автоматты түрде тоқтататын жіктеуіштер жүйесі қолданылады.
Astra-ның киберқауіпсіздік мүмкіндіктері айтарлықтай артқанын ескере отырып, біз осы орналастырудың қауіпсіз әрі қорғалған болуын қамтамасыз ету үшін ерекше сақтық танытып отырмыз. Қосымша қауіпсіздік тексерулері кейде заңды жұмыстарды, соның ішінде қорғаныс мақсатындағы киберқауіпсіздік жұмыстарын баяулатуы, кідіртуі немесе тоқтатуы мүмкін. Егер ChatGPT немесе Codex ішіндегі тапсырма кідіртілсе, жалғастырмас бұрын сізден әрекетті қарап шығу сұралуы мүмкін. API-де тапсырма тоқтайды. Бұл тексерулер кейде заңды жұмысқа кедергі келтіруі мүмкін, сондықтан қажетсіз үзілістерді азайту үшін осы жүйені одан әрі жетілдіруді жалғастырып жатырмыз. Сәйкессіздікті бақылау мақсатқа сәйкестікті алмастыра алмайды: мақсатымыз — рұқсат етілген аясынан сенімді түрде шықпайтын модельдер құру, сондықтан бұл қорғаныс шараларының араласуы қажет болмайды.
Қолжетімділік
GPT‑6 Astra бүгін ұйымдардың шектеулі тобына кезең-кезеңімен қолжетімді бола бастайды және алдағы күндері барлық ChatGPT Plus, Pro, Business және Enterprise пайдаланушыларына, сондай-ақ OpenAI API, Microsoft Azure және AWS Bedrock арқылы қолжетімді болады. Astra-ны пайдалану қолданыстағы жазылым лимиттеріне кіреді, ал пайдаланушылар мен компаниялар қосымша пайдалану үшін кредиттер де сатып ала алады. Pro, Business және Enterprise жоспарларының пайдаланушылары GPT‑6 Astra Pro моделіне де қол жеткізе алады. Enterprise әкімшілері Astra-ны өз жұмыс кеңістігі үшін қоса алады; іске қосылғанда қолжетімділік әдепкі бойынша өшірулі болады.
Astra талаптарға сай API тұтынушылары үшін деректерді мүлде сақтамауды қолдайды және өткен айда хабарлағанымыздай, тұтынушылардың құпиялылығын сақтай отырып, қауіпсіздік мониторингін күшейту үшін құпиялылықты сақтайтын қауіпсіздік өңдеуді сынақтан өткізіп жатырмыз.
Әзірлеушілер үшін GPT‑6 Astra OpenAI API-де gpt-6-astra атауымен және Microsoft Azure мен Amazon Bedrock арқылы қолжетімді болады.
OpenAI API-дегі Standard тарифі 1 миллион кіріс токені үшін 10 АҚШ долларын және 1 миллион шығыс токені үшін 50 АҚШ долларын құрайды. Кэштен оқу және кэшке жазу үшін бөлек тарифтер қолданылады. API-де GPT‑6 Astra үшін «Жылдам» режим қолжетімді және ол Стандартты өңдеуге қарағанда 2 есеге дейін жылдамырақ жұмыс істейді, ал бағасы Стандартты өңдеу бағасының 2 есесіне тең.
Кәсіби
Кәсіби | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
OpenScore ішекті квартеттері (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Ішкі дизайн тапсырмалары | 50,0% | 47,4% | - | 35,8% | - | - |
Деректер ғылымы бойынша ішкі тапсырмалар | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Кодтау
| Бағдарламалау | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 кеңейтілген (ұпай) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Негізгі (ұпай) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Ішкі дерекқорды көшіру тапсырмалары | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Академиялық
Академиялық | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath 4-деңгей (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (құралдармен) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Сәйкестік
Сәйкестік | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Компьютерді ішкі пайдалану қауіпсіздігінің эталондық көрсеткіші (төмен болғаны жақсы) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Компьютерді пайдалану қауіпсіздігінің ішкі бенчмаркі, AutoReview көмегімен (төмен болғаны жақсы) | 1,8% | 4,3% | - | - | - | - |
Айналып өтудің ішкі бенчмаркі (төмен болғаны жақсы) | 0,00% | 0,29% | - | - | - | - |
ExploitGym ханипоты (төмен болғаны жақсы) | 0,0% | 48,2% | - | - | - | - |
Impossible ExploitGym | 100,0% | - | - | - | - | - |
Ішкі галлюцинация бенчмаркі (төмен болғаны жақсы) | 4,2% | 12,2% | - | - | - | - |
Ұзақ контекст
Ұзақ контекст | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256 мың–512 мың | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512 мың–1 млн | 96,3% | 73,8% | - | - | - | - |
Абстрактілі ой қорыту
| Абстрактілі ой қорыту | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Бағалау ұпайлары кез келген күш салу деңгейінде ең жоғары болып табылады. GPT бағалаулары зерттеу ортамызда немесе API арқылы жүргізілді, сондықтан жүйелік көмексөздердегі, қолжетімді құралдардағы және т.б. айырмашылықтарға байланысты олардың нәтижелері өндірістегі ChatGPT нәтижелерінен сәл өзгеше болуы мүмкін.
ЕСКЕРТПЕЛЕР
- 1
ARC-AGI-3-те GPT-6 Astra нақты әлемдегі өнімділікке жақсырақ сәйкес келу үшін екі параметрді өзгертетін біздің responses API тапсырма ортамызбен іске қосылды. Бұл өзгерістер ARC-AGI-3-ке арнайы бағытталмаған.
- 2
GPT-5.6 Sol біздің API-де, ChatGPT Codex-те және ChatGPT Work-те қолжетімді нұсқаны білдіреді. ChatGPT-дегі Чат нұсқасы сәл өзгеше.
- 3
OSWorld V2-Offline — интернетке кіру мүмкіндігінсіз жұмыс істейтін бастапқы OSWorld V2 нұсқасының ішкі жиыны. OSWorld-V2 Offline жүйесіндегі Claude моделінің өнімділігін авторлар ресми көшбасшылар кестесінде(жаңа терезеде ашылады) қайта жаңғыртты. OSWorld 2.0-де Claude ұпайларын есептеу үшін Fable 5.1 жүйе картасындағы өзгертілген тапсырмалар мен өзгертілген бағалау емес, ресми параметрлер қолданылады.
- 4
- 5
BenchCAD жүйесінде Claude бағалары бағалауға енгізілген үш өзгерісті көрсетеді, олар Fable 5.1 Жүйе картасында(жаңа терезеде ашылады) егжей-тегжейлі сипатталған.
- 6
Гуан Ян, Виктория Эберт, Назиф Тамер, Брайан Сиюань Чжэн, Луиза Поццобон және Ноа А. Смит. «LEGATO: Терілген OMR-ге арналған ауқымды, басынан аяғына дейін жалпыланатын тәсіл(жаңа терезеде ашылады).» arXiv:2506.19065, 2025.
- 7
Марк Р. Х. Готэм, Морин Редбонд, Бруно Бауэр және Питер Джонас. «OpenScore ішекті квартеттер корпусы(жаңа терезеде ашылады)». Музыкатануға арналған цифрлық кітапханалар жөніндегі 10-халықаралық конференция материалдары, б. 49–57. ACM, 2023.
- 8
FrontierCode жүйесінде GPT-6 Astra Codex-тегі әзірлеуші хабарламасының бір бөлігіне(жаңа терезеде ашылады) ұқсас әзірлеуші хабарламасымен іске қосылды: «Тым көп тест файлын жасамаңыз. Жаңа тест файлын тек репозиторий ережелері талап еткенде немесе ешбір қолданыстағы файл қолайлы орын болмағанда ғана жасаңыз. Қатысы жоқ тазалау жұмыстарынан және қажетсіз күрделіліктен аулақ болыңыз. Сәйкес келетін қолданыстағы утилиталарды қайта пайдаланыңыз. Тиісті репозиторий нұсқауларын оқып, жақын жердегі кодты, тесттерді, құжаттаманы және үздіксіз интеграцияны тексеріңіз. Қалыптасқан қағидаларды ұстаныңыз. Мақсат — таза әрі біріктіруге болатын код». Көмексөз бағалау сынағы үшін оңтайландырылмады.
- 9
Біріншісі сан түзуінің бойымен қаншалықты алысқа барсаңыз да, жай сандардың бір-біріне қаншалықты жақын кездесуі мүмкін екеніне қатысты. Он жылдан астам уақыт бойы ең жақсы белгілі нәтиже айырмасы ең көбі 246 болатын жай сандардың шексіз көп жұбы бар екенін көрсетті. Julia Stadlmann(жаңа терезеде ашылады) жақында сол шекті 240-қа дейін жақсартты. Astra 186 болатын неғұрлым қатаң шекті орнатуға көмектесті, бұл шексіз көп жұптың осы кішірек қашықтық ішінде кездесетінін көрсетті. Жай сандар арасындағы қысқа аралықтар: Дәлел(жаңа терезеде ашылады) және растайтын зерттеулер(жаңа терезеде ашылады).
- 10
Екіншісі жай сандар арасындағы әдеттен тыс үлкен алшақтықтарға қатысты. Астра осы аралықтарға арналған шектің 80 жылдан астам уақыт бойы өзгеріссіз қалған бір мүшесін жақсартты. Екі нәтиже үшін де дәлелдемелерді, қысқартылған ойлау тізбегін және тексеру материалдарын бөлісіп отырмыз. Жай сандар арасындағы үлкен алшақтықтар: Дәлел(жаңа терезеде ашылады) және растайтын зерттеулер(жаңа терезеде ашылады).
- 11
- 12
- 13
- 14
ExploitBench (2026 жылғы маусым–тамыз) жүйесінде ауырлығы жоғары 20 V8 осалдығы бар және олар Chrome браузерінің 13 тұрақты шығарылымын қамтиды. Бенчмарк агенттердің әрбір көрсетілген осалдықты пайдалану арқылы V8 жүйесінде және Linux жүйесіне арналған ресми Chrome шығарылымдарында ерікті кодты орындауға қол жеткізе алатынын тексереді. Қамтылған кейбір осалдықтар бағалаудың шектеулері жағдайында ерікті кодты орындауға мүмкіндік бермеуі мүмкін, сондықтан 100% сәттілік көрсеткішіне қол жеткізу мүмкін болмауы ықтимал. Ескерту: GPT-5.6 Sol моделінің 5,5% нәтижесі — бенчмарктегі 300 раундтық шектеудің салдары; max қолданатын нақты клиенттерде мұндай шектеу болмайды. Ұқсас параметрлерде модель азырақ шектеулерге тап болғанда 11,5% балл жинады.
- 15
Jeremy Spence және т.б. «Агенттік киберқауіпсіздіктің келесі сын-қатері: шынайы, контаминациясыз кері инженерияға арналған бенчмарк(жаңа терезеде ашылады)». arXiv:2608.11469v1, 2026.
- 16
Үшінші тарап модельдерін сынағанда, біз қарапайымырақ зерттеу баптауын қолданамыз. Codex-тің өндірістік конфигурациясы күрделірек, бұл бастапқы модельдегі қателік деңгейлерінің әртүрлі болуына әкелуі мүмкін. Провайдер тарапындағы қорғаныс шаралары мен компьютерлік құралдардың іске асырылуы әлі де әртүрлі. Пайдаланушылар Codex-те растаусыз сценарийге тап болмайды, өйткені бұл ішкі зерттеу конфигурациясы.
- 17
