OpenAI

GPT-6 Astra: A new generation of intelligence

Naujos kartos intelektas

Atnaujinta 2026 m. rugsėjo 22 d. Papildome GPT‑6 grupę modeliais „GPT‑6 Sol“ ir „GPT‑6 Luna“. Sužinokite daugiau.

Pristatome „GPT‑6 Astra“ – išmaniausią ir geriausiai suderintą modelį pasaulyje.

„GPT‑6 Astra“ sujungia ilgametį tyrimų įdirbį ir drąsius sprendimus išankstinio mokymo, skatinamojo mokymosi bei suderinimo srityse. „Astra“ – pažangiausias modelis kompiuterio naudojimo, naršymo, programinės įrangos inžinerijos, kibernetinio saugumo, mokslo ir profesionalaus darbo srityse. „Astra“ pasiekia maksimalų „FrontierMath Tier 4“ rezultatą (98 %) ir jau padėjo išspręsti ilgai gvildentas atviras problemas⁠ matematikos srityje. „Astra“ taip pat pasiekia maksimalų ARC-AGI-3 rezultatą (99,9 %) ir šimtaprocentinį „ExploitBench“ rezultatą (100 %). Modelis taip pat atveria naujas kompiuterio ir naršyklės naudojimo galimybes bei atlieka sudėtingiausius profesionalius darbus neprilygstamu greičiu, tikslumu ir įžvalgumu. 

Nuo šiandien „GPT‑6 Astra“ pristatoma ribotam organizacijų skaičiui, o artimiausiomis dienomis taps pasiekiama visiems „ChatGPT Plus“, „Pro“, „Business“ ir „Enterprise“ naudotojams, taip pat per „OpenAI“ API, „Microsoft Azure“ ir „AWS Bedrock“.

„Atliekant „ARC-AGI-3“ testą, „Astra“ pranoko mūsų žmogaus veiksmų efektyvumo atskaitos tašką 96 % lygių, taip faktiškai pasiekdama žmogaus lygį šiame etaloniniame teste. Tai ne tik geriausias mūsų kada nors išbandytas modelis, bet ir reikšmingas šuolis priešakinių modelių našumo srityje – kalbant tiek apie gebėjimą orientuotis ir ieškoti sprendimų naujose aplinkose, tiek apie tai, kaip efektyviai modelis mokosi tai daryti.“
Greg Kamradt, „ARC Prize Foundation“

„Astra“ – tai geriausiai suderintas mūsų modelis. Jis kur kas geriau supranta naudotojo ketinimus ir tinkamą modelio elgseną, todėl galite užtikrinčiau deleguoti užduotis ir pasikliauti „Astra“ sprendimais. Norėdami tai patikrinti, sukūrėme naują vertinimą, pagrįstą „Hugging Face“ incidentu. Jis matuoja, ar modelis, susidūręs su sudėtinga ar neįmanoma užduotimi, neperžengs jam numatytų ribų. Palyginti su „GPT‑5.6 Sol“, kuris be apsaugos priemonių realiomis sąlygomis peržengė leistinas ribas 48 % atvejų, „GPT‑6 Astra“ to nepadarė nė karto (0 % atvejų).

Geriausias pasaulyje kompiuterį naudojantis modelis

„GPT‑6 Astra“ atveria naujas kompiuterio naudojimo greičio, tikslumo ir saugos ribas. Modelis gali pasirūpinti tokiomis nuobodžiomis užduotimis kaip internetinių formų pildymas, klientų įrašų atnaujinimas ryšių su klientais valdymo (CRM) sistemoje ir jūsų kalendoriaus tvarkymas. Jis gali atlikti informacijos paiešką internete ir parengti santraukas jūsų el. pašto programoje arba dokumentų rengyklėje. Jis gali analizuoti mokslinius duomenis, braižyti grafikus, sukurti interneto svetainę ir atlikti naudotojo sąsajos kokybės užtikrinimo (QA) patikras, siekdamas užtikrinti, kad visos tos svetainės funkcijos veiktų sklandžiai. Jis gali padėti autonomiškai įdiegti ir išbandyti programinę įrangą bei išspręsti problemas, kurias matote ekrane. Šie patobulinimai atsispindi ir mūsų pažangiausiuose vertinimo rezultatuose.

Šie patobulinimai taip pat gerokai padidina efektyvumą atliekant realias žinių srities užduotis. Atliekant vėlavimo modeliavimą „OSWorld 2.0“ teste, „Astra“ pasiekia didesnį kompiuterio naudojimo našumą, o vienai užduočiai skiria maždaug 47 % mažiau laiko nei „GPT‑5.6 Sol“ (pasiekia 72,6 % rezultatą per maždaug 40 minučių vienai užduočiai, palyginti su 65,7 % per maždaug 75 minutes)3.

„GPT‑6 Astra“ kompiuterio naudojimo gebėjimai matomi įvairių sričių rezultatuose, įskaitant žaidimų kūrimą, elektros inžineriją ir kasdienį protinį darbą:

Kartu su „Astra“ taip pat atnaujiname „Codex“ infrastruktūrą ir taip gerokai padidiname kompiuterio naudojimo greitį. Dėl „Astra“ efektyvumo tai leidžia užduotis atlikti 1,9 karto greičiau nei naudojant dabartinę „GPT‑5.6 Sol“ versiją (remiantis „Mind2Web“ etaloninio testo rezultatais). Dėl modelio greičio patobulinimų jis gali perimti iš jūsų daugelį daug laiko reikalaujančių kasdienių užduočių ir atlikti jas greičiau nei jūs patys4.

„Pristatymo dieną integruojame „GPT‑6 Astra“ į „Devin“ infrastruktūrą, kurioje modelis pasiekia pažangiausius mūsų vidinio etaloninio testo rezultatus. Dėl puikaus kompiuterio naudojimo, teksto rašymo ir kodo bazės supratimo testavimas pagerėjo vos pradėjus naudoti modelį: vaizdo įrašus pastebimai lengviau sekti, o ataskaitos aiškesnės ir glaustesnės.“
Silas Alberti, „Cognition“ tyrimų vyresnysis viceprezidentas

Didžiulis šuolis profesionaliame darbe

„GPT‑6 Astra“ sujungia kompiuterio naudojimo pasiekimus su profesionalioms aplinkoms skirtu tiksliniu mokymu, padedančiu atlikti sudėtingas darbo užduotis. Modelyje sujungiamas intelektas, būtinas sudėtingoms problemoms spręsti, su gebėjimu vykdyti kelių etapų darbo eigas ir rengti kokybiškus dokumentus, skaičiuokles bei pristatymus.

„GPT‑6 Astra“ – geriausias mūsų modelis, gebantis laikytis esamų šablonų, kurti tvarkingo maketo skaidres ir trumpai bei aiškiai perteikti pagrindines mintis naudojant struktūruotą pasakojimą. Jis sukuria aiškius, tinkamai struktūruotus dokumentus, pristatymus, skaičiuokles ir analizes, kurie atitinka jūsų šablonus, rašymo ir vizualinį stilių. Taip pat „Astra“ specialiai išmokytas į išvestis įtraukti tik svarbų kontekstą, užuot kartojęs konkrečiam darbui nereikalingą informaciją. Visa tai reiškia, kad modelis gali pateikti iš karto naudojamus rezultatus, atitinkančius jūsų verslo kontekstą ir standartus.

„GPT‑6 Astra“ taip pat išsiskiria geresniu vaizdiniu vertinimu kuriant interneto svetaines, žaidimus, programas ir atvaizdavimus. Naudojant „ChatGPT“ funkciją „Sites“ („Svetainės“)⁠(atsidaro naujame lange), „Astra“ gali kurti, talpinti ir dalytis interneto svetainėmis, žiniatinklio programomis bei žaidimais tiesiog iš užklausos.

„Astra suteikia mums reikšmingą pranašumą tiek gebėjimų, tiek efektyvumo atžvilgiu. Modelis sėkmingai atlieka mūsų sudėtingiausias kūrybines darbo eigas ir sunaudoja iki 20 % mažiau žetonų nei kiti mūsų išbandyti modeliai. Svarbiausia, kad mūsų klientams tai reiškia geresnę rezultatų kokybę.“
Alex Mashrabov, „Higgsfield AI“ generalinis direktorius ir vienas iš įkūrėjų

Kai nurodymuose paliekama erdvės interpretacijai, „GPT‑6 Astra“ geriau nei ankstesni modeliai priima tinkamus sprendimus. Jis naudoja kontekstą įprastoms spragoms užpildyti ir užduoda tikslinius klausimus, kai atsakymas gali pakeisti rezultatą. Naudojant „Codex“, jis gali pateikti klausimus asinchroniškai ir tęsti darbą, kuris nepriklauso nuo jūsų atsakymo. Jei neatsakote, prireikus jis remiasi pagrįstomis prielaidomis, tačiau laukia jūsų įvesties prieš priimdamas reikšmingus sprendimus.

Toliau pateiktuose pavyzdžiuose parodyta, kaip „Astra“ bendradarbiauja atliekant kasdienes užduotis, kai trūkstama informacija gali iš esmės pakeisti atsakymą.

„Astra“ taip pat geriau orientuojasi kintant užduoties sąlygoms. Ankstesni modeliai kartais nukreipiamąsias žinutes laikydavo nauju tikslu, todėl pamiršdavo pradinę užklausą ar ankstesnius apribojimus. „Astra“ integruoja naujus reikalavimus, paprašius keičia kryptį ir atsako į papildomus klausimus, neatitrūkdama nuo pagrindinės užduoties.

„Astra“ užtikrina reikšmingą kokybės šuolį palyginti su „GPT‑5.6 Sol“ atliekant sudėtingas teisines užduotis. Ankstyvuosiuose bandymuose „Astra“ išsiskyrė tuo, kad teisinį darbą atlieka taip, kaip tai darytų įžvalgus teisininkas: atskiria dokumentus nuo patvirtintų įrašų, išryškina nepagrįstas prielaidas ir trūkumus paverčia konkrečiomis formuluotėmis rengiant dokumentus.“
Niko Grupen, „Harvey“ taikomųjų tyrimų vadovas

Programavimas

„GPT‑6 Astra“ – iki šiol geriausias programinės įrangos inžinerijos modelis.

1 iš 2
„„GPT‑6 Astra“ pasiekia pažangiausius rezultatus atliekant mūsų vidinius programavimo etaloninius testus ir demonstruoja akivaizdų progresą prekybos intuicijos vertinimuose, palyginti su „GPT‑5.6 Sol“. Naudojant agentiniam programavimui, „GPT‑6 Astra“ bendrauja taip, kad kūrėjams būtų lengviau sekti procesą, ir generuoja kodą, kuriam reikia mažiau iteracijų, kad jį būtų galima naudoti realiomis sąlygomis.“
John Crepezzi, DI asistentai, „Jane Street“

Su „Astra“ pristatome naują būdą, kaip „Codex“ gali išsaugoti ir atkurti kontekstą prisipildžius konteksto langui. Iki šiol, ilgų seansų metu, pavyzdžiui, derinant sudėtingas problemas ar atliekant didelį kodo pertvarkymą, darbui apibendrinti modeliai naudojo tankinimą (angl. „compaction“). Kiekvienas toks apibendrinimas gali praleisti detales apie tai, kodėl pataisymas nepavyko arba kaip veikia atskiras komponentas. „Codex“ aplinkoje „Astra“ užrašus gali išsaugoti skirtinguose konteksto languose, taip išlaikant sukauptas detales ir pakartotinai jų nesutankinti į vieną santrauką. Ankstesniuose konteksto languose išlieka galimybė ieškoti, todėl „Astra“ gali rasti reikalavimus ar testų rezultatus iš ankstesnių žinučių ir priemonių išvesčių – net ir tuo atveju, jei ta informacija nebuvo išsaugota užrašuose. Šią eksperimentinę funkciją galite įjungti savo „Codex“ config.toml faile,⁠(atsidaro naujame lange) o ateinančiomis savaitėmis ji taps numatytąja „Astra“ nuostata.

Mokslinių atradimų skatinimas

„Istorija tokia: vienos eros pabaiga, kitos – pradžia.“
Greg Burnham, „EpochAI“

„GPT‑6 Astra“ – didžiulis pasiekimas mokslinių atradimų, matematikos ir sveikatos srityse. Šiandien dalijamės dar dviem rezultatais apie atstumus tarp pirminių skaičių9 ir 10.

„Astra“ taip pat pasiekė naujų rekordų įvairiuose matematikos ir mokslo vertinimuose.

„Astra“ gali padėti atlikti praktinius darbus, reikalingus moksliniams atradimams. Susiejus mokslinį protavimą su kompiuterio naudojimo įgūdžiais, modelis gali dirbti tiesiogiai specializuotoje programinėje įrangoje – tikrinti duomenis, nagrinėti rezultatus ir padėti tyrėjams įvertinti įrodymus bei nuspręsti, ką tirti toliau.

Kibernetinis saugumas

Kaip aptarėme savo saugos atnaujinime⁠, „Astra“ pasižymi gerokai didesniais kibernetiniais gebėjimais ir pasiekia kibernetinio saugumo kritinę ribą pagal mūsų pasirengimo sistemą. Šio modelio gebėjimas aptikti ir kurti nulinės dienos pažeidžiamumų išnaudojimus gali padėti gynėjams rasti ir ištaisyti silpnąsias vietas, tačiau dėl to taip pat atsiranda stipresnių apsaugos priemonių poreikis. Siekdami suprasti šių gebėjimų ribas, išbandėme „Astra“ atlikdami vidinius ir trečiųjų šalių ekspertų vertinimus.

Pirmiausia išbandėme modelį be apsaugos priemonių realiomis sąlygomis su „ExploitBench“ ir „ExploitGym“, kurie vertina, ar modeliai gali paversti žinomas programinės įrangos pažeidžiamumų spragas veikiančiais pažeidžiamumų išnaudojimais. Atliekant „ExploitBench“ testą, „Astra“ pasiekė maksimalų 100 % rezultatą, palyginti su 78,5 % rodikliu, kurį pademonstravo „GPT‑5.6 Sol“ – ankstesnis mūsų priešakinis kibernetinių gebėjimų turintis modelis. Atliekant „ExploitGym“ testą, „Astra“ sėkmės rodiklis siekė 42,4 %, palyginti su 30,3 % modelio „GPT‑5.6 Sol“ rodikliu, nors modelis naudojo kur kas mažiau išvesties žetonų13.

Atsižvelgdami į nuogąstavimus, kad susidūrimas su ankstesniais programinės įrangos pažeidžiamumais galėjo turėti įtakos etaloniniams rezultatams, taip pat įvertinome „Astra“ naudodami du naujus etaloninius testus. Pirma, sukūrėme vidinį vertinimą „ExploitBench (2026 m. birželio–rugpjūčio mėn.)“, kad patikrintume pažeidžiamumų išnaudojimo kūrimą naudojant pastarųjų trijų mėnesių pažeidžiamumus14. „Astra“ pasiekė gerokai didesnį savavališko kodo vykdymo dažnį nei „GPT‑5.6 Sol“ su šiuo duomenų rinkiniu, sunaudodamas daug mažiau išvesties žetonų. Per vertinimą „Astra“ netgi aptiko ir panaudojo du anksčiau nežinotus nulinės dienos (angl. „zero-day“) pažeidžiamumus. Apie abu pažeidžiamumus pranešėme jų prižiūrėtojams.

Taip pat išbandėme „Astra“ su „SRE-Bench“15 – etaloniniu testu, kuris matuoja, ar modeliai geba atlikti programinės įrangos dvejetainių failų apgrąžos inžineriją, siekiant suprasti jos pagrindinę logiką neturint prieigos prie pradinio kodo. „Astra“ išsprendė 88,0 % užduočių pirmuoju bandymu ir 99,2 % per keturis bandymus, palyginti su „GPT‑5.6 Sol“, kurio rezultatai buvo atitinkamai 55,9 % ir 68,7 %.

Be etaloninių testų, ekspertų atlikti vertinimai parodė, kad paleidus „Astra“ be apsaugos priemonių realiomis sąlygomis, modelis galėtų panaudoti anksčiau nežinotus pažeidžiamumus savavališkam kodui vykdyti sustiprintos saugos naršyklėse ir kurti privilegijų didinimo pažeidžiamumų išnaudojimus sustiprintos saugos operacinėse sistemose.

Kaip minėjome straipsnyje „The Defender’s Window“, priešakiniai kibernetiniai gebėjimai gali padėti gynėjams greičiau rasti silpnąsias vietas, tačiau jas taip pat tampa lengviau išnaudoti, todėl gynėjams būtina kuo greičiau prisitaikyti. Naudodami šiandien pristatomą „Astra“ versiją, gynėjai gali atlikti tokias užduotis kaip saugaus kodo peržiūra ir pataisų diegimas.

Tačiau „Astra“ atsisakys atlikti sudėtingesnes kibernetinio saugumo užduotis, pavyzdžiui, kurti bandomuosius (angl. „proof-of-concept“) pažeidžiamumų išnaudojimus. Per projektą „OpenAI Daybreak“⁠ planuojame artimiausiomis savaitėmis išplėsti prieigą ir pristatyti mažiau ribojančias apsaugos priemones. Tai sudarys sąlygas vykdyti daugiau gynybinių darbo eigų, įskaitant pažeidžiamumų ir jų bandomųjų versijų patvirtinimą, kenkėjiškų programų analizę bei aptikimo sistemų inžineriją.

Taip pat sustiprinome apsaugą nuo galimo kibernetinio piktnaudžiavimo, remdamiesi „GPT‑5.6 Sol“ modelyje taikytu apsaugos priemonių rinkiniu. Pavyzdžiui, padidinome modelio atsparumą, kad jis geriau atlaikytų galimus bandymus apeiti apsaugą (angl. „jailbreaks“), ir suteikėme daugiau konteksto savo stebėsenos sistemoms. Toliau vykdėme griežtą vidinį ir išorinį testavimą, įskaitant automatizuotus vertinimus, kuriuos atliko mūsų vidinė spragų nustatymo komanda. Daugiau informacijos apie mūsų kibernetines apsaugos priemones ir testavimą pateikiama „Astra“ saugos apžvalgoje⁠ ir sistemos kortelėje⁠(atsidaro naujame lange).

Atsakingas „GPT‑6 Astra“ suderinimas ir diegimas

„Astra“ – geriausiai suderintas mūsų modelis. Modeliui „Astra“ puikiai sekasi atidžiai vertinti užduotis, laikytis užduočių ribų ir skaidriai bendrauti. Tai – naujausias mūsų ilgalaikės tyrimų programos, kurios tikslas – išmokyti modelius nuo pradžios iki pabaigos išlikti suderintus su žmogaus ketinimais, rezultatas.

Jautrioje aplinkoje „Astra“ veikia taip atidžiai, kaip to reikalauja rizika. Įvertinus kompiuterio naudojimo užduotis, kurios buvo sąmoningai parinktos siekiant išprovokuoti netinkamą elgesį, pastebėta, kad „Astra“ daug sėkmingiau išvengia nenumatytų pasekmių. Naudojant su papildomomis pagal numatytąsias nuostatas siūlomomis saugumo priemonėmis, pasiekti dar geresni rezultatai.

„Astra“ lemia mažiau nesuderintų rezultatų nei bet kurie kiti išbandyti priešakiniai modeliai. Siekdami užtikrinti objektyvų palyginimą, naudojome standartinę kompiuterį naudojančio agento infrastruktūrą (paremtą bazinėmis kompiuterio naudojimo priemonėmis, prieinamomis tiek „OpenAI Responses API“⁠(atsidaro naujame lange), tiek „Anthropic Messages API“⁠(atsidaro naujame lange)) be jokių papildomų apsaugos priemonių, kurios paprastai taikomos „Codex“ ir „ChatGPT Work“ naudotojams (automatinė peržiūra, patvirtinimo politika).

Be to, „Astra“ dažniau veikia neperžengdama naudotojo nustatytų ir aplinkos padiktuotų ribų. Per vidinį vertinimą „Astra“ nė karto nebandė apeiti „Codex“ automatinės peržiūros atmetimo. Tai pasitvirtino net ir tuomet, kai automatinė peržiūra buvo sąmoningai sukonfigūruota taip, kad ją būtų galima apeiti, o užduoties nebuvo įmanoma atlikti jokiu kitu būdu. Toks aplinkos apribojimų laikymasis atitinka neįmanomos kibernetinės užduoties vertinimo, kuriuo dalijomės šio įrašo pradžioje, rezultatus bei kitas išvadas, pateiktas mūsų sistemos kortelėje⁠(atsidaro naujame lange).

„Astra“ taip pat pasiekia naujų laimėjimų skaidraus bendravimo su naudotojais srityje. Per vieną vertinimą pastebėta, kad „Astra“ tris kartus rečiau nei „GPT‑5.6 Sol“ pateikia netikslią informaciją apie savo galimybes ir paskirtį.

Mūsų atliktame gebėjimų pramanų vertinime „Astra“ gerokai lenkia „GPT‑5.6 Sol“ ir rečiau pateikia klaidinančius teiginius apie savo gebėjimus.

Mūsų vertinimai parodė, kad „Astra“ rašytinį protavimą sunkiau stebėti nei „GPT‑5.6 Sol“ – tuo įsitikinome atlikę testus, kuriuose modelio buvo aiškiai prašoma išvengti stebėsenos. Tai aiškiname tuo, kad atlikdama paprastesnes užduotis „Astra“ geriau kontroliuoja rašytinį protavimą ir geba spręsti problemas atlikdama mažiau rašytinių veiksmų. Atrodo, kad „Astra“ vis dar sunkiai sekasi nuslėpti protavimą, reikalingą atliekant sudėtingas užduotis, tačiau į šį pablogėjimą žiūrime rimtai. Stebėsenos gerinimas išlieka mūsų tyrimų prioritetu, o pridedamoje sistemos kortelėje⁠(atsidaro naujame lange) išsamiai aprašytos mūsų išvados ir vykdomi darbai.

Suderinimo mokymas – pagrindinis mūsų diegimo metodo elementas. Kaip papildomą apsaugos sluoksnį taip pat kuriame sistemos apsaugos priemones, pavyzdžiui, „Codex“ automatinę peržiūrą⁠(atsidaro naujame lange) ir agentų protavimo bei veiksmų stebėseną, kad padėtume aptikti ir suvaldyti nesaugų elgesį. Kaip aprašyta mūsų saugos atnaujinime⁠, realiomis sąlygomis taip pat diegiame „Astra“ klasės modeliams skirtą nesuderinamumų stebėseną, kad galėtume matyti nesuderinamumo atvejus ir padėti suvaldyti blogiausius jų pasireiškimus. Šios apsaugos priemonės primena mūsų vidinių diegimų stebėseną: klasifikatorių sistema tikrina modelio protavimą bei veiksmus ieškodama neleistino elgesio ir automatiškai sustabdo galimai neteisėtą veiklą.

Atsižvelgdami į gerokai išaugusias „Astra“ kibernetinio saugumo galimybes, ypač stengiamės užtikrinti šio modelio diegimo saugumą ir patikimumą. Papildomos saugos patikros kartais gali sulėtinti, pristabdyti ar sustabdyti teisėtą darbą, įskaitant gynybinį kibernetinį saugumą. Jei užduotis pristabdoma „ChatGPT“ arba „Codex“ platformoje, prieš tęsiant darbą jūsų gali paprašyti peržiūrėti veiksmą. API sąsajoje užduotis bus sustabdyta. Šios patikros kartais gali pertraukti įprastą darbą, todėl toliau tobuliname šią sistemą, siekdami sumažinti nereikalingų trikdžių skaičių. Nesuderinamumų stebėsena negali pakeisti suderinimo: mūsų tikslas – kurti modelius, kurie patikimai neperžengia nustatytų leistinų ribų, kad šioms apsaugos priemonėms nereikėtų įsikišti.

Prieinamumas

Nuo šiandien „GPT‑6 Astra“ pristatoma ribotam organizacijų skaičiui, o artimiausiomis dienomis taps pasiekiama visiems „ChatGPT Plus“, „Pro“, „Business“ ir „Enterprise“ naudotojams, taip pat per OpenAI API, Microsoft Azure ir AWS Bedrock. „Astra“ naudojimas įtrauktas į esamus prenumeratos limitus – naudotojai ir įmonės taip pat galės įsigyti kreditų papildomam naudojimui. „Pro“, „Business“ ir „Enterprise“ planų naudotojai taip pat gaus prieigą prie „GPT‑6 Astra Pro“. „Enterprise“ administratoriai gali įjungti „Astra“ savo darbo erdvėje; pradžioje prieiga išjungta.

„Astra“ palaiko nulinį duomenų saugojimą reikalavimus atitinkantiems API klientams, o, kaip minėjome praėjusį mėnesį, šiuo metu išbandome privatų saugos apdorojimą, siekdami sustiprinti saugos stebėseną ir užtikrinti klientų privatumą.

Kūrėjams „GPT‑6 Astra“ bus pasiekiama „OpenAI“ API kaip gpt-6-astra bei per „Microsoft Azure“ ir „Amazon Bedrock“.

Standartinė OpenAI API kaina – 10 USD už milijoną įvesties žetonų ir 50 USD už milijoną išvesties žetonų. Podėlio skaitymui ir rašymui taikomi atskiri įkainiai. „GPT‑6 Astra“ API pasiekiamas spartusis režimas, kuris užtikrina iki 2 kartų didesnį greitį nei standartinis apdorojimas už dvigubą standartinę kainą.

Kompiuterio naudojimas

Kompiuterio naudojimas

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3 %

53,6 %

-

48,7 %

55,5 %

-

„OSWorld 2.0“ (v2026.08.08, neprisijungus pasiekiamas rinkinys, dalinis rezultatas)

72,6 %

65,7 %

-

-

70,2 %3

-

„ScreenSpot-Pro“ (be priemonių)

92,7 %

76,9 %

-

87,3 %17

-

-

Profesionalus

Profesionalus

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

„OpenScore“ styginiai kvartetai (1 - OMR-NED)

0,84

0,19

-

-

-

-

Vidinės dizaino užduotys

50,0 %

47,4 %

-

35,8 %

-

-

Vidinės duomenų mokslo užduotys

40,9 %

30,5 %

-

34,7 %

-

-

Artificial Analysis Intelligence Index v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Programavimas

ProgramavimasGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Extended (rezultatas)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 Main (rezultatas)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Vidinės duomenų bazių perkėlimo užduotys63,9 %42,7 %57,8 %50,3 %--
Artificial Analysis kodavimo agento indeksas v1.467,065,1-67,268,161,2

Akademinis

Akademinis

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath Tier 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA Diamond

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

„Humanity's Last Exam“ (su priemonėmis)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Mokslas ir sveikata

Mokslas ir „ChatGPT“ SveikataGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (vidinis)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (pakoreguotas pagal ilgį)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Kibernetinis saugumas

Kibernetinis saugumasGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70%-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (2026 m. birželio–rugpjūčio mėn.)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Suderinimas

Suderinimas

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Vidinio kompiuterio naudojimo saugos etaloninio testo rezultatai (kuo mažesnis rodiklis, tuo geriau)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Vidinio kompiuterio naudojimo saugos etaloninio testo rezultatai (su automatine peržiūra) (kuo mažesnis rodiklis, tuo geriau)

1,8 %

4,3 %

-

-

-

-

Vidinio apėjimo etaloninio testo rezultatai (kuo mažesnis rodiklis, tuo geriau)

0,00 %

0,29 %

-

-

-

-

„ExploitGym“ spąstai (mažiau – geriau)

0,0 %

48,2 %

-

-

-

-

Impossible ExploitGym

100,0 %

-

-

-

-

-

Vidinių pramanų etaloninio testo rezultatai (kuo mažesnis rodiklis, tuo geriau)

4,2 %

12,2 %

-

-

-

-

Ilgas kontekstas

Ilgas kontekstas

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstraktus samprotavimas

Abstraktus protavimasGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 %97,5 %97,5 %98,5 %97,5 %-

Pateikti vertinimo rezultatai rodo didžiausią pasiektą balą, nepriklausomai nuo bandymų skaičiaus. GPT vertinimai atlikti mūsų tyrimų aplinkoje arba per API, todėl rezultatai gali šiek tiek skirtis nuo „ChatGPT“ rezultatų realiomis sąlygomis dėl sistemos užklausų, prieinamų priemonių ir kitų skirtumų.

IŠNAŠOS

  1. 1

    Atliekant „ARC-AGI-3“ testą, „GPT-6 Astra“ paleista su mūsų atsakymų API infrastruktūra⁠, kurioje pakeistos dvi nuostatos siekiant geriau atspindėti našumą realiomis sąlygomis. Šie pakeitimai nėra specialiai pritaikyti „ARC-AGI-3“.

  2. 2

    „GPT-5.6 Sol“ nurodo versiją, pasiekiamą per mūsų API, taip pat „ChatGPT Codex“ ir „ChatGPT Work“. „ChatGPT“ pokalbiuose naudojama versija šiek tiek skiriasi⁠.

  3. 3

    „OSWorld V2-Offline“ – tai pradinio „OSWorld V2“ poaibis, veikiantis be interneto prieigos. Modelių „Claude“ našumą atliekant „OSWorld-V2 Offline“ testą autoriai atkūrė oficialiojoje lyderių lentelėje⁠(atsidaro naujame lange).„OSWorld 2.0“ teste „Claude“ rezultatams taikomos oficialios nuostatos, o ne modifikuotos užduotys ir pakeistas vertinimas iš „Fable 5.1“ sistemos kortelės.

  4. 4

    Modelių laikai – tai nurodytas laikas, praėjęs atliekant atitinkamus demonstracinius paleidimus. Pateikti klipai – sumontuotos ištraukos.

  5. 5

    Atliekant „BenchCAD“ testą, „Claude“ rezultatai atspindi 3 vertinimo modifikacijas, išsamiai aprašytas „Fable 5.1“ sistemos kortelėje⁠(atsidaro naujame lange).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon ir Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(atsidaro naujame lange).“ arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower ir Peter Jonas. „The OpenScore String Quartet Corpus⁠(atsidaro naujame lange).“ 10-osios tarptautinės konferencijos apie skaitmenines muzikologijos bibliotekas medžiaga (angl. „Proceedings of the 10th International Conference on Digital Libraries for Musicology“), p. 49–57. ACM, 2023.

  8. 8

    Atliekant „FrontierCode“ testą, „GPT-6 Astra“ paleista su kūrėjo žinute, panašia į kūrėjo žinutės dalį modelyje „Codex“⁠(atsidaro naujame lange): „Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code.“ (Venk kurti perteklinius testavimo failus. Naują testavimo failą kurk tik tada, kai to reikalauja saugyklos konvencijos, arba kai joks esamas failas tam netinka. Venk nesusijusių valymo darbų ir nereikalingo sudėtingumo. Pakartotinai naudok tinkamas esamas pagalbines priemones. Perskaityk atitinkamas saugyklos instrukcijas ir peržiūrėk greta esantį kodą, testus, dokumentaciją bei CI informaciją. Laikykis nusistovėjusių konvencijų. Tikslas – švarus, sujungti tinkamas kodas.) Užklausa nebuvo optimizuota šiam vertinimui.

  9. 9

    Pirmasis rezultatas susijęs su tuo, kaip arti vienas kito gali būti pirminiai skaičiai, nesvarbu, kaip toli skaičių tiesėje eitumėte. Daugiau nei dešimtmetį geriausias žinomas rezultatas teigė, kad atstumas tarp be galo daug pirminių skaičių porų – ne didesnis kaip 246. Julia Stadlmann⁠(atsidaro naujame lange) neseniai pagerino šią ribą iki 240. „Astra“ padėjo nustatyti stipresnę ribą – 186, parodydama, kad toks mažesnis atstumas skiria be galo daug porų. Maži atstumai tarp pirminių skaičių: įrodymas⁠(atsidaro naujame lange) ir patvirtinamieji tyrimai⁠(atsidaro naujame lange).

  10. 10

    Antrasis rezultatas susijęs su neįprastai dideliais atstumais tarp pirminių skaičių. „Astra“ pagerino šių atstumų ribos narį, kuris išliko nepakitęs ilgiau nei 80 metų. Dalijamės įrodymais, sutrumpinta minčių grandine ir patvirtinimo medžiaga abiem rezultatams. Dideli atstumai tarp pirminių skaičių: įrodymas⁠(atsidaro naujame lange) ir patvirtinamieji tyrimai⁠(atsidaro naujame lange).

  11. 11

    Mes nepriklausomai įvertinome visus „Claude“ modelius laikydamiesi numatytos „HealthBench Professional“ procedūros bei naudodami „GPT-5.4 “ vertinimą ir pagal ilgį pakoreguotus, neapkarpytus rezultatus. Testuojant „Fable 5.1“, atmetimo atvejams kaip atsarginį variantą naudojome „Opus 5“.

  12. 12

    Modelių „Claude Fable 5“ ir 5.1 nėra „LifeSciBench Gold v1“, „GeneBench Pro v13“ ir „MedChemBench“ vertinimuose, nes į daugumą šių vertinimų klausimų jie neatsako.

  13. 13

    Atlikdami „ExploitGym“ testą, išbandėme „Astra“ ir „Sol“ be 6 valandų laiko limito, kad geriau įvertintume visas jų kibernetines galimybes. Jie pakankamai greiti, todėl tai turi mažai įtakos.

  14. 14

    „ExploitBench“ (2026 m. birželio–rugpjūčio mėn.) apima 20 didelio pavojaus lygio V8 pažeidžiamumų 13-oje stabilių „Chrome“ versijų. Šis etaloninis testas tikrina, ar agentai, išnaudodami kiekvieną nurodytą pažeidžiamumą, gali įvykdyti savavališką kodą (angl. arbitrary code execution) V8 aplinkoje ir oficialiose „Chrome“ laidose, skirtose operacinei sistemai „Linux“. Dėl vertinimo apribojimų kai kurie įtraukti pažeidžiamumai gali neleisti vykdyti savavališko kodo, todėl 100 % sėkmės rodiklis gali būti nepasiekiamas. Pastaba: 5,5 % „GPT-5.6 Sol“ rezultatas yra nulemtas etaloniniame teste taikomo 300 užklausų limito, su kuriuo nesusidurtų realūs klientai, naudojantys „Max“. Esant panašioms nuostatoms ir susidūrus su mažiau ribojimų, modelis pasiekė 11,5 % rezultatą.

  15. 15
  16. 16

    Bandydami trečiųjų šalių modelius, naudojame paprastesnę tyrimų sąrangą. Modeliui „Codex“ taikoma sudėtingesnė konfigūracija realiomis sąlygomis, dėl kurios neapdoroto modelio klaidų rodikliai gali skirtis. Teikėjų taikomos apsaugos priemonės ir kompiuterio priemonių diegimo būdai taip pat vis dar skiriasi. Naudotojai „Codex“ modelyje nesusiduria su scenarijumi be patvirtinimo, nes tai – vidinė tyrimų konfigūracija.

  17. 17

    Mūsų nurodyti „Fable“ rezultatai iš „ScreenSpot-Pro“ ir „ExploitGym“ vertinimų gauti naudojant „Mythos“ – tai „Fable“ modelis, kuriame taikoma mažiau apsaugos priemonių.