OpenAI

GPT-6 Astra: A new generation of intelligence

Uue põlvkonna nutikus

Tutvustame GPT‑6 Astrat, maailma kõige intelligentsemat ja kõige paremini seadistatud mudelit.

GPT‑6 Astra koondab endasse aastatepikkused teadusuuringud ja suured panused eeltreenimise, stiimulõppe ja joondamise valdkonnas. Astra esindab tipptaset arvutikasutuse, veebisirvimise, tarkvaraehituse, küberturvalisuse, teaduse ja kutsetöö vallas. Astra küllastab FrontierMath Tier 4 tulemusega 98%, olles juba aidanud matemaatikas lahendada pikaajalisi lahtisi probleeme. Astra küllastab ka ARC-AGI-3 tulemusega 99,9% ja ExploitBenchi tulemusega 100%. Samuti seab see uue tipptasemel piiri arvuti ja brauseri kasutamises, saades hakkama kõige nõudlikuma professionaalse tööga võrreldamatu kiiruse, täpsuse ja otsustusvõimega. 

GPT‑6 Astra jõuab tänasest piiratud hulgale organisatsioonidele ning muutub lähipäevadel kättesaadavaks kõigile ChatGPT Plusi, Pro, Businessi ja Enterprise'i kasutajatele, samuti OpenAI API, Microsoft Azure'i ja AWS Bedrocki kaudu.

„ARC-AGI-3 testis ületas Astra meie inimtegevuse efektiivsuse baastaset 96% tasemetest, saavutades testis tegelikult inimekvivalentsuse. ee pole mitte ainult parim mudel, mida oleme kunagi katsetanud, vaid kujutab endast ka tähendusrikast sammu edasi eesliinimudelite jõudluses — mitte ainult selle võimes navigeerida ja lahendada uusi keskkondi, vaid ka selles, kui efektiivselt see õpib seda tegema.“
Greg Kamradt, ARC Prize Foundation

Astra on meie kõige paremini ühtlustatud mudel ning selle võime mõista kasutajate kavatsusi ja mudeli käitumist on märkimisväärselt paranenud – saate ülesandeid suurema kindlusega Astra otsustusvõimet usaldades delegeerida. Ühe võimalusena selle testimiseks töötasime Hugging Face’i intsidendi põhjal välja uue hindamise, millega hindame, kas keerulise või võimatu ülesandega silmitsi seisev mudel väljub oma kavandatud tegevusraamidest. Võrdluseks: kui mudel GPT‑5.6 Sol väljus ilma tootmisturvameetmeteta autoriseeritud sihtmärgi piirest 48% juhtudest, siis GPT‑6 Astra tegi seda 0% juhtudest.

Maailma parim arvutikasutuse mudel

GPT‑6 Astra tähistab uut tipptasemel arvutikasutuse kiiruse, täpsuse ja turvalisuse vallas. See tegeleb tüütute ülesannetega, nagu veebivormide täitmine, kliendiandmete värskendamine CRM-süsteemis ja kalendri haldamine. See teeb veebiuuringuid ja koostab kokkuvõtteid sinu e-postis või dokumendiredaktoris. See suudab analüüsida teadusandmeid, koostada graafikuid, luua veebisaidi ja teha kasutajaliidese kvaliteedikontrolle, et veenduda, et kõik selle saidi funktsioonid töötavad. See saab aidata teil iseseisvalt tarkvara installida ja testida ning ekraanil nähtavaid probleeme lahendada. Need täiustused kajastuvad ka meie tipptasemel hindamistulemustes.

Samuti toovad need täiustused kaasa märkimisväärse tõhususe kasvu reaalsetes teadmustöö ülesannetes. OSWorld 2.0 latentsussimulatsioonides saavutab Astra GPT‑5.6-ga võrreldes kõrgema arvutikasutuse jõudluse, kulutades ülesande kohta umbes 47% vähem aega. Sol saavutas tulemuseks 72,6%, kulutades ülesandele umbes 40 minutit, võrreldes 65,7%-ga ligikaudu 75 minuti juures.3

GPT‑6 Astra arvutikasutuse võimekust saab näha erinevate valdkondade väljundites, sealhulgas mänguarenduses, elektrotehnikas ja igapäevases mõttetöös:

Kõrvuti Astraga värskendame ka Codexi täitmiskeskkonna, et oluliselt parandada arvutikasutuse kiirust. Koos Astra tõhususega tähendab see Mind2Webi võrdlusalusel 1,9 korda kiiremat ülesannete täitmist võrreldes praeguse GPT‑5.6 Soli kogemusega. Mudeli kiiruse täiustused tähendavad, et see saab sinu eest enda peale võtta palju aeganõudvaid igapäevaelu ülesandeid kiiremini, kui sa ise suudaksid.

„Lõimime GPT‑6 Astra Devini raamistikku selle käivitamispäeval, kus see pakub meie sisemises testimise võrdlustestis tipptasemel jõudlust. Selle suurepärane arvutikasutus, kirjutamisoskus ja koodibaasi mõistmine parandasid testimist koheselt: videosid on märgatavalt lihtsam jälgida ning aruanded on selgemad ja lakoonilisemad.“
Silas Alberti, Cognitsiooni teadusvaldkonna aepresident

Hüppeline muutus erialases töös

GPT‑6 Astra ühendab edusammud arvutikasutuses sihipärase koolitusega professionaalsete keskkondade jaoks, et aidata lahendada keerulisi tööülesandeid. See ühendab keeruliste probleemide jaoks vajaliku intellekti võimega viia läbi mitmesammulisi töövoogusid ning luua viimistletud dokumente, tabelarvutusi ja esitlusi.

GPT‑6 Astra on meie parim mudel olemasolevate mallide järgimiseks ja hästi paigutatud slaidide loomiseks, mis edastavad põhipunkte kokkuvõtlikult ja struktureeritud narratiivina. See loob selgeid, hästi struktureeritud dokumente, esitlusi, tabeleid ja analüüse, mis järgivad sinu malle ning vastavad sinu kirjutamisstiilile ja visuaalsele stiilile. Astra on samuti treenitud tooma väljunditesse ainult olulise konteksti, selle asemel et korrata käsiloleva töö jaoks ebavajalikku teavet. Kõik see tähendab, et see suudab luua kohe kasutuskõlblikumaid artefakte, mis vastavad sinu ärikontekstile ja standarditele.

GPT‑6 Astra pakub ka paremat visuaalset otsustusvõimet veebisaitide, mängude, rakenduste ja renderduste loomisel. Funktsiooniga Sites(avaneb uues aknas) saab Astra ChatGPT‑s luua, majutada ja jagada veebilehti, veebirakendusi ning mänge otse sisendviiba põhjal.

„Astra annab meile märkimisväärse eelise nii võimekuse kui ka tõhususe osas. See viib edukalt läbi meie kõige keerukamaid loovtöövooge, kasutades kuni 20% vähem tokeneid kui teised mudelid, mida oleme testinud. Kõige tähtsam on, et meie klientide jaoks tähendab see kvaliteetsemat väljundit.”
Alex Mashrabov, Higgsfield AI tegevjuht ja kaasasutaja

Kui juhised jätavad ruumi tõlgendustele, teeb GPT‑6 Astra õige otsuse paremini kui varasemad mudelid. See kasutab konteksti rutiinsete lünkade täitmiseks ja küsib täpsustavaid küsimusi siis, kui vastus võib tulemust oluliselt muuta. Codexis saab see küsida asünkroonselt, jätkates samal ajal tööd, mis ei sõltu sinu vastusest. Kui sa ei vasta, jätkab see asjakohastel juhtudel mõistlike eelduste alusel, kuid ootab sinu sisendit põhimõtteliste ja kaalukate otsuste puhul.

Allpool toodud näited näitavad, kuidas Astra teeb koostööd igapäevaste ülesannete täitmisel, kus puuduv teave võib vastust oluliselt muuta.

Astra on parem ka oma suuna hoidmisel ülesande arenedes. Varasemad mudelid mehhitasid suunavaid sõnumeid vahel uue eesmärgina, kaotades silmist algse taotluse või varasemad piirangud. Astra integreerib uued nõuded, muudab palvel suunda ja vastab kõrvalküsimustele ilma üldisemat ülesannet unustamata.

„Astra on märkimisväärne kvaliteediparandus võrreldes GPT‑5.6 Soliga keerulistes juriidilistes ülesannetes. Meie varajases testimises paistis Astra silma sellega, et lähenes juriidilisele tööle nii, nagu seda teeb tähelepanelik jurist: see eristab dokumente kehtestatud kirjetest, toob esile toetuseta eeldused ja muudab lüngad konkreetseteks koostamisseisukohtadeks.”
Niko Grupen, Harvey rakendusuuringute juht

Kodeerimine

GPT‑6 Astra on senini parim tarkvaraarenduse mudel.

1 / 2
„GPT‑6 Astra pakub meie sisemistes programmeerimise võrdlustestides tipptasemel jõudlust ning näitab selget edasiminekut kauplemisintuitsiooni hindamisel võrreldes mudeliga GPT‑5.6 Sol. Kui seda kasutatakse agendipõhiseks koodikirjutamiseks, suhtleb GPT‑6 Astra viisil, mida arendajatel on lihtsam jälgida, ning toodab koodi, mis nõuab tootmiskvaliteedini jõudmiseks vähem iteratsioone.“
John Crepezzi, tehisintellekti assistendid, Jane Street

Astra abil tutvustame uut viisi, kuidas Codex saab konteksti säilitada ja taastada, kui kontekstivaade saab täis. Varem on mudelid kasutanud tihendamist töö kokkuvõtmiseks pikkade seansside ajal, näiteks keerukate probleemide silumisel või suurte koodirefaktoreerimiste käigus. Iga tihendamine võib jätta välja üksikasju selle kohta, miks parandus ebaõnnestus või kuidas komponent käitub. Codexis saab Astra hoida märkmeid kontekstivaadetes, säilitades kogunenud üksikasjad ilma neid korduvalt ühte kokkuvõttesse tihendamata. Varasemad kontekstivaated jäävad otsitavaks, nii et Astra leiab nõuded või testitulemused varasematest sõnumitest ja tööriistade väljunditest — isegi kui seda teavet ei jäädvustatud selle märkmetes. Selle eksperimentaalse funktsiooni saab lubada oma konfiguratsioonifailis Codex config.toml,(avaneb uues aknas) ja sellest saab lähinädalatel Astra jaoks vaikeseade.

Teadusliku avastamise edendamine

„Lugu on ühe ajastu lõpp, teise algus”.
Greg Burnham, EpochAI

GPT‑6 Astra on suur edasiminek teadusliku avastamise, matemaatika ja tervishoiu jaoks. Täna jagame kahte täiendavat tulemust algarvude vaheliste lünkade kohta [KOOS LINGIGA]. Astra püstitab ka uusi rekordeid teadushindamiste seerias:

Astra saab aidata teaduslike avastustega seotud praktilise tööga. Ühendades teadusliku arutluse arvuti kasutamisega, saab see töötada otse spetsialiseeritud tarkvaras, et uurida andmeid ja analüüsida tulemusi, aidates teadlastel tõendusmaterjali hinnata ja otsustada, mida järgmisena uurida.

Küberturvalisus

Astra on samm edasi küberjulgeoleku võimekuses. Selle võime tuvastada ja välja töötada nullpäeva eksploite võib aidata kaitsjatel turvanõrkusi paigata, kuid tekitab ka vajaduse tugevamate kaitsemeetmete järele. Et mõista, kui kaugele need võimekused ulatuvad, kasutasime sisemisi ja kolmandate osapoolte eksperthinnanguid.

Esmalt testisime Astrat ExploitBenchis ja ExploitGymis, mis mõõdavad, kas mudelid suudavad haavatavates koodibaasides käivitada suvalist koodi.

Arvestades võimalikke muresid, et kokkupuude eemiste tarkvarahaavatavustega võis mõjutada võrdlustestide tulemusi, hindasime Astrat ka kahel uudsel võrdlustestil. Esiteks lõime sisemise hindamise „ExploitBench (juuni–august 2026)”, et testida ärakasutuste arendamist eelneva kolme kuu haavatavuste abil. 2 Astra saavutas selles andmestikus palju suurema suvalise koodi käivitamise määra kui GPT‑5.6 Sol, kasutades märksa vähem väljundtokeneid. Hindamise käigus avastas ja kasutas Astra kahte varem tundmatut Chrome'i V8 heap-põhisest liivakastist väljumise tehnikat. Avaldame mõlemad haavatavused nende haldajatele.

Testisime Astrat ka SRE-Benchis, võrdlusaluses, mis mõõdab, kas mudelid suudavad binaartarkvara pöördprojekteerida, et mõista selle põhiloogikat. Võrdlustesti autorid arendasid tarkvara algusest peale ega avalikustanud selle lähtekoodi. Astra lahendas ühe katsega 88,0% ülesannetest ja nelja katse jooksul 99,2%, võrreldes GPT‑5.6 Soli vastavate näitajatega 55,9% ja 68,7%.

Lisaks võrdlustestidele leidsid ekspertide juhitud hindamised, et Astra suutis kasutada varem tundmatuid haavatavusi suvalise koodi käivitamiseks tugevdatud turbega brauserites ning luua õiguste eskaleerimise eksploite tugevdatud turbega operatsioonisüsteemide jaoks. Kokkuvõttes olid need tulemused aluseks meie otsusele, et Astra on saavutanud küberturvalisuse kriitilise lävendi meie Valmisoleku raamistiku järgi.

Nagu käsitlesime dokumendis The Defender’s Window, võivad tipptasemel kübervõimekused aidata kaitsjatel nõrkusi kiiremini leida, kuid muudavad need nõrkused ka lihtsamini ärakasutatavaks, mis suurendab kaitsjate jaoks kohanemise pakilisust.

Täna välja tulevas Astra versioonis toetame olulisi kaitsetegevusi, nagu turvalise koodi ülevaatus, paikamine ja ohumodelleerimine. Vaikimisi keeldub Astra aga täitmast täiustatud küberjulgeoleku ülesandeid, näiteks haavatavuste avastamist. OpenAI Daybreaki kaudu võtame kasutusele vähem piirava juurdepääsu usaldusväärsete küberturbe kaitsjate alfarühmale OpenAI Daybreaki programmis. See laiendab juurdepääsu kaitsetöövoogudele, sealhulgas haavatavuste analüüsile ja kinnitamisele, pahavara analüüsile, tuvastamise projekteerimisele ning paikade kinnitamisele. Plaanime juurdepääsu Daybreak Blue’i kaudu veelgi laiendada.

Oleme tugevdanud ka oma kaitsemeetmeid võimaliku küberkuritarvitamise vastu, tuginedes oma GPT‑5.6 Soli turvameetmetele. See hõlmab mudeli vastupidavuse põhjalikumat koolitamist, et paremini vastu pidada võimalikele jailbreakidele, ning rohkem konteksti meie seiresüsteemide jaoks. Oleme jätkanud põhjalikku sise- ja välistestimist, sealhulgas automaatteste meie sisemiste lööktestimise ründajatega. Lisateave meie küberkaitse- ja testimismeetmete kohta on saadaval Astra süsteemikaardil ja meie blogis.

GPT‑6 Astra vastutustundlik vastavusse viimine ja kasutuselevõtt

Astra on meie kõige ühtsem mudel. Astra paistab silma hoolika tegutsemise, ülesande piiridest kinnipidamise ja läbipaistva suhtlusega. See töö on uusim tulemus meie pikaajalisest teadusprogrammist, mis keskendub mudelite treenimisele nii, et need püsiksid algusest lõpuni kooskõlas inimese kavatsustega.

Tundlikes keskkondades tegutseb Astra ettevaatlikult, vastavalt riskitasemele. Arvutikasutuse ülesannete hindamisel, kus ülesanded olid ründetestimise põhimõttel valitud väärkäitumise esilekutsumiseks, suutis Astra soovimatuid tagajärgi edukamalt vältida. Vaikimisi pakutavate täiendavate turbemeetmetega käitamine andis veelgi parema jõudluse.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(avaneb uues aknas) and Anthropic Messages API(avaneb uues aknas)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra tegutseb suurema tõenäosusega kasutaja seatud ja keskkonnast tulenevate piirangute raames. Sisemises hindamises ei üritanud Astra kordagi kõrvale hiilida Codex Auto-Review ülevaatuse keeldumisest. See pidas paika isegi siis, kui Auto-Review oli tahtlikult konfigureeritud nii, et sellest saaks kõrvale hiilida, ning ülesannet oli muidu võimatu lõpule viia. See keskkonnapiirangutest kinnipidamine on kooskõlas meie võimatu küberülesande hindamise tulemustega, mida jagasime selle postituse sissejuhatuses, ning teiste leidudega meie süsteemikaardil(avaneb uues aknas).

Astra näitab ka petturliku käitumise märkimisväärset vähenemist. Tööd delegeerivatel inimestel on vaja selget arusaama mudeli võimetest ja ausat aruandlust selle edenemise kohta. See mõõdab aususe ühte aspekti; tahtliku petmise vähendamine on jätkuvalt meie ühtlustamistöö laiem fookus.

Meie võimekuse-hallutsinatsioonide hindamisel näitab Astra olulist paranemist võrreldes GPT‑5.6 Soliga, tehes oma võimete kohta vähem eksitavaid väiteid.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(avaneb uues aknas) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(avaneb uues aknas) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Kättesaadavus

GPT‑6 Astra jõuab täna ettevõtete ja meie Trusted Access Programmi klientideni ning muutub lähipäevil laialdaselt kättesaadavaks ChatGPT Plusi, Pro, Businessi ja Enterprise'i tellijatele. Astra kasutamine sisaldub olemasolevas kasutuslimiidis 100- ja 200-dollaristes Pro pakettides ning 100-dollarises Businessi paketis, ilma täiendavate kiiruspiirangute või piiranguteta. Inimesed, kellel on 20-dollarine Plusi tellimus, ja standardse Businessi paketi kliendid saavad GPT‑6 Astrale juurde pääseda madalamate limiitidega, võimalusega osta täiendava juurdepääsu saamiseks krediiti. Enterprise'i administraatorid saavad Astra oma tööjaama jaoks lubada; käivitamisel on juurdepääs vaikimisi välja lülitatud.

Pro Lite’i, Pro, Businessi ja Enterprise’i kasutajad saavad GPT‑6 Astrat kasutada ka Chatis. Astra toetab tingimustele vastavate API-klientide puhul põhimõtet „andmeid ei säilitata“ ning nagu eelmisel kuul teatasime, testime Private Safety Processingut, et tugevdada ohutusseiret, säilitades samal ajal kliendi privaatsuse.

Arendajatele on GPT‑6 Astra saadaval OpenAI API-s nimega gpt-6-astra ning AWS Bedrockis. OpenAI API standardhinnastus on kümme dollarit miljoni sisendtokeni kohta ja 50 dollarit miljoni väljundtokeni kohta. Vahemälu lugemistele ja kirjutamistele kehtivad eraldi tariifid. Kiirrežiim on GPT‑6 Astra jaoks API-s saadaval ning pakub standardtöötlusega võrreldes kuni 2,5-kordset kiirust kahekordse standardhinnaga.

Arvuti kasutamine

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Teadus ja tervis

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Küberturvalisus

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Vastavus

Vastavus

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Sisemine arvutikasutuse turvalisuse võrdlustest (madalam on parem)

2,4%

22,0%

9,5%

18,3%

11,5%

-

Sisemine arvutikasutuse ohutuse võrdlustest, koos AutoReview’ga (madalam on parem)

1,8%

4,3%

-

-

-

-

Sisemine kõrvalehoidmise võrdlustest (madalam on parem)

0,00%

0,29%

-

-

-

-

ExploitGymi peibutusvõrk (madalam on parem)

0,0%

48,2%

-

-

-

-

Võimatu ExploitGym

100,0%

-

-

-

-

-

Sisemine hallutsinatsioonide võrdlustest (madalam on parem)

4,2%

12,2%

-

-

-

-

Pikk kontekst

Pikk kontekst

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0%

91,5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K–1M

96,3%

73,8%

-

-

-

-

Abstraktne arutlemine

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Hindamisskoorid kujutavad endast maksimaalset tulemust mis tahes pingutustaseme juures. GPT hindamised viidi läbi meie uurimiskeskkonnas või meie API kaudu, mis võib süsteemi viipade, saadaolevate tööriistade jms erinevuste tõttu anda tootmis-ChatGPT‑st veidi erineva tulemuse.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(avaneb uues aknas). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(avaneb uues aknas).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(avaneb uues aknas).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(avaneb uues aknas).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(avaneb uues aknas): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(avaneb uues aknas) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(avaneb uues aknas) and supporting research(avaneb uues aknas).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(avaneb uues aknas) and supporting research(avaneb uues aknas).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.