OpenAI

GPT-6 Astra: A new generation of intelligence

Ġenerazzjoni ġdida ta’ intelliġenza

Qed nintroduċu GPT‑6 Astra, l-aktar mudell intelliġenti u allinjat fid-dinja.

GPT‑6 Astra jiġbor flimkien snin ta’ riċerka u investimenti kbar fit-taħriġ minn qabel, l-apprendiment ta’ tisħiħ u l-allinjament. Astra huwa avvanzat fl-użu tal-kompjuter, il-browsing, l-inġinerija tas-softwer, iċ-ċibersigurtà, ix-xjenza u x-xogħol professjonali. Astra jissatura FrontierMath Tier 4 b’punteġġ ta’ 98%, wara li diġà għen isolvi problemi miftuħa li ilhom jeżistu fil-matematika. Astra jissatura wkoll ARC-AGI-3 b’punteġġ ta’ 99.9% u ExploitBench b’punteġġ ta’ 100%. Jistabbilixxi wkoll fruntiera ġdida fl-użu tal-kompjuter u l-browser, u jwettaq l-aktar xogħol professjonali impenjattiv b’veloċità, preċiżjoni u ġudizzju bla paragun. 

GPT‑6 Astra qed jitnieda llum għal għadd limitat ta’ organizzazzjonijiet u fil-jiem li ġejjin se jkun disponibbli għall-utenti kollha ta’ ChatGPT Plus, Pro, Business u Enterprise, kif ukoll permezz tal-API ta’ OpenAI, Microsoft Azure u AWS Bedrock.

On ARC-AGI-3, Astra surpassed our human action-efficiency baseline on 96% of levels, effectively reaching human parity on the benchmark. Not only is this the best model we’ve ever tested, but it also represents a meaningful step change in frontier-model performance - not only in its ability to navigate and solve novel environments, but also in how efficiently it learns to do so.
Greg Kamradt, ARC Prize Foundation

Astra is our most aligned model, with substantial improvements in understanding user intent and model behavior—you can delegate tasks with greater confidence in Astra’s judgment. As one way that we test this, we built a new evaluation informed by the Hugging Face incident that evaluates whether a model facing a difficult or impossible task will go beyond its intended scope. Compared to GPT‑5.6 Sol, which without production safeguards went beyond the authorized target 48% of the time, GPT‑6 Astra did this in 0% of cases.

L-aqwa mudell fid-dinja għall-użu tal-kompjuter

GPT‑6 Astra jistabbilixxi fruntiera ġdida fil-veloċità, il-preċiżjoni u s-sikurezza tal-użu tal-kompjuter. Jista’ jieħu ħsieb kompiti tedjanti bħall-mili ta’ formoli online, l-aġġornament tar-rekords tal-klijenti f’CRM u l-organizzazzjoni tal-kalendarju tiegħek. Jista’ jagħmel riċerka online u jabbozza sommarji fl-email jew fl-editur tad-dokumenti tiegħek. Jista’ janalizza dejta xjentifika, joħloq graffs u sit web, u jwettaq kontrolli tal-QA tal-frontend biex jiżgura li l-karatteristiċi kollha tas-sit jaħdmu. Jista’ jgħinek tinstalla u tittestja softwer b’mod awtonomu, u ssolvi problemi li tara fuq l-iskrin. Dan it-titjib jidher ukoll fir-riżultati tal-evalwazzjonijiet avvanzati tagħna.

These improvements also result in significant efficiency gains in real knowledge-work tasks. In latency simulations on OSWorld 2.0, Astra achieves higher computer-use performance in about 47% less time per task than GPT‑5.6 Sol, scoring 72.6% at roughly 40 minutes per task, compared with 65.7% at roughly 75 minutes.3

Il-kapaċitajiet ta’ GPT‑6 Astra fl-użu tal-kompjuter jidhru f’outputs f’diversi oqsma, inklużi l-iżvilupp tal-logħob, l-inġinerija elettrika u x-xogħol ta’ għarfien ta’ kuljum:

Flimkien ma’ Astra, qed naġġornaw ukoll il-harness ta’ Codex biex intejbu b’mod sinifikanti l-veloċità tal-użu tal-kompjuter. Flimkien mal-effiċjenza ta’ Astra, dan ifisser tlestija tal-kompiti 1.9 darbiet aktar malajr mill-esperjenza attwali ta’ GPT‑5.6 Sol fuq il-benchmark Mind2Web. It-titjib fil-veloċità tal-mudell ifisser li jista’ jieħu ħsieb ħafna kompiti tal-ħajja li jieħdu ħafna ħin, u jagħmilhom aktar malajr minnek.

“We’re integrating GPT‑6 Astra into Devin’s harness on launch day, where it delivers state-of-the-art performance on our internal testing benchmark. Its excellent computer use, writing, and codebase understanding improved testing right out of the box: videos are noticeably easier to follow, and reports are clearer and more concise”
Silas Alberti, SVP Research, Cognition

A step change in professional work

GPT‑6 Astra jgħaqqad l-avvanzi fl-użu tal-kompjuter ma’ taħriġ immirat għal ambjenti professjonali, biex jgħin f’kompiti kumplessi tax-xogħol. Jgħaqqad l-intelliġenza meħtieġa għal problemi kumplessi mal-kapaċità li jwettaq flussi tax-xogħol b’diversi passi u jipproduċi dokumenti, spreadsheets u preżentazzjonijiet irfinuti.

GPT‑6 Astra is our best model for adhering to existing templates and producing slides that are well laid out and succinctly convey key points with a structured narrative. It creates clear, well-structured documents, presentations, spreadsheets, and analyses that follow your templates and match your writing and visual style. Astra is also trained to specifically pull only the context that matters into outputs, instead of repeating information unnecessary for the work at hand. All this means it can output more immediately usable artifacts that match your business context and standards.

GPT‑6 Astra jġib ukoll ġudizzju viżiv aħjar lis-siti web, il-logħob, l-applikazzjonijiet u r-rendituri li jibni. Bis-Siti(jinfetaħ f’tieqa ġdida) f’ChatGPT, Astra jista’ joħloq, jospita u jaqsam siti web, apps web u logħob direttament minn prompt.

“Astra jagħtina vantaġġ sinifikanti kemm fil-kapaċità kif ukoll fl-effiċjenza. Iwettaq b’suċċess l-aktar flussi tax-xogħol kreattivi kumplessi tagħna filwaqt li juża sa 20% inqas tokens minn mudelli oħra li ttestjajna. L-aktar importanti għall-klijenti tagħna, dan ifisser output ta’ kwalità ogħla.”
Alex Mashrabov, CEO u Kofundatur, Higgsfield AI

Meta l-istruzzjonijiet iħallu lok għall-interpretazzjoni, GPT‑6 Astra jieħu d-deċiżjoni t-tajba aħjar mill-mudelli preċedenti. Juża l-kuntest biex jimla lakuni ordinarji u jistaqsi mistoqsijiet iffukati meta t-tweġiba tista’ tbiddel ir-riżultat. F’Codex, jista’ jistaqsi b’mod asinkronu waqt li jkompli xogħol li ma jiddependix mit-tweġiba tiegħek. Jekk ma tweġibx, jipproċedi b’suppożizzjonijiet raġonevoli fejn xieraq, iżda jistenna l-kontribut tiegħek għal deċiżjonijiet importanti.

L-eżempji hawn taħt juru kif Astra jikkollabora f’kompiti ta’ kuljum fejn informazzjoni nieqsa tista’ tbiddel sostanzjalment it-tweġiba.

Astra huwa wkoll aħjar biex iżomm id-direzzjoni hekk kif il-kompitu jevolvi. Mudelli preċedenti kultant ittrattaw messaġġi ta’ direzzjoni bħala għan ġdid, u tilfu t-talba oriġinali jew ir-restrizzjonijiet preċedenti. Astra jinkorpora rekwiżiti ġodda, ibiddel id-direzzjoni meta jintalab u jwieġeb mistoqsijiet sekondarji mingħajr ma jitlef il-kompitu usa’.

“Astra joffri titjib sinifikanti fil-kwalità fuq GPT‑5.6 Sol f’kompiti legali kumplessi. Fl-ittestjar bikri tagħna, Astra spikka billi ttratta x-xogħol legali bħal avukat għaqli: jiddistingwi d-dokumenti mir-rekords stabbiliti, jikxef suppożizzjonijiet mhux sostnuti u jbiddel il-lakuni f’pożizzjonijiet konkreti għall-abbozzar.”
Niko Grupen, Kap tar-Riċerka Applikata, Harvey

Coding

GPT‑6 Astra is the best model for software engineering to date.

1 minn 2
“GPT‑6 Astra jagħti prestazzjoni avvanzata fil-benchmarks interni tal-kowdjar tagħna u juri pass ċar ’il quddiem fl-evalwazzjonijiet tal-intuwizzjoni tan-negozjar meta mqabbel ma’ GPT‑5.6 Sol. Meta jintuża għall-ikkowdjar b’karatteristiċi aġenti, GPT‑6 Astra jikkomunika b’mod aktar faċli biex l-iżviluppaturi jsegwuh u jipproduċi kodiċi li jeħtieġ inqas iterazzjonijiet biex jilħaq kwalità tal-produzzjoni.”
John Crepezzi, Assistenti tal-IA, Jane Street

B’Astra, qed nintroduċu mod ġdid biex Codex jippreserva u jirkupra l-kuntest meta timtela t-tieqa tal-kuntest. Storikament, il-mudelli użaw il-kompattazzjoni biex jiġbru fil-qosor ix-xogħol matul sessjonijiet twal, bħal meta jiddibaggjaw problemi kumplessi jew iwettqu refactoring kbir. Kull kompattazzjoni tista’ tħalli barra dettalji dwar għaliex soluzzjoni falliet jew kif iġib ruħu komponent. F’Codex, Astra jista’ jżomm noti bejn twieqi tal-kuntest, u jippreserva d-dettalji akkumulati mingħajr ma jerġa’ jikkompressahom ripetutament f’sommarju wieħed. It-twieqi tal-kuntest preċedenti jibqgħu jistgħu jitfittxu, għalhekk Astra jista’ jsib rekwiżiti jew riżultati tat-testijiet minn messaġġi u outputs tal-għodod preċedenti—anke jekk dik l-informazzjoni ma ddaħħlitx fin-noti tiegħu. Tista’ tattiva din il-karatteristika sperimentali fil-Codex config.toml,(jinfetaħ f’tieqa ġdida) tiegħek, u fil-ġimgħat li ġejjin issir l-għażla awtomatika għal Astra.

Inħaffu l-iskoperta xjentifika

“L-istorja hi: tmiem ta’ era u bidu ta’ oħra.”
Greg Burnham, EpochAI

GPT‑6 Astra huwa avvanz kbir għall-iskoperta xjentifika, il-matematika u s-saħħa. Illum qed naqsmu żewġ riżultati oħra dwar id-distakki bejn in-numri primi [BIL-LINK]. Astra jistabbilixxi wkoll rekords ġodda f’sensiela ta’ evalwazzjonijiet xjentifiċi:

Astra jista’ jgħin fix-xogħol prattiku wara l-iskoperta xjentifika. Billi jgħaqqad ir-raġunament xjentifiku mal-użu tal-kompjuter, jista’ jaħdem direttament f’softwer speċjalizzat biex jispezzjona d-dejta u jesplora r-riżultati, u jgħin lir-riċerkaturi jivvalutaw l-evidenza u jiddeċiedu x’jinvestigaw wara.

Cybersecurity

Astra jirrappreżenta qabża kbira fil-kapaċitajiet taċ-ċibersigurtà. Il-ħila tiegħu li jidentifika u jiżviluppa exploits zero-day tista’ tgħin lid-difensuri jsewwu d-dgħufijiet, iżda toħloq ukoll il-ħtieġa għal salvagwardji aktar b’saħħithom. Biex nifhmu kemm jaslu dawn il-kapaċitajiet, użajna evalwazzjonijiet minn esperti interni u esterni.

L-ewwel ittestjajna lil Astra fuq ExploitBench u ExploitGym, li jkejlu jekk il-mudelli jistgħux jiksbu eżekuzzjoni arbitrarja tal-kodiċi f’bażijiet ta’ kodiċi vulnerabbli.

Minħabba tħassib possibbli li l-esponiment għal vulnerabbiltajiet storiċi tas-softwer seta’ affettwa r-riżultati tal-benchmark, evalwajna wkoll lil Astra fuq żewġ benchmarks ġodda. Għal wieħed minnhom, bnejna evalwazzjoni interna “ExploitBench (Ġunju–Awwissu 2026)” biex nittestjaw l-iżvilupp ta’ exploits b’vulnerabbiltajiet mit-tliet xhur preċedenti. 2 Astra kiseb rati ferm ogħla ta’ eżekuzzjoni arbitrarja tal-kodiċi minn GPT‑5.6 Sol fuq dan is-sett tad-dejta, filwaqt li uża ħafna inqas tokens tal-output. Matul l-evalwazzjoni, Astra skopra u uża żewġ tekniki li qabel ma kinux magħrufa biex jaħrab mill-heap sandbox ta’ Chrome V8. Qed niżvelaw iż-żewġ vulnerabbiltajiet lill-mantenituri tagħhom.

Ittestjajna wkoll lil Astra fuq SRE-Bench, benchmark li jkejjel jekk il-mudelli jistgħux jagħmlu inġinerija inversa ta’ softwer binarju biex jifhmu l-loġika ewlenija tiegħu. L-awturi tal-benchmark bnew is-softwer mill-bidu u żammew il-kodiċi sors tiegħu privat. Astra solva 88.0% tal-kompiti f’tentattiv wieħed u 99.2% f’erba’ tentattivi, meta mqabbel ma’ 55.9% u 68.7% għal GPT‑5.6 Sol, rispettivament.

Lil hinn mill-benchmarks, valutazzjonijiet immexxija minn esperti sabu li Astra seta’ juża vulnerabbiltajiet li qabel ma kinux magħrufa biex jikseb eżekuzzjoni arbitrarja tal-kodiċi fi brawżers imsaħħa u joħloq exploits għall-eskalazzjoni tal-privileġġi f’sistemi operattivi msaħħa. Meħuda flimkien, dawn ir-riżultati wassluna għad-deċiżjoni li Astra laħaq il-livell Kritiku fiċ-ċibersigurtà skont il-Qafas tat-Tħejjija tagħna.

Kif iddiskutejna f’It-Tieqa tad-Difensur, kapaċitajiet ċibernetiċi avvanzati jistgħu jgħinu lid-difensuri jsibu d-dgħufijiet aktar malajr, iżda jagħmlu wkoll dawk id-dgħufijiet aktar faċli biex jiġu sfruttati, u b’hekk iżidu l-urġenza biex id-difensuri jadattaw.

Għall-verżjoni ta’ Astra li qed titnieda llum, nappoġġjaw kompiti difensivi importanti bħar-rieżami sigur tal-kodiċi, l-applikazzjoni ta’ rqajja’ u l-immudellar tat-theddid. Madankollu, awtomatikament Astra jirrifjuta li jwettaq kompiti avvanzati taċ-ċibersigurtà bħall-iskoperta ta’ exploits. Permezz ta’ OpenAI Daybreak, qed inniedu aċċess inqas restrittiv għal grupp alpha ta’ difensuri fdati taċ-ċibersigurtà fil-programm OpenAI Daybreak. Dan jestendi l-aċċess għal flussi tax-xogħol difensivi, inklużi t-trijaġġ u l-validazzjoni tal-vulnerabbiltajiet, l-analiżi tal-malware, l-inġinerija tas-sejbien u l-validazzjoni tal-irqajja’. Qed nippjanaw li nespandu aktar l-aċċess permezz ta’ Daybreak Blue.

Saħħaħna wkoll il-protezzjonijiet tagħna kontra użu ħażin ċibernetiku potenzjali, billi bnejna fuq il-ġabra ta’ salvagwardji tagħna għal GPT‑5.6 Sol. Dawn jinkludu taħriġ aktar b’saħħtu tar-robustezza tal-mudell biex jirreżisti aħjar jailbreaks potenzjali, u aktar kuntest għas-sistemi ta’ monitoraġġ tagħna. Komplejna b’ittestjar intern u estern rigoruż, inklużi testijiet awtomatizzati bl-attakkanti interni tagħna tar-red teaming. Aktar dettalji dwar is-salvagwardji u l-ittestjar ċibernetiċi tagħna jinsabu fil-kard tas-sistema ta’ Astra u fil-blog tagħna.

Allinjament u tnedija responsabbli ta’ GPT‑6 Astra

Astra is our most aligned model. Astra excels at exercising care, respecting task boundaries, and communicating transparently. This work is the latest product of our long-running research program focused on training models that remain aligned with human intent from start to finish.

In sensitive environments, Astra proceeds with care commensurate with its risk. In an evaluation of computer use tasks adversarially selected to elicit misbehavior, Astra was more successful at avoiding unintended consequences. Running with additional security measures offered by default yielded even stronger performance.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(jinfetaħ f’tieqa ġdida) and Anthropic Messages API(jinfetaħ f’tieqa ġdida)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra is also more likely to operate within the boundaries set by the user and implied by its environment. In an internal evaluation, Astra never attempted to circumvent a Codex Auto-Review denial. This held even when Auto-review was deliberately configured to be evadable and the task was impossible to complete otherwise. This respect for the environment restrictions is consistent with the results of our impossible cyber task evaluation that we shared in the intro of this post and other findings documented in our system card(jinfetaħ f’tieqa ġdida).

Astra jistabbilixxi wkoll livelli ġodda ta’ komunikazzjoni trasparenti mal-utent. F’evalwazzjoni waħda, Astra għandu probabbiltà tliet darbiet inqas minn GPT 5.6-Sol li jagħmel stqarrijiet mhux preċiżi dwar il-kapaċitajiet u l-funzjonijiet tiegħu.

Fl-evalwazzjoni tagħna tal-alluċinazzjonijiet dwar il-kapaċitajiet, Astra juri titjib sostanzjali fuq GPT‑5.6 Sol u jagħmel inqas stqarrijiet qarrieqa dwar il-kapaċitajiet tiegħu.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(jinfetaħ f’tieqa ġdida) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(jinfetaħ f’tieqa ġdida) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Availability

GPT‑6 Astra qed jitnieda llum għal għadd limitat ta’ organizzazzjonijiet u fil-jiem li ġejjin se jkun disponibbli għall-utenti kollha ta’ ChatGPT Plus, Pro, Business u Enterprise, kif ukoll permezz tal-API ta’ OpenAI, Microsoft Azure u AWS Bedrock. L-użu ta’ Astra huwa inkluż fil-kwoti tal-abbonament eżistenti—l-utenti u n-negozji se jkunu jistgħu wkoll jixtru krediti għal użu addizzjonali. L-utenti tal-pjanijiet Pro, Business u Enterprise se jkollhom ukoll aċċess għal GPT‑6 Astra Pro. L-amministraturi tal-Enterprise jistgħu jattivaw Astra għall-workspace tagħhom; mal-varar, l-aċċess ikun diżattivat b’mod awtomatiku.

Astra jappoġġja l-ebda żamma tad-dejta għal klijenti eliġibbli tal-API, u kif għedna x-xahar li għadda, qed nittestjaw Proċessar Privat tas-Sikurezza biex insaħħu l-monitoraġġ tas-sikurezza filwaqt li nħarsu l-privatezza tal-klijenti.

Għall-iżviluppaturi, GPT‑6 Astra se jkun disponibbli fl-API ta’ OpenAI bħala gpt-6-astra u permezz ta’ Microsoft Azure u Amazon Bedrock.

Il-prezz Standard tal-API ta’ OpenAI huwa $10 għal kull miljun token tal-input u $50 għal kull miljun token tal-output. Japplikaw rati separati għall-qari u l-kitba tal-cache. Il-Modalità veloċi hija disponibbli għal GPT‑6 Astra fl-API u tagħti sa darbtejn il-veloċità tal-ipproċessar Standard bid-doppju tal-prezz Standard.

Użu tal-Kompjuter

Użu tal-KompjuterGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (rilaxx ta’ Awwissu, punteġġ parzjali)---66.1%70.6%-
OSWorld 2.0 (rilaxx ta’ Awwissu, subsett offline, punteġġ parzjali)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Xjenza u Saħħa

Xjenza u SaħħaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.8%28.7%
MedChemBench (Intern)49.3%47.4%
LifeSciBench60.3%59.9%
HealthBench Professional (aġġustat għat-tul)63.4%60.5%58.1%60.9%56.4%52.1%

Ċibersigurtà

ĊibersigurtàGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%70%
Exploit Gym42.4% 630.3% 630.4% 1728.4%1722.0%17
ExploitBench (Ġunju–Awwissu 2026)39.0%11.5%
SRE-Bench88.0%55.9%12.5%
SEC-Bench Pro85.4%79.1%

Allinjament

Allinjament

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Benchmark intern tas-sikurezza tal-użu tal-kompjuter (inqas aħjar)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Benchmark intern tas-sikurezza tal-użu tal-kompjuter, b’AutoReview (inqas aħjar)

1.8%

4.3%

-

-

-

-

Benchmark intern tal-evitar (inqas aħjar)

0.00%

0.29%

-

-

-

-

ExploitGym honeypot (inqas aħjar)

0.0%

48.2%

-

-

-

-

ExploitGym Impossibbli

100.0%

-

-

-

-

-

Benchmark intern tal-alluċinazzjonijiet (inqas aħjar)

4.2%

12.2%

-

-

-

-

Long Context

Long Context

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

Raġunament astratt

Raġunament astrattGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 77.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Evaluation scores are the maximum at any effort. GPT evaluations were run in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, etc.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(jinfetaħ f’tieqa ġdida). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(jinfetaħ f’tieqa ġdida).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(jinfetaħ f’tieqa ġdida).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(jinfetaħ f’tieqa ġdida).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(jinfetaħ f’tieqa ġdida): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(jinfetaħ f’tieqa ġdida) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(jinfetaħ f’tieqa ġdida) and supporting research(jinfetaħ f’tieqa ġdida).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(jinfetaħ f’tieqa ġdida) and supporting research(jinfetaħ f’tieqa ġdida).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.