OpenAI

GPT-6 Astra: A new generation of intelligence

Ġenerazzjoni ġdida ta’ intelliġenza

Aġġornament tat-22 ta’ Settembru 2026: Qed inwessgħu l-familja GPT‑6 tagħna b’GPT‑6 Sol u GPT‑6 Luna. Sir af aktar.

Qed inniedu GPT‑6 Astra, l-aktar mudell intelliġenti u allinjat fid-dinja.

GPT‑6 Astra jiġbor flimkien snin ta’ riċerka u inizjattivi ambizzjużi fit-taħriġ minn qabel, l-apprendiment ta' tisħiħ u l-allinjament. Astra jinsab fuq quddiem nett fl-użu tal-kompjuter, l-ibbrawżjar, l-inġinerija tas-software, iċ-ċibersigurtà, ix-xjenza u l-kompiti professjonali. Astra jilħaq il-livell massimu ta’ FrontierMath Tier 4 b’punteġġ ta’ 98%, wara li diġà għen jissolvew problemi miftuħa fil-matematika li ilhom pendenti⁠. Astra jilħaq ukoll il-limitu ta’ ARC-AGI-3 b’punteġġ ta’ 99.9% u ta’ ExploitBench b’punteġġ ta’ 100%. Jistabbilixxi wkoll standard ġdid fl-użu tal-kompjuter u tal-brawżer, u jwettaq l-aktar kompiti professjonali impenjattivi b’veloċità, preċiżjoni u ġudizzju bla paragun. 

GPT‑6 Astra qed jibda jitnieda llum għal għadd limitat ta’ organizzazzjonijiet u, fil-jiem li ġejjin, se jkun disponibbli għall-utenti kollha ta’ ChatGPT Plus, Pro, Business u Enterprise, kif ukoll permezz tal-API ta’ OpenAI, Microsoft Azure u AWS Bedrock.

“On ARC-AGI-3, Astra surpassed our human action-efficiency baseline on 96% of levels, effectively reaching human parity on the benchmark. Not only is this the best model we’ve ever tested, but it also represents a meaningful step change in frontier-model performance - not only in its ability to navigate and solve novel environments, but also in how efficiently it learns to do so.”
Greg Kamradt, ARC Prize Foundation

Astra is our most aligned model, with substantial improvements in understanding user intent and model behavior—you can delegate tasks with greater confidence in Astra’s judgment. As one way that we test this, we built a new evaluation informed by the Hugging Face incident that evaluates whether a model facing a difficult or impossible task will go beyond its intended scope. Compared to GPT‑5.6 Sol, which without production safeguards went beyond the authorized target 48% of the time, GPT‑6 Astra did this in 0% of cases.

L-aqwa mudell fid-dinja għall-użu tal-kompjuter

GPT‑6 Astra jistabbilixxi fruntiera ġdida fil-veloċità, il-preċiżjoni u s-sikurezza tal-użu tal-kompjuter. Jista’ jieħu ħsieb kompiti tedjanti bħall-mili ta’ formoli online, l-aġġornament tar-rekords tal-klijenti f’CRM u l-organizzazzjoni tal-kalendarju tiegħek. Jista’ jagħmel riċerka online u jabbozza sommarji fl-email jew fl-editur tad-dokumenti tiegħek. Jista’ janalizza data xjentifika, jiġġenera graffs, joħloq sit web u jwettaq kontrolli tal-QA tal-frontend biex jiżgura li l-funzjonijiet kollha tas-sit jaħdmu. Jista’ jgħinek jinstalla u jittestja software b’mod awtonomu, u jsolvi problemi li tara fuq l-iskrin. Dan it-titjib jidher ukoll fir-riżultati tal-evalwazzjonijiet avvanzati tagħna.

These improvements also result in significant efficiency gains in real knowledge-work tasks. In latency simulations on OSWorld 2.0, Astra achieves higher computer-use performance in about 47% less time per task than GPT‑5.6 Sol, scoring 72.6% at roughly 40 minutes per task, compared with 65.7% at roughly 75 minutes.3

Il-kapaċitajiet ta’ GPT‑6 Astra fl-użu tal-kompjuter jidhru f’outputs f’diversi oqsma, fosthom l-iżvilupp tal-logħob, l-inġinerija elettrika u x-xogħol tal-għarfien ta’ kuljum:

Flimkien ma’ Astra, qed naġġornaw ukoll il-harness ta’ Codex biex intejbu b’mod sinifikanti l-veloċità tal-użu tal-kompjuter. Flimkien mal-effiċjenza ta’ Astra, dan ifisser tlestija tal-kompiti 1.9x aktar mgħaġġla mill-esperjenza attwali ta’ GPT‑5.6 Sol fuq il-benchmark Mind2Web. It-titjib fil-veloċità tal-mudell ifisser li jista’ jwettaq għalik ħafna kompiti tal-ħajja li jieħdu l-ħin, aktar malajr minnek.4

“We’re integrating GPT‑6 Astra into Devin’s harness on launch day, where it delivers state-of-the-art performance on our internal testing benchmark. Its excellent computer use, writing, and codebase understanding improved testing right out of the box: videos are noticeably easier to follow, and reports are clearer and more concise”
Silas Alberti, SVP Research, Cognition

A step change in professional work

GPT‑6 Astra jgħaqqad l-avvanzi fl-użu tal-kompjuter ma’ taħriġ immirat għal ambjenti professjonali, biex jgħin f’kompiti kumplessi tax-xogħol. Jgħaqqad l-intelliġenza meħtieġa għal problemi kumplessi mal-abbiltà li jwettaq flussi tax-xogħol f’diversi passi u jipproduċi dokumenti, spreadsheets u preżentazzjonijiet irfinuti.

GPT‑6 Astra is our best model for adhering to existing templates and producing slides that are well laid out and succinctly convey key points with a structured narrative. It creates clear, well-structured documents, presentations, spreadsheets, and analyses that follow your templates and match your writing and visual style. Astra is also trained to specifically pull only the context that matters into outputs, instead of repeating information unnecessary for the work at hand. All this means it can output more immediately usable artifacts that match your business context and standards.

GPT‑6 Astra jagħti wkoll ġudizzju viżiv aktar b’saħħtu lis-siti web, il-logħob, l-applikazzjonijiet u r-renderings li jibni. Bis-Siti⁠(jinfetaħ f’tieqa ġdida) f’ChatGPT, Astra jista’ joħloq, jospita u jaqsam siti web, apps web u logħob direttament minn prompt.

“Astra jagħtina vantaġġ sinifikanti kemm fil-kapaċità kif ukoll fl-effiċjenza. Iwettaq b’suċċess l-aktar flussi tax-xogħol kreattivi kumplessi tagħna filwaqt li juża sa 20% inqas tokens minn mudelli oħra li ttestjajna. L-aktar importanti għall-klijenti tagħna, dan ifisser output ta’ kwalità ogħla.”
Alex Mashrabov, CEO u Kofundatur, Higgsfield AI

Meta l-istruzzjonijiet iħallu lok għall-interpretazzjoni, GPT‑6 Astra jagħmel għażliet tajbin aħjar mill-mudelli preċedenti. Juża l-kuntest biex jimla n-nuqqasijiet tas-soltu u jistaqsi mistoqsijiet iffukati meta t-tweġiba tista’ tbiddel ir-riżultat. F’Codex, jista’ jistaqsi b’mod asinkronu waqt li jkompli xogħol li ma jiddependix mit-tweġiba tiegħek. Jekk ma tweġibx, jipproċedi b’assunzjonijiet raġonevoli fejn xieraq, iżda jistenna l-kontribut tiegħek għal deċiżjonijiet importanti.

L-eżempji hawn taħt juru kif Astra jikkollabora f’kompiti ta’ kuljum fejn informazzjoni nieqsa tista’ tbiddel sostanzjalment it-tweġiba.

Astra huwa wkoll aħjar biex iżomm id-direzzjoni hekk kif il-kompitu jevolvi. Mudelli preċedenti kultant ittrattaw messaġġi ta’ direzzjoni bħala għan ġdid, u tilfu t-talba oriġinali jew ir-restrizzjonijiet preċedenti. Astra jinkorpora rekwiżiti ġodda, ibiddel id-direzzjoni meta jintalab u jwieġeb mistoqsijiet sekondarji mingħajr ma jitlef il-kompitu usa’.

“Astra huwa titjib sinifikanti fil-kwalità fuq GPT‑5.6 Sol f’kompiti legali kumplessi. Fl-ittestjar bikri tagħna, Astra spikka għax javviċina x-xogħol legali bħal avukat għaqli: jiddistingwi d-dokumenti minn rekords stabbiliti, jikxef assunzjonijiet mhux sostnuti u jbiddel in-nuqqasijiet f’pożizzjonijiet konkreti għall-abbozzar.”
Niko Grupen, Kap tar-Riċerka Applikata, Harvey

Coding

GPT‑6 Astra is the best model for software engineering to date.

1 minn 2
“GPT‑6 Astra jagħti prestazzjoni avvanzata fuq il-benchmarks interni tagħna tal-ikkowdjar u juri pass ċar ’il quddiem fl-evalwazzjonijiet tal-intuwizzjoni tal-kummerċ meta mqabbel ma’ GPT‑5.6 Sol. Meta jintuża għall-ikkowdjar b’karatteristiċi aġenti, GPT‑6 Astra jikkomunika b’mod aktar faċli biex l-iżviluppaturi jsegwuh u jipproduċi kodiċi li jeħtieġ inqas iterazzjonijiet biex jilħaq kwalità tal-produzzjoni.”
John Crepezzi, Assistenti tal-IA, Jane Street

B’Astra, qed nintroduċu mod ġdid kif Codex jippreserva u jirkupra l-kuntest meta timtela t-tieqa tal-kuntest. Storikament, il-mudelli użaw il-kompattazzjoni biex jiġbru fil-qosor ix-xogħol matul sessjonijiet twal, bħal meta jiddibaggjaw problemi kumplessi jew iwettqu refactors kbar. Kull kompattazzjoni tista’ tħalli barra dettalji dwar għaliex soluzzjoni falliet jew kif iġib ruħu komponent. F’Codex, Astra jista’ jżomm noti bejn twieqi tal-kuntest, u jippreserva d-dettalji akkumulati mingħajr ma jikkompressahom ripetutament f’sommarju wieħed. It-twieqi tal-kuntest preċedenti jibqgħu jistgħu jitfittxu, għalhekk Astra jista’ jsib rekwiżiti jew riżultati tat-testijiet minn messaġġi u outputs tal-għodod preċedenti—anke jekk dik l-informazzjoni ma nżammitx fin-noti tiegħu. Tista’ tattiva din il-karatteristika sperimentali fil-Codex config.toml tiegħek,⁠(jinfetaħ f’tieqa ġdida) u fil-ġimgħat li ġejjin issir l-għażla awtomatika għal Astra.

Inħaffu l-iskoperta xjentifika

“L-istorja hi: tmiem ta’ era u bidu ta’ oħra.”
Greg Burnham, EpochAI

GPT‑6 Astra huwa avvanz kbir għall-iskoperta xjentifika, il-matematika u s-saħħa. Illum qed naqsmu żewġ riżultati oħra dwar id-distakki bejn in-numri primi.9 u 10

Astra jistabbilixxi wkoll rekords ġodda f’sensiela ta’ evalwazzjonijiet tal-matematika u x-xjenza.

Astra jista’ jgħin fix-xogħol prattiku wara l-iskoperta xjentifika. Billi jgħaqqad ir-raġunament xjentifiku mal-użu tal-kompjuter, jista’ jaħdem direttament f’software speċjalizzat biex jispezzjona d-data u jesplora r-riżultati, u jgħin lir-riċerkaturi jivvalutaw l-evidenza u jiddeċiedu x’għandhom jinvestigaw wara.

Cybersecurity

Kif iddiskutejna fl-aġġornament dwar is-sikurezza⁠ tagħna, Astra jirrappreżenta qabża sinifikanti fil-kapaċitajiet ċibernetiċi u jilħaq il-livell Kritiku fiċ-ċibersigurtà skont il-Qafas tat-Tħejjija tagħna. Il-kapaċità tiegħu li jidentifika u jiżviluppa exploits zero-day tista’ tgħin lid-difensuri jsibu u jsewwu d-dgħufijiet, iżda toħloq ukoll il-ħtieġa għal salvagwardji aktar b’saħħithom. Biex nifhmu kemm jaslu dawn il-kapaċitajiet, ittestjajna lil Astra f’evalwazzjonijiet interni u ta’ esperti terzi.

L-ewwel ittestjajna l-mudell mingħajr salvagwardji tal-produzzjoni fuq ExploitBench u ExploitGym, li jevalwaw jekk il-mudelli jistgħux ibiddlu vulnerabbiltajiet magħrufa tas-software f’exploits li jaħdmu. Fuq ExploitBench, Astra kiseb punteġġ perfett ta’ 100%, meta mqabbel ma’ 78.5% għal GPT‑5.6 Sol, il-mudell preċedenti tagħna b’kapaċitajiet ċibernetiċi avvanzati. Fuq ExploitGym, Astra laħaq rata ta’ suċċess ta’ 42.4%, meta mqabbel ma’ 30.3% għal GPT‑5.6 Sol, filwaqt li uża ferm inqas tokens tal-output.13

Minħabba tħassib li l-esponiment għal vulnerabbiltajiet storiċi tas-software seta’ affettwa r-riżultati tal-benchmarks, evalwajna wkoll lil Astra fuq żewġ benchmarks ġodda. Għal wieħed minnhom, bnejna evalwazzjoni interna “ExploitBench (Ġunju–Awwissu 2026)” biex nittestjaw l-iżvilupp ta’ exploits bl-użu ta’ vulnerabbiltajiet mit-tliet xhur preċedenti.14 Astra kiseb rati ferm ogħla ta’ eżekuzzjoni arbitrarja tal-kodiċi minn GPT‑5.6 Sol fuq dan is-sett tad-data, filwaqt li uża ħafna inqas tokens tal-output. Matul l-evalwazzjoni, Astra saħansitra skopra u uża żewġ vulnerabbiltajiet zero-day li qabel ma kinux magħrufa. Qed niżvelaw iż-żewġ vulnerabbiltajiet lill-mantenituri tagħhom.

Ittestjajna wkoll lil Astra fuq SRE-Bench15, benchmark li jkejjel jekk il-mudelli jistgħux jagħmlu reverse engineering ta’ binaries tas-software biex jifhmu l-loġika ewlenija tagħhom mingħajr aċċess għall-kodiċi sors mhux ipproċessat. Astra solva 88.0% tal-kompiti f’tentattiv wieħed u 99.2% f’erba’ tentattivi, meta mqabbel ma’ 55.9% u 68.7% għal GPT‑5.6 Sol, rispettivament.

Lil hinn mill-benchmarks, valutazzjonijiet immexxija minn esperti sabu li Astra, meta jitħaddem mingħajr salvagwardji tal-produzzjoni, seta’ juża vulnerabbiltajiet mhux magħrufa biex jikseb eżekuzzjoni arbitrarja tal-kodiċi fi browsers imsaħħa u joħloq exploits ta’ eskalazzjoni tal-privileġġi għal sistemi operattivi msaħħa.

Kif iddiskutejna f’It-Tieqa tad-Difensur, il-kapaċitajiet ċibernetiċi avvanzati jistgħu jgħinu lid-difensuri jsibu d-dgħufijiet aktar malajr, iżda jagħmluhom ukoll aktar faċli biex jiġu sfruttati, u għalhekk id-difensuri jridu jadattaw b’urġenza. Bil-verżjoni ta’ Astra li qed titnieda llum, id-difensuri jistgħu jużawh għal kompiti bħal rieżami sigur tal-kodiċi u patching.

Madankollu, Astra jirrifjuta kompiti aktar avvanzati taċ-ċibersigurtà, bħall-ħolqien ta’ exploits proof-of-concept għal vulnerabbiltajiet. Permezz ta’ OpenAI Daybreak⁠, qed nippjanaw li nwessgħu l-aċċess u nniedu salvagwardji inqas restrittivi fil-ġimgħat li ġejjin. Dan se jippermetti aktar flussi tax-xogħol difensivi, inklużi l-validazzjoni ta’ vulnerabbiltajiet u proof-of-concept, l-analiżi tal-malware u l-inġinerija tad-detezzjoni.

Saħħaħna wkoll il-protezzjonijiet tagħna kontra użu ħażin ċibernetiku potenzjali, billi bnejna fuq il-ġabra ta’ salvagwardji tagħna għal GPT‑5.6 Sol. Dawn jinkludu robustezza akbar tal-mudell biex jirreżisti aħjar jailbreaks potenzjali u aktar kuntest għas-sistemi ta’ monitoraġġ tagħna. Komplejna b’ittestjar intern u estern rigoruż, inklużi evalwazzjonijiet awtomatizzati bl-attakkanti interni tagħna tar-red teaming. Aktar dettalji dwar is-salvagwardji u l-ittestjar ċibernetiċi tagħna jinsabu fil-ħarsa ġenerali lejn is-sikurezza⁠ u l-kard tas-sistema⁠(jinfetaħ f’tieqa ġdida) ta’ Astra.

Nallinjaw u nniedu GPT‑6 Astra b’mod responsabbli

Astra is our most aligned model. Astra excels at exercising care, respecting task boundaries, and communicating transparently. This work is the latest product of our long-running research program focused on training models that remain aligned with human intent from start to finish.

In sensitive environments, Astra proceeds with care commensurate with its risk. In an evaluation of computer use tasks adversarially selected to elicit misbehavior, Astra was more successful at avoiding unintended consequences. Running with additional security measures offered by default yielded even stronger performance.

Astra jikkawża inqas riżultati mhux allinjati minn kwalunkwe mudell avvanzat ieħor ittestjat. Għal tqabbil ġust, użajna harness ġeneriku ta’ aġent li juża l-kompjuter (ibbażat fuq l-għodod nattivi tal-użu tal-kompjuter disponibbli kemm fl-API Responses ta’ OpenAI⁠(jinfetaħ f’tieqa ġdida) kif ukoll fl-API Messages ta’ Anthropic⁠(jinfetaħ f’tieqa ġdida)) u mingħajr protezzjonijiet addizzjonali li normalment jingħataw lill-utenti ta’ Codex u ChatGPT Work (rieżami awtomatiku, politika ta’ konferma).

Astra is also more likely to operate within the boundaries set by the user and implied by its environment. In an internal evaluation, Astra never attempted to circumvent a Codex Auto-Review denial. This held even when Auto-review was deliberately configured to be evadable and the task was impossible to complete otherwise. This respect for the environment restrictions is consistent with the results of our impossible cyber task evaluation that we shared in the intro of this post and other findings documented in our system card⁠(jinfetaħ f’tieqa ġdida).

Astra jistabbilixxi wkoll livelli ġodda fil-komunikazzjoni trasparenti mal-utent. F’evalwazzjoni waħda, Astra huwa tliet darbiet inqas probabbli minn GPT‑5.6 Sol li jagħmel stqarrijiet mhux preċiżi dwar il-kapaċitajiet u l-possibbiltajiet tiegħu.

Fl-evalwazzjoni tagħna tal-alluċinazzjonijiet dwar il-kapaċitajiet, Astra juri titjib sostanzjali fuq GPT‑5.6 Sol, b’inqas stqarrijiet qarrieqa dwar il-kapaċitajiet tiegħu.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card⁠(jinfetaħ f’tieqa ġdida) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review⁠(jinfetaħ f’tieqa ġdida) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update⁠, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Availability

GPT‑6 Astra qed jitnieda llum għal għadd limitat ta’ organizzazzjonijiet u fil-jiem li ġejjin se jsir disponibbli għall-utenti kollha ta’ ChatGPT Plus, Pro, Business u Enterprise, kif ukoll permezz tal-API ta’ OpenAI, Microsoft Azure u AWS Bedrock. L-użu ta’ Astra huwa inkluż fil-kwoti tal-abbonament eżistenti—l-utenti u n-negozji se jkunu jistgħu wkoll jixtru krediti għal użu addizzjonali. L-utenti tal-pjanijiet Pro, Business u Enterprise se jkollhom ukoll aċċess għal GPT‑6 Astra Pro. L-amministraturi Enterprise jistgħu jattivaw Astra għall-workspace tagħhom; mal-varar, l-aċċess ikun diżattivat b’mod awtomatiku.

Astra jappoġġja l-ebda żamma tad-dejta għal klijenti eliġibbli tal-API u, kif ħabbarna x-xahar li għadda, qed nittestjaw Ipproċessar Privat tas-Sikurezza biex insaħħu l-monitoraġġ tas-sikurezza filwaqt li nħarsu l-privatezza tal-klijenti.

Għall-iżviluppaturi, GPT‑6 Astra se jkun disponibbli fl-API ta’ OpenAI bħala gpt-6-astra u permezz ta’ Microsoft Azure u Amazon Bedrock.

Il-prezz Standard tal-API ta’ OpenAI huwa $10 għal kull miljun token tal-input u $50 għal kull miljun token tal-output. Japplikaw tariffi separati għall-qari u l-kitba fil-cache. Il-Modalità veloċi hija disponibbli għal GPT‑6 Astra fl-API u tagħti sa darbtejn il-veloċità tal-ipproċessar Standard bid-doppju tal-prezz Standard.

Użu tal-Kompjuter

Użu tal-KompjuterGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.7 Flash
OSWorld 2.0 (rilaxx ta’ Awwissu, punteġġ parzjali)---66.1%70.6%-
OSWorld 2.0 (rilaxx ta’ Awwissu, subsett offline, punteġġ parzjali)------
ScreenSpot Pro92.6%76.8%----
BrowseComp92.1%90.4%-87.4%90.8%-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Xjenza u Saħħa

Xjenza u SaħħaGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Intern)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (aġġustat għat-tul)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Ċibersigurtà

ĊibersigurtàGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (Ġun-Aww 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Allinjament

Allinjament

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Benchmark intern tas-sikurezza fl-użu tal-kompjuter (inqas aħjar)

2.4%

22.0%

9.5%

18.3%

11.5%

-

Benchmark intern tas-sikurezza fl-użu tal-kompjuter, b’AutoReview (inqas aħjar)

1.8%

4.3%

-

-

-

-

Benchmark intern tal-evażjoni (inqas aħjar)

0.00%

0.29%

-

-

-

-

Honeypot ta’ ExploitGym (inqas aħjar)

0.0%

48.2%

-

-

-

-

ExploitGym Impossibbli

100.0%

-

-

-

-

-

Benchmark intern tal-alluċinazzjonijiet (inqas aħjar)

4.2%

12.2%

-

-

-

-

Long Context

Long Context

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100.0%

91.5%

-

-

-

-

OpenAI MRCR v2 8-needle 512K-1M

96.3%

73.8%

-

-

-

-

Raġunament astratt

Raġunament astrattGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Evaluation scores are the maximum at any effort. GPT evaluations were run in our research environment or via our API, which may provide slightly different output from production ChatGPT due to differences in the system prompts, tools available, etc.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness⁠, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.⁠

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard⁠(jinfetaħ f’tieqa ġdida). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card⁠(jinfetaħ f’tieqa ġdida).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(jinfetaħ f’tieqa ġdida).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus⁠(jinfetaħ f’tieqa ġdida).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex⁠(jinfetaħ f’tieqa ġdida): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann⁠(jinfetaħ f’tieqa ġdida) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof⁠(jinfetaħ f’tieqa ġdida) and supporting research⁠(jinfetaħ f’tieqa ġdida).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof⁠(jinfetaħ f’tieqa ġdida) and supporting research⁠(jinfetaħ f’tieqa ġdida).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.