OpenAI

GPT-6 Astra: A new generation of intelligence

En ny generation av intelligens

Vi introducerar GPT‑6 Astra, världens mest intelligenta och välanpassade modell.

GPT‑6 Astra samlar flera års forskning och stora satsningar inom förträning, förstärkningsinlärning och anpassning. Astra är toppmodern inom datoranvändning, webbsurfning, programvaruteknik, cybersäkerhet, vetenskap och professionellt arbete. Astra når taket för FrontierMath Tier 4 med ett resultat på 98 %, och har redan hjälpt till att lösa långvariga öppna problem inom matematiken. Astra uppnår också taket på ARC-AGI-3 med ett resultat på 99,9 % och på ExploitBench med ett resultat på 100 %. Den är också banbrytande inom användning av datorer och webbläsare och hanterar det mest krävande professionella arbetet med oöverträffad snabbhet, noggrannhet och omdöme. 

GPT‑6 Astra lanseras idag till ett begränsat antal organisationer och blir under de kommande dagarna tillgänglig för alla användare av ChatGPT Plus, Pro, Business och Enterprise, samt via OpenAI API, Microsoft Azure och AWS Bedrock.

”På ARC-AGI-3 överträffade Astra vår mänskliga referensnivå för handlingseffektivitet på 96 % av nivåerna och nådde därmed i praktiken mänsklig paritet i benchmarktestet. Detta är inte bara den bästa modellen vi någonsin har testat, utan den innebär också ett betydande steg framåt för de banbrytande modellernas prestanda – inte bara i förmågan att navigera och lösa nya miljöer, utan också i hur effektivt den lär sig att göra det.”
Greg Kamradt, ARC Prize Foundation

Astra är vår modell som är mest i linje med våra avsikter, med betydande förbättringar i förståelsen av användaravsikter och modellbeteende – du kan överlåta uppgifter med större tilltro till Astras omdöme. Som ett sätt att testa detta byggde vi en ny utvärdering, med lärdomar från incidenten med Hugging Face, som bedömer om en modell som ställs inför en svår eller omöjlig uppgift går utöver sitt avsedda område. Jämfört med GPT‑5.6 Sol, som utan skyddsåtgärder i produktion gick utöver det auktoriserade målet i 48 % av fallen, gjorde GPT‑6 Astra detta i 0 % av fallen.

Världens bästa modell för datoranvändning

GPT‑6 Astra öppnar nya dörrar för snabbhet, noggrannhet och säkerhet vid datoranvändning. Den kan ta hand om tidsödande uppgifter som att fylla i onlineformulär, uppdatera kundposter i ett CRM-system och organisera din kalender. Den kan göra research online och skriva utkast till sammanfattningar i din e-post eller i din dokumentredigerare. Den kan analysera vetenskapliga data, generera diagram, skapa en webbplats och köra QA-kontroller för frontend för att säkerställa att alla funktioner på webbplatsen fungerar. Det kan hjälpa dig att på egen hand installera och testa programvara samt felsöka problem som du ser på skärmen. Dessa förbättringar återspeglas också i våra toppmoderna utvärderingsresultat.

Dessa förbättringar leder också till betydande effektivitetsvinster i verkliga kunskapsarbetsuppgifter. I svarstidssimuleringar på OSWorld 2.0 uppnår Astra högre datoranvändningsprestanda på omkring 47 % kortare tid per uppgift än GPT‑5.6 Sol, med ett resultat på 72,6 % vid cirka 40 minuter per uppgift, jämfört med 65,7 % vid cirka 75 minuter.3

GPT‑6 Astras förmåga att använda datorer syns i resultaten inom olika områden, däribland spelutveckling, elektroteknik och vardagligt kunskapsarbete:

Tillsammans med Astra uppdaterar vi även Codex-körmiljön för att avsevärt förbättra hastigheten vid datoranvändning. I kombination med Astras effektivitet innebär detta att uppgifter slutförs 1,9 gånger snabbare jämfört med den nuvarande upplevelsen av GPT‑5.6 Sol i Mind2Web-benchmarktestet. Modellens hastighetsförbättringar innebär att den kan ta sig an många tidskrävande vardagsuppgifter åt dig, snabbare än du själv kan.

“Vi integrerar GPT‑6 Astra i Devins körmiljö på lanseringsdagen, där den levererar topprestanda på vårt interna testbenchmark. Dess utmärkta datoranvändning, skrivförmåga och förståelse för kodbasen förbättrade testningen direkt från start: videor är märkbart enklare att följa, och rapporterna är tydligare och mer koncisa”
Silas Alberti, SVP Research, Cognition

Ett stort kliv framåt för professionellt arbete

GPT‑6 Astra kombinerar framsteg inom datoranvändning med riktad träning för professionella miljöer för att hjälpa till att hantera komplexa arbetsuppgifter. Den kombinerar den intelligens som krävs för komplexa problem med förmågan att genomföra arbetsflöden i flera steg och skapa välpolerade dokument, kalkylblad och presentationer.

GPT‑6 Astra är vår bästa modell för att följa befintliga mallar och skapa väl disponerade bilder som kortfattat förmedlar huvudpunkter genom en strukturerad berättelse. Det skapar tydliga, välstrukturerade dokument, presentationer, kalkylblad och analyser som följer dina mallar och matchar ditt skrivsätt och din visuella stil. Astra har också tränats i att bara ta med den kontext som är relevant i sina utdata, i stället för att upprepa information som är onödig för den aktuella uppgiften. Allt detta innebär att den kan generera mer direkt användbara artefakter som överensstämmer med din verksamhetskontext och dina standarder.

GPT‑6 Astra har också ett starkare visuellt omdöme när den skapar webbplatser, spel, applikationer och renderingar. Med Sites(öppnas i ett nytt fönster) i ChatGPT kan Astra skapa, publicera och dela webbplatser, webbappar och spel direkt från en prompt.

“Astra ger oss en betydande fördel i fråga om både kapacitet och effektivitet. Den utför framgångsrikt våra mest komplexa kreativa arbetsflöden samtidigt som den använder upp till 20 % färre token än andra modeller som vi har testat. Viktigast av allt är att det för våra kunder innebär resultat av högre kvalitet.”
Alex Mashrabov, vd och medgrundare, Higgsfield AI

När instruktioner lämnar utrymme för tolkning är GPT‑6 Astra bättre än tidigare modeller på att fatta rätt beslut. Den använder sammanhang för att fylla i vanliga luckor och ställer riktade frågor när svaret kan förändra resultatet. I Codex kan den ställa frågor asynkront samtidigt som den fortsätter att arbeta med sådant som inte är beroende av ditt svar. Om du inte svarar fortsätter den med rimliga antaganden när det är lämpligt, men väntar på dina synpunkter vid beslut med större konsekvenser.

Exemplen nedan visar hur Astra samarbetar kring vardagliga uppgifter där avsaknad av information kan förändra svaret avsevärt.

Astra är också bättre på att hålla sig orienterad allt eftersom en uppgift utvecklas. Tidigare modeller behandlade ibland styrmeddelanden som ett nytt mål och tappade bort den ursprungliga begäran eller tidigare begränsningar. Astra kan ta hänsyn till nya krav, ändra kurs på begäran och besvara sidofrågor utan att tappa bort den övergripande uppgiften.

“Astra innebär en betydande kvalitetsförbättring jämfört med GPT‑5.6 Sol vid komplexa juridiska uppgifter. I våra tidiga tester utmärkte sig Astra genom att ta sig an juridiskt arbete på samma sätt som en omdömesgill jurist: den skiljer dokument från fastställda handlingar, lyfter fram antaganden som saknar stöd och omvandlar luckor till konkreta ståndpunkter för utformningen.
Niko Grupen, Chef för tillämpad forskning, Harvey

Kodning

GPT‑6 Astra är den bästa modellen för programvaruutveckling hittills.

1 av 2
“GPT‑6 Astra levererar topprestanda på våra interna benchmarks för kodning och visar ett tydligt steg framåt i utvärderingar av handelsintuition jämfört med GPT‑5.6 Sol. När GPT‑6 Astra används för agentbaserad kodning kommunicerar den på ett sätt som är lättare för utvecklare att följa och producerar kod som kräver färre iterationer för att nå produktionskvalitet.”
John Crepezzi, AI-assistenter, Jane Street

Med Astra introducerar vi ett nytt sätt för Codex att bevara och hämta kontext när kontextfönstret blir fullt. Historiskt har modeller använt komprimering för att sammanfatta arbete under långa sessioner, till exempel vid felsökning av komplexa problem eller vid arbete med stora refaktoreringar. Varje komprimering kan utelämna detaljer om varför en korrigering misslyckades eller hur en komponent fungerar. I Codex kan Astra behålla anteckningar mellan kontextfönster och bevara ackumulerade detaljer utan att upprepade gånger komprimera dem till en enda sammanfattning.Tidigare kontextfönster förblir sökbara, så Astra kan hitta krav eller testresultat från tidigare meddelanden och verktygsutdata – även om informationen inte har fångats i dess anteckningar. Du kan aktivera den här experimentella funktionen i din Codex config.toml, och(öppnas i ett nytt fönster) det kommer att bli standard för Astra under de kommande veckorna.

Främjar vetenskapliga upptäckter

”Berättelsen är: slutet på en era, början på en annan.”
Greg Burnham, EpochAI

GPT‑6 Astra är ett stort framsteg för vetenskapliga upptäckter, matematik och hälsa. I dag delar vi med oss av ytterligare två resultat om avstånd mellan primtal [WITH LINK]. Astra sätter även nya rekord i en rad vetenskapliga utvärderingar:

Astra kan hjälpa till med det praktiska arbetet bakom vetenskapliga upptäckter. Genom att kombinera vetenskapligt resonemang med datoranvändning kan den arbeta direkt i specialiserad programvara för att granska data och utforska resultat, vilket hjälper forskare att bedöma evidensen och avgöra vad de ska undersöka härnäst.

Cybersäkerhet

Astra är ett stort steg framåt för cybersäkerheten. Dess förmåga att identifiera och utveckla dagnollsexploateringar kan hjälpa försvarare att åtgärda svagheter, men den skapar också ett behov av starkare skyddsåtgärder. För att förstå hur långt dessa förmågor sträcker sig använde vi interna expertutvärderingar och expertutvärderingar från tredje part.

Vi testade först Astra på ExploitBench och ExploitGym, som mäter om modeller kan uppnå godtycklig kodexekvering i sårbara kodbaser.

Med tanke på möjliga farhågor om att exponering för historiska sårbarheter i programvara kan ha påverkat benchmarkresultaten utvärderade vi även Astra på två nya benchmarktester. Bland annat byggde vi en intern utvärdering, "ExploitBench (juni–augusti 2026)", för att testa utveckling av exploits med hjälp av sårbarheter från de föregående tre månaderna. 2 Astra uppnådde avsevärt högre frekvenser för godtycklig kodkörning än GPT‑5.6 Sol i detta dataset, samtidigt som den använde långt färre utdatatoken. Under utvärderingen upptäckte och använde Astra två tidigare okända tekniker för att kringgå heapsandlådan i Chrome V8. Vi rapporterar båda sårbarheterna till deras underhållare.

Vi testade också Astra på SRE-Bench, ett benchmarktest som mäter om modeller kan bakåtkompilera binär programvara för att förstå dess kärnlogik. Författarna bakom benchmarktestet byggde programvaran från grunden och höll källkoden privat. Astra löste 88,0 % av uppgifterna vid ett enda försök och 99,2 % inom fyra försök, jämfört med 55,9 % respektive 68,7 % för GPT‑5.6 Sol.

Utöver benchmarktester visade expertledda bedömningar att Astra kunde använda tidigare okända sårbarheter för att åstadkomma exekvering av godtycklig kod i härdade webbläsare och skapa exploiter för privilegieeskalering i härdade operativsystem. Sammantaget låg dessa resultat till grund för vårt beslut att Astra har nått den kritiska tröskeln inom cybersäkerhet enligt vårt Preparedness Framework.

Som vi diskuterade i Försvararnas tidsfönster kan banbrytande cyberfunktioner hjälpa försvarare att hitta svagheter snabbare, men de gör också dessa svagheter lättare att utnyttja, vilket gör det mer angeläget för försvarare att anpassa sig.

För den version av Astra som lanseras idag stöder vi viktiga defensiva uppgifter såsom säker kodgranskning, patchning och hotmodellering. Men som standard kommer Astra att vägra att utföra avancerade cybersäkerhetsuppgifter som upptäckt av sårbarheter som kan utnyttjas. Genom OpenAI Daybreak rullar vi ut mindre begränsad åtkomst för en alfagrupp av betrodda cybersäkerhetsförsvarare i OpenAI Daybreak-programmet. Detta utökar åtkomsten till defensiva arbetsflöden, inklusive triagering av sårbarheter och validering, analys av skadlig kod, detekteringsutveckling och validering av patchar. Vi planerar att utöka åtkomsten ytterligare via Daybreak Blue.

Vi har också stärkt våra skyddsåtgärder mot potentiellt cybermissbruk genom att bygga vidare på vår säkerhetsstack för GPT‑5.6 Sol. Dessa omfattar bättre träning för mer robusta modeller för att bättre stå emot potentiella jailbreaks samt mer kontext för våra övervakningssystem. Vi har fortsatt med rigorösa interna och externa tester, inklusive automatiserade tester med våra interna red teaming-angripare. Mer information om våra cyberskyddsåtgärder och tester finns i Astra-systemkortet och på vår blogg.

Anpassa och implementera GPT‑6 Astra på ett ansvarsfullt sätt

Astra är vår mest välanpassade modell. Astra är mycket bra på att agera omsorgsfullt, respektera uppgiftens ramar och kommunicera transparent. Detta arbete är det senaste resultatet av vårt långvariga forskningsprogram som fokuserar på att träna modeller som förblir i linje med människors avsikter från början till slut.

I känsliga miljöer går Astra varsamt fram, med en försiktighet som står i proportion till den risk som föreligger. I en utvärdering av uppgifter som rör datoranvändning och som valts ut för att vara motståndarinriktade för att provocera fram oönskat beteende lyckades Astra bättre med att undvika oavsiktliga konsekvenser. Att köra med de ytterligare säkerhetsåtgärder som erbjuds som standard resulterade i ännu bättre prestanda.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(öppnas i ett nytt fönster) and Anthropic Messages API(öppnas i ett nytt fönster)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra är också mer benägen att agera inom de gränser som användaren har angett och som antyds av dess miljö. i en intern utvärdering försökte Astra aldrig kringgå ett avslag från Codex Auto-Review. Detta gällde även när automatisk granskning avsiktligt hade konfigurerats så att den gick att kringgå och uppgiften annars var omöjlig att slutföra. Denna respekt för miljöns begränsningar överensstämmer med resultaten från vår utvärdering av omöjliga cyberuppgifter, som vi delade i inledningen av det här inlägget, och andra resultat som dokumenterats i vårt systemkort(öppnas i ett nytt fönster).

Astra uppvisar även betydande minskningar av vilseledande beteende. Personer som delegerar arbete behöver en tydlig förståelse för en modells förmågor och en ärlig rapportering av dess framsteg. Detta mäter en aspekt av ärlighet; att minska avsiktligt vilseledande förblir ett mer övergripande fokus för vårt anpassningsarbete.

I vår utvärdering av hallucinationer om förmågor visar Astra en betydande förbättring jämfört med GPT‑5.6 Sol och gör färre vilseledande påståenden om sina förmågor.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(öppnas i ett nytt fönster) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(öppnas i ett nytt fönster) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Tillgänglighet

GPT‑6 Astra rullas ut idag till företag och kunder i vårt Trusted Access-program och blir under de närmaste dagarna allmänt tillgänglig för personer som abonnerar på ChatGPT Plus, Pro, Business och Enterprise. Användning av Astra ingår i den befintliga användningsgränsen för Pro-abonnemangen för 100 USD och 200 USD, och Business-abonnemanget för 100 USD, utan ytterligare frekvensgränser eller begränsningar. Personer med en Plus-abonnemang för 20 USD och kunder med standardabonnemanget Business kan få åtkomst till GPT‑6 Astra med lägre användningsgränser och kan köpa krediter för ytterligare åtkomst. Enterprise-administratörer kan aktivera Astra för sin arbetsyta, och åtkomsten är som standard inaktiverad vid lanseringen.

Användare med Pro Lite, Pro, Business och Enterprise kan också använda GPT‑6 Astra i Chat. Astra stöder Noll datalagring för berättigade API-kunder, och som vi berättade förra månaden testar vi Private Safety Processing för att stärka säkerhetsövervakningen samtidigt som kundernas integritet bevaras.

För utvecklare är GPT‑6 Astra tillgänglig i OpenAI API som gpt-6-astra och i AWS Bedrock. Standardpriset för OpenAI API är 10 USD per miljon indatatoken och 50 USD per miljon utdatatoken. Separata priser gäller för cacheläsningar och cacheskrivningar. Snabbläge är tillgängligt för GPT‑6 Astra i API:et och ger upp till 2,5 gånger högre hastighet än standardbearbetning till dubbla standardpriset.

Datoranvändning

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Vetenskap och hälsa

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Cybersäkerhet

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Inriktning

Inriktning

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Internt säkerhetsbenchmark för datoranvändning (lägre är bättre)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Internt säkerhetsbenchmark för datoranvändning, med AutoReview (lägre är bättre)

1,8 %

4,3 %

-

-

-

-

Internt benchmark för kringgående (lägre är bättre)

0,00 %

0,29 %

-

-

-

-

ExploitGym honeypot (lägre är bättre)

0,0 %

48,2 %

-

-

-

-

Omöjligt ExploitGym

100,0 %

-

-

-

-

-

Internt hallucinationsbenchmark (lägre är bättre)

4,2 %

12,2 %

-

-

-

-

Lång kontext

Lång kontext

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 med 8 nålar, 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 med 8 nålar, 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstrakt resonemang

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Utvärderingspoängen är som högst oavsett ansträngningsnivå. Utvärderingar av GPT kördes i vår forskningsmiljö eller via vårt API, vilket kan ge något annorlunda resultat jämfört med ChatGPT i produktion på grund av skillnader i systemprompter, tillgängliga verktyg osv.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(öppnas i ett nytt fönster). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(öppnas i ett nytt fönster).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(öppnas i ett nytt fönster).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(öppnas i ett nytt fönster).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(öppnas i ett nytt fönster): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(öppnas i ett nytt fönster) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(öppnas i ett nytt fönster) and supporting research(öppnas i ett nytt fönster).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(öppnas i ett nytt fönster) and supporting research(öppnas i ett nytt fönster).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.