OpenAI

GPT-6 Astra: A new generation of intelligence

En ny generation af intelligens

Vi introducerer GPT‑6 Astra, verdens mest intelligente og målrettede model.

GPT‑6 Astra samler mange års forskning og store satsninger inden for fortræning, forstærkende læring og tilpasning. Astra er banebrydende inden for computerbrug, browsing, softwareudvikling, cybersikkerhed, videnskab og fagligt arbejde. Astra når mætningspunktet for FrontierMath Tier 4 med en score på 98 % og har allerede bidraget til at løse længe uløste åbne problemer inden for matematik. Astra når også mætningspunktet for ARC-AGI-3 med en score på 99,9 % og 100 % for ExploitBench. Den sætter også banebrydende standarder for brug af computere og browsere og håndterer det mest krævende faglige arbejde med uovertruffen hastighed, nøjagtighed og dømmekraft. 

GPT‑6 Astra udrulles i dag til et begrænset antal organisationer og bliver i løbet af de kommende dage tilgængelig for alle ChatGPT Plus-, Pro-, Business- og Enterprise-brugere samt via OpenAI API, Microsoft Azure og AWS Bedrock.

“På ARC-AGI-3 overgik Astra vores menneskelige baseline for handlingseffektivitet på 96 % af niveauerne og nåede dermed reelt menneskelig paritet på benchmarken. Det er ikke blot den bedste model, vi nogensinde har testet, men den repræsenterer også et betydeligt spring i ydeevnen for banebrydende modeller - ikke blot i dens evne til at navigere i og løse nye miljøer, men også i, hvor effektivt den lærer at gøre det.”
Greg Kamradt, ARC Prize Foundation

Astra er vores hidtil bedst afstemte model med væsentlige forbedringer i forståelsen af brugerens hensigt og modeladfærd—du kan uddelegere opgaver med større tillid til Astras vurdering. Som en måde, vi tester dette på, udviklede vi en ny evaluering baseret på Hugging Face-hændelsen, som vurderer, om en model, der står over for en vanskelig eller umulig opgave, vil overskride sit tilsigtede område. Sammenlignet med GPT‑5.6 Sol, som uden sikkerhedsforanstaltninger i produktionsmiljøet overskred det autoriserede mål i 48 % af tilfældene, gjorde GPT‑6 Astra dette i 0 % af tilfældene.

Verdens bedste model til computerbrug

GPT‑6 Astra markerer en ny milepæl inden for hastighed, nøjagtighed og sikkerhed ved brug af computere. Den kan varetage kedelige opgaver som at udfylde onlineformularer, opdatere kundeoplysninger i et CRM-system og organisere din kalender. Den kan lave research på nettet og udarbejde resuméer i din e-mail eller i dit dokumentredigeringsprogram. Den kan analysere videnskabelige data, generere grafer, oprette et website og køre frontend-QA-tjek for at sikre, at alle funktionerne på websitet virker. Den kan hjælpe dig med selvstændigt at installere og teste software samt fejlfinde problemer, du ser på skærmen. Disse forbedringer afspejles også i vores evalueringsresultater, der er blandt de bedste på området.

Disse forbedringer resulterer også i væsentlige effektivitetsgevinster i virkelige opgaver med vidensarbejde. I latenstidssimuleringer på OSWorld 2.0 opnår Astra højere ydeevne ved computerbrug på cirka 47 % kortere tid pr. opgave end GPT‑5.6 Sol, og scorer 72,6 % ved cirka 40 minutter pr. opgave, sammenlignet med 65,7 % ved cirka 75 minutter.3

GPT‑6 Astras inden for computerbrug kan ses i resultater på tværs af domæner, herunder spiludvikling, elektroteknik og dagligdags vidensarbejde:

Sideløbende med Astra opdaterer vi også Codex-systemet for at forbedre hastigheden ved computerbrug markant. Kombineret med Astras effektivitet betyder det, at opgaver udføres 1,9 gange hurtigere sammenlignet med den nuværende GPT‑5.6 Sol-oplevelse, målt på Mind2Web-benchmarken. Modellens forbedringer i hastighed betyder, at den kan overtage mange tidskrævende hverdagopgaver for dig – hurtigere, end du selv kan.

“Vi integrerer GPT‑6 Astra i Devins harness på lanceringsdagen, hvor den leverer topmoderne ydeevne på vores interne testbenchmark. Dens fremragende evne til at bruge computere, skrive, og forstå kodebasen forbedrede testningen fra starten: videoer er mærkbart lettere at følge, og rapporter er tydeligere og mere kortfattede”
Silas Alberti, SVP for forskning, Cognition

Et markant skifte i professionelt arbejde

GPT‑6 Astra kombinerer fremskridt inden for computerbrug med målrettet træning til professionelle miljøer for at hjælpe med at løse komplekse arbejdsopgaver. Den kombinerer den intelligens, der kræves til komplekse problemer, med evnen til at gennemføre arbejdsgange i flere trin og udarbejde gennemarbejdede dokumenter, regneark og præsentationer.

GPT‑6 Astra er vores bedste model til at følge eksisterende skabeloner og udarbejde dias, der er overskueligt opbyggede og kortfattet formidler nøglepunkter gennem en struktureret fortælling. Den skaber klare, velstrukturerede dokumenter, præsentationer, regneark og analyser, der følger dine skabeloner og matcher din skrivestil og visuelle stil. Astra er desuden trænet til specifikt kun at inddrage den relevante kontekst i resultaterne, i stedet for at gentage oplysninger, der er unødvendige for den aktuelle opgave. Alt dette betyder, at den kan generere mere umiddelbart anvendelige artefakter, der matcher din forretningskontekst og dine standarder.

GPT‑6 Astra bidrager desuden med en bedre visuel vurderingsevne til de websteder, spil, applikationer og renderinger, den bygger. Med Sites(åbner i et nyt vindue) i ChatGPT kan Astra oprette, hoste og dele websteder, webapps og spil direkte fra en prompt.

"Astra giver os en markant fordel i forhold til både kapacitet og effektivitet. Den udfører vores mest komplekse kreative arbejdsgange, samtidig med at den bruger op til 20 % færre tokens end andre modeller, vi har testet. Og hvad der er allervigtigst for vores kunder: Det betyder resultater af højere kvalitet."
Alex Mashrabov, CEO og medstifter, Higgsfield AI

Når instruktioner giver plads til fortolkning, er GPT‑6 Astra bedre end tidligere modeller til at træffe den rigtige beslutning. Den bruger sammenhæng til at udfylde almindelige informationsmangler og stiller målrettede spørgsmål, når svaret kan ændre udfaldet. I Codex kan den stille spørgsmål asynkront, mens den fortsætter arbejdet, der ikke afhænger af dit svar. Hvis du ikke svarer, fortsætter den ud fra fornuftige antagelser, hvor det er passende, men venter på dit input i forbindelse med beslutninger med væsentlige konsekvenser.

Eksemplerne nedenfor viser, hvordan Astra samarbejder om dagligdagsopgaver, hvor manglende oplysninger kan ændre svaret væsentligt.

Astra er også bedre til at bevare overblikket, efterhånden som en opgave udvikler sig. Tidligere modeller behandlede nogle gange styringsbeskeder som et nyt mål og mistede dermed fokus i forhold til den oprindelige anmodning eller tidligere begrænsninger. Astra indarbejder nye krav, skifter kurs, når den bliver bedt om det, og besvarer sidespørgsmål uden at miste den overordnede opgave af syne.

"Astra er en betydelig kvalitetsforbedring i forhold til GPT‑5.6 Sol på tværs af komplekse juridiske opgaver. I vores indledende test skilte Astra sig ud ved at til gå juridisk arbejde på samme måde som en skarpsindig advokat: den skelner mellem dokumenter og etablerede optegnelser, påpeger ikke-underbyggede antagelser og omsætter mangler til konkrete standpunkter i udarbejdelsen."
Niko Grupen, chef for applied research, Harvey

Kodning

GPT‑6 Astra er den bedste model til softwareudvikling til dato.

1 af 2
"GPT‑6 Astra leverer topmoderne ydeevne på vores interne benchmarks for kodning og viser et klart fremskridt i evalueringer af handelsintuition sammenlignet med GPT‑5.6 Sol. Når GPT‑6 Astra bruges til agentisk kodning, kommunikerer den på en måde, der er lettere for udviklere at følge, og producerer kode, der kræver færre iterationer for at nå produktionskvalitet."
John Crepezzi, AI Assistants, Jane Street

Med Astra introducerer vi en ny måde, hvorpå Codex kan bevare og hente sammenhæng, når sammenhængsvinduet fyldes. Historisk set har modeller brugt komprimering til at sammenfatte arbejde under lange sessioner, f.eks. når de fejlfinder komplekse problemer eller håndterer store refaktoreringer. Hver komprimering kan udelade detaljer om, hvorfor en rettelse mislykkedes, eller hvordan en komponent fungerer. I Codex kan Astra gemme noter på tværs af sammenhængsvinduer og dermed bevare de akkumulerede detaljer uden gentagne gange at komprimere dem til en enkelt sammenfatning. Tidligere sammenhængsvinduer forbliver søgbare, så Astra kan finde krav eller testresultater fra tidligere beskeder og værktøjsoutput—også selvom oplysningerne ikke blev registreret i dens noter. Du kan aktivere denne eksperimentelle funktion i din Codex config.toml,(åbner i et nyt vindue) og den vil blive standarden for Astra i løbet af de næste uger.

Fremme videnskabelige opdagelser

"Historien er: slutningen på én æra, begyndelsen på en anden."
Greg Burnham, EpochAI

GPT‑6 Astra er et stort fremskridt for videnskabelige opdagelser, matematik og sundhed. I dag deler vi yderligere to resultater om afstande mellem primtal [MED LINK]. Astra sætter også nye rekorder på tværs af en række videnskabelige evalueringer:

Astra kan bidrage til det praktiske arbejde, der ligger bag videnskabelige opdagelser. Ved at kombinere videnskabelig ræsonnering med brug af computere kan den arbejde direkte i specialiseret software for at undersøge data og udforske resultater, hvilket hjælper forskere med at vurdere evidensen og beslutte, hvad de skal undersøge som det næste.

Cybersikkerhed

Astra er et markant fremskridt inden for cybersikkerhedskapacitet. Dens evne til at identificere og udvikle zero-day-exploits kan hjælpe sikkerhedsansvarlige med at rette sårbarheder, men den skaber også behov for stærkere sikkerhedsforanstaltninger. For at forstå, hvor langt disse kapaciteter rækker, brugte vi interne ekspertvurderinger og ekspertvurderinger fra tredjeparter.

Vi testede først Astra på ExploitBench og ExploitGym, som måler, om modeller kan opnå vilkårlig kodeeksekvering i sårbare kodebaser.

I betragtning af eventuelle bekymringer om, at eksponering for historiske sårbarheder i software kan have påvirket benchmark-resultaterne, har vi også evalueret Astra ved hjælp af to nye benchmarks. For det første udviklede vi en intern evaluering, "ExploitBench (juni‑august 2026)", til at teste udvikling af exploits ved hjælp af sårbarheder fra de foregående tre måneder. 2 Astra opnåede væsentligt højere rater for udførelse af vilkårlig kode takket være GPT‑5.6 Sol på dette datasæt, samtidig med at den anvendte langt færre output-tokens. Under evalueringen opdagede og anvendte Astra to hidtil ukendte teknikker til at omgå Chrome V8-heap-sandboxen. Vi videregiver oplysninger om begge sårbarheder til de ansvarlige for vedligeholdelsen af disse.

Vi testede også Astra på SRE-Bench, en benchmark, der måler, om modeller kan reverse engineere binær software for at forstå dens grundlæggende logik. Forfatterne bag benchmarken udviklede softwaren fra bunden og holdt dens kildekode privat. Astra løste 88,0 % af opgaverne i ét forsøg og 99,2 % inden for fire forsøg sammenlignet med henholdsvis 55,9 % og 68,7 % for GPT‑5.6 Sol.

Ud over benchmarks viste ekspertledede vurderinger, at Astra kunne udnytte hidtil ukendte sårbarheder til at køre vilkårlig kode i sikrede browsere og skabe exploits til rettighedseskalering for sikrede operativsystemer. Samlet set lå disse resultater til grund for vores beslutning om, at Astra har nået den kritiske tærskel inden for cybersikkerhed i henhold til vores Preparedness Framework.

Som vi drøftede i The Defender’s Window, kan banebrydende cyberfunktioner hjælpe sikkerhedsansvarlige med at finde svagheder hurtigere, men de gør også disse svagheder lettere at udnytte, hvilket øger presset på de sikkerhedsansvarlige for at tilpasse sig.

I den version af Astra, der lanceres i dag, understøtter vi vigtige defensive opgaver såsom sikker kodegennemgang, patching og trusselsmodellering. Som standard vil Astra dog afvise at udføre avancerede cybersikkerhedsopgaver såsom identifikation af exploits. Gennem OpenAI Daybreak indfører vi en mindre begrænsende adgang til en alfagruppe af betroede sikkerhedsansvarlige inden for cybersikkerhed i OpenAI Daybreak-programmet. Dette udvider adgangen til defensive arbejdsgange, herunder sårbarhedstriagering og -validering, malwareanalyse, detektionsingeniørarbejde og patchvalidering. Vi planlægger at udvide adgangen yderligere gennem Daybreak Blue.

Vi har også styrket vores beskyttelse mod potentielt cybermisbrug med udgangspunkt i vores sikkerhedsforanstaltninger for GPT‑5.6 Sol. Dette omfatter stærkere træning i modelrobusthed for bedre at kunne modstå potentielle jailbreaks og mere kontekst til vores overvågningssystemer. Vi har fortsat den grundige interne og eksterne testning, herunder automatiserede tests med vores interne red-teaming-angribere. Du kan finde flere oplysninger om vores cybersikkerhedsforanstaltninger og test i Astra-systemkortet og på vores blog.

Ansvarlig tilpasning og implementering af GPT‑6 Astra

Astra er vores mest tilpassede model. Astra udmærker sig ved at udvise omhu, respektere opgavens rammer og kommunikere åbent. Dette arbejde er det seneste resultat af vores langvarige forskningsprogram, der fokuserer på at træne modeller, som forbliver afstemt med menneskelig hensigt fra start til slut.

I følsomme miljøer udviser Astra en omhu, der er passende i forhold til risikoen. I en evaluering af opgaver inden for computerbrug, der var udvalgt med henblik på at fremkalde uønsket adfærd, havde Astra større succes med at undgå utilsigtede konsekvenser. Kørsel med yderligere sikkerhedsforanstaltninger, der tilbydes som standard, gav endnu bedre ydeevne.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(åbner i et nyt vindue) and Anthropic Messages API(åbner i et nyt vindue)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Astra er også mere tilbøjelig til at arbejde inden for de grænser, der er fastsat af brugeren og underforstået i dens miljø. I en intern evaluering forsøgte Astra aldrig at omgå en afvisning af Codex automatisk gennemgang. Dette gjorde sig gældende, selv når automatisk gennemgang bevidst var konfigureret til at kunne omgås, og opgaven ellers var umulig at fuldføre. Denne respekt for miljøets begrænsninger stemmer overens med resultaterne af vores evaluering af umulige cyberopgaver, som vi delte i indledningen til dette indlæg, samt andre resultater, der er dokumenteret i vores systemkort(åbner i et nyt vindue).

Astra viser også en markant reduktion i vildledende adfærd. Personer, der uddelegerer arbejde, har brug for en klar forståelse af en models evner og en ærlig rapportering om dens fremskridt. Dette måler ét aspekt af ærlighed; reduktion af bevidst vildledning er fortsat et bredere fokusområde i vores tilpasningsarbejde.

I vores evaluering af "capability-hallucination" viser Astra en betydelig forbedring i forhold til GPT‑5.6 Sol, idet den fremsætter færre vildledende påstande om sine kapabiliteter.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(åbner i et nyt vindue) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(åbner i et nyt vindue) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Tilgængelighed

GPT‑6 Astra lanceres i dag for virksomheder og kunder i vores Trusted Access-program, og i løbet af de næste par dage vil den blive bredt tilgængelig for abonnenter på ChatGPT Plus, Pro, Business og Enterprise. Brug af Astra er inkluderet i den eksisterende forbrugsgrænse i Pro-abonnementerne til 100 $ og 200 $ samt Business-abonnementet til 100 $, uden yderligere brugsgrænser eller restriktioner. Brugere med et $20 Plus-abonnement og kunder på standard Business-abonnementet har adgang til GPT‑6 Astra med lavere begrænsninger, og de har mulighed for at købe kreditter for at få yderligere adgang. Virksomhedsadministratorer kan aktivere Astra for deres arbejdsområde; adgangen er som standard deaktiveret ved opstart.

Brugere af Pro Lite, Pro, Business og Enterprise kan også bruge GPT‑6 Astra i Chat. Astra understøtter ingen datalagring for berettigede API-kunder, og som vi fortalte sidste måned, tester vi Private Safety Processing for at styrke sikkerhedsovervågningen, samtidig med at kundernes privatliv bevares.

For udviklere er GPT‑6 Astra tilgængelig i OpenAI API som gpt-6-astra og i AWS Bedrock. Standardprisen for OpenAI API er 10 USD pr. million input-tokens og 50 USD pr. million output-tokens. Der gælder særskilte takster for cachelæsninger og -skrivninger. Hurtig tilstand er tilgængelig for GPT‑6 Astra i API'et og leverer op til 2,5 gange hastigheden ved standardbehandling til det dobbelte af standardprisen.

Computerbrug

Computerbrug

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.7 Flash

OSWorld 2.0 (augustudgivelse, delvis score)

66,1 %

70,6 %

OSWorld 2.0 (augustudgivelse, offline-delmængde, delvis score)

ScreenSpot Pro

92,6 %

76,8 %

BrowseComp

92,1 %

90,4 %

87,4 %

90,8 %

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Videnskab og sundhed

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Cybersikkerhed

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Justering

Justering

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Sikkerhedsbenchmark for intern computerbrug (lavere er bedre)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Sikkerhedsbenchmark for intern computerbrug, med automatisk gennemgang (lavere er bedre)

1,8 %

4,3 %

-

-

-

-

Benchmark for intern omgåelse (lavere er bedre)

0,00 %

0,29 %

-

-

-

-

ExploitGym-honeypot (lavere er bedre)

0,0 %

48,2 %

-

-

-

-

Umuligt ExploitGym

100,0 %

-

-

-

-

-

Benchmark for intern hallucination (lavere er bedre)

4,2 %

12,2 %

-

-

-

-

Lang kontekst

Lang kontekst

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-nåls 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8-nåls 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstrakt tænkning

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Evalueringsresultater er maksimale uanset indsatsniveau. GPT‑evalueringer blev kørt i vores forskningsmiljø eller via vores API, hvilket kan give output, der afviger en smule fra produktionsversionen af ChatGPT på grund af forskelle i systemprompter, tilgængelige værktøjer, osv.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(åbner i et nyt vindue). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(åbner i et nyt vindue).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(åbner i et nyt vindue).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(åbner i et nyt vindue).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(åbner i et nyt vindue): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(åbner i et nyt vindue) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(åbner i et nyt vindue) and supporting research(åbner i et nyt vindue).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(åbner i et nyt vindue) and supporting research(åbner i et nyt vindue).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.