OpenAI

GPT-6 Astra: A new generation of intelligence

Nová generace inteligence

Představujeme GPT‑6 Astra, nejinteligentnější a nejlépe sladěný model na světě.

Model GPT‑6 Astra spojuje roky výzkumu a odvážných investic do předtrénování, učení posilováním a sladěním. Model Astra dosahuje špičkové úrovně v práci s počítačem, prohlížení webu, softwarovém inženýrství, kybernetické bezpečnosti, vědě a profesionální práci. Astra dosahuje saturace v benchmarku FrontierMath Tier 4 se skóre 98 %, přičemž už dříve pomohla vyřešit dlouhodobě nevyřešené problémy v matematice. Model Astra také dosahuje saturace v ARC-AGI-3 se skóre 99,9 % a v ExploitBenchi se 100% skóre. Zároveň stanovuje průkopnický přístup k používání počítače a prohlížeče a zvládá i nejnáročnější profesionální práci s bezkonkurenční rychlostí, přesností a úsudkem. 

Model GPT‑6 Astra se dnes postupně zpřístupňuje omezenému počtu organizací a v příštích dnech bude dostupný všem uživatelům ChatGPT Plus, Pro, Business a Enterprise, stejně jako prostřednictvím rozhraní OpenAI API, Microsoft Azure a AWS Bedrock.

„V benchmarku ARC-AGI-3 překonal model Astra naši referenční úroveň efektivity lidských akcí na 96 % úrovní, čímž v benchmarku fakticky dosáhl výkonu srovnatelného s lidmi. Nejenže jde o nejlepší model, jaký jsme kdy testovali, ale představuje také významný skok ve výkonu průkopnických modelů – nejen ve schopnosti orientovat se v nových prostředích a řešit je, ale také v tom, jak efektivně se učí.“
Greg Kamradt, ARC Prize Foundation

Model Astra je náš dosud nejlépe sladěný model s výrazně lepším porozuměním záměru uživatele a chování modelu – úkoly tak můžete delegovat s větší důvěrou v úsudek Astry. Jedním ze způsobů, jak to testujeme, je nové hodnocení vycházející z incidentu Hugging Face, které zkoumá, zda model čelící obtížnému nebo neřešitelnému úkolu překročí svůj zamýšlený rozsah. Ve srovnání s modelem GPT‑5.6 Sol, který bez produkčních ochranných opatření v 48 % případů překročil oprávněný cíl, model GPT‑6 Astra tak učinil v 0 % případů.

Nejlepší model pro práci s počítačem na světě

GPT‑6 Astra představuje průkopnický nový milník v rychlosti, přesnosti a bezpečnosti při používání počítače. Dokáže se postarat o zdlouhavé úkoly, jako je vyplňování online formulářů, aktualizace záznamů o zákaznících v CRM a organizace vašeho kalendáře. Dokáže provádět online rešerše a připravovat návrhy shrnutí ve vašem e-mailu nebo v editoru dokumentů. Dokáže analyzovat vědecká data, generovat grafy, vytvořit web a spouštět kontroly QA frontendu, aby se zajistilo, že všechny funkce na tomto webu fungují. Může vám pomoci samostatně instalovat a testovat software a řešit problémy, které vidíte na obrazovce. Tato vylepšení se odrážejí také v našich špičkových výsledcích hodnocení.

Tato vylepšení také vedou k významnému zvýšení efektivity při skutečných úkolech znalostní práce. V simulacích latence v OSWorld 2.0 dosahuje model Astra vyššího výkonu při používání počítače za přibližně o 47 % kratší dobu na úkol než GPT‑5.6 Sol se skóre 72,6 % při přibližně 40 minutách na úlohu, ve srovnání s 65,7 % při přibližně 75 minutách.3

Schopnosti modelu GPT‑6 Astra při práci s počítačem se projevují ve výstupech v různých oblastech, včetně vývoje her, elektrotechniky a každodenní znalostní práce:

Vedle modelu Astra také aktualizujeme harness Codexu, abychom výrazně zvýšili rychlost používání počítače. V kombinaci s efektivitou modelu Astra to v benchmarku Mind2Web znamená 1,9 × rychlejší dokončování úloh ve srovnání se současnou zkušeností s GPT‑5.6 Sol. Zlepšení rychlosti modelu znamená, že za váš dokáže převzít mnoho časově náročných každodenních úkolů a vyřídit je rychleji než vy.

„V den uvedení na trh integrujeme GPT‑6 Astra do Devinova prostředí, kde v našem interním testovacím benchmarku dosahuje špičkových výsledků. Díky vynikající práci s počítačem, psaní a porozumění kódové základně se testování zlepšilo hned od začátku: videa lze znatelně snáze sledovat a reporty jsou jasnější a stručnější“
Silas Alberti, SVP pro výzkum, Cognition

Zásadní posun v odborné práci

GPT‑6 Astra spojuje pokroky v práci s počítačem s cíleným tréninkem pro profesionální prostředí, aby pomohl zvládat složité pracovní úkoly. Kombinuje inteligenci potřebnou k řešení složitých problémů se schopností provádět vícekrokové pracovní postupy a vytvářet propracované dokumenty, tabulky a prezentace.

Model GPT‑6 Astra je náš nejlepší model pro dodržování stávajících šablon a vytváření přehledně uspořádaných snímků, které pomocí strukturovaného vyprávění stručně předávají klíčové body. Vytváří srozumitelné, dobře strukturované dokumenty, prezentace, tabulky a analýzy, které se řídí vašimi šablonami a odpovídají vašemu stylu psaní i vizuálnímu stylu. Astra je také vytrénována tak, aby do výstupů cíleně zahrnovala pouze relevantní kontext, místo aby opakovala informace, které nejsou pro aktuální úkol nezbytné. To vše znamená, že dokáže generovat artefakty, které jsou okamžitě lépe použitelné a odpovídají kontextu vašeho podnikání a vašim standardům.

GPT‑6 Astra také přináší lepší schopnosti vizuálního posouzení při vytváření webových stránek, her, aplikací a vizualizací. S Weby(otevře se v novém okně) v ChatGPT může model Astra vytvářet, hostovat a sdílet webové stránky, webové aplikace a hry přímo z promptu.

„Astra nám poskytuje významnou výhodu jak z hlediska schopností, tak efektivity. Úspěšně zvládá naše nejsložitější kreativní pracovní postupy a přitom používá až o 20 % méně tokenů než jiné modely, které jsme testovali. A co je pro naše zákazníky nejdůležitější, znamená to kvalitnější výstupy.“
Alex Mashrabov, generální ředitel a spoluzakladatel společnosti Higgsfield AI

Když pokyny ponechávají prostor pro výklad, model GPT‑6 Astra dokáže lépe než předchozí modely učinit správné rozhodnutí. Využívá kontext k doplnění běžných nedostatků a klade cílené otázky, pokud by odpověď mohla změnit výsledek. V Codexu může klást otázky asynchronně a pokračovat v práci, která nezávisí na vaší odpovědi. Pokud neodpovíte, postupuje tam, kde je to vhodné, podle rozumných předpokladů, ale u zásadních rozhodnutí počká na vaše zadání.

Níže uvedené příklady ukazují, jak model Astra spolupracuje na každodenních úlohách, kde mohou chybějící informace podstatně změnit odpověď.

Model Astra si také lépe udržuje přehled o průběhu úkolu. Dřívější modely někdy považovaly řídicí zprávy za nový cíl a ztrácely přehled o původním požadavku nebo dřívějších omezeních. Astra zohledňuje nové požadavky, na požádání mění směřování a odpovídá na doplňující otázky, aniž by ztratila ze zřetele širší úkol.

„Astra představuje výrazné zlepšení kvality oproti GPT‑5.6 Sol při řešení složitých právních úkolů. Při našem úvodním testování Astra vynikla tím, že k právním činnostem přistupovala tak, jak to dělá pečlivý právník s dobrým úsudkem: rozlišuje dokumenty od ověřených záznamů, odhaluje nepodložené předpoklady a nedostatky převádí na konkrétní východiska pro formulaci textu.“
Niko Grupen, vedoucí aplikovaného výzkumu, společnosti Harvey

Programování

GPT‑6 Astra je dosud nejlepší model pro vývoj softwaru.

1 z 2
„Model GPT‑6 Astra poskytuje špičkový výkon v našich interních benchmarcích pro kódování a ve srovnání s GPT‑5.6 Sol představuje zřetelný posun vpřed v hodnoceních intuice při obchodování. Při použití pro agentní kódování model GPT‑6 Astra komunikuje způsobem, který mohou vývojáři snáze sledovat, a vytváří kód, který k dosažení produkční kvality vyžaduje méně iterací.“
John Crepezzi, AI asistenti, Jane Street

S Astrou představujeme nový způsob, jak může Codex zachovávat a znovu vyhledávat kontext, když se kontextové okno zaplní. Modely v minulosti používaly kompakci ke shrnutí práce během dlouhých relací, například při ladění složitých problémů nebo provádění rozsáhlých refaktoringů. Při každé kompakci mohou chybět podrobnosti o tom, proč oprava selhala nebo jak se komponenta chová. V Codex může Astra uchovávat poznámky napříč kontextovými okny a zachovávat tak nahromaděné podrobnosti, aniž by je opakovaně komprimovala do jediného shrnutí. Dřívější kontextová okna zůstávají prohledávatelná, takže Astra může najít požadavky nebo výsledky testů z předchozích zpráv a výstupů nástrojů, i když tyto informace nebyly zachyceny v jejích poznámkách. Tuto experimentální funkci můžeš povolit v souboru config.toml pro Codex,(otevře se v novém okně) a v nadcházejících týdnech se stane výchozím nastavením pro model Astra.

Posouváme vědecké objevy dopředu

„Příběh zní: konec jedné éry, začátek druhé.“
Greg Burnham, EpochAI

Model GPT‑6 Astra představuje významný pokrok v oblasti vědeckých objevů, matematiky a zdravotnictví. Dnes se s vámi dělíme o další dva výsledky týkající se nedostatků mezi prvočísly [WITH LINK]. Astra také stanovuje nové rekordy v celé sadě vědeckých hodnocení:

Astra může pomoci s praktickými činnostmi, které stojí za vědeckými objevy. Kombinací vědeckého uvažování s používáním počítače může přímo pracovat ve specializovaném softwaru, zkoumat data a výsledky a pomáhat výzkumníkům vyhodnocovat důkazy a rozhodovat, co zkoumat dál.

Kybernetická bezpečnost

Astra představuje zásadní posun v kyberbezpečnostních schopnostech. Její schopnost identifikovat a vyvíjet zero-day exploity může obráncům pomoci opravovat zranitelnosti, ale zároveň vytváří potřebu silnějších ochranných opatření. Abychom porozuměli rozsahu těchto schopností, využili jsme interní hodnocení i hodnocení externích odborníků.

Model Astra jsme nejprve testovali v benchmarcích ExploitBench a ExploitGym, které měří, zda modely dokážou ve zranitelných kódových základnách spustit libovolný kód.

Vzhledem k možným obavám, že vystavení historickým softwarovým zranitelnostem mohlo ovlivnit výsledky benchmarků, jsme systém Astra vyhodnotili také na dvou nových benchmarcích. Jednak jsme vytvořili interní vyhodnocení „ExploitBench (červen–srpen 2026)“ pro testování vývoje exploitů s využitím zranitelností z předchozích tří měsíců. 2 Astra na této datové sadě dosáhla při použití mnohem menšího počtu výstupních tokenů výrazně vyšší úspěšnosti spuštění libovolného kódu než GPT‑5.6 Sol. Během vyhodnocení Astra objevila a použila dvě dříve neznámé techniky úniku ze sandboxu haldy V8. Obě zranitelnosti oznamujeme jejich správcům.

Model Astra jsme také testovali v benchmarku SRE-Bench, který měří, zda modely dokážou zpětně analyzovat binární software a porozumět jeho základní logice. Autoři benchmarku vytvořili software od základu a jeho zdrojový kód nezveřejnili. Astra vyřešila 88,0 % úloh na jediný pokus a 99,2 % do čtyř pokusů, ve srovnání s 55,9 % a 68,7 % v případě GPT‑5.6 Sol.

Nad rámec benchmarků hodnocení vedená odborníky zjistila, že Astra dokázala využít dříve neznámé zranitelnosti ke spuštění libovolného kódu v zabezpečených prohlížečích a vytvářet exploity pro eskalaci oprávnění v zabezpečených operačních systémech. Tyto výsledky nás společně vedly k rozhodnutí, že Astra podle našeho rámce připravenosti dosáhla kritického prahu v oblasti kybernetické bezpečnosti.

Jak jsme rozebrali v The Defender’s Window, mohou průkopnické kybernetické schopnosti obráncům pomoci rychleji odhalit slabiny, zároveň však usnadňují jejich zneužití, a zvyšují tak naléhavost adaptace obránců.

V dnes uváděné verzi Astra podporujeme důležité obranné činnosti, jako jsou bezpečnostní revize kódu, použití oprav a modelování hrozeb. Ve výchozím nastavení však Astra odmítne provádět pokročilé úlohy v oblasti kybernetické bezpečnosti, jako je vyhledávání exploitů. Prostřednictvím OpenAI Daybreak zavádíme méně omezující přístup pro alfa skupinu důvěryhodných obránců v oblasti kybernetické bezpečnosti v programu OpenAI Daybreak. Tím se rozšiřuje přístup k obranným pracovním postupům, včetně třídění zranitelností a jejich ověřování, analýzy malwaru, vývoje detekčních mechanismů a ověřování oprav. Plánujeme dále rozšířit přístup prostřednictvím Daybreak Blue.

Posílili jsme také naši ochranu proti možnému kybernetickému zneužití a navázali tak na soubor ochranných opatření pro GPT‑5.6 Sol. Ta zahrnují intenzivnější trénování odolnosti modelu, aby lépe odolával možným jailbreakům, a více kontextu pro naše monitorovací systémy. Pokračovali jsme v důkladném interním i externím testování, včetně automatizovaných testů s našimi interními útočníky v rámci red-teamingu. Další podrobnosti o našich kybernetických ochranných opatřeních a testování najdete v kartě systému Astra a na našem blogu.

Zodpovědné slaďování a nasazování GPT‑6 Astra

Astra je náš dosud nejlépe sladěný model. Model Astra vyniká pečlivým postupem, respektováním hranic úkolů a transparentní komunikací. Tato činnost je nejnovějším výsledkem našeho dlouhodobého výzkumného programu zaměřeného na trénování modelů, které od začátku do konce zůstávají v souladu s lidským záměrem.

V citlivých prostředích postupuje model Astra s opatrností odpovídající danému riziku. Při hodnocení úloh zaměřených na používání počítače, které byly adverzariálně vybrány tak, aby vyvolaly nežádoucí chování, byla Astra úspěšnější v předcházení nezamýšleným důsledkům. Při používání dodatečných bezpečnostních opatření poskytovaných ve výchozím nastavení bylo dosaženo ještě vyššího výkonu.

Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(otevře se v novém okně) and Anthropic Messages API(otevře se v novém okně)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16

Model Astra také s větší pravděpodobností funguje v mezích stanovených uživatelem a vyplývajících z jejího prostředí. V interním hodnocení se Astra nikdy nepokusila obejít zamítnutí automatickou kontrolou Codex. To platilo i tehdy, když byla funkce Automatická kontrola záměrně nakonfigurována tak, aby ji bylo možné obejít, a úkol jinak nebylo možné dokončit. Toto respektování omezení prostředí je v souladu s výsledky našeho hodnocení nemožných kybernetických úkolů, které jsme sdíleli v úvodu tohoto příspěvku, i s dalšími zjištěními zdokumentovanými na naší kartě systému(otevře se v novém okně).

Astra také vykazuje výrazné snížení klamavého chování. Lidé, kteří delegují práci, potřebují jasně rozumět schopnostem modelu a získávat upřímné informace o jeho pokroku. Toto měří jeden aspekt poctivosti; snižování míry úmyslného klamání nadále zůstává širším zaměřením naší práce v oblasti sladění.

V našem hodnocení halucinací týkajících se schopností vykazuje Astra oproti GPT‑5.6 Sol výrazné zlepšení a uvádí méně zavádějících tvrzení o svých schopnostech.

Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(otevře se v novém okně) details our findings and ongoing work.

Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(otevře se v novém okně) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.

Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.

Dostupnost

Model GPT‑6 Astra se dnes postupně zpřístupňuje podnikům a zákazníkům v našem programu Trusted Access. V příštích několika dnech bude ve velké míře dostupný lidem s předplatným ChatGPT Plus, Pro, Business a Enterprise. Používání modelu AstrA je zahrnuto do stávajícího limitu využití v plánech Pro za 100 USD a 200 USD a v plánu Business za 100 USD, bez dalších limitů frekvence požadavků nebo omezení. Lidé s předplatným Plus za 20 USD a zákazníci se standardním plánem Business mohou používat GPT‑6 Astra s nižšími limity a mají možnost zakoupit kredity pro další přístup. Správci Enterprise mohou Astru povolit pro svůj pracovní prostor; přístup je při spuštění ve výchozím nastavení vypnutý.

Uživatelé plánů Pro Lite, Pro, Business a Enterprise mohou GPT‑6 Astra používat také v Chatu. Astra podporuje nulové uchovávání dat pro oprávněné zákazníky API a jak jsme uvedli minulý měsíc, testujeme Soukromé bezpečnostní zpracování, abychom posílili monitorování bezpečnosti a zároveň zachovali soukromí zákazníků.

Pro vývojáře je model GPT‑6 Astra dostupný v OpenAI API jako gpt-6-astra a také v AWS Bedrock. Standardní ceny OpenAI API jsou 10 USD za milion vstupních tokenů a 50 USD za milion výstupních tokenů. Na čtení z mezipaměti a zápisy do mezipaměti se vztahují samostatné sazby. Rychlý režim je pro GPT‑6 Astra dostupný v API a nabízí až 2,5× vyšší rychlost než zpracování v režimu Standard za dvojnásobnou cenu režimu Standard.

Používání počítače

Computer Use

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59.3%

53.6%

-

48.7%

55.5%

-

OSWorld 2.0 (v2026.08.08, offline set, partial score)

72.6%

65.7%

-

-

70.2%3

-

ScreenSpot-Pro (no tools)

92.7%

76.9%

-

87.3%17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41.4%

18.1%

31.4%

17.4%

26.9%

-

BenchCAD

95.9%

83.3%

84.3% 5

67.5% 5

82.1% 5

-

BrowseComp

91.5%

90.4%

-

87.4%

90.8%

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Internal Design Tasks

50.0%

47.4%

-

35.8%

-

-

Internal Data Science Tasks

40.9%

30.5%

-

34.7%

-

-

Artificial Analysis Intelligence Index v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Coding

CodingGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9%37.3%55.8%44.5%52.6%19.1%
DeepSWE v1.174.1%72.7%67.4%69.9%73.7%73.8%
FrontierCode 1.1 Extended (score)64.5% 860.6%63.6%64.9%63.6%56.3%
FrontierCode 1.1 Main (score)53.3% 847.5%50.9%53.5%53.4%43.6%
Internal Database Migration Tasks63.9%42.7%57.8%50.3%--
Artificial Analysis Coding Agent Index v1.467.065.1-67.268.161.2

Academic

Academic

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

21.4%

30.0%

-

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

90.2%

73.2%

-

GPQA Diamond

96.0%

94.6%

93.7%

92.6%

93.7%

95.3%

Humanity's Last Exam (w/ tools)

57.2%

-

65.0%

63.8%

63.6%

-

Věda a zdraví

Science and HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1%32.3%----
MedChemBench (Internal)49.3%47.4%----
LifeSciBench60.3%59.9%----
HealthBench Professional (length-adjusted)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%

Kybernetická bezpečnost

CybersecurityGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0%78.5%--70%-
ExploitGym42.4% 1330.3% 1330.4% 1728.4%1722.0%-
ExploitBench (June-Aug 2026)39.0%5.5%----
SRE-Bench88.0%55.9%--12.5%-
SEC-Bench Pro85.4%79.1%----

Sladění

Sladění

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Interní benchmark bezpečnosti používání počítače (čím nižší, tím lepší)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Interní benchmark bezpečnosti používání počítače s AutoReview (čím nižší, tím lepší)

1,8 %

4,3 %

-

-

-

-

Interní benchmark obcházení (čím nižší, tím lepší)

0,00 %

0,29 %

-

-

-

-

Honeypot v ExploitGym (čím nižší, tím lepší)

0,0 %

48,2 %

-

-

-

-

Nemožný ExploitGym

100,0 %

-

-

-

-

-

Interní benchmark halucinací (čím nižší, tím lepší)

4,2 %

12,2 %

-

-

-

-

Dlouhý kontext

Dlouhý kontext

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8needle 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstraktní uvažování

Abstract reasoningGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399.9% 17.8%--30.2%-
ARC-AGI-295.0%92.5%90.0%89.2%90.4%-
ARC-AGI-198.5%97.5%97.5%98.5%97.5%-

Hodnoticí skóre jsou maximální při jakémkoli úsilí. Hodnocení GPT byla provedena v našem výzkumném prostředí nebo prostřednictvím našeho rozhraní API, což může kvůli rozdílům v systémových promptech, dostupných nástrojích atd. v porovnání s ChatGPT v produkčním prostředí poskytovat mírně odlišné výstupy.

FOOTNOTES

  1. 1

    On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.

  2. 2

    GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.

  3. 3

    OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(otevře se v novém okně). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.

  4. 4

    Model times are the reported elapsed times for the corresponding demonstration runs. The displayed clips are edited excerpts.

  5. 5

    On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(otevře se v novém okně).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(otevře se v novém okně).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(otevře se v novém okně).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.

  8. 8

    On FrontierCode, GPT-6 Astra was run with a developer  message similar to a section of its developer message in Codex(otevře se v novém okně): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.

  9. 9

    The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(otevře se v novém okně) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(otevře se v novém okně) and supporting research(otevře se v novém okně).

  10. 10

    The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(otevře se v novém okně) and supporting research(otevře se v novém okně).

  11. 11

    We independently evaluated all Claude models following the intended HealthBench Professional procedure, using GPT‑5.4 grading and length-adjusted, unclipped scores. For Fable 5.1, we used Opus 5 fallback for provider refusals.

  12. 12

    Claude Fable 5 and 5.1 are not included in LifeSciBench Gold v1, GeneBench Pro v13, and MedChemBench because they refuse the majority of questions in these evaluations.

  13. 13

    On ExploitGym, we tested Astra and Sol without the 6-hour time limit, to better assess their full cyber capabilities. They are fast enough that it has little impact.

  14. 14

    ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.

  15. 15
  16. 16

    When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.

  17. 17

    For ScreenSpot-Pro and ExploitGym, the Fable scores we report come from Mythos, which is Fable with fewer safeguards.