OpenAI

GPT-6 Astra: A new generation of intelligence

Nová generace inteligence

Aktualizace z 22. září 2026: rozšiřujeme naši rodinu GPT‑6 o GPT‑6 Sol a GPT‑6 Luna. Více informací.

Představujeme GPT‑6 Astra, nejinteligentnější a nejlépe sladěný model na světě.

Model GPT‑6 Astra spojuje roky výzkumu a odvážných investic do předtrénování, učení posilováním a sladěním. Model Astra dosahuje špičkové úrovně v práci s počítačem, prohlížení webu, softwarovém inženýrství, kybernetické bezpečnosti, vědě a profesionální práci. Astra dosahuje saturace v benchmarku FrontierMath Tier 4 se skóre 98 %, přičemž už dříve pomohla vyřešit dlouhodobě nevyřešené problémy⁠ v matematice. Model Astra také dosahuje saturace v ARC-AGI-3 se skóre 99,9 % a v ExploitBenchi se 100% skóre. Zároveň stanovuje průkopnický přístup k používání počítače a prohlížeče a zvládá i nejnáročnější profesionální práci s bezkonkurenční rychlostí, přesností a úsudkem. 

Model GPT‑6 Astra se dnes postupně zpřístupňuje omezenému počtu organizací a v příštích dnech bude dostupný všem uživatelům ChatGPT Plus, Pro, Business a Enterprise, stejně jako prostřednictvím rozhraní OpenAI API, Microsoft Azure a AWS Bedrock.

„V benchmarku ARC-AGI-3 překonal model Astra naši referenční úroveň efektivity lidských akcí na 96 % úrovní, čímž v benchmarku fakticky dosáhl výkonu srovnatelného s lidmi. Nejenže jde o nejlepší model, jaký jsme kdy testovali, ale představuje také významný skok ve výkonu průkopnických modelů – nejen ve schopnosti orientovat se v nových prostředích a řešit je, ale také v tom, jak efektivně se učí.“
Greg Kamradt, ARC Prize Foundation

Model Astra je náš dosud nejlépe sladěný model s výrazně lepším porozuměním záměru uživatele a chování modelu – úkoly tak můžete delegovat s větší důvěrou v úsudek Astry. Jedním ze způsobů, jak to testujeme, je nové hodnocení vycházející z incidentu Hugging Face, které zkoumá, zda model čelící obtížnému nebo neřešitelnému úkolu překročí svůj zamýšlený rozsah. Ve srovnání s modelem GPT‑5.6 Sol, který bez produkčních ochranných opatření v 48 % případů překročil oprávněný cíl, model GPT‑6 Astra tak učinil v 0 % případů.

Nejlepší model pro práci s počítačem na světě

GPT‑6 Astra představuje průkopnický nový milník v rychlosti, přesnosti a bezpečnosti při používání počítače. Dokáže se postarat o zdlouhavé úkoly, jako je vyplňování online formulářů, aktualizace záznamů o zákaznících v CRM a organizace vašeho kalendáře. Dokáže provádět online rešerše a připravovat návrhy shrnutí ve vašem e-mailu nebo v editoru dokumentů. Dokáže analyzovat vědecká data, generovat grafy, vytvořit web a spouštět kontroly QA frontendu, aby se zajistilo, že všechny funkce na tomto webu fungují. Může vám pomoci samostatně instalovat a testovat software a řešit problémy, které vidíte na obrazovce. Tato vylepšení se odrážejí také v našich špičkových výsledcích hodnocení.

Tato vylepšení také vedou k významnému zvýšení efektivity při skutečných úkolech znalostní práce. V simulacích latence v OSWorld 2.0 dosahuje model Astra vyššího výkonu při používání počítače za přibližně o 47 % kratší dobu na úkol než GPT‑5.6 Sol se skóre 72,6 % při přibližně 40 minutách na úlohu, ve srovnání s 65,7 % při přibližně 75 minutách.3

Schopnosti modelu GPT‑6 Astra při práci s počítačem se projevují ve výstupech v různých oblastech, včetně vývoje her, elektrotechniky a každodenní znalostní práce:

Vedle modelu Astra také aktualizujeme harness Codexu, abychom výrazně zvýšili rychlost používání počítače. V kombinaci s efektivitou modelu Astra to v benchmarku Mind2Web znamená 1,9× rychlejší dokončování úloh ve srovnání se současnou zkušeností s GPT‑5.6 Sol. Zlepšení rychlosti modelu znamená, že za vás dokáže převzít mnoho časově náročných každodenních úkolů a vyřídit je rychleji než vy.4

„V den uvedení na trh integrujeme GPT‑6 Astra do Devinova prostředí, kde v našem interním testovacím benchmarku dosahuje špičkových výsledků. Díky vynikající práci s počítačem, psaní a porozumění kódové základně se testování zlepšilo hned od začátku: videa lze znatelně snáze sledovat a reporty jsou jasnější a stručnější“
Silas Alberti, SVP pro výzkum, Cognition

Zásadní posun v odborné práci

GPT‑6 Astra spojuje pokroky v práci s počítačem s cíleným tréninkem pro profesionální prostředí, aby pomohl zvládat složité pracovní úkoly. Kombinuje inteligenci potřebnou k řešení složitých problémů se schopností provádět vícekrokové pracovní postupy a vytvářet propracované dokumenty, tabulky a prezentace.

Model GPT‑6 Astra je náš nejlepší model pro dodržování stávajících šablon a vytváření přehledně uspořádaných snímků, které pomocí strukturovaného vyprávění stručně předávají klíčové body. Vytváří srozumitelné, dobře strukturované dokumenty, prezentace, tabulky a analýzy, které se řídí vašimi šablonami a odpovídají vašemu stylu psaní i vizuálnímu stylu. Astra je také vytrénována tak, aby do výstupů cíleně zahrnovala pouze relevantní kontext, místo aby opakovala informace, které nejsou pro aktuální úkol nezbytné. To vše znamená, že dokáže generovat artefakty, které jsou okamžitě lépe použitelné a odpovídají kontextu vašeho podnikání a vašim standardům.

GPT‑6 Astra také přináší lepší schopnosti vizuálního posouzení při vytváření webových stránek, her, aplikací a vizualizací. S Weby⁠(otevře se v novém okně) v ChatGPT může model Astra vytvářet, hostovat a sdílet webové stránky, webové aplikace a hry přímo z promptu.

„Astra nám poskytuje významnou výhodu jak z hlediska schopností, tak efektivity. Úspěšně zvládá naše nejsložitější kreativní pracovní postupy a přitom používá až o 20 % méně tokenů než jiné modely, které jsme testovali. A co je pro naše zákazníky nejdůležitější, znamená to kvalitnější výstupy.“
Alex Mashrabov, generální ředitel a spoluzakladatel společnosti Higgsfield AI

Když pokyny ponechávají prostor pro výklad, model GPT‑6 Astra dokáže lépe než předchozí modely učinit správné rozhodnutí. Využívá kontext k doplnění běžných nedostatků a klade cílené otázky, pokud by odpověď mohla změnit výsledek. V Codexu může klást otázky asynchronně a pokračovat v práci, která nezávisí na vaší odpovědi. Pokud neodpovíte, postupuje tam, kde je to vhodné, podle rozumných předpokladů, ale u zásadních rozhodnutí počká na vaše zadání.

Níže uvedené příklady ukazují, jak model Astra spolupracuje na každodenních úlohách, kde mohou chybějící informace podstatně změnit odpověď.

Model Astra si také lépe udržuje přehled o průběhu úkolu. Dřívější modely někdy považovaly řídicí zprávy za nový cíl a ztrácely přehled o původním požadavku nebo dřívějších omezeních. Astra zohledňuje nové požadavky, na požádání mění směřování a odpovídá na doplňující otázky, aniž by ztratila ze zřetele širší úkol.

„Astra představuje výrazné zlepšení kvality oproti GPT‑5.6 Sol při řešení složitých právních úkolů. Při našem úvodním testování Astra vynikla tím, že k právním činnostem přistupovala tak, jak to dělá pečlivý právník s dobrým úsudkem: rozlišuje dokumenty od ověřených záznamů, odhaluje nepodložené předpoklady a nedostatky převádí na konkrétní východiska pro formulaci textu.“
Niko Grupen, vedoucí aplikovaného výzkumu, společnosti Harvey

Programování

GPT‑6 Astra je dosud nejlepší model pro vývoj softwaru.

1 z 2
„Model GPT‑6 Astra poskytuje špičkový výkon v našich interních benchmarcích pro kódování a ve srovnání s GPT‑5.6 Sol představuje zřetelný posun vpřed v hodnoceních intuice při obchodování. Při použití pro agentní kódování model GPT‑6 Astra komunikuje způsobem, který mohou vývojáři snáze sledovat, a vytváří kód, který k dosažení produkční kvality vyžaduje méně iterací.“
John Crepezzi, AI asistenti, Jane Street

S Astrou představujeme nový způsob, jak může Codex zachovávat a znovu vyhledávat kontext, když se kontextové okno zaplní. Modely v minulosti používaly kompakci ke shrnutí práce během dlouhých relací, například při ladění složitých problémů nebo provádění rozsáhlých refaktoringů. Při každé kompakci mohou chybět podrobnosti o tom, proč oprava selhala nebo jak se komponenta chová. V Codex může Astra uchovávat poznámky napříč kontextovými okny a zachovávat tak nahromaděné podrobnosti, aniž by je opakovaně komprimovala do jediného shrnutí. Dřívější kontextová okna zůstávají prohledávatelná, takže Astra může najít požadavky nebo výsledky testů z předchozích zpráv a výstupů nástrojů, i když tyto informace nebyly zachyceny v jejích poznámkách. Tuto experimentální funkci můžeš povolit v souboru config.toml pro Codex,⁠(otevře se v novém okně) a v nadcházejících týdnech se stane výchozím nastavením pro model Astra.

Posouváme vědecké objevy dopředu

„Příběh zní: konec jedné éry, začátek druhé.“
Greg Burnham, EpochAI

Model GPT‑6 Astra představuje významný pokrok v oblasti vědeckých objevů, matematiky a zdravotnictví. Dnes se s vámi podělíme o další dva výsledky týkající se mezer mezi prvočísly.9, 10

Astra také stanovuje nové rekordy v celé sadě matematických a vědeckých hodnocení.

Astra může pomoci s praktickými činnostmi, které stojí za vědeckými objevy. Kombinací vědeckého uvažování s používáním počítače může přímo pracovat ve specializovaném softwaru, zkoumat data a výsledky a pomáhat výzkumníkům vyhodnocovat důkazy a rozhodovat, co zkoumat dál.

Kybernetická bezpečnost

Jak jsme uvedli v naší aktualizaci bezpečnosti⁠, Astra představuje výrazný skok v kybernetických schopnostech a dosahuje kritické prahové hodnoty v oblasti kybernetické bezpečnosti podle našeho rámce připravenosti. Její schopnost identifikovat a vyvíjet zero-day exploity může obráncům pomoci nacházet a opravovat zranitelnosti, ale zároveň vytváří potřebu silnějších ochranných opatření. Abychom porozuměli rozsahu těchto schopností, podrobili jsme model Astra interním hodnocením i hodnocením externích odborníků.

Model jsme nejprve bez produkčních ochranných opatření testovali v benchmarcích ExploitBench a ExploitGym, které hodnotí, zda modely dokážou proměnit známé softwarové zranitelnosti ve funkční exploity. V benchmarku ExploitBench dosáhla Astra perfektního skóre 100 % oproti 78,5 % u GPT‑5.6 Sol, našeho předchozího průkopnického modelu se schopnostmi v kybernetické bezpečnosti. V ExploitGym dosáhl model Astra míry úspěšnosti 42,4 % oproti 30,3 % u GPT‑5.6 Sol, přičemž spotřeboval výrazně méně výstupních tokenů.13

Vzhledem k obavám, že vystavení historickým softwarovým zranitelnostem mohlo ovlivnit výsledky benchmarků, jsme model Astra vyhodnotili také na základně dvou nových benchmarků. Jednak jsme vytvořili interní vyhodnocení „ExploitBench (červen–srpen 2026)“ pro testování vývoje exploitů s využitím zranitelností z předchozích tří měsíců.14 Model Astra dosáhl výrazně vyšší úspěšnosti spuštění libovolného kódu než model GPT‑5.6 Sol na této datové sadě a použil přitom mnohem menší počet výstupních tokenů. Během vyhodnocení model Astra dokonce objevil a použil dvě dříve neznámé zranitelnosti typu zero-day. Obě zranitelnosti oznamujeme jejich správcům.

Model Astra jsme také testovali v benchmarku SRE-Bench15, který měří, zda modely dokážou zpětně analyzovat binární soubory softwaru a porozumět jeho základní logice bez přístupu k nezpracovanému zdrojovému kódu. Astra vyřešila 88,0 % úloh na jediný pokus a 99,2 % do čtyř pokusů, ve srovnání s 55,9 % a 68,7 % v případě modelu GPT‑5.6 Sol.

Nad rámec benchmarků hodnocení vedená odborníky zjistila, že pokud byl model Astra spuštěný bez produkčních ochranných mechanismů, dokázal využít dříve neznámé zranitelnosti ke spuštění libovolného kódu v zabezpečených prohlížečích a vytvářet exploity pro eskalaci oprávnění v zabezpečených operačních systémech.

Jak jsme rozebrali v The Defender’s Window, mohou průkopnické kybernetické schopnosti obráncům pomoci rychleji odhalit slabiny, zároveň však usnadňují jejich zneužití, a zvyšují tak naléhavost adaptace obránců. Dnes uváděnou verzi modelu Astra mohou obránci využít k plnění úkolů, jako jsou bezpečnostní revize kódu a záplatování.

Astra však odmítne splňovat pokročilejší úkoly v oblasti kybernetické bezpečnosti, jako je vytváření exploitů pro zranitelnosti typu proof-of-concept. Prostřednictvím OpenAI Daybreak⁠ plánujeme v nadcházejících týdnech rozšířit přístup a zavést méně omezující ochranné mechanismy. To umožní více obranných pracovních postupů, včetně ověřování zranitelností a proof-of-conceptů, analýzy malwaru a vývoje detekčních mechanismů.

Posílili jsme také naši ochranu proti možnému kybernetickému zneužití a navázali tak na soubor ochranných opatření pro GPT‑5.6 Sol. Ta zahrnují vyšší odolnost modelu, aby lépe odolával možným jailbreakům, a více kontextu pro naše monitorovací systémy. Pokračovali jsme v důkladném interním i externím testování, včetně automatizovaných hodnocení s našimi interními útočníky v rámci red-teamingu. Další podrobnosti o našich kybernetických ochranných opatřeních a testování jsou k dispozici v přehledu zabezpečení Astra⁠ a kartě systému⁠(otevře se v novém okně)..

Zodpovědné slaďování a nasazování GPT‑6 Astra

Astra je náš dosud nejlépe sladěný model. Model Astra vyniká pečlivým postupem, respektováním hranic úkolů a transparentní komunikací. Tato činnost je nejnovějším výsledkem našeho dlouhodobého výzkumného programu zaměřeného na trénování modelů, které od začátku do konce zůstávají v souladu s lidským záměrem.

V citlivých prostředích postupuje model Astra s opatrností odpovídající danému riziku. Při hodnocení úloh zaměřených na používání počítače, které byly adverzariálně vybrány tak, aby vyvolaly nežádoucí chování, byla Astra úspěšnější v předcházení nezamýšleným důsledkům. Při používání dodatečných bezpečnostních opatření poskytovaných ve výchozím nastavení bylo dosaženo ještě vyššího výkonu.

Astra způsobuje méně nesouladných výsledků než jakékoli jiné testované průkopnické modely. Pro spravedlivé porovnání jsme použili obecný harness agenta používajícího počítač (založený na nativních nástrojích pro používání počítače dostupných jak v rozhraní OpenAI Responses API⁠(otevře se v novém okně), tak v rozhraní Anthropic Messages API⁠(otevře se v novém okně)) a bez dalších ochran, které se běžně nasazují pro uživatele Codex a ChatGPT Work (automatická kontrola, zásady potvrzování).

Model Astra také s větší pravděpodobností funguje v mezích stanovených uživatelem a vyplývajících z jejího prostředí. V interním hodnocení se Astra nikdy nepokusila obejít zamítnutí automatickou kontrolou Codex. To platilo i tehdy, když byla funkce Automatická kontrola záměrně nakonfigurována tak, aby ji bylo možné obejít, a úkol jinak nebylo možné dokončit. Toto respektování omezení prostředí je v souladu s výsledky našeho hodnocení nemožných kybernetických úkolů, které jsme sdíleli v úvodu tohoto příspěvku, i s dalšími zjištěními zdokumentovanými na naší kartě systému⁠(otevře se v novém okně).

Model Astra navíc nastavuje nová měřítka v transparentní komunikaci s uživateli. V jednom hodnocení má model Astra oproti modelu GPT‑5.6 Sol třikrát nižší pravděpodobnost uvádět nepřesné informace o svých schopnostech a možnostech využití.

V našem hodnocení halucinací týkajících se schopností vykazuje Astra oproti GPT‑5.6 Sol výrazné zlepšení a uvádí méně zavádějících tvrzení o svých schopnostech.

Naše hodnocení ukázala, že písemné uvažování modelu Astra je obtížnější monitorovat než u GPT‑5.6 Sol na základě testů, které jej výslovně žádaly, aby se vyhnul monitorování. Přisuzujeme to větší kontrole modelu Astra nad písemným uvažováním při jednodušších úkolech a jeho schopnosti řešit problémy s menším počtem písemných kroků. Zdá se, že model Astra má i nadále potíže skrýt uvažování potřebné pro složité úkoly, ale tento pokles bereme vážně. Zlepšování monitorovatelnosti zůstává prioritou výzkumu a přiložená karta systému⁠(otevře se v novém okně) podrobně popisuje naše zjištění a probíhající úsilí.

Trénink zaměřený na sladění je jádrem našeho přístupu k nasazení. Jako další vrstvu ochrany také vytváříme systémová ochranná opatření, jako jsou Auto-review⁠(otevře se v novém okně) Codex a monitorování uvažování a jednání agentů, která pomáhají odhalovat a omezovat nebezpečné chování. Jak jsme popsali v naší bezpečnostní aktualizaci⁠, u modelů třídy Astra také v produkci nasazujeme monitorování nesouladu, abychom měli přehled o nesouladu a pomohli omezit jeho nejzávažnější projevy. Tato ochranná opatření se podobají našemu monitoringu interních nasazení a zahrnují systém klasifikátorů, které kontrolují uvažování a jednání modelu, zda nevykazují neoprávněné chování, a automaticky zastavují potenciálně neoprávněnou činnost.

Vzhledem k výraznému nárůstu kyberbezpečnostních schopností modelu Astra věnujeme zvláštní pozornost tomu, aby toto nasazení bylo bezpečné a zabezpečené. Dodatečné bezpečnostní kontroly mohou někdy zpomalit, pozastavit nebo zastavit legitimní činnost, včetně obranné kyberbezpečnosti. Pokud je úloha v ChatGPT nebo Codexu pozastavena, může se stát, že před pokračováním budete muset danou akci zkontrolovat. V rozhraní API se úloha zastaví. Tyto kontroly mohou někdy přerušit oprávněné činnosti a my nadále tento systém iterativně vylepšujeme, abychom omezili zbytečná přerušení. Monitoring nesladěného chování nemůže nahradit sladění: naším cílem je vytvářet modely, které se spolehlivě drží rozsahu svých oprávnění, aby tato ochranná opatření nemusela zasahovat.

Dostupnost

Model GPT‑6 Astra se dnes postupně zpřístupňuje omezenému počtu organizací a v příštích dnech bude dostupný všem uživatelům ChatGPT Plus, Pro, Business a Enterprise, stejně jako prostřednictvím rozhraní OpenAI API, Microsoft Azure a AWS Bedrock. Používání modelu Astra je součástí stávajících limitů předplatného. Uživatelé a firmy si také budou moci zakoupit kredity pro další využití. Uživatelé plánů Pro, Business a Enterprise také získají přístup k modelu GPT‑6 Astra Pro. Správci Enterprise mohou model Astru povolit pro svůj pracovní prostor; přístup je při spuštění ve výchozím nastavení vypnutý.

Model Astra podporuje nulové uchovávání dat pro zákazníky API splňující podmínky a jak jsme uvedli minulý měsíc, testujeme Soukromé zpracování bezpečnosti, abychom posílili monitorování bezpečnosti a zároveň zachovali soukromí zákazníků.

Pro vývojáře bude model GPT‑6 Astra dostupný v OpenAI API jako gpt-6-astra a prostřednictvím Microsoft Azure a Amazon Bedrock.

Standardní ceny OpenAI API jsou 10 USD za milion vstupních tokenů a 50 USD za milion výstupních tokenů. Na čtení z mezipaměti a zápisy do mezipaměti se vztahují samostatné sazby. Rychlý režim je pro model GPT‑6 Astra dostupný v API a nabízí až dvojnásobnou rychlost oproti zpracování v režimu Standard za dvojnásobnou cenu režimu Standard.

Používání počítače

Používání počítače

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Agents' Last Exam

59,3 %

53,6 %

-

48,7 %

55,5%

-

OSWorld 2.0 (v2026.08.08, offline sada, dílčí skóre)

72,6 %

65,7 %

-

-

70,2 %3

-

ScreenSpot-Pro (bez nástrojů)

92,7 %

76,9 %

-

87,3 %17

-

-

Profesionální

Profesionální

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3 %

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8%

-

Smyčcové kvartety OpenScore (1 - OMR-NED)

0,84

0,19

-

-

-

-

Interní designové úkoly

50,0 %

47,4 %

-

35,8 %

-

-

Interní úlohy datové vědy

40,9 %

30,5 %

-

34,7 %

-

-

Index inteligence Artificial Analysis v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Programování

ProgramováníGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9 %37,3 %55,8 %44,5 %52,6 %19,1 %
DeepSWE v1.174,1 %72,7 %67,4 %69,9 %73,7 %73,8 %
FrontierCode 1.1 Extended (skóre)64,5 % 860,6 %63,6 %64,9 %63,6 %56,3 %
FrontierCode 1.1 hlavní (skóre)53,3 % 847,5 %50,9 %53,5 %53,4 %43,6 %
Úlohy migrace interní databáze63,9 %42,7 %57,8 %50,3 %--
Artificial Analysis Coding Agent Index v1.467,065,1-67,268,161,2

Akademický

Akademický

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath, úroveň 4 (v2)

97,6 %

83,0 %

87,8 %

90,2%

73,2 %

-

GPQA Diamond

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

Humanity's Last Exam (s nástroji)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Věda a zdraví

Věda a zdravíGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1 %32,3 %----
MedChemBench (interní)49,3 %47,4 %----
LifeSciBench60,3 %59,9 %----
HealthBench Professional (upraveno podle délky)63,4 %60,5 %58,1 % 1160,9 % 1156,4 % 1152,1 %

Kybernetická bezpečnost

Kybernetická bezpečnostGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0 %78,5 %--70 %-
ExploitGym42,4 % 1330,3 % 1330,4 % 1728,4 %1722,0 %-
ExploitBench (červen–srpen 2026)39,0 %5,5 %----
SRE-Bench88,0 %55,9 %--12,5 %-
SEC-Bench Pro85,4 %79,1 %----

Sladění

Sladění

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Interní benchmark bezpečnosti používání počítače (čím nižší, tím lepší)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Interní benchmark bezpečnosti používání počítače s AutoReview (čím nižší, tím lepší)

1,8 %

4,3 %

-

-

-

-

Interní benchmark obcházení (čím nižší, tím lepší)

0,00 %

0,29 %

-

-

-

-

Honeypot v ExploitGym (čím nižší, tím lepší)

0,0 %

48,2 %

-

-

-

-

Nemožný ExploitGym

100,0 %

-

-

-

-

-

Interní benchmark halucinací (čím nižší, tím lepší)

4,2 %

12,2 %

-

-

-

-

Dlouhý kontext

Dlouhý kontext

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-needle 256K-512K

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8needle 512K-1M

96,3 %

73,8 %

-

-

-

-

Abstraktní uvažování

Abstraktní uvažováníGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8 %--30,2 %-
ARC-AGI-295,0 %92,5 %90,0 %89,2 %90,4 %-
ARC-AGI-198,5 %97,5 %97,5 %98,5 %97,5 %-

Hodnoticí skóre jsou maximální při jakémkoli úsilí. Hodnocení GPT byla provedena v našem výzkumném prostředí nebo prostřednictvím našeho rozhraní API, což může kvůli rozdílům v systémových promptech, dostupných nástrojích atd. v porovnání s ChatGPT v produkčním prostředí poskytovat mírně odlišné výstupy.

Poznámky pod čarou

  1. 1

    V ARC-AGI-3 byl model GPT-6 Astra spuštěn s naším harnessem pro Responses API⁠, který mění dvě nastavení, aby lépe odpovídal výkonu v reálném světě. Tyto změny nejsou konkrétně zaměřené na ARC-AGI-3.

  2. 2

    GPT-5.6 Sol označuje verzi dostupnou v našem API, ChatGPT Codex a ChatGPT Work. Verze v režimu Chat v ChatGPT se mírně liší.⁠

  3. 3

    OSWorld V2-Offline je podmnožina původního OSWorld V2, která funguje bez přístupu k internetu. Autoři reprodukovali výkon modelu Claude v OSWorld-V2 Offline na oficiálním žebříčku⁠(otevře se v novém okně). V OSWorld 2.0 skóre modelu Claude vycházejí z oficiálního nastavení, nikoli z upravených úloh a upraveného hodnocení uvedených v kartě systému Fable 5.1.

  4. 4

    Časy modelů jsou uvedené uplynulé časy pro příslušné demonstrační běhy. Zobrazené klipy jsou upravené výňatky.

  5. 5

    V BenchCAD skóre modelu Claude odráží 3 úpravy vyhodnocení, které jsou podrobně popsány v kartě systému Fable 5.1⁠(otevře se v novém okně).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon a Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(otevře se v novém okně).“ arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower a Peter Jonas. „Korpus smyčcových kvartetů OpenScore⁠(otevře se v novém okně).“ Sborník z 10. mezinárodní konference o digitálních knihovnách pro muzikologii, s. 49–57. ACM, 2023.

  8. 8

    Na FrontierCode byl model GPT-6 Astra spuštěn se zprávou pro vývojáře, která se podobala části zprávy pro vývojáře v Codexu⁠(otevře se v novém okně): "Nevytvářej nadměrné množství testovacích souborů. Nový testovací soubor vytvářej jen tehdy, když to vyžadují konvence úložiště nebo když žádný stávající soubor není vhodným místem. Vyhni se nesouvisejícím úpravám a zbytečné složitosti. Znovu použij vhodné stávající utility. Přečti si relevantní pokyny pro úložiště a prozkoumej okolní kód, testy, dokumentaci a CI. Dodržuj zavedené konvence. Cílem je čistý kód připravený ke sloučení." Prompt nebyl optimalizován pro hodnocení.

  9. 9

    První se týká toho, jak blízko u sebe se mohou prvočísla vyskytovat, bez ohledu na to, jak daleko po číselné ose postoupíte. Po více než desetiletí nejlepší známý výsledek dokazoval, že existuje nekonečně mnoho dvojic prvočísel, jejichž rozdíl je maximálně 246. Julia Stadlmann⁠(otevře se v novém okně) nedávno zlepšila tuto mez na 240. Model Astra pomohl stanovit těsnější horní mez 186, čímž ukázal, že existuje nekonečně mnoho dvojic, které jsou od sebe vzdáleny nejvýše o tuto menší vzdálenost. Krátké mezery mezi prvočísly: Důkaz⁠(otevře se v novém okně) a podpůrný výzkum⁠(otevře se v novém okně).

  10. 10

    Druhé se týká neobvykle velkých mezer mezi prvočísly. Astra v tomto ohledu výrazně zlepšila termín, který se po více než 80 let nezměnil. Sdílíme důkazy, zkrácený myšlenkový řetězec a materiály k ověření pro oba výsledky. Velké mezery mezi prvočísly: důkaz⁠(otevře se v novém okně) a podpůrný výzkum⁠(otevře se v novém okně).

  11. 11

    Všechny modely Claude jsme nezávisle vyhodnotili podle zamýšleného postupu HealthBench Professional s použitím hodnocení GPT‑5.4 a neoříznutá skóre upravená podle délky. Pro Fable 5.1 jsme kvůli odmítnutí ze strany poskytovatele použili jako záložní řešení Opus 5.

  12. 12

    Claude Fable 5 a 5.1 nejsou zahrnuty v LifeSciBench Gold v1, GeneBench Pro v13 ani MedChemBench, protože odmítají většinu otázek v těchto hodnoceních.

  13. 13

    V prostředí ExploitGym jsme testovali modely Astra a Sol bez šestihodinového časového limitu, abychom mohli lépe posoudit jejich plné kybernetické schopnosti. Jsou dostatečně rychlé, takže to má jen malý dopad.

  14. 14

    ExploitBench (červen–srpen 2026) obsahuje 20 vysoce závažných zranitelností V8 napříč 13 stabilními verzemi Chromu. Benchmark ověřuje, zda agenti dokážou dosáhnout spuštění libovolného kódu ve V8 a v oficiálních vydáních Chromu pro Linux zneužitím každé uvedené zranitelnosti. Některé zahrnuté zranitelnosti nemusí v rámci omezení daných vyhodnocením umožňovat spuštění libovolného kódu, takže 100% úspěšnost nemusí být dosažitelná. Poznámka: Skóre 5,5 % u modelu GPT-5.6 Sol je důsledkem limitu 300 tahů v benchmarku; skuteční zákazníci používající režim max by tímto omezením nebyli limitováni. Model při podobném nastavení dosáhl skóre 11,5 %, když narazil na méně limitů.

  15. 15
  16. 16

    Při testování modelů třetích stran používáme jednodušší výzkumné nastavení. Codex má složitější produkční konfiguraci, která může vést k odlišné chybovosti samotného modelu. Ochranná opatření na straně poskytovatele a implementace počítačových nástrojů se stále liší. Uživatelé se v Codexu nesetkávají se scénářem bez potvrzení, protože jde o interní výzkumnou konfiguraci.

  17. 17

    Skóre Fable pro ScreenSpot-Pro a ExploitGym, která uvádíme, pocházejí z Mythos, což je Fable s menším počtem ochranných opatření.