OpenAI

GPT-6 Astra: A new generation of intelligence

Nová generácia inteligencie

Aktualizácia z 22. 9. 2026: rozširujeme našu rodinu GPT‑6 o modely GPT‑6 Sol a GPT‑6 Luna. Viac informácií.

Predstavujeme GPT‑6 Astra, najinteligentnejší a najlepšie zosúladený model na svete.

GPT‑6 Astra spája roky výskumu a veľké stávky v oblasti predbežného trénovania, učenia posilňovaním a zosúlaďovania. Astra dosahuje špičkovú úroveň v používaní počítača, prehliadaní webu, softvérovom inžinierstve, kybernetickej bezpečnosti, vede a profesionálnej práci. Astra dosahuje v teste FrontierMath úrovne 4 skóre 98 % a už pomohla vyriešiť dlhodobo otvorené problémy⁠ v matematike. Astra tiež dosahuje v ARC-AGI-3 skóre 99,9 % a v ExploitBench maximálne skóre 100 %. Posúva tiež prelomové používanie počítačov a prehliadačov a zvláda aj tú najnáročnejšiu profesionálnu prácu s bezkonkurenčnou rýchlosťou, presnosťou a úsudkom. 

GPT‑6 Astra dnes postupne sprístupňujeme obmedzenému počtu organizácií a v priebehu nasledujúcich dní bude dostupný pre všetkých používateľov ChatGPT Plus, Pro, Business a Enterprise, ako aj prostredníctvom rozhrania API OpenAI, Microsoft Azure a AWS Bedrock.

„V ARC-AGI-3 Astra prekonala našu referenčnú úroveň efektivity ľudských činností v 96 % úrovní, čím na tomto benchmarku fakticky dosiahla úroveň ľudského výkonu. Nie je to len najlepší model, aký sme kedy testovali, ale zároveň predstavuje významný posun vo výkone prelomových modelov – nielen v schopnosti orientovať sa v nových prostrediach a riešiť ich, ale aj v tom, ako efektívne sa to dokáže naučiť.“
Greg Kamradt, ARC Prize Foundation

Astra je náš najlepšie zosúladený model s výraznými zlepšeniami v porozumení zámeru používateľa a správaní modelu – úlohy môžete delegovať s väčšou dôverou v úsudok Astry. Ako jeden zo spôsobov testovania sme vytvorili nové hodnotenie inšpirované incidentom Hugging Face, ktoré skúma, či model čeliaci náročnej alebo nemožnej úlohe prekročí svoj zamýšľaný rozsah. V porovnaní s GPT‑5.6 Sol, ktorý bez produkčných ochranných opatrení v 48 % prípadov prekročil autorizovaný cieľ, GPT‑6 Astra takto postupoval v 0 % prípadov.

Najlepší model na ovládanie počítača na svete

GPT‑6 Astra posúva hranice v rýchlosti, presnosti a bezpečnosti používania počítača. Dokáže sa postarať o zdĺhavé úlohy, ako je vypĺňanie online formulárov, aktualizácia záznamov o zákazníkoch v CRM a organizovanie vášho kalendára. Dokáže robiť online rešerše a pripravovať zhrnutia vo vašom e-maile alebo v editore dokumentov. Dokáže analyzovať vedecké údaje, generovať grafy, vytvoriť webovú stránku a spúšťať kontroly kvality frontendu, aby sa zabezpečilo, že všetky funkcie na tejto stránke fungujú. Môže vám pomôcť autonómne inštalovať a testovať softvér a riešiť problémy, ktoré vidíš na obrazovke. Tieto vylepšenia sa odrážajú aj v našich špičkových výsledkoch hodnotenia.

Tieto zlepšenia tiež vedú k výraznému zvýšeniu efektivity pri reálnych úlohách znalostnej práce. V simuláciách latencie na OSWorld 2.0 dosahuje Astra vyšší výkon pri používaní počítača za približne o 47 % kratší čas na úlohu než GPT‑5.6 Sol so skóre 72,6 % pri približne 40 minútach na úlohu v porovnaní so 65,7 % pri približne 75 minútach.3

Schopnosti GPT‑6 Astra pri používaní počítača možno vidieť vo výstupoch v rôznych oblastiach vrátane vývoja hier, elektrotechniky a každodennej znalostnej práce:

Popri Astre aktualizujeme aj Codex harness, aby sme výrazne zlepšili rýchlosť používania počítača. V kombinácii s efektivitou Astry to v benchmarku Mind2Web znamená 1,9× rýchlejšie dokončenie úloh v porovnaní so súčasným používaním GPT‑5.6 Sol. Zlepšenia v rýchlosti modelu znamenajú, že za teba dokáže vykonať množstvo časovo náročných každodenných úloh rýchlejšie, než by si ich vykonal ty.4

„V deň uvedenia integrujeme GPT‑6 Astra do Devinovho harnessu, kde dosahuje špičkový výkon v našom internom testovacom benchmarku. Jeho vynikajúca práca s počítačom, písanie a porozumenie kódovej základni zlepšili testovanie hneď od začiatku: videá sa sledujú výrazne ľahšie a reporty sú jasnejšie a stručnejšie”
Silas Alberti, senior viceprezident pre výskum (SVP), Cognition

Skoková zmena v odbornej práci

GPT‑6 Astra spája pokroky v používaní počítača s cieleným trénovaním pre profesionálne prostredia, aby pomohol zvládať komplexné pracovné úlohy. Kombinuje inteligenciu potrebnú na riešenie komplexných problémov so schopnosťou vykonávať viacstupňové pracovné postupy a vytvárať uhladené dokumenty, tabuľky a prezentácie.

GPT‑6 Astra je náš najlepší model na dodržiavanie existujúcich šablón a vytváranie prezentácií s premysleným rozložením, ktoré stručne sprostredkúvajú kľúčové body v rámci štruktúrovaného príbehu. Vytvára prehľadné, dobre štruktúrované dokumenty, prezentácie, tabuľky a analýzy, ktoré sa riadia tvojimi šablónami a zodpovedajú tvojmu štýlu písania aj vizuálnemu štýlu. Astra je tiež trénovaná tak, aby do výstupov cielene zahŕňala iba relevantný kontext, namiesto opakovania informácií, ktoré nie sú potrebné pre aktuálnu úlohu. To všetko znamená, že dokáže generovať artefakty, ktoré sú použiteľnejšie hneď po vytvorení a zodpovedajú tvojmu obchodnému kontextu a štandardom.

GPT‑6 Astra prináša aj lepší vizuálny úsudok pri tvorbe webových stránok, hier, aplikácií a renderov. S Webmi⁠(otvorí sa v novom okne) v ChatGPT dokáže Astra vytvárať, hostovať a zdieľať webové stránky, webové aplikácie a hry priamo z príkazu.

„Astra nám poskytuje výraznú výhodu v schopnostiach aj efektívnosti. Úspešne vykonáva naše najkomplexnejšie kreatívne pracovné postupy a pritom používa až o 20 % menej tokenov než iné modely, ktoré sme testovali. A čo je najdôležitejšie, pre našich zákazníkov to znamená kvalitnejšie výstupy.“
Alex Mashrabov, generálny riaditeľ a spoluzakladateľ spoločnosti Higgsfield AI

Keď pokyny poskytujú priestor na interpretáciu, GPT‑6 Astra je pri správnom rozhodovaní lepší než predchádzajúce modely. Využíva kontext na doplnenie bežných chýbajúcich informácií a kladie cielené otázky, keď by odpoveď mohla ovplyvniť výsledok. V Codexe môže klásť otázky asynchrónne a zároveň pokračovať v práci, ktorá nezávisí od tvojej odpovede. Ak neodpovieš, podľa potreby pokračuje s rozumnými predpokladmi, ale pri rozhodnutiach s významnými dôsledkami počká na tvoj vstup.

Nižšie uvedené príklady ukazujú, ako Astra spolupracuje pri bežných úlohách, pri ktorých môžu chýbajúce informácie podstatne zmeniť odpoveď.

Astra si tiež lepšie udržiava prehľad o tom, ako sa úloha vyvíja. Skoršie modely niekedy považovali usmerňovacie správy za nový cieľ a strácali zo zreteľa pôvodnú požiadavku alebo skoršie obmedzenia. Astra zapracúva nové požiadavky, na požiadanie zmení smerovanie a odpovedá na doplňujúce otázky bez toho, aby stratila zo zreteľa celkovú úlohu.

„Astra predstavuje výrazné zlepšenie kvality oproti GPT‑5.6 Sol pri komplexných právnych úlohách. Pri našom počiatočnom testovaní Astra vynikla tým, že k právnej práci pristupuje tak, ako dôsledný právnik: rozlišuje dokumenty od ustálených záznamov, odhaľuje nepodložené predpoklady a premieňa medzery na konkrétne východiská pre formuláciu návrhu.”
Niko Grupen, vedúci aplikovaného výskumu, Harvey

Programovanie

GPT‑6 Astra je doteraz najlepší model pre softvérové inžinierstvo.

1 z 2
„GPT‑6 Astra poskytuje špičkový výkon v našich interných benchmarkoch programovania a v hodnoteniach intuície pri obchodovaní predstavuje v porovnaní s GPT‑5.6 Sol jasný krok vpred. Pri použití na agentické programovanie GPT‑6 Astra komunikuje spôsobom, ktorý vývojári ľahšie sledujú, a vytvára kód, ktorý si na dosiahnutie produkčnej kvality vyžaduje menej iterácií.“
John Crepezzi, AI asistenti, Jane Street

S Astrou predstavujeme nový spôsob, ako môže Codex zachovávať a získavať kontext, keď sa kontextové okno zaplní. Modely v minulosti používali kompakciu na sumarizáciu práce počas dlhých relácií, napríklad pri ladení zložitých problémov alebo riešení rozsiahlych refaktorov. Každá kompakcia môže vynechať podrobnosti o tom, prečo oprava zlyhala alebo ako sa komponent správa. V Codex môže Astra uchovávať poznámky naprieč kontextovými oknami, pričom zachováva nahromadené podrobnosti bez ich opakovaného komprimovania do jediného súhrnu. Predchádzajúce kontextové okná zostávajú prehľadávateľné, takže Astra môže nájsť požiadavky alebo výsledky testov z predchádzajúcich správ a výstupov nástrojov – aj keď tieto informácie neboli zachytené v jej poznámkach. Túto experimentálnu funkciu môžeš povoliť vo svojom súbore config.toml pre Codex,⁠(otvorí sa v novom okne) a v najbližších týždňoch sa stane predvolenou pre Astru.

Posúvanie vedeckého objavovania vpred

„Ide o príbeh konca jednej éry a začiatku ďalšej.“
Greg Burnham, EpochAI

GPT‑6 Astra predstavuje významný pokrok pre vedecké objavy, matematiku a zdravotníctvo. Dnes prinášame dva ďalšie výsledky o medzerách medzi prvočíslami.9 a 10

Astra tiež dosahuje nové rekordy v sérii matematických a vedeckých hodnotení.

Astra môže pomôcť s praktickou prácou, ktorá stojí za vedeckými objavmi. Kombináciou vedeckého uvažovania s používaním počítača môže pracovať priamo v špecializovanom softvéri, skúmať údaje a výsledky, a tak výskumníkom pomôcť posúdiť dôkazy a rozhodnúť sa, čo skúmať ďalej.

Kybernetická bezpečnosť

Ako sme rozobrali v našej aktualizácii o⁠ bezpečnosti, Astra predstavuje významný posun v kybernetických schopnostiach a podľa nášho Rámca pripravenosti spĺňa kritický prah v oblasti kybernetickej bezpečnosti. Schopnosť identifikovať a vyvíjať zero-day exploity môže obrancom pomôcť nájsť a opraviť zraniteľnosti, no zároveň vytvára potrebu silnejších ochranných opatrení. Aby sme pochopili, kam až tieto schopnosti siahajú, podrobili sme Astru interným odborným hodnoteniam aj odborným hodnoteniam tretích strán.

Najprv sme model bez produkčných bezpečnostných opatrení testovali v benchmarkoch ExploitBench a ExploitGym, ktoré hodnotia, či modely dokážu premeniť známe softvérové zraniteľnosti na funkčné exploity. V benchmarku ExploitBench dosiahla Astra perfektné skóre 100 % v porovnaní so skóre 78,5 % modelu GPT‑5.6 Sol, nášho predchádzajúceho prelomového modelu so schopnosťami v kybernetickej bezpečnosti. V benchmarku ExploitGym dosiahla Astra mieru úspešnosti 42,4 % v porovnaní s 30,3 % pri modeli GPT‑5.6 Sol, pričom použila podstatne menej výstupných tokenov.13

Vzhľadom na obavy, že vystavenie historickým softvérovým zraniteľnostiam mohlo ovplyvniť výsledky benchmarkov, sme Astru vyhodnotili aj na dvoch nových benchmarkoch. Po prvé sme vytvorili interné hodnotenie „ExploitBench (jún – august 2026)“ na testovanie vývoja exploitov s použitím zraniteľností z predchádzajúcich troch mesiacov.14 Astra dosiahla podstatne Vysokú mieru spustenia ľubovoľného kódu než GPT‑5.6 Sol v tomto súbore údajov, pričom použil omnoho menej výstupných tokenov. Počas hodnotenia Astra dokonca objavila a použila dve dovtedy neznáme zraniteľnosti typu zero-day. Obe zraniteľnosti oznamujeme ich správcom.

Astru sme testovali aj v benchmarku SRE-Bench15, ktorý meria, či modely dokážu spätne analyzovať binárne súbory softvéru, aby pochopili jeho základnú logiku bez prístupu k nespracovanému zdrojovému kódu. Astra vyriešila 88,0 % úloh na jeden pokus a 99,2 % do štyroch pokusov v porovnaní s 55,9 % a 68,7 % v prípade GPT‑5.6 Sol, v uvedenom poradí.

Okrem benchmarkov expertné hodnotenia zistili, že Astra pri spustení bez produkčných bezpečnostných opatrení dokázala využiť predtým neznáme zraniteľnosti na spustenie ľubovoľného kódu v zabezpečených prehliadačoch a na vytvorenie exploitov na eskaláciu oprávnení pre zabezpečené operačné systémy.

Ako sme rozobrali v článku Okno obrancu, prelomové kybernetické schopnosti môžu obrancom pomôcť rýchlejšie nájsť slabiny, ale zároveň uľahčujú ich zneužitie, čo zvyšuje naliehavosť prispôsobenia sa obrancov. Dnes uvádzanú verziu Astra môžu obrancovia používať na plnenie úloh, ako sú bezpečnostná kontrola kódu a aplikovanie záplat.

Astra však odmietne vykonávať pokročilejšie úlohy v oblasti kybernetickej bezpečnosti, ako je vytváranie exploitov typu proof-of-concept pre zraniteľnosti. Prostredníctvom OpenAI Daybreak⁠ plánujeme v nasledujúcich týždňoch rozšíriť prístup a zaviesť menej obmedzujúce ochranné opatrenia. Umožní to viac obranných pracovných postupov vrátane validácie zraniteľností a proof-of-conceptov, analýzy malvéru a tvorby detekčných mechanizmov.

Posilnili sme aj našu ochranu pred možným kybernetickým zneužitím, pričom nadväzujeme na náš súbor ochranných opatrení pre GPT‑5.6 Sol. Patrí sem vyššia odolnosť modelu, aby lepšie odolával možným jailbreakom, a viac kontextu pre naše monitorovacie systémy. Pokračovali sme v dôkladnom internom a externom testovaní vrátane automatizovaných hodnotení s našimi internými útočníkmi v rámci red-teamingu. Ďalšie podrobnosti o našich kybernetických ochranných opatreniach a testovaní sú k dispozícii v prehľade bezpečnosti⁠ a systémovej karte⁠(otvorí sa v novom okne) Astra.

Zodpovedné zosúlaďovanie a nasadzovanie GPT‑6 Astra

Astra je náš najviac zosúladený model. Astra vyniká starostlivým prístupom, rešpektovaním hraníc úloh a transparentnou komunikáciou. Táto práca je najnovším výsledkom nášho dlhodobého výskumného programu zameraného na trénovanie modelov, ktoré zostávajú zosúladené s ľudským zámerom od začiatku až do konca.

V citlivých prostrediach Astra postupuje s opatrnosťou primeranou riziku. Pri hodnotení úloh práce s počítačom, ktoré boli adverzárne vybrané tak, aby vyvolali nežiaduce správanie, bola Astra úspešnejšia v predchádzaní nezamýšľaným dôsledkom. Spustenie s ďalšími štandardne ponúkanými bezpečnostnými opatreniami prinieslo ešte vyšší výkon.

Astra spôsobuje menej nezosúladených výsledkov než ktorýkoľvek iný testovaný prelomový model. Na férové porovnanie sme použili generický harness agenta používania počítača (založený na natívnych nástrojoch na používanie počítača dostupných v oboch rozhraniach OpenAI Responses API⁠(otvorí sa v novom okne) a Anthropic Messages API⁠(otvorí sa v novom okne)) a bez dodatočných ochrán, ktoré sa bežne nasadzujú pre používateľov služieb Codex a ChatGPT Work (automatická kontrola, politika potvrdzovania).

Astra tiež s väčšou pravdepodobnosťou funguje v rámci hraníc stanovených používateľom a vyplývajúcich z jej prostredia. V internom hodnotení sa Astra nikdy nepokúsila obísť zamietnutie automatickou kontrolou Codex. Platilo to aj vtedy, keď bola funkcia Automatická kontrola zámerne nakonfigurovaná tak, aby sa dala obísť, a úlohu inak nebolo možné dokončiť. Toto rešpektovanie obmedzení prostredia je v súlade s výsledkami nášho hodnotenia nemožných kybernetických úloh, ktoré sme zdieľali v úvode tohto príspevku, aj s ďalšími zisteniami zdokumentovanými v našej systémovej karte⁠(otvorí sa v novom okne).

Astra navyše stanovuje nové štandardy v transparentnej komunikácii s používateľmi. V jednom hodnotení je Astra trikrát menej pravdepodobná než GPT‑5.6 Sol nepresne prezentovať svoje schopnosti a možnosti.

V našom hodnotení halucinácií o schopnostiach Astra vykazuje výrazné zlepšenie oproti GPT‑5.6 Sol a uvádza menej zavádzajúcich tvrdení o svojich schopnostiach.

Naše hodnotenia ukázali, že písané uvažovanie Astry sa monitoruje ťažšie než u GPT‑5.6 Solove, na základe testov, ktoré ho výslovne žiadali, aby sa vyhol monitorovaniu. Pripisujeme to väčšej kontrole Astry nad písaným uvažovaním pri jednoduchších úlohách a schopnosti riešiť problémy s menším počtom písaných krokov. Zdá sa, že Astra má stále problém skryť uvažovanie potrebné pre komplexné úlohy, no toto zhoršenie berieme vážne. Zlepšovanie monitorovateľnosti zostáva prioritou výskumu a priložená systémová karta⁠(otvorí sa v novom okne) podrobne opisuje naše zistenia a prebiehajúcu prácu.

Tréning zameraný na zosúladenie je základom nášho prístupu k nasadeniu. Ako ďalšiu vrstvu obrany tiež vytvárame systémové ochranné opatrenia, ako sú Codex automatické posudzovanie⁠(otvorí sa v novom okne) a monitorovanie uvažovania a konania agentov, ktoré pomáhajú odhaľovať a obmedzovať nebezpečné správanie. Ako sme uviedli v našej bezpečnostnej aktualizácii⁠, pri modeloch triedy Astra nasadzujeme do produkcie aj monitorovanie nezosúladenia, aby sme mali prehľad o nezosúladení a pomohli obmedziť jeho najhoršie prípady. Tieto ochranné opatrenia sa podobajú nášmu monitorovaniu interných nasadení a zahŕňajú systém klasifikátorov, ktoré kontrolujú uvažovanie a konanie modelu, vyhľadávajú neoprávnené správanie a automaticky zastavujú potenciálne neoprávnenú činnosť.

Vzhľadom na výrazný nárast kybernetických schopností Astry venujeme mimoriadnu pozornosť tomu, aby bolo toto nasadenie bezpečné a zabezpečené. Dodatočné bezpečnostné kontroly môžu niekedy spomaliť, pozastaviť alebo zastaviť legitímnu prácu vrátane obrannej kybernetickej bezpečnosti. Ak je úloha v ChatGPT alebo Codex pozastavená, pred pokračovaním môžete byť vyzvaní, aby ste danú akciu skontrolovali. V rozhraní API sa úloha zastaví. Tieto kontroly môžu niekedy prerušiť legitímnu prácu a naďalej tento systém vylepšujeme, aby sme znížili počet zbytočných prerušení. Monitorovanie nezosúladenia nemôže nahradiť zosúladenie: naším cieľom je vytvárať modely, ktoré spoľahlivo zostávajú v rámci rozsahu, na ktorý majú oprávnenie, aby tieto ochranné opatrenia nemuseli zasiahnuť.

Dostupnosť

GPT‑6 Astra dnes postupne sprístupňujeme obmedzenému počtu organizácií a v priebehu nasledujúcich dní bude dostupný pre všetkých používateľov ChatGPT Plus, Pro, Business a Enterprise, ako aj prostredníctvom rozhrania API OpenAI, Microsoft Azure a AWS Bedrock. Používanie Astry je zahrnuté v existujúcich limitoch predplatného. Používatelia a firmy si budú môcť zakúpiť aj kredity na dodatočné používanie. Používatelia plánov Pro, Business a Enterprise získajú aj prístup k GPT‑6 Astra Pro. Správcovia Enterprise môžu povoliť Astru pre svoj pracovný priestor. Prístup je pri spustení predvolene vypnutý.

Astra podporuje nulové uchovávanie údajov pre oprávnených zákazníkov API a ako sme uviedli minulý mesiac, testujeme súkromné spracovanie bezpečnosti s cieľom posilniť monitorovanie bezpečnosti a zároveň zachovať súkromie zákazníkov.

Vývojárom bude GPT‑6 Astra k dispozícii v rozhraní OpenAI API ako gpt-6-astra a prostredníctvom služieb Microsoft Azure a Amazon Bedrock.

Štandardné ceny rozhrania OpenAI API sú 10 USD za milión vstupných tokenov a 50 USD za milión výstupných tokenov. Na čítanie z vyrovnávacej pamäte a zápis do nej sa vzťahujú samostatné sadzby. Rýchly režim je pre GPT‑6 Astra k dispozícii v rozhraní API a poskytuje až dvojnásobnú rýchlosť oproti štandardnému spracovaniu za dvojnásobok štandardnej ceny.

Používanie počítača

Používanie počítača

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Posledná skúška agentov

59,3 %

53,6 %

-

48,7 %

55,5 %

-

OSWorld 2.0 (v2026.08.08, offline sada, čiastočné skóre)

72,6 %

65,7 %

-

-

70,2 %3

-

ScreenSpot-Pro (bez nástrojov)

92,7 %

76,9 %

-

87,3 %17

-

-

Professional

Professional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31,4 %

17,4 %

26,9 %

-

BenchCAD

95,9 %

83,3%

84,3 % 5

67,5 % 5

82,1 % 5

-

BrowseComp

91,5 %

90,4 %

-

87,4 %

90,8 %

-

OpenScore sláčikové kvartetá (1 - OMR-NED)

0,84

0,19

-

-

-

-

Interné dizajnové úlohy

50,0 %

47,4 %

-

35,8 %

-

-

Interné úlohy dátovej vedy

40,9 %

30,5 %

-

34,7 %

-

-

Index inteligencie Artificial Analysis v4.1.1

61,2

60,9

65,7

62,1

63,1

58,7

Programovanie

ProgramovanieGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%73,8%
FrontierCode 1.1 Extended (skóre)64,5% 860,6%63,6%64,9%63,6%56,3%
FrontierCode 1.1 Main (skóre)53,3% 847,5%50,9%53,5%53,4%43,6%
Úlohy migrácie internej databázy63,9%42,7%57,8%50,3%--
Index kódovacích agentov Artificial Analysis v1.467,065,1-67,268,161,2

Akademický

Akademický

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64,6 %

22,4 %

52,6 %

21,4 %

30,0 %

-

FrontierMath úroveň 4 (v2)

97,6 %

83,0 %

87,8 %

90,2 %

73,2 %

-

GPQA Diamond

96,0 %

94,6 %

93,7 %

92,6 %

93,7 %

95,3 %

Posledná skúška ľudstva (s nástrojmi)

57,2 %

-

65,0 %

63,8 %

63,6 %

-

Veda a zdravie

Veda a ChatGPT HealthGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37,1%32,3%----
MedChemBench (interné)49,3%47,4%----
LifeSciBench60,3%59,9%----
HealthBench Professional (upravené podľa dĺžky)63,4%60,5%58,1% 1160,9% 1156,4% 1152,1%

Kybernetická bezpečnosť

Kybernetická bezpečnosťGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100,0%78,5%--70 %-
ExploitGym42,4% 1330,3% 1330,4% 1728,4%1722,0%-
ExploitBench (jún – aug. 2026)39,0%5,5%----
SRE-Bench88,0%55,9%--12,5%-
SEC-Bench Pro85,4%79,1%----

Zosúladenie

Zosúladenie

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Interný bezpečnostný referenčný test používania počítača (nižšia hodnota je lepšia)

2,4 %

22,0 %

9,5 %

18,3 %

11,5 %

-

Interný bezpečnostný benchmark používania počítača s AutoReview (nižšia hodnota je lepšia)

1,8 %

4,3 %

-

-

-

-

Interný benchmark obchádzania (nižšia hodnota je lepšia)

0,00 %

0,29 %

-

-

-

-

Honeypot ExploitGym (nižšia hodnota je lepšia)

0,0 %

48,2 %

-

-

-

-

Nemožný ExploitGym

100,0 %

-

-

-

-

-

Interný benchmark halucinácií (nižší je lepší)

4,2 %

12,2 %

-

-

-

-

Dlhý kontext

Dlhý kontext

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8 ihiel 256 tis.–512 tis.

100,0 %

91,5 %

-

-

-

-

OpenAI MRCR v2 8 ihiel 512 tis.–1 mil.

96,3 %

73,8 %

-

-

-

-

Abstraktné myslenie

Abstraktné uvažovanieGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-AGI-399,9 % 17,8%--30,2%-
ARC-AGI-295,0%92,5%90,0%89,2%90,4%-
ARC-AGI-198,5%97,5%97,5%98,5%97,5%-

Skóre hodnotenia dosahuje maximum pri akomkoľvek úsilí. Hodnotenia GPT boli spustené v našom výskumnom prostredí alebo prostredníctvom nášho API, čo môže viesť k mierne odlišnému výstupu oproti produkčnému ChatGPT v dôsledku rozdielov v systémových príkazoch, dostupných nástrojoch atď.

Poznámky pod čiarou

  1. 1

    V teste ARC-AGI-3 bol GPT-6 Astra spustený s naším harnessom pre Responses API⁠, ktorý mení dve nastavenia, aby lepšie zodpovedali výkonu v reálnom svete. Tieto zmeny nie sú špecificky zamerané na ARC-AGI-3.

  2. 2

    GPT-5.6 Sol označuje verziu dostupnú v našom API, ChatGPT Codex a ChatGPT Work. Verzia v ChatGPT Chat je mierne odlišná.⁠

  3. 3

    OSWorld V2-Offline je podmnožina pôvodného OSWorld V2, ktorá funguje bez prístupu na internet. Výkon modelu Claude v teste OSWorld-V2 Offline reprodukovali autori v oficiálnom rebríčku⁠(otvorí sa v novom okne). V teste OSWorld 2.0 sa pri skóre pre Claude používajú oficiálne nastavenia, a nie upravené úlohy a upravené hodnotenie zo systémovej karty Fable 5.1.

  4. 4

    Časy modelu predstavujú uvádzané časy trvania príslušných demonštračných spustení. Zobrazené klipy sú upravené výňatky.

  5. 5

    V BenchCAD skóre Claudea odráža 3 úpravy hodnotenia, ktoré sú podrobne opísané v systémovej karte Fable 5.1⁠(otvorí sa v novom okne).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon a Noah A. Smith. „LEGATO: veľkoškálový end-to-end zovšeobecniteľný prístup k OMR pre sadzený notový zápis⁠(otvorí sa v novom okne).“ arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower a Peter Jonas. „Korpus sláčikových kvartet OpenScore⁠(otvorí sa v novom okne).“ Zborník z 10. medzinárodnej konferencie o digitálnych knižniciach pre muzikológiu, s. 49–57. ACM, 2023.

  8. 8

    Na FrontierCode bol GPT-6 Astra spustený s vývojárskou správou podobnou časti jeho vývojárskej správy v Codexe⁠(otvorí sa v novom okne): "Vyhýbaj sa vytváraniu nadmerného počtu testovacích súborov. Vytvor nový testovací súbor len vtedy, keď to vyžadujú konvencie repozitára alebo keď žiadny existujúci súbor nie je vhodným miestom. Vyhni sa nesúvisiacemu upratovaniu a zbytočnej zložitosti. Opätovne použi vhodné existujúce utility. Prečítaj si relevantné pokyny repozitára a preskúmaj okolitý kód, testy, dokumentáciu a CI. Dodržiavaj zavedené konvencie. Cieľom je čistý kód vhodný na zlúčenie." Príkaz nebol optimalizovaný na hodnotenie.

  9. 9

    Prvý sa týka toho, ako blízko pri sebe sa môžu vyskytovať prvočísla, nech sa po číselnej osi dostanete akokoľvek ďaleko. Viac ako desaťročie bolo najlepším známym výsledkom tvrdenie, že existuje nekonečne veľa dvojíc prvočísel, ktorých rozdiel je najviac 246. Julia Stadlmann⁠(otvorí sa v novom okne) nedávno zlepšila túto hranicu na 240. Astra pomohla stanoviť prísnejšiu hranicu 186, čím ukázala, že nekonečne veľa párov sa vyskytuje v rámci tejto menšej vzdialenosti. Krátke medzery medzi prvočíslami: dôkaz⁠(otvorí sa v novom okne) a podporný výskum⁠(otvorí sa v novom okne).

  10. 10

    Druhý sa týka nezvyčajne veľkých medzier medzi prvočíslami. Astra vylepšila člen v hranici pre tieto medzery, ktorý zostával nezmenený viac než 80 rokov. Zdieľame dôkazy, skrátené reťazenie myšlienok a materiály na overenie pre oba výsledky. Veľké medzery medzi prvočíslami: dôkaz⁠(otvorí sa v novom okne) a podporný výskum⁠(otvorí sa v novom okne).

  11. 11

    Nezávisle sme vyhodnotili všetky modely Claude podľa zamýšľaného postupu HealthBench Professional s použitím GPT‑5.4 hodnotenie a skóre upravené podľa dĺžky bez orezania. Pre Fable 5.1 sme pri odmietnutiach poskytovateľa použili Opus 5 ako záložné riešenie.

  12. 12

    Claude Fable 5 a 5.1 nie sú zahrnuté v hodnoteniach LifeSciBench Gold v1, GeneBench Pro v13 a MedChemBench, pretože odmietajú väčšinu otázok v týchto hodnoteniach.

  13. 13

    Na platforme ExploitGym sme testovali systémy Astra a Sol bez 6-hodinového časového limitu, aby sme lepšie posúdili ich plné kybernetické schopnosti. Sú dostatočne rýchle, takže to má len malý vplyv.

  14. 14

    ExploitBench (jún – august 2026) obsahuje 20 zraniteľností V8 s vysokou závažnosťou v rámci 13 stabilných verzií Chromu. Benchmark testuje, či agenti dokážu dosiahnuť spustenie ľubovoľného kódu vo V8 a v oficiálnych vydaniach prehliadača Chrome pre Linux zneužitím každej uvedenej zraniteľnosti. Niektoré zahrnuté zraniteľnosti nemusia v rámci obmedzení hodnotenia umožňovať spustenie ľubovoľného kódu, takže 100 % miera úspešnosti nemusí byť dosiahnuteľná. Poznámka: skóre 5,5 % modelu GPT-5.6 Sol je artefaktom limitu 300 krokov v benchmarku, ktorý nie je limitom, aký by mali skutoční zákazníci používajúci režim Maximálna. Model pri podobných nastaveniach dosiahol skóre 11,5 % pri narazení na menší počet limitov.

  15. 15
  16. 16

    Keď testujeme modely tretích strán, používame jednoduchšie výskumné nastavenie. Codex má komplexnejšiu produkčnú konfiguráciu, čo môže viesť k odlišnej chybovosti základného modelu. Ochranné opatrenia na strane poskytovateľa a implementácie nástrojov na prácu s počítačom sa stále líšia. Používatelia sa v Codex nestretnú so scenárom bez potvrdenia, keďže ide o internú výskumnú konfiguráciu.

  17. 17

    V prípade ScreenSpot-Pro a ExploitGym pochádzajú uvádzané skóre Fable z Mythos, čo je Fable s menším počtom bezpečnostných opatrení.