Nová generácia inteligencie
Aktualizácia z 22. 9. 2026: rozširujeme našu rodinu GPT‑6 o modely GPT‑6 Sol a GPT‑6 Luna. Viac informácií.
Predstavujeme GPT‑6 Astra, najinteligentnejší a najlepšie zosúladený model na svete.
GPT‑6 Astra spája roky výskumu a veľké stávky v oblasti predbežného trénovania, učenia posilňovaním a zosúlaďovania. Astra dosahuje špičkovú úroveň v používaní počítača, prehliadaní webu, softvérovom inžinierstve, kybernetickej bezpečnosti, vede a profesionálnej práci. Astra dosahuje v teste FrontierMath úrovne 4 skóre 98 % a už pomohla vyriešiť dlhodobo otvorené problémy v matematike. Astra tiež dosahuje v ARC-AGI-3 skóre 99,9 % a v ExploitBench maximálne skóre 100 %. Posúva tiež prelomové používanie počítačov a prehliadačov a zvláda aj tú najnáročnejšiu profesionálnu prácu s bezkonkurenčnou rýchlosťou, presnosťou a úsudkom.
GPT‑6 Astra dnes postupne sprístupňujeme obmedzenému počtu organizácií a v priebehu nasledujúcich dní bude dostupný pre všetkých používateľov ChatGPT Plus, Pro, Business a Enterprise, ako aj prostredníctvom rozhrania API OpenAI, Microsoft Azure a AWS Bedrock.
Astra je náš najlepšie zosúladený model s výraznými zlepšeniami v porozumení zámeru používateľa a správaní modelu – úlohy môžete delegovať s väčšou dôverou v úsudok Astry. Ako jeden zo spôsobov testovania sme vytvorili nové hodnotenie inšpirované incidentom Hugging Face, ktoré skúma, či model čeliaci náročnej alebo nemožnej úlohe prekročí svoj zamýšľaný rozsah. V porovnaní s GPT‑5.6 Sol, ktorý bez produkčných ochranných opatrení v 48 % prípadov prekročil autorizovaný cieľ, GPT‑6 Astra takto postupoval v 0 % prípadov.
Najlepší model na ovládanie počítača na svete
GPT‑6 Astra posúva hranice v rýchlosti, presnosti a bezpečnosti používania počítača. Dokáže sa postarať o zdĺhavé úlohy, ako je vypĺňanie online formulárov, aktualizácia záznamov o zákazníkoch v CRM a organizovanie vášho kalendára. Dokáže robiť online rešerše a pripravovať zhrnutia vo vašom e-maile alebo v editore dokumentov. Dokáže analyzovať vedecké údaje, generovať grafy, vytvoriť webovú stránku a spúšťať kontroly kvality frontendu, aby sa zabezpečilo, že všetky funkcie na tejto stránke fungujú. Môže vám pomôcť autonómne inštalovať a testovať softvér a riešiť problémy, ktoré vidíš na obrazovke. Tieto vylepšenia sa odrážajú aj v našich špičkových výsledkoch hodnotenia.
Tieto zlepšenia tiež vedú k výraznému zvýšeniu efektivity pri reálnych úlohách znalostnej práce. V simuláciách latencie na OSWorld 2.0 dosahuje Astra vyšší výkon pri používaní počítača za približne o 47 % kratší čas na úlohu než GPT‑5.6 Sol so skóre 72,6 % pri približne 40 minútach na úlohu v porovnaní so 65,7 % pri približne 75 minútach.3
Schopnosti GPT‑6 Astra pri používaní počítača možno vidieť vo výstupoch v rôznych oblastiach vrátane vývoja hier, elektrotechniky a každodennej znalostnej práce:
Popri Astre aktualizujeme aj Codex harness, aby sme výrazne zlepšili rýchlosť používania počítača. V kombinácii s efektivitou Astry to v benchmarku Mind2Web znamená 1,9× rýchlejšie dokončenie úloh v porovnaní so súčasným používaním GPT‑5.6 Sol. Zlepšenia v rýchlosti modelu znamenajú, že za teba dokáže vykonať množstvo časovo náročných každodenných úloh rýchlejšie, než by si ich vykonal ty.4
Skoková zmena v odbornej práci
GPT‑6 Astra spája pokroky v používaní počítača s cieleným trénovaním pre profesionálne prostredia, aby pomohol zvládať komplexné pracovné úlohy. Kombinuje inteligenciu potrebnú na riešenie komplexných problémov so schopnosťou vykonávať viacstupňové pracovné postupy a vytvárať uhladené dokumenty, tabuľky a prezentácie.
GPT‑6 Astra je náš najlepší model na dodržiavanie existujúcich šablón a vytváranie prezentácií s premysleným rozložením, ktoré stručne sprostredkúvajú kľúčové body v rámci štruktúrovaného príbehu. Vytvára prehľadné, dobre štruktúrované dokumenty, prezentácie, tabuľky a analýzy, ktoré sa riadia tvojimi šablónami a zodpovedajú tvojmu štýlu písania aj vizuálnemu štýlu. Astra je tiež trénovaná tak, aby do výstupov cielene zahŕňala iba relevantný kontext, namiesto opakovania informácií, ktoré nie sú potrebné pre aktuálnu úlohu. To všetko znamená, že dokáže generovať artefakty, ktoré sú použiteľnejšie hneď po vytvorení a zodpovedajú tvojmu obchodnému kontextu a štandardom.
GPT‑6 Astra prináša aj lepší vizuálny úsudok pri tvorbe webových stránok, hier, aplikácií a renderov. S Webmi(otvorí sa v novom okne) v ChatGPT dokáže Astra vytvárať, hostovať a zdieľať webové stránky, webové aplikácie a hry priamo z príkazu.
Keď pokyny poskytujú priestor na interpretáciu, GPT‑6 Astra je pri správnom rozhodovaní lepší než predchádzajúce modely. Využíva kontext na doplnenie bežných chýbajúcich informácií a kladie cielené otázky, keď by odpoveď mohla ovplyvniť výsledok. V Codexe môže klásť otázky asynchrónne a zároveň pokračovať v práci, ktorá nezávisí od tvojej odpovede. Ak neodpovieš, podľa potreby pokračuje s rozumnými predpokladmi, ale pri rozhodnutiach s významnými dôsledkami počká na tvoj vstup.
Nižšie uvedené príklady ukazujú, ako Astra spolupracuje pri bežných úlohách, pri ktorých môžu chýbajúce informácie podstatne zmeniť odpoveď.
Astra si tiež lepšie udržiava prehľad o tom, ako sa úloha vyvíja. Skoršie modely niekedy považovali usmerňovacie správy za nový cieľ a strácali zo zreteľa pôvodnú požiadavku alebo skoršie obmedzenia. Astra zapracúva nové požiadavky, na požiadanie zmení smerovanie a odpovedá na doplňujúce otázky bez toho, aby stratila zo zreteľa celkovú úlohu.
Programovanie
GPT‑6 Astra je doteraz najlepší model pre softvérové inžinierstvo.
„GPT‑6 Astra poskytuje špičkový výkon v našich interných benchmarkoch programovania a v hodnoteniach intuície pri obchodovaní predstavuje v porovnaní s GPT‑5.6 Sol jasný krok vpred. Pri použití na agentické programovanie GPT‑6 Astra komunikuje spôsobom, ktorý vývojári ľahšie sledujú, a vytvára kód, ktorý si na dosiahnutie produkčnej kvality vyžaduje menej iterácií.“
„Testovali sme Astru pri nízkej, strednej a vysokej úrovni úsilia v jednom z našich hodnotení prvej generácie a výrazne prekonala GPT 5.6 Sol.“ Vyššia úroveň úsilia prináša viac iterácií pri novom zostavení, viac overovania prostredníctvom testovania v prehliadači a väčší sklon k vykonávaniu kódu namiesto apply-patch. Pochopenie toho, ako model vynakladá svoje úsilie, nám umožňuje poskytnúť miliónom tvorcov rýchlejšiu a spoľahlivejšiu cestu od nápadu k fungujúcej aplikácii.“
S Astrou predstavujeme nový spôsob, ako môže Codex zachovávať a získavať kontext, keď sa kontextové okno zaplní. Modely v minulosti používali kompakciu na sumarizáciu práce počas dlhých relácií, napríklad pri ladení zložitých problémov alebo riešení rozsiahlych refaktorov. Každá kompakcia môže vynechať podrobnosti o tom, prečo oprava zlyhala alebo ako sa komponent správa. V Codex môže Astra uchovávať poznámky naprieč kontextovými oknami, pričom zachováva nahromadené podrobnosti bez ich opakovaného komprimovania do jediného súhrnu. Predchádzajúce kontextové okná zostávajú prehľadávateľné, takže Astra môže nájsť požiadavky alebo výsledky testov z predchádzajúcich správ a výstupov nástrojov – aj keď tieto informácie neboli zachytené v jej poznámkach. Túto experimentálnu funkciu môžeš povoliť vo svojom súbore config.toml pre Codex,(otvorí sa v novom okne) a v najbližších týždňoch sa stane predvolenou pre Astru.
Posúvanie vedeckého objavovania vpred
Astra môže pomôcť s praktickou prácou, ktorá stojí za vedeckými objavmi. Kombináciou vedeckého uvažovania s používaním počítača môže pracovať priamo v špecializovanom softvéri, skúmať údaje a výsledky, a tak výskumníkom pomôcť posúdiť dôkazy a rozhodnúť sa, čo skúmať ďalej.
Kybernetická bezpečnosť
Ako sme rozobrali v našej aktualizácii o bezpečnosti, Astra predstavuje významný posun v kybernetických schopnostiach a podľa nášho Rámca pripravenosti spĺňa kritický prah v oblasti kybernetickej bezpečnosti. Schopnosť identifikovať a vyvíjať zero-day exploity môže obrancom pomôcť nájsť a opraviť zraniteľnosti, no zároveň vytvára potrebu silnejších ochranných opatrení. Aby sme pochopili, kam až tieto schopnosti siahajú, podrobili sme Astru interným odborným hodnoteniam aj odborným hodnoteniam tretích strán.
Najprv sme model bez produkčných bezpečnostných opatrení testovali v benchmarkoch ExploitBench a ExploitGym, ktoré hodnotia, či modely dokážu premeniť známe softvérové zraniteľnosti na funkčné exploity. V benchmarku ExploitBench dosiahla Astra perfektné skóre 100 % v porovnaní so skóre 78,5 % modelu GPT‑5.6 Sol, nášho predchádzajúceho prelomového modelu so schopnosťami v kybernetickej bezpečnosti. V benchmarku ExploitGym dosiahla Astra mieru úspešnosti 42,4 % v porovnaní s 30,3 % pri modeli GPT‑5.6 Sol, pričom použila podstatne menej výstupných tokenov.13
Vzhľadom na obavy, že vystavenie historickým softvérovým zraniteľnostiam mohlo ovplyvniť výsledky benchmarkov, sme Astru vyhodnotili aj na dvoch nových benchmarkoch. Po prvé sme vytvorili interné hodnotenie „ExploitBench (jún – august 2026)“ na testovanie vývoja exploitov s použitím zraniteľností z predchádzajúcich troch mesiacov.14 Astra dosiahla podstatne Vysokú mieru spustenia ľubovoľného kódu než GPT‑5.6 Sol v tomto súbore údajov, pričom použil omnoho menej výstupných tokenov. Počas hodnotenia Astra dokonca objavila a použila dve dovtedy neznáme zraniteľnosti typu zero-day. Obe zraniteľnosti oznamujeme ich správcom.
Astru sme testovali aj v benchmarku SRE-Bench15, ktorý meria, či modely dokážu spätne analyzovať binárne súbory softvéru, aby pochopili jeho základnú logiku bez prístupu k nespracovanému zdrojovému kódu. Astra vyriešila 88,0 % úloh na jeden pokus a 99,2 % do štyroch pokusov v porovnaní s 55,9 % a 68,7 % v prípade GPT‑5.6 Sol, v uvedenom poradí.
Okrem benchmarkov expertné hodnotenia zistili, že Astra pri spustení bez produkčných bezpečnostných opatrení dokázala využiť predtým neznáme zraniteľnosti na spustenie ľubovoľného kódu v zabezpečených prehliadačoch a na vytvorenie exploitov na eskaláciu oprávnení pre zabezpečené operačné systémy.
Ako sme rozobrali v článku Okno obrancu, prelomové kybernetické schopnosti môžu obrancom pomôcť rýchlejšie nájsť slabiny, ale zároveň uľahčujú ich zneužitie, čo zvyšuje naliehavosť prispôsobenia sa obrancov. Dnes uvádzanú verziu Astra môžu obrancovia používať na plnenie úloh, ako sú bezpečnostná kontrola kódu a aplikovanie záplat.
Astra však odmietne vykonávať pokročilejšie úlohy v oblasti kybernetickej bezpečnosti, ako je vytváranie exploitov typu proof-of-concept pre zraniteľnosti. Prostredníctvom OpenAI Daybreak plánujeme v nasledujúcich týždňoch rozšíriť prístup a zaviesť menej obmedzujúce ochranné opatrenia. Umožní to viac obranných pracovných postupov vrátane validácie zraniteľností a proof-of-conceptov, analýzy malvéru a tvorby detekčných mechanizmov.
Posilnili sme aj našu ochranu pred možným kybernetickým zneužitím, pričom nadväzujeme na náš súbor ochranných opatrení pre GPT‑5.6 Sol. Patrí sem vyššia odolnosť modelu, aby lepšie odolával možným jailbreakom, a viac kontextu pre naše monitorovacie systémy. Pokračovali sme v dôkladnom internom a externom testovaní vrátane automatizovaných hodnotení s našimi internými útočníkmi v rámci red-teamingu. Ďalšie podrobnosti o našich kybernetických ochranných opatreniach a testovaní sú k dispozícii v prehľade bezpečnosti a systémovej karte(otvorí sa v novom okne) Astra.
Zodpovedné zosúlaďovanie a nasadzovanie GPT‑6 Astra
Astra je náš najviac zosúladený model. Astra vyniká starostlivým prístupom, rešpektovaním hraníc úloh a transparentnou komunikáciou. Táto práca je najnovším výsledkom nášho dlhodobého výskumného programu zameraného na trénovanie modelov, ktoré zostávajú zosúladené s ľudským zámerom od začiatku až do konca.
V citlivých prostrediach Astra postupuje s opatrnosťou primeranou riziku. Pri hodnotení úloh práce s počítačom, ktoré boli adverzárne vybrané tak, aby vyvolali nežiaduce správanie, bola Astra úspešnejšia v predchádzaní nezamýšľaným dôsledkom. Spustenie s ďalšími štandardne ponúkanými bezpečnostnými opatreniami prinieslo ešte vyšší výkon.
Astra spôsobuje menej nezosúladených výsledkov než ktorýkoľvek iný testovaný prelomový model. Na férové porovnanie sme použili generický harness agenta používania počítača (založený na natívnych nástrojoch na používanie počítača dostupných v oboch rozhraniach OpenAI Responses API(otvorí sa v novom okne) a Anthropic Messages API(otvorí sa v novom okne)) a bez dodatočných ochrán, ktoré sa bežne nasadzujú pre používateľov služieb Codex a ChatGPT Work (automatická kontrola, politika potvrdzovania).
Astra tiež s väčšou pravdepodobnosťou funguje v rámci hraníc stanovených používateľom a vyplývajúcich z jej prostredia. V internom hodnotení sa Astra nikdy nepokúsila obísť zamietnutie automatickou kontrolou Codex. Platilo to aj vtedy, keď bola funkcia Automatická kontrola zámerne nakonfigurovaná tak, aby sa dala obísť, a úlohu inak nebolo možné dokončiť. Toto rešpektovanie obmedzení prostredia je v súlade s výsledkami nášho hodnotenia nemožných kybernetických úloh, ktoré sme zdieľali v úvode tohto príspevku, aj s ďalšími zisteniami zdokumentovanými v našej systémovej karte(otvorí sa v novom okne).
Astra navyše stanovuje nové štandardy v transparentnej komunikácii s používateľmi. V jednom hodnotení je Astra trikrát menej pravdepodobná než GPT‑5.6 Sol nepresne prezentovať svoje schopnosti a možnosti.
V našom hodnotení halucinácií o schopnostiach Astra vykazuje výrazné zlepšenie oproti GPT‑5.6 Sol a uvádza menej zavádzajúcich tvrdení o svojich schopnostiach.
Naše hodnotenia ukázali, že písané uvažovanie Astry sa monitoruje ťažšie než u GPT‑5.6 Solove, na základe testov, ktoré ho výslovne žiadali, aby sa vyhol monitorovaniu. Pripisujeme to väčšej kontrole Astry nad písaným uvažovaním pri jednoduchších úlohách a schopnosti riešiť problémy s menším počtom písaných krokov. Zdá sa, že Astra má stále problém skryť uvažovanie potrebné pre komplexné úlohy, no toto zhoršenie berieme vážne. Zlepšovanie monitorovateľnosti zostáva prioritou výskumu a priložená systémová karta(otvorí sa v novom okne) podrobne opisuje naše zistenia a prebiehajúcu prácu.
Tréning zameraný na zosúladenie je základom nášho prístupu k nasadeniu. Ako ďalšiu vrstvu obrany tiež vytvárame systémové ochranné opatrenia, ako sú Codex automatické posudzovanie(otvorí sa v novom okne) a monitorovanie uvažovania a konania agentov, ktoré pomáhajú odhaľovať a obmedzovať nebezpečné správanie. Ako sme uviedli v našej bezpečnostnej aktualizácii, pri modeloch triedy Astra nasadzujeme do produkcie aj monitorovanie nezosúladenia, aby sme mali prehľad o nezosúladení a pomohli obmedziť jeho najhoršie prípady. Tieto ochranné opatrenia sa podobajú nášmu monitorovaniu interných nasadení a zahŕňajú systém klasifikátorov, ktoré kontrolujú uvažovanie a konanie modelu, vyhľadávajú neoprávnené správanie a automaticky zastavujú potenciálne neoprávnenú činnosť.
Vzhľadom na výrazný nárast kybernetických schopností Astry venujeme mimoriadnu pozornosť tomu, aby bolo toto nasadenie bezpečné a zabezpečené. Dodatočné bezpečnostné kontroly môžu niekedy spomaliť, pozastaviť alebo zastaviť legitímnu prácu vrátane obrannej kybernetickej bezpečnosti. Ak je úloha v ChatGPT alebo Codex pozastavená, pred pokračovaním môžete byť vyzvaní, aby ste danú akciu skontrolovali. V rozhraní API sa úloha zastaví. Tieto kontroly môžu niekedy prerušiť legitímnu prácu a naďalej tento systém vylepšujeme, aby sme znížili počet zbytočných prerušení. Monitorovanie nezosúladenia nemôže nahradiť zosúladenie: naším cieľom je vytvárať modely, ktoré spoľahlivo zostávajú v rámci rozsahu, na ktorý majú oprávnenie, aby tieto ochranné opatrenia nemuseli zasiahnuť.
Dostupnosť
GPT‑6 Astra dnes postupne sprístupňujeme obmedzenému počtu organizácií a v priebehu nasledujúcich dní bude dostupný pre všetkých používateľov ChatGPT Plus, Pro, Business a Enterprise, ako aj prostredníctvom rozhrania API OpenAI, Microsoft Azure a AWS Bedrock. Používanie Astry je zahrnuté v existujúcich limitoch predplatného. Používatelia a firmy si budú môcť zakúpiť aj kredity na dodatočné používanie. Používatelia plánov Pro, Business a Enterprise získajú aj prístup k GPT‑6 Astra Pro. Správcovia Enterprise môžu povoliť Astru pre svoj pracovný priestor. Prístup je pri spustení predvolene vypnutý.
Astra podporuje nulové uchovávanie údajov pre oprávnených zákazníkov API a ako sme uviedli minulý mesiac, testujeme súkromné spracovanie bezpečnosti s cieľom posilniť monitorovanie bezpečnosti a zároveň zachovať súkromie zákazníkov.
Vývojárom bude GPT‑6 Astra k dispozícii v rozhraní OpenAI API ako gpt-6-astra a prostredníctvom služieb Microsoft Azure a Amazon Bedrock.
Štandardné ceny rozhrania OpenAI API sú 10 USD za milión vstupných tokenov a 50 USD za milión výstupných tokenov. Na čítanie z vyrovnávacej pamäte a zápis do nej sa vzťahujú samostatné sadzby. Rýchly režim je pre GPT‑6 Astra k dispozícii v rozhraní API a poskytuje až dvojnásobnú rýchlosť oproti štandardnému spracovaniu za dvojnásobok štandardnej ceny.
Používanie počítača
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3% | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
OpenScore sláčikové kvartetá (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Interné dizajnové úlohy | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Interné úlohy dátovej vedy | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Index inteligencie Artificial Analysis v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programovanie
| Programovanie | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (skóre) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (skóre) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Úlohy migrácie internej databázy | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Index kódovacích agentov Artificial Analysis v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Akademický
Akademický | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath úroveň 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 90,2 % | 73,2 % | - |
GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,7 % | 95,3 % |
Posledná skúška ľudstva (s nástrojmi) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Kybernetická bezpečnosť
Zosúladenie
Zosúladenie | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Interný bezpečnostný referenčný test používania počítača (nižšia hodnota je lepšia) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Interný bezpečnostný benchmark používania počítača s AutoReview (nižšia hodnota je lepšia) | 1,8 % | 4,3 % | - | - | - | - |
Interný benchmark obchádzania (nižšia hodnota je lepšia) | 0,00 % | 0,29 % | - | - | - | - |
Honeypot ExploitGym (nižšia hodnota je lepšia) | 0,0 % | 48,2 % | - | - | - | - |
Nemožný ExploitGym | 100,0 % | - | - | - | - | - |
Interný benchmark halucinácií (nižší je lepší) | 4,2 % | 12,2 % | - | - | - | - |
Dlhý kontext
Dlhý kontext | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8 ihiel 256 tis.–512 tis. | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8 ihiel 512 tis.–1 mil. | 96,3 % | 73,8 % | - | - | - | - |
Abstraktné myslenie
| Abstraktné uvažovanie | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9 % 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Skóre hodnotenia dosahuje maximum pri akomkoľvek úsilí. Hodnotenia GPT boli spustené v našom výskumnom prostredí alebo prostredníctvom nášho API, čo môže viesť k mierne odlišnému výstupu oproti produkčnému ChatGPT v dôsledku rozdielov v systémových príkazoch, dostupných nástrojoch atď.
Poznámky pod čiarou
- 1
V teste ARC-AGI-3 bol GPT-6 Astra spustený s naším harnessom pre Responses API, ktorý mení dve nastavenia, aby lepšie zodpovedali výkonu v reálnom svete. Tieto zmeny nie sú špecificky zamerané na ARC-AGI-3.
- 2
GPT-5.6 Sol označuje verziu dostupnú v našom API, ChatGPT Codex a ChatGPT Work. Verzia v ChatGPT Chat je mierne odlišná.
- 3
OSWorld V2-Offline je podmnožina pôvodného OSWorld V2, ktorá funguje bez prístupu na internet. Výkon modelu Claude v teste OSWorld-V2 Offline reprodukovali autori v oficiálnom rebríčku(otvorí sa v novom okne). V teste OSWorld 2.0 sa pri skóre pre Claude používajú oficiálne nastavenia, a nie upravené úlohy a upravené hodnotenie zo systémovej karty Fable 5.1.
- 4
- 5
V BenchCAD skóre Claudea odráža 3 úpravy hodnotenia, ktoré sú podrobne opísané v systémovej karte Fable 5.1(otvorí sa v novom okne).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon a Noah A. Smith. „LEGATO: veľkoškálový end-to-end zovšeobecniteľný prístup k OMR pre sadzený notový zápis(otvorí sa v novom okne).“ arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower a Peter Jonas. „Korpus sláčikových kvartet OpenScore(otvorí sa v novom okne).“ Zborník z 10. medzinárodnej konferencie o digitálnych knižniciach pre muzikológiu, s. 49–57. ACM, 2023.
- 8
Na FrontierCode bol GPT-6 Astra spustený s vývojárskou správou podobnou časti jeho vývojárskej správy v Codexe(otvorí sa v novom okne): "Vyhýbaj sa vytváraniu nadmerného počtu testovacích súborov. Vytvor nový testovací súbor len vtedy, keď to vyžadujú konvencie repozitára alebo keď žiadny existujúci súbor nie je vhodným miestom. Vyhni sa nesúvisiacemu upratovaniu a zbytočnej zložitosti. Opätovne použi vhodné existujúce utility. Prečítaj si relevantné pokyny repozitára a preskúmaj okolitý kód, testy, dokumentáciu a CI. Dodržiavaj zavedené konvencie. Cieľom je čistý kód vhodný na zlúčenie." Príkaz nebol optimalizovaný na hodnotenie.
- 9
Prvý sa týka toho, ako blízko pri sebe sa môžu vyskytovať prvočísla, nech sa po číselnej osi dostanete akokoľvek ďaleko. Viac ako desaťročie bolo najlepším známym výsledkom tvrdenie, že existuje nekonečne veľa dvojíc prvočísel, ktorých rozdiel je najviac 246. Julia Stadlmann(otvorí sa v novom okne) nedávno zlepšila túto hranicu na 240. Astra pomohla stanoviť prísnejšiu hranicu 186, čím ukázala, že nekonečne veľa párov sa vyskytuje v rámci tejto menšej vzdialenosti. Krátke medzery medzi prvočíslami: dôkaz(otvorí sa v novom okne) a podporný výskum(otvorí sa v novom okne).
- 10
Druhý sa týka nezvyčajne veľkých medzier medzi prvočíslami. Astra vylepšila člen v hranici pre tieto medzery, ktorý zostával nezmenený viac než 80 rokov. Zdieľame dôkazy, skrátené reťazenie myšlienok a materiály na overenie pre oba výsledky. Veľké medzery medzi prvočíslami: dôkaz(otvorí sa v novom okne) a podporný výskum(otvorí sa v novom okne).
- 11
- 12
- 13
- 14
ExploitBench (jún – august 2026) obsahuje 20 zraniteľností V8 s vysokou závažnosťou v rámci 13 stabilných verzií Chromu. Benchmark testuje, či agenti dokážu dosiahnuť spustenie ľubovoľného kódu vo V8 a v oficiálnych vydaniach prehliadača Chrome pre Linux zneužitím každej uvedenej zraniteľnosti. Niektoré zahrnuté zraniteľnosti nemusia v rámci obmedzení hodnotenia umožňovať spustenie ľubovoľného kódu, takže 100 % miera úspešnosti nemusí byť dosiahnuteľná. Poznámka: skóre 5,5 % modelu GPT-5.6 Sol je artefaktom limitu 300 krokov v benchmarku, ktorý nie je limitom, aký by mali skutoční zákazníci používajúci režim Maximálna. Model pri podobných nastaveniach dosiahol skóre 11,5 % pri narazení na menší počet limitov.
- 15
Jeremy Spence a kol. „Ďalšia výzva pre agentickú kyberbezpečnosť: realistický benchmark reverzného inžinierstva bez kontaminácie(otvorí sa v novom okne).“ arXiv:2608.11469v1, 2026.
- 16
Keď testujeme modely tretích strán, používame jednoduchšie výskumné nastavenie. Codex má komplexnejšiu produkčnú konfiguráciu, čo môže viesť k odlišnej chybovosti základného modelu. Ochranné opatrenia na strane poskytovateľa a implementácie nástrojov na prácu s počítačom sa stále líšia. Používatelia sa v Codex nestretnú so scenárom bez potvrdenia, keďže ide o internú výskumnú konfiguráciu.
- 17
