Preskočiť na hlavný obsah
OpenAI

26. júna 2026

ProduktVydanie

Ukážka GPT‑5.6 Sol: model novej generácie

Načítava sa…

Začíname obmedzenú ukážku série GPT‑5.6: Sol, náš vlajkový model; Terra, vyvážený model na každodennú prácu; a Luna, rýchly a cenovo dostupný model. Terra dosahuje konkurencieschopný výkon v porovnaní s GPT‑5.5, pričom je 2× lacnejšia, a Luna prináša silné schopnosti za naše najnižšie náklady.

GPT‑5.6 Sol prichádza s naším doteraz najrobustnejším bezpečnostným stackom. Posilnili sme ochranu pre činnosti s vyšším rizikom, citlivé kybernetické požiadavky a opakované zneužívanie a niekoľko týždňov sme hľadali slabiny, záťažovo testovali náš systém a spevňovali ho proti útokom z reálneho sveta.

Veríme v široký prístup a plánujeme GPT‑5.6 Sol, Terra a Luna všeobecne sprístupniť v najbližších týždňoch. V rámci našej priebežnej spolupráce s vládou USA sme pred dnešným uvedením predstavili naše plány a schopnosti modelov. Na jej žiadosť začíname obmedzenou ukážkou pre malú skupinu dôveryhodných partnerov, ktorých účasť bola oznámená vláde, a až potom pristúpime k širšiemu vydaniu. Počas tejto ukážky budeme pokračovať v testovaní a úzkej koordinácii s partnermi, kým budeme pracovať na širšej dostupnosti. Nemyslíme si, že tento druh procesu prístupu vlády by sa mal stať dlhodobým štandardom. Zadržiava najlepšie nástroje pred používateľmi, vývojármi, podnikmi, kybernetickými obrancami a globálnymi partnermi, ktorí ich potrebujú. Tento krátkodobý krok robíme preto, že ho považujeme za najsilnejšiu cestu k širšej dostupnosti v najbližších týždňoch, zatiaľ čo s administratívou pracujeme na rámci kybernetického výkonného nariadenia a opakovateľnom procese pre budúce vydania modelov.

Schopnosti

GPT‑5.6 Sol je náš doteraz najsilnejší model. Ako ukážku výkonu modelu zdieľame súbor vyhodnotení, ktoré zdôrazňujú zlepšené agentické schopnosti v programovaní, biológii a kybernetickej bezpečnosti; ďalšie bezpečnostné vyhodnotenia a vyhodnotenia pripravenosti sú dostupné v našej systémovej karte(otvorí sa v novom okne). Rozšírený súbor výsledkov vyhodnotení zverejníme, keď model sprístupníme širokej verejnosti.

S GPT‑5.6 zavádzame novú úroveň uvažovania `max`, aby mal Sol čo najviac času na hlboké uvažovanie. Okrem toho zavádzame nový režim `ultra`, ktorý presahuje schopnosti jedného agenta tým, že využíva subagentov na zrýchlenie komplexnej práce.

V pracovných postupoch programovania GPT‑5.6 Sol stanovuje nový špičkový štandard v Terminal‑Bench 2.1, ktorý testuje pracovné postupy v príkazovom riadku vyžadujúce plánovanie, iteráciu a koordináciu nástrojov.

GPT‑5.6 Sol tiež vykazuje rozsiahle zlepšenia v biologických pracovných postupoch. V GeneBench v1, ktorý vyhodnocuje dlhodobé genomické analýzy a analýzy kvantitatívnej biológie, dosahuje silnejšie výsledky než GPT‑5.5 a zároveň používa menej tokenov.

GPT‑5.6 Sol je náš doteraz najschopnejší model pre kybernetickú bezpečnosť. Posúva hranicu medzi výkonom a efektívnosťou pri dlhodobých bezpečnostných úlohách vrátane výskumu zraniteľností a exploitácie. V ExploitBench² je GPT‑5.6 Sol konkurencieschopný s Mythos Preview, pričom používa iba približne 1/3 výstupných tokenov. V ExploitGym(otvorí sa v novom okne)3, benchmarku vytvorenom výskumníkmi z UC Berkeley v spolupráci s OpenAI a ďalšími frontier laboratóriami, vykazujú modely GPT‑5.6 Sol, Terra a Luna výrazné zlepšenia kybernetických schopností so zvyšujúcou sa úrovňou uvažovania.

Silnejšie kybernetické schopnosti so silnejšími ochrannými opatreniami

GPT‑5.6 Sol, Terra a Luna sme vyvinuli s našimi doteraz najrobustnejšími ochrannými opatreniami, pričom konfigurácie sú prispôsobené schopnostiam jednotlivých modelov. Ako sa model stáva schopnejším, navrhujeme ochranné opatrenia tak, aby čoraz lepšie odolávali reálnemu nepriateľskému tlaku a zároveň zachovali prístup k legitímnej práci, ako je kontrola kódu, výskum zraniteľností, vývoj záplat, ladenie, bezpečnostné vzdelávanie a defenzívne testovanie. Naším cieľom je sťažiť zakázanú ofenzívnu činnosť, urobiť ju neistejšou a ľahšie odhaliteľnou bez zbytočného obmedzovania týchto prospešných použití. Na základe nášho posúdenia modelu a ochranných opatrení očakávame výrazný prínos pre legitímnu defenzívnu prácu a zároveň významné obmedzenie zakázaného ofenzívneho použitia.

GPT‑5.6 Sol lepšie pomáha ľuďom hľadať a opravovať zraniteľnosti, než spoľahlivo vykonávať útoky od začiatku do konca. Keďže tieto schopnosti sa ďalej rozvíjajú, našou prioritou je zabezpečiť, aby sa dostali k obrancom a priniesli im úžitok, aby mohli tieto nástroje používať na hľadanie slabín, vývoj záplat a širšie posilňovanie systémov.

GPT‑5.6 Sol neprekračuje prah Cyber Critical podľa nášho Preparedness Framework. Vo vyhodnoteniach zahŕňajúcich Chromium a Firefox identifikoval chyby a exploitačné primitíva — stavebné prvky exploitu — no za testovaných podmienok autonómne nevytvoril funkčný full-chain exploit. Prahy benchmarkov však nedokážu zachytiť každý spôsob, akým sa model môže použiť alebo skombinovať s inými nástrojmi. Práve táto neistota spolu so širším skokovým posunom schopností modelu je dôvodom, prečo zvýšené schopnosti modelu spájame so silnejšími ochrannými opatreniami a fázovaným vydaním. Viac podrobností o našich ochranných opatreniach zdieľame v systémovej karte k ukážke GPT‑5.6(otvorí sa v novom okne).

Vrstvený stack ochranných opatrení

Proti odhodlanému alebo prispôsobivému zneužívaniu nestačí žiadne jednotlivé ochranné opatrenie. V celej ukážke GPT‑5.6 používame vrstvené ochranné opatrenia, ktorých presné konfigurácie sa medzi modelmi líšia, a záťažovo ich testujeme na útoky z reálneho sveta. Patria sem ochrany natrénované do modelu, kontroly v reálnom čase počas generovania, signály na úrovni účtu, diferencovaný prístup, monitorovanie, vynucovanie pravidiel a pokračujúce testovanie.

GPT‑5.6 je natrénovaný tak, aby odmietal zakázanú kybernetickú asistenciu, a to aj vtedy, keď sa používatelia snažia zamaskovať svoj zámer alebo model jailbreaknúť. Tieto ochranné opatrenia na úrovni modelu vytvárajú prvú hranicu toho, s čím by model mal a nemal pomáhať.

Klasifikátory zneužitia v oblasti kybernetiky a biológie v reálnom čase poskytujú ďalšiu vrstvu tým, že vyhodnocujú výstup počas jeho generovania. V prípadoch s vyšším rizikom sa pri zistení možného porušenia môže generovanie pozastaviť, kým väčší uvažovací model skontroluje konverzáciu a jej kontext. Ak sa výstup vyhodnotí ako nepovolený, zadrží sa skôr, než sa dostane k používateľovi.

Označená aktivita môže spustiť aj kontrolu na úrovni účtu naprieč relevantnými konverzáciami a rizikovými signálmi v súlade s našimi podmienkami a zásadami týkajúcimi sa uchovávania a kontroly obsahu. Pohľad nad rámec jednej konverzácie pomáha našim systémom odlíšiť pretrvávajúce škodlivé správanie od legitímnej dvojúčelovej bezpečnostnej práce, pri ktorej sa podobné technické koncepty môžu objavovať vo veľmi odlišných kontextoch.

Spoločne tieto vrstvy robia celkový prístup robustnejším než ktorékoľvek jednotlivé ochranné opatrenie samostatne. Správanie modelu znižuje pravdepodobnosť škodlivých odpovedí, systémy v reálnom čase môžu zasiahnuť počas generovania, kontrola na úrovni účtu dokáže identifikovať širšie vzorce a diferencovaný prístup zachováva dôležitú defenzívnu prácu bez toho, aby sa najcitlivejšie schopnosti predvolene široko sprístupnili.

Najmä počas ukážky sa používatelia môžu stretnúť s ochrannými opatreniami, ktoré niektoré požiadavky zablokujú alebo odmietnu. Iné požiadavky môžu trvať dlhšie, pretože generovanie sa pozastaví na dodatočnú kontrolu. Ochranné opatrenia môžu občas zasiahnuť aj pri legitímnej práci, najmä v dvojúčelových oblastiach, kde defenzívna a ofenzívna činnosť môžu spočiatku vyzerať podobne.

Aj to má táto ukážka otestovať. Chceme pochopiť nielen to, či ochranné opatrenia obmedzujú zneužívanie, ale aj to, či legitímni používatelia dokážu naďalej spoľahlivo a efektívne dokončovať bežnú prácu. Spätná väzba počas ukážky nám pomôže znížiť počet zbytočných blokovaní a oneskorení, zlepšiť spôsob, akým ochranné opatrenia interpretujú kontext, a vytvoriť plynulejšie prostredie pred širším vydaním.

S podnikovými zákazníkmi pracujeme aj na dlhodobejších prístupoch — vrátane detekcie chrániacej súkromie, bezpečnostných kontrol prevádzkovaných zákazníkom a prístupu kalibrovaného podľa rizika zákazníka, používateľa alebo pracovnej záťaže — aby sme zvyšovali bezpečnosť a zároveň podporovali požiadavky podnikov na súkromie.

Zvyšovanie robustnosti pomocou automatizovaného red-teamingu

Ochranné opatrenia musia zostať účinné aj vtedy, keď útočníci prispôsobujú svoju taktiku. Ochrana, ktorá funguje iba proti pevnej množine známych útokov, nie je pre frontier model dostatočne robustná.

Preto do bezpečnosti vkladáme viac inteligencie a výpočtového výkonu než kedykoľvek predtým a využívame vlastné modely na rýchlejšie hľadanie slabín a zlepšovanie ochranných opatrení. Na automatizovaný red-teaming zameraný na hľadanie univerzálnych jailbreakov sme vyčlenili viac než 700 000 GPU hodín v ekvivalente A100: útokov, ktoré môžu fungovať naprieč mnohými príkazmi alebo kontextmi, nielen v jednom úzkom nastavení. Zameranie na tieto ťažšie a všeobecnejšie útoky nám umožnilo testovať ochranné opatrenia nad rámec pevnej množiny známych zlyhaní. Zároveň nám umožňuje preskúmať oveľa viac vzorcov útokov, než by pokrylo samotné ľudské testovanie, skôr identifikovať vzorce zlyhaní a skrátiť cestu od nájdenia slabiny k jej odstráneniu.

Popri automatizovanom red-teamingu sme spolupracovali s externými testermi na rozsiahlych odborných ľudských red-teamingových testoch, ktoré budú pokračovať aj počas obdobia ukážky. Ľudský red-teaming dopĺňa automatizovanú prácu tým, že testuje ochranné opatrenia proti kreatívnym expertom, ktorí sa snažia model zneužiť spôsobmi, ktoré naše systémy nemusia predvídať.

Žiadne vyhodnotenie nedokáže obsiahnuť každú konfiguráciu produktu, viacstupňový útok ani pracovný postup z reálneho sveta. Preto udržiavame proces rýchlej reakcie, v rámci ktorého novoobjavené jailbreaky reprodukujeme, posudzujeme, prioritizujeme a odstraňujeme, a následne ich pridávame do našich priebežných vyhodnotení, aby sme v budúcnosti vedeli testovať podobné zlyhania.

Dostupnosť a ceny

Počas ukážky budú modely GPT‑5.6 spočiatku dostupné cez API a Codex pre vybranú skupinu dôveryhodných partnerov a organizácií. Plánujeme ich čoskoro sprístupniť širšiemu okruhu ľudí používajúcich ChatGPT, Codex a API.

V tomto novom systéme pomenovania zavedenom s GPT‑5.6 číslo označuje generáciu modelu, zatiaľ čo Sol, Terra a Luna označujú trvalé úrovne schopností, ktoré sa môžu vyvíjať vlastným tempom. Celá rodina tak ľuďom aj vývojárom poskytuje jasnejší výber podľa inteligencie, rýchlosti a nákladov.

Cena GPT‑5.6 sa účtuje za 1 milión tokenov v troch veľkostiach modelu: Sol stojí 5 USD za vstup / 30 USD za výstup; Terra 2,50 USD za vstup / 15 USD za výstup; a Luna 1 USD za vstup / 6 USD za výstup. GPT‑5.6 tiež prináša predvídateľnejšie ukladanie príkazov do vyrovnávacej pamäte vrátane podpory explicitných bodov prerušenia cache a minimálnej životnosti cache 30 minút. Pri GPT‑5.6 a novších modeloch sa zápisy do cache účtujú sadzbou 1,25× oproti sadzbe modelu za neukladaný vstup, zatiaľ čo čítania z cache naďalej využívajú 90 % zľavu na cachovaný vstup.

V júli tiež spúšťame GPT‑5.6 Sol na platforme Cerebras s rýchlosťou až 750 tokenov za sekundu, čím zákazníkom prinášame frontier inteligenciu bezprecedentnou rýchlosťou. Prístup bude spočiatku obmedzený na vybraných zákazníkov, kým budeme rozširovať kapacitu.

Tešíme sa, že sa počas tohto obdobia ukážky budeme ďalej učiť a že čoskoro prinesieme GPT‑5.6 Sol, Terra a Luna väčšiemu počtu ľudí.


1. Latenciu a náklady na API odhadujeme podľa produkčného správania našich modelov a offline simuláciou. Tieto odhady zohľadňujú podrobnosti volaní nástrojov, vzorkované tokeny a vstupné tokeny. Výsledky v reálnom svete sa môžu výrazne líšiť a závisia od mnohých faktorov, ktoré naša simulácia nezachytáva. Latenciu simulujeme pri vysokých rýchlostiach API a náklady pri bežných cenách API.

2. Všetky modely sa vyhodnocujú pomocou API harnessu ExploitBench s 5 seedmi a kontinuitou uvažovania.

3. ExploitGym sme spustili na našom alfa API, ktoré generuje odpovede rýchlejšie než naše verejné API, a potom sme výsledky preškálovali tak, aby zodpovedali verejnému API. Pri preškálovaní latencií na rýchlosti očakávané pre naše verejné API to spôsobuje, že niektoré odhadované latencie prekračujú časové limity 2 h a 6 h, hoci v hodnotiacom behu boli limity správne dodržané. Na vyššie rýchlosti pri časovo citlivej práci ponúkame v API prioritné spracovanie a v Codex rýchly režim.

4. Modely bez uvedených výstupných tokenov, latencie alebo nákladov sú zobrazené ako vodorovné bodkované čiary.

Autor

OpenAI