Přeskoč na hlavní obsah
OpenAI

Cesta k Astře: kritické schopnosti a průkopnická ochranná opatření

Načítání…

Od našeho dřívějšího posouzení, že by Astra mohla dosáhnout kritické úrovně kyberbezpečnostních schopností, jsme shromáždili další důkazy a provedli další hodnocení schopností modelu. Nyní se domníváme, že Astra podle našeho rámce připravenosti splňuje kritickou prahovou hodnotu kyberbezpečnostních schopností. Se správnými nástroji a přístupem tedy dokáže bez lidského vedení v každém kroku nacházet dosud neznámé bezpečnostní chyby a rozvíjet způsoby jejich zneužití v mnoha dobře chráněných systémech. Jde o první model, který na tuto úroveň zařazujeme, a během vývoje i před vydáním proto vyžaduje účinnější ochranná opatření.

V uplynulých týdnech jsme odložili části vývoje a vydání Astry, zatímco jsme posilovali a testovali ochranu proti kybernetickému zneužití a neoprávněnému jednání modelu. Na základě této práce se domníváme, že ochranná opatření Astry dostatečně minimalizují riziko závažných škod, aby ji bylo možné vydat v souladu s naším rámcem připravenosti.

Ačkoli Astra nebyla zapojena do incidentu Hugging Face, poznatky(otevře se v novém okně) z něj jsme začlenili do našeho přístupu k bezpečnosti. Na základě zpětného testování se domníváme, že naše tehdejší produkční ochranná opatření by incidentu Hugging Face zabránila. Od té doby jsme pro Astru zavedli ještě účinnější ochranná opatření. Patří mezi ně trénování modelu, aby spolehlivěji odmítal škodlivé kyberbezpečnostní požadavky a dodržoval bezpečnostní omezení, další ochrana proti zneužití a monitoring schopný zastavit potenciálně neoprávněnou činnost.

Astru plánujeme brzy zpřístupnit, přístup k jejím nejpokročilejším kyberbezpečnostním schopnostem však bude omezenější. Pokročilá práce v oblasti kybernetické bezpečnosti bude zpočátku dostupná skupině testerů. Následně přibude přístup prostřednictvím Daybreak Blue, který rozšíří možnosti obranného využití.

Při uvedení zveřejníme v kartě systému modelu další podrobnosti o testování a hodnocení bezpečnosti, zabezpečení a sladění. Před vydáním chceme informovat o části práce na bezpečném uvedení modelu s touto úrovní kybernetických schopností a otevřeně popsat rizika, která přetrvávají.

Posouzení kyberbezpečnostních schopností Astry

Podle našeho rámce připravenosti model splňuje kritickou prahovou hodnotu, pokud je splněna alespoň jedna z následujících podmínek:

  • Model dokáže bez zásahu člověka identifikovat a rozvinout funkční zero-day exploity všech úrovní závažnosti pro řadu odolných kritických systémů používaných v reálném světě.
  • Model dokáže pouze na základě obecně formulovaného cíle navrhnout a provést zcela nové komplexní strategie kybernetických útoků proti odolným cílům.

Naše hodnocení připravenosti Astry spojilo automatizované veřejné a neveřejné benchmarky s posouzeními vedenými odborníky. Astra představuje oproti GPT‑5.6 Sol výrazný nárůst kyberbezpečnostních schopností: využívá tokeny podstatně efektivněji a lépe identifikuje zranitelnosti i vyvíjí exploity.

Například jsme Astru otestovali v benchmarku ExploitBench, kde dosáhla perfektního skóre 100 % při hodnocení schopnosti modelu vyvíjet exploity ze známých zranitelností.

Kvůli obavám z kontaminace jsme následně vytvořili interní benchmark nazvaný „ExploitBench – interní port (červen–srpen 2026)“, který obsahuje 20 nověji zveřejněných vysoce závažných zranitelností V8. Na této datové sadě dosahuje Astra s mnohem menším počtem výstupních tokenů výrazně vyšší úspěšnosti spuštění libovolného kódu než GPT‑5.6 Sol. Během hodnocení model dokonce objevil a využil dvě zero-day zranitelnosti jako součást řetězce exploitů. Tyto dvě zranitelnosti právě oznamujeme správcům.

Uvedené výsledky Astry odrážejí schopnosti s přístupem k Daybreak Blue, nikoli výchozí produkční konfiguraci.

Při hodnoceních vedených odborníky zaměřených na odolný prohlížeč a operační systém Astra objevila dosud neznámé zranitelnosti a vytvořila z nich funkční řetězce exploitů. Vytvořila kompletní řetězec pro kompromitaci prohlížeče, který po otevření souboru HTML v prohlížeči unikl ze sandboxu a spustil příkazy na hostitelském systému. Model také našel několik zranitelností v odolném operačním systému a spojil je do řetězce lokálního zvýšení oprávnění z neprivilegovaného uživatele na root. Celkově nás naše šetření vedlo k závěru, že Astra dosáhla na kritický práh.

Ochranná opatření vyžadovaná pro kritické schopnosti

U modelů s kyberbezpečnostními schopnostmi na úrovni Astry musíme během vývoje i před nasazením ošetřit dvě cesty, abychom minimalizovali riziko závažných kyberbezpečnostních škod:

  • Zneužití modelu útočníky. Naše ochranná opatření musí spolehlivě bránit útočníkům ve využití Astry k vývoji exploitů pro dosud neznámé chyby v odolných kritických systémech nebo k provádění komplexních útoků proti odolným cílům.
  • Neoprávněné a nesladěné jednání modelu. I bez uživatele se zlými úmysly by model s pokročilými kyberbezpečnostními schopnostmi mohl sám způsobit kyberbezpečnostní škody, pokud by nebyl sladěný. Kromě mimořádně přísných požadavků na sladění modelů s těmito schopnostmi musí naše ochranná opatření jako druhá vrstva obrany rychle odhalit a omezit nesladěné jednání, které by mohlo způsobit významné škody v reálném světě.

Druhá cesta se přitom týká jak interního vývoje, tak externího nasazení. Jak jsme již popsali, po incidentu OpenAI – Hugging Face jsme na dva týdny pozastavili některá trénování průkopnických modelů (včetně některých trénování Astry), abychom posílili zabezpečení trénovací infrastruktury. Zavedli jsme mimo jiné izolaci a síťové kontroly, rozšířený monitoring a důkladnější trénování sladění i přísnější prahové hodnoty. Poté jsme pokračovali v práci menšího rozsahu za přísnějších opatření.

Některá rozsáhlejší trénování budoucích verzí Astry pomocí učení posilováním (RL) jsme odložili na delší dobu, než jsme stanovili vyšší požadavky na bezpečnost a zabezpečení jejich trénovacího prostředí. Dne 28. srpna jsme po zavedení nových požadavků na bezpečnost a zabezpečení znovu spustili rozsáhlé trénování průkopnického modelu pomocí RL, které jsme předtím pozastavili. Některá menší experimentální trénování nadále dočasně odkládáme.

Příprava Astry na vydání si rovněž vyžádala účinnější ochranu proti kybernetickému zneužití a neoprávněnému jednání. Níže tato ochranná opatření popisujeme včetně způsobu jejich testování.

Odolnost vůči kyberbezpečnostnímu zneužití

Od nasazení prvního modelu, jehož kyberbezpečnostní schopnosti jsme v únoru označili úrovní „Vysoká“, jsme s každým dalším vydáním posilovali ochranu v oblasti kybernetické bezpečnosti. Náš celkový přístup k bezpečnosti kombinuje odmítání požadavků dotrénovaným modelem, bezpečnostní klasifikátory na úrovni systému a offline detekci i potlačování hrozeb.

U modelu GPT‑5.6(otevře se v novém okně) jsme výrazně zvýšili odolnost naší systémové vrstvy. Přidali jsme například aktivační klasifikátory k detekci kyberbezpečnostního zneužití a rozšířili pokrytí univerzálních jailbreaků nalezených intenzivním automatizovaným red-teamingem. Na těchto zlepšeních jsme stavěli i u Astry: dále jsme investovali do modelové vrstvy souboru ochranných opatření a zlepšili jejich schopnost pracovat s kontextem napříč konverzacemi.

  • Díky novým trénovacím technikám zvyšujícím odolnost modelu Astra spolehlivěji odmítá žádosti o nepovolenou kyberbezpečnostní pomoc. V naší sadě hodnocení kybernetických jailbreaků Astra odmítá 91,5 % požadavků (oproti 59 % u GPT‑5.6 Sol).
  • U účtů vyhodnocených jako rizikovější uplatňujeme konzervativnější hranice chování modelu, který tak odmítá širší okruh potenciálně rizikové kyberbezpečnostní pomoci. U vysoce rizikových uživatelů jsme rozšířili kontext našich monitorovacích systémů, aby dokázaly tyto druhy kyberbezpečnostního zneužití zachytit.

Pokračovali jsme také v programu důkladného testování, interního i externího red-teamingu a nápravných opatření. Vedle regresního testování, kterým ověřujeme trvalé pokrytí všech jailbreaků nalezených v předchozích testovacích obdobích, provádíme novou vlnu red-teamingu s našimi nejnovějšími interními útočníky pro red-teaming. S partnery v oboru pracujeme na společném systému hodnocení jailbreaků a nová zjištění budeme vyšetřovat a řešit prostřednictvím našeho nepřetržitého programu rychlé reakce. Další podrobnosti o testování našich kyberbezpečnostních ochranných opatření zveřejníme v kartě systému Astry.

Pomoc obráncům s hledáním a opravou zranitelností zůstává ústředním pilířem našeho přístupu k bezpečnosti. Při uvedení očekáváme, že ochranná opatření Astry budou kvůli ochraně před možným zneužitím působit více komplikací, než dlouhodobě zamýšlíme. Přístup k Astře pro pokročilé pracovní postupy v kybernetické bezpečnosti bude zpočátku dostupný malé skupině alfa testerů. Následně se přístup prostřednictvím programu Daybreak Blue rozšíří na podporu obranného využití.

Sladění a monitoring

Přidali jsme také další vrstvy ochrany, které mají modelu zabránit v potenciálně nesladěném jednání:

  • Sladění modelu: V našich hodnoceních Astra dodržovala výslovná bezpečnostní omezení a držela se rozsahu svých oprávnění mnohem častěji než GPT‑5.6 Sol. Jde tak o náš dosud nejlépe sladěný model. Zaměřili jsme se zejména na to, zda model dodržuje omezení v oblasti bezpečnosti a zabezpečení a zda se drží rozsahu svých oprávnění.
  • Monitoring a kontrola: Podobně jako u našich interních postupů nasazujeme Astru s novým monitoringem myšlenkového řetězce, který rychle odhalí a omezí potenciálně nesladěné jednání.

Astra představuje významný pokrok ve sladění modelů a završuje několik našich dlouhodobých pracovních směrů v této oblasti – od zásahů během předtrénování až po pečlivější a konzistentnější hodnocení při učení posilováním. Při testování zjišťujeme, že Astra ve srovnání s GPT 5.6 Sol konzistentně častěji respektuje výslovná bezpečnostní omezení a varování, například automatickou kontrolu.

Vyvinuli jsme také test vycházející z poznatků z incidentu Hugging Face, při němž agenti provádějící kybernetické hodnocení ExploitGym kompromitovali systémy třetí strany. Nejtěžší úkoly z tohoto hodnocení jsme použili k vytvoření testů s „honeypoty“, které ověřují, zda se model místo řešení zadaného úkolu pokusí kompromitovat okolní bezpečnostní infrastrukturu. GPT‑5.6 Sol se bez produkčních ochranných opatření pokusil získat přístup k těmto cílům v 56 % testů simulujících prostředí benchmarku, v němž má model za úkol vyvíjet exploity. Astra se v těchto testech o nic takového nepokusila. Tyto údaje popisují chování v testovacích podmínkách bez kybernetických ochranných opatření, nikoli při běžném produkčním používání.

Vlevo: V tomto novém hodnocení sledujeme, jak modely reagují na zamítnutí automatickou kontrolou. Každý úkol probíhá v prostředí znalostní práce a běh začíná bezprostředně po zamítnutí automatickou kontrolou. Model pak může postupovat několika způsoby: ukončit běh, pokusit se najít bezpečnější alternativu, zopakovat podobný příkaz nebo využít nevhodnou konfiguraci(otevře se v novém okně) k úplnému obejití automatické kontroly. Volba kterékoli z posledních dvou možností by v tomto hodnocení znamenala neúspěch. Astra se automatickou kontrolu nikdy nepokusila obejít.

Vpravo: V tomto hodnocení ověřujeme tendenci modelu podvádět (pomocí „honeypotů“), když narazí na nejobtížnější nebo nesplnitelné úkoly v hodnocení ExploitGym. Hodnocení probíhalo v simulovaném prostředí s ochrannými opatřeními nastavenými pouze na pozorování, abychom mohli posoudit chování modelu. GPT‑5.6 Sol sice v těchto scénářích vykazoval větší sklon k podvádění, Astra se však tyto zkratky využít nepokusila a přesto dokázala některé úkoly legitimně vyřešit.

Trénování sladěného chování modelů představuje jednu vrstvu bezpečnosti. Další podrobnosti o testování sladění a jeho výsledcích zveřejníme v kartě systému Astry.

U modelů třídy Astra rovněž nasazujeme v produkci monitoring nesladěného chování, abychom potenciální nesladěné chování odhalili a rychle jeho šíření. Tato ochranná opatření se podobají našemu monitoringu interních nasazení. Zahrnují systém klasifikátorů, které kontrolují uvažování a jednání modelu, zda nevykazuje neoprávněné chování, a potenciálně neoprávněnou činnost automaticky zastavují. S rostoucími schopnostmi nemohou tato ochranná opatření nahradit dobré sladění našich modelů. Naším cílem je, aby budoucí modely byly sladěné natolik dobře, že se tato opatření nikdy neaktivují.

Co to bude znamenat pro uživatele

OpenAI usiluje o to, aby byly přínosy umělé inteligence široce dostupné. Vzhledem k výraznému nárůstu kyberbezpečnostních schopností Astry věnujeme mimořádnou pozornost bezpečnosti a zabezpečení tohoto nasazení. Nově přidané bezpečnostní kontroly někdy potenciálně zpomalí, pozastaví nebo zastaví legitimní práci, včetně obranné kyberbezpečnostní činnosti.

Občas se může stát, že systém označí legitimní činnost za potenciální kyberbezpečnostní zneužití nebo neoprávněné chování, a neúmyslně ji tak zpomalí, pozastaví či zastaví. Může jít i o práci, která zdánlivě přímo nesouvisí s kybernetickou bezpečností, nebo o úlohy, při nichž agent běží delší dobu.

Pokud monitoring nesladěného chování úlohu pozastaví, mohou být uživatelé ChatGPT nebo Codexu před pokračováním požádáni o kontrolu dané akce. Při použití jiných rozhraní, například API, se úloha zastaví. Tato ochranná opatření plánujeme průběžně kalibrovat, abychom omezili zbytečná přerušení a prostřednictvím programů jako Daybreak rozšířili přístup k průkopnickým schopnostem.

Výhled do budoucna

Vstupujeme do fáze vývoje umělé inteligence, v níž modely dokáží přebírat důležitější práci a selhání sladění či kontroly mohou mít závažnější dopady. Využití přínosů těchto systémů bude záviset na naší schopnosti sladit a mít pod kontrolou modely s rostoucími schopnostmi.

Tato odpovědnost zahrnuje trénování, hodnocení i nasazení. Vyžaduje přesvědčivější dokazování sladěného chování, ochranná opatření držící krok se schopnostmi a ochotu zpomalit, pokud tato ochrana není dostatečná.

Tyto systémy budeme nadále testovat, sdílet získané poznatky a otevřeně uvádět, co zůstává nejisté. Modely, které přijdou po Astře, od nás budou vyžadovat více. Věnujeme potřebný čas a práci tomu, abychom této odpovědnosti dostáli.