Reakce na nový milník kritických kyberbezpečnostních schopností
Kybernetická bezpečnost se rychle mění, protože modely získávají pokročilejší schopnosti, které mohou posílit kybernetickou obranu, ale také umožnit útoky v dosud nevídaném měřítku a tempu.
Naše nejnovější interní hodnocení Astry, jednoho z připravovaných modelů, provedená v posledních několika dnech ukazují výrazný pokrok v agentním kódování a kybernetické bezpečnosti. Tyto výsledky spolu s odbornými posudky nás včera večer vedly k závěru, že podle našeho rámce připravenosti(otevře se v novém okně) nelze vyloučit kritickou úroveň kyberbezpečnostních schopností.
Tyto informace zveřejňujeme, protože považujeme za důležité otevřeně informovat veřejnost a odborníky na bezpečnost a zabezpečení o tomto možném posunu schopností.
Náš rámec připravenosti jsme poprvé zveřejnili v prosinci 2023, tedy dlouho předtím, než se modely přiblížily této úrovni schopností v biologii, chemii, kybernetické bezpečnosti a sebezdokonalování AI. Vytvořili jsme jej jako vodítko k rozpoznávání pokroku ve schopnostech a k plánování kroků naší společnosti v okamžiku, kdy se tyto schopnosti objeví. Předchozí modely, včetně GPT‑5.6‑Sol, byly hodnoceny z hlediska průkopnických kyberbezpečnostních schopností a dosáhly prahové úrovně Vysoká (nikoli Kritická).
Podle našeho rámce připravenosti dosáhne model v kybernetické bezpečnosti prahu „Kritické“ úrovně, pokud dokáže bez zásahu člověka v mnoha odolných kritických systémech z reálného světa identifikovat a vyvinout funkční zero-day exploity všech úrovní závažnosti nebo navrhnout a od začátku do konce provést nové strategie kybernetických útoků proti odolným cílům pouze na základě obecně zadaného požadovaného cíle.
Ačkoli tento model nadále testujeme a hodnotíme, předběžné výsledky ukazují natolik vysoký výkon, že v tuto chvíli nemůžeme vyloučit „Kritickou“ úroveň schopností. Astra je připravovaný model a na napadení služby Hugging Face se nepodílela.
Proto jsme rozšířili testování odolnosti našich ochranných opatření a bezpečnostních kontrol, aby odpovídaly nasazení těchto schopností. Aby další vývoj tohoto modelu probíhal bezpečně a spolehlivě, přijali jsme interně také následující opatření:
- Pro schopnější modely a související činnosti zavádíme přísnější bezpečnostní opatření, včetně izolovaných testovacích prostředí, omezeného přístupu k sítím a nástrojům, lepší ochrany a šifrování vah modelu, dalších možností monitorování a detekce a spouštění v sandboxu.
- Pozastavujeme interní činnosti využívající Astru, které dosud nesplňují tyto zpřísněné požadavky na bezpečnostní opatření.
- Ve všech agentních aplikacích Astry, včetně trénování a hodnocení, jsme zavedli jednotné monitorování rizikových kroků a nesouladu. Monitorovací systémy vyhodnocují řetězec úvah modelu a při vysoce rizikové činnosti spouštějí bezpečnostní reakci, která danou činnost prověří a přeruší.
- Při testování schopností tohoto modelu budeme spolupracovat s příslušnými vládními úřady a vybranými organizacemi zaměřenými na bezpečnost AI.
- Externím partnerům provádějícím testování poskytneme doporučené bezpečnostní kontroly pro bezpečné provádění rizikovějších hodnocení a úloh.
Tento rámec nás již provedl jinými přechody mezi úrovněmi schopností. Když se naše modely v červnu 2025 přiblížily prahu „Vysoké“ úrovně podle rámce připravenosti pro biologii, popsali jsme kroky, které podnikáme k posílení ochranných opatření, rozšíření testování, spolupráci s externími odborníky a zavedení dalších bezpečnostních opatření. Stejnou zásadu uplatňujeme i zde.
Věříme, že pokročilé modely s kyberbezpečnostními schopnostmi by měly pomáhat obráncům odhalovat a řešit zranitelnosti dříve než útočníci. Jsme odhodláni spolupracovat s orgány veřejné správy, bezpečnostními instituty a občanskou společností, aby byly průkopnické schopnosti modelů, jako je Astra, i jejich nástupců nasazovány odpovědně a v širokém měřítku ku prospěchu celého lidstva.


