OpenAI a Hugging Face společně řeší bezpečnostní incident vzniklý během vyhodnocování modelu
Minulý týden společnost Hugging Face zveřejnila nový druh bezpečnostního incidentu(otevře se v novém okně) poté, co odhalila a izolovala AI agenta, který kompromitoval její infrastrukturu; očekáváme, že s rozšířením modelů se stále většími kyberbezpečnostními schopnostmi budou podobné případy častější. Po vyšetřování nyní víme, že tento konkrétní incident způsobila kombinace modelů OpenAI — včetně GPT‑5.6 Sol a ještě schopnějšího předprodukčního modelu, všechny se sníženou mírou odmítání kyberbezpečnostních úkolů pro účely vyhodnocování — během interního testování na benchmarku(otevře se v novém okně) kybernetických schopností.
Tento incident považujeme za bezprecedentní kybernetický incident zahrnující nejmodernější kyberbezpečnostní schopnosti a podle toho na něj reagujeme. V této fázi sdílíme předběžná zjištění, abychom obráncům pomohli pochopit, co se stalo, a lépe si nastavit očekávání ohledně toho, čeho jsou modely nyní schopné. Budeme pokračovat v důkladném vyšetřování společně s Hugging Face a po jeho dokončení zveřejníme další podrobnosti o zranitelnostech, incidentu i zjištěních.
K tomuto incidentu došlo během interního vyhodnocování, které modely pomocí promptů vede k pokročilému zneužívání zranitelností přes komplikované cesty útoku s cílem kvantifikovat jejich kyberbezpečnostní schopnosti. Maximální kyberbezpečnostní schopnosti odhadujeme tak, že toto vyhodnocování spouštíme bez produkčních klasifikátorů, které se používají k tomu, aby modelům bránily v provádění vysoce rizikové kyberbezpečnostní aktivity. Naše benchmarky běží ve vysoce izolovaném prostředí, kde je síťový přístup omezen na možnost instalovat balíčky prostřednictvím interně hostovaného softwaru třetí strany, který funguje jako proxy a cache pro registry balíčků.
Modely identifikovaly a zřetězily zranitelnosti napříč výzkumným prostředím OpenAI a produkční infrastrukturou Hugging Face, aby získaly testovací řešení přímo z produkční databáze Hugging Face. Všechny důkazy naznačují, že se modely extrémně soustředily na nalezení řešení pro ExploitGym a zacházely do krajností, aby dosáhly poměrně úzce vymezeného testovacího cíle.
Při práci v našem sandboxovaném testovacím prostředí naše modely vynaložily značné množství inferenčního výpočetního výkonu na hledání způsobu, jak získat otevřený přístup k internetu, aby vyřešily vyhodnocovací úlohu. Aby modely tento přístup získaly, našly a zneužily zero-day zranitelnost (kterou jsme nyní odpovědně nahlásili dodavateli) v proxy pro cache registru balíčků. S tímto přístupem provedly naše modely v našem výzkumném testovacím prostředí sérii kroků eskalace oprávnění a pohybu stranou, dokud se nedostaly k uzlu s přístupem k internetu.
Po získání přístupu k internetu modely usoudily, že Hugging Face může hostovat modely, datové sady a řešení pro ExploitGym. Na základě toho model vyhledal a úspěšně našel způsoby, jak získat přístup k tajným informacím, které mohl použít k podvodnému dosažení úspěšného hodnocení. V jednom případě model zřetězil několik vektorů útoku, včetně použití odcizených přihlašovacích údajů a zero-day zranitelností, aby na serverech Hugging Face našel cestu ke vzdálenému spuštění kódu. Bezpečnostní tým OpenAI tuto anomální aktivitu interně odhalil.
Bezpečnostní tým a agenti Hugging Face tuto aktivitu na své infrastruktuře detekovali a zastavili a pomocí vlastních open-source modelů zahájili izolaci a forenzní rekonstrukci, ještě než se naše týmy propojily. Aktivně s nimi spolupracujeme na dalším vyšetřování incidentu. Jsme vděční za rychlou a úzkou spolupráci Hugging Face při vyšetřování a nápravě.
- V rámci vyšetřování zavádíme přísná kontrolní opatření v konfiguraci infrastruktury, a to za cenu zpomalení výzkumu, dokud nebudou zranitelnosti opraveny. O těchto opatřeních a jejich dopadu pravidelně informujeme náš Výbor pro bezpečnost a zabezpečení.
- Spolupracujeme s Hugging Face na forenzním vyšetření incidentu.
- Zjištěnou zero-day zranitelnost v interně hostovaném softwaru třetí strany jsme odpovědně nahlásili a spolupracujeme s dodavatelem na její opravě.
- Zařadili jsme Hugging Face do programu trusted access a podporujeme jejich týmy v rychlém využití schopností našich modelů ke zlepšení jejich obrany.
- Zlepšujeme a doplňujeme silnější ochranná opatření pro budoucí trénování a vyhodnocování. Tento týden jsme zveřejnili blog o zlepšování bezpečnosti a alignmentu v éře modelů s dlouhým časovým horizontem. Tato ochranná opatření pro nasazení během tohoto vyhodnocování záměrně nebyla zapnuta, protože cílem bylo testovat kybernetické zranitelnosti. Tento incident ukazuje, že je třeba dále posílit alignment našeho modelu, kybernetickou ochranu během vyhodnocování i monitorování při interním testování.
Jak jsme nedávno uvedli, AI urychluje objevování i zneužívání zranitelností. Hlavním poučením z tohoto incidentu je, že zabezpečení a bezpečnost modelů musí držet krok s rychle se rozvíjejícími schopnostmi. Posilujeme izolaci, monitorování, řízení přístupu a postupy vyhodnocování používané při vývoji modelů.
Vyhodnocení UK AISI ukazuje, že modely jako GPT‑5.6 Sol jsou stále schopnější dlouhodobě vést složité, vícekrokové kybernetické operace. Z tohoto incidentu vyplývá, že tyto teoretické schopnosti se skutečně uplatňují i v reálném prostředí.

Incident také jasně ukazuje, že pokročilé modely dokážou v reálných systémech objevovat a zneužívat nové cesty útoku i bez přístupu ke zdrojovému kódu. Zdůrazňuje, že pokročilé kybernetické schopnosti je nutné vyvíjet souběžně se silnějšími ochrannými opatřeními a obrannými nástroji.
Věříme, že modely s pokročilými kybernetickými schopnostmi musí bezpečnostním týmům pomáhat nacházet slabiny dříve než útočníci, chápat, jak lze zranitelnosti řetězit, a napravovat je strojovou rychlostí. Tyto schopnosti využíváme k dalšímu posilování ochrany konfigurace infrastruktury a prostředí pro vyhodnocování modelů; o poznatky a osvědčené postupy se podělíme, jakmile je získáme. Vyzýváme další obránce, aby požádali o trusted access a už nyní s těmito modely experimentovali, aby se tyto schopnosti proměnily v lepší prevenci, rychlejší detekci a účinnější reakci na incidenty.
„Jsme vděční za spolupráci s OpenAI na tomto i dalších tématech. Tento incident, možná první svého druhu, potvrzuje něco, čemu už dlouho věříme: bezpečnost AI nevyřeší žádná jednotlivá firma pracující v utajení. Vyřeší se otevřeně, ve spolupráci a se širokým přístupem k AI pro každého obránce, kdekoli.“


