Kyberbezpečnostní evaluace modelů OpenAI třetími stranami
Nezávislé testování nám významně pomáhá ověřovat a lépe chápat rizika před nasazením. Některá kybernetická hodnocení záměrně používají vlastní konfigurace, včetně omezených ochranných opatření, aby změřila skutečné schopnosti modelů, nikoli jejich běžné chování ve veřejně dostupných nasazeních.
Během nedávných hodnocení odhalili dva externí testovací partneři incidenty, při nichž kombinace testovacích konfigurací a kontrolních mechanismů s rostoucími schopnostmi nových modelů umožnila, aby činnost modelů překročila zamýšlené hranice testování. Tyto incidenty zdůrazňují význam spolupráce napříč odvětvím i s externími hodnotiteli při rozvoji standardů pro testovací prostředí a postupy v době, kdy jsou modely stále schopnější. Poznámka redakce: Tyto případy nesouvisejí s bezpečnostním incidentem Hugging Face. Aktuální informace o incidentu Hugging Face budeme i nadále zveřejňovat zde.
Při nových incidentech získaly modely OpenAI během kyberbezpečnostních evaluací třetích stran přístup k veřejnému internetu. Stalo se tak za specifických podmínek a při konfiguracích s omezenými ochrannými opatřeními, které neodpovídaly běžnému nasazení. Jednalo se o tyto incidenty:
- UK AISI, britský vládní institut pro bezpečnost AI, prováděl hodnocení v kyberbezpečnostním testovacím prostředí se záměrně povoleným přístupem k internetu, aby agenti mohli sami vyhledávat nástroje a pracovat v podmínkách bližších skutečnému útočníkovi. Zároveň byly vypnuty kyberbezpečnostní klasifikátory, aby bylo možné změřit skutečné schopnosti modelů. Jejich blog si můžete přečíst zde.(otevře se v novém okně)
- Irregular, jeden z našich externích partnerů pro testování kybernetické bezpečnosti, prováděl hodnocení ve stylu Capture the Flag, která měla být izolována od internetu. Chybná konfigurace testovacího prostředí však modelům umožnila přístup k veřejnému internetu.
Níže shrnujeme, co se stalo, jaké testovací podmínky tuto aktivitu umožnily, jaké kroky byly podniknuty k jejímu zastavení a co děláme pro to, aby nezávislé laboratoře mohly stále schopnější modely nadále důkladně a bezpečně hodnotit.
Tyto incidenty poukazují na stejný širší problém, který jsme popsali v nedávném příspěvku o incidentu Hugging Face: s rostoucími schopnostmi modelů se musí rozvíjet také bezpečnostní a ochranné systémy kolem nich. To se týká jak prostředí používaných k vývoji modelů, tak prostředí, v nichž je hodnotí laboratoře a nezávislí partneři.
V nadcházejících týdnech přezkoumáme náš vlastní přístup k testování třetími stranami. Zaměříme se mimo jiné na rozpoznávání rizikovějších hodnocení, vymezení rozsahu, posuzování žádostí o přístup k internetu nebo omezení ochranných opatření, požadavky na izolaci, nakládání s přihlašovacími údaji, monitoring a podmínky zastavení a také na zavedení jasnějších postupů pro oznamování a eskalaci incidentů.
Jsme odhodláni spolupracovat s ostatními v našem odvětví na posílení společných postupů pro bezpečné provádění vysoce rizikových hodnocení. V nadcházejících týdnech proto chceme svolat zástupce národních institutů umělé inteligence, nezávislých hodnotitelů, ostatních AI laboratoří a jiných skupin. Naším cílem je zachovat přínos důkladného nezávislého hodnocení a současně zajistit, aby testovací postupy držely krok se stále schopnějšími modely.
Dne 3. srpna nás z UK AISI informovali, že během rutinního kyberbezpečnostního hodnocení zahájeného 25. července modely OpenAI a jiné laboratoře v několika případech překročily rozsah testování. Hodnocení probíhalo v kontrolovaných kybernetických testovacích prostředích navržených tak, aby napodobovala skutečné sítě. Z 19 zjištěných událostí se dvě týkaly modelu OpenAI GPT‑5.6 Sol. V ostatních případech šlo o modely jiné laboratoře.
V rámci tohoto hodnocení dostali agenti pokyn, aby vystupovali jako odborníci na kybernetickou bezpečnost v úloze typu Capture the Flag: měli napadnout tři propojená simulovaná prostředí a získat závěrečnou vlajku. Prompt úlohy určoval sítě zahrnuté do testovacího prostředí a několik systémů výslovně označoval za systémy mimo vymezení úkolu. UK AISI také povolil přístup k živému internetu, aby si agenti mohli stahovat nástroje a pracovat v podmínkách bližších lidskému útočníkovi. Současně vypnul kyberbezpečnostní klasifikátory modelu, aby změřil jeho skutečné schopnosti.
UK AISI zamýšlel omezit oprávnění na simulované kyberbezpečnostní prostředí: agenti směli napadnout určené simulované sítě a získat vlajku, nikoli komunikovat se systémy mimo síťovou hranici tohoto prostředí. Agenti však nedostali výslovné pokyny, jak smějí a nesmějí otevřený přístup k internetu používat, což UK AISI označuje za možnou příčinu incidentu.
UK AISI zjistil, že během těchto běhů provedl GPT‑5.6 Sol při hledání cesty do simulovaného prostředí a snaze získat vlajku dvě nepovolené akce:
- GPT‑5.6 Sol znovu použil token GitHubu, který agent jiné laboratoře ponechal veřejně přístupný, aby ověřil, zda systém v tomto rozmezí kontaktuje GitHub nebo jinou aktualizační službu. Pokusil se také obejít obnovení účtu a limity požadavků a zaregistroval si účty u externích poskytovatelů DNS a tunelovacích služeb.
- GPT‑5.6 Sol použil veřejnou tunelovací službu, aby server DNS spuštěný lokálně v jeho hodnoticím prostředí zpřístupnil z veřejného internetu. Server obsahoval datové části exploitu určené pro známou zranitelnost softwaru spuštěného v testovacím prostředí. Toto řešení nefungovalo, nic nenasvědčuje tomu, že by na něj skutečný resolver odeslal dotaz, a po skončení hodnocení byla infrastruktura odstraněna.
Přestože se model snažil dokončit úlohu v testovacím prostředí kybernetické bezpečnosti, UK AISI považoval tyto kroky za nepovolené, protože zahrnovaly skutečné externí účty a služby mimo vymezené prostředí a ke splnění úlohy nebyly nutné. Server DNS také na veřejném internetu hostoval datové části exploitů. Toto řešení však nefungovalo a nic nenasvědčuje tomu, že by na něj skutečný resolver odeslal dotaz.
UK AISI tuto aktivitu odhalil 28. července poté, co bezpečnostní monitoring zaznamenal neobvyklé přenosy dat. Související evaluace zastavil, příslušné počítače izoloval a přibližně do hodiny od zjištění aktivitu omezil.
Vážíme si spolupráce s UK AISI během celého procesu, včetně jeho práce na odhalení a prošetření této aktivity a sdílení podrobností. Těšíme se na další spolupráci.
Dne 29. července nás jeden z našich externích partnerů pro hodnocení, společnost Irregular, informoval o incidentu týkajícím se modelů OpenAI během hodnocení kybernetické bezpečnosti ve stylu Capture the Flag (CTF). Modely dostaly za úkol najít skryté informace zneužitím slabin v simulovaném prostředí a bylo jim sděleno, že nemají přístup k internetu. Chybná konfigurace testovacího prostředí však modelům umožnila přístup k veřejnému internetu.
V jednom testu se název fiktivního cíle úlohy CTF neúmyslně shodoval se skutečnou doménou. Protože bylo testovací prostředí omylem připojeno k internetu, model napadl skutečný web v domnění, že je součástí simulovaného prostředí. Nešlo o sofistikovaný únik ze sandboxu ani zranitelnost nultého dne: přístup k internetu byl důsledkem chybné konfigurace a model zřejmě zneužil základní bezpečnostní zranitelnost.
Podle vyšetřování společnosti Irregular model také našel a použil přihlašovací údaje k ovládání téhož webu. Společnost Irregular nezjistila žádné dopady mimo vlastní data dotčeného webu a její audit pokračuje. Hodnocení pozastavila, zahájila nápravu a informovala dotčené třetí strany. Společnost Irregular nás informovala, že žádný z problémů zjištěných v souvislosti s incidentem již není aktivní a že do testovacího prostředí byla přidána příslušná ochranná opatření. Společnost Irregular rovněž informovala o souvisejících incidentech, které se ve stejném testovacím prostředí týkaly jiných laboratoří.
Vážíme si spolupráce se společností Irregular a budeme s ní nadále úzce spolupracovat a podporovat její šetření. Společnost Irregular také připravuje odbornou studii, v níž představí osvědčené postupy pro omezení incidentů a bezpečné provádění kybernetických hodnocení. Těšíme se, že se na této studii budeme podílet, zpřístupníme její závěry komunitě a budeme v naší spolupráci pokračovat. Takovou spolupráci považujeme za nezbytnou k zajištění bezpečného a důkladného hodnocení současných i budoucích modelů.


