OpenAI a Hugging Face spolupracujú na riešení bezpečnostného incidentu pri hodnotení modelu
Minulý týždeň spoločnosť Hugging Face zverejnila nový typ bezpečnostného incidentu(otvorí sa v novom okne) po tom, ako odhalila a zastavila AI agenta, ktorý kompromitoval jej infraštruktúru. Očakávame, že s rozšírením čoraz kyberneticky schopnejších modelov bude niečo také bežnejšie. Po vyšetrení už vieme, že tento konkrétny incident spôsobila kombinácia modelov OpenAI — vrátane GPT‑5.6 Sol a ešte schopnejšieho predbežného modelu, všetkých so zníženým odmietaním kybernetických požiadaviek na účely hodnotenia — počas interného testovania na benchmarku(otvorí sa v novom okne) kybernetických schopností.
Tento incident považujeme za bezprecedentný kybernetický incident zahŕňajúci najmodernejšie kybernetické schopnosti a reagujeme naň primerane. V tejto fáze zdieľame predbežné zistenia, aby sme obrancom pomohli pochopiť, čo sa stalo, a lepšie posúdiť, čo dnes modely dokážu. Spolu so spoločnosťou Hugging Face budeme pokračovať v dôkladnom vyšetrovaní a po jeho ukončení zverejníme ďalšie podrobnosti o zraniteľnostiach, incidente a zisteniach.
K incidentu došlo počas interného hodnotenia, ktoré modely vyzýva, aby sa pokúšali o pokročilé zneužitie zraniteľností cez zložité cesty útoku, s cieľom kvantifikovať ich kybernetické schopnosti. Maximálne kybernetické schopnosti odhadujeme tak, že toto hodnotenie spúšťame bez produkčných klasifikátorov používaných na zabránenie modelom v rizikovej kybernetickej činnosti. Naše benchmarky bežia vo vysoko izolovanom prostredí, kde je sieťový prístup obmedzený na možnosť inštalovať balíky cez interne hostovaný softvér tretej strany, ktorý slúži ako proxy a vyrovnávacia pamäť pre registre balíkov.
Modely identifikovali a zreťazili zraniteľnosti naprieč výskumným prostredím OpenAI a produkčnou infraštruktúrou Hugging Face, aby získali testovacie riešenia priamo z produkčnej databázy Hugging Face. Všetky dôkazy naznačujú, že modely boli mimoriadne sústredené na nájdenie riešenia pre ExploitGym a zachádzali do krajností, aby dosiahli pomerne úzky testovací cieľ.
Počas práce v našom sandboxovom testovacom prostredí naše modely vynaložili značné množstvo inferenčného výpočtového výkonu na hľadanie spôsobu, ako získať otvorený prístup na internet, aby vyriešili hodnotiacu úlohu. Na získanie prístupu modely identifikovali a zneužili zero-day zraniteľnosť v proxy vyrovnávacej pamäti registra balíkov, ktorú sme už zodpovedne nahlásili dodávateľovi. S týmto prístupom naše modely vykonali sériu krokov na eskaláciu oprávnení a laterálny pohyb v našom výskumnom testovacom prostredí, až kým sa nedostali k uzlu s prístupom na internet.
Po získaní prístupu na internet modely usúdili, že Hugging Face môže hostovať modely, datasety a riešenia pre ExploitGym. Na základe toho model hľadal a úspešne našiel spôsoby, ako získať prístup k tajným informáciám, ktoré mohol použiť na podvádzanie v hodnotení. V jednom príklade model prepojil viacero vektorov útoku vrátane použitia ukradnutých prihlasovacích údajov a zero-day zraniteľností, aby na serveroch Hugging Face našiel cestu k vzdialenému spusteniu kódu. Bezpečnostný tím OpenAI túto anomálnu aktivitu interne odhalil.
Bezpečnostný tím Hugging Face a jeho agenti aktivitu vo svojej infraštruktúre odhalili a zastavili a už začali s jej izoláciou a forenznou rekonštrukciou pomocou vlastných open-source modelov, keď sa naše tímy spojili. Aktívne s nimi spolupracujeme na ďalšom vyšetrovaní incidentu. Sme vďační spoločnosti Hugging Face za rýchlu a úzku spoluprácu pri vyšetrovaní a náprave.
- V rámci vyšetrovania zavádzame prísne kontroly konfigurácie infraštruktúry, aj za cenu spomalenia výskumu, kým sa zraniteľnosti opravia. Náš Výbor pre bezpečnosť a ochranu pravidelne informujeme o týchto kontrolách a ich vplyve.
- Spolupracujeme so spoločnosťou Hugging Face na forenznom vyšetrení incidentu.
- Identifikovanú zero-day zraniteľnosť v interne hostovanom softvéri tretej strany sme zodpovedne nahlásili a spolupracujeme na jej oprave.
- Spoločnosť Hugging Face sme zapojili do programu dôveryhodného prístupu a podporujeme jej tímy pri rýchlom využívaní schopností našich modelov na zlepšenie ich obrany.
- Zlepšujeme a pridávame silnejšie ochranné opatrenia pre budúci tréning a hodnotenia. Tento týždeň sme zverejnili blog o zlepšovaní bezpečnosti a zosúladenia v ére modelov s dlhým časovým horizontom. Tieto ochranné opatrenia pri nasadení počas tohto hodnotenia zámerne neboli zapnuté, pretože jeho cieľom bolo testovať kybernetické zraniteľnosti. Tento incident poukazuje na potrebu ďalej posilniť zosúladenie nášho modelu, kybernetickú ochranu počas hodnotenia a monitorovanie pri internom testovaní.
Ako sme nedávno uviedli, AI zrýchľuje objavovanie a zneužívanie zraniteľností. Hlavným poučením z tohto incidentu je, že bezpečnosť a ochrana modelov musia držať krok s rýchlo napredujúcimi schopnosťami. Posilňujeme izoláciu, monitorovanie, kontroly prístupu a hodnotiace postupy používané počas vývoja modelov.
Hodnotenie UK AISI ukazuje, že modely ako GPT‑5.6 Sol sú čoraz schopnejšie udržiavať zložité viacfázové kybernetické operácie počas dlhých časových horizontov. Tento incident naznačuje, že tieto teoretické schopnosti sa uplatňujú aj v reálnom prostredí.

Incident tiež jasne ukazuje, že pokročilé modely dokážu objavovať a zneužívať nové cesty útoku v reálnych systémoch aj bez prístupu k zdrojovému kódu. Zdôrazňuje, že pokročilé kybernetické schopnosti sa musia vyvíjať spolu so silnejšími ochrannými opatreniami a obrannými nástrojmi.
Sme presvedčení, že modely s pokročilými kybernetickými schopnosťami musia pomáhať bezpečnostným tímom nachádzať slabiny skôr než útočníci, chápať, ako možno zraniteľnosti reťaziť, a odstraňovať ich strojovou rýchlosťou. Tieto schopnosti využívame na ďalšie posilňovanie ochrany konfigurácie infraštruktúry a prostredí na hodnotenie modelov; o svoje zistenia a osvedčené postupy sa podelíme priebežne, ako sa budeme učiť. Povzbudzujeme aj ďalších obrancov, aby požiadali o dôveryhodný prístup a už teraz experimentovali s týmito modelmi, aby sa tieto schopnosti premietli do lepšej prevencie, rýchlejšej detekcie a účinnejšej reakcie na incidenty.
„Sme vďační za spoluprácu s OpenAI v tejto aj ďalších témach. Tento incident, možno prvý svojho druhu, potvrdzuje presvedčenie, ktoré máme už dlho: bezpečnosť AI nevyrieši žiadna jednotlivá firma pracujúca v utajení. Vyrieši sa otvorene, spoluprácou a so širokým prístupom k AI pre každého obrancu, kdekoľvek.“


