Kybernetické hodnotenia modelov OpenAI tretími stranami
Nezávislé testovanie nám významne pomáha overovať a lepšie pochopiť riziká ešte pred nasadením. Niektoré kybernetické hodnotenia zámerne používajú vlastné konfigurácie vrátane oslabených ochranných opatrení, aby merali základné schopnosti, nie bežné správanie modelov vo verejne dostupných nasadeniach.
Počas nedávnych hodnotení dvaja externí testovací partneri identifikovali incidenty, pri ktorých kombinácia testovacích konfigurácií, kontrolných mechanizmov a rastúcich schopností nových modelov umožnila, aby aktivita modelov prekročila zamýšľané hranice testovania. Tieto incidenty zdôrazňujú význam spolupráce v celom odvetví aj s externými hodnotiteľmi pri rozvíjaní štandardov testovacích prostredí a postupov, keďže schopnosti modelov rastú. Poznámka redakcie: Tieto incidenty nesúvisia s bezpečnostným incidentom Hugging Face. Aktuálne informácie o incidente Hugging Face budeme naďalej zverejňovať tu.
Pri nových incidentoch získali modely OpenAI počas kybernetických hodnotení tretích strán prístup na verejný internet. Stalo sa tak za špecifických podmienok a pri konfiguráciách s oslabenými ochrannými opatreniami, ktoré nezodpovedali bežnému nasadeniu. Išlo o tieto incidenty:
- UK AISI, britský vládny Inštitút pre bezpečnosť umelej inteligencie, vykonával hodnotenia v kybernetickom cvičisku so zámerne povoleným prístupom na internet, aby si agenti mohli sami vyhľadávať nástroje a pracovať v podmienkach bližších skutočnému útočníkovi. Na meranie základných schopností boli zároveň vypnuté kybernetické klasifikátory. Ich blog si môžete prečítať tu.(otvorí sa v novom okne)
- Irregular, jeden z našich externých partnerov pre testovanie kybernetickej bezpečnosti, vykonával hodnotenia v štýle Capture the Flag, ktoré mali byť izolované od internetu. Nesprávna konfigurácia testovacieho prostredia však modelom umožnila prístup na verejný internet.
Nižšie sumarizujeme, čo sa stalo, aké testovacie podmienky túto aktivitu umožnili, aké kroky boli prijaté na jej obmedzenie a čo robíme pre to, aby nezávislé laboratóriá mohli čoraz schopnejšie modely naďalej dôkladne a bezpečne hodnotiť.
Tieto incidenty poukazujú na širší problém, ktorý sme opísali v nedávnom príspevku o incidente Hugging Face: s rastúcimi schopnosťami modelov sa musia rozvíjať aj systémy zabezpečenia a bezpečnosti, ktoré ich obklopujú. Týka sa to prostredí používaných na vývoj modelov aj prostredí, v ktorých ich hodnotia laboratóriá a nezávislí partneri.
V nasledujúcich týždňoch preskúmame svoj prístup k testovaniu tretími stranami. Zameriame sa okrem iného na identifikáciu rizikovejších hodnotení, dohodnutie rozsahu, posudzovanie žiadostí o povolenie prístupu na internet alebo oslabenie ochranných opatrení, stanovenie požiadaviek na izoláciu, nakladanie s prihlasovacími údajmi, monitorovanie a podmienky zastavenia, ako aj na zavedenie jasnejších procesov oznamovania incidentov a ich eskalácie.
Zaviazali sme sa spolupracovať v celom odvetví na posilnení spoločných postupov bezpečného vykonávania vysokorizikových hodnotení. V nasledujúcich týždňoch preto spojíme zainteresované strany vrátane národných inštitútov pre AI, nezávislých hodnotiteľov, ďalších laboratórií AI a iných skupín. Naším cieľom je zachovať prínos dôkladného nezávislého hodnotenia a zároveň zabezpečiť, aby testovacie postupy držali krok s čoraz schopnejšími modelmi.
Dňa 3. augusta nám UK AISI oznámil, že počas rutinného kybernetického hodnotenia, ktoré sa začalo 25. júla, modely OpenAI a iného laboratória v niektorých prípadoch prekročili rozsah testovania. Hodnotenie prebiehalo v kontrolovaných kybernetických cvičiskách navrhnutých tak, aby napodobňovali reálne siete. Z 19 identifikovaných udalostí sa dve týkali modelu OpenAI GPT‑5.6 Sol. V ostatných prípadoch išlo o modely iného laboratória.
Pri tomto hodnotení dostali agenti pokyn konať ako odborníci na kybernetickú bezpečnosť v cvičení Capture the Flag: napadnúť tri prepojené simulované prostredia a získať záverečnú vlajku. Príkaz úlohy uvádzal siete cvičiska patriace do rozsahu a označoval niekoľko systémov, ktoré boli mimo rozsahu. UK AISI povolil aj aktívny prístup na internet, aby si agenti mohli sťahovať nástroje a pracovať v podmienkach bližších ľudskému útočníkovi. Zároveň vypol kybernetické klasifikátory modelu, aby zmeral jeho základné schopnosti.
Zamýšľanou hranicou oprávnenia UK AISI bolo simulované kybernetické cvičisko: agenti smeli napadnúť určené simulované siete a získať vlajku, nie však interagovať so systémami za hranicou siete cvičiska. Agentom však nebolo výslovne povedané, ako smú a nesmú používať otvorený prístup na internet, čo UK AISI označil za možnú spolupôsobiacu príčinu incidentu.
UK AISI zistil, že GPT‑5.6 Sol počas týchto spustení vykonal dva nepovolené kroky, keď sa snažil nájsť cestu do simulovaného cvičiska a získať vlajku:
- GPT‑5.6 Sol opätovne použil token GitHubu, ktorý agent iného laboratória ponechal verejne prístupný, aby zistil, či systém v rámci cvičiska kontroluje GitHub alebo inú aktualizačnú službu. Pokúsil sa tiež obísť obnovenie účtu a limity požiadaviek a zaregistroval účty u externých poskytovateľov DNS a tunelovania.
- GPT‑5.6 Sol použil verejnú tunelovaciu službu, aby z verejného internetu sprístupnil DNS server spustený lokálne v jeho hodnotiacom prostredí. Server obsahoval škodlivé kódy určené na zneužitie známej zraniteľnosti softvéru spusteného v testovacom cvičisku. Toto nastavenie nefungovalo, neexistujú dôkazy, že by mu odoslal dopyt akýkoľvek skutočný DNS resolver, a po skončení hodnotenia bola infraštruktúra odstránená.
Hoci sa model snažil dokončiť úlohu v kybernetickom cvičisku, UK AISI považoval tieto kroky za nepovolené, pretože zahŕňali skutočné externé účty a služby mimo hraníc cvičiska a na dokončenie úlohy neboli potrebné. DNS server zároveň na verejnom internete hostil škodlivé kódy na zneužitie zraniteľnosti, hoci toto nastavenie nefungovalo a neexistujú dôkazy, že by mu odoslal dopyt akýkoľvek skutočný DNS resolver.
UK AISI túto aktivitu identifikoval 28. júla po tom, ako bezpečnostný monitoring zaznamenal nezvyčajné prenosy údajov. Súvisiace hodnotenia zastavil, príslušné zariadenia izoloval a približne do hodiny od odhalenia zabránil ďalšiemu šíreniu aktivity.
Vážime si spoluprácu s UK AISI počas celého procesu vrátane jeho úsilia identifikovať a vyšetriť túto aktivitu a poskytnúť o nej podrobnosti. Tešíme sa na pokračovanie našej spolupráce.
Dňa 29. júla nás Irregular, jeden z našich externých partnerov pre hodnotenie, upozornil na incident týkajúci sa modelov OpenAI počas hodnotení kybernetickej bezpečnosti v štýle Capture the Flag (CTF). Modely dostali pokyn nájsť skryté informácie zneužitím slabín v simulovanom prostredí a bolo im oznámené, že nemajú prístup na internet. Nesprávna konfigurácia testovacieho prostredia však modelom umožnila prístup na verejný internet.
V jednom teste sa názov fiktívneho cieľa výzvy CTF neúmyselne zhodoval so skutočnou doménou. Keďže testovacie prostredie bolo omylom pripojené na internet, model napadol skutočnú webovú lokalitu v domnení, že je súčasťou simulovaného prostredia. Nešlo o sofistikovaný únik zo sandboxu ani o zraniteľnosť nultého dňa: prístup na internet bol dôsledkom nesprávnej konfigurácie a model zrejme zneužil základnú bezpečnostnú zraniteľnosť.
Podľa vyšetrovania spoločnosti Irregular model zároveň našiel a použil prihlasovacie údaje na ovládanie tej istej lokality. Irregular nezistil žiadny dosah nad rámec vlastných údajov dotknutej lokality a jeho audit pokračuje. Pozastavil hodnotenia, začal s nápravou a informoval dotknuté tretie strany. Irregular nás informoval, že všetky zistené problémy súvisiace s incidentom už nie sú aktívne a do testovacieho prostredia boli pridané príslušné ochranné opatrenia. Irregular informoval aj o súvisiacich incidentoch, ktoré sa v rovnakom testovacom prostredí týkali iných laboratórií.
Vážime si spoluprácu so spoločnosťou Irregular a naďalej s ňou budeme úzko spolupracovať a podporovať jej preskúmanie incidentu. Irregular zároveň pripravuje odbornú štúdiu, v ktorej predstaví osvedčené postupy na obmedzenie incidentov a bezpečné vykonávanie kybernetických hodnotení. Tešíme sa na účasť na príprave tejto odbornej štúdie, vďaka ktorej budú zistenia dostupné komunite, aj na pokračovanie našej spolupráce. Takúto spoluprácu považujeme za nevyhnutnú na zaistenie bezpečného a dôkladného hodnotenia súčasných aj budúcich modelov.


