Narušení koordinované kampaně na destilaci modelů
Nedávno jsme odhalili a narušili koordinovanou kampaň zaměřenou na extrakci chráněného uvažování z našich modelů. První aktivitu jsme zaznamenali v prvním červencovém týdnu. Tato aktivita odpovídá adversariální destilaci: systematickému a neoprávněnému využívání výstupů či uvažování jednoho modelu k trénování, reprodukci nebo vylepšování jiného modelu. Chráněné uvažování je interní záznam postupu, kterým model řeší úkol. Jeho extrakce může odhalit informace, které nejsou součástí konečné odpovědi, a pomoci ostatním reprodukovat schopnosti modelu.
Útočníci neprolomili naše šifrování, nenapadli databázi ani nezískali přímý přístup k uloženým konverzacím uživatelů. Zato manipulovali interakce s modely tak, aby bylo možné chráněné uvažování reprodukovat v podobě viditelné pro žadatele. Postupovali koordinovaně, ve velkém měřítku a v rozporu s našimi podmínkami služby. Tato manipulace nevyužívá zranitelnost specifickou pouze pro modely OpenAI. Informace o ní jsme prostřednictvím Frontier Model Forum sdíleli s partnery v oboru, abychom posílili společnou obranu proti adversariální destilaci.
Před zveřejněním jsme prozkoumali rozsah a možné dopady, zavedli vlastní ochranná opatření a sdíleli poznatky s výzkumníky a partnery v oboru. Zohlednili jsme také jejich zpětnou vazbu, abychom zajistili ochranu proti tomuto typu útoku. Další vyšetřování i práce na ochranných opatřeních pokračují. Věříme, že sdílením dosavadních poznatků pomůžeme posílit obranu celého ekosystému.
Zaznamenali jsme pokusy útočníků extrahovat chráněné uvažování novými způsoby. Mimo jiné kopírovali zašifrované uvažování z jedné konverzace a v jiné konverzaci žádali model, aby obsah skrytého uvažování dešifroval a přepsal.
Nezávislí bezpečnostní výzkumníci(otevře se v novém okně) nás v rámci odpovědného hlášení zranitelností rovněž upozornili na související zranitelnosti při interakcích mezi modely a při kompakci konverzací. Jejich zjištění jsme prošetřili a potvrdili, že odhalené způsoby útoku skutečně fungují. Jejich práce nám pomohla porozumět širší kategorii těchto útoků a urychlit zavádění ochranných opatření.
Aktivita začala 1. července, zpočátku v malém objemu. Ve dnech 24. a 25. července jsme zaznamenali prudký nárůst: přes 4 000 uživatelů odeslalo 16 000 požadavků1 využívajících příslušný vzorec extrakce. Další vyšetřování odhalilo související aktivitu se stejnými vzorci promptů ve skupině více než 15 000 uživatelů. Do 28. července se nám ji podařilo zcela zastavit.
Aktivita se v průběhu času vyvíjela, což potvrzuje, že adversariální destilace představuje širší bezpečnostní problém vyžadující vícevrstvou a přizpůsobivou obranu.
Není jasné, zda všichni útočníci, které jsme v daném období zaznamenali, byli z jediného subjektu. Hlavní část této aktivity však připisujeme osobám spojeným se společností Moonshot AI, která vyvíjí Kimi.
Adversariální destilace představuje rizika pro bezpečnost AI i pro národní bezpečnost. Extrahované uvažování by mohlo být použito k trénování jiného modelu bez zachování ochranných opatření, která se uplatňují na výstupy původního modelu určené uživatelům. Ve velkém měřítku může destilace také urychlit přenos pokročilých schopností, aniž by vyžadovala stejné investice do bezpečnosti. Tyto obavy sílí s tím, jak modely získávají schopnosti v oblastech dvojího užití.
Toto riziko se netýká pouze OpenAI. Jak jsme uvedli výše, podobné techniky mohou ohrozit i jiné pokročilé systémy AI. Jde tedy o společný bezpečnostní problém, který vyžaduje koordinaci napříč celým odvětvím.
Proti této nedávné destilační kampani jsme zasáhli kombinací opatření vůči účtům, technických kontrol a koordinace s partnery. Zablokovali jsme nebo omezili podvodné účty, posílili kontroly při registraci i na úrovni infrastruktury a rozšířili sledování souvisejících sítí.
Posílili jsme také ochranu skrytého uvažování napříč uživateli, pracovními prostory, organizacemi i rodinami modelů. Zablokovali jsme způsob, který umožňoval někomu, kdo již měl k dispozici zašifrované uvažování jiného uživatele, toto uvažování znovu předložit modelu a získat jeho obsah. Přidali jsme také kontroly, které odhalují a zadržují streamovaný výstup, jenž by mohl uvažování odhalit. Když se související aktivita přesunula do služeb třetích stran, spolupracovali jsme s jejich poskytovateli na identifikaci zapojených účtů a zastavení jejich činnosti.
Příslušná zjištění jsme také sdíleli prostřednictvím Frontier Model Forum a příslušných oficiálních státních kanálů pro sdílení informací. Ostatní vývojáři průkopnických modelů a partneři z veřejného sektoru tak mohli pátrat po podobné aktivitě a posílit vlastní obranu. Systémy, které podporují přenositelné nebo opakovaně použitelné artefakty uvažování, mohou čelit podobným rizikům.
Očekáváme, že pokusy o adversariální destilaci budou stále důmyslnější s tím, jak se průkopnické modely budou zlepšovat a útočníci budou hledat levnější způsoby, jak napodobit jejich schopnosti. Obrana proti této aktivitě vyžaduje vícevrstvá kontrolní opatření a průběžné přizpůsobování.
Tato práce ještě neskončila. Nasazení hostovaná partnery potřebují stejnou ochranu jako služby provozované přímo námi. Útoky prostřednictvím výstupů nástrojů pak vyžadují ochranu, která zkoumá více než jen běžný viditelný text. Nadále zlepšujeme ochranu nástrojů, rozšiřujeme pokrytí klasifikátory, zdokonalujeme odmítání požadavků modely a zavádíme příslušná kontrolní opatření u našich cloudových partnerů.
Naše reakce se bude i nadále zaměřovat na tři oblasti: silnější technickou ochranu proti extrakci, lepší odhalování koordinovaných kampaní a účinnější zásahy proti nim a hlubší sdílení informací o hrozbách mezi odvětvím a národními institucemi.

