Narušenie koordinovanej kampane na destiláciu modelov
Nedávno sme odhalili a narušili koordinovanú kampaň zameranú na extrakciu chráneného uvažovania z našich modelov. Prvú aktivitu sme zaznamenali v prvom júlovom týždni. Táto aktivita zodpovedá adverzárnej destilácii: systematickému a neoprávnenému využívaniu výstupov alebo uvažovania jedného modelu na trénovanie, reprodukovanie alebo zlepšovanie iného modelu. Chránené uvažovanie je interný záznam modelu o postupe riešenia úlohy. Jeho extrakcia môže odhaliť informácie vynechané z konečnej odpovede a pomôcť iným napodobniť schopnosti modelu.
Útočníci neprelomili naše šifrovanie, nenarušili databázu ani nezískali priamy prístup k uloženým konverzáciám používateľov. Namiesto toho manipulovali interakcie s modelmi tak, aby sa chránené uvažovanie dalo reprodukovať v podobe viditeľnej pre žiadateľa. Robili to koordinovane a vo veľkom rozsahu, čím porušovali naše podmienky používania. Táto manipulácia využíva zraniteľnosť, ktorá sa netýka len modelov OpenAI. Informácie o nej sme prostredníctvom organizácie Frontier Model Forum poskytli partnerom v odvetví, aby sme posilnili spoločnú obranu proti adverzárnej destilácii.
Pred zverejnením sme preskúmali rozsah a potenciálne dôsledky, zaviedli vlastné ochranné opatrenia, podelili sa o zistenia s výskumníkmi a partnermi v odvetví a získali od nich spätnú väzbu. Chceli sme tak zabezpečiť, aby bola zavedená ochrana proti tomuto typu útoku. Vo vyšetrovaní a zavádzaní ďalších ochranných opatrení pokračujeme. Veríme, že zverejnenie našich doterajších poznatkov pomôže širšiemu ekosystému posilniť obranu.
Zaznamenali sme pokusy útočníkov extrahovať chránené uvažovanie novými spôsobmi. Napríklad kopírovali zašifrované uvažovanie z jednej konverzácie a v inej konverzácii žiadali model, aby dešifroval a prepísal jeho skrytý obsah.
Nezávislí bezpečnostní výskumníci(otvorí sa v novom okne) nás prostredníctvom zodpovedného nahlasovania upozornili aj na súvisiace zraniteľnosti pri interakciách medzi modelmi a pri kompakcii konverzácií. Ich zistenia sme preskúmali a potvrdili sme, že nimi identifikované spôsoby útoku skutočne fungovali. Ich práca nám pomohla pochopiť širšiu kategóriu týchto útokov a urýchliť zavádzanie ochranných opatrení.
Aktivita sa začala 1. júla, spočiatku v malom rozsahu. V dňoch 24. a 25. júla sme zaznamenali prudký nárast: 16 000 požiadaviek1 od viac ako 4 000 používateľov využívalo príslušný vzor extrakcie. Ďalšie vyšetrovanie odhalilo aktivitu so súvisiacimi vzormi príkazov v skupine viac ako 15 000 používateľov. Túto aktivitu sme do 28. júla úplne zastavili.
Aktivita sa postupne vyvíjala, čo potvrdzuje, že adverzárna destilácia je širší bezpečnostný problém vyžadujúci viacvrstvovú a adaptívnu obranu.
Nie je jasné, či všetci útočníci, ktorých sme v danom období zaznamenali, konali v mene jediného subjektu. Hlavnú skupinu týchto aktivít však pripisujeme jednotlivcom spojeným so spoločnosťou Moonshot AI, ktorá vyvíja Kimi.
Adverzárna destilácia predstavuje riziká pre bezpečnosť systémov aj národnú bezpečnosť. Extrahované uvažovanie by sa mohlo použiť na trénovanie iného modelu bez zachovania ochranných opatrení uplatňovaných na výstupy pôvodného modelu určené používateľom. Destilácia vo veľkom rozsahu môže tiež urýchliť prenos pokročilých schopností bez potreby rovnakej investície do bezpečnosti. Tieto obavy rastú s tým, ako modely získavajú schopnosti v oblastiach s dvojakým využitím.
Toto riziko sa netýka len OpenAI. Ako sme uviedli vyššie, podobné techniky môžu zasiahnuť aj iné pokročilé systémy AI. Ide teda o spoločný bezpečnostný problém, ktorý si vyžaduje koordináciu v celom odvetví.
Túto nedávnu destilačnú kampaň sme obmedzili kombináciou zásahov proti účtom, technických kontrol a koordinácie s partnermi. Zablokovali alebo obmedzili sme podvodné účty, posilnili kontroly pri registrácii aj v infraštruktúre a rozšírili monitorovanie súvisiacich sietí.
Posilnili sme aj ochranu skrytého uvažovania naprieč používateľmi, pracovnými priestormi, organizáciami a rodinami modelov. Zablokovali sme spôsob, ktorým mohol niekto, kto už mal zašifrované uvažovanie iného používateľa, toto uvažovanie opätovne odoslať a získať jeho obsah. Pridali sme aj kontroly na detekciu a zadržanie priebežne odosielaného výstupu, ktorý by mohol odhaliť uvažovanie. Keď sa súvisiaca aktivita presunula na služby tretích strán, spolupracovali sme s ich poskytovateľmi na identifikácii zapojených účtov a zastavení ich činnosti.
Napokon sme príslušné zistenia poskytli prostredníctvom organizácie Frontier Model Forum a vhodných vládnych kanálov na výmenu informácií. Ostatní vývojári prelomových modelov a partneri z verejného sektora tak mohli hľadať podobnú aktivitu a posilniť vlastnú obranu. Systémy, ktoré podporujú prenosné alebo opätovne použiteľné záznamy uvažovania, môžu čeliť podobným rizikám.
Očakávame, že pokusy o adverzárnu destiláciu budú čoraz sofistikovanejšie, keďže prelomové modely sa zlepšujú a útočníci hľadajú lacnejšie spôsoby, ako napodobniť ich schopnosti. Obrana proti tejto aktivite si vyžaduje viacvrstvové kontroly a neustále prispôsobovanie.
Táto práca sa ešte neskončila. Nasadenia prevádzkované partnermi potrebujú rovnakú ochranu ako služby prevádzkované priamo nami. Útoky cez výstupy nástrojov si zase vyžadujú ochranu, ktorá skúma viac než len bežný viditeľný text. Naďalej zlepšujeme ochranu nástrojov, rozširujeme pokrytie klasifikátormi, zdokonaľujeme odmietanie nevhodných požiadaviek modelmi a zavádzame príslušné kontroly u cloudových partnerov.
Naša reakcia sa bude aj naďalej sústreďovať na tri oblasti: silnejšiu technickú ochranu proti extrakcii, lepšie odhaľovanie koordinovaných kampaní a zásahy proti nim a intenzívnejšiu výmenu informácií o hrozbách medzi odvetvím a vládnymi inštitúciami.

