Koordinuotos modelių distiliavimo kampanijos sustabdymas
Neseniai aptikome ir sustabdėme koordinuotą kampaniją, kurios tikslas buvo iš mūsų modelių išgauti apsaugotus protavimo duomenis. Pirmuosius šios veiklos požymius pastebėjome pirmąją liepos savaitę. Ši veikla atitinka piktavališko distiliavimo požymius: tai sistemingas ir neleistinas vieno modelio išvesties ar protavimo duomenų naudojimas kitam modeliui mokyti, atkurti ar tobulinti. Apsaugoti protavimo duomenys – tai vidinis modelio užduoties sprendimo eigos įrašas. Jį išgavus galima atskleisti informaciją, nepateiktą galutiniame atsakyme, ir padėti kitiems atkurti modelio gebėjimus.
Kampanijos vykdytojai neįveikė mūsų šifravimo, neįsilaužė į duomenų bazę ir negavo tiesioginės prieigos prie saugomų naudotojų pokalbių. Vietoj to jie manipuliavo sąveika su modeliais, kad apsaugoti protavimo duomenys būtų atkurti užklausos teikėjui matoma forma. Tai buvo daroma koordinuotai, dideliu mastu ir pažeidžiant mūsų paslaugų teikimo sąlygas. Tokios manipuliacijos galimos ne tik dėl „OpenAI“ modelių pažeidžiamumo. Per „Frontier Model Forum“ pasidalijome informacija apie jas su sektoriaus partneriais, kad sustiprintume bendrą apsaugą nuo piktavališko distiliavimo.
Prieš paskelbdami šią informaciją, ištyrėme veiklos mastą ir galimą poveikį, įdiegėme savo rizikos mažinimo priemones, pasidalijome išvadomis su tyrėjais bei sektoriaus partneriais ir gavome jų atsiliepimų, kad užtikrintume apsaugą nuo tokio tipo atakų. Toliau diegiame papildomas rizikos mažinimo priemones ir tęsiame tyrimą. Manome, kad dabar pasidaliję tuo, ką sužinojome, padėsime platesnei ekosistemai sustiprinti savo apsaugą.
Pastebėjome, kad kampanijos vykdytojai mėgino išgauti apsaugotus protavimo duomenis naujais būdais. Pavyzdžiui, jie kopijavo užšifruotus protavimo duomenis iš vieno pokalbio ir kitame pokalbyje prašė modelio iššifruoti bei perrašyti paslėptą protavimo turinį.
Nepriklausomi saugumo tyrėjai(atsidaro naujame lange), laikydamiesi atsakingo atskleidimo principų, taip pat atkreipė mūsų dėmesį į susijusius pažeidžiamumus, pasireiškiančius sąveikaujant skirtingiems modeliams ir tankinant pokalbius. Ištyrėme jų išvadas ir patvirtinome, kad jų nustatyti atakų būdai iš tiesų veikė. Jų darbas padėjo mums geriau suprasti platesnę šių atakų kategoriją ir paspartinti rizikos mažinimo priemonių diegimą.
Veikla prasidėjo liepos 1 d. ir iš pradžių buvo nedidelio masto. Liepos 24 ir 25 d. pastebėjome staigius aktyvumo šuolius: daugiau nei 4 000 naudotojų pateikė 16 000 užklausų1, kuriose buvo naudojama atitinkama duomenų išgavimo schema. Tęsdami tyrimą aptikome susijusią veiklą, kuriai buvo būdingos panašios užklausų schemos, daugiau nei 15 000 naudotojų grupėje. Iki liepos 28 d. šią veiklą visiškai sustabdėme.
Laikui bėgant ši veikla keitėsi. Tai dar kartą parodė, kad piktavališkas distiliavimas yra platesnė saugumo problema, kuriai spręsti reikia daugiasluoksnės, prisitaikančios apsaugos.
Neaišku, ar visi atitinkamu laikotarpiu mūsų stebėti vykdytojai buvo susiję su vienu veikėju. Vis dėlto pagrindinę šios veiklos dalį priskiriame asmenims, susijusiems su „Kimi“ kūrėja „Moonshot AI“.
Piktavališkas distiliavimas kelia riziką saugai ir nacionaliniam saugumui. Išgauti protavimo duomenys gali būti naudojami kitam modeliui mokyti, neišlaikant apsaugos priemonių, taikomų pradinio modelio naudotojams pateikiamai išvesčiai. Dideliu mastu vykdomas distiliavimas taip pat gali paspartinti pažangių gebėjimų perdavimą be tokių pat investicijų į saugą. Šis susirūpinimas stiprėja modeliams įgyjant gebėjimų dvejopo naudojimo srityse.
Ši rizika kyla ne tik „OpenAI“. Kaip minėta pirmiau, panašūs metodai gali paveikti ir kitas pažangias DI sistemas, todėl tai yra bendra saugumo problema, reikalaujanti koordinuotų viso sektoriaus veiksmų.
Šią neseniai vykdytą distiliavimo kampaniją pažabojome derindami sankcijas paskyroms, technines kontrolės priemones ir veiksmų koordinavimą su partneriais. Užblokavome arba apribojome sukčiavimui naudojamas paskyras, sustiprinome registracijos ir infrastruktūros kontrolę bei išplėtėme susijusių tinklų stebėseną.
Taip pat sustiprinome paslėptų protavimo duomenų apsaugą tarp skirtingų naudotojų, darbo sričių, organizacijų ir modelių šeimų. Pašalinome galimybę asmeniui, jau turinčiam kito naudotojo užšifruotus protavimo duomenis, juos pakartotinai pateikti ir atkurti jų turinį. Taip pat įdiegėme patikras, kurios aptinka ir sulaiko srautu siunčiamą išvestį, galinčią atskleisti protavimo duomenis. Kai susijusi veikla persikėlė į trečiųjų šalių paslaugas, bendradarbiavome su jų teikėjais, kad nustatytume joje dalyvaujančias paskyras ir sustabdytume jų veiklą.
Galiausiai pasidalijome svarbiomis išvadomis per „Frontier Model Forum“ ir atitinkamus vyriausybinius keitimosi informacija kanalus, kad kiti priešakinių modelių kūrėjai ir viešojo sektoriaus partneriai galėtų ieškoti panašios veiklos ir sustiprinti savo apsaugą. Sistemos, kuriose protavimo įrašus galima perkelti arba pakartotinai panaudoti, gali susidurti su panašia rizika.
Manome, kad bandymai piktavališkai distiliuoti modelius taps vis sudėtingesni, nes priešakiniai modeliai tobulėja, o piktavaliai ieško pigesnių būdų atkartoti jų gebėjimus. Norint apsisaugoti nuo šios veiklos, reikia daugiasluoksnių kontrolės priemonių ir nuolatinio prisitaikymo.
Šis darbas dar nebaigtas. Partnerių infrastruktūroje veikiančioms sistemoms reikia tokios pat apsaugos kaip ir mūsų pačių teikiamoms paslaugoms. O nuo atakų per įrankių išvestį reikia apsaugos priemonių, kurios tikrintų ne vien įprastą matomą tekstą. Toliau tobuliname įrankių apsaugą, plečiame klasifikatorių aprėptį, geriname modelių gebėjimą atsisakyti vykdyti neleistinas užklausas ir diegiame atitinkamas kontrolės priemones debesijos partnerių sistemose.
Ir toliau daugiausia dėmesio skirsime trims sritims: stipresnei techninei apsaugai nuo duomenų išgavimo, geresniam koordinuotų kampanijų aptikimui ir priemonėms joms sustabdyti bei glaudesniam sektoriaus ir valdžios institucijų keitimuisi informacija apie grėsmes.

