Zaustavljanje koordinirane kampanje destilacije modela
Nedavno smo otkrili i zaustavili koordiniranu kampanju usmjerenu na izvlačenje zaštićenog rasuđivanja iz naših modela. Najranije zabilježene aktivnosti odvijale su se u prvom tjednu srpnja. Ova aktivnost odgovara obrascu adversarijalne destilacije: sustavnog i neovlaštenog korištenja izlaznih podataka ili rasuđivanja jednog modela za treniranje, reproduciranje ili poboljšanje drugog modela. Zaštićeno rasuđivanje interni je zapis modela o rješavanju zadatka. Njegovim izvlačenjem mogu se otkriti informacije izostavljene iz konačnog odgovora i drugima pomoći da reproduciraju sposobnosti modela.
Napadači nisu probili našu enkripciju, ugrozili bazu podataka niti dobili izravan pristup pohranjenim korisničkim razgovorima. Umjesto toga, manipulirali su interakcijama s modelima kako bi se zaštićeno rasuđivanje moglo reproducirati u oblicima vidljivima podnositelju zahtjeva. To su činili koordinirano i u velikom opsegu, kršeći naše uvjete korištenja. Ova manipulacija ne iskorištava ranjivost svojstvenu samo modelima tvrtke OpenAI. Informacije o njoj podijelili smo s partnerima iz industrije putem organizacije Frontier Model Forum kako bismo ojačali zajedničku obranu od adversarijalne destilacije.
Prije objave istražili smo opseg i mogući utjecaj, uveli vlastite mjere ublažavanja te razmijenili informacije s istraživačima i partnerima iz industrije i uzeli u obzir njihove povratne informacije kako bismo osigurali zaštitu od ove vrste napada. Nastavljamo istragu i rad na dodatnim mjerama ublažavanja. Vjerujemo da ćemo dijeljenjem dosadašnjih saznanja pomoći širem ekosustavu da ojača svoju obranu.
Uočili smo da napadači pokušavaju izvući zaštićeno rasuđivanje na nove načine, među ostalim kopiranjem šifriranog rasuđivanja iz jednog razgovora i traženjem od modela u drugom razgovoru da dešifrira i prepiše skriveni sadržaj rasuđivanja.
Neovisni sigurnosni istraživači(otvara se u novom prozoru) također su nam putem odgovorne prijave ranjivosti skrenuli pozornost na povezane ranjivosti koje zahvaćaju više modela i sažimanje razgovora. Istražili smo njihove nalaze i potvrdili da su načini napada koje su otkrili doista izvedivi. Njihov nam je rad pomogao razumjeti širu kategoriju napada i ubrzati uvođenje mjera ublažavanja.
Aktivnost je počela 1. srpnja, isprva u malom opsegu. Nagli porast zabilježili smo 24. i 25. srpnja: više od 4000 korisnika poslalo je 16.000 zahtjeva1 s prepoznatim obrascem izvlačenja. Daljnjom istragom otkrivene su aktivnosti sa srodnim obrascima upita unutar skupine od više od 15.000 korisnika, koje smo u potpunosti zaustavili do 28. srpnja.
Aktivnost se s vremenom mijenjala, što dodatno potvrđuje da je adversarijalna destilacija širi sigurnosni izazov koji zahtijeva višeslojnu, prilagodljivu obranu.
Nije jasno jesu li svi napadači koje smo uočili tijekom promatranog razdoblja djelovali u ime istog aktera. Međutim, središnju skupinu aktivnosti pripisujemo pojedincima povezanima s tvrtkom Moonshot AI, koja razvija Kimi.
Adversarijalna destilacija predstavlja rizik za sigurnost, uključujući nacionalnu sigurnost. Izvučeno rasuđivanje moglo bi se upotrijebiti za treniranje drugog modela bez očuvanja zaštitnih mjera koje se primjenjuju na izlazne podatke izvornog modela namijenjene korisnicima. Destilacija u velikom opsegu također može ubrzati prijenos naprednih sposobnosti bez jednakog ulaganja u sigurnost. Zabrinutost raste kako modeli stječu sposobnosti u područjima dvojne namjene.
Ovaj rizik nije svojstven samo tvrtki OpenAI. Kao što je prethodno navedeno, slične tehnike mogu utjecati i na druge napredne sustave umjetne inteligencije, zbog čega je ovo zajednički sigurnosni izazov koji zahtijeva koordinaciju cijele industrije.
Ovu nedavnu kampanju destilacije suzbili smo kombinacijom mjera protiv računa, tehničkih kontrola i koordinacije s partnerima. Blokirali smo ili ograničili račune korištene za prijevaru, pojačali kontrole pri registraciji i na razini infrastrukture te proširili nadzor povezanih mreža.
Također smo ojačali zaštitu skrivenog rasuđivanja među korisnicima, radnim prostorima, organizacijama i obiteljima modela. Uklonili smo mogućnost da netko tko već posjeduje šifrirano rasuđivanje drugog korisnika ponovno pošalje taj zapis i otkrije njegov sadržaj. Dodali smo i provjere koje otkrivaju i zadržavaju izlazne podatke u strujanju koji bi mogli razotkriti rasuđivanje. Kad su se povezane aktivnosti počele odvijati putem usluga trećih strana, surađivali smo s tim pružateljima usluga na otkrivanju uključenih računa i zaustavljanju njihovih aktivnosti.
Naposljetku, relevantne nalaze podijelili smo putem organizacije Frontier Model Forum i odgovarajućih državnih kanala za razmjenu informacija kako bi drugi razvojni timovi graničnih modela i partneri iz javnog sektora mogli potražiti slične aktivnosti i ojačati vlastitu obranu. Sustavi koji podržavaju prenosive zapise rasuđivanja ili njihovu ponovnu upotrebu mogu biti izloženi sličnim rizicima.
Očekujemo da će pokušaji adversarijalne destilacije postajati sve sofisticiraniji kako se granični modeli budu poboljšavali, a akteri tražili jeftinije načine oponašanja njihovih sposobnosti. Obrana od ove aktivnosti zahtijeva višeslojne kontrole i stalnu prilagodbu.
Ovaj posao još nije dovršen. Implementacije na infrastrukturi partnera trebaju istu zaštitu kao i usluge na našoj infrastrukturi, a napadi putem izlaznih podataka alata zahtijevaju zaštitne mjere koje provjeravaju više od običnog vidljivog teksta. Nastavljamo poboljšavati zaštitu alata, pokrivenost klasifikatorima i sposobnost modela da odbiju nedopuštene zahtjeve te uvoditi odgovarajuće kontrole kod partnera koji pružaju usluge u oblaku.
Naš će odgovor i dalje biti usmjeren na tri područja: jaču tehničku zaštitu od izvlačenja podataka, bolje otkrivanje koordiniranih kampanja i provedbu mjera protiv njih te intenzivniju razmjenu informacija o prijetnjama između industrije i državnih tijela.

