Preskočite na glavni sadržaj
OpenAI

30. septembar 2026.

Zaštita

Suzbijanje koordinirane kampanje destilacije modela

Učitavanje…

Nedavno smo otkrili i suzbili koordiniranu kampanju čiji je cilj bio izvlačenje zaštićenog rezonovanja iz naših modela. Najranije uočene aktivnosti zabilježene su u prvoj sedmici jula. Ova aktivnost odgovara obrascu zlonamjerne destilacije: sistematskog i neovlaštenog korištenja izlaznih podataka ili rezonovanja jednog modela radi obuke, reprodukcije ili poboljšanja drugog modela. Zaštićeno rezonovanje je interni zapis modela o procesu rješavanja zadatka. Njegovo izvlačenje može otkriti informacije izostavljene iz konačnog odgovora i pomoći drugima da reproduciraju sposobnosti modela.

Počinioci nisu probili našu enkripciju, kompromitirali bazu podataka niti dobili direktan pristup pohranjenim razgovorima korisnika. Umjesto toga, manipulirali su interakcijama s modelima kako bi se zaštićeno rezonovanje moglo reproducirati u obliku vidljivom podnosiocu zahtjeva. To su činili koordinirano i u velikom obimu, kršeći naše uslove korištenja. Ova manipulacija ne iskorištava ranjivost svojstvenu samo modelima kompanije OpenAI. Informacije o njoj podijelili smo s partnerima iz industrije putem organizacije Frontier Model Forum kako bismo ojačali zajedničku odbranu od zlonamjerne destilacije.

Prije objave istražili smo obim i mogući utjecaj, uveli vlastite mjere ublažavanja rizika te podijelili informacije s istraživačima i partnerima iz industrije i prikupili njihove povratne informacije kako bismo osigurali zaštitu od ove vrste napada. Nastavljamo istragu i rad na dodatnim mjerama ublažavanja rizika. Vjerujemo da će dijeljenje dosadašnjih saznanja pomoći širem ekosistemu da ojača svoju odbranu.

Šta smo uočili

Uočili smo pokušaje izvlačenja zaštićenog rezonovanja na nove načine. Među njima je bilo kopiranje šifriranog rezonovanja iz jednog razgovora i traženje od modela u drugom razgovoru da dešifrira i prepiše skriveni sadržaj rezonovanja.

Nezavisni istraživači sigurnosti⁠(otvara se u novom prozoru) također su nam, kroz postupak odgovornog prijavljivanja, ukazali na povezane ranjivosti koje uključuju različite modele i kompakciju razgovora. Istražili smo njihove nalaze i potvrdili da su napadi koje su identificirali zaista izvedivi. Njihov rad pomogao nam je da razumijemo širu kategoriju ovih napada i ubrzamo uvođenje mjera ublažavanja rizika.

Aktivnost je počela 1. jula, u početku u malom obimu. Zatim smo 24. i 25. jula uočili nagle skokove: više od 4.000 korisnika poslalo je 16.000 zahtjeva1 koji su koristili obrazac za izvlačenje podataka povezan s ovom aktivnošću. Daljnjom istragom utvrdili smo povezane aktivnosti s istim obrascima upita unutar grupe od više od 15.000 korisnika, koje smo u potpunosti zaustavili do 28. jula.

Aktivnost se s vremenom mijenjala, što potvrđuje da je zlonamjerna destilacija širi sigurnosni izazov koji zahtijeva višeslojnu, prilagodljivu odbranu.

Naša procjena o tome ko stoji iza aktivnosti

Nije jasno jesu li svi počinioci koje smo uočili u relevantnom periodu djelovali u ime jednog aktera. Međutim, središnju grupu aktivnosti pripisujemo pojedincima povezanim s kompanijom Moonshot AI, koja razvija Kimi.

Zašto je ovo važno

Zlonamjerna destilacija predstavlja rizik za sigurnost primjene modela i nacionalnu sigurnost. Izvučeno rezonovanje moglo bi se koristiti za obuku drugog modela bez zadržavanja zaštitnih mjera koje se primjenjuju na izlazne podatke izvornog modela namijenjene korisnicima. Destilacija u velikom obimu može i ubrzati prijenos naprednih sposobnosti bez potrebe za jednakim ulaganjem u sigurnost. Ova zabrinutost raste kako modeli stječu sposobnosti u oblastima s dvojnom namjenom.

Ovaj rizik nije svojstven samo kompaniji OpenAI. Kao što je već navedeno, slične tehnike mogu utjecati i na druge napredne AI sisteme, pa je ovo zajednički sigurnosni izazov koji zahtijeva koordinaciju cijele industrije.

Kako smo reagirali

Ovu nedavnu kampanju destilacije suzbili smo kombinacijom mjera protiv korisničkih računa, tehničkih kontrola i koordinacije s partnerima. Blokirali smo ili ograničili račune korištene za prevaru, pooštrili kontrole pri registraciji i u infrastrukturi te proširili praćenje povezanih mreža.

Također smo ojačali zaštitu skrivenog rezonovanja na nivou korisnika, radnih prostora, organizacija i porodica modela. Zatvorili smo put napada koji je osobi koja već posjeduje šifrirano rezonovanje drugog korisnika omogućavao da ga ponovo pošalje i otkrije njegov sadržaj. Dodali smo i provjere koje otkrivaju i zadržavaju izlazni sadržaj tokom postupnog slanja ako bi mogao otkriti rezonovanje. Kada se povezana aktivnost premjestila na usluge trećih strana, sarađivali smo s tim pružaocima usluga kako bismo identificirali uključene račune i zaustavili njihove aktivnosti.

Na kraju smo relevantne nalaze podijelili putem organizacije Frontier Model Forum i odgovarajućih državnih kanala za razmjenu informacija kako bi drugi razvojni timovi graničnih modela i partneri iz javnog sektora mogli potražiti slične aktivnosti i ojačati vlastitu odbranu. Sistemi koji podržavaju prenosive zapise rezonovanja ili njihovo ponovno korištenje mogu se suočiti sa sličnim rizicima.

Šta slijedi

Očekujemo da će pokušaji zlonamjerne destilacije postajati sve sofisticiraniji kako granični modeli budu napredovali, a akteri tražili jeftinije načine da oponašaju njihove sposobnosti. Odbrana od ovih aktivnosti zahtijeva višeslojne kontrole i stalno prilagođavanje.

Ovaj posao nije završen. Sistemi koje hostuju partneri trebaju istu zaštitu kao i naše vlastite usluge, a napadi putem izlaznih podataka alata zahtijevaju zaštitne mjere koje analiziraju više od običnog vidljivog teksta. Nastavljamo poboljšavati zaštitu alata, obuhvat klasifikatora i sposobnost modela da odbiju nedozvoljene zahtjeve te uvoditi odgovarajuće kontrole kod partnera za usluge u oblaku.

Naš odgovor i dalje će biti usmjeren na tri oblasti: jaču tehničku zaštitu od izvlačenja podataka, bolje otkrivanje koordiniranih kampanja i provođenje mjera protiv njih te intenzivniju razmjenu informacija o prijetnjama među industrijom i državnim institucijama.

Autor

OpenAI

Fusnote

  1. 1

    Ove brojke odnose se na pokušaje izvlačenja podataka, koji nisu nužno bili uspješni.