Sari la conținutul principal
OpenAI

30 septembrie 2026

Securitate

Oprirea unei campanii coordonate de distilare a modelelor

Se încarcă…

Am identificat și am oprit recent o campanie coordonată menită să extragă raţionamentul protejat al modelelor noastre. Primele activități au fost observate în prima săptămână din iulie. Această activitate corespunde distilării adversariale: utilizarea sistematică și neautorizată a rezultatelor sau a raţionamentului unui model pentru a contribui la antrenarea, reproducerea sau îmbunătățirea altui model. Raţionamentul protejat este înregistrarea internă a pașilor pe care modelul îi parcurge pentru a rezolva o sarcină; extragerea lui poate dezvălui informații omise din răspunsul final și îi poate ajuta pe alții să reproducă capacitățile modelului.

Autorii acestor activități nu au spart criptarea, nu au compromis o bază de date și nu au obținut acces direct la conversațiile stocate ale utilizatorilor. În schimb, au manipulat interacțiunile cu modelele astfel încât raţionamentul protejat să poată fi reprodus în forme vizibile pentru solicitant, într-un mod coordonat și la scară largă, încălcând condițiile noastre de utilizare. Această manipulare nu exploatează o vulnerabilitate specifică doar modelelor OpenAI. Am transmis informații despre ea partenerilor din industrie prin intermediul Frontier Model Forum, pentru a consolida apărarea colectivă împotriva distilării adversariale.

Înainte de publicare, am investigat amploarea și impactul potențial, am implementat propriile măsuri de atenuare și am împărtășit constatările cu cercetători și parteneri din industrie, ținând cont de observațiile lor pentru a ne asigura că există protecții împotriva acestui tip de atac. Continuăm investigațiile și implementarea unor măsuri suplimentare de atenuare. Credem că împărtășirea acum a celor învățate va ajuta întregul ecosistem să își consolideze apărarea.

Ce am observat

Am observat tentative de extragere a raţionamentului protejat prin metode noi, inclusiv prin copierea raţionamentului criptat dintr-o conversație și solicitarea ca un model din altă conversație să decripteze și să transcrie conținutul ascuns al acestuia.

Cercetători independenți în securitate⁠(se deschide într-o fereastră nouă) ne-au semnalat, de asemenea, prin divulgare responsabilă, vulnerabilități conexe care implică interacțiuni între modele și compactarea conversațiilor. Am investigat constatările lor și am confirmat că vectorii de atac identificați erau reali. Munca lor ne-a ajutat să înțelegem categoria mai largă de atacuri și să accelerăm implementarea măsurilor de atenuare.

Activitatea a început pe 1 iulie, inițial la un volum redus. Pe 24 și 25 iulie am observat creșteri bruște ale volumului, totalizând 16.000 de cereri1 de la peste 4.000 de utilizatori, care foloseau un tipar de extragere relevant. Investigațiile ulterioare au identificat activități conexe bazate pe tipare de solicitări într-un grup de peste 15.000 de utilizatori. Până pe 28 iulie, am oprit complet aceste activități.

Activitatea a evoluat în timp, confirmând că distilarea adversarială este o problemă de securitate mai amplă, care necesită măsuri de apărare pe mai multe niveluri, capabile să se adapteze.

Evaluarea noastră privind atribuirea activității

Nu este clar dacă toți cei implicați în activitățile observate în perioada respectivă acționau în numele aceleiași entități. Totuși, atribuim un nucleu central al acestor activități unor persoane asociate cu Moonshot AI, dezvoltatorul Kimi.

De ce este important

Distilarea adversarială prezintă riscuri pentru siguranță și securitatea națională. Raţionamentul extras ar putea fi folosit pentru a antrena un alt model fără a păstra măsurile de protecție aplicate rezultatelor pe care modelul original le oferă utilizatorilor. La scară largă, distilarea poate accelera și transferul de capacități avansate, fără a necesita aceleași investiții în siguranță. Aceste preocupări se accentuează pe măsură ce modelele dobândesc capacități în domenii cu utilizare duală.

Acest risc nu este specific doar OpenAI. După cum am menționat mai sus, tehnici similare pot afecta și alte sisteme avansate de IA. Prin urmare, aceasta este o problemă comună de securitate, care necesită coordonare la nivelul întregii industrii.

Cum am răspuns

Am contracarat această campanie recentă de distilare printr-o combinație de măsuri împotriva conturilor implicate, controale tehnice și coordonare cu partenerii. Am interzis sau am restricționat conturile frauduloase, am consolidat controalele la înregistrare și la nivelul infrastructurii și am extins monitorizarea rețelelor conexe.

Am consolidat și protecțiile raţionamentului ascuns la nivelul utilizatorilor, spațiilor de lucru, organizațiilor și familiilor de modele. Am eliminat un vector de atac care permitea unei persoane ce deținea deja raţionamentul criptat al altui utilizator să îl retransmită și să îi recupereze conținutul. Am adăugat și verificări pentru a detecta și a reține rezultatele transmise în flux care ar putea dezvălui raţionamentul. Când activități conexe s-au mutat pe servicii terțe, am colaborat cu furnizorii respectivi pentru a identifica conturile implicate și a le opri activitatea.

În cele din urmă, am transmis constatările relevante prin Frontier Model Forum și prin canalele guvernamentale corespunzătoare de schimb de informații, pentru ca alți dezvoltatori de modele de vârf și parteneri din sectorul public să poată căuta activități similare și să își consolideze propriile măsuri de apărare. Sistemele care acceptă artefacte de raţionament portabile sau care pot fi retransmise se pot confrunta cu riscuri similare.

Ce urmează

Ne așteptăm ca tentativele de distilare adversarială să devină mai sofisticate pe măsură ce modelele de vârf se îmbunătățesc, iar cei implicați caută modalități mai ieftine de a le imita capacitățile. Apărarea împotriva acestei activități necesită controale pe mai multe niveluri și adaptare continuă.

Aceste eforturi nu s-au încheiat. Implementările găzduite de parteneri au nevoie de aceleași protecții ca serviciile furnizate direct, iar atacurile prin rezultatele instrumentelor necesită protecții care să examineze mai mult decât textul vizibil obișnuit. Continuăm să îmbunătățim protecția instrumentelor, acoperirea clasificatoarelor și refuzurile modelelor și să extindem controalele relevante la partenerii cloud.

Răspunsul nostru va continua să se concentreze pe trei direcții: protecții tehnice mai puternice împotriva extragerii, o mai bună detectare și contracarare a campaniilor coordonate și un schimb mai aprofundat de informații despre amenințări între industrie și autorități.

Autor

OpenAI

Note de subsol

  1. 1

    Aceste cifre se referă la tentative de extragere, nu neapărat la extrageri reușite.