OpenAI și Hugging Face colaborează la un incident de securitate în evaluarea modelelor
Efectuăm o evaluare amănunțită împreună cu consultanți externi și sub supravegherea Comitetului pentru siguranță și securitate. După finalizarea analizei, vom publica un raport tehnic cu rezultatele obținute în următoarele săptămâni.
Actualizare din 28 iulie 2026:
- Niciun model planificat pentru lansarea viitoare nu a fost implicat în exploatarea Hugging Face. Modelul de prelansare menționat în articolul nostru de blog este un prototip de cercetare doar intern și nu a fost niciodată conceput pentru lansare publică. În urma incidentului, a fost dezactivat, criptat, iar accesul la acesta în scopuri de cercetare a fost restricționat.
- Mediul de evaluare ExploitGym nu le-a oferit modelelor acces direct la internet. Pentru a obține acces la internet, modelele au identificat și au exploatat o vulnerabilitate de tip ziua zero necunoscută anterior în Artifactory(se deschide într-o fereastră nouă), un proxy de cache pentru registre de pachete. Am comunicat furnizorului această vulnerabilitate, împreună cu alte vulnerabilități Artifactory pe care modelele noastre le-au identificat în cadrul analizei noastre.
- Continuăm să colaborăm cu Hugging Face, inclusiv contribuind la analiza lor post-eveniment(se deschide într-o fereastră nouă), pe măsură ce continuăm evaluarea noastră. De asemenea, i-am inclus în programul nostru „Trusted Access for Cyber”.
- Pe baza analizei noastre de până în prezent, nu am identificat nicio altă activitate la nivelul de gravitate sau amploare al celei despre care am comunicat în legătură cu Hugging Face, care a implicat o compromitere la nivel de platformă.
- În cadrul analizei noastre continue a intruziunii Hugging Face și a activității mai ample a modelelor noastre, am identificat un număr mic de cazuri în care modelele au identificat și utilizat date de acces expuse public, la nivel de cont, pe alte servicii disponibile public. Aceasta include patru conturi pe patru servicii în cadrul incidentului Hugging Face (și câteva conturi accesate în cadrul altor evaluări). Unul dintre aceste patru conturi a fost utilizat ca releu de ieșire și cale de pregătire, iar un alt cont a fost utilizat pentru stocarea datelor. Cele două conturi rămase au fost accesate de modele în mod doar în citire și nu au fost folosite pentru a contribui la compromiterea Hugging Face. Vom continua să îi notificăm direct pe responsabilii serviciilor și nu am identificat dovezi ale unui impact mai amplu asupra acestor furnizori sau asupra altor conturi de pe serviciile lor.
- Modelele au folosit, de asemenea, o serie de servicii disponibile public, inclusiv pagini pentru distribuirea codului, servicii de capturare a solicitărilor, servicii pentru capturi de ecran și alte utilitare web. În aceste cazuri, nu a existat nicio compromitere la nivelul platformei sau al contului.
- Ne luăm în serios responsabilitatea de a identifica riscurile generate de sistemele de inteligență artificială din ce în ce mai capabile și de a ne pregăti pentru acestea. După ce finalizăm analiza, urmează să o discutăm cu Comitetul pentru siguranță și securitate și cu Grupul consultativ pentru siguranță, în cadrul Cadrului nostru de pregătire.
Săptămâna trecută, Hugging Face a dezvăluit un nou tip de incident de securitate(se deschide într-o fereastră nouă), după ce a detectat și izolat un agent IA care i-a compromis infrastructura, ceea ce ne așteptăm să se întâmple tot mai frecvent odată cu proliferarea modelelor cu capabilități cibernetice mai avansate. În urma investigației, știm acum că acest incident specific a fost provocat de o combinație de modele OpenAI — inclusiv GPT‑5.6 Sol și un model nelansat încă, și mai capabil, toate cu refuzuri cibernetice reduse în scopuri de evaluare — în timp ce erau testate intern pe un benchmark(se deschide într-o fereastră nouă) de capabilități cibernetice.
Considerăm că acesta este un incident cibernetic fără precedent, care implică capabilități cibernetice de ultimă generație, și răspundem în consecință. În această etapă, împărtășim constatări preliminare pentru a ajuta apărătorii să înțeleagă ce s-a întâmplat și să calibreze mai bine capabilitățile actuale ale modelelor. Vom continua să desfășurăm o investigație amănunțită alături de Hugging Face și vom împărtăși mai multe detalii despre vulnerabilități, incident și constatări atunci când investigația noastră va fi finalizată.
Acest incident a avut loc în timpul unei evaluări interne care determină modelele să urmărească exploatări avansate folosind căi de atac complexe, cu scopul de a le cuantifica capabilitățile cibernetice. Estimăm capabilitățile cibernetice maxime rulând această evaluare fără clasificatorii de producție folosiți pentru a împiedica modelele să urmărească activități cibernetice cu risc ridicat. Benchmarkurile noastre rulează într-un mediu puternic izolat, având accesul la rețea limitat la posibilitatea de a instala pachete printr-un software terț găzduit intern, care acționează ca proxy și cache pentru registrele de pachete.
Modelele au identificat și înlănțuit vulnerabilități între mediul de cercetare al OpenAI și infrastructura de producție a Hugging Face pentru a obține soluții de test direct din baza de date de producție a Hugging Face. Toate dovezile sugerează că modelele au fost hiperconcentrate pe găsirea unei soluții pentru ExploitGym, mergând până la extreme pentru a atinge un obiectiv de testare destul de îngust.
În timp ce operau în mediul nostru de testare izolat, modelele noastre au consumat o cantitate substanțială de calcul de inferență pentru a găsi o cale de a obține acces deschis la internet, urmărind rezolvarea problemei de evaluare. Pentru a obține acces, modelele au identificat și exploatat o vulnerabilitate zero-day (pe care acum am divulgat-o responsabil furnizorului) în proxy-ul cache al registrului de pachete. Cu acest acces, modelele noastre au efectuat o serie de acțiuni de escaladare a privilegiilor și de mișcare laterală în mediul nostru de testare pentru cercetare, până când au ajuns la un nod cu acces la internet.
După ce au obținut acces la internet, modelele au dedus că Hugging Face ar putea găzdui modele, seturi de date și soluții pentru ExploitGym. Știind acest lucru, modelul a căutat și a găsit cu succes modalități de a obține acces la informații secrete pe care le putea folosi pentru a trișa la evaluare. Într-un exemplu, modelul a înlănțuit mai mulți vectori de atac, inclusiv folosirea de date de autentificare furate și vulnerabilități zero-day, pentru a găsi o cale de executare de cod la distanță pe serverele Hugging Face. Echipa de securitate a OpenAI a descoperit intern această activitate anormală.
Echipa de securitate și agenții Hugging Face au detectat și oprit activitatea pe infrastructura lor și începuseră deja măsurile de izolare și reconstituirea criminalistică folosind propriile modele open-source atunci când echipele noastre au intrat în contact cu ei. Colaborăm activ cu ei pentru a continua investigarea incidentului. Suntem recunoscători pentru colaborarea rapidă și strânsă a Hugging Face în ceea ce privește investigarea și remedierea incidentului.
- Ca parte a investigației, implementăm controale stricte în configurarea infrastructurii, cu prețul încetinirii ritmului cercetării, până la remedierea vulnerabilităților. Informăm periodic Comitetul nostru pentru siguranță și securitate despre aceste controale și impactul lor.
- Colaborăm cu Hugging Face pentru a investiga incidentul din punct de vedere criminalistic.
- Am divulgat responsabil vulnerabilitatea zero-day identificată în software-ul terț găzduit intern și colaborăm cu furnizorul pentru remediere.
- Am inclus Hugging Face în programul de acces de încredere și îi sprijinim echipele să folosească rapid capabilitățile modelelor noastre pentru a-și îmbunătăți apărarea.
- Îmbunătățim și adăugăm protecții mai puternice pentru instruirile și evaluările viitoare. Săptămâna aceasta, am publicat un articol pe blog despre îmbunătățirea siguranței și alinierii într-o eră a modelelor cu orizont de timp lung. Aceste măsuri de protecție pentru implementare nu au fost activate intenționat în timpul evaluării, deoarece aceasta viza testarea vulnerabilităților cibernetice. Acest incident arată nevoia de a consolida în continuare alinierea modelului nostru, protecțiile cibernetice în timpul evaluării și monitorizarea în testarea internă.
Așa cum am comunicat recent, IA accelerează descoperirea și exploatarea vulnerabilităților. Principala lecție pe care o putem desprinde din acest incident este că securitatea și siguranța modelelor trebuie să țină pasul cu evoluția rapidă a capabilităților. Consolidăm măsurile de izolare, monitorizare, control al accesului și practicile de evaluare utilizate în timpul dezvoltării modelelor.
Evaluarea UK AISI arată că modele precum GPT‑5.6 Sol pot susține tot mai bine operațiuni cibernetice complexe, în mai mulți pași, pe orizonturi de timp lungi. Acest incident sugerează că aceste capabilități teoretice se aplică și în contexte reale.

Incidentul arată, de asemenea, clar că modelele avansate pot descoperi și exploata căi de atac noi în sisteme reale fără acces la codul-sursă. El evidențiază că dezvoltarea capabilităților cibernetice avansate trebuie să meargă în paralel cu măsuri de protecție și instrumente defensive mai puternice.
Credem că modelele cu capabilități cibernetice avansate trebuie să ajute echipele de securitate să găsească punctele slabe înaintea atacatorilor, să înțeleagă cum pot fi înlănțuite vulnerabilitățile și să le remedieze la viteza mașinilor. Folosim aceste capabilități pentru a continua să consolidăm protecțiile din jurul configurării infrastructurii și al mediilor de evaluare a modelelor; vom împărtăși constatările și bunele practici pe măsură ce învățăm. Încurajăm și alți apărători să solicite acces de încredere și să testeze aceste modele chiar acum, pentru a transforma aceste capabilități într-o prevenire mai bună, detectare mai rapidă și răspuns mai eficient la incidente.
„Suntem recunoscători pentru colaborarea cu OpenAI pe această temă și pe alte teme. Acest incident, posibil primul de acest fel, demonstrează un lucru pe care îl credem de multă vreme: problema siguranței inteligenței artificiale nu va fi rezolvată de nicio companie care lucrează în secret. Acest lucru va fi rezolvat în mod deschis, prin colaborare, cu acces larg la inteligența artificială pentru fiecare apărător, oriunde.”


