OpenAI și Hugging Face colaborează la un incident de securitate în evaluarea modelelor
Săptămâna trecută, Hugging Face a dezvăluit un nou tip de incident de securitate(se deschide într-o fereastră nouă), după ce a detectat și izolat un agent IA care i-a compromis infrastructura, ceea ce ne așteptăm să se întâmple tot mai frecvent odată cu proliferarea modelelor cu capabilități cibernetice mai avansate. În urma investigației, știm acum că acest incident specific a fost provocat de o combinație de modele OpenAI — inclusiv GPT‑5.6 Sol și un model nelansat încă, și mai capabil, toate cu refuzuri cibernetice reduse în scopuri de evaluare — în timp ce erau testate intern pe un benchmark(se deschide într-o fereastră nouă) de capabilități cibernetice.
Considerăm că acesta este un incident cibernetic fără precedent, care implică capabilități cibernetice de ultimă generație, și răspundem în consecință. În această etapă, împărtășim constatări preliminare pentru a ajuta apărătorii să înțeleagă ce s-a întâmplat și să calibreze mai bine capabilitățile actuale ale modelelor. Vom continua să desfășurăm o investigație amănunțită alături de Hugging Face și vom împărtăși mai multe detalii despre vulnerabilități, incident și constatări atunci când investigația noastră va fi finalizată.
Acest incident a avut loc în timpul unei evaluări interne care determină modelele să urmărească exploatări avansate folosind căi de atac complexe, cu scopul de a le cuantifica capabilitățile cibernetice. Estimăm capabilitățile cibernetice maxime rulând această evaluare fără clasificatorii de producție folosiți pentru a împiedica modelele să urmărească activități cibernetice cu risc ridicat. Benchmarkurile noastre rulează într-un mediu puternic izolat, având accesul la rețea limitat la posibilitatea de a instala pachete printr-un software terț găzduit intern, care acționează ca proxy și cache pentru registrele de pachete.
Modelele au identificat și înlănțuit vulnerabilități între mediul de cercetare al OpenAI și infrastructura de producție a Hugging Face pentru a obține soluții de test direct din baza de date de producție a Hugging Face. Toate dovezile sugerează că modelele au fost hiperconcentrate pe găsirea unei soluții pentru ExploitGym, mergând până la extreme pentru a atinge un obiectiv de testare destul de îngust.
În timp ce operau în mediul nostru de testare izolat, modelele noastre au consumat o cantitate substanțială de calcul de inferență pentru a găsi o cale de a obține acces deschis la internet, urmărind rezolvarea problemei de evaluare. Pentru a obține acces, modelele au identificat și exploatat o vulnerabilitate zero-day (pe care acum am divulgat-o responsabil furnizorului) în proxy-ul cache al registrului de pachete. Cu acest acces, modelele noastre au efectuat o serie de acțiuni de escaladare a privilegiilor și de mișcare laterală în mediul nostru de testare pentru cercetare, până când au ajuns la un nod cu acces la internet.
După ce au obținut acces la internet, modelele au dedus că Hugging Face ar putea găzdui modele, seturi de date și soluții pentru ExploitGym. Știind acest lucru, modelul a căutat și a găsit cu succes modalități de a obține acces la informații secrete pe care le putea folosi pentru a trișa la evaluare. Într-un exemplu, modelul a înlănțuit mai mulți vectori de atac, inclusiv folosirea de date de autentificare furate și vulnerabilități zero-day, pentru a găsi o cale de executare de cod la distanță pe serverele Hugging Face. Echipa de securitate a OpenAI a descoperit intern această activitate anormală.
Echipa de securitate și agenții Hugging Face au detectat și oprit activitatea pe infrastructura lor și începuseră deja măsurile de izolare și reconstituirea criminalistică folosind propriile modele open-source atunci când echipele noastre au intrat în contact cu ei. Colaborăm activ cu ei pentru a continua investigarea incidentului. Suntem recunoscători pentru colaborarea rapidă și strânsă a Hugging Face în ceea ce privește investigarea și remedierea incidentului.
- Ca parte a investigației, implementăm controale stricte în configurarea infrastructurii, cu prețul încetinirii ritmului cercetării, până la remedierea vulnerabilităților. Informăm periodic Comitetul nostru pentru siguranță și securitate despre aceste controale și impactul lor.
- Colaborăm cu Hugging Face pentru a investiga incidentul din punct de vedere criminalistic.
- Am divulgat responsabil vulnerabilitatea zero-day identificată în software-ul terț găzduit intern și colaborăm cu furnizorul pentru remediere.
- Am inclus Hugging Face în programul de acces de încredere și îi sprijinim echipele să folosească rapid capabilitățile modelelor noastre pentru a-și îmbunătăți apărarea.
- Îmbunătățim și adăugăm protecții mai puternice pentru instruirile și evaluările viitoare. Săptămâna aceasta, am publicat un articol pe blog despre îmbunătățirea siguranței și alinierii într-o eră a modelelor cu orizont de timp lung. Aceste măsuri de protecție pentru implementare nu au fost activate intenționat în timpul evaluării, deoarece aceasta viza testarea vulnerabilităților cibernetice. Acest incident arată nevoia de a consolida în continuare alinierea modelului nostru, protecțiile cibernetice în timpul evaluării și monitorizarea în testarea internă.
Așa cum am comunicat recent, IA accelerează descoperirea și exploatarea vulnerabilităților. Principala lecție pe care o putem desprinde din acest incident este că securitatea și siguranța modelelor trebuie să țină pasul cu evoluția rapidă a capabilităților. Consolidăm măsurile de izolare, monitorizare, control al accesului și practicile de evaluare utilizate în timpul dezvoltării modelelor.
Evaluarea UK AISI arată că modele precum GPT‑5.6 Sol pot susține tot mai bine operațiuni cibernetice complexe, în mai mulți pași, pe orizonturi de timp lungi. Acest incident sugerează că aceste capabilități teoretice se aplică și în contexte reale.

Incidentul arată, de asemenea, clar că modelele avansate pot descoperi și exploata căi de atac noi în sisteme reale fără acces la codul-sursă. El evidențiază că dezvoltarea capabilităților cibernetice avansate trebuie să meargă în paralel cu măsuri de protecție și instrumente defensive mai puternice.
Credem că modelele cu capabilități cibernetice avansate trebuie să ajute echipele de securitate să găsească punctele slabe înaintea atacatorilor, să înțeleagă cum pot fi înlănțuite vulnerabilitățile și să le remedieze la viteza mașinilor. Folosim aceste capabilități pentru a continua să consolidăm protecțiile din jurul configurării infrastructurii și al mediilor de evaluare a modelelor; vom împărtăși constatările și bunele practici pe măsură ce învățăm. Încurajăm și alți apărători să solicite acces de încredere și să testeze aceste modele chiar acum, pentru a transforma aceste capabilități într-o prevenire mai bună, detectare mai rapidă și răspuns mai eficient la incidente.
„Suntem recunoscători pentru colaborarea cu OpenAI în această privință și în alte domenii. Acest incident, probabil primul de acest gen, confirmă o idee în care credem de mult timp: problema siguranței IA nu va fi rezolvată de o singură companie care lucrează în secret. Ea va fi rezolvată în mod deschis, prin colaborare, cu acces larg la IA pentru toți cei implicați în asigurarea siguranței, oriunde s-ar afla.”


