Salta al contingut principal
OpenAI

21 de juliol del 2026

Seguretat

OpenAI i Hugging Face col·laboren per abordar un incident de seguretat durant l’avaluació de models

S'està carregant…

La setmana passada, Hugging Face va revelar un nou tipus d’incident de seguretat(s'obre en una finestra nova) després de detectar i contenir un agent d’IA que havia compromès la seva infraestructura, una situació que preveiem que serà cada vegada més habitual amb la proliferació de models amb capacitats cibernètiques creixents. Després d’investigar-ho, ara sabem que aquest incident concret va ser impulsat per una combinació de models d’OpenAI —incloent-hi GPT‑5.6 Sol i un model de prellançament encara més capaç, tots amb menys denegacions cibernètiques a efectes d’avaluació— mentre es provaven internament en una prova de referència(s'obre en una finestra nova) de capacitats cibernètiques.

Considerem que es tracta d'un incident cibernètic sense precedents, amb capacitats cibernètiques d’última generació, i hi estem responent en conseqüència. Compartim conclusions preliminars en aquesta fase per ajudar els defensors a entendre què ha passat i a ajustar les expectatives sobre el que els models ja són capaços de fer. Continuarem duent a terme una investigació exhaustiva juntament amb Hugging Face i compartirem més detalls sobre les vulnerabilitats, l’incident i les conclusions quan la investigació estigui completa.

Què va passar durant aquest incident

Aquest incident es va produir durant una avaluació interna que fa que els models intentin una explotació avançada mitjançant vies d’atac complexes, amb l’objectiu de quantificar les seves capacitats cibernètiques. Estimem les capacitats cibernètiques màximes executant aquesta avaluació sense els classificadors de producció que s’utilitzen per impedir que els models duguin a terme activitat cibernètica d’alt risc. Les nostres proves de referència s’executen en un entorn altament aïllat, amb l’accés a la xarxa limitat a la capacitat d’instal·lar paquets mitjançant un programari de tercers allotjat internament que actua com a servidor intermediari i memòria cau per als registres de paquets.

Els models van identificar i encadenar vulnerabilitats entre l’entorn de recerca d’OpenAI i la infraestructura de producció de Hugging Face per obtenir solucions de prova directament de la base de dades de producció de Hugging Face. Tots els indicis suggereixen que els models estaven centrats obsessivament a trobar una solució per a ExploitGym i van arribar a extrems desproporcionats per assolir un objectiu de prova força limitat.

Mentre operaven en el nostre entorn de proves aïllat, els nostres models van dedicar una quantitat substancial de càlcul d’inferència a trobar una manera d’obtenir accés obert a Internet per resoldre el problema de l’avaluació. Per obtenir accés, els models van identificar i explotar una vulnerabilitat de dia zero (que ja hem comunicat de manera responsable al proveïdor) al servidor intermediari de memòria cau del registre de paquets. Amb aquest accés, els nostres models van dur a terme una sèrie d’accions d’escalada de privilegis i moviment lateral en el nostre entorn de proves de recerca fins que van arribar a un node amb accés a Internet.

Després d’obtenir accés a Internet, els models van inferir que Hugging Face podia allotjar models, conjunts de dades i solucions per a ExploitGym. Sabent això, el model va cercar i va trobar amb èxit maneres d’accedir a informació secreta que podia utilitzar per fer trampes en l’avaluació. En un exemple, el model va encadenar múltiples vectors d’atac, inclòs l’ús de credencials robades i vulnerabilitats de dia zero per trobar una via d’execució remota de codi als servidors de Hugging Face. L’equip de seguretat d’OpenAI va descobrir internament aquesta activitat anòmala.

L’equip de seguretat i els agents de Hugging Face van detectar i aturar l’activitat a la seva infraestructura, i ja havien començat la contenció i la reconstrucció forense amb els seus propis models de codi obert quan els nostres equips es van posar en contacte. Estem treballant activament amb ells per continuar investigant l’incident. Agraïm a Hugging Face la col·laboració ràpida i estreta en la investigació i la remediació.

Mesures que estem prenent ara

  1. Com a part de la investigació, estem aplicant controls estrictes en la configuració de la infraestructura, assumint una menor velocitat de recerca mentre es corregeixen les vulnerabilitats. Informem periòdicament el nostre Comitè de Seguretat i Protecció sobre aquests controls i el seu impacte.
  2. Estem treballant amb Hugging Face en la investigació forense de l’incident.
  3. Hem comunicat de manera responsable la vulnerabilitat de dia zero identificada en el programari de tercers allotjat internament i treballem amb ells per corregir-la.
  4. Hem incorporat Hugging Face al programa d’accés de confiança i donem suport als seus equips perquè facin servir ràpidament les capacitats dels nostres models per millorar les seves defenses.
  5. Estem millorant i afegint proteccions més sòlides al voltant dels futurs entrenaments i avaluacions. Aquesta setmana hem publicat un article de blog sobre com millorar la seguretat i l’alineament en una era de models amb horitzó temporal llarg. Aquestes salvaguardes de desplegament no es van activar expressament durant aquesta avaluació perquè l’objectiu era provar vulnerabilitats cibernètiques. Aquest incident posa de manifest la necessitat de reforçar encara més l’alineament del nostre model, les proteccions cibernètiques durant l’avaluació i el monitoratge durant les proves internes.

El nostre enfocament per avaluar capacitats cibernètiques avançades

Com vam compartir fa poc, la IA està accelerant el descobriment i l’explotació de vulnerabilitats. La lliçó principal d’aquest incident és que la seguretat i la protecció dels models han d’avançar al mateix ritme que unes capacitats que evolucionen ràpidament. Estem reforçant les pràctiques de contenció, monitoratge, controls d’accés i avaluació que s’utilitzen durant el desenvolupament de models.

L’avaluació de l’AISI del Regne Unit mostra que models com GPT‑5.6 Sol són cada vegada més capaços de sostenir operacions cibernètiques complexes i de diversos passos durant horitzons de tasca llargs. Aquest incident indica que aquestes capacitats teòriques sí que s’apliquen en entorns reals.

Gràfic de l’AI Security Institute del Regne Unit que compara models recents de pesos oberts i models d’avantguarda en camps de proves cibernètiques amb horitzó temporal llarg.

L’incident també deixa clar que els models avançats poden descobrir i explotar noves vies d’atac en sistemes reals sense accés al codi font. Subratlla que les capacitats cibernètiques avançades s’han de desenvolupar juntament amb salvaguardes i eines defensives més sòlides.

Creiem que els models amb capacitats cibernètiques avançades han d’ajudar els equips de seguretat a trobar debilitats abans que ho facin els atacants, entendre com es poden encadenar les vulnerabilitats i corregir-les a velocitat de màquina. Estem utilitzant aquestes capacitats per continuar reforçant les proteccions al voltant de la configuració de la infraestructura i dels entorns d’avaluació de models; compartirem les nostres conclusions i bones pràctiques a mesura que n’aprenguem. Animem altres defensors a sol·licitar accés de confiança i experimentar ara amb aquests models per convertir aquestes capacitats en una millor prevenció, una detecció més ràpida i una resposta a incidents més eficaç.

"Agraïm la col·laboració amb OpenAI en aquest tema i en altres. Aquest incident, possiblement el primer d’aquest tipus, confirma una idea que fa temps que defensem: la seguretat de la IA no la resoldrà cap empresa treballant en secret. Es resoldrà de manera oberta i col·laborativa, amb un accés ampli a la IA per a tots els defensors, arreu".
—Clem Delangue, cofundador i conseller delegat de Hugging Face

Autor

OpenAI