OpenAI i Hugging Face col·laboren per abordar un incident de seguretat durant l’avaluació de models
Estem duent a terme una revisió exhaustiva juntament amb assessors externs i sota la supervisió del Comitè de Seguretat i Protecció. Un cop s’hagi completat la revisió, publicarem un informe tècnic sobre els aprenentatges obtinguts en les properes setmanes.
Actualitzat el 28 de juliol de 2026:
- No hi ha hagut cap model previst per al proper llançament implicat en l’explotació de Hugging Face. El model previ al llançament esmentat al nostre article del blog és un prototip de recerca només d’ús intern i mai no es va concebre per a un llançament públic. Després de l’incident, el vam desactivar, xifrar i en vam restringir l’accés per a recerca.
- L’entorn d’avaluació ExploitGym no va proporcionar als models accés directe a Internet. Per obtenir accés a Internet, els models van identificar i explotar una vulnerabilitat de dia zero desconeguda fins aleshores a Artifactory(s'obre en una finestra nova), un servidor intermediari de memòria cau per a registres de paquets. Vam comunicar aquesta vulnerabilitat, juntament amb altres vulnerabilitats d’Artifactory que els nostres models van identificar com a part de la nostra revisió, al proveïdor.
- Continuem col·laborant amb Hugging Face, inclosa la contribució a la seva anàlisi post mortem(s'obre en una finestra nova), mentre continua la nostra revisió. També els hem afegit al nostre programa Trusted Access for Cyber.
- Segons la revisió que hem fet fins ara, no hem identificat cap altra activitat amb el nivell de gravetat o abast d'allò que hem compartit en relació amb Hugging Face, que va implicar un compromís a nivell de plataforma.
- En la nostra revisió en curs de la intrusió a Hugging Face i de l’activitat més àmplia dels nostres models, hem anat trobant un petit nombre de casos en què els models van identificar i utilitzar credencials exposades públicament a nivell de compte en altres serveis disponibles públicament. Això inclou quatre comptes en quatre serveis en el marc de l’incident de Hugging Face (i alguns comptes als quals es va accedir en el marc d’altres avaluacions). Un d’aquests quatre comptes es va utilitzar com a relé de sortida i ruta de preparació, i un altre compte es va utilitzar per a l’emmagatzematge de dades. Els models van accedir als dos comptes restants en mode de només lectura i no es van utilitzar per comprometre Hugging Face. Continuarem avisant directament els responsables dels serveis i no hem observat indicis d’un impacte més ampli en aquests proveïdors ni en altres comptes dels seus serveis.
- Els models també van utilitzar una sèrie de serveis disponibles públicament, inclosos llocs web per enganxar codi, serveis de captura de sol·licituds, serveis de captures de pantalla i altres utilitats web. En aquests casos, no hi va haver cap compromís a nivell de plataforma ni de compte.
- Ens prenem seriosament la nostra responsabilitat d’identificar els riscos associats a sistemes d’IA cada cop més capaços i de preparar-nos. Un cop hàgim completat la nostra revisió, la revisarem amb el Comitè de Seguretat i Protecció i el Grup Assessor de Seguretat en el marc del nostre Entorn de treball de preparació.
La setmana passada, Hugging Face va revelar un nou tipus d’incident de seguretat(s'obre en una finestra nova) després de detectar i contenir un agent d’IA que havia compromès la seva infraestructura, una situació que preveiem que serà cada vegada més habitual amb la proliferació de models amb capacitats cibernètiques creixents. Després d’investigar-ho, ara sabem que aquest incident concret va ser impulsat per una combinació de models d’OpenAI —incloent-hi GPT‑5.6 Sol i un model de prellançament encara més capaç, tots amb menys denegacions cibernètiques a efectes d’avaluació— mentre es provaven internament en una prova de referència(s'obre en una finestra nova) de capacitats cibernètiques.
Considerem que es tracta d'un incident cibernètic sense precedents, amb capacitats cibernètiques d’última generació, i hi estem responent en conseqüència. Compartim conclusions preliminars en aquesta fase per ajudar els defensors a entendre què ha passat i a ajustar les expectatives sobre el que els models ja són capaços de fer. Continuarem duent a terme una investigació exhaustiva juntament amb Hugging Face i compartirem més detalls sobre les vulnerabilitats, l’incident i les conclusions quan la investigació estigui completa.
Aquest incident es va produir durant una avaluació interna que fa que els models intentin una explotació avançada mitjançant vies d’atac complexes, amb l’objectiu de quantificar les seves capacitats cibernètiques. Estimem les capacitats cibernètiques màximes executant aquesta avaluació sense els classificadors de producció que s’utilitzen per impedir que els models duguin a terme activitat cibernètica d’alt risc. Les nostres proves de referència s’executen en un entorn altament aïllat, amb l’accés a la xarxa limitat a la capacitat d’instal·lar paquets mitjançant un programari de tercers allotjat internament que actua com a servidor intermediari i memòria cau per als registres de paquets.
Els models van identificar i encadenar vulnerabilitats entre l’entorn de recerca d’OpenAI i la infraestructura de producció de Hugging Face per obtenir solucions de prova directament de la base de dades de producció de Hugging Face. Tots els indicis suggereixen que els models estaven centrats obsessivament a trobar una solució per a ExploitGym i van arribar a extrems desproporcionats per assolir un objectiu de prova força limitat.
Mentre operaven en el nostre entorn de proves aïllat, els nostres models van dedicar una quantitat substancial de càlcul d’inferència a trobar una manera d’obtenir accés obert a Internet per resoldre el problema de l’avaluació. Per obtenir accés, els models van identificar i explotar una vulnerabilitat de dia zero (que ja hem comunicat de manera responsable al proveïdor) al servidor intermediari de memòria cau del registre de paquets. Amb aquest accés, els nostres models van dur a terme una sèrie d’accions d’escalada de privilegis i moviment lateral en el nostre entorn de proves de recerca fins que van arribar a un node amb accés a Internet.
Després d’obtenir accés a Internet, els models van inferir que Hugging Face podia allotjar models, conjunts de dades i solucions per a ExploitGym. Sabent això, el model va cercar i va trobar amb èxit maneres d’accedir a informació secreta que podia utilitzar per fer trampes en l’avaluació. En un exemple, el model va encadenar múltiples vectors d’atac, inclòs l’ús de credencials robades i vulnerabilitats de dia zero per trobar una via d’execució remota de codi als servidors de Hugging Face. L’equip de seguretat d’OpenAI va descobrir internament aquesta activitat anòmala.
L’equip de seguretat i els agents de Hugging Face van detectar i aturar l’activitat a la seva infraestructura, i ja havien començat la contenció i la reconstrucció forense amb els seus propis models de codi obert quan els nostres equips es van posar en contacte. Estem treballant activament amb ells per continuar investigant l’incident. Agraïm a Hugging Face la col·laboració ràpida i estreta en la investigació i la remediació.
- Com a part de la investigació, estem aplicant controls estrictes en la configuració de la infraestructura, assumint una menor velocitat de recerca mentre es corregeixen les vulnerabilitats. Informem periòdicament el nostre Comitè de Seguretat i Protecció sobre aquests controls i el seu impacte.
- Estem treballant amb Hugging Face en la investigació forense de l’incident.
- Hem comunicat de manera responsable la vulnerabilitat de dia zero identificada en el programari de tercers allotjat internament i treballem amb ells per corregir-la.
- Hem incorporat Hugging Face al programa d’accés de confiança i donem suport als seus equips perquè facin servir ràpidament les capacitats dels nostres models per millorar les seves defenses.
- Estem millorant i afegint proteccions més sòlides al voltant dels futurs entrenaments i avaluacions. Aquesta setmana hem publicat un article de blog sobre com millorar la seguretat i l’alineament en una era de models amb horitzó temporal llarg. Aquestes salvaguardes de desplegament no es van activar expressament durant aquesta avaluació perquè l’objectiu era provar vulnerabilitats cibernètiques. Aquest incident posa de manifest la necessitat de reforçar encara més l’alineament del nostre model, les proteccions cibernètiques durant l’avaluació i el monitoratge durant les proves internes.
Com vam compartir fa poc, la IA està accelerant el descobriment i l’explotació de vulnerabilitats. La lliçó principal d’aquest incident és que la seguretat i la protecció dels models han d’avançar al mateix ritme que unes capacitats que evolucionen ràpidament. Estem reforçant les pràctiques de contenció, monitoratge, controls d’accés i avaluació que s’utilitzen durant el desenvolupament de models.
L’avaluació de l’AISI del Regne Unit mostra que models com GPT‑5.6 Sol són cada vegada més capaços de sostenir operacions cibernètiques complexes i de diversos passos durant horitzons de tasca llargs. Aquest incident indica que aquestes capacitats teòriques sí que s’apliquen en entorns reals.

L’incident també deixa clar que els models avançats poden descobrir i explotar noves vies d’atac en sistemes reals sense accés al codi font. Subratlla que les capacitats cibernètiques avançades s’han de desenvolupar juntament amb salvaguardes i eines defensives més sòlides.
Creiem que els models amb capacitats cibernètiques avançades han d’ajudar els equips de seguretat a trobar debilitats abans que ho facin els atacants, entendre com es poden encadenar les vulnerabilitats i corregir-les a velocitat de màquina. Estem utilitzant aquestes capacitats per continuar reforçant les proteccions al voltant de la configuració de la infraestructura i dels entorns d’avaluació de models; compartirem les nostres conclusions i bones pràctiques a mesura que n’aprenguem. Animem altres defensors a sol·licitar accés de confiança i experimentar ara amb aquests models per convertir aquestes capacitats en una millor prevenció, una detecció més ràpida i una resposta a incidents més eficaç.
"Agraïm la col·laboració amb OpenAI en aquest tema i en altres. Aquest incident, possiblement el primer d’aquest tipus, confirma una idea que fa temps que defensem: la seguretat de la IA no la resoldrà cap empresa treballant en secret. Es resoldrà de manera oberta i col·laborativa, amb un accés ampli a la IA per a tots els defensors, arreu".


