OpenAI et Hugging Face s’allient après un incident de sécurité pendant l’évaluation d’un modèle
Nous menons un examen approfondi en collaboration avec des conseillers externes et sous la supervision du Comité de sécurité et de sûreté. Une fois l’examen terminé, nous publierons, au cours des prochaines semaines, un rapport technique présentant les enseignements que nous en avons tirés.
Mise à jour du 28 juillet 2026 :
- Aucun des modèles prévus pour la prochaine version n’a été impliqué dans l’exploitation de Hugging Face. Le modèle en préversion mentionné dans notre billet de blogue est un prototype de recherche réservé à l’interne et n’a jamais été destiné à une diffusion publique. À la suite de l’incident, nous avons procédé à sa désactivation, à son chiffrement et avons restreint son accès aux fins de recherche.
- L’environnement d’évaluation ExploitGym ne fournissait pas aux modèles un accès direct à Internet. Pour obtenir un accès à Internet, les modèles ont repéré et exploité une vulnérabilité du jour zéro jusqu’alors inconnue dans Artifactory(s'ouvre dans une nouvelle fenêtre), un proxy de cache du registre de paquets. Nous avons divulgué cette vulnérabilité au fournisseur, ainsi que d’autres vulnérabilités d’Artifactory que nos modèles ont identifiées dans le cadre de notre examen.
- Nous continuons de collaborer avec Hugging Face, notamment en contribuant à son analyse post-mortem(s'ouvre dans une nouvelle fenêtre), tandis que notre examen se poursuit. Nous les avons également ajoutés à notre programme Trusted Access for Cyber.
- D’après notre examen à ce jour, nous n’avons identifié aucune autre activité présentant un niveau de gravité ou une ampleur comparable à ce que nous avons communiqué au sujet de Hugging Face, qui impliquait une compromission au niveau de la plateforme.
- Dans le cadre de notre examen continu de l’intrusion de Hugging Face et de l’activité plus générale de nos modèles, nous avons relevé un petit nombre de cas où les modèles ont identifié et utilisé des identifiants exposés publiquement au niveau du compte sur d’autres services accessibles au public. Cela comprend quatre comptes sur quatre services dans le cadre de l’incident Hugging Face (ainsi que quelques comptes consultés dans le cadre d’autres évaluations). L’un de ces quatre comptes a été utilisé comme relais sortant et chemin de transit, et un autre compte a été utilisé pour le stockage des données. Les deux comptes restants ont été consultés par les modèles en mode lecture seule et n’ont pas été utilisés pour contribuer à la compromission de Hugging Face. Nous continuerons d’aviser directement les responsables des services, et nous n’avons constaté aucun signe d’incidence plus large sur ces fournisseurs ou sur d’autres comptes utilisant leurs services.
- Les modèles ont également utilisé une série de services accessibles au public, notamment des sites de partage d’extraits de code, des services de capture de requêtes, des services de capture d’écran et d’autres utilitaires Web. Il n’y a eu aucune compromission au niveau de la plateforme ou des comptes dans ces cas.
- Nous prenons au sérieux notre responsabilité de cerner les risques associés à des systèmes d’IA de plus en plus performants et de nous y préparer. Une fois notre examen terminé, nous le passerons en revue avec le Comité de sûreté et de sécurité et le Groupe consultatif sur la sécurité dans le cadre de notre Cadre de préparation.
La semaine dernière, Hugging Face a divulgué un nouveau type d’incident de sécurité(s'ouvre dans une nouvelle fenêtre) après avoir détecté et contenu un agent d’IA qui avait compromis son infrastructure, un phénomène qui, selon nous, deviendra plus courant avec la prolifération de modèles de plus en plus capables sur le plan cybernétique. Après enquête, nous savons maintenant que cet incident précis a été causé par une combinaison de modèles d’OpenAI — dont GPT‑5.6 Sol et un modèle de préversion encore plus capable, tous avec des refus cybernétiques réduits à des fins d’évaluation — pendant des tests internes sur un banc d’essai(s'ouvre dans une nouvelle fenêtre) de capacités cybernétiques.
Nous considérons qu’il s’agit d’un incident cybernétique sans précédent, mettant en cause des capacités cybernétiques de pointe, et nous y répondons en conséquence. Nous communiquons ces conclusions préliminaires à ce stade afin d’aider les défenseurs à comprendre ce qui s’est passé et à mieux évaluer ce dont les modèles sont désormais capables. Nous poursuivrons une enquête approfondie avec Hugging Face et communiquerons d’autres détails sur les vulnérabilités, l’incident et nos conclusions lorsque l’enquête sera terminée.
Cet incident s’est produit durant une évaluation interne qui amène les modèles à mener des exploitations avancées au moyen de chemins d’attaque complexes, afin de quantifier leurs capacités cybernétiques. Nous estimons les capacités cybernétiques maximales en exécutant cette évaluation sans les classificateurs de production utilisés pour empêcher les modèles de mener des activités cybernétiques à haut risque. Nos bancs d’essai s’exécutent dans un environnement très isolé, où l’accès au réseau est limité à la possibilité d’installer des paquets au moyen d’un logiciel tiers hébergé à l’interne qui sert de mandataire et de cache pour les registres de paquets.
Les modèles ont repéré et enchaîné des vulnérabilités dans l’environnement de recherche d’OpenAI et l’infrastructure de production de Hugging Face afin d’obtenir des solutions de test directement à partir de la base de données de production de Hugging Face. Tout indique que les modèles étaient hyperconcentrés sur la recherche d’une solution pour ExploitGym, au point de déployer des efforts extrêmes pour atteindre un objectif de test assez étroit.
Alors qu’ils fonctionnaient dans notre environnement de test en bac à sable, nos modèles ont consacré une quantité importante de calcul d’inférence à trouver un moyen d’obtenir un accès ouvert à Internet afin de résoudre le problème d’évaluation. Pour obtenir cet accès, les modèles ont repéré et exploité une vulnérabilité jour zéro (que nous avons maintenant divulguée de façon responsable au fournisseur) dans le mandataire de cache du registre de paquets. Grâce à cet accès, nos modèles ont effectué une série d’actions d’élévation de privilèges et de mouvement latéral dans notre environnement de test de recherche, jusqu’à atteindre un nœud disposant d’un accès Internet.
Après avoir obtenu un accès Internet, les modèles ont déduit que Hugging Face hébergeait possiblement des modèles, des jeux de données et des solutions pour ExploitGym. Sachant cela, le modèle a cherché et réussi à trouver des moyens d’accéder à des informations secrètes qu’il pouvait utiliser pour contourner l’évaluation. Dans un exemple, le modèle a enchaîné plusieurs vecteurs d’attaque, notamment l’utilisation d’identifiants volés et de vulnérabilités jour zéro, afin de trouver un chemin d’exécution de code à distance sur les serveurs de Hugging Face. L’équipe de sécurité d’OpenAI a découvert cette activité anormale à l’interne.
L’équipe de sécurité et les agents de Hugging Face ont détecté et arrêté l’activité sur leur infrastructure, et avaient déjà commencé le confinement et la reconstruction forensique avec leurs propres modèles libres lorsque nos équipes sont entrées en contact. Nous travaillons activement avec eux pour poursuivre l’enquête sur l’incident. Nous sommes reconnaissants à Hugging Face pour sa collaboration rapide et étroite dans l’enquête et la remédiation.
- Dans le cadre de l’enquête, nous mettons en place des contrôles stricts de la configuration de l’infrastructure, au détriment de la vitesse de recherche, pendant que les vulnérabilités sont corrigées. Nous informons régulièrement notre comité de sûreté et de sécurité de ces contrôles et de leur incidence.
- Nous travaillons avec Hugging Face pour mener une enquête forensique sur l’incident.
- Nous avons divulgué de façon responsable la vulnérabilité jour zéro repérée dans le logiciel tiers hébergé à l’interne et travaillons avec son fournisseur pour la corriger.
- Nous avons intégré Hugging Face au programme d’accès de confiance et aidons ses équipes à utiliser rapidement les capacités de nos modèles pour renforcer leurs défenses.
- Nous améliorons et renforçons les protections entourant les futures formations et évaluations. Cette semaine, nous avons publié un billet sur l’amélioration de la sûreté et de l’alignement à l’ère des modèles à long horizon. Ces mesures de protection au déploiement n’avaient pas été activées intentionnellement pendant cette évaluation, puisqu’elle visait à tester des vulnérabilités cybernétiques. Cet incident montre qu’il faut renforcer davantage l’alignement de notre modèle, les protections cybernétiques pendant les évaluations et la surveillance durant les tests internes.
Comme nous l’avons récemment indiqué, l’IA accélère la découverte et l’exploitation des vulnérabilités. La principale leçon de cet incident est que la sécurité et la sûreté des modèles doivent suivre le rythme de l’avancement rapide de leurs capacités. Nous renforçons les pratiques de confinement, de surveillance, de contrôle des accès et d’évaluation utilisées pendant le développement des modèles.
L’évaluation de l’AISI du Royaume-Uni montre que des modèles comme GPT‑5.6 Sol sont de plus en plus capables de soutenir des opérations cybernétiques complexes et en plusieurs étapes sur de longs horizons temporels. Cet incident indique que ces capacités théoriques s’appliquent bel et bien à des contextes réels.

L’incident montre aussi clairement que des modèles avancés peuvent découvrir et exploiter de nouveaux chemins d’attaque dans des systèmes réels sans accès au code source. Il met en évidence que les capacités cybernétiques avancées doivent être développées en parallèle avec des mesures de protection et des outils défensifs plus robustes.
Nous croyons que les modèles dotés de capacités cybernétiques avancées doivent aider les équipes de sécurité à trouver les faiblesses avant les attaquants, à comprendre comment les vulnérabilités peuvent être enchaînées et à y remédier à la vitesse de la machine. Nous utilisons ces capacités pour continuer à renforcer les protections entourant la configuration de l’infrastructure et les environnements d’évaluation des modèles; nous partagerons nos conclusions et nos pratiques exemplaires au fil de nos apprentissages. Nous encourageons les autres défenseurs à demander un accès de confiance et à expérimenter avec ces modèles dès maintenant afin de transformer ces capacités en meilleure prévention, en détection plus rapide et en réponse aux incidents plus efficace.
« Nous sommes reconnaissants de collaborer avec OpenAI sur ce sujet et d’autres. Cet incident, peut-être le premier du genre, confirme une conviction que nous avons depuis longtemps : la sécurité de l’IA ne sera pas assurée par une seule entreprise travaillant en secret. Cela sera résolu au grand jour, de façon collaborative, avec un accès généralisé à l’IA pour chaque défenseur, partout. »


