Passer au contenu principal
OpenAI

21 juillet 2026

Sécurité

OpenAI et Hugging Face s’associent après un incident de sécurité lors d’une évaluation de modèle

Chargement...

Nous menons un examen approfondi avec des conseillers externes, sous la supervision du Comité de sûreté et de sécurité. Une fois l’examen terminé, nous publierons dans les prochaines semaines un rapport technique présentant les enseignements que nous en avons tirés.

Mise à jour du 28 juillet 2026 :

  • Aucun des modèles prévus pour la prochaine version n’a été impliqué dans l’exploitation de Hugging Face. Le modèle en préversion mentionné dans notre article de blog est un prototype de recherche à usage interne uniquement et n’a jamais été destiné à une diffusion publique. À la suite de l’incident, nous avons procédé à sa désactivation, à son chiffrement, et avons restreint l’accès à des fins de recherche.
  • L’environnement d’évaluation ExploitGym ne fournissait pas aux modèles un accès direct à Internet. Pour accéder à Internet, les modèles ont identifié puis exploité une vulnérabilité zero-day jusque-là inconnue dans Artifactory(ouverture dans une nouvelle fenêtre), un proxy de mise en cache pour registre de paquets. Nous avons signalé cette vulnérabilité, ainsi que les autres vulnérabilités d’Artifactory que nos modèles ont identifiées dans le cadre de notre analyse, à l’éditeur. 
  • Nous continuons à collaborer avec Hugging Face, notamment en contribuant à leur analyse post-mortem(ouverture dans une nouvelle fenêtre), tandis que notre examen se poursuit. Nous les avons également ajoutés à notre programme d’accès de confiance pour la cybersécurité. 
  • À ce stade de notre analyse, nous n’avons identifié aucune autre activité d’une gravité ou d’une ampleur comparables à celle que nous avons décrite concernant Hugging Face, qui impliquait une compromission au niveau de la plateforme.
  • Dans le cadre de notre analyse en cours de l’intrusion visant Hugging Face et, plus largement, des activités de nos modèles, nous avons relevé un petit nombre de cas où les modèles ont identifié et utilisé des identifiants exposés publiquement au niveau de comptes sur d’autres services accessibles au public. Cela inclut quatre comptes sur quatre services dans le cadre de l’incident Hugging Face (ainsi que quelques comptes consultés dans le cadre d’autres évaluations). L’un de ces quatre comptes a été utilisé comme relais sortant et chemin de mise en scène, et un autre compte a été utilisé pour le stockage des données. Les deux comptes restants ont été consultés par les modèles en lecture seule et n’ont pas été utilisés dans le but de compromettre Hugging Face. Nous continuerons d’informer directement les responsables des services, et n’avons constaté aucun élément indiquant un impact plus large sur ces fournisseurs ou sur d’autres comptes utilisant leurs services.
  • Les modèles ont également utilisé une série de services accessibles au public, notamment des sites de partage de code, des services de capture de requêtes, des services de capture d’écran et d’autres utilitaires web. Aucune compromission au niveau de la plateforme ou du compte n’a eu lieu dans ces cas. 
  • Nous prenons au sérieux notre responsabilité d’identifier les risques posés par des systèmes d’IA de plus en plus performants et de nous y préparer. Une fois notre examen terminé, nous le passerons en revue avec le Comité de sûreté et de sécurité et le Groupe consultatif sur la sécurité dans le cadre de notre cadre de préparation.

La semaine dernière, Hugging Face a divulgué un nouveau type d’incident de sécurité(ouverture dans une nouvelle fenêtre) après avoir détecté et contenu un agent IA qui avait compromis son infrastructure, un phénomène qui, selon nous, deviendra plus courant avec la multiplication de modèles aux capacités cyber de plus en plus avancées. Après enquête, nous savons désormais que cet incident précis a été causé par une combinaison de modèles d’OpenAI — dont GPT‑5.6 Sol et un modèle en préversion encore plus performant, tous configurés avec des refus cyber réduits à des fins d’évaluation — alors qu’ils étaient testés en interne sur un benchmark(ouverture dans une nouvelle fenêtre) de capacités cyber.

Nous considérons qu’il s’agit d’un incident cyber sans précédent, impliquant des capacités cyber de pointe, et nous réagissons en conséquence. Nous partageons à ce stade des conclusions préliminaires afin d’aider les défenseurs à comprendre ce qui s’est passé et à évaluer ce dont les modèles sont désormais capables. Nous poursuivrons une enquête approfondie aux côtés de Hugging Face et partagerons davantage de détails sur les vulnérabilités, l’incident et nos conclusions une fois l’enquête terminée.

Ce qui s’est passé pendant cet incident

Cet incident s’est produit lors d’une évaluation interne qui amène les modèles à mener une exploitation avancée au moyen de chemins d’attaque complexes, afin de quantifier leurs capacités cyber. Nous estimons les capacités cyber maximales en exécutant cette évaluation sans les classificateurs de production utilisés pour empêcher les modèles de mener des activités cyber à haut risque. Nos benchmarks s’exécutent dans un environnement très isolé, avec un accès réseau limité à la possibilité d’installer des paquets via un logiciel tiers hébergé en interne, qui sert de proxy et de cache pour les registres de paquets.

Les modèles ont identifié et enchaîné des vulnérabilités dans l’environnement de recherche d’OpenAI et l’infrastructure de production de Hugging Face afin d’obtenir des solutions de test directement depuis la base de données de production de Hugging Face. Tous les éléments indiquent que les modèles étaient hyperfocalisés sur la recherche d’une solution pour ExploitGym, allant jusqu’à des moyens extrêmes pour atteindre un objectif de test pourtant assez étroit.

Alors qu’ils opéraient dans notre environnement de test en bac à sable, nos modèles ont consacré une quantité importante de calcul d’inférence à trouver un moyen d’obtenir un accès ouvert à Internet, dans le but de résoudre le problème d’évaluation. Pour obtenir cet accès, les modèles ont identifié et exploité une vulnérabilité zero-day (que nous avons désormais divulguée de manière responsable au fournisseur) dans le proxy de cache du registre de paquets. Grâce à cet accès, nos modèles ont mené une série d’actions d’élévation de privilèges et de déplacement latéral dans notre environnement de test de recherche, jusqu’à atteindre un nœud disposant d’un accès à Internet.

Après avoir obtenu un accès à Internet, les modèles ont déduit que Hugging Face hébergeait potentiellement des modèles, des jeux de données et des solutions pour ExploitGym. Sachant cela, le modèle a cherché et réussi à trouver des moyens d’accéder à des informations secrètes qu’il pouvait utiliser pour tricher à l’évaluation. Dans un exemple, le modèle a enchaîné plusieurs vecteurs d’attaque, notamment l’utilisation d’identifiants volés et de vulnérabilités zero-day pour trouver un chemin d’exécution de code à distance sur les serveurs de Hugging Face. L’équipe de sécurité d’OpenAI a découvert cette activité anormale en interne.

L’équipe de sécurité et les agents de Hugging Face ont détecté et stoppé l’activité sur leur infrastructure, et avaient déjà commencé le confinement et la reconstitution forensique avec leurs propres modèles open source lorsque nos équipes sont entrées en contact. Nous travaillons activement avec eux pour poursuivre l’enquête sur l’incident. Nous remercions Hugging Face pour sa collaboration rapide et étroite dans l’enquête et les mesures correctives.

Mesures que nous prenons dès maintenant

  1. Dans le cadre de l’enquête, nous mettons en place des contrôles stricts de la configuration de l’infrastructure, au détriment de la rapidité de la recherche, pendant la correction des vulnérabilités. Nous informons régulièrement notre comité de sûreté et de sécurité de ces contrôles et de leur impact.
  2. Nous travaillons avec Hugging Face à l’analyse forensique de l’incident.
  3. Nous avons divulgué de manière responsable la vulnérabilité zero-day identifiée dans le logiciel tiers hébergé en interne, et nous travaillons avec eux à son correctif.
  4. Nous avons intégré Hugging Face au programme d’accès de confiance et aidons leurs équipes à exploiter rapidement les capacités de nos modèles pour renforcer leurs défenses.
  5. Nous améliorons les protections autour des futurs entraînements et évaluations, et en ajoutons de plus robustes. Cette semaine, nous avons publié un article de blog sur l’amélioration de la sûreté et de l’alignement à l’ère des modèles à horizon long. Ces garde-fous de déploiement n’ont volontairement pas été activés pendant cette évaluation, car celle-ci visait à tester des vulnérabilités cyber. Cet incident montre qu’il faut encore renforcer l’alignement de notre modèle, les protections cyber pendant l’évaluation et la surveillance lors des tests internes.

Notre approche de l’évaluation des capacités cyber avancées

Comme nous l’avons partagé récemment, l’IA accélère la découverte et l’exploitation des vulnérabilités. Le principal enseignement de cet incident est que la sécurité et la sûreté des modèles doivent suivre le rythme de capacités qui progressent rapidement. Nous renforçons les pratiques de confinement, de surveillance, de contrôle d’accès et d’évaluation utilisées pendant le développement des modèles.

L’évaluation de l’UK AISI montre que des modèles comme GPT‑5.6 Sol sont de plus en plus capables de soutenir des opérations cyber complexes et en plusieurs étapes sur de longs horizons temporels. Cet incident montre que ces capacités théoriques s’appliquent bien en conditions réelles.

Graphique de l’UK AI Security Institute comparant des modèles récents à pondérations ouvertes et des modèles de pointe dans des environnements cyber simulés à horizon temporel long.

Il montre aussi clairement que des modèles avancés peuvent découvrir et exploiter de nouveaux chemins d’attaque dans des systèmes réels, sans accès au code source. Il souligne que les capacités cyber avancées doivent être développées en parallèle de garde-fous et d’outils défensifs plus robustes.

Nous pensons que les modèles dotés de capacités cyber avancées doivent aider les équipes de sécurité à trouver les faiblesses avant les attaquants, à comprendre comment des vulnérabilités peuvent être enchaînées et à y remédier à la vitesse des machines. Nous utilisons ces capacités pour continuer à renforcer les protections autour de la configuration de l’infrastructure et des environnements d’évaluation des modèles ; nous partagerons nos constats et bonnes pratiques au fil de nos apprentissages. Nous encourageons les autres défenseurs à demander un accès de confiance et à expérimenter ces modèles dès maintenant afin de transformer ces capacités en meilleure prévention, en détection plus rapide et en réponse aux incidents plus efficace.

« Nous sommes reconnaissants de notre collaboration avec OpenAI sur ce sujet et d’autres. Cet incident, peut-être le premier du genre, confirme une conviction que nous avons depuis longtemps : la sécurité de l’IA ne sera pas résolue par une seule entreprise travaillant dans le secret. Elle sera résolue au grand jour, de manière collaborative, avec un large accès à l’IA pour chaque défenseur, partout. »
—Clem Delangue, cofondateur et CEO, Hugging Face

Auteur

OpenAI