Passer au contenu principal
OpenAI

30 septembre 2026

Cybersécurité

Déjouer une campagne coordonnée de distillation de modèles

Chargement...

Nous avons récemment identifié et déjoué une campagne coordonnée visant à extraire le raisonnement protégé de nos modèles. Les premières activités observées remontent à la première semaine de juillet. Cette activité correspond à de la distillation adversariale : l’utilisation systématique et non autorisée des sorties ou du raisonnement d’un modèle pour contribuer à entraîner, reproduire ou améliorer un autre modèle. Le raisonnement protégé est la trace interne du cheminement du modèle pour accomplir une tâche ; son extraction peut révéler des informations omises de la réponse finale et aider des tiers à reproduire les capacités du modèle.

Les opérateurs n’ont pas cassé notre chiffrement, compromis de base de données ni accédé directement aux conversations stockées des utilisateurs. Ils ont plutôt manipulé les interactions avec les modèles afin de reproduire le raisonnement protégé sous des formes visibles par le demandeur, de manière coordonnée et à grande échelle, en violation de nos conditions d’utilisation. Cette manipulation ne repose pas sur une vulnérabilité propre aux modèles d’OpenAI. Nous avons partagé des informations à ce sujet avec des partenaires du secteur par l’intermédiaire du Frontier Model Forum afin de renforcer les défenses collectives contre la distillation adversariale.

Avant cette publication, nous avons étudié la portée et l’impact potentiel de cette activité, déployé nos propres mesures d’atténuation, puis échangé avec des chercheurs et des partenaires du secteur et recueilli leurs retours afin de nous assurer que des protections contre ce type d’attaque étaient en place. Les efforts d’atténuation et les investigations se poursuivent. Nous pensons que partager dès maintenant ce que nous avons appris aidera l’ensemble de l’écosystème à renforcer ses défenses.

Nos observations

Nous avons observé des opérateurs tenter d’extraire le raisonnement protégé par des moyens inédits, notamment en copiant le raisonnement chiffré d’une conversation et en demandant à un modèle, dans une autre conversation, de déchiffrer et de transcrire le contenu de ce raisonnement masqué.

Des chercheurs indépendants en sécurité⁠(ouverture dans une nouvelle fenêtre) ont également porté à notre attention des vulnérabilités connexes impliquant plusieurs modèles et le compactage des conversations, dans le cadre d’une divulgation responsable. Nous avons étudié leurs conclusions et confirmé que les vecteurs d’attaque qu’ils avaient identifiés étaient bien réels. Leurs travaux nous ont aidés à comprendre cette catégorie d’attaques dans son ensemble et à accélérer la mise en place de mesures d’atténuation.

L’activité a débuté le 1er juillet, avec un faible volume initial, jusqu’à ce que nous observions des pics importants les 24 et 25 juillet : 16 000 requêtes1 utilisant un schéma d’extraction correspondant, issues de plus de 4 000 utilisateurs. Des investigations approfondies ont révélé une activité connexe reposant sur des schémas de prompts au sein d’un groupe de plus de 15 000 utilisateurs, à laquelle nous avons totalement mis fin le 28 juillet.

L’activité a évolué au fil du temps, confirmant que la distillation adversariale constitue un défi de sécurité plus large, qui nécessite des défenses multicouches et adaptatives.

Notre évaluation de l’attribution

Nous ne savons pas avec certitude si tous les opérateurs observés au cours de la période concernée relevaient d’un seul acteur. Nous attribuons toutefois un ensemble central de cette activité à des personnes associées à Moonshot AI, l’entreprise qui développe Kimi.

Pourquoi c’est important

La distillation adversariale présente des risques pour la sûreté et la sécurité nationale. Le raisonnement extrait pourrait servir à entraîner un autre modèle sans conserver les garde-fous appliqués aux sorties du modèle d’origine destinées aux utilisateurs. À grande échelle, la distillation peut aussi accélérer le transfert de capacités avancées sans nécessiter le même investissement en matière de sûreté. Ces préoccupations s’accentuent à mesure que les modèles acquièrent des capacités dans des domaines à double usage.

Ce risque n’est pas propre à OpenAI. Comme indiqué plus haut, des techniques similaires peuvent affecter d’autres systèmes d’IA avancés. Il s’agit donc d’un défi de sécurité commun, qui nécessite une coordination à l’échelle du secteur.

Notre réponse

Nous avons contré cette récente campagne de distillation en combinant des sanctions sur les comptes, des contrôles techniques et une coordination avec nos partenaires. Nous avons banni ou restreint les comptes frauduleux, renforcé les contrôles à l’inscription et sur l’infrastructure, et étendu la surveillance des réseaux associés.

Nous avons également renforcé les protections du raisonnement masqué entre utilisateurs, espaces de travail, organisations et familles de modèles. Nous avons fermé une voie qui permettait à une personne déjà en possession du raisonnement chiffré d’un autre utilisateur de le rejouer et d’en récupérer le contenu. Nous avons aussi ajouté des contrôles pour détecter et retenir les sorties diffusées en continu susceptibles d’exposer le raisonnement. Lorsque des activités connexes ont transité par des services tiers, nous avons travaillé avec leurs fournisseurs pour identifier les comptes impliqués et mettre fin à leurs activités.

Enfin, nous avons partagé les conclusions pertinentes par l’intermédiaire du Frontier Model Forum et des canaux gouvernementaux appropriés de partage d’informations, afin que les autres développeurs de modèles de pointe et les partenaires du secteur public puissent rechercher des activités similaires et renforcer leurs propres défenses. Les systèmes prenant en charge des artefacts de raisonnement portables ou rejouables peuvent être exposés à des risques similaires.

Les prochaines étapes

Nous nous attendons à ce que les tentatives de distillation adversariale deviennent plus sophistiquées à mesure que les modèles de pointe s’améliorent et que les acteurs cherchent des moyens moins coûteux d’imiter leurs capacités. Se défendre contre cette activité exige des contrôles multicouches et une adaptation continue.

Ce travail n’est pas terminé. Les déploiements hébergés par des partenaires ont besoin des mêmes protections que les services que nous exploitons directement. Les attaques via les sorties d’outils exigent quant à elles des protections qui examinent davantage que le simple texte visible. Nous continuons d’améliorer les défenses des outils, la couverture des classificateurs et les refus des modèles, et de déployer les contrôles pertinents auprès de nos partenaires cloud.

Notre réponse restera axée sur trois domaines : des protections techniques renforcées contre l’extraction, une meilleure détection et des sanctions plus efficaces contre les campagnes coordonnées, ainsi qu’un partage accru d’informations sur les menaces entre le secteur et les pouvoirs publics.

Auteur

OpenAI

Notes de bas de page

  1. 1

    Ces chiffres portent sur des tentatives d’extraction, pas nécessairement réussies.