Passer au contenu principal
OpenAI

30 septembre 2026

Cybersécurité

Déjouer une campagne coordonnée de distillation de modèles

Chargement…

Nous avons récemment repéré et déjoué une campagne coordonnée visant à extraire le raisonnement protégé de nos modèles. Les premières activités observées remontent à la première semaine de juillet. Cette activité correspond à de la distillation antagoniste : l’utilisation systématique et non autorisée des sorties ou du raisonnement d’un modèle pour contribuer à entraîner, à reproduire ou à améliorer un autre modèle. Le raisonnement protégé est la trace interne du cheminement du modèle pour accomplir une tâche; son extraction peut révéler des renseignements exclus de la réponse finale et aider d’autres acteurs à reproduire les capacités du modèle.

Les opérateurs n’ont ni cassé notre chiffrement, ni compromis une base de données, ni obtenu un accès direct aux conversations stockées des utilisateurs. Ils ont plutôt manipulé les interactions avec les modèles afin de reproduire le raisonnement protégé sous des formes visibles par le demandeur, de façon coordonnée et à grande échelle, en violation de nos conditions d’utilisation. Cette manipulation n’exploite pas une vulnérabilité propre aux modèles d’OpenAI. Nous avons transmis des renseignements à ce sujet à des partenaires de l’industrie par l’intermédiaire du Frontier Model Forum afin de renforcer les défenses collectives contre la distillation antagoniste.

Avant cette publication, nous avons examiné la portée et les répercussions potentielles de cette activité, déployé nos propres mesures d’atténuation, puis échangé avec des chercheurs et des partenaires de l’industrie et recueilli leurs commentaires pour nous assurer que des protections contre ce type d’attaque sont en place. D’autres travaux d’atténuation et d’enquête se poursuivent. Nous croyons que communiquer dès maintenant ce que nous avons appris aidera l’ensemble de l’écosystème à renforcer ses défenses.

Ce que nous avons observé

Nous avons vu des opérateurs tenter d’extraire le raisonnement protégé de façons inédites, notamment en copiant le raisonnement chiffré d’une conversation, puis en demandant à un modèle dans une autre conversation de déchiffrer et de transcrire le contenu du raisonnement caché.

Des chercheurs indépendants en sécurité⁠(s'ouvre dans une nouvelle fenêtre) nous ont également signalé, dans le cadre d’une divulgation responsable, des vulnérabilités connexes touchant les interactions entre modèles et le compactage des conversations. Nous avons examiné leurs conclusions et confirmé que les voies d’attaque qu’ils avaient repérées étaient bien réelles. Leurs travaux nous ont aidés à comprendre la catégorie d’attaques plus large dans laquelle elles s’inscrivent et à accélérer la mise en place de mesures d’atténuation.

L’activité a commencé le 1er juillet, d’abord à faible volume, avant des pics observés les 24 et 25 juillet : 16 000 requêtes1 utilisant un schéma d’extraction pertinent, provenant de plus de 4 000 utilisateurs. Une enquête approfondie a révélé une activité connexe fondée sur des schémas d’invites au sein d’un groupe de plus de 15 000 utilisateurs. Nous y avons entièrement mis fin au plus tard le 28 juillet.

L’activité a évolué au fil du temps, confirmant que la distillation antagoniste constitue un défi de sécurité plus vaste qui exige des défenses adaptatives à plusieurs niveaux.

Notre évaluation de l’attribution

Il reste difficile de déterminer si tous les opérateurs observés pendant la période concernée relevaient d’un seul acteur. Nous attribuons toutefois un ensemble central de ces activités à des personnes associées à Moonshot AI, l’entreprise qui développe Kimi.

Pourquoi c’est important

La distillation antagoniste présente des risques pour la sûreté et la sécurité nationale. Le raisonnement extrait pourrait servir à entraîner un autre modèle sans préserver les garde-fous appliqués aux sorties du modèle d’origine destinées aux utilisateurs. À grande échelle, la distillation peut aussi accélérer le transfert de capacités avancées sans exiger les mêmes investissements en matière de sûreté. Ces préoccupations s’accentuent à mesure que les modèles acquièrent des capacités dans des domaines à double usage.

Ce risque n’est pas propre à OpenAI. Comme indiqué plus haut, des techniques similaires peuvent toucher d’autres systèmes d’IA avancés. Il s’agit donc d’un défi de sécurité commun qui exige une coordination à l’échelle de l’industrie.

Notre réponse

Nous avons atténué cette récente campagne de distillation en combinant des mesures d’application des règles visant les comptes, des contrôles techniques et une coordination avec nos partenaires. Nous avons banni ou restreint des comptes frauduleux, renforcé les contrôles à l’inscription et au niveau de l’infrastructure, et élargi la surveillance des réseaux connexes.

Nous avons aussi renforcé les protections du raisonnement caché entre les utilisateurs, les espaces de travail, les organisations et les familles de modèles. Nous avons fermé une voie qui permettait à une personne possédant déjà le raisonnement chiffré d’un autre utilisateur de le rejouer et d’en récupérer le contenu. Nous avons également ajouté des vérifications pour détecter et retenir les sorties diffusées en continu susceptibles d’exposer le raisonnement. Lorsque des activités connexes ont transité par des services tiers, nous avons collaboré avec leurs fournisseurs pour repérer les comptes concernés et interrompre leurs activités.

Enfin, nous avons communiqué les conclusions pertinentes par l’intermédiaire du Frontier Model Forum et des canaux gouvernementaux appropriés d’échange d’information, afin que d’autres développeurs de modèles de pointe et partenaires du secteur public puissent rechercher des activités similaires et renforcer leurs propres défenses. Les systèmes qui prennent en charge des artefacts de raisonnement portables ou rejouables peuvent présenter des risques connexes.

La suite

Nous nous attendons à ce que les tentatives de distillation antagoniste deviennent plus sophistiquées à mesure que les modèles de pointe s’améliorent et que des acteurs cherchent des moyens moins coûteux d’imiter leurs capacités. Se défendre contre cette activité exige des contrôles à plusieurs niveaux et une adaptation continue.

Ce travail n’est pas terminé. Les déploiements hébergés par des partenaires ont besoin des mêmes protections que les services que nous exploitons directement. Les attaques par les sorties d’outils exigent quant à elles des protections qui examinent plus que le simple texte visible. Nous continuons d’améliorer les défenses des outils, la couverture des classificateurs et les refus des modèles, et de déployer les contrôles pertinents chez nos partenaires infonuagiques.

Notre réponse continuera de porter sur trois axes : des protections techniques plus solides contre l’extraction, une meilleure détection et une application renforcée des règles contre les campagnes coordonnées, ainsi qu’un échange accru de renseignements sur les menaces entre l’industrie et les gouvernements.

Auteur

OpenAI

Notes de bas de page

  1. 1

    Ces chiffres décrivent des tentatives d’extraction, pas nécessairement des extractions réussies.