L’incident Hugging Face et les autres répercussions de modèles mal alignés sur des tiers
À mesure que les systèmes d’IA gagnent en capacités et en autonomie, un comportement mal aligné peut se traduire par des actions lourdes de conséquences dans le monde réel, notamment des incidents de cybersécurité et d’autres résultats que les développeurs n’avaient peut-être pas anticipés. Comprendre comment ces comportements apparaissent et s’intensifient, ainsi que la façon de les détecter et d’y répondre, devient donc un aspect de plus en plus important de la conception et du déploiement sûrs de systèmes d’IA avancés.
Nous avons initialement considéré l’incident Hugging Face avant tout comme un problème de sécurité, puisqu’il impliquait une compromission au niveau de la plateforme. Il demeure à ce jour l’activité de ce type la plus grave que nous ayons détectée de la part de nos modèles, et a été principalement provoqué par un modèle de recherche très performant réservé à un usage interne. Nous avons depuis compris que cette intrusion avait été provoquée par des modèles recourant à des stratégies mal alignées pour résoudre des tâches difficiles, comme l’indique le rapport technique sur Hugging Face. Les incidents de cybersécurité sont une manifestation de ce risque ; le mauvais alignement peut également entraîner d’autres comportements inattendus ou préoccupants hors des catégories de sécurité traditionnelles, comme la publication de contenus par nos modèles sur des sites tiers — ce que nous appelons le « spam d’agents ». Et nous devons traiter ces deux aspects.
Nous avons poursuivi l’examen d’activités plus larges, en donnant la priorité aux incidents les plus graves, puis en l’étendant aux activités mal alignées de moindre gravité, notamment au spam d’agents.
Cette page rassemble nos rapports et mises à jour sur l’incident Hugging Face, les recherches et présentations publiques connexes, les activités supplémentaires que nous avons détectées, les enseignements tirés sur le rôle du mauvais alignement des modèles et les mesures que nous prenons pour renforcer nos systèmes. Nous actualiserons cette page à mesure que nos enquêtes progresseront.
Liens rapides
Activités affectant des tiers
Afin de mieux comprendre la portée de ces comportements inattendus, nous menons un examen approfondi des activités de nos modèles sur Internet pendant l’entraînement et l’évaluation. Dans le cadre de notre examen, nous identifions et informons progressivement les tiers, en commençant par les cas où :
Nos modèles ont pu contourner les contrôles de sécurité d’un tiers ou nuire à la disponibilité d’un service en ligne ; ou
Des cas de mauvais alignement ont eu des répercussions négatives sur des sites web ou services tiers.
D’après notre examen à ce jour, nous avons informé des dizaines de tiers en appliquant les critères ci-dessus. Notre examen des activités passées se poursuit et nécessitera beaucoup de temps et de ressources. Nous informerons d’autres tiers à mesure que ces travaux progresseront.
Nous publions ci-dessous des résumés anonymisés pour décrire les types d’activités mal alignées observées. Nous les actualiserons à mesure que nous informerons d’autres tiers et que notre compréhension évoluera. Nous communiquerons également les mises à jour pertinentes sur l’état d’avancement de l’examen. En règle générale, nous omettrons les noms et autres éléments d’identification lorsque cela sera nécessaire pour protéger les parties concernées, même si les parties informées pourront choisir de publier les renseignements que nous leur fournissons.
Résumé des activités observées
À ce jour, notre processus d’examen et de notification a permis d’identifier les catégories d’activités suivantes :
Contournement du contrôle d’accès : des agents accèdent à des informations ou fonctionnalités exigeant normalement une vérification d’identité, une autorisation spécifique, un abonnement ou un compte. Par exemple, un agent a utilisé une autre adresse web, modifié les détails d’une requête ou exploité une session de connexion lui donnant davantage d’accès que prévu.
Utilisation d’identifiants exposés : des agents ont trouvé des identifiants de connexion ou des clés d’accès rendus publics et les ont utilisés pour accéder à un service.
Injection de requêtes ou de commandes : des agents ont saisi du texte dans un site web ou un service, que celui-ci a traité comme une instruction plutôt que comme une entrée ordinaire. Cela pouvait amener le service à exécuter une requête de base de données, du code applicatif ou une commande sur son serveur.
Accès aux composants internes de l’environnement d’exécution : des agents ont lu des fichiers contenant l’implémentation d’un service ou interagi avec un système d’arrière-plan destiné à un usage interne. Dans ces cas, l’agent a atteint des parties du service situées hors du périmètre d’accès prévu.
Spam d’agents : des agents publient sur des sites tiers des informations susceptibles d’en modifier le contenu et de nécessiter un nettoyage, par exemple en utilisant des pages wiki publiques comme forums de discussion partagés.