L’incident Hugging Face et les autres répercussions de modèles mal alignés sur des tiers
À mesure que les systèmes d’IA gagnent en capacité et en autonomie, les comportements mal alignés peuvent se traduire par des actions lourdes de conséquences dans le monde réel, notamment des incidents de cybersécurité et d’autres résultats que les développeurs n’avaient peut-être pas anticipés. Comprendre comment ces comportements émergent et s’intensifient, ainsi que la façon de les détecter et d’y réagir, constitue donc un volet de plus en plus important du développement et du déploiement sécuritaires de systèmes d’IA avancés.
Au départ, nous considérions principalement l’incident Hugging Face comme un problème de sécurité, puisqu’il impliquait la compromission d’une plateforme. Il demeure l’activité de ce type la plus grave que nous ayons relevée à ce jour parmi nos modèles et a été principalement provoqué par un modèle de recherche très performant réservé à l’interne. Nous avons depuis compris que cette intrusion avait été provoquée par des modèles recourant à des stratégies mal alignées pour accomplir des tâches difficiles, comme l’indique le rapport technique sur Hugging Face. Les incidents de cybersécurité sont une manifestation de ce risque; le désalignement peut aussi entraîner d’autres comportements inattendus ou préoccupants qui ne relèvent pas des catégories de sécurité traditionnelles, comme la publication de contenu par nos modèles sur des sites tiers — ce que nous appelons le « pourriel d’agents ». Et nous devons nous attaquer aux deux.
Nous avons poursuivi l’examen d’activités plus vastes, en accordant la priorité aux incidents les plus graves, puis en l’élargissant aux activités mal alignées de moindre gravité, notamment le pourriel d’agents.
Cette page rassemble nos rapports et mises à jour sur l’incident Hugging Face, les recherches et présentations publiques connexes, les autres activités que nous avons relevées, ce que nous avons appris sur le rôle du désalignement des modèles et les mesures que nous prenons pour renforcer nos systèmes. Nous mettrons cette page à jour à mesure que nos enquêtes progresseront.
Liens rapides
Activités touchant des tiers
Afin de mieux comprendre la portée de ces comportements inattendus, nous menons un vaste examen des activités de nos modèles sur Internet pendant l’entraînement et l’évaluation. Dans le cadre de cet examen, nous identifions et avisons progressivement les tiers, en commençant par les cas où :
Nos modèles ont pu contourner les contrôles de sécurité d’un tiers ou nuire à la disponibilité d’un service en ligne; ou
Des cas de désalignement ont eu des répercussions négatives sur des sites Web ou des services tiers.
Selon notre examen à ce jour, nous avons avisé des dizaines de tiers en appliquant les critères ci-dessus. Notre examen des activités antérieures se poursuit et nécessitera beaucoup de temps et de ressources. Nous aviserons d’autres tiers à mesure que ces travaux progresseront.
Nous publions ci-dessous des résumés anonymisés décrivant les types d’activités mal alignées observées. Nous les mettrons à jour à mesure que nous aviserons d’autres tiers et que notre compréhension évoluera. Nous communiquerons également les mises à jour pertinentes sur l’état de l’examen. Nous omettrons généralement les noms et autres renseignements identificatoires lorsque cela sera nécessaire pour protéger les parties touchées, bien que les parties avisées puissent choisir de rendre publics les renseignements que nous leur fournissons.
Résumé des activités observées
Notre processus d’examen et d’avis a permis de relever jusqu’à présent les catégories d’activités suivantes :
Contournement des contrôles d’accès : des agents accèdent à des renseignements ou à des fonctions qui exigent normalement une vérification d’identité, une autorisation particulière, un abonnement ou un compte. Par exemple, un agent a utilisé une adresse Web différente, modifié des détails dans une requête ou tiré parti d’une session ouverte qui lui accordait plus d’accès que prévu.
Utilisation d’identifiants exposés : des agents ont trouvé des données de connexion ou des clés d’accès rendues publiques et les ont utilisées pour accéder à un service.
Injection de requêtes ou de commandes : des agents ont saisi du texte dans un site Web ou un service, que celui-ci a traité comme une instruction plutôt que comme une entrée ordinaire. Cela pouvait amener le service à exécuter une requête de base de données, du code applicatif ou une commande sur son serveur.
Accès aux composants internes d’exécution : des agents ont lu des fichiers contenant l’implémentation d’un service ou interagi avec un système d’arrière-plan réservé à un usage interne. Dans ces cas, l’agent a accédé à des parties du service qui se trouvaient hors de la portée prévue de son accès.
Pourriel d’agents : des agents publient sur des sites tiers des renseignements susceptibles d’en modifier le contenu et de nécessiter un nettoyage, par exemple en utilisant des pages wiki publiques comme babillards partagés.