Vers des dossiers de sûreté pour l’entraînement d’IA de pointe
Nous croyons entrer dans une nouvelle ère où une documentation structurée sur la sûreté devrait être exigée avant de poursuivre tout cycle d’entraînement par apprentissage par renforcement de modèles de pointe. Idéalement, cette documentation devrait atteindre le niveau des « dossiers de sûreté » : des argumentaires exhaustifs, structurés et fondés sur des preuves concernant les risques, utilisés dans d’autres secteurs où la sûreté est critique. Nous considérons les dossiers de sûreté comme un idéal vers lequel nous progressons, tout en reconnaissant la difficulté de les rendre aussi rigoureux pour les modèles d’IA que pour l’aviation ou l’énergie nucléaire, en raison de la complexité émergente à chaque nouveau palier de capacité de l’IA. Nous travaillons à un cadre pour codifier ces pratiques.
Voici quelques lignes directrices initiales qui devraient, selon nous, faire partie de ces dossiers de sûreté pour l’entraînement d’IA de pointe. Ces pratiques exemplaires reflètent les leçons apprises jusqu’ici. Nous nous attendons à ce qu’elles évoluent à mesure que nous affinons nos processus internes pour un développement prudent. Nous les présentons maintenant pour rendre notre réflexion actuelle transparente et solliciter les commentaires de la communauté. Ce document porte sur l’entraînement par apprentissage par renforcement de modèles de pointe; les déploiements internes et externes exigent de considérer un ensemble beaucoup plus large de propriétés d’alignement.
Les dossiers de sûreté devraient couvrir trois aspects de la pile technique : l’entraînement à l’alignement, le confinement et la surveillance. Ces mesures de protection contribuent à ce que le modèle ne tente pas d’actions désalignées et que, même s’il en tentait, il lui soit difficile de sortir du confinement et que la surveillance le détecte avant tout préjudice.
Alignement des modèles : La première ligne de défense devrait être d’entraîner les modèles à être alignés, c’est-à-dire à agir de façon fiable comme nous le souhaitons. Cela pourrait comprendre les éléments suivants :
Environnements d’entraînement et notation : Réduire les risques que les modèles développent des comportements désalignés en empêchant le renforcement positif du détournement des récompenses pendant l’entraînement. Cela pourrait comprendre les éléments suivants :
Examens automatisés des jeux de données : Utiliser des agents pour repérer et corriger les environnements d’apprentissage par renforcement défectueux où des trajectoires désalignées pourraient recevoir des récompenses élevées en exploitant des failles plutôt qu’en adoptant le comportement attendu, afin de réduire les occasions de renforcer le désalignement pendant l’entraînement.
Examens manuels des jeux de données : Compléter les tests automatisés d’équipe rouge par des examens manuels et des contrôles de qualité des jeux de données pour repérer les tâches défectueuses qui pourraient renforcer involontairement des comportements désalignés.
Réglage des évaluateurs : Régler les évaluateurs pour pénaliser les tentatives du modèle d’exploiter des failles ou de pirater les environnements d’apprentissage par renforcement pendant l’entraînement.
Analyse des cycles antérieurs : Appliquer des classificateurs aux traces d’expériences antérieures pour vérifier que les évaluateurs fonctionnent comme prévu.
Mesure de l’alignement : Effectuer des évaluations qui suivent les propensions au désalignement du modèle afin de mesurer l’efficacité de l’entraînement à l’alignement. Cela pourrait comprendre les éléments suivants :
Évaluations hors ligne de l’alignement : Effectuer des évaluations de l’alignement pendant les cycles d’entraînement de modèles de pointe pour déterminer si l’entraînement fonctionne comme prévu et examiner toute régression importante.
Tests rétrospectifs : Tester rétrospectivement les évaluations de l’alignement sur des incidents antérieurs pour confirmer qu’elles détectent les modèles précédemment désalignés et ne sont pas surajustées à certains incidents.
Suivi du contournement des évaluations : Suivre la conscience de l’évaluation ou le métajeu (lorsque les modèles reconnaissent qu’ils sont testés) qui pourraient entraîner un changement de comportement, avec des seuils de blocage précis (p. ex., activer des dispositifs de surveillance de la conscience de l’évaluation et du métajeu lors des évaluations de l’alignement).
Tests de résistance aux pires scénarios : Susciter les pires comportements indésirables et vérifier qu’au moins une évaluation les détecterait.
Empêcher l’entraînement sur le raisonnement détaillé (« chain-of-thought ») : Ne pas laisser les évaluateurs automatisés voir le raisonnement détaillé (« chain-of-thought ») pendant l’apprentissage par renforcement, afin d’empêcher les modèles d’évoluer pour échapper aux dispositifs de surveillance du raisonnement détaillé (« chain-of-thought »).
Confinement : Si un modèle devient désaligné, rendre l’isolation en bac à sable et la sécurité assez robustes pour empêcher les actions nuisibles. Cela pourrait comprendre les éléments suivants :
Multiples couches de sécurité de l’infrastructure : Investir massivement dans le renforcement du bac à sable où s’exécute le modèle et de l’infrastructure de recherche qui l’héberge, afin de disposer d’une couche de protection supplémentaire en cas de sortie du bac à sable.
Tests du confinement par équipe rouge : Améliorer la sécurité du bac à sable, de l’infrastructure de recherche et du périmètre en soumettant ces systèmes à des tests itératifs d’équipe rouge, à l’aide de points de contrôle de cycles d’entraînement de modèles de pointe et sous réserve d’une analyse de sûreté, pour repérer et combler toute lacune. Soumettre aussi à des tests d’équipe rouge tous les services auxquels le modèle pourrait accéder pendant l’entraînement (p. ex., le cache Internet).
Communication entre échantillons : Limiter les communications à haut débit entre échantillons aux voies approuvées, comme les outils multiagents, et fermer les canaux auxiliaires de l’infrastructure qui offrent un haut débit et sont faciles à découvrir par les agents.
Transcriptions immuables : Conserver les transcriptions des agents sous une forme immuable pendant une durée raisonnable (p. ex., dans des comptes de stockage à écriture unique) pour l’ensemble de l’entraînement par apprentissage par renforcement, des évaluations et des déploiements internes, afin de permettre des enquêtes fiables et d’éviter les modifications involontaires.
Surveillance : Si les modèles commencent à effectuer des actions désalignées, disposer d’un système de surveillance en temps réel pour détecter tout désalignement potentiel et traiter rapidement les problèmes prioritaires avant qu’un incident grave ne survienne. Cela pourrait comprendre les éléments suivants :
Exiger la possibilité de surveillance : Veiller à ce que les modèles demeurent surveillables, en le mesurant par des évaluations de la possibilité de surveillance et du contournement des dispositifs de surveillance assorties de seuils clairs, afin de détecter rapidement les comportements préoccupants.
Rappel élevé sur les problèmes connus : Vérifier que le système de surveillance présente un rappel élevé sur les incidents antérieurs dans une évaluation réservée à cet usage.
Actualité des évaluations des dispositifs de surveillance : Créer des points de données d’évaluation représentatifs des risques inédits pour les nouveaux cycles, afin que les mesures de rappel et de précision des dispositifs de surveillance restent à jour.
Intervention rapide : Mettre en place des alertes prioritaires entraînant une action dans le délai prévu par un accord de niveau de service, soit en alertant une personne de garde, soit en mettant automatiquement en pause le cycle concerné, avant que le modèle ne cause un préjudice (p. ex., alerter la personne de garde en sécurité et le responsable du cycle lors d’incidents de jour, et mettre automatiquement les cycles en pause si les alertes restent sans accusé de réception la nuit).
En plus de formuler des recommandations sur les mesures de protection techniques, nous travaillons à des pratiques exemplaires opérationnelles pour les dossiers de sûreté des cycles d’entraînement d’IA de pointe. Celles-ci pourraient comprendre les éléments suivants :
Avis divergents (analyses pré-mortem) : Après la rédaction d’un dossier de sûreté, un membre d’une autre équipe devrait rédiger un avis divergent pour repérer les failles potentielles du dossier et présenter une appréciation nuancée des risques. L’équipe d’entraînement devrait ensuite y répondre afin de renforcer le dossier.
Approbations : Le dossier de sûreté devrait être examiné par des membres de la haute direction, chacun disposant d’un droit de veto sur le cycle afin d’assurer plusieurs contrôles internes (p. ex., responsable ou vice-présidence de la recherche, responsable de la sûreté et direction scientifique).
Responsabilité : Le membre de la haute direction responsable d’un cycle d’entraînement (p. ex., responsable ou vice-présidence de la recherche) devrait rendre compte du dossier de sûreté et de toute intervention en cas d’incident, notamment dans les évaluations de rendement, afin d’inciter aussi les équipes d’entraînement à promouvoir la sûreté et l’alignement.
Mise en pause : Si des problèmes susceptibles d’invalider un dossier de sûreté sont découverts (p. ex., un nouveau problème de sécurité), veiller à disposer de guides d’intervention, de contrôles techniques et d’accords de niveau de service pour mettre en pause tous les cycles concernés.
Transparence interne : Les dossiers de sûreté devraient être accessibles aux groupes de surveillance internes (p. ex., le comité de sûreté et de sécurité).
Audits : Les auditeurs devraient disposer d’un accès suffisant pour vérifier la validité et la solidité des affirmations du dossier de sûreté et signaler toute lacune constatée.
Remontée des alertes : Il devrait exister un processus clair pour faire remonter les alertes de désalignement, avec un tableau définissant les niveaux de gravité et une personne de garde chargée du désalignement, capable d’alerter la direction (p. ex., le PDG) lorsqu’un cycle atteint un certain niveau de gravité.
Contrôles techniques : Il devrait être difficile, pour les humains comme pour les agents, de lancer des cycles non conformes. Les fonctions de sûreté, comme la surveillance et la mise en pause automatique, devraient bloquer les opérations en cas de défaillance (p. ex., il ne devrait pas être possible de lancer des cycles sans activer une surveillance appropriée ni de désactiver le dispositif de surveillance depuis l’entraînement par apprentissage par renforcement, l’évaluation ou un déploiement interne).
Possibilité de retour en arrière : Il devrait être facile de repérer toutes les utilisations en aval d’un modèle désaligné dans le processus d’entraînement (p. ex., génération de données ou notation) afin de pouvoir annuler l’effet de ses sorties désalignées au besoin.
Exhaustivité des risques résiduels : Les dossiers de sûreté devraient dresser, dans la mesure du possible, une liste exhaustive des risques résiduels non couverts par les mesures d’atténuation en place, afin de permettre des décisions éclairées sur l’acceptation des risques.
Ces recommandations reflètent notre position actuelle et sont en cours de mise en œuvre chez OpenAI. Nous nous attendons à ce que nos pratiques continuent d’évoluer au cours des prochaines semaines.
Nous élaborons aussi des pratiques exemplaires pour enquêter sur les incidents graves de désalignement de l’IA. Les laboratoires devraient chercher à tirer le plus de leçons possible de chaque incident (à l’image des pratiques d’enquête(s'ouvre dans une nouvelle fenêtre) d’autres secteurs à enjeux élevés) afin d’en prévenir la récurrence. Voici quelques exemples de mesures possibles :
Transparence interne : Comme une enquête peut prendre beaucoup de temps, des mises à jour périodiques sur les enquêtes devraient être présentées à l’interne (p. ex., des mises à jour quotidiennes pour les enquêtes en cours). Le personnel devrait disposer de voies définies pour obtenir un accès élargi, notamment aux transcriptions brutes et à l’échantillonnage des modèles désalignés, lorsque cela est sûr et pertinent pour son travail.
Cause fondamentale du désalignement : Les chercheurs devraient analyser les dynamiques d’entraînement pour en déterminer les causes fondamentales (p. ex., par des ablations ciblées ou des expériences de rééchantillonnage) et comprendre comment les comportements désalignés sont apparus, afin de mieux comprendre la science du désalignement et de mieux le prévenir.
Analyse post-mortem : Une analyse post-mortem opérationnelle et culturelle devrait être menée pour comprendre toutes les causes ayant contribué à l’incident, notamment pourquoi des problèmes sont apparus sans être détectés ni remontés avant l’incident.
Détection : Nous devrions élaborer des méthodes de test de l’alignement capables de déceler la propension à provoquer l’incident, sans les optimiser directement à partir des renseignements tirés de celui-ci (p. ex., transcriptions ou résumés d’incident). Des évaluations dérivées des incidents devraient être créées comme « tests de non-régression » pour vérifier que les futurs modèles ne présentent pas de propension au désalignement dans des incidents très similaires.
Divulgations publiques : Les résultats d’enquête, les analyses post-mortem et les changements opérationnels devraient être communiqués au public à la fin de l’enquête. Les tiers touchés devraient être avisés dès que possible.


