Passer au contenu principal
OpenAI

28 septembre 2026

Sécurité

Vers des dossiers de sûreté pour l’entraînement des IA de pointe

Chargement...

Nous pensons entrer dans une nouvelle ère où une documentation structurée sur la sûreté devrait être exigée avant de poursuivre toute session d’entraînement par renforcement de modèles de pointe. Idéalement, cette documentation devrait atteindre le niveau des « dossiers de sûreté » : des argumentaires complets, structurés et fondés sur des preuves concernant les risques, tels qu’ils sont utilisés dans d’autres secteurs où la sûreté est critique. Nous considérons les dossiers de sûreté comme un idéal vers lequel tendre, tout en reconnaissant la difficulté de les rendre aussi rigoureux pour les modèles d’IA que pour l’aviation ou le nucléaire, en raison de la complexité émergente à chaque nouveau niveau de capacité de l’IA. Nous élaborons un cadre pour codifier ces pratiques.

Voici quelques premières lignes directrices qui, selon nous, devraient figurer dans ces dossiers de sûreté pour l’entraînement des IA de pointe. Ces bonnes pratiques reflètent nos enseignements actuels et devraient évoluer à mesure que nous affinons nos processus internes pour un développement prudent. Nous les partageons dès maintenant pour rendre notre réflexion actuelle transparente et recueillir les retours de la communauté. Ce document porte sur l’entraînement par renforcement des modèles de pointe ; les déploiements internes et externes exigent de prendre en compte un ensemble bien plus large de propriétés d’alignement.

1. Protections techniques

Les dossiers de sûreté devraient couvrir trois aspects de la pile technique : l’entraînement à l’alignement, le confinement et la surveillance. Ces protections contribuent à garantir que le modèle ne tente pas d’actions désalignées et que, même s’il le faisait, il lui serait difficile de sortir du confinement et la surveillance le détecterait avant tout préjudice.

  • Alignement des modèles : La première ligne de défense devrait consister à entraîner les modèles à être alignés, c’est-à-dire à agir de manière fiable selon nos intentions. Cela pourrait inclure les éléments suivants :

    • Environnements d’entraînement et notation : Réduire le risque que les modèles développent des comportements désalignés en empêchant le renforcement positif des détournements du système de récompense pendant l’entraînement. Cela pourrait inclure les éléments suivants :

      • Examens automatisés des jeux de données : Utiliser des agents pour repérer et corriger les environnements d’apprentissage par renforcement défectueux, dans lesquels des trajectoires désalignées pourraient obtenir une récompense élevée en exploitant des failles plutôt qu’en adoptant le comportement attendu, afin de limiter les possibilités de renforcer le désalignement pendant l’entraînement.

      • Examens manuels des jeux de données : Compléter le red teaming automatisé par des examens manuels et des contrôles qualité des jeux de données pour repérer les tâches défectueuses susceptibles de renforcer involontairement des comportements désalignés.

      • Réglage des systèmes de notation : Régler les systèmes de notation pour pénaliser les tentatives du modèle d’exploiter des failles ou de détourner les environnements d’apprentissage par renforcement pendant l’entraînement.

      • Analyse des sessions antérieures : Appliquer des classificateurs aux traces d’expériences antérieures pour vérifier que les systèmes de notation fonctionnent comme prévu.

    • Mesure de l’alignement : Effectuer des évaluations qui suivent les propensions au désalignement du modèle afin de mesurer l’efficacité de l’entraînement à l’alignement. Cela pourrait inclure les éléments suivants :

      • Évaluations d’alignement hors ligne : Effectuer des évaluations d’alignement pendant les sessions d’entraînement de modèles de pointe pour vérifier que l’entraînement fonctionne comme prévu et examiner toute régression notable.

      • Tests rétrospectifs : Tester rétrospectivement les évaluations d’alignement sur des incidents passés pour confirmer qu’elles détectent les modèles précédemment désalignés et ne sont pas surajustées à des incidents particuliers.

      • Suivi du contournement des évaluations : Suivre la conscience de l'évaluation ou le méta-jeu (lorsque les modèles reconnaissent qu’ils sont testés), susceptibles d’induire un changement de comportement, avec des seuils de blocage précis (par exemple, activer des dispositifs de surveillance de ces phénomènes lors des évaluations d’alignement).

      • Tests de résistance au pire scénario : Susciter les pires comportements indésirables et vérifier qu’au moins une évaluation les détecterait.

    • Empêcher l’entraînement sur le raisonnement détaillé (« chain-of-thought ») : Ne pas laisser les systèmes de notation automatisés accéder au raisonnement détaillé (« chain-of-thought ») lors de l’apprentissage par renforcement, afin d’éviter que les modèles n’évoluent pour échapper aux dispositifs de surveillance du raisonnement détaillé (« chain-of-thought »).

  • Confinement : Prévoir une isolation en bac à sable et une sécurité suffisamment robustes pour empêcher des actions nuisibles si un modèle devient désaligné. Cela pourrait inclure les éléments suivants :

    • Sécurité de l’infrastructure à plusieurs niveaux : Investir massivement dans le renforcement du bac à sable où s’exécute le modèle et de l’infrastructure de recherche qui l’héberge, afin de disposer d’une protection supplémentaire en cas de sortie du bac à sable.

    • Red teaming du confinement : Améliorer la sécurité du bac à sable, de l’infrastructure de recherche et du périmètre en soumettant ces systèmes à un red teaming itératif à l’aide de points de contrôle issus de sessions d’entraînement de modèles de pointe, sous réserve d’une analyse de sûreté, afin de repérer et de combler les failles. Soumettre également à des tests adversariaux tous les services avec lesquels le modèle pourrait interagir pendant l’entraînement (par exemple, le cache Internet).

    • Communication entre échantillons : Limiter les communications à haut débit entre échantillons aux voies approuvées, telles que les outils multi-agents, et fermer les canaux auxiliaires de l’infrastructure à haut débit facilement repérables par les agents.

    • Transcriptions immuables : Conserver les transcriptions des agents sous une forme immuable pendant une durée raisonnable (par exemple, dans des comptes de stockage à écriture unique) pour tout entraînement par renforcement, toute évaluation et tout déploiement interne, afin de permettre des enquêtes fiables et d’éviter les modifications involontaires.

  • Surveillance : Si les modèles commencent à effectuer des actions désalignées, disposer d’un système de surveillance en temps réel pour détecter tout désalignement potentiel et traiter rapidement les problèmes prioritaires avant qu’un incident grave ne survienne. Cela pourrait inclure les éléments suivants :

    • Garantir la possibilité de surveillance : Veiller à ce que les modèles restent surveillables, en le mesurant par des évaluations de leur aptitude à être surveillés et de leur capacité à échapper à la surveillance, avec des seuils clairs, afin de détecter tôt les comportements préoccupants.

    • Rappel élevé sur les problèmes connus : Vérifier que le système de surveillance présente un rappel élevé sur les incidents passés lors d’une évaluation sur des données réservées à cet usage.

    • Actualité des évaluations de surveillance : Créer des données d’évaluation représentatives des risques entièrement nouveaux des nouvelles sessions, afin que les mesures de rappel et de précision des dispositifs de surveillance restent pertinentes.

    • Réponse rapide : Mettre en place des alertes prioritaires entraînant une action dans le délai défini par un SLA, en alertant une personne d’astreinte ou en mettant automatiquement en pause la session concernée, avant que le modèle ne cause un préjudice (par exemple, alerter la personne d’astreinte de sécurité et le responsable de la session en cas d’incident le jour, et mettre automatiquement les sessions en pause si les alertes ne sont pas acquittées la nuit).

2. Lignes directrices opérationnelles

Outre les recommandations sur les protections techniques, nous élaborons de bonnes pratiques opérationnelles pour les dossiers de sûreté des sessions d’entraînement d’IA de pointe. Elles pourraient inclure les éléments suivants :

  • Avis contradictoires (analyses pré-mortem) : Une fois le dossier de sûreté rédigé, un membre d’une autre équipe devrait rédiger un avis contradictoire pour en repérer les éventuelles lacunes et fournir une appréciation mesurée du risque. L’équipe d’entraînement devrait ensuite y répondre afin de consolider le dossier.

  • Approbations : Le dossier de sûreté devrait être examiné par des membres de la haute direction, chacun disposant d’un droit de veto sur la session afin de garantir plusieurs contrôles internes (par exemple, responsable ou vice-président de la recherche, responsable de la sûreté et directeur scientifique).

  • Responsabilité : Le dirigeant responsable d’une session d’entraînement (par exemple, responsable ou vice-président de la recherche) devrait répondre du dossier de sûreté et de toute réponse aux incidents, y compris lors des évaluations de performance, afin que les équipes d’entraînement soient également incitées à promouvoir la sûreté et l’alignement.

  • Mise en pause : Si des problèmes susceptibles d’invalider un dossier de sûreté sont détectés (par exemple, une nouvelle faille de sécurité), veiller à disposer de procédures opérationnelles, de contrôles techniques et d’accords de niveau de service (SLA) pour mettre en pause toutes les sessions couvertes.

  • Transparence interne : Les dossiers de sûreté devraient être accessibles aux instances de supervision internes (par exemple, le Comité de sûreté et de sécurité).

  • Audits : Les auditeurs devraient disposer d’un accès suffisant pour vérifier la validité et la solidité des affirmations du dossier de sûreté et signaler les éventuelles lacunes.

  • Remontée des alertes : Il devrait exister une procédure claire de remontée des alertes de désalignement, avec un tableau définissant les niveaux de gravité et une personne d’astreinte pouvant alerter les dirigeants (par exemple, le PDG) lorsqu’une session atteint un certain niveau de gravité.

  • Contrôles techniques : Il devrait être difficile pour les humains et les agents de lancer des sessions non conformes. Les dispositifs de sûreté, tels que la surveillance et la mise en pause automatique, devraient bloquer le fonctionnement en cas de défaillance (par exemple, il ne devrait pas être possible de lancer une session sans surveillance adéquate activée, ni de désactiver cette surveillance depuis un entraînement par renforcement, une évaluation ou un déploiement interne).

  • Capacité de retour en arrière : Il devrait être facile d’identifier toutes les utilisations en aval d’un modèle désaligné dans le processus d’entraînement (par exemple, la génération de données ou la notation) afin de pouvoir annuler, si nécessaire, les effets des sorties désalignées.

  • Exhaustivité des risques résiduels : Les dossiers de sûreté devraient dresser une liste aussi exhaustive que possible des risques résiduels non couverts par les mesures d’atténuation en place, afin de permettre des décisions éclairées d’acceptation du risque.

Ces recommandations reflètent notre position actuelle et sont en cours de mise en œuvre chez OpenAI. Nous prévoyons que nos pratiques continueront d’évoluer au cours des prochaines semaines.

3. Enquêtes sur les incidents de désalignement

Nous élaborons également de bonnes pratiques pour enquêter sur les incidents graves de désalignement de l’IA. Les laboratoires devraient chercher à tirer le plus d’enseignements possible de chaque incident (à l’image des pratiques d’enquête⁠(ouverture dans une nouvelle fenêtre) d’autres secteurs à forts enjeux) afin d’éviter qu’ils ne se reproduisent. Voici quelques exemples de mesures possibles :

  • Transparence interne : Une enquête pouvant prendre beaucoup de temps, des points d’avancement réguliers devraient être présentés en interne (par exemple, des points quotidiens pour les enquêtes en cours). Les employés devraient disposer de procédures définies pour obtenir un accès élargi, notamment aux transcriptions brutes et à l’échantillonnage des modèles désalignés, si cela est sûr et pertinent pour leur travail.

  • Cause profonde du désalignement : Les chercheurs devraient identifier les causes profondes dans la dynamique d’entraînement (par exemple, par des études d’ablation ciblées ou des expériences de rééchantillonnage) afin de comprendre comment les comportements désalignés ont été introduits, de mieux comprendre la science du désalignement et de mieux le prévenir.

  • Analyse post-mortem : Une analyse post-mortem opérationnelle et culturelle devrait être menée pour comprendre toutes les causes ayant contribué à l’incident, notamment pourquoi des problèmes sont apparus sans être détectés ni remontés avant l’incident.

  • Détection : Nous devrions élaborer des méthodes de test d’alignement capables de détecter la propension à provoquer l’incident, sans les optimiser directement par itérations à partir d’informations tirées de celui-ci (par exemple, des transcriptions ou des résumés d’incident). Des évaluations dérivées des incidents devraient être créées comme « tests de non-régression », afin de vérifier que les futurs modèles ne présentent pas de propension au désalignement dans des incidents très similaires.

  • Communication publique : Les résultats des enquêtes, les analyses post-mortem et les changements opérationnels devraient être communiqués au public après la clôture de l’enquête. Les tiers concernés devraient être informés dès que possible.

Auteur

OpenAI