Priorités et principes pour des évaluations tierces efficaces
Les laboratoires d’IA de pointe ont l’immense responsabilité d’entraîner, d’évaluer et de déployer les modèles de façon sécuritaire. Les évaluations par des tiers jouent un rôle essentiel dans l’exercice de cette responsabilité : elles multiplient les possibilités de contribuer à la sécurité de l’IA, tiennent le monde informé et obligent les laboratoires à rendre compte d’affirmations de sécurité claires et étayées de façon indépendante.
Dans le cadre de nos efforts visant à suivre le rythme des avancées de pointe, OpenAI s’engage à soutenir des évaluations indépendantes offrant un accès approfondi aux activités d’entraînement, d’évaluation et de déploiement. Cet accès doit permettre aux évaluateurs de remettre en question nos hypothèses, de relever les risques qui auraient pu nous échapper et de tirer leurs propres conclusions sur l’efficacité de nos mesures de protection.
Nous travaillons depuis longtemps avec des évaluateurs tiers à diverses étapes du développement et du déploiement des modèles. Nous avons également intégré des évaluations par des tiers à nos pratiques liées au cadre de préparation et soutenu des organisations et des mesures législatives qui préconisent un processus plus rigoureux et responsable. Dans le cadre de ces collaborations, nous avons fourni des formes d’accès approfondi, notamment des renseignements sur nos mesures de protection techniques, un accès au raisonnement détaillé (« chain-of-thought ») visible, ainsi que des niveaux sans précédent d’accès à des données confidentielles et aux déploiements internes pour l’intervention en cas d’incident et la mise à l’essai en équipe rouge des moniteurs. Les priorités et les principes présentés ici portent sur notre collaboration avec des organismes d’évaluation indépendants des secteurs privé et sans but lucratif dans le cadre d’évaluations techniques de la sécurité. Ils complètent notre travail avec les gouvernements en matière de mise à l’essai et d’évaluation, où des rôles et des responsabilités distincts peuvent nécessiter des approches différentes.
L’efficacité de ces évaluations exige de solides mécanismes d’indépendance, une rigueur scientifique, des pratiques de sécurité robustes et des responsabilités claires. Les laboratoires ont la responsabilité de permettre un examen sérieux tout en protégeant les renseignements sensibles. Les laboratoires et les évaluateurs indépendants partagent la responsabilité de bien faire les choses et doivent appliquer des normes internationales communes pour les pratiques de sûreté et de sécurité. Nous proposons ci-dessous quatre domaines prioritaires pour une évaluation approfondie, ainsi que des principes assurant un travail rigoureux, sécuritaire et indépendant.
Les évaluations par des tiers sont particulièrement utiles lorsqu’elles portent sur des questions précises et lourdes de conséquences : les preuves étayent-elles l’argumentaire et les affirmations de sécurité d’un laboratoire? Les évaluations mettent-elles adéquatement à l’épreuve les risques qu’elles sont censées mesurer? Les mesures de protection fonctionnent-elles dans des conditions réalistes?
Les évaluations décrites ici sont destinées à prendre différentes formes selon les questions de sécurité examinées. Nous prévoyons soutenir plusieurs évaluations en parallèle et sur des périodes différentes, certaines durant quelques semaines et d’autres plusieurs mois. Bien que les évaluations par des tiers puissent aussi faire partie des travaux préalables au déploiement et orienter les décisions connexes, les travaux décrits ici s’inscrivent généralement dans une perspective à plus long terme et sont indépendants de tout lancement; ils visent à examiner en profondeur des affirmations de sécurité précises au fil du temps.
Dans nos domaines prioritaires et nos principes, nous parlons d’affirmations et d’argumentaires de sécurité. Voici ce que nous entendons par ces termes :
Affirmation de sécurité : assertion précise concernant les capacités, le comportement ou les mesures de protection d’un modèle ou d’un système, qui touche à sa sécurité et peut être évaluée au regard des preuves. Une affirmation doit préciser les risques et les conditions qu’elle vise, ainsi que les hypothèses et les limites pertinentes.
Argumentaire de sécurité : argument structuré, étayé par des preuves, expliquant pourquoi les risques d’un modèle ou d’un système sont adéquatement gérés pour une activité donnée, comme l’entraînement, l’évaluation ou le déploiement. Un argumentaire de sécurité relie chaque affirmation de sécurité aux preuves qui l’étayent et présente explicitement les hypothèses, les incertitudes et les risques résiduels susceptibles d’influer sur ses conclusions.
Nous proposons quatre domaines prioritaires pour une évaluation approfondie, ainsi que des principes assurant un travail rigoureux, sécuritaire et indépendant.
Évaluation indépendante des argumentaires de sécurité couvrant l’entraînement, l’évaluation ainsi que les déploiements internes et externes.
L’évaluation des argumentaires de sécurité exige une expertise en alignement, en méthodes de contrôle comme la surveillance, en cybersécurité, en mésusage biologique et chimique ainsi qu’en équipe rouge. Les argumentaires de sécurité comprennent des affirmations portant notamment sur l’entraînement, les évaluations des capacités et les mesures de protection, qui peuvent être évaluées dans leur ensemble ou séparément (voir les priorités 2 et 3 ci-dessous). Plusieurs évaluateurs devront probablement examiner différentes parties des argumentaires en s’appuyant sur leur expertise respective. Ensemble, leurs évaluations doivent répondre à des questions comme les suivantes :
Les preuves étayant les argumentaires de sécurité relatifs à l’entraînement, à l’évaluation et aux déploiements sont-elles fondées? Les conditions de l’argumentaire de sécurité ont-elles été respectées pendant l’entraînement, l’évaluation et le déploiement?
Nos argumentaires de sécurité couvrent-ils les risques les plus urgents relevés au cours d’une évaluation? Les affirmations de sécurité étayent-elles l’argumentaire de sécurité global? Y a-t-il des lacunes ou des aspects à améliorer?
Des méthodes efficaces sont-elles employées pour repérer et réduire les incitatifs d’entraînement susceptibles de récompenser la tromperie, le détournement de la récompense, les actions destructrices ou le contournement des restrictions?
Évaluation des mesures de protection essentielles dans les déploiements internes et externes
Notre ensemble de mesures de protection évolue constamment en fonction de l’évolution des capacités et du contexte. Nos mesures de protection couvrent l’entraînement ainsi que les déploiements internes et externes. Elles comprennent actuellement des mesures de protection au niveau du modèle, des mesures d’application et des mesures de sécurité, ainsi que des moniteurs de désalignement. Elles couvrent une grande variété de risques, comme la perte de contrôle et le mésusage lié aux risques cybernétiques, biologiques et chimiques. Les partenariats techniques peuvent dès maintenant relever les faiblesses des mesures de protection, tout en améliorant les méthodes d’évaluation et en accélérant l’élaboration de normes. Ils fournissent ainsi une base technique plus solide pour de futures politiques publiques adaptées aux avancées de pointe, particulièrement pour les déploiements internes, où les normes de sûreté et de sécurité sont encore embryonnaires.
Les évaluations indépendantes doivent examiner l’efficacité de ces mesures de protection et déterminer leurs éventuelles lacunes, notamment en posant les questions suivantes :
Avec un accès « boîte grise », les mesures de protection résistent-elles aux essais contradictoires (jailbreaks) et protègent-elles suffisamment contre l’augmentation des capacités dans les domaines à haut risque, comme la cybersécurité et la biologie? Nos essais contradictoires et notre travail d’équipe rouge couvrent-ils les risques les plus importants?
Dans le cadre d’essais autorisés menés dans des conditions d’exploitation réalistes, comment les agents interagissent-ils avec les cyberdéfenses, comme les contrôles d’accès, les environnements isolés et les systèmes de détection et d’intervention? Quelles défenses préviennent, détectent ou circonscrivent les actions nuisibles, et où échouent-elles?
Nos moniteurs de désalignement présentent-ils des lacunes critiques qui pourraient entraîner une perte de contrôle ou un désalignement grave dans les déploiements internes ou externes? Dans quelle mesure la surveillance du raisonnement détaillé (« chain-of-thought ») constitue-t-elle une source fiable de preuves concernant la sécurité ou l’alignement à mesure que les capacités des modèles progressent?
Une surveillance appropriée est-elle mise en œuvre dans l’ensemble des activités pertinentes d’entraînement, d’évaluation et de déploiement, de manière à ne pas pouvoir être facilement désactivée?
Les mesures de protection mises en œuvre sont-elles proportionnelles aux capacités?
Évaluation des capacités couvrant les catégories de risques du cadre de préparation (risques chimiques et biologiques, cybersécurité et autoamélioration de l’IA), ainsi qu’évaluations de l’alignement portant sur les risques de désalignement
Notre cadre de préparation exige des évaluations portant sur les principaux domaines de risques liés aux modèles de pointe. À mesure que les seuils sont dépassés et que les évaluations atteignent leur plafond, il est important de les renouveler régulièrement et d’assurer la couverture et la qualité des évaluations des capacités liées aux domaines de risque du cadre de préparation, ainsi que des évaluations de l’alignement visant les risques de désalignement grave.
Voici quelques questions pertinentes :
Les évaluations des risques du cadre de préparation couvrent-elles adéquatement la définition des seuils de risque de ce cadre? Les seuils de ces évaluations sont-ils établis correctement?
Les évaluations sont-elles mises à jour lorsque les modèles obtiennent systématiquement les notes maximales, et les nouveaux tests mesurent-ils réellement des capacités plus avancées?
Nos évaluations de l’alignement couvrent-elles adéquatement les risques de désalignement grave, et quels comportements ou quelles conditions importants pourraient-elles omettre?
Enquête indépendante sur les incidents critiques de désalignement
Une enquête indépendante peut être utile pour divers incidents critiques touchant la sécurité de l’IA. Nous nous concentrons ici sur le désalignement des modèles, notamment les modèles qui agissent sans autorisation ou échappent à la surveillance, ce qui peut révéler des faiblesses dans les méthodes d’alignement et les mesures de protection, même en l’absence de mésusage intentionnel.
Dans certaines circonstances, comme lors de l’incident OpenAI sur Hugging Face, il peut être avantageux de faire appel à un tiers indépendant pour mener des enquêtes indépendantes sur les incidents de désalignement. Il est essentiel que les tiers participant à une enquête sur un incident possèdent l’expertise requise, notamment, selon le cas, une expertise en criminalistique informatique et en alignement, une capacité d’analyse à grande échelle du raisonnement détaillé (« chain-of-thought »), ainsi que le personnel et les ressources nécessaires pour mener rapidement l’enquête. L’intervention en cas d’incident peut nécessiter l’accès à des données internes sensibles et à des données de tiers; certains détails peuvent donc être trop sensibles pour être publiés ou consultés. Les constatations issues d’enquêtes indépendantes peuvent aussi éclairer l’argumentaire de sécurité d’un modèle en fournissant des preuves permettant d’évaluer les affirmations sur son alignement et l’efficacité des mesures prises pour corriger les désalignements observés précédemment.
Dans le contexte des incidents de désalignement, nous accordons la priorité aux évaluations indépendantes portant sur les questions suivantes :
Quels comportements du modèle ou problèmes de désalignement se sont produits pendant l’incident, et quels en sont les principaux facteurs contributifs?
Les mesures de protection et de correction atténueraient-elles efficacement des incidents similaires à l’avenir?
Affirmations à évaluer clairement délimitées et convenues d’un commun accord : Les évaluations doivent commencer par l’établissement d’une portée mutuellement convenue, puis par la définition claire d’affirmations de sécurité consignées avant le début des activités d’évaluation. Les tiers et les laboratoires doivent préciser s’il s’agit d’affirmations que l’entreprise évaluée souhaite soumettre à l’évaluation ou d’affirmations que l’évaluateur tiers entend évaluer de façon indépendante et au regard desquelles le laboratoire accepte d’être évalué. De nombreuses raisons peuvent exclure certaines affirmations de la portée, notamment l’impossibilité pour les tiers d’accéder aux données, l’expertise insuffisante de l’évaluateur ou des contraintes de temps raisonnables lorsque l’évaluation est urgente. Les laboratoires et les évaluateurs doivent établir un processus pour examiner les risques importants relevés hors de la portée initiale, notamment afin de déterminer si une enquête approfondie est justifiée. Les conclusions doivent indiquer clairement ce qui a été évalué ou non par rapport à la portée convenue d’un commun accord.
Accès proportionné : Dans la mesure du possible, les évaluateurs doivent disposer d’un accès proportionné pour évaluer les affirmations convenues, sous réserve des contraintes juridiques, de sécurité et de propriété intellectuelle. Lorsqu’un accès direct est impossible ou peu pratique, les évaluateurs peuvent travailler avec un représentant désigné de l’entreprise ou étudier des mécanismes d’accès indirect ou respectueux de la vie privée afin de protéger les renseignements sous-jacents.
Méthode et normes transparentes : Les évaluateurs doivent expliquer leurs méthodes, leurs critères d’évaluation et leurs incertitudes, en s’appuyant sur les normes établies lorsqu’elles existent. Lorsqu’il n’existe pas encore de normes, ils doivent justifier clairement les critères employés. Les rapports doivent distinguer les constatations directes des interprétations, expliquer l’incertitude et préciser clairement les conclusions étayées par les preuves.
Expertise et indépendance : Les évaluateurs doivent démontrer une expertise technique pertinente ainsi que relever, divulguer et gérer les conflits d’intérêts organisationnels et individuels, notamment les incitatifs financiers, les relations avec les développeurs et toute participation antérieure aux travaux évalués. Les mesures de protection doivent garantir que les pressions commerciales et les modalités de rémunération n’influencent pas les constatations. Elles peuvent comprendre la récusation ou des périodes d’exclusion appropriées.
Sécurité et confidentialité : Les évaluateurs doivent démontrer qu’ils appliquent des pratiques de sécurité de l’information et des protections de confidentialité exécutoires visant leur personnel, proportionnées à la sensibilité des systèmes et des renseignements consultés. Ces protections doivent couvrir la propriété intellectuelle, les renseignements sensibles et les dossiers d’évaluation. Lorsque les évaluateurs ne peuvent satisfaire aux exigences de sécurité dans leur propre environnement, ou que les données consultées sont particulièrement sensibles, un accès sur des appareils ou dans des locaux gérés par l’entreprise peut être approprié.
Constatations exploitables et délai de correction : Les évaluations doivent relever les lacunes précises et fournir assez de détails pour permettre aux laboratoires d’y remédier. S’il y a lieu, les laboratoires doivent disposer d’un délai raisonnable pour corriger les problèmes avant la publication. Lorsqu’il y a lieu, les rapports doivent également présenter les enseignements à tirer pour les développeurs, les responsables du déploiement et les défenseurs d’agents, ainsi que des recommandations pratiques de mise en œuvre.
Pratiques de publication responsables : Les rapports d’évaluation doivent reposer sur des preuves et être diffusés aussi ouvertement que possible, tout en protégeant les renseignements sensibles et confidentiels. Lorsqu’une divulgation publique complète est impossible, la transmission confidentielle de rapports aux organismes de surveillance appropriés, comme les organes de gouvernance ou les conseils d’administration, peut favoriser la reddition de comptes. Des protections et des politiques de caviardage fondées sur des principes, ainsi que des attentes claires concernant les commentaires et la correction des inexactitudes, doivent être en place pour préserver l’équilibre entre indépendance et confidentialité. Les évaluateurs doivent conserver leur indépendance éditoriale tout en veillant au maintien des protections relatives à la confidentialité et à la propriété intellectuelle. Les évaluateurs doivent adopter des politiques de caviardage claires permettant aux laboratoires de demander le retrait de renseignements sensibles, tout en pouvant signaler les caviardages substantiels et leur incidence sur le rapport d’évaluation.
Nous nous engageons à soutenir les évaluateurs indépendants et à établir des normes internationales communes plus claires, tant au moyen de futures lois que d’institutions de gouvernance privées, afin d’assurer l’efficacité des évaluations par des tiers. Même si l’écosystème de l’évaluation indépendante est encore en croissance, nous contribuerons à son essor en soutenant une communauté diversifiée d’évaluateurs indépendants possédant une expertise approfondie des questions de sécurité liées aux modèles de pointe et en collaborant avec elle. Aucun tiers ne peut ni ne devrait traiter à lui seul et de façon exhaustive les questions urgentes de sécurité liées aux modèles de pointe. Nous avancerons de façon réfléchie et délibérée afin d’accroître nos capacités et de permettre à l’écosystème grandissant des tiers de s’entendre sur les pratiques exemplaires et les principes. Nous discutons avec plusieurs tiers de propositions qui correspondent aux domaines prioritaires ci-dessus.


