Passer au contenu principal
OpenAI

22 septembre 2026

Sécurité

Priorités et principes pour des évaluations tierces efficaces

Chargement...

Les laboratoires d’IA de pointe assument une immense responsabilité en matière d’entraînement, d’évaluation et de déploiement sécurisé des modèles. Les évaluations par des tiers sont essentielles pour équilibrer cette responsabilité, multiplier les possibilités de contribution à la sécurité de l’IA, informer le monde et obliger les laboratoires à répondre d’allégations de sécurité claires et étayées de façon indépendante.

Dans le cadre de nos efforts visant à suivre le rythme des avancées de pointe, OpenAI s’engage à soutenir des évaluations indépendantes bénéficiant d’un accès approfondi aux phases d’entraînement, d’évaluation et de déploiement. Cet accès doit permettre aux évaluateurs de remettre en question nos hypothèses, d’identifier les risques qui ont pu nous échapper et de tirer leurs propres conclusions quant à l’efficacité de nos mesures de protection.

Nous collaborons depuis longtemps avec des évaluateurs tiers à différentes étapes du développement et du déploiement des modèles. Nous avons également intégré les évaluations par des tiers aux pratiques de notre cadre de préparation et soutenu des organisations et des textes législatifs qui défendent un processus plus rigoureux et responsable. Dans le cadre de ces collaborations, nous avons fourni des formes d’accès approfondies, notamment des informations sur nos mesures de protection techniques, un accès au raisonnement détaillé visible, ainsi que des niveaux sans précédent d’accès aux données confidentielles et aux déploiements internes pour la réponse aux incidents et le red teaming des systèmes de surveillance. Les priorités et principes présentés ici portent sur notre collaboration avec des organismes indépendants des secteurs privé et à but non lucratif chargés d’évaluations techniques de sécurité. Ils complètent notre travail avec les pouvoirs publics sur les tests et les évaluations, pour lesquels des rôles et responsabilités distincts peuvent exiger des approches différentes.

L’efficacité de ces évaluations exige de solides mécanismes d’indépendance, une grande rigueur scientifique, des pratiques de sécurité robustes et des responsabilités clairement définies. Les laboratoires ont la responsabilité de permettre un examen approfondi tout en protégeant les informations sensibles. Les laboratoires et les évaluateurs indépendants partagent la responsabilité de mener cette démarche correctement et doivent appliquer des normes internationales communes en matière de pratiques de sûreté et de sécurité. Nous proposons ci-dessous quatre domaines prioritaires pour une évaluation approfondie, ainsi que des principes visant à garantir un travail rigoureux, sécurisé et indépendant.

Domaines d’évaluation prioritaires

Les évaluations par des tiers sont particulièrement utiles lorsqu’elles répondent à des questions précises et lourdes de conséquences : les éléments probants étayent-ils le dossier et les allégations de sécurité d’un laboratoire ? Les évaluations testent-elles correctement les risques qu’elles sont censées mesurer ? Les mesures de protection fonctionnent-elles dans des conditions réalistes ?

Les évaluations décrites ici sont destinées à prendre différentes formes selon les questions de sécurité examinées. Nous prévoyons de soutenir plusieurs évaluations en parallèle et sur des périodes différentes, certaines durant quelques semaines et d’autres plusieurs mois. Bien que les évaluations par des tiers puissent aussi faire partie des travaux préalables au déploiement et éclairer les décisions de déploiement, les travaux décrits ici s’inscrivent généralement dans le long terme et sont indépendants de tout lancement : ils visent à examiner en profondeur des allégations de sécurité précises au fil du temps.

Dans l’ensemble de nos domaines prioritaires et de nos principes, nous faisons référence aux allégations et aux dossiers de sécurité. Voici ce que nous entendons par ces termes :

Allégation de sécurité : affirmation précise concernant les capacités, le comportement ou les mesures de protection d’un modèle ou d’un système, qui a une incidence sur sa sécurité et peut être évaluée au regard d’éléments probants. Une allégation doit préciser les risques et les conditions auxquels elle répond, ainsi que les hypothèses et limites pertinentes.

Dossier de sécurité : argumentaire structuré et étayé par des éléments probants, expliquant pourquoi les risques d’un modèle ou d’un système sont correctement gérés pour une activité donnée, telle que l’entraînement, l’évaluation ou le déploiement. Un dossier de sécurité relie chaque allégation de sécurité aux éléments qui l’étayent et explicite les hypothèses, les incertitudes et les risques résiduels susceptibles d’influer sur ses conclusions.

Nous proposons quatre domaines prioritaires pour une évaluation approfondie, ainsi que des principes visant à garantir un travail rigoureux, sécurisé et indépendant.

  1. Évaluation indépendante des dossiers de sécurité couvrant l’entraînement, l’évaluation, le déploiement interne et le déploiement externe.

    L’évaluation des dossiers de sécurité exige une expertise en alignement, en méthodes de contrôle telles que la surveillance, en cybersécurité, en détournements biologiques et chimiques et en red teaming. Les dossiers de sécurité se composent d’allégations portant notamment sur l’entraînement, les évaluations des capacités et les mesures de protection, qui peuvent être examinées globalement ou séparément (voir les priorités 2 et 3 ci-dessous). Plusieurs évaluateurs devront probablement examiner différentes parties des dossiers en s’appuyant sur leurs expertises respectives. Ensemble, leurs évaluations doivent répondre à des questions telles que :

    1. Les éléments probants étayant les dossiers de sécurité relatifs à l’entraînement, à l’évaluation et aux déploiements sont-ils fondés ? Les conditions du dossier de sécurité ont-elles été respectées pendant l’entraînement, l’évaluation et le déploiement ?

    2. Nos dossiers de sécurité couvrent-ils les risques les plus urgents identifiés au cours d’une évaluation ? Les allégations de sécurité étayent-elles le dossier de sécurité global ? Existe-t-il des lacunes ou des possibilités d’amélioration ?

    3. Des méthodes efficaces sont-elles utilisées pour identifier et réduire les incitations, lors de l’entraînement, susceptibles de récompenser la tromperie, le reward hacking, les actions destructrices ou le contournement des restrictions ?

  2. Évaluation des mesures de protection critiques dans les déploiements internes et externes

    Notre ensemble de mesures de protection évolue constamment pour s’adapter à l’évolution des capacités et du contexte. Nos mesures de protection couvrent l’entraînement ainsi que les déploiements internes et externes. Elles comprennent actuellement des mesures de protection au niveau du modèle, des mesures d’application des règles et des mesures de sécurité, ainsi que des systèmes de surveillance du désalignement. Elles couvrent un large éventail de risques, tels que la perte de contrôle et les détournements liés aux risques cybernétiques, biologiques et chimiques. Les partenariats techniques peuvent identifier dès maintenant les faiblesses des mesures de protection, tout en améliorant les méthodes d’évaluation et en accélérant l’élaboration de normes. Ils peuvent ainsi fournir une base technique plus solide aux futures politiques publiques destinées à suivre le rythme des avancées de pointe, en particulier pour les déploiements internes, où les normes de sûreté et de sécurité sont encore balbutiantes.

    Les évaluations indépendantes doivent examiner l’efficacité de ces mesures de protection et déterminer leurs éventuelles insuffisances, notamment en posant les questions suivantes :

    1. Avec un accès « boîte grise », les mesures de protection résistent-elles aux tests contradictoires (jailbreaks) et protègent-elles suffisamment contre l’accroissement des capacités dans les domaines à haut risque, par exemple cybernétiques et biologiques ? Nos tests contradictoires et notre red teaming couvrent-ils les risques les plus importants ?

    2. Lors de tests autorisés menés dans des conditions d’exploitation réalistes, comment les agents interagissent-ils avec les défenses cybernétiques telles que les contrôles d’accès, le cloisonnement et les systèmes de détection et de réponse ? Quelles défenses empêchent, détectent ou contiennent les actions nuisibles, et dans quels cas échouent-elles ?

    3. Nos systèmes de surveillance du désalignement présentent-ils des lacunes critiques susceptibles d’entraîner une perte de contrôle ou un désalignement grave dans les déploiements internes comme externes ? Dans quelle mesure la surveillance du raisonnement détaillé (« chain-of-thought ») constitue-t-elle une source fiable d’éléments probants sur la sécurité ou l’alignement à mesure que les capacités des modèles progressent ?

    4. Une surveillance appropriée est-elle mise en œuvre dans tous les entraînements, évaluations et déploiements pertinents, de manière à ne pas pouvoir être facilement désactivée ?

    5. Les mesures de protection mises en œuvre sont-elles proportionnées aux capacités ?

  3. Évaluation des capacités couvrant les catégories de risques de préparation (risques chimiques et biologiques, cybersécurité, auto-amélioration de l’IA) et évaluations de l’alignement portant sur les risques de désalignement

    Notre cadre de préparation exige que les évaluations examinent les principaux domaines de risques liés aux modèles de pointe. À mesure que les seuils sont dépassés et que les évaluations atteignent leurs limites, il est important d’actualiser régulièrement les évaluations des capacités dans les domaines de risques de préparation et celles de l’alignement visant les risques de désalignement grave, et d’en garantir la couverture et la qualité.

    Les questions pertinentes comprennent :

    1. Les évaluations des risques de préparation couvrent-elles correctement la définition des seuils de risque de préparation ? Les seuils de ces évaluations sont-ils correctement définis ?

    2. Les évaluations sont-elles actualisées lorsque les modèles obtiennent systématiquement les meilleurs scores, et les nouveaux tests mesurent-ils réellement des capacités plus avancées ?

    3. Nos évaluations de l’alignement couvrent-elles correctement les risques de désalignement grave, et quels comportements ou conditions importants risquent-elles de négliger ?

  4. Enquête indépendante sur les incidents critiques de désalignement

    Une enquête indépendante peut être utile pour de nombreux incidents critiques liés à la sécurité de l’IA. Nous nous concentrons ici sur le désalignement des modèles, notamment lorsqu’ils agissent sans autorisation ou échappent à la surveillance, ce qui peut révéler des faiblesses des méthodes d’alignement et des mesures de protection, même en l’absence de détournement intentionnel.

    Dans certaines circonstances, comme lors de l’incident OpenAI Hugging Face, il peut être utile de faire appel à un tiers indépendant afin de mener des enquêtes indépendantes sur les incidents de désalignement. Il est essentiel que les tiers participant à l’enquête sur un incident disposent de l’expertise requise, notamment, le cas échéant, en criminalistique cybernétique, en alignement et en analyse à grande échelle du raisonnement détaillé, ainsi que du personnel et des ressources nécessaires pour mener rapidement l’enquête. La réponse aux incidents peut nécessiter l’accès à des données internes sensibles et à des données de tiers. Par conséquent, certains détails peuvent être trop sensibles pour être publiés ou consultés. Les conclusions des enquêtes indépendantes peuvent également éclairer le dossier de sécurité d’un modèle en fournissant des éléments permettant d’évaluer les allégations relatives à son alignement et à l’efficacité des mesures prises pour corriger les désalignements précédemment observés.

    Dans le contexte des incidents de désalignement, nous accordons la priorité aux évaluations indépendantes portant sur les questions suivantes :

    1. Quels comportements du modèle ou problèmes de désalignement sont survenus pendant l’incident, et quels en sont les principaux facteurs contributifs ?

    2. Les mesures de protection et de correction permettraient-elles d’atténuer efficacement des incidents similaires à l’avenir ?

Principes pour des évaluations efficaces

  • Allégations à évaluer clairement délimitées et mutuellement convenues : les évaluations doivent commencer par la définition mutuellement convenue de leur périmètre, suivie d’allégations de sécurité clairement définies et préenregistrées avant le début des activités d’évaluation. Les tiers et les laboratoires doivent préciser s’il s’agit d’allégations que l’entreprise évaluée souhaite soumettre à l’évaluation, ou d’allégations que l’évaluateur tiers entend examiner de façon indépendante et au regard desquelles le laboratoire accepte d’être évalué. De nombreuses raisons peuvent justifier l’exclusion de certaines allégations du périmètre, notamment l’impossibilité pour les tiers d’accéder aux données, l’expertise insuffisante de l’évaluateur ou des délais raisonnables lorsque l’évaluation est urgente. Les laboratoires et les évaluateurs doivent établir une procédure d’examen des risques importants détectés hors du périmètre initial, notamment afin de déterminer si une enquête approfondie est justifiée. Les conclusions doivent indiquer clairement ce qui a été évalué ou non au regard du périmètre mutuellement convenu.

  • Accès proportionné : dans la mesure du possible et sous réserve des contraintes juridiques, de sécurité et de propriété intellectuelle, les évaluateurs doivent disposer d’un accès proportionné pour examiner les allégations convenues. Lorsqu’un accès direct est difficile ou impossible, les évaluateurs peuvent collaborer avec un représentant désigné de l’entreprise ou envisager des mécanismes d’accès indirect ou respectueux de la vie privée afin de protéger les informations sous-jacentes.

  • Méthodologie et normes transparentes : les évaluateurs doivent expliquer leurs méthodes, leurs critères d’évaluation et les incertitudes, en s’appuyant sur les normes établies lorsqu’elles existent. En l’absence de normes, ils doivent justifier clairement les critères qu’ils utilisent. Les rapports doivent distinguer les constatations directes de leur interprétation, expliquer les incertitudes et préciser clairement les conclusions étayées par les éléments probants.

  • Expertise et indépendance : les évaluateurs doivent démontrer une expertise technique pertinente et identifier, déclarer et traiter les conflits d’intérêts institutionnels et individuels, notamment les incitations financières, les relations avec les développeurs et toute participation antérieure aux travaux évalués. Les mesures de protection doivent garantir que les pressions commerciales et les modalités de rémunération n’influencent pas les constatations. Elles peuvent inclure une récusation ou des périodes d’exclusion appropriées.

  • Sécurité et confidentialité : les évaluateurs doivent démontrer qu’ils appliquent des pratiques de sécurité de l’information et des protections de confidentialité opposables couvrant leur personnel, proportionnées à la sensibilité des systèmes et des informations consultés. Ces protections doivent couvrir la propriété intellectuelle, les informations sensibles et les dossiers d’évaluation. Lorsque les évaluateurs ne peuvent pas satisfaire aux exigences de sécurité dans leur propre environnement, ou lorsque les données consultées sont particulièrement sensibles, il peut être approprié de limiter l’accès aux appareils ou aux locaux gérés par l’entreprise.

  • Constatations exploitables et délai de correction : les évaluations doivent identifier des lacunes précises et fournir suffisamment de détails pour permettre aux laboratoires d’y remédier. Le cas échéant, les laboratoires doivent disposer d’un délai raisonnable pour corriger les problèmes avant la publication. Lorsqu’ils sont pertinents, les rapports doivent également présenter les enseignements destinés aux développeurs, aux responsables du déploiement et aux défenseurs des agents, ainsi que des recommandations pratiques de mise en œuvre.

  • Pratiques de publication responsables : les rapports d’évaluation doivent reposer sur des éléments probants et être diffusés aussi ouvertement que possible, tout en protégeant les informations sensibles et confidentielles. Lorsqu’une divulgation publique complète est impossible, la transmission confidentielle de rapports aux organes de surveillance appropriés, tels que les organes de gouvernance ou les conseils d’administration des entreprises, peut renforcer la responsabilisation. Des protections et politiques de caviardage fondées sur des principes, ainsi que des attentes claires concernant les retours et la correction des inexactitudes, doivent être mises en place afin de préserver l’équilibre entre indépendance et confidentialité. Les évaluateurs doivent préserver leur indépendance éditoriale tout en veillant au maintien des protections de la confidentialité et de la propriété intellectuelle. Les évaluateurs doivent adopter des politiques de caviardage claires permettant aux laboratoires de demander le retrait d’informations sensibles, tout en pouvant signaler les retraits substantiels effectués et leur incidence sur le rapport d’évaluation.

La voie à suivre

Nous nous engageons à soutenir les évaluateurs indépendants et à établir des normes internationales communes plus claires, tant par de futures lois que par des institutions de gouvernance privées, afin de garantir l’efficacité des évaluations par des tiers. Alors que l’écosystème de l’évaluation indépendante poursuit son développement, nous contribuerons à sa croissance en soutenant une communauté diverse d’évaluateurs indépendants possédant une expertise approfondie des questions de sécurité de pointe et en collaborant avec elle. Aucun tiers ne peut ni ne doit traiter à lui seul l’ensemble des questions urgentes de sécurité de pointe. Nous avancerons de façon réfléchie et résolue afin de renforcer nos capacités et de permettre à l’écosystème croissant des tiers de s’accorder sur les meilleures pratiques et les meilleurs principes. Nous échangeons avec plusieurs tiers au sujet de propositions conformes aux domaines prioritaires ci-dessus.