Passer au contenu principal
OpenAI

Développement des modèles à l’ère des cybercapacités critiques

Chargement…

Au cours des dernières semaines, deux événements ont souligné les risques croissants associés aux systèmes d’IA toujours plus performants : l’incident OpenAI-Hugging Face et, séparément, des données préliminaires indiquant que l’un de nos prochains modèles, Astra, pourrait atteindre le seuil de capacité critique en cybersécurité défini dans notre cadre de préparation. Ensemble, ces événements et les progrès rapides de nos recherches internes ont rendu plus urgents nos efforts pour renforcer les mesures de protection liées à la surveillance, à l’alignement et au confinement à toutes les étapes du processus d’entraînement.

À mesure que les modèles gagnent en capacité, les risques liés à leur développement et à leur mise à l’essai en interne augmentent aussi. Nos normes de surveillance, d’alignement et de sécurité doivent conserver une longueur d’avance sur ces risques. Nous voulions prendre le temps nécessaire pour respecter ces normes; nous avons donc temporairement ralenti la mise à l’échelle. Cela comprenait une pause de deux semaines dans l’entraînement par apprentissage par renforcement (RL) de nos plus récents modèles destinés au déploiement, pendant que nous renforcions et testions davantage nos environnements de recherche avec des équipes rouges et élargissions la couverture de nos systèmes de surveillance. Notre plus importante exécution d’apprentissage par renforcement de pointe prévue demeure en suspens pendant que nous menons des entraînements et des évaluations à plus petite échelle afin d’évaluer le comportement du modèle, de valider nos mesures de protection et de recueillir davantage de preuves d’alignement avant de poursuivre.

L’alignement — le travail visant à faire en sorte que les systèmes d’IA se comportent comme prévu et répondent à la supervision humaine — est depuis longtemps au cœur de notre programme de recherche. Nous exigeons maintenant des preuves plus solides de comportement aligné tout au long de l’entraînement, en nous appuyant sur les recherches et les évaluations déjà en cours. Maintenir l’alignement de systèmes toujours plus performants est un défi que l’ensemble du secteur devra relever. Les signaux que nous observons dans les progrès des prochains modèles montrent clairement qu’il nous faut une approche plus vaste, qui s’appuie sur le cadre de préparation actuel tout en allant au-delà.

Nous jugeons important d’expliquer en toute transparence l’évolution de notre approche. Nous décrivons ci-dessous les changements déjà apportés à nos processus et à notre infrastructure de recherche, ainsi que le travail toujours en cours.

Renforcer les mesures de protection pour les modèles plus performants

Notre approche de développement de modèles plus performants repose sur trois mesures de protection complémentaires :

  1. La surveillance, qui détecte les comportements préoccupants et nous permet d’y réagir.
  2. L’alignement, qui réduit la probabilité d’actions nuisibles ou non autorisées.
  3. Les mesures de sécurité, qui limitent ce à quoi les systèmes d’IA peuvent accéder ou ce qu’ils peuvent affecter.

Nous nous attendons à ce que les modèles assurent bientôt la majeure partie du travail de sécurité, y compris la défense contre d’autres modèles. Cela permettra aux trois mesures de protection d’évoluer avec les capacités des modèles, ce qui nous paraît essentiel.

Nous appliquons ces mesures de protection à la recherche et au déploiement, en les adaptant aux capacités, à l’environnement d’exploitation et au niveau de risque de chaque modèle.

Sécuriser nos environnements de recherche

À mesure que les modèles de pointe acquièrent de plus grandes capacités en cybersécurité, nous relevons les normes de sécurité des environnements où nous les entraînons et les évaluons. Le respect de ces normes a exigé un travail d’ingénierie considérable et entraîné des coûts importants ainsi que des retards dans la recherche de pointe. Immédiatement après l’incident OpenAI-Hugging Face*, nous avons suspendu l’inférence des modèles de pointe dans les grappes de recherche pour les exécutions pouvant lancer du code ou utiliser des outils ayant accès à Internet. Nous avons assez rapidement rétabli une voie plus limitée et sécurisée pour l’exécution de code, puis examiné chaque charge de travail afin de déterminer si elle pouvait reprendre sans danger. Certaines charges de travail de recherche ont repris sous ces nouveaux contrôles, tandis que d’autres ont nécessité des changements supplémentaires.

Au cours des semaines suivantes, nous avons défini et commencé à mettre en œuvre des exigences de sécurité renforcées pour les charges de travail de recherche de pointe. Par exemple :

  • Isolation des charges de travail : Nous exigeons désormais une isolation renforcée (« bacs à sable ») pour les charges de travail qui exécutent du code généré par un modèle ou autrement non fiable. Cela s’applique aussi aux logiciels qui pourraient être compromis lors du traitement des sorties d’un modèle.
  • Isolation du réseau : Nous avons mis en place davantage de contrôles pour isoler d’Internet les charges de travail à risque élevé et non fiables. Nous avons conçu ces contrôles de sorte que la compromission d’une seule charge de travail ou d’un service connexe ne permette pas, à elle seule, un accès non autorisé à Internet ou à d’autres réseaux internes.
  • Tests de sécurité continus : Nous avons reconfiguré notre environnement afin de supprimer les services partagés potentiellement vulnérables, de réduire les privilèges permanents et d’améliorer les limites de sécurité et de confiance. Nous améliorons aussi notre capacité à recueillir et à surveiller les journaux de sécurité. Enfin, nous investissons dans l’automatisation en utilisant nos modèles pour tester continuellement ces limites contre des attaques simulées.

Ensemble, ces contrôles assurent une défense en profondeur et aident à protéger notre environnement de recherche contre les attaques. Aujourd’hui, nous exigeons le niveau le plus strict de mesures de sécurité pour les charges de travail liées à Astra ou aux modèles cyber, car nous avons déterminé que les modèles Astra pourraient avoir un niveau critique de cybercapacité. Ces mesures de protection s’appliquent également à toutes les autres charges de travail liées au domaine cyber.

Bien que certains entraînements et certaines évaluations d’Astra répondent à ces exigences, un nombre important de charges de travail demeurent en suspens jusqu’à ce qu’elles soient entièrement migrées et améliorées pour satisfaire à la nouvelle norme de sécurité. Nous accordons la priorité à la migration des charges de travail de sûreté et d’alignement vers ces nouveaux environnements.

Élargir la surveillance du raisonnement détaillé (« chain-of-thought »)

La surveillance joue depuis longtemps un rôle important dans notre processus de développement des modèles, notamment la surveillance des agents de programmation internes et des sessions de longue durée. Nos efforts de surveillance ciblaient particulièrement les déploiements internes de modèles de pointe et les exécutions d’apprentissage par renforcement de pointe, que nous considérions comme les charges de travail les plus risquées puisqu’elles peuvent combiner des capacités avancées avec l’accès à des outils, à des systèmes sensibles et à des réseaux internes ou externes. Ils ne s’appliquaient pas à toutes les exécutions d’inférence et d’entraînement utilisant des outils. Nous avons revu et élargi notre approche grâce à notre nouveau dispositif de surveillance.

Ce nouveau dispositif de surveillance comporte plusieurs étapes. Il commence par des classificateurs d’activation — des détecteurs qui examinent l’activité interne d’un modèle — exécutés à chaque token échantillonné, puis transmet les problèmes potentiels à des enquêteurs automatisés de plus en plus sophistiqués et exigeants en calcul. Ces systèmes examinent les actions des outils, le raisonnement disponible et la séquence complète des activités pour détecter les accès non autorisés, le vol de données, les comportements destructeurs et les tentatives de contournement des mesures de protection. Nous cherchons à émettre une alerte dans les 30 minutes suivant la détection d’une activité préoccupante par notre système de surveillance. Si le système de surveillance repère une violation probable d’une limite de sécurité critique, il génère une alerte de priorité maximale. Dans notre mise en œuvre actuelle, les équipes de sûreté, de sécurité et de recherche sont alertées. Si elles ne peuvent pas établir avec certitude dans les 30 minutes que le signalement est un faux positif, ces équipes doivent suspendre l’activité.

Cette surveillance est obligatoire pour tous les entraînements par apprentissage par renforcement et toutes les évaluations avec outils visant des modèles aux capacités équivalentes ou supérieures à celles de Sol. Après avoir déterminé, le 7 août, qu’Astra pourrait posséder des cybercapacités critiques, nous avons ajouté une exigence de surveillance pour toutes les inférences d’Astra avec outils, et non seulement pour l’entraînement par apprentissage par renforcement et les évaluations.

Ces mesures de protection exigent une puissance de calcul considérable. Selon nos estimations actuelles, la surcharge liée à la surveillance représente environ 20 % de la puissance de calcul de l’inférence surveillée, bien que le coût varie considérablement selon les charges de travail d’entraînement et d’évaluation. Nous communiquerons plus de détails sur ce système dans un prochain billet de blogue.

Faire progresser la recherche sur l’alignement

La recherche sur l’alignement est au cœur de notre mission. Notre mission consiste à faire en sorte que l’intelligence artificielle générale profite à toute l’humanité. À mesure que les modèles acquièrent des capacités avancées, comme celle de mener des cyberattaques, et évoluent dans des environnements plus complexes, les comportements mal alignés tels que le détournement de la récompense — trouver des moyens d’obtenir des récompenses élevées pendant l’entraînement sans atteindre le résultat visé —, la tromperie ou l’accès non autorisé créeront des risques toujours plus graves.

Pour les exécutions d’apprentissage par renforcement sur les modèles les plus performants, nous appliquons désormais nos principales techniques d’alignement à davantage d’étapes du processus d’entraînement. Cela comprend l’amélioration des modèles de récompense afin de mieux détecter et décourager les comportements dangereux dans diverses tâches et divers environnements; l’entraînement des modèles pour qu’ils soient plus honnêtes au sujet de leurs actions, de leurs capacités et de leurs limites; et la réduction des comportements qui exploitent les faiblesses des récompenses, des évaluateurs, des outils ou de la supervision. Nous élargissons également la couverture de l’entraînement visant les comportements susceptibles de causer des dommages lorsque les modèles interagissent avec des systèmes ou des ressources externes.

Nous continuons d’investir vigoureusement dans la recherche sur l’alignement, d’élargir la couverture des évaluations et d’utiliser nos apprentissages pour orienter l’entraînement et les mesures de protection. Nous prévoyons bientôt communiquer beaucoup plus de renseignements sur nos recherches en matière d’alignement, notamment ce que nous apprenons sur le comportement des modèles et tout nouveau défi que nous découvrons.

Prochaines étapes

Nous ferons évoluer notre cadre de préparation afin de réunir ces mesures de protection pendant l’entraînement et le déploiement, et de mieux refléter les capacités des futurs modèles ainsi que les environnements dans lesquels ils fonctionnent. Le développement de méthodes capables d’évoluer avec ces capacités exigera des investissements soutenus dans la sécurité assistée par les modèles, une surveillance plus efficace et des progrès continus dans la recherche sur l’alignement. Nous comptons faire participer des organisations externes et communiquer davantage nos apprentissages à mesure que notre approche évolue.

Les capacités des modèles de pointe progressent rapidement. Notre capacité à les comprendre, à les aligner et à les sécuriser doit conserver une longueur d’avance.


*Nous publierons un rapport technique sur nos apprentissages au cours des prochaines semaines.

Auteur

OpenAI