À la mi-2023, dans le cadre du projet de recherche « RLSlow », nous avons obtenu les premiers résultats nous donnant l’assurance que nous pourrions mettre à l’échelle l’entraînement des modèles de raisonnement, libérant ainsi la capacité des modèles préentraînés à former leurs propres chaînes de pensée. Szymon et moi avons passé cette nuit-là au bureau, songeant non pas aux chiffres incroyables des évaluations, aux produits ou aux résultats scientifiques que cette technologie produirait, mais plutôt à cette réalité dégrisante : de notre vivant, nous verrons véritablement des machines plus intelligentes que nous, et nous distinguons déjà la forme de ces systèmes. Nous nous demandions comment sensibiliser les gens à l’importance de cette évolution.
Trois ans plus tard, les modèles de langage fondés sur le raisonnement occupent une place en croissance rapide dans l’économie et commencent à repousser les frontières de la science. Ils peuvent utiliser des ordinateurs et des interfaces graphiques, collaborer avec des personnes et entre eux, et mener des projets de recherche. Ils transforment aussi le paysage de la sécurité informatique, ce qui présente manifestement de nouveaux dangers.
De nombreuses nouvelles recherches ont été menées pendant cette période, et notre compréhension de ces systèmes diffère encore un peu de celle que nous avions en 2023. Au vu des résultats internes, je m’attends fortement à ce que ce rythme de progrès puisse se maintenir jusqu’à l’autoamélioration récursive. Si le développement de l’IA poursuit sa trajectoire actuelle, les systèmes qui apparaîtront au cours des prochaines années connaîtront probablement des bonds de capacités d’une ampleur égale ou supérieure et piloteront de plus en plus leur propre développement.
Cette période exige une prudence extrême. Je crains que personne ne soit préparé aux conséquences d’une hausse rapide et continue de l’intelligence artificielle. OpenAI continuera à chercher des solutions techniques aux problèmes d’alignement et de surveillance, à bâtir des systèmes défensifs et, au besoin, à suspendre unilatéralement toute nouvelle mise à l’échelle; je crois toutefois que des interventions plus vastes sont nécessaires.
Dans l’ensemble, les progrès de l’intelligence artificielle sont alimentés par l’augmentation de la puissance de calcul. Chez OpenAI, nous avons profondément intégré cette réalité vers 2017, après avoir constaté les gains constants découlant de la mise à l’échelle dans plusieurs projets de recherche1. Nous avons donc cherché à obtenir une puissance de calcul bien supérieure à celle initialement prévue et avons de plus en plus orienté nos recherches vers un petit nombre d’axes hautement extensibles. Nous pensions que c’était notre seule façon de rester à la pointe de la recherche en IA et d’influencer les répercussions de l’AGI.
De nouveaux algorithmes ont été élaborés en cours de route, grâce à de nouveaux exploits d’ingéniosité réalisés par des équipes et des chercheurs individuels. Je les considère surtout comme des découvertes jalonnant le parcours de mise à l’échelle; la science de l’apprentissage profond en est encore à ses débuts, et les progrès algorithmiques significatifs tendent à être corrélés à l’accès à la puissance de calcul. À l’échelle de plusieurs années, l’IA continue de gagner en intelligence à mesure qu’elle est mise à l’échelle sur de plus gros ordinateurs.
Conformément aux prédictions de Ray Kurzweil datant de la fin du XXe siècle(s'ouvre dans une nouvelle fenêtre), nous sommes maintenant arrivés au moment de l’histoire de l’informatique où l’intelligence artificielle commence à dépasser celle des humains de façons transformatrices.
L’IA est davantage cultivée que conçue : en première approximation, elle résulte de la répétition d’une étape d’optimisation simple, un très grand nombre de fois, au moyen d’une quantité de calcul difficile à concevoir. Il en résulte un système incroyablement complexe qui traite des concepts abstraits et peut simuler des facettes du comportement humain. Nous pouvons découvrir divers éléments sur de petits mécanismes qui émergent dans ce système, selon un processus comparable aux neurosciences; comme en neurosciences, toutefois, son fonctionnement global échappe à toute description que nous pourrions pleinement comprendre.
L’étude de l’IA fondée sur l’apprentissage profond est en grande partie une science expérimentale. Nous déployons beaucoup d’efforts pour concevoir des algorithmes fondés sur des principes et formuler des prédictions vérifiables, mais fondamentalement, nos entraînements à grande échelle sont des expériences, dont les résultats nous surprennent parfois. De plus, à mesure que les systèmes gagnent en capacités, leurs résultats deviennent plus difficiles à interpréter.
La situation est compliquée par le fait que les algorithmes actuels améliorent généralement les capacités faciles à mesurer plus rapidement que celles difficiles à quantifier objectivement. Nous consacrons beaucoup de temps à comprendre comment les capacités se généralisent et quelles priorités établir pour faire progresser les compétences qui seront les plus pertinentes au cours des prochaines années. Par exemple, nous croyons pouvoir améliorer les modèles spécifiquement en recherche mathématique en y accordant davantage d’attention, mais nous ne donnons pas la priorité à cet axe en raison de l’urgence que nous ressentons concernant la RSI et la recherche automatisée sur l’alignement, comme je l’expliquerai plus loin.
L’intelligence produite par la mise à l’échelle de l’apprentissage profond n’est pas directement comparable à l’intelligence humaine. Pour avoir une grande incidence dans le monde réel — être très utile ou très dangereuse —, l’IA n’a pas besoin d’égaler ou de dépasser toutes les capacités humaines; il lui suffit d’en surpasser assez. Et comme elle continue de dépasser les humains sur un nombre croissant de dimensions, il devient de plus en plus difficile de comprendre précisément l’étendue de ses capacités.
Puisque l’intelligence artificielle provient d’un processus fondamentalement différent de celui de l’intelligence humaine, nous ne pouvons pas présumer qu’elle respectera par défaut les principes humains ni qu’elle généralisera à partir d’eux à la manière d’un humain. Le problème central de la recherche en IA est celui de l’alignement : amener l’IA à « essayer de faire ce qui est juste » selon les normes humaines.
Pour organiser les axes de recherche pratique, je trouve utile de distinguer l’alignement des objectifs de l’alignement des valeurs.
De façon générale, l’alignement des objectifs répond à la question : « L’IA cherche-t-elle à atteindre l’objectif qui lui est fixé? ». Cela peut comprendre le respect d’une hiérarchie d’instructions, ou encore la capacité de communiquer et de collaborer avec les personnes afin de tenter de comprendre leurs objectifs. Cet ensemble d’axes s’est révélé extrêmement pertinent en pratique.
L’alignement des valeurs est une propriété plus intrinsèque du modèle. Il s’agit de la capacité à adopter un ensemble de principes généraux et à généraliser à partir de ceux-ci, afin d’agir « raisonnablement » même face à des objectifs imprécis ou contradictoires, ou dans des situations inconnues ou hostiles. Une IA alignée devrait agir avec honnêteté, intégrité et amour pour l’humanité.
Bien sûr, la frontière entre l’alignement des valeurs et celui des objectifs peut être floue, et se soucier véritablement des objectifs exige de tenter d’en déduire l’intention(s'ouvre dans une nouvelle fenêtre) et les valeurs sous-jacentes. Cependant, lorsque je parle de l’importance à long terme de la recherche sur l’alignement, je fais généralement référence à l’alignement des valeurs.
Le défi fondamental de l’alignement de l’IA est la généralisation. À mesure que les machines deviennent plus intelligentes, elles travaillent sur des concepts de plus haut niveau et évoluent dans des environnements de plus en plus différents de ceux rencontrés pendant leur entraînement. Elles peuvent échouer à généraliser les valeurs enseignées et renforcées pendant leur entraînement à ces nouvelles situations; il peut alors nous être difficile de prévoir avec certitude comment elles agiront. La difficulté est accrue par l’évolution très rapide de l’écosystème global dans lequel les IA sont utilisées; par exemple, les IA entraînées aujourd’hui doivent pouvoir interagir de manière robuste avec diverses autres IA. Surtout, les futures IA devront continuer à respecter les valeurs humaines, qu’elles se croient ou non sous supervision humaine.
Il existe actuellement deux grandes catégories de méthodes employées en pratique pour l’entraînement à l’alignement.
La première consiste à favoriser un comportement aligné dans le cadre d’un apprentissage par renforcement axé sur des objectifs. Les actions du modèle sont évaluées — généralement par une IA — en fonction de leur conformité à un modèle de préférences, à une « spécification » ou à une « constitution » donnée, puis récompensées en conséquence. Cette approche peut être très efficace dans les cas courants et constitue un élément essentiel de la création des assistants d’IA modernes. Malheureusement, elle peut aussi être fragile et dépend fortement de l’étendue de la supervision pendant l’entraînement ainsi que de la capacité du modèle à généraliser à partir des situations rencontrées durant celui-ci. Par exemple, lors de l’incident OpenAI-Hugging Face, les agents ont respecté une limite consistant à ne pas recourir à l’ingénierie sociale contre des humains. Cependant, ils n’ont manifestement pas su s’abstenir d’autres actions hors de leur mandat et contraires à l’esprit des valeurs qui leur avaient été enseignées dans d’autres contextes.
La deuxième approche cherche à exploiter la capacité du modèle à généraliser à partir des données de préentraînement. Elle peut consister à créer des jeux de données d’entraînement favorisant l’alignement ou à concentrer le modèle sur une partie « alignée » de la distribution de préentraînement, comme dans le modèle de sélection de persona(s'ouvre dans une nouvelle fenêtre). La faiblesse de cette approche tient à son manque de robustesse face à des pressions d’optimisation supplémentaires. Si l’on prend un modèle qui produit généralement des pensées semblant 'alignées' et qu’on le soumet à un entraînement suffisant où on lui apprend à atteindre des objectifs très difficiles, il peut apprendre à raisonner de façon motivée, en adaptant au besoin ses pensées apparemment « alignées » pour atteindre l’objectif. Nous avons probablement observé un exemple de ce comportement lors de récents incidents de cybersécurité impliquant un modèle autre que ceux d’OpenAI.
Nous investissons massivement dans tout l’éventail des approches couvertes par ces axes. Nous constatons aussi des progrès significatifs : GPT‑6 Astra est le premier modèle à profiter d’avancées importantes auxquelles nous travaillons depuis longtemps, et il est nettement mieux aligné que GPT‑5.6 Sol. Il demeure néanmoins important de reconnaître et de comprendre que des progrès bien plus considérables seront nécessaires à mesure que les modèles gagneront en capacités, et que les progrès de l’alignement généralisable pourraient ne pas dépasser suffisamment ceux de l’intelligence générale des modèles.
Nous ne disposons pas d’une théorie satisfaisante de la généralisation, et il semble peu probable que nous puissions en élaborer une bientôt, du moins sans l’aide d’une IA plus puissante. Par conséquent, à l’heure actuelle, notre capacité à valider empiriquement nos techniques d’alignement est, en pratique, sans doute encore plus importante que les techniques elles-mêmes.
Le principal pari d’OpenAI dans ce domaine a été la surveillance du raisonnement détaillé (« chain-of-thought »)(s'ouvre dans une nouvelle fenêtre). Cette approche repose sur une idée séduisante et extensible : une grande partie des capacités du modèle provient d’un processus de raisonnement verbalisé, soit le raisonnement détaillé (« chain-of-thought »). Si nous mettons à l’échelle l’optimisation des résultats de ce processus sans superviser le processus lui-même, ce raisonnement détaillé (« chain-of-thought ») n’est soumis, pendant l’entraînement, à aucune incitation directe à dissimuler des idées ou des objectifs mal alignés. Cela ne signifie pas que le modèle apprendra à extérioriser les tendances mal alignées qui ne reposent pas sur le raisonnement détaillé (« chain-of-thought »); toutefois, cette méthode peut nous permettre de surveiller précisément l’augmentation des capacités issue du raisonnement.
Nous avons compris l’importance potentielle de la surveillance du raisonnement détaillé (« chain-of-thought ») au moment même où nous développions des modèles de raisonnement. Lors du lancement d’o1‑preview, nous avons délibérément conçu le produit pour masquer la chaîne de pensée, afin de la protéger à long terme de la pression liée à la supervision2. Depuis, pendant le développement, nous nous sommes efforcés de respecter la règle voulant que le processus de raisonnement ne soit pas supervisé. La surveillance de la CoT est devenue pour nous un outil extrêmement important afin d’étudier comment nos modèles généralisent à partir de leur distribution d’entraînement, nous permettant d’observer et d’analyser non seulement leurs actions, mais aussi leur processus interne.
Cet outil demeure essentiel dans notre étude de la classe de modèles Astra. Malheureusement, nos évaluations indiquent toutefois que notre capacité à nous fier à la surveillance de la CoT diminue progressivement. Cette situation découle d’une combinaison de facteurs.
Les modèles de raisonnement modernes sont utilisés dans des environnements plus complexes qu’o1‑preview; leur processus de raisonnement se mêle de plus en plus aux communications avec les personnes et d’autres IA, ainsi qu’à l’utilisation d’outils. Bon nombre de ces interactions doivent être supervisées, ce qui brouille la frontière que nous cherchons à préserver.
L’IA devient plus apte à raisonner sur son propre processus de raisonnement et à le manipuler.
Grâce à l’amélioration des performances du préentraînement, nous constatons aussi que les modèles deviennent beaucoup plus intelligents, même sans recourir au raisonnement verbalisé.
Ces difficultés ne sont pas nécessairement insurmontables. J’espère que nous pourrons élaborer des interventions qui amélioreront la capacité de surveiller le raisonnement détaillé (« chain-of-thought ») de nos modèles, notamment en comprenant mieux l’interaction entre les différents objectifs d’optimisation et les formes de calcul à l’inférence utilisées par le modèle. Je crois aussi qu’il pourrait être très utile de combiner les idées de la surveillance de la CoT et de celle des activations, en mettant à l’échelle l’entraînement de moniteurs ayant un accès direct aux mécanismes internes du réseau, par exemple les confessions(s'ouvre dans une nouvelle fenêtre). Nous explorons activement ces idées. Je m’attends néanmoins à ce que les progrès généraux de l’IA soient de plus en plus limités par la confiance dans la surveillance.
L’argument le plus convaincant que je vois en faveur de la poursuite rapide de l’entraînement de modèles beaucoup plus intelligents est la nécessité de bâtir des systèmes défensifs contre les dangers posés par d’autres IA.
Un risque évident, abordé tout au long de l’année, concerne la cybersécurité : les modèles acquièrent des capacités surhumaines pour pénétrer des systèmes informatiques ou s’en échapper. Cela élargit énormément la portée des risques liés à l’IA : les agents pourront accéder à toutes les infrastructures sauf les plus sécurisées et agir directement sur une grande partie du monde, même sans corps physique. Nous disposons actuellement d’une courte fenêtre pour utiliser les meilleurs modèles disponibles afin de renforcer considérablement la sécurité des systèmes critiques.
Malheureusement, les risques liés à l’IA ne feront que croître désormais. Un agent très performant, expressément entraîné et chargé de commettre des actes malveillants, présente un nouveau type de danger; il risque de dépasser la portée des intentions de son opérateur et de généraliser vers des comportements potentiellement beaucoup plus malveillants. La frontière entre l’utilisation abusive et les actions autonomes mal alignées s’estompera à mesure que l’IA gagnera en autonomie d’action. Nous avons peut-être l’habitude de considérer les IA comme des outils, mais certains agents poursuivront leurs propres objectifs. Ils trouveront des moyens de collaborer avec des personnes en négociant avec elles, en les trompant ou en les faisant chanter.
S’ajoutent les risques découlant de nouvelles technologies que l’IA pourrait rendre possibles, comme les agents pathogènes artificiels.
Nous aurons besoin d’une IA puissante et alignée pour assurer notre défense : sécuriser les infrastructures, nous protéger en temps réel contre les agents incontrôlés et inventer des mesures de protection entièrement nouvelles. Ce sera l’un des principaux axes des efforts de déploiement d’OpenAI.
Parallèlement, malgré l’incertitude découlant des vastes progrès attendus de l’IA et la nécessité de bâtir des systèmes défensifs, nous ne devons pas laisser cela devenir un prétexte à l’imprudence. L’idée de foncer à tout prix paraît absurde dès qu’on mesure pleinement la gravité des enjeux.
Le rôle toujours croissant de l’intelligence artificielle dans son propre processus de développement constitue l’aboutissement naturel d’un progrès technologique soutenu. Si les progrès de l’IA se poursuivent, l’autoamélioration récursive des machines (RSI) sera au cœur même des découvertes scientifiques futures.
La recherche automatisée en IA constitue une forme plus spectaculaire de mise à l’échelle de l’intelligence grâce au calcul; dans ce cadre, l’IA améliorera bien sûr le substrat informatique lui-même. Comme pour la mise à l’échelle, nous orientons les recherches d’OpenAI vers la RSI, car nous croyons que c’est la seule façon de demeurer à la pointe de la recherche en IA.
Je tiens à souligner que mes propos précédents ne signifient pas que j’estime qu’une forte accélération de la recherche sur l’apprentissage profond, surtout à court terme, soit la bonne action collective à entreprendre par la communauté scientifique. Je pense toutefois que c’est là où mène la trajectoire actuelle, et que nous devons tous choisir consciemment comment poursuivre. Nos principaux leviers consistent soit à orienter le processus pour renforcer l’alignement et la surveillance parallèlement à l’IA, tout en trouvant des moyens de maintenir l’humain dans la boucle, soit à nous coordonner pour ralentir le développement futur au besoin afin d’accroître notre confiance dans ces mesures.
À l’heure actuelle, la meilleure voie à suivre me semble combiner les deux.
Les progrès concrets que nous avons réalisés en matière d’alignement et de surveillance ont généralement été étroitement liés aux progrès généraux de l’IA. D’excellents exemples sont l’apprentissage par renforcement à partir de rétroaction humaine(s'ouvre dans une nouvelle fenêtre), essentiel à l’entraînement des premiers assistants d’IA, et la surveillance du raisonnement détaillé (« chain-of-thought »)(s'ouvre dans une nouvelle fenêtre) mentionnée précédemment, rendue possible par les avancées des modèles de raisonnement. Nous devons axer le processus de recherche de plus en plus automatisé sur l’élaboration de nouvelles connaissances, de nouveaux algorithmes et de nouvelles théories de ce type, puis constituer progressivement des dossiers de sûreté pour des IA plus performantes.
La mise à l’échelle des systèmes d’IA doit être limitée par notre degré de confiance en leur sûreté. Nous devons faire évoluer des engagements comme le cadre de préparation ou la politique de mise à l’échelle responsable(s'ouvre dans une nouvelle fenêtre) pour en faire des seuils de sûreté largement imposés à tout développement ultérieur. Ceux-ci peuvent être appliqués par un réseau d’auditeurs tiers, des organismes gouvernementaux ou des instances internationales.
Le défi fondamental de l’automatisation de la recherche en IA n’est pas d’« y arriver », mais d’y arriver d’une manière qui maintient les personnes au cœur du processus d’amélioration continue et laisse l’avenir entre les mains de l’humanité.
Comme nous l’avons récemment expliqué avec Sam, OpenAI organise ses travaux autour de trois grandes priorités :
Traverser la prochaine phase des progrès de l’IA en créant un chercheur en IA automatisé, en travaillant avec lui de manière itérative sur le problème de l’alignement et en trouvant des moyens de maintenir les personnes dans la boucle d’autoamélioration.
Faire profiter la société des avantages du progrès scientifique et de la croissance économique rendus possibles par des machines très intelligentes.
Donner à chaque personne les moyens d’agir grâce à une AGI personnelle.
Dans cet essai, je me suis concentré uniquement sur le premier point, car je crois qu’il est de loin le plus urgent. Je nourris toutefois un profond espoir et une grande reconnaissance à l’égard des bienfaits qu’apporteront les futurs progrès technologiques. Une IA future bien alignée pourrait faire progresser la science, mettre au point de nouveaux traitements et créer une abondance matérielle généralisée. Une IA bienveillante et honnête peut aider les personnes à surmonter les difficultés de leur vie et améliorer sensiblement leur bonheur et leur sentiment d’accomplissement. OpenAI déploie d’immenses efforts pour concrétiser ces avantages. Un exemple actuel dont je suis fier — et que mes proches ont trouvé utile — est l’investissement considérable dans la capacité de ChatGPT à fournir des renseignements sur la santé.
Aussi prometteuse que soit l’IA à long terme, nous devrions concentrer l’essentiel de notre attention sur les prochaines années. Nous sommes à l’aube d’une transition vers un monde peuplé de machines incroyablement intelligentes, et nous devons veiller à ce qu’elle profite à l’humanité. Nous devons trouver des moyens de préserver la capacité d’action humaine et de consacrer la valeur intrinsèque de l’être humain dans un monde où l’IA pourrait accomplir la plupart des tâches. Nous devons empêcher une concentration extrême du pouvoir dans un monde où des projets qui auraient autrefois exigé des milliers d’experts pourront être réalisés par quelques personnes exploitant un grand ordinateur. Nous devons aussi veiller à ce que les humains demeurent maîtres de l’avenir et ne soient pas laissés pour compte par des progrès incontrôlés issus d’une intelligence étrangère supérieure à la nôtre.
À l’heure actuelle, je crois qu’aucun laboratoire n’a résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer encore longtemps à mettre ses systèmes à l’échelle de façon responsable et à vitesse maximale. Je m’attends et j’espère que les ralentissements volontaires deviendront courants jusqu’à l’établissement de seuils de sûreté communs. Je crois aussi que la coordination internationale du développement futur de l’IA doit devenir une priorité absolue pour les gouvernements du monde entier.
Auteur
Notes de bas de page
- 1
Cela comprenait la mise à l’échelle de l’autojeu(s'ouvre dans une nouvelle fenêtre), de la robotique(s'ouvre dans une nouvelle fenêtre) et, rétrospectivement surtout, de la mise à l’échelle des réseaux récurrents pour modéliser le langage(s'ouvre dans une nouvelle fenêtre), précurseur de la série de recherches sur GPT.
- 2


