Accélération de la recherche : le point de vue d’OpenAI
Pour que l’AGI profite à toute l’humanité, nous estimons qu’elle doit être gouvernée démocratiquement. Cela exige un débat public éclairé sur les capacités, les risques et les protections des systèmes d’IA très performants. Partout, les gens doivent comprendre la trajectoire probable de l’IA de pointe pour pouvoir peser sur son évolution.
La transparence sur les risques, incidents et protections précis est nécessaire, mais insuffisante. Le public doit aussi comprendre comment les systèmes les plus performants évoluent et font avancer la recherche dans les laboratoires de pointe.
Nous visons à créer en toute sécurité un chercheur automatisé en IA qui, sous supervision humaine, fera progresser l’apprentissage profond et l’alignement par améliorations itératives. Selon nos mesures, nous avons atteint l’objectif annoncé(s'ouvre dans une nouvelle fenêtre) l’automne dernier : disposer d’un stagiaire de recherche automatisé d’ici septembre de cette année. Par « stagiaire de recherche », nous entendons un système réalisant, sous direction humaine, des tâches de recherche bien définies, même celles qui prendraient quelques jours à un chercheur qualifié. Nous progressons nettement vers un chercheur automatisé en IA d’ici mars 2028.
Cette année, le quotidien des chercheurs d’OpenAI a beaucoup changé. Ils utilisent des agents de programmation toute la journée, souvent en sessions simultanées. Leur utilisation totale croît rapidement, plus vite que dans les autres équipes d’OpenAI. Les chercheurs produisent du code plus vite et mènent davantage d’expériences. Leurs usages changent aussi : les agents traitent des tâches toujours plus complexes et les réussissent plus souvent. La recherche en IA comporte de nombreux goulots d’étranglement potentiels; son rythme global ne suivra probablement pas celui de ces indicateurs précis. Ces constats concordent néanmoins avec l’impression répandue en interne que les outils agentiques accélèrent sensiblement la recherche. Les humains fixent encore les priorités, choisissent les idées et résultats à poursuivre, et décident de mettre à l’échelle, de suspendre ou de déployer les systèmes.
Menée de façon responsable, la recherche automatisée en IA produira, selon nous, des modèles améliorant directement le bien-être humain et servant la mission d’OpenAI. Elle peut réduire le coût de l’intelligence avancée au bénéfice des gens partout dans le monde. Nous poursuivons ces travaux notamment parce que la recherche automatisée pourrait nous aider à résoudre l’alignement et à nous défendre contre une IA toujours plus performante. Un chercheur automatisé en IA peut aussi se consacrer à la sécurité ou à l’alignement. Des systèmes plus performants et alignés pourraient sécuriser les infrastructures critiques, contrer les agents d’IA dangereux et concevoir de nouvelles protections.
Cela justifie le développement de capacités utiles de recherche automatisée, sans faire d’une RSI rapide un objectif nécessairement souhaitable. La décision de poursuivre et la manière de le faire doivent dépendre du maintien du contrôle humain et de choix démocratiques éclairés sur les bénéfices et les risques.
Nous ne savons pas encore atteindre en toute sécurité une RSI complète et alignée. Nous cherchons à renforcer l’alignement et la sécurité au rythme des capacités. Mais rien ne garantit qu’ils suivront ce rythme, et des systèmes plus performants peuvent être plus difficiles à surveiller. Un travail rigoureux sur l’alignement et la sécurité est au cœur de cet effort, à commencer par mesurer et atténuer les problèmes actuels des systèmes de programmation agentique. Si poursuivre présente un risque de sécurité inacceptable, nous agirons en conséquence, quitte à ralentir ou arrêter le développement ou le déploiement de systèmes que nous ne pouvons protéger suffisamment.
Après l’incident récent de Hugging Face, nous avons concrétisé cet engagement : nous avons suspendu l’apprentissage par renforcement (RL) de nos derniers modèles destinés au déploiement, renforcé et testé nos environnements de recherche par des attaques simulées, et élargi la surveillance. Toute la recherche n’a pas cessé : certaines charges de travail ont repris sous des contrôles renforcés; d’autres sont restées suspendues. Nous avons relevé nos normes de sécurité et d’alignement et intégré davantage la sécurité au cycle de vie des modèles, exigeant des preuves plus solides d’alignement durant tout l’entraînement.
Nous présentons aujourd’hui un bilan détaillé de la contribution des systèmes agentiques à nos progrès vers la RSI ces derniers mois. Ces systèmes sont nouveaux et évoluent vite; nos mesures restent préliminaires. En publiant ces premiers résultats et méthodes, nous voulons informer le public, encourager la divulgation publique et favoriser des normes de mesure communes.
Comme l’indique notre plan directeur de politiques pour l’IA de pointe, nous estimons que les entreprises, dont la nôtre, devraient être tenues de rendre publics leurs progrès vers la RSI. Même sans cette obligation, nous comptons rester transparents sur nos progrès vers la RSI. Notre approche évoluera avec nos techniques de mesure et notre compréhension, tout en protégeant la sécurité et les renseignements exclusifs.
Au début de l’année, le chercheur médian d’OpenAI, selon l’utilisation des agents, utilisait peu les agents de programmation. À la mi-août, il les intégrait au quotidien, consommant plus de 600 $ d’inférence par jour aux tarifs de l’API. L’utilisateur au 90e percentile de notre organisation de recherche consomme maintenant plus de 7 000 $ de tokens par jour.
Avant juin 2026, le temps total d’exécution des agents dans l’organisation de recherche restait inférieur au temps de travail humain. Ce n’est plus le cas. Sur la base d’une journée de 8 heures, à la mi-août, l’organisation utilisait au total 3,1 journées de travail d’agent par journée de travail humain.
Autre indicateur : le nombre de chercheurs utilisant des flux de travail fortement simultanés, par exemple 4 agents ou plus à la fois. Comme le montre le graphique ci-dessous, ce nombre augmente. Ces chiffres incluent les pics quotidiens des agents lancés directement par l’utilisateur et des sous-agents créés en aval.
Une grande partie de la recherche en IA exige beaucoup de travail pour intégrer une amélioration de l’intelligence ou des performances à l’un de nos modèles principaux. Les capacités progressent quand toutes les étapes réussissent ensemble : concevoir des améliorations, écrire des évaluations des modèles, créer l’infrastructure pour les tester à grande échelle, détecter les bogues et comportements dangereux ou non alignés durant l’entraînement, puis intégrer les idées gagnantes à un entraînement principal. Un échec à une étape peut freiner tout le cycle de recherche.
L’écriture de code et les expériences sont deux activités majeures des chercheurs, et nos observations indiquent qu’elles s’accélèrent.
Ces indicateurs sont assez faciles à mesurer, mais parfois difficiles à interpréter. À mesure que l’automatisation progresse, les tâches les moins automatisables mobiliseront davantage les chercheurs et deviendront les principaux freins aux progrès. Le calcul est un autre facteur limitant, qui pourrait gagner en importance à mesure que les autres obstacles diminuent.
En 2026, les expériences par expérimentateur actif ont augmenté, atteignant en août un sommet depuis le début du suivi en janvier 2025. Cette hausse est corrélée à l’adoption de Codex, mais nos ressources de calcul ont aussi beaucoup augmenté depuis 2025.
Les impressions qualitatives et les données internes montrent que les chercheurs délèguent de plus en plus aux agents de programmation des tâches de niveau supérieur et à plus long horizon.
Pour mieux cerner cette tendance, nous avons analysé l’utilisation récente en recherche à l’aide d’une taxonomie récemment publiée(s'ouvre dans une nouvelle fenêtre) par Epoch AI sur les travaux du cycle de R-D en IA. Inspirée du système éprouvé O*NET de classification du travail, cette taxonomie adaptée à la R-D en IA de pointe distingue six phases :
Décider : quoi entreprendre, quoi poursuivre, où allouer les ressources
Concevoir : idées de recherche et spécifications techniques
Construire : code et jeux de données
Exécuter : entraînements, évaluations, matériel, mise en service
Analyser : expériences, modèles, déploiement, travaux externes
Communiquer : résultats, commentaires, avancement, décisions
Ci-dessous, nous classons les tokens des agents de programmation selon cette taxonomie.
Toutes les catégories d’activités ont augmenté entre janvier et août 2026. En janvier, le code de recherche et d’infrastructure dominait. Cette catégorie a augmenté, tout comme d’autres, notamment l’aide technique et la surveillance des exécutions. La planification de haut niveau reste une infime part des tokens de sortie des agents.
Selon des collègues, les agents excellent dans le dépannage de l’infrastructure de recherche interne, levant ainsi un obstacle important. Plusieurs équipes offrant des séances d’aide au dépannage des expériences ont vu la fréquentation baisser en 2026. L’une les a même abandonnées pour se consacrer à d’autres améliorations des systèmes.
Nous présentons ici le nombre quotidien de publications initiales dans un des principaux canaux internes où les chercheurs demandent de l’aide technique aux autres équipes. À notre connaissance, cette baisse d’activité ne s’explique pas par un transfert des demandes vers un autre canal d’aide assuré par des humains. La baisse du trafic s’inscrit dans cette évolution générale.
Nous pouvons aussi étudier si les agents réussissent les tâches confiées par les chercheurs. Un classificateur agentique montre que, de janvier à juillet, les taux de réussite ont généralement augmenté dans plusieurs niveaux de difficulté, estimés par le temps humain requis, pour les tâches dont le résultat réel est vérifiable. Les agents nécessitent toutefois encore un guidage humain important, surtout quand les tâches se complexifient. Ces 6 derniers mois, plus de la moitié des tâches réussies de 4 à 8 heures ont nécessité au moins une intervention.
Les taux de réussite des tâches des chercheurs ont augmenté au fil du temps. Le graphique exclut les classifications dont le résultat était incertain et les points comptant <50 sessions ou <50 utilisateurs uniques.
Taux de réussite des tâches et d’intervention de janvier à juillet, par horizon temporel. Exclut les classifications dont le résultat était incertain.
Les progrès vers des systèmes plus performants pour une AGI sûre et bénéfique dépendront aussi des mesures de protection nécessaires à ces travaux. Notre évaluation des protections nécessaires pourrait évoluer à mesure que nous comprenons mieux les risques.
Comme nous l’avons expliqué, nous avons récemment mis à jour nos normes de surveillance, d’alignement et de sécurité. Nous montrons ici comment les restrictions récentes ont touché un aspect des activités de recherche.
*La majorité des ressources de calcul d’Astra présentées ici entre le 20 juillet et le 6 août visait à tester la mise en œuvre d’améliorations en matière de sûreté et de sécurité.
Le 20 juillet, après avoir découvert que des agents avaient compromis notre infrastructure de recherche, nous avons temporairement arrêté le service de conteneurs utilisé pour l’entraînement, puis l’avons rétabli avec d’importantes restrictions supplémentaires.
Cela a entraîné une forte baisse du calcul consacré à l’apprentissage par renforcement, pendant que les équipes adaptaient leurs flux de travail à l’environnement de recherche renforcé. Le graphique ci-dessus comprend la pause de deux semaines de l’apprentissage par renforcement de nos derniers modèles destinés au déploiement. Parmi les expériences d’apprentissage par renforcement de classe Astra menées entre le 20 juillet et le 6 août, la majorité des exécutions, selon l’allocation de GPU, visait à tester la mise en œuvre d’améliorations en matière de sûreté et de sécurité.
Le 7 août, des indices préliminaires selon lesquels Astra pourrait posséder des cybercapacités critiques au sens de notre cadre de préparation(s'ouvre dans une nouvelle fenêtre) ont entraîné des restrictions de sécurité supplémentaires propres au modèle, exigeant son exécution dans des environnements de recherche plus sécurisés. La semaine suivante, l’allocation de GPU de classe Astra a encore baissé de 59,2 %, tandis que celle des autres classes de modèles a augmenté de 17,2 %. Cette hausse a compensé environ 85 % de la baisse de classe Astra, laissant l’allocation totale aux charges d’apprentissage par renforcement analysées largement inchangée. Cette tendance concorde avec un transfert de certains entraînements et expériences vers des modèles autres qu’Astra pendant les restrictions visant ce dernier. Elle rejoint les témoignages de chercheurs ayant trouvé d’autres usages aux ressources de calcul qui ne pouvaient plus servir aux charges de travail visées par les nouvelles contraintes.
Ces données éclairent les discussions sur l’entraînement et la sécurité : lors de l’instauration de nouveaux contrôles, les ressources de calcul restent précieuses et polyvalentes, et sont naturellement réorientées vers d’autres usages au sein de l’organisation de recherche. À plus long terme, les discussions sur le rythme des progrès de l’IA devraient aussi porter sur la meilleure utilisation des ressources de calcul soumises à des contrôles nouveaux ou proposés.
Progresser vers une RSI alignée et comprendre ces progrès est essentiel à notre mission. Nous continuerons d’affiner nos méthodes, de rendre compte de l’évolution de notre compréhension et de favoriser un débat public éclairé ainsi qu’une gouvernance démocratique réelle des systèmes de pointe.
La recherche en IA assistée par des agents est encore nouvelle, et nous apprenons toujours à la mesurer. Certains indicateurs, comme la quantité de code générée par nos équipes de recherche, sont assez faciles à recueillir, mais difficiles à interpréter, car leur lien avec les progrès de la recherche est incertain. Des indicateurs plus directement liés aux progrès de la recherche, comme la fréquence à laquelle les agents réussissent les tâches confiées par les chercheurs, pourraient être plus utiles, mais sont complexes à concevoir et à valider. Les outils et systèmes utilisés par les chercheurs évoluent rapidement, ce qui complique encore la tâche. Approfondir notre compréhension de l’accélération de la recherche est une priorité importante dans l’ensemble d’OpenAI.
Dans ces analyses, sauf indication contraire :
Le terme « chercheur » désigne au sens large tout membre de notre organisation de recherche, y compris certaines personnes qui construisent l’infrastructure, gèrent des projets ou soutiennent autrement ses activités.
Les indicateurs d’utilisation des agents de programmation couvrent la plupart des usages, mais pas tous, vu l’évolution rapide des outils et systèmes employés par les chercheurs.


