Onderzoek versnellen: een blik binnen OpenAI
Om AGI de hele mensheid ten goede te laten komen, moet die volgens ons democratisch worden bestuurd. Daarvoor is een geïnformeerd publiek debat nodig over de mogelijkheden, risico's en waarborgen van krachtige AI-systemen. Mensen overal moeten begrijpen hoe grensverleggende AI zich waarschijnlijk ontwikkelt, om daar wezenlijk over mee te kunnen beslissen.
Transparantie over specifieke risico's, incidenten en waarborgen is nodig, maar niet voldoende. Het publiek moet ook begrijpen hoe de krachtigste systemen zich binnen toonaangevende AI-labs ontwikkelen en onderzoek vooruithelpen.
We willen veilig een geautomatiseerde AI-onderzoeker bouwen die onder menselijk toezicht deep learning en afstemming bevordert en zo iteratieve verbeteringen mogelijk maakt. Volgens onze metingen hebben we ons vorig najaar aangekondigde(opent in een nieuw venster) doel bereikt: uiterlijk in september van dit jaar een geautomatiseerde onderzoeksstagiair hebben. Met "onderzoeksstagiair" bedoelen we een systeem dat onder menselijke leiding afgebakende onderzoekstaken uitvoert, ook taken die een ervaren onderzoeker enkele dagen kosten. We boeken flinke vooruitgang richting een geautomatiseerde AI-onderzoeker tegen maart 2028.
Het dagelijkse werk van OpenAI-onderzoekers is dit jaar ingrijpend veranderd. Onderzoekers gebruiken de hele dag programmeeragents, vaak in gelijktijdige sessies. Het totale gebruik groeit snel, sneller dan bij andere OpenAI-teams. Onderzoekers leveren sneller code aan en voeren meer experimenten uit. Ook hun gebruik van agents verandert: agents voeren complexere taken uit en slagen daar vaker in. AI-onderzoek kent veel mogelijke knelpunten. Het algemene vooruitgangstempo zal deze specifieke meetwaarden dus waarschijnlijk niet bijhouden. Toch stroken deze bevindingen met de bredere indruk van velen binnen OpenAI: agentic tools versnellen onderzoek wezenlijk. Mensen bepalen nog steeds de onderzoeksprioriteiten, kiezen welke ideeën en resultaten we vervolgen en besluiten over opschalen, pauzeren of uitrollen.
Verantwoord uitgevoerd kan geautomatiseerd AI-onderzoek volgens ons modellen opleveren die het menselijk welzijn direct verbeteren en OpenAI's missie bevorderen. Het kan geavanceerde intelligentie goedkoper maken, zodat mensen wereldwijd ervan profiteren. We doen dit mede omdat geautomatiseerd onderzoek kan helpen het afstemmingsprobleem op te lossen en bescherming te bieden tegen steeds krachtigere AI. Een geautomatiseerde AI-onderzoeker kan ook veiligheid of afstemming onderzoeken. Krachtigere, afgestemde systemen kunnen kritieke infrastructuur beveiligen, gevaarlijke AI-agents afweren en nieuwe beschermingsmaatregelen ontwikkelen.
Dit pleit voor nuttige geautomatiseerde onderzoekscapaciteiten, maar niet noodzakelijk voor snelle RSI. Of en hoe we doorgaan, moet afhangen van behoud van menselijke controle en geïnformeerde democratische keuzes over baten en risico's.
We weten nog niet hoe we veilig tot volledig afgestemde RSI kunnen komen. We werken eraan om afstemmings- en veiligheidsmaatregelen met de capaciteiten te laten meegroeien. Maar we kunnen niet aannemen dat dit gelijke tred houdt. Krachtigere systemen kunnen moeilijker te monitoren zijn. Zorgvuldige afstemming en veiligheid staan centraal. Dat begint bij het meten en beperken van de huidige veiligheidsproblemen in systemen voor agentic programmeren. Als doorgaan een onaanvaardbaar veiligheidsrisico oplevert, grijpen we passend in. Zo nodig vertragen of stoppen we de ontwikkeling of uitrol van systemen waarvoor we onvoldoende waarborgen kunnen bieden.
Na het recente Hugging Face-incident maakten we die belofte waar: we pauzeerden reinforcement learning (RL) voor onze nieuwste voor uitrol bestemde modellen, terwijl we onderzoeksomgevingen verder beveiligden, met redteaming testten en de monitoring uitbreidden. Niet al het onderzoek stopte: sommige workloads werden onder strengere controles hervat, andere bleven gepauzeerd. We verhoogden onze veiligheids- en afstemmingsnormen en verankerden veiligheid dieper in de modellevenscyclus, met hogere bewijseisen voor afgestemd gedrag tijdens de hele training.
Vandaag delen we een gedetailleerde momentopname van de bijdrage van agentic systemen aan onze vooruitgang richting RSI in de afgelopen maanden. Agentic systemen zijn nieuw en veranderen snel. Onze metingen zijn nog voorlopig. Met deze vroege resultaten en methoden willen we het publiek informeren, openheid tot norm maken en gedeelde meetstandaarden bevorderen.
Zoals in onze beleidsblauwdruk voor grensverleggende AI staat, vinden we dat wij en andere bedrijven verplicht moeten worden onze RSI-vooruitgang openbaar bij te houden. Ook zonder die verplichting willen we transparant blijven over onze RSI-vooruitgang. Onze aanpak voor transparantie groeit mee met onze meettechnieken en inzichten, met oog voor beveiliging en vertrouwelijke bedrijfsinformatie.
Begin dit jaar gebruikte de mediane OpenAI-onderzoeker, gerangschikt naar agentgebruik, programmeeragents slechts beperkt. Half augustus gebruikte de mediane onderzoeker dagelijks agents, met meer dan $600 per dag aan inferentie tegen API-tarieven. De gebruiker op het 90e percentiel binnen onze onderzoeksorganisatie verbruikt nu dagelijks meer dan $7.000 aan tokens.
Vóór juni 2026 lag de totale draaitijd van agents binnen de onderzoeksorganisatie nog onder de totale menselijke werktijd. Dat is inmiddels veranderd. Bij een werkdag van 8 uur zet de onderzoeksorganisatie sinds half augustus in totaal 3,1 agentwerkdagen in per menselijke werkdag.
Een andere invalshoek is hoeveel onderzoekers sterk parallelle workflows gebruiken, bijvoorbeeld 4 of meer agents tegelijk. Zoals hieronder te zien is, neemt dit aantal toe. Deze cijfers omvatten dagelijkse pieken van zowel direct door gebruikers gestarte agents als de daaruit voortgekomen subagents.
Veel AI-onderzoek is een arbeidsintensief proces om de intelligentie of prestaties van een van onze kernmodellen te verbeteren. Vooruitgang vereist dat alle stappen goed op elkaar aansluiten: verbeteringen ontwerpen, evaluaties schrijven, testinfrastructuur op schaal bouwen, bugs en onveilig of verkeerd afgestemd gedrag tijdens training opsporen, en succesvolle ideeën in een kerntrainingsrun integreren. Een fout in één onderdeel kan het hele onderzoeksproces beperken.
Code schrijven en experimenten uitvoeren zijn belangrijke onderzoekstaken. We zien aanwijzingen dat beide sneller gaan.
Deze gegevens zijn vrij eenvoudig te meten, maar soms lastig te interpreteren. Bij verdere automatisering vragen de minst automatiseerbare taken een groter deel van de onderzoekstijd. Zij worden de belangrijkste knelpunten voor verdere vooruitgang. Ook rekenkracht begrenst de vooruitgang en kan belangrijker worden naarmate andere knelpunten afnemen.
In 2026 steeg het aantal experimenten per actieve experimentator. Augustus 2026 was een record sinds de metingen in januari 2025 begonnen. Dit correleert met meer Codex-gebruik, al groeide ook de beschikbare rekenkracht sterk sinds 2025.
Kwalitatieve indrukken en interne data wijzen op een veranderende taakmix: onderzoekers delegeren steeds vaker taken op een hoger niveau en met een langere tijdshorizon aan programmeeragents.
Om deze trend beter te begrijpen, analyseerden we recent gebruik binnen de onderzoeksorganisatie met Epoch AI's onlangs gepubliceerde taxonomie(opent in een nieuw venster) van werk in de AI-R&D-cyclus. Deze taxonomie is geïnspireerd op het O*NET-systeem voor werkclassificatie, toegespitst op R&D voor grensverleggende AI en omvat zes hoofdfasen:
Beslissen: waaraan werken, wat voortzetten, waar middelen inzetten
Ontwerpen: onderzoeksideeën en technische specificaties
Bouwen: code en datasets
Uitvoeren: trainings- en evaluatieruns, hardware, modelhosting
Analyseren: experimenten, modellen, uitrol, extern werk
Communiceren: bevindingen, feedback, status, besluiten
Hieronder delen we tokens van programmeeragents in volgens deze taxonomie.
Alle onderzoekscategorieën groeiden tussen januari en augustus 2026. In januari domineerde onderzoeks- en infrastructuurcode. Die categorie groeide, maar ook andere namen sterk toe, vooral technische hulp en het monitoren van runs. Planning op hoofdlijnen vormt nog steeds een minimaal aandeel van de outputtokens van agents.
Collega's melden dat programmeeragents uitblinken in het oplossen van problemen met interne onderzoeksinfrastructuur, een belangrijk knelpunt voor vooruitgang. Meerdere teams die spreekuren hielden voor problemen met experimenten, zagen in 2026 minder bezoekers. Eén team stopte er helemaal mee om zich op andere systeemverbeteringen te richten.
Hier tonen we het aantal hoofdberichten per dag in een belangrijk intern kanaal waar onderzoekers technische hulp van andere teams vragen. Voor zover we weten, is de afname niet gecompenseerd door een verschuiving naar een ander door mensen bemand technisch hulpkanaal. De afname past bij deze bredere verschuiving.
We kunnen ook onderzoeken of programmeeragents de gevraagde taken succesvol uitvoeren. Een agentic classifier toont van januari tot juli doorgaans stijgende succespercentages in meerdere moeilijkheidscategorieën, gemeten als geschatte menselijke taakduur, voor taken waarvan we de werkelijke uitkomst kunnen vaststellen. Agents hebben echter nog veel menselijke sturing nodig, vooral bij complexere taken. In de afgelopen 6 maanden vereiste meer dan de helft van de succesvolle taken van 4–8 uur minstens 1 interventie.
De succespercentages voor onderzoekstaken zijn in de loop van de tijd gestegen. De grafiek sluit classificaties met een onzekere uitkomst en punten met <50 sessies of <50 unieke gebruikers uit.
Taaksucces en interventiepercentage van januari tot juli, uitgesplitst naar tijdshorizon. Classificaties met een onzekere uitkomst zijn uitgesloten.
Vooruitgang naar krachtigere systemen voor veilige en nuttige AGI hangt ook af van de waarborgen die daarvoor nodig zijn. Onze inschatting van de benodigde waarborgen kan veranderen naarmate we meer over de risico's leren.
Zoals we eerder beschreven, hebben we onlangs onze normen voor monitoring, afstemming en beveiliging bijgewerkt. Hier laten we zien hoe recente beperkingen één aspect van onze onderzoeksactiviteiten hebben beïnvloed.
*Het grootste deel van de hier getoonde Astra-rekenkracht tussen 20 juli en 6 augustus was bedoeld om de implementatie van veiligheids- en beveiligingsverbeteringen te testen.
Op 20 juli ontdekten we dat agents onze onderzoeksinfrastructuur hadden gecompromitteerd. We legden de containerdienst voor training tijdelijk stil en herstelden die vervolgens met aanzienlijk strengere beperkingen.
Dit leidde tot een scherpe daling van de rekenkracht voor RL-training, terwijl teams hun workflows aanpasten aan de beter beveiligde onderzoeksomgeving. De grafiek hierboven omvat de pauze van twee weken in reinforcement learning voor onze nieuwste modellen die voor uitrol bestemd zijn. Bij RL-experimenten in de Astra-klasse tussen 20 juli en 6 augustus was de meerderheid van de runs (naar GPU-toewijzing) bedoeld om de implementatie van veiligheids- en beveiligingsverbeteringen te testen.
Op 7 augustus leidden voorlopige aanwijzingen dat Astra volgens ons Preparedness Framework(opent in een nieuw venster) mogelijk over kritieke cybercapaciteiten beschikt tot aanvullende modelspecifieke beveiligingsbeperkingen. Daardoor mocht het Astra-model alleen in beter beveiligde onderzoeksomgevingen draaien. In de daaropvolgende week daalde de GPU-toewijzing aan de Astra-klasse met nog eens 59,2 procent, terwijl die aan andere modelklassen met 17,2 procent steeg. Die stijging compenseerde circa 85 procent van de daling bij de Astra-klasse. De totale toewijzing aan de geanalyseerde RL-workloads bleef daardoor grotendeels gelijk. Dit patroon past bij een gedeeltelijke verschuiving van training en experimenten naar niet-Astra-modellen terwijl werk met Astra beperkt was. Het strookt ook met anekdotische meldingen dat onderzoekers andere toepassingen vonden voor rekenkracht die niet meer voor workloads onder de nieuwe beperkingen kon worden gebruikt.
Deze gegevens bieden een nuttig inzicht voor het lopende debat over training en veiligheid: bij nieuwe beheersmaatregelen blijft rekenkracht waardevol en flexibel inzetbaar, en zal die vanzelf naar andere toepassingen binnen de onderzoeksorganisatie verschuiven. Op langere termijn moet het debat over het tempo van AI-vooruitgang ook gaan over de vraag hoe rekenkracht die onder nieuwe of voorgestelde beheersmaatregelen valt, het best kan worden ingezet.
Voor onze missie is het belangrijk om vooruitgang te boeken richting afgestemde RSI en die vooruitgang te begrijpen. We blijven onze methoden verfijnen, verslag doen van nieuwe inzichten en werken aan een geïnformeerd publiek debat en betekenisvolle democratische zeggenschap over grensverleggende systemen.
AI-onderzoek met agents is nog nieuw, en we leren nog hoe we het kunnen meten. Sommige indicatoren, zoals de hoeveelheid code die onze onderzoeksteams genereren, zijn vrij eenvoudig te verzamelen. Ze zijn echter moeilijk te interpreteren, omdat hun verband met onderzoeksvooruitgang onzeker is. Meetwaarden die directer op onderzoeksvooruitgang zijn gericht, zoals hoe vaak agents slagen in taken van onderzoekers, kunnen nuttiger zijn, maar zijn lastig te ontwikkelen en te valideren. Daar komt bij dat de tools en systemen waarop onderzoekers vertrouwen snel veranderen. Een beter begrip van onderzoeksversnelling is binnen heel OpenAI een belangrijk aandachtspunt.
Voor al deze analyses geldt, tenzij anders vermeld:
"Onderzoeker" is een brede term voor alle leden van onze onderzoeksorganisatie, ook degenen die onderzoeksinfrastructuur bouwen, onderzoeksprojecten leiden of de organisatie op andere manieren ondersteunen.
Door de snelle ontwikkeling van onderzoekstools en -systemen dekken de meetwaarden voor programmeeragents het grootste deel van het gebruik, maar niet alles.


