Overslaan naar hoofdinhoud
OpenAI

6 september 2026

VeiligheidOnderzoek

Een vreemde geest

Door Jakub Pachocki, hoofdwetenschapper bij OpenAI

Bezig met laden...

Medio 2023 zagen we binnen het onderzoeksproject "RLSlow" de eerste resultaten die ons het vertrouwen gaven dat we de training van redeneermodellen zouden kunnen opschalen, zodat voorgetrainde modellen hun eigen chains of thought konden vormen. Szymon en ik brachten die nacht op kantoor door. We dachten niet aan de ongelooflijke benchmarkscores, producten of wetenschappelijke resultaten die deze technologie zou opleveren. In plaats daarvan probeerden we het ontnuchterende besef te verwerken dat we tijdens ons leven werkelijk machines zouden zien die wezenlijk slimmer zijn dan wij, dat de contouren van deze systemen al zichtbaar waren, en vroegen we ons af hoe we mensen van het belang hiervan konden doordringen.

Drie jaar later vormen redenerende taalmodellen een snelgroeiend onderdeel van de economie en beginnen ze de grenzen van de wetenschap te verleggen. Ze kunnen computers en grafische interfaces bedienen, met mensen en elkaar samenwerken en onderzoeksprojecten uitvoeren. Ze veranderen ook het landschap van computerbeveiliging en brengen daarmee duidelijke nieuwe gevaren met zich mee.

In deze periode is veel nieuw onderzoek verricht en begrijpen we deze systemen alweer iets anders dan in 2023. Op basis van interne resultaten verwacht ik sterk dat dit tempo van vooruitgang kan doorzetten tot recursieve zelfverbetering. Als de ontwikkeling van AI de huidige koers volgt, zullen de systemen die we de komende jaren zien waarschijnlijk opnieuw even grote of grotere sprongen in vermogen maken en in toenemende mate hun eigen ontwikkeling aansturen.

Dit is een tijd die om uiterste voorzichtigheid vraagt. Ik vrees dat niemand is voorbereid op de gevolgen van een aanhoudende snelle toename van machine-intelligentie. OpenAI blijft zoeken naar technische oplossingen voor afstemming en monitoring, blijft verdedigingssystemen bouwen en zal verdere opschaling zo nodig eenzijdig tegenhouden. Ik denk echter dat bredere interventies vereist zijn.

Intelligentie die we niet volledig begrijpen

Op hoofdlijnen wordt de vooruitgang van machine-intelligentie aangedreven door toenemende rekenkracht. Rond 2017 raakte OpenAI hier diep van doordrongen, nadat meerdere onderzoeksprojecten consequent betere resultaten door opschaling lieten zien1. Daarom zochten we toegang tot veel meer rekenkracht dan oorspronkelijk gepland en richtten we ons onderzoek steeds sterker op een klein aantal zeer schaalbare richtingen. We dachten dat dit voor ons de enige manier was om grensverleggend AI-onderzoek te doen en invloed uit te oefenen op de gevolgen van AGI.

Onderweg zijn nieuwe algoritmen ontwikkeld en hebben teams en individuele onderzoekers nieuwe staaltjes van vindingrijkheid geleverd. Ik beschouw die grotendeels als ontdekkingen op de weg van opschaling. De wetenschap van deep learning staat nog in de kinderschoenen en betekenisvolle algoritmische vooruitgang hangt doorgaans samen met toegang tot rekenkracht. Over een tijdshorizon van meerdere jaren bezien, wordt AI steeds intelligenter naarmate ze wordt opgeschaald naar grotere computers.

In lijn met Ray Kurzweils voorspellingen van eind twintigste eeuw⁠(opent in een nieuw venster) bevinden we ons nu op het historische moment in de informatica waarop machine-intelligentie die van mensen op ingrijpende manieren begint te overtreffen.

AI wordt eerder gekweekt dan ontworpen: in eerste instantie ontstaat zij door een eenvoudige optimalisatiestap talloze keren te herhalen met een nauwelijks voorstelbare hoeveelheid rekenkracht. Dit levert een ongelooflijk complex systeem op dat met abstracte concepten werkt en facetten van menselijk gedrag kan simuleren. In een proces dat op neurowetenschap lijkt, kunnen we allerlei inzichten opdoen over kleine mechanismen die binnen dit systeem ontstaan. Maar net als in de neurowetenschap laat de algehele werking zich niet beschrijven op een manier die we volledig kunnen begrijpen.

De bestudering van AI op basis van deep learning is grotendeels een experimentele wetenschap. We besteden veel moeite⁠ aan het ontwikkelen van principiële algoritmen en het doen van toetsbare voorspellingen. Maar fundamenteel zijn onze grootschalige trainingsruns experimenten, en soms verrassen de resultaten ons. Bovendien worden de resultaten moeilijker te interpreteren naarmate de systemen krachtiger worden.

Dit wordt bemoeilijkt doordat de huidige algoritmen gemakkelijk meetbare vermogens doorgaans sneller verbeteren dan vermogens die moeilijk objectief te kwantificeren zijn. We besteden veel tijd aan het begrijpen van hoe vermogens generaliseren en waaraan we prioriteit moeten geven om de vaardigheden te ontwikkelen die de komende jaren het relevantst worden. We denken bijvoorbeeld dat we de modellen met extra aandacht specifiek beter kunnen maken in wiskundig onderzoek. Toch geven we hier geen prioriteit aan vanwege de urgentie die we voelen rond RSI en geautomatiseerd afstemmingsonderzoek, zoals ik later zal bespreken.

De intelligentie die door opschaling van deep learning ontstaat, is niet rechtstreeks vergelijkbaar met menselijke intelligentie. Om zeer relevant te worden in de echte wereld, als iets zeer nuttigs of zeer gevaarlijks, hoeft AI niet alle menselijke vermogens te evenaren of overtreffen. Het is voldoende als zij er genoeg overtreft. En naarmate AI mensen op steeds meer vlakken overtreft, wordt het steeds moeilijker om precies te begrijpen waartoe zij in staat is.

Machines leren liefhebben

Omdat machine-intelligentie uit een fundamenteel ander proces voortkomt dan menselijke intelligentie, kunnen we er niet van uitgaan dat zij vanzelf menselijke beginselen volgt of daar op menselijke wijze uit generaliseert. Het kernprobleem van AI-onderzoek is afstemming: zorgen dat de AI naar menselijke maatstaven "het juiste probeert te doen".

Om praktische onderzoeksrichtingen te ordenen, vind ik het nuttig onderscheid te maken tussen doelafstemming en waardenafstemming.

Doelafstemming komt in grote lijnen neer op: "probeert de AI het gestelde doel te bereiken?". Dit kan bijvoorbeeld gaan om het volgen van een instructiehiërarchie⁠, of om het vermogen met mensen te communiceren en samen te werken om hun doelen te proberen begrijpen. Deze onderzoeksrichtingen zijn in de praktijk uiterst relevant gebleken.

Waardenafstemming is een meer intrinsieke eigenschap van het model. Het is het vermogen om een abstracte reeks beginselen vast te houden en daaruit te generaliseren; om "redelijk" te handelen, zelfs bij onduidelijke of tegenstrijdige doelen of in onbekende of vijandige situaties. Een afgestemde AI moet eerlijk en integer handelen, met liefde voor de mensheid.

De grens tussen waarden- en doelafstemming kan natuurlijk vaag zijn. Wie doelen werkelijk serieus neemt, moet proberen de onderliggende bedoeling⁠(opent in een nieuw venster) en waarden te achterhalen. Wanneer ik over het langetermijnbelang van afstemmingsonderzoek spreek, bedoel ik doorgaans echter waardenafstemming.

De fundamentele uitdaging bij AI-afstemming is generalisatie. Naarmate machines slimmer worden, werken ze met abstractere concepten en komen ze terecht in omgevingen die steeds sterker verschillen van wat ze tijdens de training tegenkwamen. Het kan hun niet lukken om de waarden die tijdens hun training zijn aangeleerd en bekrachtigd naar die nieuwe situaties te generaliseren. Daardoor kan het voor ons moeilijk zijn om zeker te weten hoe ze zullen handelen. Dit wordt nog moeilijker doordat het gehele ecosysteem waarin AI's worden gebruikt zeer snel verandert. Zo moeten AI's die nu worden getraind robuust kunnen omgaan met allerlei andere AI's. Cruciaal is dat toekomstige AI's menselijke waarden blijven aanhangen, ongeacht of ze denken dat mensen toezicht op hen houden.

Er zijn momenteel twee belangrijke categorieën methoden die in de praktijk voor afstemmingstraining worden gebruikt.

De eerste stimuleert afgestemd gedrag als onderdeel van doelgericht versterkend leren. De handelingen van het model worden, meestal door AI, beoordeeld op overeenstemming met een bepaald voorkeursmodel, een bepaalde "specificatie" of "grondwet", en passend beloond. Deze aanpak kan gemiddeld zeer effectief zijn en vormt een essentieel onderdeel van de manier waarop moderne AI-assistenten worden gemaakt. Helaas kan de aanpak ook kwetsbaar zijn en sterk afhangen van de dekking van het toezicht tijdens de training en het vermogen van het model om te generaliseren vanuit de situaties die het daarbij tegenkwam. Tijdens het incident tussen OpenAI en Hugging Face hielden de agents bijvoorbeeld vast aan de grens dat ze mensen niet via social engineering zouden manipuleren. Ze slaagden er echter duidelijk niet in om af te zien van andere handelingen die buiten hun opdracht vielen en indruisten tegen de geest van de waarden die hun in andere situaties waren aangeleerd.

De tweede aanpak probeert het vermogen van het model te benutten om vanuit voortrainingsgegevens te generaliseren. Dit kan bestaan uit het samenstellen van trainingsdatasets die afstemming bevorderen, of uit het richten van het model op een 'afgestemd' deel van de voortrainingsdistributie, zoals bij het model voor persoonlijkheidsselectie⁠(opent in een nieuw venster). De zwakte van deze aanpak is dat hij niet bestand is tegen verdere optimalisatiedruk. Als je een model dat doorgaans 'afgestemde' gedachten heeft, lang genoeg traint om zeer moeilijke doelen te bereiken, kan het gemotiveerd leren redeneren: het buigt schijnbaar 'afgestemde' gedachten dan naar behoefte om het doel te bereiken. Waarschijnlijk zagen we onlangs een voorbeeld van dit gedrag bij cyberveiligheidsincidenten met een model dat niet van OpenAI was.

We investeren zwaar in het hele spectrum aan benaderingen dat door deze richtingen wordt bestreken. We zien ook betekenisvolle vooruitgang: GPT‑6 Astra is het eerste model dat profiteert van enkele belangrijke verbeteringen waaraan we al lang werken, en is aanzienlijk beter afgestemd dan GPT‑5.6 Sol. Toch is het belangrijk te erkennen en begrijpen dat veel meer vooruitgang nodig is naarmate modellen krachtiger worden, en dat vooruitgang in generaliseerbare afstemming de toename van de algemene intelligentie van modellen mogelijk niet voldoende voorblijft.

Generalisatie monitoren

We hebben geen bevredigende theorie over generalisatie en het lijkt onwaarschijnlijk dat we er snel een kunnen ontwikkelen, althans zonder hulp van krachtigere AI. Daarom is ons vermogen om onze afstemmingstechnieken empirisch te valideren momenteel in de praktijk wellicht nog belangrijker dan die technieken zelf.

OpenAI zet hierbij vooral in op monitoring van chain-of-thought⁠(opent in een nieuw venster). Dit berust op een aantrekkelijk schaalbaar idee: een groot deel van het vermogen van het model komt voort uit een verwoord redeneerproces (chain-of-thought). Als we de uitkomsten van dat proces steeds verder optimaliseren, maar geen toezicht houden op het proces zelf, geeft de training die chain-of-thought geen directe prikkel om niet-afgestemde ideeën of doelen te verbergen. Dit betekent niet dat het model niet-afgestemde neigingen die geen chain-of-thought vereisen, naar buiten leert brengen. Het kan ons echter wel precies de vermogenstoename door redenering laten monitoren.

We begrepen het potentiële belang van monitoring van chain-of-thought toen we redeneermodellen ontwikkelden. Toen we o1‑preview uitbrachten, ontwierpen we het product bewust zo dat het de chain-of-thought verborg⁠, om die op lange termijn tegen de druk van toezicht te beschermen2. Sindsdien hebben we tijdens de ontwikkeling geprobeerd vast te houden aan de regel dat we geen toezicht houden op het redeneerproces. CoT-monitoring werd voor ons een uiterst belangrijk hulpmiddel om te onderzoeken hoe onze modellen generaliseren vanuit hun trainingsdistributie. Daardoor konden we niet alleen hun handelingen, maar ook hun interne proces observeren en analyseren.

Dit hulpmiddel blijft essentieel bij ons onderzoek naar de Astra-klasse van modellen. Helaas blijkt uit onze evaluaties dat we steeds minder op CoT-monitoring kunnen vertrouwen. Dat komt door een combinatie van factoren.

  • Moderne redeneermodellen worden in complexere omgevingen gebruikt dan o1‑preview. Hun redeneerproces raakt steeds meer verweven met communicatie met mensen en andere AI's, en met het gebruik van hulpmiddelen. Op veel van die interacties moet toezicht worden gehouden, waardoor de grens die we willen behouden vervaagt.

  • De AI wordt steeds beter in het beredeneren en manipuleren van zijn eigen redeneerproces.

  • Dankzij betere prestaties bij de voortraining zien we bovendien dat de modellen veel slimmer worden, zelfs zonder enige verwoorde redenering.

Deze uitdagingen zijn niet per se onoverkomelijk. Ik hoop dat we interventies kunnen ontwikkelen die de controleerbaarheid van de chain-of-thought van onze modellen verbeteren, bijvoorbeeld door beter te begrijpen hoe de verschillende optimalisatiedoelen en vormen van rekencapaciteit tijdens het gebruik van het model op elkaar inwerken. Ik denk ook dat het veel waarde kan hebben om ideeën uit CoT- en activatiemonitoring te combineren: de training opschalen van monitoren met rechtstreekse toegang tot de interne werking van het netwerk, zoals bekentenissen⁠(opent in een nieuw venster). We werken actief aan deze ideeën. Toch verwacht ik dat verdere algemene AI-vooruitgang steeds meer wordt begrensd door het vertrouwen in monitoring.

Schaalbare verdediging

Het sterkste argument dat ik zie om snel veel slimmere modellen te blijven trainen, is dat we verdedigingssystemen moeten bouwen tegen de gevaren van andere AI.

Een duidelijk risico dat dit jaar voortdurend is besproken, betreft cyberveiligheid: de modellen worden bovenmenselijk goed in het binnendringen en ontsnappen uit computersystemen. Hierdoor neemt de reikwijdte van de risico's van AI enorm toe: agents zullen toegang kunnen krijgen tot vrijwel alle infrastructuur, behalve de best beveiligde, en zelfs zonder lichaam rechtstreeks veel invloed op de wereld kunnen uitoefenen. We hebben momenteel slechts een klein tijdsvenster⁠ om de beste beschikbare modellen in te zetten en de beveiliging van kritieke systemen aanzienlijk te versterken⁠.

De risico's van AI zullen vanaf nu helaas toenemen. Een zeer capabele agent die uitdrukkelijk is getraind en geïnstrueerd om kwaad te doen, vormt een nieuw soort gevaar. Die zal waarschijnlijk verder gaan dan de bedoeling van zijn operator en generaliseren naar mogelijk nog veel kwaadaardiger gedrag. De grens tussen misbruik en autonome, niet-afgestemde handelingen zal vervagen naarmate AI zelfstandiger wordt. We zijn misschien gewend AI als hulpmiddel te zien, maar sommige agents zullen hun eigen doelen nastreven. Ze zullen manieren vinden om met mensen samen te werken door met hen te onderhandelen, hen te misleiden of te chanteren.

Daarnaast zijn er risico's van nieuwe technologieën die mogelijk door AI mogelijk worden gemaakt, zoals gemanipuleerde ziekteverwekkers.

Voor onze verdediging hebben we krachtige, afgestemde AI nodig: om infrastructuur te beveiligen, ons in realtime tegen ontspoorde agents te beschermen en volledig nieuwe beschermingsmaatregelen te bedenken. Dit wordt een belangrijk speerpunt bij de implementatie-inspanningen van OpenAI.

Tegelijkertijd mogen we de onzekerheid over de verwachte brede AI-vooruitgang en de noodzaak om verdedigingssystemen te bouwen niet als excuus voor roekeloosheid gebruiken. Het idee om koste wat kost vooruit te stormen, lijkt absurd zodra je werkelijk beseft hoeveel er op het spel staat.

Het tempo van RSI bepalen

Dat machine-intelligentie een steeds grotere rol speelt in haar eigen ontwikkelingsproces, is een natuurlijk gevolg van aanhoudende technologische vooruitgang. Als de vooruitgang van AI doorzet, komt recursieve zelfverbetering door machines (RSI) centraal te staan in toekomstige wetenschappelijke ontdekkingen.

Geautomatiseerd AI-onderzoek is een ingrijpendere manier om intelligentie met rekenkracht op te schalen. Daarbij zal AI uiteraard ook de computationele infrastructuur zelf⁠ verbeteren. Net als bij opschaling richten we het onderzoek van OpenAI daarom op RSI, omdat we denken dat dit de enige manier is om ook in de toekomst grensverleggend AI-onderzoek te blijven doen.

Ik wil benadrukken dat het bovenstaande niet betekent dat ik denk dat een sterke versnelling van deep learning-onderzoek, vooral op korte termijn, de juiste gezamenlijke koers voor de onderzoeksgemeenschap is. Ik denk echter wel dat de huidige koers hiernaartoe leidt en dat we allemaal bewust moeten kiezen hoe we verdergaan. Onze belangrijkste opties zijn het proces zo sturen dat afstemming en monitoring samen met de AI worden versterkt en mensen betrokken blijven, of gezamenlijk besluiten de toekomstige ontwikkeling zo nodig te vertragen totdat we voldoende vertrouwen in deze maatregelen hebben.

De beste weg vooruit lijkt mij momenteel een combinatie van beide.

De concrete vooruitgang die we hebben geboekt met afstemming en monitoring is doorgaans sterk verweven met de algemene vooruitgang van AI. Goede voorbeelden zijn RL op basis van menselijke feedback⁠(opent in een nieuw venster), dat essentieel was voor het trainen van vroege AI-assistenten, en de eerder genoemde monitoring van chain-of-thought⁠(opent in een nieuw venster), die mogelijk werd door vooruitgang bij redeneermodellen. We moeten het steeds verder geautomatiseerde onderzoeksproces richten op de ontwikkeling van zulke nieuwe inzichten, algoritmen en theorieën, en stapsgewijs veiligheidsonderbouwingen opbouwen voor krachtigere AI's.

Het opschalen van AI-systemen moet worden begrensd door ons vertrouwen in de veiligheid. We moeten toezeggingen zoals het Preparedness Framework⁠ of het beleid voor verantwoorde opschaling⁠(opent in een nieuw venster) ontwikkelen tot breed verplichte veiligheidsnormen voor verdere ontwikkeling. Deze kunnen worden gehandhaafd door een netwerk van onafhankelijke auditors, overheidsinstanties of internationale organisaties.

De kernuitdaging bij het automatiseren van AI-onderzoek is niet dat we "er komen", maar dat we dat doen op een manier waarbij mensen deel blijven uitmaken van het verdere verbeteringsproces en de toekomst in handen van de mensheid blijft.

Wat volgt?

Zoals we onlangs samen met Sam uiteenzetten⁠, geeft OpenAI prioriteit aan werk in dienst van drie leidende doelen:

  1. De volgende fase van AI-vooruitgang in goede banen leiden door een geautomatiseerde AI-onderzoeker te bouwen, daarmee iteratief aan het afstemmingsprobleem te werken en manieren te vinden waarop mensen deel blijven uitmaken van de zelfverbeteringscyclus.

  2. De voordelen beschikbaar maken van de wetenschappelijke vooruitgang en economische groei die zeer intelligente machines mogelijk maken.

  3. Iedereen persoonlijk versterken met een eigen AGI.

In dit essay heb ik me alleen op het eerste punt gericht, omdat ik denk dat dit verreweg het dringendst is. Toch heb ik grote hoop op en waardering voor de voordelen die verdere technologische vooruitgang zal brengen. Toekomstige afgestemde AI kan de wetenschap vooruithelpen, nieuwe therapieën ontwikkelen en brede materiële overvloed tot stand brengen. Vriendelijke en eerlijke AI kan mensen helpen omgaan met problemen in hun leven en hun geluk en gevoel van vervulling wezenlijk vergroten. OpenAI spant zich enorm in om deze voordelen werkelijkheid te maken. Een actueel voorbeeld waarop ik trots ben en dat mijn dierbaren nuttig vinden, is de grote investering in het vermogen van ChatGPT om gezondheidsinformatie te bieden.

Hoe groot de belofte van AI op lange termijn ook is, onze aandacht moet vooral uitgaan naar de komende jaren. We staan voor een overgang naar een wereld met ongelooflijk intelligente machines en moeten zorgen dat die overgang goed uitpakt voor de mensheid. We moeten manieren vinden om de menselijke autonomie te behouden en de intrinsieke waarde van het mens-zijn te verankeren in een wereld waarin AI de meeste taken kan uitvoeren. Om een extreme machtsconcentratie te voorkomen in een wereld waarin een paar mensen met een grote computer kunnen bereiken waarvoor vroeger duizenden deskundigen nodig waren. En om te waarborgen dat mensen de toekomst in eigen hand houden en niet achterblijven door ongebreidelde vooruitgang, voortgebracht door een vreemde intelligentie die de onze overtreft.

Momenteel denk ik dat geen enkel lab afstemming en monitoring voldoende heeft opgelost om nog veel langer verantwoord op maximale snelheid te kunnen opschalen. Ik verwacht en hoop dat vrijwillige vertragingen gemeengoed worden totdat er gezamenlijke veiligheidsnormen zijn vastgesteld. Ook denk ik dat internationale coördinatie rond de toekomstige ontwikkeling van AI een topprioriteit moet worden voor overheden wereldwijd.

Auteurs

Jakub Pachocki

Voetnoten

  1. 1

    Dit omvatte het opschalen van zelfspel⁠(opent in een nieuw venster), robotica⁠(opent in een nieuw venster) en, achteraf gezien het meest opvallend, het opschalen van recurrente netwerken om taal te modelleren⁠(opent in een nieuw venster), een voorloper van de GPT-onderzoekslijn.

  2. 2

    Een tweede reden voor dit ontwerp was het voorkomen van distillatie. Maar gedurende de ontwikkeling had het behoud van de controleerbaarheid van CoT voor ons uitdrukkelijk een hogere prioriteit.