Normen ontwikkelen voor de volgende fase van AI
Onze missie is ervoor te zorgen dat kunstmatige algemene intelligentie de hele mensheid ten goede komt. Zoals Sam Altman onlangs uiteenzette, samen met Jakub Pachocki, richten we ons werk voor deze missie op drie hoofddoelen:
De volgende fase van AI-vooruitgang in goede banen leiden door een geautomatiseerde AI-onderzoeker te ontwikkelen, daarmee iteratief aan het afstemmingsprobleem te werken en manieren te vinden om mensen bij de cyclus van zelfverbetering betrokken te houden.
De voordelen verwezenlijken van de wetenschappelijke vooruitgang en economische groei die zeer intelligente machines mogelijk maken.
Iedereen individueel meer mogelijkheden bieden met een persoonlijke AGI.
AI versnelt ons eigen onderzoek en ontwikkelwerk, en onderzoek met behulp van AI heeft geleid tot vooruitgang in de wiskunde, waaronder bij het Navier-Stokes-millenniumprobleem. Deze vooruitgang is veelbelovend voor onze twee andere doelen en kan leiden tot belangrijke medische ontdekkingen, breed toegankelijke gezondheidszorg en meer economische mogelijkheden voor kleine bedrijven en individuele ondernemers overal ter wereld.
AI maakt bij veel bedrijven en in veel landen vorderingen, en de vooruitgang in het hele vakgebied verandert de kansen en uitdagingen waarmee iedereen te maken krijgt. Naast de andere voordelen zal capabele, afgestemde AI een belangrijke rol spelen bij het doorlopen van deze overgang: ze kan de verdediging versterken, onderzoek naar afstemming bevorderen en mensen helpen de volgende fasen van de AI-ontwikkeling te begrijpen en te sturen.
Om deze overgang veilig te doorlopen, moet onderzoek naar afstemming gelijke tred houden met deze mogelijkheden, zodat de systemen die wij en anderen ontwikkelen afgestemd blijven op menselijke waarden en onder menselijke controle blijven. Dit wordt steeds belangrijker naarmate AI-systemen capabeler en autonomer worden, ook wanneer ze een groter deel van het onderzoek naar en de ontwikkeling van AI zelf uitvoeren. Om verdere AI-vooruitgang veilig en nuttig te maken, zijn zowel vorderingen in onderzoek naar afstemming als gezamenlijke normen nodig die de ontwikkeling in verschillende laboratoria en landen sturen.
Geautomatiseerd AI-onderzoek kan in uiteenlopende mate onder menselijk toezicht staan. Naarmate AI-systemen meer werk verrichten aan de ontwikkeling van opeenvolgende generaties AI, kunnen ze in toenemende mate een proces van recursieve zelfverbetering (RSI) aandrijven, ook als mensen erbij betrokken blijven. Naarmate dit proces verder wordt geautomatiseerd, kan de AI-vooruitgang snel versnellen.
Wij denken dat geautomatiseerd AI-onderzoek modellen zal opleveren die het leven van mensen rechtstreeks verbeteren. Het kan de kosten van geavanceerde intelligentie verlagen, zodat mensen overal ter wereld ervan kunnen profiteren. Geautomatiseerd onderzoek kan ons ook helpen de afstemming aanzienlijk te verbeteren en verdedigingsmechanismen tegen steeds capabelere AI te ontwikkelen: een geautomatiseerde AI-onderzoeker kan ook een geautomatiseerde onderzoeker naar AI-veiligheid zijn. Capabelere, afgestemde systemen kunnen helpen kritieke infrastructuur te beveiligen, bescherming te bieden tegen gevaarlijke AI-agenten en nieuwe beschermingsmaatregelen te ontwikkelen.
Volledig autonome RSI vindt momenteel niet plaats en we moeten die niet nastreven, tenzij en totdat dit veilig kan. Of en hoe we verdergaan, moet afhangen van ons vermogen om menselijke controle te behouden en van goed geïnformeerde democratische keuzes(opent in een nieuw venster) over de voordelen en risico's. Zonder passende zorgvuldigheid en voorzichtigheid kan RSI ertoe leiden dat mensen de feitelijke controle over de AI-ontwikkeling verliezen en geen toezicht meer kunnen houden op onderzoeksprocessen die ze niet langer begrijpen. Van daaruit kan AI gevaarlijker en minder goed afgestemd worden en per saldo een gevaar voor mensen vormen. Het door ons gemelde Hugging Face-incident was weliswaar geen rechtstreeks gevolg van RSI, maar geeft een voorproefje van de soorten risico's die zonder robuuste waarborgen en afstemming veel ernstiger kunnen worden.
Internationale normen voor veiligheids- en beveiligingspraktijken bij de ontwikkeling van grensverleggende AI kunnen net zo belangrijk zijn om het tempo van die ontwikkeling te bepalen als het onderzoek naar afstemming zelf. Normen kunnen gezamenlijke definities voor hoogwaardig bewijs en afgesproken minimumeisen voor de degelijkheid van technische waarborgen opleveren. Kortom, ze helpen ons de vraag te beantwoorden: "Hoe ziet een goede aanpak van catastrofale AI-risico's eruit?"
Bestaande democratische instellingen zoals het Center for AI Standards and Innovation (CAISI), wetten van deelstaten en een federaal kader voor AI kunnen hier allemaal aan bijdragen, net als nieuwe vormen van publiek-private samenwerking(opent in een nieuw venster). Maar AI wordt in meerdere landen ontwikkeld en ingezet, de toepassing ervan vindt wereldwijd plaats en de gevolgen zullen waarschijnlijk iedereen op enig moment en op enige wijze raken.
Er zijn daarom internationale initiatieven voor de ontwikkeling van normen nodig om enkele belangrijke uitdagingen aan te pakken:
Versnippering — Evaluaties, rapportagevereisten en definities van incidenten kunnen per land verschillen en met elkaar botsen. Dat maakt het moeilijker om bewijs te vergelijken, nieuwe mogelijkheden te begrijpen en te reageren op grensoverschrijdende risico's.
Gezamenlijk optreden — Als elk land zelfstandig handelt, kan dat resultaten opleveren die geen enkel land wenst. RSI kan het AI-onderzoek zelf versnellen, mogelijk tot voorbij ons gezamenlijke vermogen om de vooruitgang te begrijpen, risico's te beoordelen en betekenisvol menselijk toezicht te behouden.
Ongelijk verdeelde capaciteit — De ontwikkeling van grensverleggende AI en de bijbehorende expertise zijn niet gelijkmatig over de wereld verdeeld. Dit versterkt beide bovenstaande problemen.
Deze uitdagingen gelden voor zowel open als gesloten modellen.
Voor alle duidelijkheid: elk AI-laboratorium dat geautomatiseerd AI-onderzoek of andere geavanceerde mogelijkheden nastreeft, moet er verantwoordelijkheid voor nemen dat dit veilig gebeurt, volgens de basisbeginselen van eigen verantwoordelijkheid en de geldende wetgeving. Onze argumenten voor normen zijn gebaseerd op het voorkomen van machtsconcentratie en het behalen van betere praktische resultaten. Normen bieden meer belanghebbenden buiten de laboratoria een manier om mee te praten over de ontwikkeling van deze technologie. Ook vormen ze een zichtbare reeks beginselen waarop men kan vertrouwen, ongeacht de specifieke werkwijze van een bepaald laboratorium. En we zullen waarschijnlijk betere resultaten behalen als partijen samenwerken om de bovenstaande uitdagingen aan te pakken.
Daarom vinden wij dat de Verenigde Staten het voortouw moeten nemen bij een initiatief om samen met landen overal ter wereld mondiale technische normen voor grensverleggende AI te ontwikkelen, waaronder voor RSI.
Hoewel we verwachten dat dit concept zich in de loop van de tijd sterk zal ontwikkelen, zijn twee aspecten essentieel.
Een manier om dit te bereiken is gebruik te maken van het opkomende netwerk van instituten voor AI-veiligheid, zoals die welke al zijn opgericht in Australië, Canada, Duitsland, Frankrijk, Kenia, Japan, Korea, Singapore, India en het Verenigd Koninkrijk. Via CAISI en nationale brancheorganisaties kunnen zij de vaststelling van normen ondersteunen, met bijzondere aandacht voor (1) grensverleggende AI-modellen en hun ontwikkelaars, gemeten aan de hand van benchmarks voor capaciteiten; en (2) het beheer van voordelen en risico's van geautomatiseerd AI-onderzoek, waaronder RSI. De Verenigde Staten kunnen voortbouwen op de oprichting door CAISI van het International Network for Advanced AI Measurement, Evaluation, and Science(opent in een nieuw venster) in 2024, dat publieke instellingen samenbrengt om mee te werken aan het meten en evalueren van AI en aan AI-wetenschap.
De normen die dit initiatief ontwikkelt, zouden een gemeenschappelijke technische basis bieden voor het meten en evalueren van capaciteiten, het beoordelen van risico's en het bepalen of waarborgen toereikend zijn. Deze technische normen zouden geen vergunningen, verplichte toetsing vóór publicatie of goedkeuringsvereisten voor AI-modellen zijn. Nationale overheden zouden zelf beslissen of en hoe ze deze normen in hun eigen rechtsstelsels opnemen.
Dit werk moet ook een concurrerend AI-ecosysteem ondersteunen door ontwikkelaars van open en gesloten modellen, onafhankelijke technische experts en de academische wereld te raadplegen. Gemeenschappelijke normen moeten transparant worden ontwikkeld en zo worden ontworpen dat ze bepaalde bedrijven, landen of bedrijfsmodellen niet bevoordelen, ook niet door het nieuwe toetreders of ontwikkelaars van modellen met open gewichten moeilijker te maken om te concurreren.
Zoals we hebben voorgesteld(opent in een nieuw venster), kan deze aanpak lessen trekken uit sectoren zoals de luchtvaart en financiële stabiliteit, waar landen gemeenschappelijke technische normen en vertrouwde kanalen voor samenwerking hebben ontwikkeld zonder nationale bevoegdheden op te geven. Er moet ook nauw worden samengewerkt met gevestigde en nieuwere normalisatieorganisaties zoals ISO(opent in een nieuw venster), het Frontier Model Forum(opent in een nieuw venster), de Agentic AI Foundation(opent in een nieuw venster) en de Open Secure AI Alliance(opent in een nieuw venster), en met organisaties die zich richten op implementatie, zoals de Appia Foundation, die praktische specificaties ontwikkelt om internationale normen te verbinden met AI-beoordelingen in de praktijk.
Internationale AI-normen zullen bijzonder belangrijk zijn voor het beheersen van de toenemende autonomie in AI-onderzoek en recursieve zelfverbetering. Deze kunnen specifiek normen omvatten voor:
Het evalueren van voor RSI relevante AI-vooruitgang en de hoeveelheid autonoom onderzoek die binnen een AI-bedrijf plaatsvindt. Ons recente rapport over de versnelling van onderzoek is een eerste bijdrage aan dit initiatief.
Menselijk toezicht op geautomatiseerd AI-onderzoek, waaronder de soorten geautomatiseerde AI-onderzoeksprocessen die onmiddellijk door mensen moeten worden beoordeeld.
De classificatie, registratie, rapportage en afhandeling van incidenten rond afstemming en geautomatiseerd AI-onderzoek, zoals gemeenschappelijke ernstniveaus voor incidenten en rapportagedrempels. Ons kader voor het melden van gebrekkige afstemming is een eerste bijdrage.
Naast deze normen vinden we het belangrijk dat beheerders van kritieke infrastructuur en overheden wereldwijd beveiligde communicatiekanalen opzetten om zorgen over de nationale veiligheid, nieuwe kwetsbaarheden en dreigingen, en best practices te delen op het snel veranderende gebied van de veiligheid van grensverleggende AI. Een dialoog tussen de Verenigde Staten en China op deze gebieden zou een positieve stap zijn, en de komende gesprekken vinden op een gunstig moment plaats.
Het tempo van de AI-ontwikkeling bepalen betekent niet dat we een vooraf vastgestelde snelheid moeten aanhouden. Technisch gezien gaat het erom dat onderzoek naar afstemming en de toepassing van de resultaten daarvan voor blijven lopen op de mogelijkheden van AI. Maatschappelijk gezien gaat het om de inzet van normen, instellingen en samenwerking om netwerken van bedrijven, maatschappelijke verbanden en marktkrachten te versterken en zo resultaten te bereiken die per saldo voordeel opleveren. De recente oproep tot gezamenlijke actie voor cyberverdediging is een voorbeeld van dat laatste.
De Verenigde Staten verkeren in een goede positie om het voortouw te nemen, omdat hun AI-sector technisch grensverleggend is en het land nog altijd een bevoorrechte positie inneemt in mondiale netwerken op cruciale gebieden zoals financiën, handel, defensie, technologie en informatiesystemen. Door nu het voortouw te nemen, bepalen de Verenigde Staten of ze het mondiale AI-kader vormgeven of toezien hoe er om hen heen een versnipperd, ongelijk en conflictueus systeem ontstaat. Dit bepaalt ook of geavanceerde AI de bestaande netwerken van de Verenigde Staten en hun bondgenoten versterkt; nemen ze niet het voortouw, dan kunnen die netwerken verzwakken.
Bij geopolitieke concurrentie zal het niet alleen gaan om wie technisch vooroploopt, maar ook om de invoering en verspreiding van AI. Dat laatste wordt mogelijk steeds meer bepaald door de partij die werkbare samenwerking en verstandige spelregels tot stand brengt waar bedrijven en samenlevingen overal behoefte aan hebben als ze hun toekomst op deze technologie willen inzetten.
Krachtig nationaal bestuur, verbonden door praktische internationale samenwerking, biedt uitzicht op betere waarborgen, voortdurende innovatie en brede toegang tot de voordelen van AI.


