Naar veiligheidsonderbouwingen voor grensverleggende AI-training
We denken dat we een nieuw tijdperk ingaan waarin gestructureerde veiligheidsdocumentatie verplicht zou moeten zijn voordat een grensverleggende trainingsrun met reinforcement learning wordt voortgezet. Idealiter voldoet zulke documentatie aan het niveau van "veiligheidsonderbouwingen": uitvoerige, gestructureerde en op bewijs gebaseerde argumentaties over risico's, zoals die in andere veiligheidskritische sectoren worden gebruikt. We zien veiligheidsonderbouwingen als een ambitieus richtpunt waar we naartoe werken. Tegelijk erkennen we hoe moeilijk het is om ze voor AI-modellen even rigoureus te maken als voor de luchtvaart of kernenergie, doordat elk nieuw niveau van AI-capaciteiten nieuwe complexiteit met zich meebrengt. We werken aan een kader om deze werkwijzen vast te leggen.
Hieronder staan enkele eerste richtlijnen die volgens ons deel moeten uitmaken van zulke veiligheidsonderbouwingen voor grensverleggende AI-training. Deze best practices weerspiegelen wat we tot nu toe hebben geleerd. We verwachten dat ze zullen evolueren naarmate we onze interne processen voor zorgvuldige ontwikkeling blijven verbeteren. We delen ze nu om onze huidige inzichten transparant te maken en nodigen de gemeenschap uit om feedback te geven. Dit document richt zich op grensverleggende training met reinforcement learning. Voor intern en extern gebruik moet een veel breder scala aan eigenschappen van doelafstemming worden meegewogen.
Veiligheidsonderbouwingen moeten drie aspecten van de technische stack behandelen: training voor doelafstemming, inperking en monitoring. Deze waarborgen helpen voorkomen dat het model probeert te handelen in strijd met de beoogde doelen. Mocht het dat toch proberen, dan maken ze het moeilijk om aan de inperking te ontsnappen en zorgen ze dat monitoring dit detecteert voordat er schade kan ontstaan.
Doelafstemming van modellen: De eerste verdedigingslinie moet bestaan uit het trainen van modellen op doelafstemming: ze moeten betrouwbaar handelen zoals wij dat bedoelen. Denk hierbij aan:
Trainingsomgevingen en beoordeling: Verminder het risico dat modellen gedrag ontwikkelen dat afwijkt van de beoogde doelen, door tijdens de training te voorkomen dat het manipuleren van het beloningssysteem positief wordt bekrachtigd. Denk hierbij aan:
Geautomatiseerde datasetcontroles: Gebruik agents om gebrekkige RL-omgevingen op te sporen en te herstellen waarin afwijkende handelingsreeksen een hoge beloning kunnen opleveren door kwetsbaarheden uit te buiten in plaats van het beoogde gedrag te vertonen. Zo wordt de kans kleiner dat afstemmingsproblemen tijdens de training worden versterkt.
Handmatige datasetcontroles: Vul geautomatiseerde red teaming aan met handmatige beoordelingen en kwaliteitscontroles van datasets om gebrekkige taken op te sporen die onbedoeld gedrag kunnen versterken dat afwijkt van de beoogde doelen.
Beoordelingssystemen afstellen: Stel beoordelingssystemen zo af dat ze pogingen van het model om tijdens de training RL-omgevingen uit te buiten of te hacken bestraffen.
Analyse van eerdere runs: Laat classificatiemodellen de uitvoeringssporen van eerdere experimenten analyseren om te controleren of de beoordelingssystemen werken zoals bedoeld.
Doelafstemming meten: Voer evaluaties uit die bijhouden in hoeverre het model geneigd is af te wijken van de beoogde doelen, om de effectiviteit van de afstemmingstraining te meten. Denk hierbij aan:
Offline-evaluaties van doelafstemming: Voer tijdens grensverleggende trainingsruns evaluaties van doelafstemming uit om te beoordelen of de training werkt zoals bedoeld, en onderzoek elke wezenlijke achteruitgang.
Toetsing aan eerdere incidenten: Toets evaluaties van doelafstemming aan eerdere incidenten om te bevestigen dat ze modellen met eerdere afstemmingsproblemen detecteren en niet te sterk op specifieke incidenten worden afgestemd.
Manipulatie van evaluaties volgen: Volg evaluatiebewustzijn of metagaming (modellen die herkennen dat ze worden getest) dat tot gedragsverandering kan leiden. Schakel bijvoorbeeld monitors voor evaluatiebewustzijn en metagaming in bij evaluaties van doelafstemming, met specifieke drempelwaarden voor blokkering.
Stresstests voor het ongunstigste scenario: Lok het ernstigste ongewenste gedrag uit en controleer of ten minste één evaluatie dit gedrag zou detecteren.
Training op chain-of-thought voorkomen: Geef geautomatiseerde beoordelingssystemen bij reinforcement learning geen inzage in de chain-of-thought, om te voorkomen dat modellen leren de monitors voor chain-of-thought te omzeilen.
Inperking: Zorg dat sandboxing en beveiliging sterk genoeg zijn om schadelijke handelingen te voorkomen als een model afstemmingsproblemen ontwikkelt. Denk hierbij aan:
Meerdere lagen infrastructuurbeveiliging: Investeer fors in het versterken van zowel de sandbox waarin het model draait als de onderzoeksinfrastructuur waarop de sandbox wordt gehost. Zo is er een extra beschermingslaag als het model uit de sandbox ontsnapt.
Red teaming van inperking: Verbeter de beveiliging van de sandbox, de onderzoeksinfrastructuur en de netwerkperimeter door deze systemen herhaaldelijk aan red teaming te onderwerpen met checkpoints uit grensverleggende trainingsruns, onder voorbehoud van een veiligheidsanalyse. Spoor zo eventuele hiaten op en dicht ze. Voer ook aanvalstests uit op alle diensten waarmee het model tijdens de training in aanraking kan komen, zoals de internetcache.
Communicatie tussen samples: Beperk communicatie met hoge bandbreedte tussen samples tot goedgekeurde kanalen, zoals tooling voor meerdere agents. Sluit nevenkanalen in de infrastructuur af die een hoge bandbreedte hebben en gemakkelijk door agents kunnen worden ontdekt.
Onveranderbare transcripten: Bewaar agenttranscripten voor alle RL-training, evaluaties en intern gebruik gedurende een redelijke termijn in onveranderbare vorm, bijvoorbeeld in opslagaccounts waarin gegevens slechts eenmaal kunnen worden geschreven. Dit maakt betrouwbaar incidentonderzoek mogelijk en voorkomt onbedoelde wijzigingen.
Monitoring: Zorg voor een live monitoringsysteem dat mogelijke afstemmingsproblemen detecteert als modellen beginnen te handelen in strijd met de beoogde doelen. Pak prioritaire problemen snel aan, voordat een ernstig incident kan ontstaan. Denk hierbij aan:
Monitorbaarheid afdwingen: Zorg dat modellen monitorbaar blijven, gemeten met evaluaties van monitorbaarheid en monitoromzeiling met duidelijke drempelwaarden, om zorgwekkend gedrag vroegtijdig te detecteren.
Hoge detectiegraad voor bekende problemen: Zorg dat het monitoringsysteem een groot deel van eerdere incidenten detecteert in een evaluatie met apart gehouden testgegevens.
Actuele evaluaties voor monitors: Maak evaluatiedatapunten die representatief zijn voor geheel nieuwe risico's bij nieuwe runs, zodat metingen van de detectiegraad en precisie van monitors actueel blijven.
Snelle respons: Stel prioriteitsmeldingen in die binnen de afgesproken SLA tot actie leiden, door een dienstdoende medewerker te alarmeren of de getroffen run automatisch te pauzeren voordat het model schade veroorzaakt. Alarmeer bijvoorbeeld overdag bij incidenten de dienstdoende beveiligingsmedewerker en de verantwoordelijke voor de run, en pauzeer runs 's nachts automatisch bij onbevestigde meldingen.
Naast aanbevelingen voor technische waarborgen hebben we gewerkt aan operationele best practices voor veiligheidsonderbouwingen bij trainingsruns voor grensverleggende AI. Denk hierbij aan:
Kritische tegenargumenten (premortems): Nadat een veiligheidsonderbouwing is opgesteld, moet een medewerker van een ander team een kritische reactie schrijven om mogelijke hiaten bloot te leggen en een zorgvuldig afgewogen risico-inschatting te geven. Het trainingsteam moet daarop reageren om de veiligheidsonderbouwing te versterken.
Goedkeuringen: Leden van het hoger management moeten de veiligheidsonderbouwing beoordelen en ieder afzonderlijk de run kunnen tegenhouden. Zo zijn er meerdere interne controles op de run (bijvoorbeeld door de onderzoeksdirecteur of VP, het hoofd veiligheid en de hoofdwetenschapper).
Verantwoording: De leidinggevende die verantwoordelijk is voor een trainingsrun (bijvoorbeeld de onderzoeksdirecteur of VP onderzoek) moet verantwoording afleggen over de veiligheidsonderbouwing en eventuele incidentafhandeling, ook tijdens beoordelingsgesprekken. Zo worden trainingsteams ook gestimuleerd om zich in te zetten voor veiligheid en doelafstemming.
Pauzeren: Zorg voor draaiboeken, technische beheersmaatregelen en SLA's om alle betrokken runs te pauzeren als er problemen worden ontdekt die een veiligheidsonderbouwing ongeldig maken, zoals een nieuw beveiligingsprobleem.
Interne transparantie: Veiligheidsonderbouwingen moeten beschikbaar worden gesteld aan interne toezichthouders, zoals de Safety and Security Committee.
Audits: Auditors moeten voldoende toegang krijgen om te controleren of de claims in de veiligheidsonderbouwing geldig en deugdelijk zijn, en om eventuele hiaten aan te kaarten.
Escalaties: Er moet een duidelijk proces zijn om afstemmingsproblemen te escaleren, met een tabel van vastgelegde ernstniveaus en een bereikbaarheidsdienst voor afstemmingsproblemen. Die dienst moet bestuurders (bijvoorbeeld de CEO) kunnen alarmeren wanneer een run een bepaald ernstniveau bereikt.
Technische beheersmaatregelen: Het moet voor mensen en agents moeilijk zijn om runs te starten die niet aan de vereisten voldoen. Veiligheidsfuncties zoals monitoring en automatisch pauzeren moeten bij uitval de uitvoering blokkeren. Het mag bijvoorbeeld niet mogelijk zijn om runs te starten zonder passende monitoring, of om de monitor uit te schakelen vanuit RL-training, evaluatie of intern gebruik.
Terugdraaibaarheid: Alle vervolgtoepassingen van een niet goed afgestemd model binnen het trainingsproces (bijvoorbeeld voor gegevensgeneratie of beoordeling) moeten eenvoudig te achterhalen zijn. Zo kunnen de effecten van niet goed afgestemde outputs zo nodig ongedaan worden gemaakt.
Volledig overzicht van restrisico's: Veiligheidsonderbouwingen moeten een zo volledig mogelijke lijst bevatten van restrisico's die niet worden afgedekt door de huidige risicobeperkende maatregelen. Dit maakt weloverwogen beslissingen over risicoacceptatie mogelijk.
Dit zijn onze huidige aanbevelingen, die momenteel bij OpenAI worden ingevoerd. We verwachten dat onze werkwijzen de komende weken verder zullen evolueren.
We hebben ook best practices ontwikkeld voor onderzoek naar ernstige incidenten met gebrekkige AI-afstemming. AI-labs moeten proberen zo veel mogelijk te leren van afzonderlijke incidenten om herhaling te voorkomen, vergelijkbaar met onderzoekspraktijken(opent in een nieuw venster) in andere sectoren waar veel op het spel staat. Voorbeelden van mogelijke maatregelen zijn:
Interne transparantie: Omdat een onderzoek veel tijd kan kosten, moeten intern regelmatig updates over incidentonderzoeken worden gedeeld, bijvoorbeeld dagelijks zolang het onderzoek loopt. Er moeten duidelijke procedures zijn waarmee medewerkers ruimere toegang kunnen krijgen, onder meer tot onbewerkte transcripten en de mogelijkheid om outputs van niet goed afgestemde modellen te genereren, als dit veilig en relevant is voor hun werk.
Grondoorzaak van afstemmingsproblemen: Onderzoekers moeten de onderliggende oorzaken in de trainingsdynamiek achterhalen, bijvoorbeeld via gerichte ablatie- of resamplingexperimenten. Zo kunnen ze vaststellen hoe het afwijkende gedrag is ontstaan, de wetenschappelijke inzichten in afstemmingsproblemen verdiepen en deze problemen in de toekomst beter voorkomen.
Evaluatie achteraf: Er moet een evaluatie van operationele en culturele factoren worden uitgevoerd om alle oorzaken die aan het incident hebben bijgedragen te begrijpen. Denk aan de vraag hoe problemen zijn ontstaan en waarom ze vóór het incident niet zijn ontdekt of geëscaleerd.
Detectie: We moeten testmethoden voor doelafstemming ontwikkelen die de neiging om het incident te veroorzaken kunnen opsporen, zonder deze methoden rechtstreeks te optimaliseren op basis van informatie uit het incident, zoals transcripten of incidentsamenvattingen. Op incidenten gebaseerde evaluaties moeten worden opgezet als "regressietests", om te waarborgen dat toekomstige modellen bij sterk vergelijkbare incidenten geen neiging tot afstemmingsproblemen vertonen.
Openbaarmaking: Onderzoeksresultaten, evaluaties achteraf en operationele wijzigingen moeten na afronding van het onderzoek openbaar worden gemaakt. Getroffen derden moeten zo snel mogelijk op de hoogte worden gesteld.


