Prioriteiten en principes voor effectieve externe beoordelingen
Labs voor grensverleggende AI dragen een enorme verantwoordelijkheid om modellen veilig te trainen, evalueren en in gebruik te nemen. Beoordelingen door externe partijen zijn essentieel om die verantwoordelijkheid in evenwicht te houden, meer ruimte te bieden voor inbreng over AI-veiligheid, de wereld te informeren en labs verantwoordelijk te houden voor duidelijke, onafhankelijk onderbouwde veiligheidsclaims.
Als onderdeel van onze inspanningen om gelijke tred te houden met grensverleggende AI, zet OpenAI zich in voor onafhankelijke beoordelingen met diepgaande toegang tijdens training, evaluatie en ingebruikname. Die toegang moet beoordelaars in staat stellen onze aannames ter discussie te stellen, risico's te identificeren die wij mogelijk hebben gemist en zelf conclusies te trekken over de doeltreffendheid van onze waarborgen.
We werken al lange tijd met externe beoordelaars in verschillende fasen van de ontwikkeling en ingebruikname van modellen. We hebben beoordelingen door externe partijen ook opgenomen in onze werkwijzen voor het Preparedness Framework en organisaties en wetgeving ondersteund die pleiten voor een grondiger proces met meer verantwoordingsplicht. Tijdens deze samenwerkingen hebben we vergaande toegang geboden, onder meer tot informatie over onze technische waarborgen, zichtbare chain-of-thought en ongekende hoeveelheden vertrouwelijke gegevens en interne implementaties voor incidentrespons en red teaming van monitors. De hier beschreven prioriteiten en principes richten zich op onze samenwerking met onafhankelijke beoordelingsorganisaties uit de private en non-profitsector op het gebied van technische veiligheidsbeoordelingen. Ze vormen een aanvulling op ons werk met overheden rond testen en evalueren, waarbij afzonderlijke rollen en verantwoordelijkheden andere benaderingen kunnen vereisen.
Voor effectieve beoordelingen zijn sterke mechanismen voor onafhankelijkheid, wetenschappelijke grondigheid, robuuste beveiligingspraktijken en duidelijke verantwoordelijkheden nodig. Labs zijn verantwoordelijk voor het mogelijk maken van zinvolle toetsing en het beschermen van gevoelige informatie. Labs en onafhankelijke beoordelaars delen de verantwoordelijkheid om dit goed te doen en moeten werken volgens gedeelde internationale normen voor veiligheids- en beveiligingspraktijken. Hieronder stellen we vier prioriteitsgebieden voor diepgaandere beoordeling voor, naast principes voor grondig, veilig en onafhankelijk werk.
Beoordelingen door externe partijen zijn het nuttigst wanneer ze specifieke vragen met wezenlijke gevolgen behandelen: ondersteunt het bewijs de veiligheidsonderbouwing en veiligheidsclaims van een lab? Toetsen evaluaties de risico's die ze moeten meten voldoende? Werken waarborgen onder realistische omstandigheden?
De hier beschreven beoordelingen kunnen verschillende vormen aannemen, afhankelijk van de onderzochte veiligheidsvragen. We verwachten meerdere beoordelingen parallel en over verschillende perioden te ondersteunen, waarbij sommige weken en andere meerdere maanden duren. Hoewel beoordelingen door externe partijen ook deel kunnen uitmaken van werkzaamheden vóór ingebruikname en beslissingen daarover kunnen beïnvloeden, is het hier beschreven werk doorgaans langerlopend en onafhankelijk van een lancering. Het richt zich op het langdurig en diepgaand onderzoeken van specifieke veiligheidsclaims.
In onze prioriteitsgebieden en principes verwijzen we naar veiligheidsclaims en veiligheidsonderbouwingen. Met deze termen bedoelen we het volgende:
Veiligheidsclaim: Een specifieke bewering over de capaciteiten, het gedrag of de waarborgen van een model of systeem, die relevant is voor de veiligheid en aan bewijs kan worden getoetst. Een claim moet duidelijk maken op welke risico's en omstandigheden deze betrekking heeft, evenals welke relevante aannames en beperkingen gelden.
Veiligheidsonderbouwing: Een gestructureerd, door bewijs ondersteund betoog dat uitlegt waarom de risico's van een model of systeem afdoende worden beheerst voor een specifieke activiteit, zoals training, evaluatie of ingebruikname. Een veiligheidsonderbouwing koppelt afzonderlijke veiligheidsclaims aan het bewijs dat ze ondersteunt en benoemt expliciet de aannames, onzekerheden en resterende risico's die van invloed kunnen zijn op de conclusies.
We stellen vier prioriteitsgebieden voor diepgaandere beoordeling voor, naast principes voor grondig, veilig en onafhankelijk werk.
Onafhankelijke beoordeling van veiligheidsonderbouwingen voor training, evaluatie, interne ingebruikname en externe ingebruikname.
Voor de beoordeling van veiligheidsonderbouwingen is expertise nodig op het gebied van alignment, controlemethoden zoals monitoring, cyberbeveiliging, biologisch en chemisch misbruik en red teaming. Veiligheidsonderbouwingen bestaan uit claims over onder meer training, capaciteitsevaluaties en waarborgen. Deze kunnen als geheel of afzonderlijk worden beoordeeld (zie prioriteiten 2 en 3 hieronder). Waarschijnlijk moeten meerdere beoordelaars verschillende onderdelen van de onderbouwingen onderzoeken, ieder vanuit de eigen expertise. Samen moeten hun beoordelingen antwoord geven op vragen zoals:
Is het bewijs voor veiligheidsonderbouwingen voor training, evaluatie en ingebruikname afdoende gestaafd? Zijn de voorwaarden van de veiligheidsonderbouwing tijdens training, evaluatie en ingebruikname nageleefd?
Bestrijken onze veiligheidsonderbouwingen de urgentste risico's die tijdens een beoordeling zijn vastgesteld? Ondersteunen de veiligheidsclaims de algehele veiligheidsonderbouwing? Zijn er tekortkomingen of verbeterpunten?
Worden doeltreffende methoden gebruikt om prikkels in de training te identificeren en verminderen die misleiding, reward hacking, destructieve handelingen of het omzeilen van beperkingen kunnen belonen?
Beoordeling van cruciale waarborgen bij interne en externe ingebruikname
Onze combinatie van waarborgen blijft zich ontwikkelen om aan te sluiten bij veranderende capaciteiten en omstandigheden. Onze waarborgen omvatten training, interne ingebruikname en externe ingebruikname. Ze omvatten momenteel waarborgen op modelniveau, handhavings- en beveiligingswaarborgen en monitors voor misalignment. Daarmee bestrijken ze uiteenlopende risico's, zoals controleverlies en misbruik op cyber-, biologisch en chemisch gebied. Technische samenwerkingen kunnen nu zwakke plekken in waarborgen identificeren, terwijl ze beoordelingsmethoden verbeteren en de ontwikkeling van normen versnellen. Zo ontstaat een sterkere technische basis voor toekomstig overheidsbeleid om gelijke tred te houden met grensverleggende AI, met name bij interne ingebruikname, waarvoor veiligheids- en beveiligingsnormen nog in de kinderschoenen staan.
Onafhankelijke beoordelingen moeten onderzoeken hoe goed deze waarborgen werken en waar ze mogelijk tekortschieten, bijvoorbeeld:
Zijn waarborgen bij toegang volgens het "grey box"-principe bestand tegen adversariële tests (jailbreaks) en bieden ze voldoende bescherming tegen capaciteitstoename in domeinen met een hoog risico, zoals cyber en biologie? Bestrijken onze adversariële tests en red teaming de belangrijkste risico's?
Hoe werken agents tijdens geautoriseerde tests onder realistische operationele omstandigheden samen met cyberverdediging, zoals toegangscontroles, sandboxing en systemen voor detectie en respons? Welke verdedigingsmaatregelen voorkomen, detecteren of beheersen schadelijke handelingen, en waar schieten ze tekort?
Vertonen onze monitors voor misalignment cruciale tekortkomingen die bij interne of externe ingebruikname kunnen leiden tot controleverlies of ernstige misalignment? Hoe betrouwbaar is monitoring van chain-of-thought als bewijsbron voor veiligheid of alignment wanneer de capaciteiten van modellen toenemen?
Is passende monitoring toegepast bij alle relevante trainingen, evaluaties en vormen van ingebruikname, op een manier die niet eenvoudig kan worden uitgeschakeld?
Zijn de toegepaste waarborgen evenredig aan de capaciteiten?
Beoordeling van capaciteitsevaluaties voor de Preparedness-risicocategorieën (chemische en biologische risico's, cyberbeveiliging en zelfverbetering van AI) en van alignment-evaluaties voor risico's op misalignment
Ons Preparedness Framework vereist evaluaties van belangrijke grensverleggende risicogebieden. Wanneer drempels worden overschreden en evaluaties hun plafond bereiken, is het belangrijk de evaluaties van capaciteiten in Preparedness-risicogebieden en de alignment-evaluaties voor ernstige risico's op misalignment voortdurend te vernieuwen en de dekking en kwaliteit ervan te waarborgen.
Relevante vragen zijn onder meer:
Bestrijken evaluaties van Preparedness-risico's de definitie van de Preparedness-risicodrempel voldoende? Zijn de drempels voor deze evaluaties juist vastgesteld?
Worden evaluaties bijgewerkt wanneer modellen consequent de hoogste scores behalen, en meten de nieuwe tests daadwerkelijk geavanceerdere capaciteiten?
Bestrijken onze alignment-evaluaties ernstige risico's op misalignment voldoende, en welke belangrijke gedragingen of omstandigheden zien ze mogelijk over het hoofd?
Onafhankelijk onderzoek naar kritieke incidenten met misalignment
Onafhankelijk onderzoek kan waardevol zijn bij uiteenlopende kritieke incidenten rond AI-veiligheid. Hier richten we ons op misalignment van modellen, waaronder modellen die zonder toestemming handelen of aan toezicht ontsnappen. Dit kan zelfs zonder opzettelijk misbruik zwakke plekken in alignmentmethoden en waarborgen blootleggen.
In bepaalde omstandigheden, zoals bij het OpenAI Hugging Face-incident, kan het nuttig zijn een onafhankelijke externe partij in te schakelen voor onafhankelijk onderzoek naar incidenten met misalignment. Het is essentieel dat externe partijen die incidenten onderzoeken over de vereiste expertise beschikken, waaronder waar van toepassing deskundigheid op het gebied van cyberforensisch onderzoek en alignment, grootschalige analyse van chain-of-thought en voldoende personeel en middelen om het onderzoek tijdig uit te voeren. Incidentrespons kan toegang tot gevoelige interne gegevens en gegevens van externe partijen vereisen. Daardoor kunnen sommige details te gevoelig zijn om te publiceren of toegankelijk te maken. Bevindingen uit onafhankelijk onderzoek kunnen ook bijdragen aan de veiligheidsonderbouwing van een model door bewijs te leveren voor de beoordeling van claims over de alignment en de doeltreffendheid van maatregelen om eerder waargenomen misalignment te verhelpen.
Bij incidenten met misalignment geven we prioriteit aan onafhankelijke beoordelingen van:
Welk modelgedrag of welke problemen met misalignment deden zich tijdens het incident voor, en wat waren de belangrijkste oorzaken?
Zouden waarborgen en herstelmaatregelen vergelijkbare incidenten in de toekomst doeltreffend beperken?
Duidelijk afgebakende en gezamenlijk overeengekomen claims voor beoordeling: Beoordelingen moeten beginnen met een gezamenlijk overeengekomen reikwijdte, gevolgd door duidelijk omschreven veiligheidsclaims die vóór aanvang van de beoordelingsactiviteiten worden geregistreerd. Externe partijen en labs moeten verduidelijken of het gaat om claims die het beoordeelde bedrijf ter beoordeling wil voorleggen, of om claims die de externe beoordelaar onafhankelijk wil beoordelen en waaraan het lab ermee instemt te worden getoetst. Er zijn veel redenen waarom bepaalde claims buiten de reikwijdte kunnen vallen, waaronder het feit dat externe partijen geen toegang tot gegevens kunnen krijgen, de beoordelaar onvoldoende deskundig is of er bij een urgente beoordeling redelijke tijdsbeperkingen gelden. Labs en beoordelaars moeten een proces vaststellen voor de behandeling van aanzienlijke risico's die buiten de oorspronkelijke reikwijdte worden vastgesteld, waaronder de vraag of nader onderzoek gerechtvaardigd is. De conclusies moeten duidelijk maken wat binnen de gezamenlijk overeengekomen reikwijdte wel en niet is beoordeeld.
Evenredige toegang: Beoordelaars moeten, waar mogelijk en binnen de grenzen van wettelijke, beveiligings- en intellectuele-eigendomsbeperkingen, evenredige toegang krijgen om de overeengekomen claims te beoordelen. Wanneer rechtstreekse toegang onpraktisch of onmogelijk is, kunnen beoordelaars samenwerken met een aangewezen vertegenwoordiger van een bedrijf of indirecte dan wel privacybeschermende toegangsmechanismen verkennen om de onderliggende informatie te beschermen.
Transparante methodologie en normen: Beoordelaars moeten hun methoden, beoordelingscriteria en onzekerheden toelichten en waar mogelijk gebruikmaken van bestaande normen. Waar nog geen normen bestaan, moeten zij de gebruikte criteria duidelijk onderbouwen. Rapporten moeten rechtstreekse bevindingen onderscheiden van interpretaties, onzekerheid toelichten en duidelijk maken welke conclusies door het bewijs worden ondersteund.
Deskundigheid en onafhankelijkheid: Beoordelaars moeten relevante technische deskundigheid aantonen en organisatorische en individuele belangenconflicten vaststellen, bekendmaken en aanpakken, waaronder financiële prikkels, relaties met ontwikkelaars en eerdere betrokkenheid bij het beoordeelde werk. Waarborgen moeten voorkomen dat commerciële druk en beloningsafspraken de bevindingen beïnvloeden. Deze kunnen onder meer bestaan uit verschoning of passende uitsluitingstermijnen.
Beveiliging en vertrouwelijkheid: Beoordelaars moeten informatiebeveiligingspraktijken en afdwingbare vertrouwelijkheidswaarborgen voor hun personeel aantonen, in verhouding tot de gevoeligheid van de systemen en informatie waartoe zij toegang krijgen. Deze waarborgen moeten intellectueel eigendom, gevoelige informatie en beoordelingsdossiers omvatten. Wanneer beoordelaars in hun eigen omgevingen niet aan de beveiligingseisen kunnen voldoen, of de geraadpleegde gegevens bijzonder gevoelig zijn, kan toegang via door het bedrijf beheerde apparaten of op bedrijfslocaties passend zijn.
Praktisch bruikbare bevindingen en tijd voor herstel: Beoordelingen moeten specifieke tekortkomingen aanwijzen en labs voldoende details bieden om deze te verhelpen. Waar passend moeten labs vóór publicatie een redelijke termijn krijgen om problemen te verhelpen. Waar relevant moeten rapporten ook lessen voor ontwikkelaars, exploitanten en verdedigers van agents toelichten, met praktische aanbevelingen voor de uitvoering.
Verantwoorde publicatiepraktijken: Beoordelingsrapporten moeten op bewijs zijn gebaseerd en zo open mogelijk worden gedeeld, met bescherming van gevoelige en vertrouwelijke informatie. Wanneer volledige openbaarmaking niet mogelijk is, kan vertrouwelijke rapportage aan bevoegde toezichthoudende organen, zoals bestuursorganen of raden van bestuur, de verantwoordingsplicht ondersteunen. Er moeten principiële waarborgen en beleidsregels voor anonimisering gelden, evenals duidelijke verwachtingen over feedback en de correctie van onjuistheden, om het evenwicht tussen onafhankelijkheid en vertrouwelijkheid te bewaren. Beoordelaars moeten redactioneel onafhankelijk blijven en er tegelijk voor zorgen dat de vertrouwelijkheid en bescherming van intellectueel eigendom worden gehandhaafd. Beoordelaars moeten duidelijke regels voor anonimisering hanteren, zodat labs kunnen verzoeken gevoelige informatie weg te laten. Beoordelaars kunnen daarbij aangeven waar inhoudelijke weglatingen zijn aangebracht en welke gevolgen die hebben voor hun beoordelingsrapport.
We zetten ons in voor de ondersteuning van onafhankelijke beoordelaars en de ontwikkeling van duidelijkere, gedeelde internationale normen voor effectieve beoordelingen door externe partijen, zowel via toekomstige wetgeving als via private governance-instellingen. Hoewel het ecosysteem voor onafhankelijke evaluaties nog groeit, helpen we die groei te bevorderen door een diverse gemeenschap van onafhankelijke beoordelaars met diepgaande expertise in grensverleggende veiligheidsvraagstukken te ondersteunen en ermee samen te werken. Geen enkele externe partij kan of moet alle urgente grensverleggende veiligheidsvraagstukken volledig bestrijken. We zullen doelbewust en weloverwogen onze capaciteit uitbreiden en het groeiende ecosysteem van externe partijen in staat stellen overeenstemming te bereiken over beste praktijken en principes. We bespreken met meerdere externe partijen voorstellen die aansluiten bij de bovenstaande prioriteitsgebieden.


