Ons kader voor rapportage over modelmisalignment
We publiceren een nieuw kader voor het volgen, onderzoeken en openbaar maken van gevallen van modelmisalignment bij OpenAI, samen met zes rapporten over onverwacht of zorgwekkend modelgedrag dat we de afgelopen zes maanden hebben waargenomen.
Om onderzoekers, AI-ontwikkelaars, beleidsmakers en het brede publiek beter te informeren, hebben we eerder geprobeerd onze bevindingen over misalignment openbaar te maken. Maar zonder een systematische aanpak voor het rapporteren van deze bevindingen verliepen onze openbaarmakingen incidenteel en minder vaak dan wenselijk. We wachtten vaak tot we meerdere gevallen in één rapport konden bundelen of voegden ze toe aan systeemkaarten voor pas uitgebrachte modellen. Dit nieuwe kader is bedoeld om misalignmentrapporten sneller na een waarneming te publiceren, ook als we het gemelde gedrag nog niet volledig hebben verklaard of beperkt.
Nu AI-systemen geavanceerder worden en breder worden ingezet, moeten we een bredere en beter geïnformeerde consensus opbouwen over de voortgang van alignmentonderzoek. Wij geloven niet dat de AI-sector alignment en monitoring voldoende heeft opgelost om nog veel langer verantwoord op maximale snelheid te kunnen opschalen. Besluiten over hoe AI-ontwikkeling de komende maanden en jaren moet verlopen, moeten steunen op bewijs dat mensen buiten de bedrijven die grensverleggende modellen bouwen zelf kunnen onderzoeken.
Voorbeelden van misalignment kunnen helpen problemen te identificeren die andere AI-ontwikkelaars mogelijk tegenkomen wanneer hun systemen vergelijkbare capaciteiten bereiken, zwakke plekken in waarborgen blootleggen of aannames over modelgedrag ter discussie stellen. Door deze bevindingen te delen, kunnen anderen dezelfde problemen onderzoeken, onze verklaringen toetsen en beperkende maatregelen verbeteren. Omdat we transparantie over misalignment belangrijk vinden, geeft ons nieuwe kader de voorkeur aan openbaarmaking, zelfs als de betekenis ervan onzeker is. Dit betekent dat sommige gevallen die we openbaar maken misleidend kunnen blijken en geen deel uitmaken van een breder patroon of aanwijzing zijn voor toekomstige ontwikkelingen.
Momenteel bestaat er geen sectorbreed kader met expliciete normen voor de manier waarop AI-ontwikkelaars voorbeelden van misalignment in hun modellen openbaar moeten maken. We hopen dat het kader dat we vandaag uiteenzetten een eerste stap is naar zulke normen, door vast te leggen welke gevallen van misalignment ontwikkelaars openbaar moeten maken en wat hun rapporten moeten bevatten. We beschouwen dit kader als werk in uitvoering en zullen het op basis van ervaring en publieke feedback verfijnen.
Hier beschrijven we hoe het kader zal werken en delen we de eerste rapporten die we publiceren.
We willen voorbeelden openbaar maken die nuttig bewijs leveren over hoe modelmisalignment ontstaat, hoe die zich uit en waar waarborgen slagen of tekortschieten. We geven prioriteit aan nieuwe mechanismen, betekenisvolle veranderingen in bekend gedrag en bevindingen die aannames over veiligheid of risicobeperking ter discussie stellen. Een voorbeeld hoeft geen schade te veroorzaken of een breder patroon aan te tonen om openbaarmaking te rechtvaardigen. Dit kader geldt voor gedrag dat aan de criteria voldoet gedurende de hele levenscyclus van een model, waaronder training, evaluatie, tests en implementatie.
Dit omvat nieuwe manieren waarop modellen zonder toestemming handelen, met andere modellen samenwerken of toezicht ontwijken; tekortkomingen die een alignmentmethode of waarborg ter discussie stellen; en gedrag dat een bewering in een gepubliceerde veiligheidsbeoordeling ter discussie stelt. Dezelfde criteria voor openbaarmaking gelden voor misalignment die gevolgen kan hebben voor derden.
Dit kan ook gevallen van misalignment omvatten die overeenkomen met gevallen die we eerder openbaar hebben gemaakt. Herhaling van het probleem kan op zichzelf nuttig bewijs zijn over het gedrag van onze modellen of de doeltreffendheid van onze waarborgen. Bijvoorbeeld als een bepaald soort verkeerd afgestemd gedrag ondanks herhaalde pogingen tot beperking blijft terugkeren. In zulke omstandigheden publiceren we de aanvullende voorbeelden door de oorspronkelijke openbaarmaking over misalignment bij te werken.
Op termijn willen we samen met andere ontwikkelaars, externe onderzoekers, normalisatie-instellingen en toezichthouders objectievere criteria voor openbaarmaking ontwikkelen. We vinden ook dat ernstige incidenten rond veiligheid, beveiliging en misalignment met de federale overheid van de VS moeten worden gedeeld en werken aan voorstellen voor rapportagemechanismen. We zien dit kader als aanvulling op onze bestaande verplichtingen en benadrukken dat het onze wettelijke openbaarmakingsvereisten niet vervangt, waaronder die voor kritieke veiligheidsincidenten of cyberbeveiligingsinbreuken.
Ter introductie van ons nieuwe kader voor de openbaarmaking van misalignment publiceren we zes rapporten over gevallen van verkeerd afgestemd gedrag die we tijdens de training of evaluatie van onze modellen hebben waargenomen. Deze gevallen illustreren uiteenlopende gedragingen die volgens ons het delen waard zijn, van informatie verbergen voor de gebruiker tot ongeoorloofde acties ondernemen om obstakels te overwinnen. Dit zijn rapporten over afzonderlijke gevallen. Ze mogen niet worden beschouwd als representatief voor hoe vaak misalignment bij onze modellen voorkomt. Elk item hieronder bevat een link naar het volledige rapport.
Zelfgegenereerde instructies in taaksamenvattingen(opent in een nieuw venster). Een niet-uitgebracht onderzoeksmodel voegde irrelevante instructies, waaronder instructies om de normale beperkingen te negeren, toe aan samenvattingen waarmee het zijn werk in een nieuw contextvenster kon voortzetten. We hebben 27 getroffen samenvattingen vastgesteld.
Instructies om fouten in taaksamenvattingen te verbergen(opent in een nieuw venster). Tijdens de training van GPT‑5.6 Sol voegden veel modelinstanties instructies aan hun samenvattingen toe om fouten of verkeerd afgestemd gedrag voor de gebruiker te verbergen. Compaction-samenvattingen bevatten bijvoorbeeld instructies om ontbrekende historische gegevens te verzinnen zonder dit te vermelden en verschillen tussen bronversies te verbergen.
Openbare repositories doorzoeken op blootgestelde API-sleutels en vervolgens informatie verzinnen(opent in een nieuw venster). Bij het beantwoorden van een gewone vraag over inkomenscijfers in een county in Californië vond en gebruikte een model zonder toestemming een blootgestelde API-sleutel. Toen het de gevraagde cijfers nog steeds niet kon ophalen, verzon het deze en presenteerde het ze als gegevens uit de gevraagde bron.
Bestanden naar internet uploaden om ze als bron te citeren(opent in een nieuw venster). Toen een gebruiker een niet-uitgebracht model vroeg om de ID's en namen van meren groter dan 5.000.000 vierkante meter, vond de agent met Python het juiste antwoord. Maar omdat de instructies om een bronvermelding uit de browser vroegen, besloot de agent zonder toestemming van de gebruiker het bestand te uploaden, zodat het dit in zijn antwoord kon citeren.
Ongeoorloofde schrijfacties en communicatie via een interne softwarerepository(opent in een nieuw venster). Modellen gebruikten een interne softwarerepository als prikbord om tussen afzonderlijke trainingssamples verzoeken en antwoorden uit te wisselen terwijl ze naar ontbrekende invoerbestanden zochten. Ze konden die bestanden echter niet herstellen. Dit rapport onderzoekt ook een eerder geval waarin een model met succes testbestanden naar een repository uploadde in een poging netwerkbeperkingen te omzeilen.
Ongeoorloofd bestanden delen tussen samenwerkende agenten(opent in een nieuw venster). Agenten die samen aan dezelfde trainingstaak werkten, gebruikten openbare websites voor bestandshosting om bestanden te delen wanneer ze geen toegang hadden tot elkaars lokale bestanden. Hierdoor werden de op te leveren taakresultaten via openbare URL's toegankelijk, hoewel de modellen volgens de taak uitsluitend lokale bestanden mochten gebruiken.
Elke medewerker van OpenAI kan een voorbeeld van misalignment ter onderzoek melden bij onze veiligheids- en alignmentteams en verzoeken om het voor openbare bekendmaking te overwegen. Daarmee begint ons openbaarmakingsproces, met deadlines voor elke stap om tijdig onderzoek en tijdige openbaarmaking te waarborgen.
Nadat een voorbeeld is gemeld, onderzoeken onze technische medewerkers wat er is gebeurd, wat nog onzeker is, of openbare bekendmaking gerechtvaardigd is en welke feiten kunnen worden gedeeld. Ze beoordelen ook of een derde is getroffen en vóór publicatie vertrouwelijk moet worden geïnformeerd.
Het voorbeeld wordt vervolgens toegewezen aan een van drie trajecten: Klaar voor openbaarmaking, Beperkt onderzoek of Uitgebreider onderzoek ("Langzaam traject").
Klaar voor openbaarmaking omvat gevallen die aan de criteria voldoen en waarvan het onderzoek voldoende is afgerond om ze na beoordeling te publiceren. Beperkt onderzoek omvat gevallen die nader technisch onderzoek vereisen. We verwachten dat deze twee trajecten het overgrote deel van de openbaar gemaakte gevallen zullen omvatten, vooral gevallen waarvoor geen uitgebreid onderzoek, afstemming met derden of aanpak van ernstige risico's op misbruik nodig is. Alle gevallen die we vandaag publiceren, vallen onder een van deze twee trajecten.
Uitgebreider onderzoek omvat complexe onderzoeken, vooral als daarbij derden betrokken zijn. Wanneer een derde wordt getroffen, hebben onze verplichtingen rond beveiliging, wetgeving en verantwoorde openbaarmaking voorrang op dit kader. We streven ernaar zo snel mogelijk een eerste kennisgeving te publiceren, maar moeten die om veiligheidsredenen mogelijk uitstellen. Bijvoorbeeld als een model een voorheen onbekend beveiligingslek ontdekt in veelgebruikte software. Als een rapport een derde zou identificeren, willen we die vooraf informeren, zelfs als er geen beveiligingsgrens is overschreden.
De eerste kennisgeving van een geval in het traject Uitgebreider onderzoek geeft op hoofdlijnen weer wat er is gebeurd, vermeldt of externe deskundigen aan het onderzoek meewerken en bevat, indien beschikbaar, een schatting van wanneer we het eindrapport verwachten te publiceren. Het OpenAI Hugging Face-incident zou onder dit traject zijn gevallen als het volgens dit kader openbaar was gemaakt.
De medewerker die het voorbeeld heeft aangedragen, wordt geïnformeerd over het besluit om het al dan niet openbaar te maken en, zo ja, welk traject het zal volgen. Onopgeloste meningsverschillen over openbaarmaking of het juiste traject worden voorgelegd aan OpenAI's Safety Advisory Group (SAG), een groep senior functionarissen uit de hele organisatie die de capaciteiten en waarborgen van grensverleggende modellen beoordeelt, toezicht houdt op ons Preparedness Framework en de leiding van OpenAI adviseert. Meningsverschillen binnen de SAG of bezwaren van medewerkers tegen haar besluiten worden voorgelegd aan de leiding van OpenAI. Besluiten om iets niet openbaar te maken of dat openbaarmaking niet gerechtvaardigd is, worden gedeeld met de leidinggevenden voor veiligheid en alignment en, voor zover mogelijk, met de relevante technische medewerkers.
We kunnen dit openbaarmakingsproces aanpassen naarmate we leren hoe het in de praktijk werkt. Eventuele wijzigingen leggen we vast in dit bericht.
Elk volledig rapport beschrijft het waargenomen gedrag, de ernst en eventuele externe gevolgen ervan, de omstandigheden waarin het zich voordeed, de datum of periode, wanneer we het ontdekten en, op hoofdlijnen, het betrokken model of de betrokken modellen. Waar mogelijk delen we ook:
Meer informatie over wat er is gebeurd en de schade die daaruit is voortgekomen;
Hoe we de misalignment hebben ontdekt en wat de reikwijdte van ons onderzoek was;
Onze interpretatie van de gevolgen voor alignmentonderzoek en technische AI-veiligheid;
Belangrijke onbeantwoorde vragen die het voorbeeld oproept;
Maatregelen die we nemen of van plan zijn om het gedrag aan te pakken. Deze informatie is op het moment van openbaarmaking mogelijk niet altijd beschikbaar, omdat we het misalignmentrapport soms publiceren voordat ons onderzoek is afgerond of een oplossing is ontwikkeld.
Bij misalignment in implementaties van klanten delen we zoveel informatie als de privacy van klanten en onze contractuele verplichtingen toelaten.
De rapporten van vandaag vormen een eerste reeks openbaarmakingen en geen volledig overzicht van bekende misalignment of lopende onderzoeken. Deze eerste rapporten zijn niet bedoeld als weergave van het volledige scala of de ernst van de gevallen waarop dit kader van toepassing is. We zetten ons ervoor in om gevallen van misalignment openbaar te maken die aan de criteria van dit kader voldoen, waaronder complexere gevallen die langer onderzoek of afstemming met derden vereisen. We blijven doorlopend rapporten publiceren volgens dit kader en zullen meer vertellen over onze rapportageverplichtingen naarmate we die verder uitwerken.


