Overslaan naar hoofdinhoud
OpenAI

30 september 2026

Beveiliging

Een gecoördineerde modeldistillatiecampagne verstoord

Bezig met laden...

We hebben onlangs een gecoördineerde campagne ontdekt en verstoord die erop gericht was beschermde redenering uit onze modellen te extraheren. De vroegste activiteit die we waarnamen, vond plaats in de eerste week van juli. Deze activiteit past bij kwaadwillige distillatie: het systematisch en zonder toestemming gebruiken van de uitvoer of redenering van het ene model om een ander model te helpen trainen, reproduceren of verbeteren. Beschermde redenering is de interne vastlegging van hoe een model een taak doorloopt. Extractie hiervan kan informatie onthullen die niet in het uiteindelijke antwoord is opgenomen en anderen helpen de capaciteiten van het model te reproduceren.

De uitvoerders hebben onze versleuteling niet gekraakt, geen database gecompromitteerd en geen directe toegang verkregen tot opgeslagen gebruikersgesprekken. In plaats daarvan manipuleerden ze interacties met modellen, zodat beschermde redenering kon worden gereproduceerd in vormen die zichtbaar waren voor de aanvrager. Dit gebeurde gecoördineerd en op grote schaal, in strijd met onze gebruiksvoorwaarden. De kwetsbaarheid die deze manipulatie mogelijk maakt, is niet uniek voor de modellen van OpenAI. We hebben hierover informatie gedeeld met partners uit de sector via het Frontier Model Forum om de gezamenlijke verdediging tegen kwaadwillige distillatie te versterken.

Voorafgaand aan deze publicatie hebben we de omvang en mogelijke impact onderzocht, zelf beschermingsmaatregelen ingevoerd en informatie gedeeld met onderzoekers en partners uit de sector. Ook hebben we hun feedback meegenomen om te zorgen dat er bescherming is tegen dit type aanval. We blijven werken aan aanvullende beschermingsmaatregelen en verder onderzoek. We denken dat we het bredere ecosysteem kunnen helpen zijn verdediging te versterken door nu te delen wat we hebben geleerd.

Wat we hebben waargenomen

We zagen dat uitvoerders op nieuwe manieren probeerden beschermde redenering te extraheren. Zo kopieerden ze versleutelde redenering uit het ene gesprek en vroegen ze een model in een ander gesprek om de verborgen redenering te ontsleutelen en uit te schrijven.

Ook onafhankelijke beveiligingsonderzoekers⁠(opent in een nieuw venster) hebben via verantwoorde openbaarmaking verwante kwetsbaarheden onder onze aandacht gebracht, waarbij meerdere modellen of compaction van gesprekken betrokken waren. We hebben hun bevindingen onderzocht en bevestigd dat de aanvalsroutes die zij hadden geïdentificeerd daadwerkelijk bestonden. Hun werk hielp ons deze bredere categorie aanvallen beter te begrijpen en sneller beschermingsmaatregelen te treffen.

De activiteit begon op 1 juli, aanvankelijk op kleine schaal. Op 24 en 25 juli zagen we grote pieken: 16.000 verzoeken1 van meer dan 4.000 gebruikers met een extractiepatroon dat verband hield met deze activiteit. Bij nader onderzoek vonden we activiteit met verwante promptpatronen binnen een cluster van meer dan 15.000 gebruikers. Uiterlijk op 28 juli hadden we deze activiteit volledig verstoord.

De activiteit veranderde in de loop van de tijd. Dit onderstreept dat kwaadwillige distillatie een breder beveiligingsvraagstuk is dat vraagt om een gelaagde verdediging die zich blijft aanpassen.

Onze inschatting van wie hierachter zit

Het is onduidelijk of alle uitvoerders die we in de betreffende periode hebben waargenomen, namens één actor handelden. Wel schrijven we een kerncluster van de activiteit toe aan personen die verbonden zijn aan Moonshot AI, de ontwikkelaar van Kimi.

Waarom dit belangrijk is

Kwaadwillige distillatie brengt risico's met zich mee voor de veiligheid en de nationale veiligheid. Geëxtraheerde redenering zou kunnen worden gebruikt om een ander model te trainen zonder de waarborgen te behouden die gelden voor de uitvoer die gebruikers van het oorspronkelijke model te zien krijgen. Op grote schaal kan distillatie ook de overdracht van geavanceerde capaciteiten versnellen, zonder dat daarvoor dezelfde investeringen in veiligheid nodig zijn. Deze zorgen nemen toe naarmate modellen meer capaciteiten krijgen op gebieden met zowel civiele als militaire toepassingen.

Dit risico is niet uniek voor OpenAI. Zoals hierboven vermeld, kunnen vergelijkbare technieken ook andere geavanceerde AI-systemen treffen. Daarmee is dit een gezamenlijk beveiligingsvraagstuk dat afstemming binnen de hele sector vereist.

Hoe we hebben gereageerd

We hebben deze recente distillatiecampagne tegengegaan met een combinatie van maatregelen tegen accounts, technische beveiliging en afstemming met partners. We hebben frauduleuze accounts geblokkeerd of beperkt, de controles bij registratie en binnen de infrastructuur aangescherpt en de monitoring op verwante netwerken uitgebreid.

Ook hebben we de bescherming van verborgen redenering versterkt tussen gebruikers, werkruimten, organisaties en modelfamilies. We hebben een route afgesloten waarmee iemand die al over de versleutelde redenering van een andere gebruiker beschikte, deze opnieuw kon aanbieden om de inhoud te achterhalen. Daarnaast hebben we controles toegevoegd om gestreamde uitvoer die redenering zou kunnen blootleggen, te detecteren en tegen te houden. Toen verwante activiteit via diensten van derden verliep, werkten we met die aanbieders samen om de betrokken accounts te identificeren en hun activiteit te verstoren.

Tot slot hebben we relevante bevindingen gedeeld via het Frontier Model Forum en de daarvoor bestemde kanalen voor informatie-uitwisseling met de overheid. Zo konden andere ontwikkelaars van grensverleggende modellen en partners in de publieke sector zoeken naar vergelijkbare activiteit en hun eigen verdediging versterken. Systemen die overdraagbare of opnieuw aan te bieden redeneringsartefacten ondersteunen, kunnen met verwante risico's te maken krijgen.

Hoe nu verder

We verwachten dat pogingen tot kwaadwillige distillatie geavanceerder worden naarmate grensverleggende modellen verbeteren en actoren zoeken naar goedkopere manieren om hun capaciteiten na te bootsen. Verdediging tegen deze activiteit vereist gelaagde beveiligingsmaatregelen en voortdurende aanpassing.

Dit werk is nog niet af. Implementaties die door partners worden gehost, hebben dezelfde bescherming nodig als onze eigen diensten. Aanvallen via tooluitvoer vereisen bescherming die meer onderzoekt dan gewone zichtbare tekst. We blijven de beveiliging van tools, de dekking van classificatiemodellen en het weigeringsgedrag van modellen verbeteren. Ook blijven we relevante beveiligingsmaatregelen bij onze cloudpartners doorvoeren.

Onze aanpak blijft gericht op drie gebieden: sterkere technische bescherming tegen extractie, betere detectie van en handhaving tegen gecoördineerde campagnes, en intensievere uitwisseling van dreigingsinformatie tussen de sector en de overheid.

Auteurs

OpenAI

Voetnoten

  1. 1

    Deze cijfers betreffen extractiepogingen, niet noodzakelijk geslaagde extracties.