Vi stoppade en samordnad kampanj för modelldestillering
Vi identifierade och stoppade nyligen en samordnad kampanj som syftade till att extrahera skyddade resonemang från våra modeller. Den tidigaste aktiviteten observerades under den första veckan i juli. Aktiviteten stämmer överens med fientlig destillering: systematisk och otillåten användning av en modells utdata eller resonemang för att träna, återskapa eller förbättra en annan modell. Skyddade resonemang är modellens interna dokumentation av arbetet med en uppgift. Att extrahera dem kan avslöja information som inte ingår i det slutliga svaret och hjälpa andra att återskapa modellens förmågor.
De som utförde angreppen knäckte inte vår kryptering, gjorde inte intrång i någon databas och fick inte direkt tillgång till lagrade användarkonversationer. I stället manipulerade de interaktioner med modeller så att skyddade resonemang kunde återges i former som var synliga för den som skickade förfrågan. Detta skedde samordnat och i stor skala, i strid med våra användarvillkor. Sårbarheten som utnyttjades vid denna manipulation är inte unik för OpenAI:s modeller. Vi har delat information om den med branschpartner via Frontier Model Forum för att stärka det gemensamma skyddet mot fientlig destillering.
Före publiceringen undersökte vi omfattningen och den möjliga påverkan, införde egna skyddsåtgärder samt delade information med och tog emot synpunkter från forskare och branschpartner för att säkerställa att skydd mot denna typ av angrepp finns på plats. Arbetet med ytterligare skyddsåtgärder och undersökningar fortsätter. Vi tror att vi genom att dela våra lärdomar nu kan hjälpa det bredare ekosystemet att stärka sitt skydd.
Vi såg försök att extrahera skyddade resonemang på nya sätt, bland annat genom att kopiera krypterade resonemang från en konversation och be en modell i en annan konversation att dekryptera och skriva ut innehållet i de dolda resonemangen.
Oberoende säkerhetsforskare(öppnas i ett nytt fönster) uppmärksammade oss också på relaterade sårbarheter som rör interaktion mellan modeller och komprimering av konversationer, genom ansvarsfull rapportering. Vi undersökte deras resultat och bekräftade att de angreppsvägar som de hade identifierat faktiskt gick att utnyttja. Deras arbete hjälpte oss att förstå den bredare kategorin av angrepp och påskynda införandet av skyddsåtgärder.
Aktiviteten började den 1 juli, till en början i liten skala. Den 24 och 25 juli observerade vi kraftiga toppar med 16 000 förfrågningar1 från över 4 000 användare som använde ett relevant extraktionsmönster. Vidare undersökningar identifierade aktivitet med relaterade promptmönster i ett kluster med fler än 15 000 användare. Denna aktivitet hade vi helt stoppat den 28 juli.
Aktiviteten förändrades över tid, vilket understryker att fientlig destillering är en bredare säkerhetsutmaning som kräver anpassningsbara skydd i flera lager.
Det är oklart om alla som utförde angrepp under den aktuella perioden agerade för en och samma aktör. Vi bedömer dock att ett centralt kluster av aktiviteten kan tillskrivas personer med koppling till Moonshot AI, som utvecklar Kimi.
Fientlig destillering medför risker för såväl AI-säkerheten som den nationella säkerheten. Extraherade resonemang skulle kunna användas för att träna en annan modell utan att bevara de skyddsåtgärder som tillämpas på den ursprungliga modellens svar till användarna. I stor skala kan destillering också påskynda överföringen av avancerade förmågor utan att samma investeringar i säkerhet krävs. Dessa farhågor växer när modeller får förmågor inom områden med både civila och militära användningsområden.
Denna risk är inte unik för OpenAI. Som nämnts ovan kan liknande tekniker påverka andra avancerade AI-system. Detta gör det till en gemensam säkerhetsutmaning som kräver samordning inom hela branschen.
Vi motverkade den senaste destilleringskampanjen genom en kombination av åtgärder mot konton, tekniska kontroller och samordning med partner. Vi stängde av eller begränsade konton som användes i bedrägligt syfte, stärkte kontrollerna vid registrering och i infrastrukturen samt utökade övervakningen av relaterade nätverk.
Vi stärkte också skyddet för dolda resonemang mellan användare, arbetsytor, organisationer och modellfamiljer. Vi stängde en angreppsväg som gjorde det möjligt för någon som redan hade tillgång till en annan användares krypterade resonemang att skicka in dem på nytt och återskapa innehållet. Vi lade också till kontroller för att upptäcka och hålla tillbaka strömmade utdata som riskerar att röja resonemang. När relaterad aktivitet gick via tredjepartstjänster samarbetade vi med leverantörerna för att identifiera och stoppa de berörda kontona.
Slutligen delade vi relevanta resultat via Frontier Model Forum och lämpliga myndighetskanaler för informationsutbyte. På så sätt kunde andra utvecklare av banbrytande modeller och partner inom offentlig sektor söka efter liknande aktivitet och stärka sitt eget skydd. System som stöder resonemangsartefakter som kan flyttas mellan sammanhang eller skickas in på nytt kan utsättas för liknande risker.
Vi förväntar oss att försöken till fientlig destillering blir mer sofistikerade i takt med att banbrytande modeller förbättras och aktörer söker billigare sätt att efterlikna deras förmågor. Skydd mot denna aktivitet kräver kontroller i flera lager och kontinuerlig anpassning.
Detta arbete är inte avslutat. Driftsättningar hos partner behöver samma skydd som våra egna tjänster, och angrepp via verktygsutdata kräver skydd som granskar mer än vanlig synlig text. Vi fortsätter att förbättra skyddet för verktyg, klassificerarnas täckning och modellernas förmåga att avvisa otillåtna förfrågningar samt att införa relevanta kontroller hos våra molnpartner.
Våra insatser kommer fortsatt att fokusera på tre områden: starkare tekniska skydd mot extraktion, bättre upptäckt av och åtgärder mot samordnade kampanjer samt fördjupat utbyte av hotinformation mellan branschen och myndigheter.

