Hopp til hovedinnhold
OpenAI

30. september 2026

Sikkerhet

Vi stanset en koordinert kampanje for modelldestillasjon

Laster inn …

Vi avdekket og stanset nylig en koordinert kampanje som hadde som mål å hente ut beskyttet resonnering fra modellene våre. Den tidligste aktiviteten ble observert i den første uken i juli. Denne aktiviteten er i tråd med det vi kaller ondsinnet destillasjon: systematisk og uautorisert bruk av én modells utdata eller resonnering for å bidra til å trene, gjenskape eller forbedre en annen modell. Beskyttet resonnering er modellens interne nedtegnelser under arbeidet med en oppgave. Å hente ut disse kan avsløre informasjon som er holdt tilbake fra det endelige svaret, og hjelpe andre med å gjenskape modellens evner.

De som sto bak, brøt ikke krypteringen vår, kompromitterte ingen database og fikk ikke direkte tilgang til lagrede brukersamtaler. I stedet manipulerte de samhandlingen med modellene slik at beskyttet resonnering kunne gjengis i former som var synlige for den som sendte forespørselen. Dette foregikk koordinert og i stor skala, i strid med bruksvilkårene våre. Denne manipulasjonen utnytter en sårbarhet som ikke er unik for OpenAIs modeller. Vi har delt informasjon om den med bransjepartnere gjennom Frontier Model Forum for å styrke det felles forsvaret mot ondsinnet destillasjon.

Før publisering undersøkte vi omfanget og de mulige konsekvensene, iverksatte egne mottiltak og delte informasjon med forskere og bransjepartnere. Vi innhentet også tilbakemeldinger fra dem for å sikre at beskyttelse mot denne typen angrep er på plass. Arbeidet med videre undersøkelser og flere mottiltak fortsetter. Vi mener at det å dele det vi har lært nå, vil hjelpe det bredere økosystemet med å styrke sitt forsvar.

Dette observerte vi

Vi så forsøk på å hente ut beskyttet resonnering på nye måter, blant annet ved å kopiere kryptert resonnering fra én samtale og be en modell i en annen samtale om å dekryptere og transkribere det skjulte resonneringsinnholdet.

Uavhengige sikkerhetsforskere⁠(åpnes i et nytt vindu) gjorde oss også oppmerksomme på beslektede sårbarheter på tvers av modeller og i komprimering av samtaler gjennom ansvarlig varsling. Vi undersøkte funnene deres og bekreftet at angrepsveiene de hadde identifisert, var reelle. Arbeidet deres hjalp oss med å forstå den bredere kategorien av angrep og få på plass mottiltak raskere.

Aktiviteten begynte 1. juli, først i liten skala. Den 24. og 25. juli observerte vi kraftige topper med til sammen 16 000 forespørsler1 fra over 4 000 brukere som benyttet et relevant mønster for uthenting. Videre undersøkelser avdekket aktivitet med beslektede promptmønstre i en klynge på over 15 000 brukere. Vi hadde stanset denne aktiviteten fullstendig innen 28. juli.

Aktiviteten utviklet seg over tid. Det understreker at ondsinnet destillasjon er en bredere sikkerhetsutfordring som krever et tilpasningsdyktig forsvar i flere lag.

Vår vurdering av hvem som sto bak

Det er uklart om alle vi observerte utføre denne aktiviteten i det aktuelle tidsrommet, handlet på vegne av én og samme aktør. Vi knytter imidlertid en sentral klynge av aktiviteten til personer med tilknytning til Moonshot AI, som utvikler Kimi.

Hvorfor dette er viktig

Ondsinnet destillasjon medfører risiko både for trygg bruk av KI og for nasjonal sikkerhet. Resonnering som er hentet ut, kan brukes til å trene en annen modell uten å bevare sikkerhetstiltakene som gjelder for den opprinnelige modellens utdata til brukerne. I stor skala kan destillasjon også fremskynde overføringen av avanserte evner uten å kreve tilsvarende investeringer i sikkerhet. Disse bekymringene øker etter hvert som modellene utvikler evner på områder med både sivile og militære bruksområder.

Denne risikoen er ikke unik for OpenAI. Som nevnt ovenfor kan lignende teknikker ramme andre avanserte KI-systemer. Dette gjør det til en felles sikkerhetsutfordring som krever koordinering på tvers av bransjen.

Slik håndterte vi det

Vi motvirket denne nylige destillasjonskampanjen gjennom en kombinasjon av sanksjoner mot kontoer, tekniske kontrolltiltak og koordinering med partnere. Vi utestengte eller begrenset kontoer brukt til svindel, styrket kontrollene ved registrering og i infrastrukturen og utvidet overvåkingen av tilknyttede nettverk.

Vi styrket også beskyttelsen av skjult resonnering på tvers av brukere, arbeidsområder, organisasjoner og modellfamilier. Vi stengte en angrepsvei som gjorde det mulig for noen som allerede hadde en annen brukers krypterte resonnering, å sende den inn på nytt og hente ut innholdet. Vi la også til kontroller for å oppdage og holde tilbake strømmede utdata som kunne eksponere resonnering. Da beslektet aktivitet gikk gjennom tredjepartstjenester, samarbeidet vi med leverandørene for å identifisere de involverte kontoene og stanse aktiviteten deres.

Til slutt delte vi relevante funn gjennom Frontier Model Forum og egnede offentlige kanaler for informasjonsdeling, slik at andre utviklere av banebrytende modeller og partnere i offentlig sektor kunne se etter lignende aktivitet og styrke sitt eget forsvar. Systemer som støtter resonneringsartefakter som kan flyttes eller spilles av på nytt, kan være utsatt for beslektede risikoer.

Veien videre

Vi forventer at forsøk på ondsinnet destillasjon vil bli mer sofistikerte etter hvert som banebrytende modeller blir bedre og aktører leter etter billigere måter å etterligne evnene deres på. Å forsvare seg mot denne aktiviteten krever kontrolltiltak i flere lag og kontinuerlig tilpasning.

Dette arbeidet er ikke ferdig. Løsninger som driftes av partnere, trenger samme beskyttelse som tjenester vi selv drifter. Angrep via verktøyutdata krever beskyttelsestiltak som undersøker mer enn vanlig, synlig tekst. Vi fortsetter å forbedre beskyttelsen av verktøy, klassifikatorenes dekning og modellenes evne til å avvise uønskede forespørsler, og å innføre relevante kontrolltiltak hos skypartnerne våre.

Vi vil fortsatt rette innsatsen mot tre områder: sterkere teknisk beskyttelse mot uthenting, bedre oppdagelse av og sanksjoner mot koordinerte kampanjer, og mer omfattende deling av trusselinformasjon på tvers av bransjen og myndighetene.

Forfatter

OpenAI

Fotnoter

  1. 1

    Disse tallene beskriver forsøk på uthenting, ikke nødvendigvis vellykkede uthentinger.