Stop for en koordineret kampagne for modeldestillation
Vi har for nylig identificeret og stoppet en koordineret kampagne, der havde til formål at udtrække beskyttet ræsonnering fra vores modeller. Den første observerede aktivitet fandt sted i den første uge af juli. Denne aktivitet stemmer overens med ondsindet destillation: systematisk og uautoriseret brug af én models output eller ræsonnering til at træne, genskabe eller forbedre en anden model. Beskyttet ræsonnering er modellens interne optegnelser over arbejdet med en opgave. Udtræk af disse kan afsløre oplysninger, der er udeladt fra det endelige svar, og hjælpe andre med at genskabe modellens evner.
De ansvarlige brød ikke vores kryptering, kompromitterede ikke en database og fik ikke direkte adgang til gemte brugersamtaler. I stedet manipulerede de interaktioner med modellerne, så beskyttet ræsonnering kunne gengives i former, der var synlige for den, der sendte anmodningen. Det skete koordineret og i stor skala og var i strid med vores tjenestevilkår. Denne manipulation udnytter en sårbarhed, der ikke er unik for OpenAI's modeller. Vi har delt oplysninger om den med branchepartnere gennem Frontier Model Forum for at styrke det fælles forsvar mod ondsindet destillation.
Inden offentliggørelsen undersøgte vi omfanget og de potentielle konsekvenser, indførte vores egne afværgeforanstaltninger og delte oplysninger med forskere og branchepartnere, som gav os feedback, for at sikre, at der er beskyttelse mod denne type angreb. Arbejdet med yderligere afværgeforanstaltninger og undersøgelser fortsætter. Vi mener, at vi ved at dele vores viden nu kan hjælpe det bredere økosystem med at styrke sit forsvar.
Vi så forsøg på at udtrække beskyttet ræsonnering på nye måder, blandt andet ved at kopiere krypteret ræsonnering fra én samtale og bede en model i en anden samtale om at dekryptere og transskribere den skjulte ræsonnering.
Uafhængige sikkerhedsforskere(åbner i et nyt vindue) gjorde os også opmærksomme på beslægtede sårbarheder på tværs af modeller og i komprimering af samtaler gennem ansvarlig indberetning. Vi undersøgte deres resultater og bekræftede, at de angrebsveje, de havde identificeret, var reelle. Deres arbejde hjalp os med at forstå den bredere kategori af angreb og fremskynde afværgeforanstaltningerne.
Aktiviteten begyndte den 1. juli, først i begrænset omfang. Den 24. og 25. juli observerede vi kraftige stigninger med 16.000 anmodninger1 fra over 4.000 brugere, som anvendte et relevant mønster til udtræk. Yderligere undersøgelser afdækkede aktivitet med beslægtede promptmønstre blandt en gruppe på over 15.000 brugere. Vi havde stoppet denne aktivitet fuldstændigt den 28. juli.
Aktiviteten udviklede sig over tid. Det understreger, at ondsindet destillation er en bredere sikkerhedsudfordring, som kræver et forsvar i flere lag, der løbende tilpasses.
Det er uklart, om alle de personer, vi observerede i den pågældende periode, handlede på vegne af én og samme aktør. Vi vurderer dog, at en central del af aktiviteten kan tilskrives personer med tilknytning til Moonshot AI, som står bag Kimi.
Ondsindet destillation udgør risici for både sikkerheden generelt og den nationale sikkerhed. Udtrukket ræsonnering kan bruges til at træne en anden model uden at bevare de sikkerhedsforanstaltninger, der gælder for den oprindelige models output til brugerne. Destillation i stor skala kan også fremskynde overførslen af avancerede evner uden at kræve samme investering i sikkerhed. Disse bekymringer vokser, efterhånden som modeller får evner inden for områder med både civile og militære anvendelser.
Denne risiko er ikke unik for OpenAI. Som nævnt ovenfor kan lignende teknikker ramme andre avancerede AI-systemer. Det gør dette til en fælles sikkerhedsudfordring, som kræver koordinering på tværs af branchen.
Vi imødegik denne seneste destillationskampagne med en kombination af indgreb mod konti, tekniske kontrolforanstaltninger og koordinering med partnere. Vi blokerede eller begrænsede konti, der blev brugt til svindel, styrkede kontrollen ved oprettelse af konti og i infrastrukturen og udvidede overvågningen af beslægtede netværk.
Vi styrkede også beskyttelsen af skjult ræsonnering på tværs af brugere, arbejdsområder, organisationer og modelfamilier. Vi lukkede en angrebsvej, som gjorde det muligt for nogen, der allerede var i besiddelse af en anden brugers krypterede ræsonnering, at genindsende den og genskabe indholdet. Vi tilføjede også kontroller, som opdager og tilbageholder streamet output, der kan afsløre ræsonnering. Da beslægtet aktivitet flyttede til tredjepartstjenester, samarbejdede vi med udbyderne om at identificere og gribe ind over for de involverede konti.
Endelig delte vi relevante resultater gennem Frontier Model Forum og de relevante myndighedskanaler til informationsdeling, så andre udviklere af banebrydende modeller og partnere i den offentlige sektor kunne lede efter lignende aktivitet og styrke deres eget forsvar. Systemer, der understøtter ræsonneringsartefakter, som kan overføres eller genafspilles, kan være udsat for beslægtede risici.
Vi forventer, at forsøg på ondsindet destillation bliver mere sofistikerede, efterhånden som banebrydende modeller forbedres, og aktører søger billigere måder at efterligne deres evner på. Et forsvar mod denne aktivitet kræver kontrolforanstaltninger i flere lag og løbende tilpasning.
Dette arbejde er ikke afsluttet. Løsninger, der hostes af partnere, har brug for samme beskyttelse som vores egne tjenester, og angreb via værktøjsoutput kræver beskyttelse, der undersøger mere end almindelig synlig tekst. Vi fortsætter med at forbedre beskyttelsen af værktøjer, klassifikatorernes dækning og modellernes afvisninger samt at udbrede relevante kontrolforanstaltninger til vores cloudpartnere.
Vores indsats vil fortsat fokusere på tre områder: stærkere teknisk beskyttelse mod udtræk, bedre opdagelse af og indgreb mod koordinerede kampagner samt tættere udveksling af trusselsoplysninger på tværs af branchen og myndighederne.

