Udaremnienie skoordynowanej kampanii destylacji modeli
Niedawno wykryliśmy i udaremniliśmy skoordynowaną kampanię mającą na celu pozyskanie chronionych zapisów rozumowania z naszych modeli. Pierwsze zaobserwowane działania miały miejsce w pierwszym tygodniu lipca. Działania te odpowiadają nieuprawnionej destylacji: systematycznemu wykorzystywaniu wyników lub rozumowania jednego modelu bez zezwolenia do trenowania, odtwarzania lub ulepszania innego modelu. Chroniony zapis rozumowania to wewnętrzny zapis procesu, w którym model rozwiązuje zadanie. Jego pozyskanie może ujawnić informacje pominięte w końcowej odpowiedzi i pomóc innym odtworzyć możliwości modelu.
Sprawcy nie złamali naszych zabezpieczeń szyfrujących, nie włamali się do bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników. Zamiast tego manipulowali interakcjami z modelami, aby odtwarzać chronione zapisy rozumowania w formie widocznej dla osoby wysyłającej żądanie. Robili to w sposób skoordynowany i na dużą skalę, naruszając nasz regulamin świadczenia usług. Podatność na tę manipulację nie dotyczy wyłącznie modeli OpenAI. Udostępniliśmy informacje o niej partnerom branżowym za pośrednictwem Frontier Model Forum, aby wzmocnić wspólną ochronę przed nieuprawnioną destylacją.
Przed publikacją zbadaliśmy zakres i potencjalne skutki tych działań, wdrożyliśmy własne środki zaradcze, a także przekazaliśmy informacje badaczom i partnerom branżowym oraz zebraliśmy ich opinie, aby zapewnić ochronę przed tego typu atakami. Nadal prowadzimy prace nad dodatkowymi środkami zaradczymi i badamy sprawę. Uważamy, że udostępnienie już teraz zdobytej wiedzy pomoże całemu ekosystemowi wzmocnić zabezpieczenia.
Zaobserwowaliśmy próby pozyskania chronionych zapisów rozumowania nowymi metodami. Sprawcy między innymi kopiowali zaszyfrowany zapis rozumowania z jednej rozmowy i prosili model w innej rozmowie o odszyfrowanie i przepisanie ukrytej treści.
Niezależni badacze bezpieczeństwa(otwiera nowe okno) również zwrócili nam uwagę na powiązane podatności występujące przy interakcjach między modelami oraz przy kompaktowaniu rozmów, zgodnie z zasadami odpowiedzialnego zgłaszania podatności. Przeanalizowaliśmy ich ustalenia i potwierdziliśmy, że wskazane przez nich sposoby przeprowadzenia ataków rzeczywiście działały. Ich praca pomogła nam zrozumieć szerszą kategorię ataków i przyspieszyć wdrażanie środków zaradczych.
Działania rozpoczęły się 1 lipca i początkowo miały niewielką skalę. Gwałtowne wzrosty aktywności zaobserwowaliśmy 24 i 25 lipca: ponad 4000 użytkowników wysłało 16 000 żądań1 wykorzystujących określony schemat pozyskiwania zapisów rozumowania. Dalsza analiza ujawniła działania wykorzystujące powiązane schematy poleceń w grupie ponad 15 000 użytkowników. Do 28 lipca całkowicie je udaremniliśmy.
Działania te zmieniały się z czasem, co potwierdza, że nieuprawniona destylacja jest szerszym wyzwaniem dla bezpieczeństwa i wymaga wielowarstwowej ochrony dostosowywanej do zagrożeń.
Nie jest jasne, czy wszyscy sprawcy, których działania zaobserwowaliśmy w tym okresie, działali na rzecz jednego podmiotu. Jednak główną grupę tych działań przypisujemy osobom związanym z Moonshot AI, twórcą Kimi.
Nieuprawniona destylacja stwarza zagrożenia dla bezpieczeństwa, w tym bezpieczeństwa narodowego. Pozyskane zapisy rozumowania mogłyby posłużyć do trenowania innego modelu bez zachowania zabezpieczeń stosowanych w odpowiedziach oryginalnego modelu widocznych dla użytkowników. Destylacja prowadzona na dużą skalę może też przyspieszyć transfer zaawansowanych możliwości bez konieczności ponoszenia takich samych nakładów na bezpieczeństwo. Obawy te nasilają się w miarę, jak modele zyskują możliwości w dziedzinach podwójnego zastosowania.
Ryzyko to nie dotyczy wyłącznie OpenAI. Jak wskazaliśmy powyżej, podobne techniki mogą zagrażać innym zaawansowanym systemom AI. Jest to więc wspólne wyzwanie dla bezpieczeństwa, które wymaga koordynacji działań w całej branży.
Ograniczyliśmy tę niedawną kampanię destylacji, łącząc sankcje wobec kont, zabezpieczenia techniczne i koordynację działań z partnerami. Zablokowaliśmy lub ograniczyliśmy konta wykorzystywane do nadużyć, wzmocniliśmy zabezpieczenia rejestracji i infrastruktury oraz rozszerzyliśmy monitorowanie powiązanych sieci.
Wzmocniliśmy również ochronę ukrytych zapisów rozumowania między użytkownikami, obszarami roboczymi, organizacjami i rodzinami modeli. Zablokowaliśmy metodę, która pozwalała osobie posiadającej już zaszyfrowany zapis rozumowania innego użytkownika ponownie go przesłać i odzyskać jego treść. Dodaliśmy też mechanizmy wykrywania i wstrzymywania strumieniowanych odpowiedzi, które mogłyby ujawnić rozumowanie. Gdy powiązane działania przenosiły się do usług zewnętrznych, współpracowaliśmy z ich dostawcami, aby zidentyfikować wykorzystywane konta i uniemożliwić dalsze nadużycia.
Ponadto udostępniliśmy istotne ustalenia za pośrednictwem Frontier Model Forum i odpowiednich rządowych kanałów wymiany informacji, aby inni twórcy pionierskich modeli i partnerzy z sektora publicznego mogli wykrywać podobne działania i wzmacniać własne zabezpieczenia. Systemy obsługujące artefakty rozumowania, które można przenosić lub ponownie wykorzystywać, mogą być narażone na podobne zagrożenia.
Spodziewamy się, że próby nieuprawnionej destylacji będą coraz bardziej wyrafinowane w miarę doskonalenia pionierskich modeli i poszukiwania przez sprawców tańszych sposobów naśladowania ich możliwości. Ochrona przed tymi działaniami wymaga wielowarstwowych zabezpieczeń i ciągłego dostosowywania ich do zagrożeń.
Te prace jeszcze się nie zakończyły. Wdrożenia hostowane przez partnerów wymagają takich samych zabezpieczeń jak usługi świadczone bezpośrednio przez nas. Z kolei ataki wykorzystujące wyniki narzędzi wymagają zabezpieczeń, które analizują nie tylko zwykły, widoczny tekst. Nadal ulepszamy zabezpieczenia narzędzi, rozszerzamy zakres działania klasyfikatorów i doskonalimy mechanizmy odmowy w modelach, a także wdrażamy odpowiednie zabezpieczenia u partnerów chmurowych.
Nasze działania nadal będą skupiać się na trzech obszarach: silniejszych zabezpieczeniach technicznych przed pozyskiwaniem chronionych zapisów, lepszym wykrywaniu skoordynowanych kampanii i egzekwowaniu zasad wobec ich uczestników oraz szerszej wymianie informacji o zagrożeniach między branżą a instytucjami rządowymi.

