Pāriet uz galveno saturu
OpenAI

2026. gada 30. septembris

Aizsardzība

Koordinētas modeļu destilācijas kampaņas apturēšana

Notiek ielāde…

Nesen atklājām un apturējām koordinētu kampaņu, kuras mērķis bija iegūt mūsu modeļu aizsargātos spriestspējas procesa pierakstus. Pirmās darbības novērojām jūlija pirmajā nedēļā. Šīs darbības atbilst ļaunprātīgai destilācijai — viena modeļa izvades vai spriestspējas procesa pierakstu sistemātiskai un neatļautai izmantošanai, lai palīdzētu apmācīt, atveidot vai uzlabot citu modeli. Aizsargātie spriestspējas procesa pieraksti ir modeļa iekšējie pieraksti par uzdevuma risināšanu. To izguve var atklāt galīgajā atbildē neiekļautu informāciju un palīdzēt citiem atveidot modeļa spējas.

Kampaņas īstenotāji neuzlauza mūsu šifrēšanu, neiekļuva datubāzē un neieguva tiešu piekļuvi glabātajām lietotāju sarunām. Tā vietā viņi manipulēja ar mijiedarbību ar modeļiem, lai aizsargātos spriestspējas procesa pierakstus varētu atveidot pieprasītājam redzamā formā. Tas tika darīts koordinēti un plašā mērogā, pārkāpjot mūsu pakalpojumu sniegšanas noteikumus. Šāda manipulācija izmanto ievainojamību, kas nav raksturīga tikai OpenAI modeļiem. Ar Frontier Model Forum starpniecību esam dalījušies informācijā par to ar nozares partneriem, lai stiprinātu kopīgo aizsardzību pret ļaunprātīgu destilāciju.

Pirms šīs informācijas publicēšanas izpētījām darbību apjomu un iespējamo ietekmi, ieviesām savus riska mazināšanas pasākumus, kā arī dalījāmies informācijā ar pētniekiem un nozares partneriem un uzklausījām viņu atsauksmes, lai nodrošinātu aizsardzību pret šāda veida uzbrukumiem. Izmeklēšana un papildu riska mazināšanas pasākumu ieviešana turpinās. Uzskatām, ka, jau tagad daloties ar uzzināto, palīdzēsim plašākai ekosistēmai stiprināt aizsardzību.

Ko mēs novērojām

Novērojām, ka kampaņas īstenotāji mēģina iegūt aizsargātos spriestspējas procesa pierakstus jaunos veidos, tostarp kopējot šifrētus pierakstus no vienas sarunas un lūdzot modelim citā sarunā atšifrēt un pārrakstīt to slēpto saturu.

Arī neatkarīgi drošības pētnieki⁠(atveras jaunā logā), ievērojot atbildīgas ziņošanas principus, pievērsa mūsu uzmanību saistītām ievainojamībām starp modeļiem un sarunu konteksta saspiešanā. Izpētījām viņu atklājumus un apstiprinājām, ka identificētie uzbrukumu veidi patiešām ir īstenojami. Viņu darbs palīdzēja mums izprast plašāku šādu uzbrukumu kategoriju un ātrāk ieviest riska mazināšanas pasākumus.

Darbības sākās 1. jūlijā un sākotnēji bija nelielā apjomā, līdz 24. un 25. jūlijā novērojām strauju aktivitātes pieaugumu: vairāk nekā 4000 lietotāju veica 16 000 pieprasījumu1, izmantojot attiecīgo izguves shēmu. Turpmākajā izmeklēšanā atklājām saistītas darbības ar līdzīgām uzvedņu shēmām vairāk nekā 15 000 lietotāju kopā. Līdz 28. jūlijam šīs darbības pilnībā apturējām.

Laika gaitā darbības mainījās, vēlreiz apliecinot, ka ļaunprātīga destilācija ir plašāka drošības problēma, kurai nepieciešama daudzslāņaina, pielāgojama aizsardzība.

Mūsu vērtējums par iesaistītajām personām

Nav skaidrs, vai visi kampaņas īstenotāji, kurus novērojām attiecīgajā laikposmā, darbojās vienas puses uzdevumā. Tomēr galveno darbību kopumu attiecinām uz personām, kas saistītas ar Kimi izstrādātāju Moonshot AI.

Kāpēc tas ir svarīgi

Ļaunprātīga destilācija rada riskus gan drošumam, gan nacionālajai drošībai. Iegūtos spriestspējas procesa pierakstus varētu izmantot cita modeļa apmācīšanai, nesaglabājot aizsargmehānismus, kas piemēroti sākotnējā modeļa lietotājiem paredzētajai izvadei. Plašā mērogā destilācija var arī paātrināt attīstītu spēju pārnesi, neprasot līdzvērtīgus ieguldījumus drošumā. Šīs bažas pieaug, modeļiem iegūstot spējas divējāda lietojuma jomās.

Šis risks neskar tikai OpenAI. Kā minēts iepriekš, līdzīgas metodes var ietekmēt arī citas attīstītas mākslīgā intelekta sistēmas. Tādējādi tā ir kopīga drošības problēma, kuras risināšanai nepieciešama koordinācija visā nozarē.

Kā mēs reaģējām

Šo neseno destilācijas kampaņu ierobežojām, apvienojot sankcijas pret kontiem, tehniskus kontroles pasākumus un koordināciju ar partneriem. Bloķējām vai ierobežojām krāpnieciskos kontus, pastiprinājām reģistrācijas un infrastruktūras kontroles pasākumus un paplašinājām saistīto tīklu uzraudzību.

Pastiprinājām arī slēpto spriestspējas procesa pierakstu aizsardzību visiem lietotājiem, darbvietām, organizācijām un modeļu saimēm. Novērsām iespēju personai, kuras rīcībā jau bija cita lietotāja šifrētie spriestspējas procesa pieraksti, tos atkārtoti iesniegt un atgūt to saturu. Pievienojām arī pārbaudes, lai atklātu un aizturētu straumētu izvadi, kas varētu atklāt šos pierakstus. Kad saistītās darbības pārcēlās uz trešo pušu pakalpojumiem, sadarbojāmies ar to sniedzējiem, lai identificētu iesaistītos kontus un apturētu to darbību.

Visbeidzot, ar Frontier Model Forum un atbilstošu valsts iestāžu informācijas apmaiņas kanālu starpniecību dalījāmies būtiskajos atklājumos, lai citi robežšķirtnes modeļu izstrādātāji un publiskā sektora partneri varētu meklēt līdzīgas darbības un stiprināt savu aizsardzību. Ar līdzīgiem riskiem var saskarties sistēmas, kas ļauj pārnest vai atkārtoti izmantot spriestspējas procesa artefaktus.

Turpmākie soļi

Sagaidām, ka ļaunprātīgas destilācijas mēģinājumi kļūs arvien izsmalcinātāki, robežšķirtnes modeļiem pilnveidojoties un uzbrucējiem meklējot lētākus veidus, kā atdarināt to spējas. Lai aizsargātos pret šādām darbībām, nepieciešami daudzslāņaini kontroles pasākumi un pastāvīga pielāgošanās.

Šis darbs vēl nav pabeigts. Partneru mitinātiem risinājumiem nepieciešama tāda pati aizsardzība kā mūsu pašu pakalpojumiem, savukārt aizsardzībai pret uzbrukumiem, kuros izmanto rīku izvadi, jāpārbauda ne tikai parastais redzamais teksts. Turpinām uzlabot rīku aizsardzību, paplašināt klasifikatoru tvērumu, pilnveidot modeļu atteikumu mehānismus un ieviest attiecīgos kontroles pasākumus mākoņpakalpojumu partneru vidē.

Mūsu rīcība arī turpmāk būs vērsta uz trim jomām: spēcīgāku tehnisko aizsardzību pret izguvi, labāku koordinētu kampaņu atklāšanu un apkarošanu, kā arī ciešāku informācijas apmaiņu par apdraudējumiem starp nozari un valsts iestādēm.

Autors

OpenAI

Zemsvītras piezīmes

  1. 1

    Šie skaitļi raksturo izguves mēģinājumus, nevis obligāti veiksmīgu izguvi.