Preskočite na glavno vsebino
OpenAI

30. september 2026

Sistemska zaščita

Prekinitev usklajene kampanje za destilacijo modelov

Nalaganje …

Pred kratkim smo odkrili in prekinili usklajeno kampanjo, katere cilj je bil iz naših modelov pridobiti zaščiteno sklepanje. Prve dejavnosti smo opazili v prvem tednu julija. Ta dejavnost ustreza zlonamerni destilaciji: sistematični in nepooblaščeni uporabi izhodnih podatkov ali sklepanja enega modela za pomoč pri učenju, poustvarjanju ali izboljševanju drugega modela. Zaščiteno sklepanje je notranji zapis modela o reševanju naloge. Njegovo pridobivanje lahko razkrije informacije, ki niso vključene v končni odgovor, in drugim pomaga poustvariti zmogljivosti modela.

Izvajalci niso zlomili našega šifriranja, vdrli v podatkovno zbirko ali pridobili neposrednega dostopa do shranjenih pogovorov uporabnikov. Namesto tega so manipulirali z interakcijami z modeli, da bi se zaščiteno sklepanje prikazalo v oblikah, vidnih pošiljatelju zahteve. To so počeli usklajeno in v velikem obsegu ter s tem kršili naše pogoje uporabe. Ranljivost, ki omogoča takšno manipulacijo, ni omejena na modele OpenAI. Informacije o njej smo prek organizacije Frontier Model Forum delili s partnerji v panogi, da bi okrepili skupno obrambo pred zlonamerno destilacijo.

Pred objavo smo preiskali obseg in morebitne posledice, uvedli lastne omilitvene ukrepe ter ugotovitve delili z raziskovalci in partnerji v panogi. Upoštevali smo njihove povratne informacije, da bi zagotovili zaščito pred tovrstnimi napadi. Preiskava in uvajanje dodatnih omilitvenih ukrepov se nadaljujeta. Prepričani smo, da bo deljenje dosedanjih ugotovitev širšemu ekosistemu pomagalo okrepiti obrambo.

Kaj smo opazili

Opazili smo, da so izvajalci poskušali pridobiti zaščiteno sklepanje na nove načine. Med drugim so kopirali šifrirano sklepanje iz enega pogovora in model v drugem pogovoru prosili, naj dešifrira in prepiše skrito vsebino sklepanja.

Neodvisni varnostni raziskovalci⁠(odpre se v novem oknu) so nas v okviru odgovornega razkritja opozorili tudi na sorodne ranljivosti pri interakcijah med modeli in kompaktiranju pogovorov. Preučili smo njihove ugotovitve in potrdili, da so bili ugotovljeni načini napada dejansko izvedljivi. Njihovo delo nam je pomagalo razumeti širšo skupino napadov in pospešiti uvedbo omilitvenih ukrepov.

Dejavnost se je začela 1. julija, sprva v majhnem obsegu. Nato smo 24. in 25. julija opazili močna porasta: več kot 4.000 uporabnikov je poslalo 16.000 zahtev1 z značilnim vzorcem za pridobivanje sklepanja. Z nadaljnjo preiskavo smo v skupini več kot 15.000 uporabnikov odkrili dejavnost s sorodnimi vzorci pozivov in jo do 28. julija v celoti prekinili.

Dejavnost se je sčasoma spreminjala, kar dodatno potrjuje, da je zlonamerna destilacija širši varnostni izziv, ki zahteva večplastno in prilagodljivo obrambo.

Komu pripisujemo dejavnost

Ni jasno, ali so vsi izvajalci, ki smo jih opazili v zadevnem obdobju, delovali v okviru istega akterja. Vendar osrednji sklop dejavnosti pripisujemo posameznikom, povezanim s podjetjem Moonshot AI, ki razvija Kimi.

Zakaj je to pomembno

Zlonamerna destilacija prinaša tveganja za varnost, tudi nacionalno. Pridobljeno sklepanje bi lahko uporabili za učenje drugega modela, ne da bi pri tem ohranili zaščitne ukrepe, ki veljajo za izhodne podatke izvornega modela, namenjene uporabnikom. Destilacija v velikem obsegu lahko tudi pospeši prenos naprednih zmogljivosti, ne da bi zahtevala enake naložbe v varnost. Te skrbi se povečujejo, ko modeli pridobivajo zmogljivosti na področjih z dvojno rabo.

To tveganje ni omejeno na OpenAI. Kot je navedeno zgoraj, lahko podobne tehnike prizadenejo tudi druge napredne sisteme umetne inteligence. Gre torej za skupen varnostni izziv, ki zahteva usklajevanje v celotni panogi.

Kako smo se odzvali

To nedavno kampanjo destilacije smo zajezili s kombinacijo ukrepov proti računom, tehničnih nadzornih ukrepov in usklajevanja s partnerji. Blokirali ali omejili smo goljufive račune, okrepili nadzor pri registraciji in na ravni infrastrukture ter razširili spremljanje povezanih omrežij.

Okrepili smo tudi zaščito skritega sklepanja med uporabniki, delovnimi prostori, organizacijami in družinami modelov. Onemogočili smo način, ki je nekomu, ki je že imel šifrirano sklepanje drugega uporabnika, omogočal, da ga znova predloži in pridobi njegovo vsebino. Dodali smo tudi preverjanja za zaznavanje in zadržanje pretočnih izhodnih podatkov, ki bi lahko razkrili sklepanje. Ko se je povezana dejavnost preselila na storitve tretjih ponudnikov, smo z njimi sodelovali pri prepoznavanju vpletenih računov in prekinitvi njihovega delovanja.

Nazadnje smo ustrezne ugotovitve delili prek organizacije Frontier Model Forum in primernih vladnih kanalov za izmenjavo informacij, da bi lahko drugi razvijalci prelomnih modelov in partnerji iz javnega sektorja poiskali podobno dejavnost ter okrepili lastno obrambo. Podobnim tveganjem so lahko izpostavljeni sistemi, ki podpirajo prenosljive zapise sklepanja ali njihovo ponovno uporabo.

Kaj sledi

Pričakujemo, da bodo poskusi zlonamerne destilacije postajali vse bolj izpopolnjeni, saj se prelomni modeli izboljšujejo, akterji pa iščejo cenejše načine za posnemanje njihovih zmogljivosti. Obramba pred to dejavnostjo zahteva večplastne nadzorne ukrepe in nenehno prilagajanje.

To delo še ni končano. Namestitve, ki gostujejo pri partnerjih, potrebujejo enako zaščito kot naše lastne storitve. Napadi prek izhodnih podatkov orodij pa zahtevajo zaščito, ki preverja več kot le običajno vidno besedilo. Še naprej izboljšujemo zaščito orodij, pokritost s klasifikatorji in zavračanje zahtev s strani modelov ter uvajamo ustrezne nadzorne ukrepe pri partnerjih za storitve v oblaku.

Naš odziv bo še naprej osredotočen na tri področja: močnejšo tehnično zaščito pred pridobivanjem sklepanja, boljše zaznavanje usklajenih kampanj in ukrepanje proti njim ter tesnejšo izmenjavo informacij o grožnjah med panogo in vladnimi organi.

Avtorji

OpenAI

Opombe

  1. 1

    Te številke se nanašajo na poskuse pridobivanja podatkov, ki niso bili nujno uspešni.