Egy összehangolt modelldesztillációs kampány megállítása
Nemrég azonosítottunk és megállítottunk egy összehangolt kampányt, amelynek célja a modelljeink védett érvelésének kinyerése volt. Az első ilyen tevékenységet július első hetében észleltük. Ez a tevékenység megfelel a rosszindulatú desztilláció jellemzőinek: egy modell kimeneteinek vagy érvelésének szisztematikus és engedély nélküli felhasználása egy másik modell betanításához, reprodukálásához vagy továbbfejlesztéséhez. A védett érvelés a modell belső feljegyzése a feladat megoldásának menetéről. Kinyerésével olyan információk tárulhatnak fel, amelyek a végső válaszból kimaradtak, és ez segíthet másoknak reprodukálni a modell képességeit.
Az elkövetők nem törték fel a titkosításunkat, nem törtek be adatbázisba, és nem jutottak közvetlen hozzáféréshez a tárolt felhasználói beszélgetésekhez. Ehelyett a modellel folytatott interakciókat manipulálták úgy, hogy a védett érvelés a kérést küldő fél számára látható formában jelenjen meg. Mindezt összehangoltan, nagy léptékben, a szolgáltatási feltételeinket megsértve tették. Az ilyen manipulációt lehetővé tevő sérülékenység nem csak az OpenAI modelljeit érinti. A Frontier Model Forum keretében megosztottuk az ezzel kapcsolatos információkat iparági partnereinkkel, hogy közösen erősítsük a rosszindulatú desztilláció elleni védelmet.
A közzététel előtt megvizsgáltuk a tevékenység kiterjedését és lehetséges hatásait, bevezettük saját védelmi intézkedéseinket, valamint megosztottuk eredményeinket kutatókkal és iparági partnerekkel, és kikértük visszajelzéseiket, hogy biztosítsuk az ilyen támadások elleni védelmet. A további védelmi intézkedések kidolgozása és a vizsgálat folytatódik. Úgy véljük, hogy az eddigi tapasztalataink megosztása segít a tágabb ökoszisztéma szereplőinek megerősíteni a védelmüket.
Megfigyeltük, hogy az elkövetők újszerű módszerekkel próbálták kinyerni a védett érvelést. Többek között az egyik beszélgetésből kimásolták a titkosított érvelést, majd egy másik beszélgetésben arra kérték a modellt, hogy fejtse vissza és írja le a rejtett érvelés tartalmát.
Független biztonsági kutatók(új ablakban nyílik meg) is felhívták a figyelmünket kapcsolódó, modellek közötti és a beszélgetések kontextusmegőrzését érintő sérülékenységekre, a felelős hibabejelentés elveit követve. Kivizsgáltuk a megállapításaikat, és megerősítettük, hogy az általuk azonosított támadási útvonalak valóban működnek. Munkájuk segített megérteni a támadások tágabb kategóriáját, és felgyorsította a védelmi intézkedések bevezetését.
A tevékenység július 1-jén kezdődött, kezdetben kis volumenben. Július 24-én és 25-én jelentős kiugrást észleltünk: több mint 4000 felhasználótól 16 000 olyan kérés1 érkezett, amely az érintett kinyerési mintát követte. A további vizsgálat egy több mint 15 000 felhasználóból álló csoportban azonosított kapcsolódó utasításmintákon alapuló tevékenységet, amelyet július 28-ra teljesen megállítottunk.
A tevékenység idővel változott, ami megerősíti, hogy a rosszindulatú desztilláció átfogóbb biztonsági kihívást jelent, és többrétegű, alkalmazkodóképes védelmet igényel.
Nem egyértelmű, hogy az érintett időszakban megfigyelt összes elkövető egyetlen szereplőhöz tartozott-e. A tevékenység egy központi részét azonban a Kimit fejlesztő Moonshot AI-hoz kötődő személyeknek tulajdonítjuk.
A rosszindulatú desztilláció biztonsági és nemzetbiztonsági kockázatokat jelent. A kinyert érvelés felhasználható egy másik modell betanítására anélkül, hogy megőriznék az eredeti modell felhasználóknak szánt kimeneteire alkalmazott védelmi intézkedéseket. Nagy léptékben a desztilláció a fejlett képességek átvitelét is felgyorsíthatja anélkül, hogy ugyanakkora biztonsági ráfordítást igényelne. Ezek az aggályok egyre súlyosabbá válnak, ahogy a modellek új képességekre tesznek szert a kettős felhasználású területeken.
Ez a kockázat nem csak az OpenAI-t érinti. Amint azt fentebb jeleztük, hasonló technikák más fejlett AI-rendszereket is érinthetnek. Ez tehát közös biztonsági kihívás, amely iparági szintű együttműködést igényel.
Ezt a közelmúltbeli desztillációs kampányt a fiókokkal szembeni szankciók, technikai védelmi intézkedések és a partnereinkkel való együttműködés révén szorítottuk vissza. Letiltottuk vagy korlátoztuk a csalárd tevékenységet folytató fiókokat, megerősítettük a regisztrációs és infrastrukturális ellenőrzéseket, és kiterjesztettük a kapcsolódó hálózatok megfigyelését.
Megerősítettük a rejtett érvelés védelmét a felhasználók, munkaterületek, szervezetek és modellcsaládok között is. Lezártunk egy olyan útvonalat, amely lehetővé tette, hogy aki már birtokában volt egy másik felhasználó titkosított érvelésének, azt újra beküldve visszanyerje a tartalmát. Emellett ellenőrzéseket vezettünk be az érvelést esetleg felfedő, folyamatosan továbbított kimenetek észlelésére és visszatartására. Amikor a kapcsolódó tevékenység külső szolgáltatókhoz helyeződött át, együttműködtünk velük az érintett fiókok azonosításában és működésük megakadályozásában.
Végül a Frontier Model Forum és a megfelelő kormányzati információmegosztási csatornák útján megosztottuk a releváns megállapításokat, hogy az élvonalbeli modellek más fejlesztői és a közszférában működő partnereink is kereshessenek hasonló tevékenységeket, és megerősíthessék saját védelmüket. Hasonló kockázatokkal szembesülhetnek azok a rendszerek, amelyek támogatják az érvelési adatok hordozhatóságát vagy ismételt beküldését.
Arra számítunk, hogy a rosszindulatú desztillációs kísérletek egyre kifinomultabbá válnak, ahogy az élvonalbeli modellek fejlődnek, és a támadók olcsóbb módszereket keresnek képességeik utánzására. Az ilyen tevékenységek elleni védekezés többrétegű intézkedéseket és folyamatos alkalmazkodást igényel.
Ez a munka még nem ért véget. A partnerek által üzemeltetett rendszereknek ugyanolyan védelemre van szükségük, mint a saját szolgáltatásainknak. Az eszközkimeneteken keresztüli támadások ellen pedig olyan védelem kell, amely nem csupán a szokásos látható szöveget vizsgálja. Tovább fejlesztjük az eszközök védelmét, bővítjük az osztályozók által lefedett esetek körét, javítjuk a modellek elutasítási képességét, és felhőszolgáltató partnereinknél is bevezetjük a megfelelő védelmi intézkedéseket.
Fellépésünk továbbra is három területre összpontosít: a kinyerés elleni erősebb technikai védelemre, az összehangolt kampányok hatékonyabb észlelésére és szankcionálására, valamint a fenyegetésekkel kapcsolatos információk szélesebb körű megosztására az iparági és kormányzati szereplők között.

