Jäta vahele ja mine põhisisu juurde
OpenAI

30. september 2026

Turvalisus

Koordineeritud mudelidistilleerimise kampaania peatamine

Laadimine…

Tuvastasime ja peatasime hiljuti koordineeritud kampaania, mille eesmärk oli saada meie mudelitest kätte kaitstud arutlust. Esimesi märke sellest tegevusest täheldasime juuli esimesel nädalal. See tegevus vastab pahatahtlikule distilleerimisele: ühe mudeli väljundite või arutluse süstemaatiline ja loata kasutamine teise mudeli treenimiseks, taastootmiseks või täiustamiseks. Kaitstud arutlus on mudeli sisemine ülesande lahendamise käigu kirjeldus. Selle kättesaamine võib paljastada lõppvastusest välja jäetud teavet ja aidata teistel mudeli võimekust jäljendada.

Ründajad ei murdnud meie krüpteeringut, ei tunginud andmebaasi ega saanud otsest juurdepääsu salvestatud kasutajavestlustele. Selle asemel manipuleerisid nad mudeliga peetavate vestlustega, et kaitstud arutlus esitataks päringu tegijale nähtaval kujul. Nad tegid seda koordineeritult ja suures mahus, rikkudes meie teenusetingimusi. Sellist manipuleerimist võimaldav nõrkus ei ole omane üksnes OpenAI mudelitele. Oleme jaganud selle kohta teavet valdkonna partneritega Frontier Model Forumi kaudu, et tugevdada ühist kaitset pahatahtliku distilleerimise vastu.

Enne avaldamist uurisime tegevuse ulatust ja võimalikku mõju, rakendasime oma kaitsemeetmed ning jagasime teavet teadlaste ja valdkonna partneritega ja küsisime neilt tagasisidet, et tagada kaitse seda tüüpi rünnakute vastu. Täiendavate kaitsemeetmete rakendamine ja uurimine jätkuvad. Usume, et seni õpitu jagamine aitab tugevdada kaitset kogu ökosüsteemis.

Mida me täheldasime

Täheldasime, et ründajad püüdsid kaitstud arutlust kätte saada uudsetel viisidel. Muu hulgas kopeerisid nad ühest vestlusest krüpteeritud arutluse ning palusid teises vestluses mudelil peidetud arutluse dekrüpteerida ja selle sisu kirja panna.

Ka sõltumatud turbeuurijad⁠(avaneb uues aknas) juhtisid vastutustundliku avalikustamise korras meie tähelepanu sellega seotud mudelitevahelistele ja vestluste tihendamise turvanõrkustele. Uurisime nende leide ja kinnitasime, et tuvastatud ründeviisid olid tõepoolest võimalikud. Nende töö aitas meil mõista seda ründeklassi laiemalt ja kiirendada kaitsemeetmete rakendamist.

Tegevus algas 1. juulil ja oli esialgu väikesemahuline. 24. ja 25. juulil täheldasime aga järsku kasvu: üle 4000 kasutaja esitas 16 000 päringut1, milles kasutati vastavat teabe kättesaamise mustrit. Edasise uurimise käigus tuvastasime enam kui 15 000 kasutajast koosnevas rühmas seotud viibamustrite kasutamise. Peatasime selle tegevuse täielikult 28. juuliks.

Tegevus muutus aja jooksul, kinnitades, et pahatahtlik distilleerimine on laiem turbeprobleem, mis nõuab mitmekihilist ja kohanduvat kaitset.

Meie hinnang tegevuse taga olijatele

Pole selge, kas kõik ründajad, keda sel ajavahemikul täheldasime, tegutsesid ühe ja sama osapoole nimel. Siiski seostame üht keskset tegevuste rühma inimestega, kes on seotud Kimi arendaja Moonshot AI-ga.

Miks see oluline on

Pahatahtlik distilleerimine ohustab nii ohutust kui ka riiklikku julgeolekut. Kättesaadud arutlust võidakse kasutada teise mudeli treenimiseks, säilitamata kaitsemeetmeid, mida rakendatakse algse mudeli kasutajale nähtavate väljundite puhul. Ulatuslik distilleerimine võib kiirendada ka täiustatud võimekuse ülekandumist, ilma et ohutusse tuleks samaväärselt investeerida. Need ohud süvenevad, kui mudelite võimekus kahesuguse kasutusega valdkondades kasvab.

See risk ei puuduta üksnes OpenAI-d. Nagu eespool märgitud, võivad sarnased võtted mõjutada ka teisi täiustatud tehisintellektisüsteeme. Seega on tegemist ühise turbeprobleemiga, mis nõuab kogu valdkonna koordineeritud tegutsemist.

Kuidas me reageerisime

Piirasime seda hiljutist distilleerimiskampaaniat, ühendades kontode suhtes rakendatavad meetmed, tehnilised kontrollid ja koordineeritud koostöö partneritega. Keelasime või piirasime petturlike kontode kasutamist, tugevdasime registreerumise ja taristu kontrollimeetmeid ning laiendasime seotud võrgustike seiret.

Tugevdasime ka peidetud arutluse kaitset eri kasutajate, tööruumide, organisatsioonide ja mudeliperede vahel. Sulgesime võimaluse, mis lubas kellelgi, kelle valduses juba oli teise kasutaja krüpteeritud arutlus, selle uuesti mudelile esitada ja sisu kätte saada. Lisasime ka kontrollid, et tuvastada ja peatada voogedastatav väljund, mis võiks arutluse paljastada. Kui seotud tegevus liikus kolmandate osapoolte teenustesse, tegime nende pakkujatega koostööd, et tuvastada asjassepuutuvad kontod ja nende tegevus peatada.

Lisaks jagasime asjakohaseid leide Frontier Model Forumi ja sobivate riiklike teabevahetuskanalite kaudu, et teised tipptasemel mudelite arendajad ja avaliku sektori partnerid saaksid otsida sarnase tegevuse märke ning tugevdada oma kaitset. Sarnased riskid võivad ohustada süsteeme, mis toetavad ülekantavaid või uuesti esitatavaid arutluse artefakte.

Mis saab edasi

Eeldame, et pahatahtliku distilleerimise katsed muutuvad keerukamaks, kuna tipptasemel mudelid täiustuvad ja ründajad otsivad odavamaid viise nende võimekuse jäljendamiseks. Sellise tegevuse vastu kaitsmine nõuab mitmekihilisi kontrollimeetmeid ja pidevat kohanemist.

See töö ei ole veel lõppenud. Partnerite majutatud lahendused vajavad sama kaitset nagu meie enda teenused. Tööriistade väljundite kaudu toimuvate rünnakute tõrjumiseks on vaja kaitsemeetmeid, mis uurivad enamat kui tavalist nähtavat teksti. Jätkame tööriistade kaitse, klassifikaatorite katvuse ja mudelite keeldumiskäitumise täiustamist ning asjakohaste kontrollimeetmete juurutamist pilveteenuste partnerite juures.

Meie tegevus keskendub ka edaspidi kolmele valdkonnale: tugevam tehniline kaitse arutluse kättesaamise vastu, koordineeritud kampaaniate parem tuvastamine ja tõkestamine ning tihedam ohuteabe vahetamine ettevõtete ja riigiasutuste vahel.

Autor

OpenAI

Allmärkused

  1. 1

    Need arvud kajastavad teabe kättesaamise katseid, mitte tingimata õnnestunud juhtumeid.