Koordinoidun mallien tislauskampanjan torjuminen
Havaitsimme hiljattain koordinoidun kampanjan, jonka tarkoituksena oli poimia malleistamme suojattua päättelyä, ja puutuimme siihen. Varhaisimmat havainnot toiminnasta ovat heinäkuun ensimmäiseltä viikolta. Toiminta vastaa vihamielistä tislausta: yhden mallin tuotoksia tai päättelyä käytetään järjestelmällisesti ja luvatta toisen mallin kouluttamiseen, jäljentämiseen tai parantamiseen. Suojattu päättely on mallin sisäinen kuvaus tehtävän ratkaisemisesta. Sen poimiminen voi paljastaa lopullisesta vastauksesta pois jätettyjä tietoja ja auttaa muita jäljentämään mallin kyvykkyyksiä.
Toimijat eivät murtaneet salaustamme, murtautuneet tietokantaan eivätkä päässeet suoraan käsiksi tallennettuihin käyttäjäkeskusteluihin. Sen sijaan he manipuloivat vuorovaikutusta mallien kanssa niin, että suojattu päättely voitiin tuottaa uudelleen pyynnön esittäjälle näkyvässä muodossa. Toiminta oli koordinoitua ja laajamittaista, ja se rikkoi käyttöehtojamme. Tällaisen manipuloinnin mahdollistava haavoittuvuus ei koske vain OpenAI:n malleja. Olemme jakaneet siitä tietoa alan kumppaneille Frontier Model Forumin kautta vahvistaaksemme yhteistä puolustusta vihamielistä tislausta vastaan.
Ennen julkaisua tutkimme toiminnan laajuutta ja mahdollisia vaikutuksia, otimme käyttöön omia torjuntatoimia sekä jaoimme tietoa tutkijoille ja alan kumppaneille ja pyysimme heiltä palautetta. Näin varmistimme, että tämänkaltaisia hyökkäyksiä vastaan on käytössä suojauksia. Torjunta- ja selvitystyö jatkuu. Uskomme, että havaintojemme jakaminen nyt auttaa laajempaa ekosysteemiä vahvistamaan puolustustaan.
Havaitsimme toimijoiden yrittävän poimia suojattua päättelyä uusilla tavoilla. He esimerkiksi kopioivat salattua päättelyä yhdestä keskustelusta ja pyysivät mallia toisessa keskustelussa purkamaan salauksen ja kirjoittamaan piilotetun päättelysisällön auki.
Myös riippumattomat tietoturvatutkijat(avautuu uudessa ikkunassa) ilmoittivat meille vastuullisen ilmoittamiskäytännön mukaisesti asiaan liittyvistä mallien välisistä haavoittuvuuksista sekä haavoittuvuuksista keskustelujen kontekstin tiivistämisessä. Tutkimme heidän havaintonsa ja vahvistimme, että heidän tunnistamansa hyökkäysreitit olivat todellisia. Heidän työnsä auttoi meitä ymmärtämään tätä laajempaa hyökkäystyyppiä ja nopeuttamaan torjuntatoimia.
Toiminta alkoi 1. heinäkuuta ja oli aluksi vähäistä, kunnes havaitsimme 24. ja 25. heinäkuuta voimakkaita piikkejä: yli 4 000 käyttäjää teki yhteensä 16 000 pyyntöä1, joissa käytettiin asiaan liittyvää poimintamenetelmää. Jatkotutkimuksissa tunnistimme yli 15 000 käyttäjän ryhmässä tähän liittyvää toimintaa, jossa käytettiin samankaltaisia kehoterakenteita. Saimme sen kokonaan estettyä 28. heinäkuuta mennessä.
Toiminta muuttui ajan myötä. Tämä vahvisti käsitystä siitä, että vihamielinen tislaus on laajempi turvallisuushaaste, joka vaatii monikerroksista ja mukautuvaa puolustusta.
On epäselvää, edustivatko kaikki kyseisenä ajanjaksona havaitsemamme toimijat samaa tahoa. Arvioimme kuitenkin, että toiminnan keskeisen osan takana oli henkilöitä, joilla on yhteyksiä Kimin kehittäjään Moonshot AI:hin.
Vihamielinen tislaus aiheuttaa riskejä sekä tekoälyn käytön turvallisuudelle että kansalliselle turvallisuudelle. Poimittua päättelyä voitaisiin käyttää toisen mallin kouluttamiseen säilyttämättä suojatoimia, joita alkuperäisen mallin käyttäjille näkyviin tuotoksiin sovelletaan. Laajamittainen tislaus voi myös nopeuttaa edistyneiden kyvykkyyksien siirtymistä muille ilman vastaavia investointeja turvallisuuteen. Nämä huolet korostuvat, kun mallien kyvykkyydet kasvavat kaksikäyttöön soveltuvilla aloilla.
Tämä riski ei koske vain OpenAI:ta. Kuten edellä todettiin, samankaltaiset menetelmät voivat vaikuttaa myös muihin edistyneisiin tekoälyjärjestelmiin. Kyse on siis yhteisestä turvallisuushaasteesta, joka vaatii koko alan välistä koordinointia.
Torjuimme tätä viimeaikaista tislauskampanjaa yhdistämällä tileihin kohdistuvia valvontatoimia, teknisiä suojauksia ja koordinoitua yhteistyötä kumppanien kanssa. Suljimme tai rajoitimme vilpilliseen toimintaan käytettyjä tilejä, vahvistimme rekisteröitymisen ja infrastruktuurin valvontaa sekä laajensimme toimintaan liittyvien verkostojen seurantaa.
Vahvistimme myös piilotetun päättelyn suojauksia käyttäjien, työtilojen, organisaatioiden ja malliperheiden välillä. Suljimme reitin, jonka kautta toisen käyttäjän salatun päättelyn jo haltuunsa saanut henkilö saattoi syöttää sen uudelleen mallille ja palauttaa sen sisällön. Lisäsimme myös tarkistuksia, jotka tunnistavat päättelyä mahdollisesti paljastavan suoratoistetun tuotoksen ja estävät sen välittämisen. Kun asiaan liittyvä toiminta siirtyi kolmansien osapuolten palveluihin, teimme yhteistyötä näiden palveluntarjoajien kanssa tunnistaaksemme toimintaan osallistuneet tilit ja estääksemme niiden toiminnan.
Lopuksi jaoimme olennaiset havainnot Frontier Model Forumin ja asianmukaisten viranomaisten tiedonvaihtokanavien kautta, jotta muut edistyneiden mallien kehittäjät ja julkisen sektorin kumppanit voisivat etsiä vastaavaa toimintaa ja vahvistaa omaa puolustustaan. Järjestelmät, jotka tukevat siirrettäviä tai uudelleen syötettäviä päättelyaineistoja, saattavat kohdata samankaltaisia riskejä.
Odotamme vihamielisten tislausyritysten muuttuvan yhä kehittyneemmiksi, kun edistyneet mallit paranevat ja toimijat etsivät edullisempia tapoja jäljitellä niiden kyvykkyyksiä. Tältä toiminnalta suojautuminen edellyttää monikerroksisia suojatoimia ja jatkuvaa mukautumista.
Tämä työ ei ole vielä valmis. Kumppanien ylläpitämät toteutukset tarvitsevat samat suojaukset kuin omat palvelumme. Työkalujen tuotoksia hyödyntävien hyökkäysten torjunta puolestaan edellyttää suojauksia, jotka tarkastelevat muutakin kuin tavallista näkyvää tekstiä. Parannamme edelleen työkalujen suojauksia, luokittimien kattavuutta ja mallien kykyä kieltäytyä pyynnöistä sekä laajennamme olennaisten suojatoimien käyttöä pilvipalvelukumppaneillemme.
Toimemme keskittyvät jatkossakin kolmeen osa-alueeseen: vahvempiin teknisiin suojauksiin päättelyn poimimista vastaan, koordinoitujen kampanjoiden parempaan havaitsemiseen ja torjuntaan sekä tiiviimpään uhkatiedon jakamiseen alan toimijoiden ja viranomaisten välillä.

