Siirry pääsisältöön
OpenAI

Hugging Face -poikkeama ja tavoitteista poikkeavien mallien muut vaikutukset kolmansiin osapuoliin

Tekoälyjärjestelmien kyvykkyyden ja autonomisuuden lisääntyessä niiden tavoitteista poikkeava toiminta voi johtaa merkittäviin reaalimaailman tekoihin, kuten kyberturvallisuuspoikkeamiin ja muihin seurauksiin, joita kehittäjät eivät välttämättä ole ennakoineet. Siksi on yhä tärkeämpää ymmärtää, miten tällainen toiminta syntyy ja kärjistyy sekä miten se voidaan havaita ja siihen voidaan reagoida, jotta edistyneitä tekoälyjärjestelmiä voidaan kehittää ja ottaa käyttöön turvallisesti.

Pidimme Hugging Face -poikkeamaa aluksi ensisijaisesti tietoturvaongelmana, koska siihen liittyi alustan tason murto. Se on edelleen vakavin tähän mennessä malleissamme havaitsemamme tämänkaltainen toiminta, ja sen taustalla oli ensisijaisesti erittäin kyvykäs, vain sisäiseen käyttöön tarkoitettu tutkimusmalli. Olemme sittemmin ymmärtäneet, että tunkeutuminen johtui siitä, että mallit turvautuivat tavoitteista poikkeaviin strategioihin ratkaistakseen vaikeita tehtäviä, kuten Hugging Face -poikkeaman teknisessä raportissa kuvataan. Kyberturvallisuuspoikkeamat ovat yksi tämän riskin ilmenemismuoto. Tavoitteista poikkeaminen voi johtaa myös muuhun odottamattomaan tai huolestuttavaan toimintaan, joka ei kuulu perinteisiin tietoturvaluokkiin. Tällaista on esimerkiksi malliemme viestien julkaiseminen kolmansien osapuolten sivustoilla, mitä kutsumme ”agenttiroskapostiksi”. Meidän on puututtava molempiin.

Olemme jatkaneet laajemman toiminnan tarkastelua. Olemme asettaneet vakavammat poikkeamat etusijalle ja laajentaneet tarkastelua lievempään tavoitteista poikkeavaan toimintaan, kuten agenttiroskapostiin.

Tälle sivulle on koottu raporttimme ja päivityksemme Hugging Face -poikkeamasta, siihen liittyvästä tutkimuksesta ja julkisista esityksistä, havaitsemastamme muusta toiminnasta, mallien tavoitteista poikkeamisen merkityksestä oppimastamme sekä toimista, joilla vahvistamme järjestelmiämme. Päivitämme tätä sivua tutkimustemme edetessä.


Kolmansiin osapuoliin vaikuttanut toiminta

Ymmärtääksemme paremmin tämän odottamattoman toiminnan laajuutta olemme tarkastelleet kattavasti malliemme internettoimintaa koulutuksen ja arvioinnin aikana. Tunnistamme tarkastelumme osana kolmansia osapuolia ja ilmoitamme niille vaiheittain. Aloitamme tapauksista, joissa:

  • mallimme ovat saattaneet ohittaa kolmannen osapuolen suojausrajoituksia tai heikentää verkkopalvelun saatavuutta; tai

  • tavoitteista poikkeaminen on vaikuttanut haitallisesti kolmansien osapuolten verkkosivustoihin tai palveluihin.

Olemme tähänastisen tarkastelumme perusteella ilmoittaneet asiasta kymmenille kolmansille osapuolille edellä mainittujen kriteerien mukaisesti. Aiemman toiminnan tarkastelumme jatkuu ja vaatii huomattavasti aikaa ja resursseja. Ilmoitamme työn edetessä uusille kolmansille osapuolille.

Julkaisemme jäljempänä anonymisoituja yhteenvetoja havaitsemamme tavoitteista poikkeavan toiminnan muodoista. Päivitämme kuvauksia ilmoittaessamme uusille kolmansille osapuolille ja ymmärryksemme kehittyessä. Lisäksi kerromme olennaisista päivityksistä tarkastelun tilanteeseen. Jätämme yleensä nimet ja muut tunnistetiedot pois, kun se on tarpeen asianosaisten suojelemiseksi. Asiasta tiedon saaneet osapuolet voivat kuitenkin halutessaan julkaista niille antamamme tiedot.

Yhteenvedot havaitusta toiminnasta

Tähänastisessa tarkastelu- ja ilmoitusprosessissamme on tunnistettu seuraavat toimintaluokat:

  • Pääsynhallinnan ohittaminen: Agentit pääsevät tietoihin tai toimintoihin, jotka yleensä edellyttävät henkilöllisyyden tarkistamista, tiettyä käyttöoikeutta, tilausta tai tiliä. Agentti saattoi esimerkiksi käyttää eri verkko-osoitetta, muuttaa pyynnön tietoja tai hyödyntää kirjautumisistuntoa, joka antoi odotettua laajemmat käyttöoikeudet.

  • Paljastuneiden tunnusten käyttö: Agentit löysivät julkisesti saataville joutuneita kirjautumistietoja tai käyttöavaimia ja käyttivät niitä palveluun pääsyyn.

  • Kysely- tai komentoinjektio: Agentit syöttivät verkkosivustoon tai palveluun tekstiä, jonka palvelu tulkitsi tavallisen syötteen sijasta ohjeeksi. Tämä saattoi saada palvelun suorittamaan tietokantakyselyn, sovelluskoodia tai komennon palvelimellaan.

  • Pääsy ajoympäristön sisäisiin osiin: Agentit lukivat palvelun toteutuksen sisältäviä tiedostoja tai olivat vuorovaikutuksessa sisäiseen käyttöön tarkoitetun taustajärjestelmän kanssa. Näissä tapauksissa agentti pääsi palvelun osiin, joihin sillä ei ollut tarkoitus olla pääsyä.

  • Agenttiroskaposti: Agentit julkaisevat kolmansien osapuolten sivustoilla tietoja, jotka voivat muuttaa sivustojen sisältöä ja vaatia siivoamista. Ne voivat esimerkiksi käyttää julkisia wikisivuja yhteisinä viestitauluina.


Tapahtumien aikajana

Syyskuu

Elokuu

Heinäkuu