Kohti edistyneen tekoälyn koulutuksen turvallisuusperusteluja
Uskomme siirtyvämme uuteen aikakauteen, jolloin jäsenneltyä turvallisuusdokumentaatiota tulisi edellyttää ennen minkään edistyneen mallin vahvistusoppimiskoulutusajon jatkamista. Ihannetapauksessa tämä dokumentaatio täyttäisi ”turvallisuusperustelujen” vaatimukset: kyse on muilla turvallisuuskriittisillä aloilla käytettävistä kattavista, jäsennellyistä ja näyttöön perustuvista riskejä koskevista perusteluista. Pidämme turvallisuusperusteluja kunnianhimoisena tavoitteena, jota kohti etenemme. Tunnistamme samalla, että tekoälymallien turvallisuusperusteluista on vaikea tehdä yhtä aukottomia kuin ilmailussa tai ydinvoima-alalla, sillä jokainen uusi tekoälyn kyvykkyystaso tuo mukanaan uudenlaista monimutkaisuutta. Kehitämme viitekehystä näiden käytäntöjen kokoamiseksi yhtenäiseksi ohjeistoksi.
Alla on alustavia ohjeita, joiden tulisi mielestämme sisältyä edistyneen tekoälyn koulutuksen turvallisuusperusteluihin. Nämä parhaat käytännöt perustuvat tähän mennessä oppimaamme. Odotamme niiden kehittyvän, kun jatkamme huolellista kehitystyötä tukevien sisäisten prosessiemme parantamista. Julkaisemme ne nyt, jotta nykyiset näkemyksemme ovat avoimesti saatavilla, ja toivomme yhteisöltä palautetta. Huomaa, että tämä asiakirja keskittyy edistyneiden mallien vahvistusoppimiskoulutukseen. Sisäinen ja ulkoinen käyttöönotto edellyttävät huomattavasti laajemman tavoitteiden mukaiseen toimintaan liittyvän ominaisuusjoukon tarkastelua.
Turvallisuusperustelujen tulisi kattaa teknisen kokonaisuuden kolme osa-aluetta: koulutus tavoitteiden mukaiseen toimintaan, eristäminen ja valvonta. Nämä suojatoimet auttavat varmistamaan, ettei malli yritä toimia tavoitteiden vastaisesti. Vaikka se yrittäisi, eristyksen murtamisen tulisi olla vaikeaa ja valvonnan tulisi havaita yritys ennen kuin vahinkoa ehtii syntyä.
Mallin tavoitteiden mukainen toiminta: Ensisijaisena suojana tulisi olla mallien kouluttaminen toimimaan tavoitteiden mukaisesti eli luotettavasti tarkoittamallamme tavalla. Tämä voisi sisältää esimerkiksi seuraavaa:
Koulutusympäristöt ja pisteytys: Vähennetään riskiä, että malleille kehittyy tavoitteiden vastaista toimintaa, estämällä palkitsemisjärjestelmän kiertämisen positiivinen vahvistaminen koulutuksen aikana. Tämä voisi sisältää esimerkiksi seuraavaa:
Tietoaineistojen automaattiset tarkastukset: Etsitään ja korjataan agenttien avulla virheellisiä vahvistusoppimisympäristöjä, joissa tavoitteiden vastaiset toimintaketjut voisivat saada suuren palkkion haavoittuvuuksia hyödyntämällä tarkoitetun toiminnan sijaan. Näin vähennetään mahdollisuuksia vahvistaa tavoitteiden vastaista toimintaa koulutuksen aikana.
Tietoaineistojen manuaaliset tarkastukset: Täydennetään automaattista hyökkäävää tietoturvatestausta tietoaineistojen manuaalisella arvioinnilla ja laaduntarkastuksilla. Näin tunnistetaan virheelliset tehtävät, jotka voisivat tahattomasti vahvistaa tavoitteiden vastaista toimintaa.
Pisteyttäjien säätäminen: Säädetään pisteyttäjät rankaisemaan mallin yrityksistä hyödyntää vahvistusoppimisympäristöjen haavoittuvuuksia tai murtaa niiden suojauksia koulutuksen aikana.
Aiempien ajojen analyysi: Analysoidaan aiempien kokeiden toimintalokeja luokittimilla ja varmistetaan näin, että pisteyttäjät toimivat tarkoitetulla tavalla.
Tavoitteiden mukaisen toiminnan mittaaminen: Tehdään arviointeja, joissa seurataan mallin taipumusta tavoitteiden vastaiseen toimintaan, jotta voidaan mitata tavoitteiden mukaiseen toimintaan tähtäävän koulutuksen tehokkuutta. Tämä voisi sisältää esimerkiksi seuraavaa:
Tavoitteiden mukaisen toiminnan erillisarvioinnit: Arvioidaan tavoitteiden mukaista toimintaa edistyneiden mallien koulutusajojen aikana, jotta selviää, toimiiko koulutus tarkoitetulla tavalla. Tutkitaan kaikki olennaiset heikennykset.
Takautuva testaus: Testataan tavoitteiden mukaisen toiminnan arviointeja aiemmilla poikkeamilla. Näin varmistetaan, että arvioinnit tunnistavat aiemmin tavoitteiden vastaisesti toimineet mallit eivätkä ylisovitu yksittäisiin poikkeamiin.
Arviointien manipuloinnin seuranta: Seurataan arviointitietoisuutta tai metapelaamista (malli tunnistaa olevansa testattavana), joka voisi muuttaa käyttäytymistä, ja asetetaan täsmälliset estokynnykset. Esimerkiksi tavoitteiden mukaisen toiminnan arvioinneissa voidaan ottaa käyttöön arviointitietoisuuden ja metapelaamisen valvontajärjestelmät.
Pahimpien tapausten stressitestit: Pyritään saamaan esiin pahin mahdollinen virheellinen toiminta ja tarkistetaan, että ainakin yksi arviointi havaitsisi sen.
Ajatusketjuun perustuvan koulutuksen estäminen: Ei anneta automaattisten pisteyttäjien nähdä ajatusketjua vahvistusoppimisen aikana, jotta mallit eivät opi kiertämään ajatusketjun valvontajärjestelmiä.
Eristäminen: Varmistetaan, että hiekkalaatikkoeristys ja tietoturva ovat riittävän vahvoja estämään haitalliset toimet, jos malli alkaa toimia tavoitteiden vastaisesti. Tämä voisi sisältää esimerkiksi seuraavaa:
Infrastruktuurin monikerroksinen tietoturva: Panostetaan vahvasti sekä mallin suoritusympäristönä toimivan hiekkalaatikon että sitä ylläpitävän tutkimusinfrastruktuurin suojauksen vahvistamiseen. Näin käytössä on ylimääräinen suojakerros siltä varalta, että malli pääsee hiekkalaatikon ulkopuolelle.
Eristyksen hyökkäävä tietoturvatestaus: Parannetaan hiekkalaatikon, tutkimusinfrastruktuurin ja ulkorajan tietoturvaa testaamalla näitä järjestelmiä toistuvasti hyökkäävän tietoturvatestauksen keinoin. Käytetään turvallisuusanalyysin perusteella edistyneiden mallien koulutusajojen välitallenteita mahdollisten aukkojen löytämiseen ja korjaamiseen. Testataan hyökkäävästi myös kaikki palvelut, joihin malli voi olla yhteydessä koulutuksen aikana (esimerkiksi internetvälimuisti).
Näytteiden välinen viestintä: Rajataan suuren tiedonsiirtokapasiteetin viestintä näytteiden välillä hyväksyttyihin reitteihin, kuten moniagenttityökaluihin. Suljetaan infrastruktuurin sivukanavat, joilla on suuri tiedonsiirtokapasiteetti ja jotka agenttien on helppo löytää.
Muuttumattomat vuorovaikutuslokit: Säilytetään agenttien vuorovaikutuslokit muuttumattomina kohtuullisen ajan esimerkiksi kertakirjoitteisilla tallennustileillä. Tämä koskee kaikkea vahvistusoppimiskoulutusta, arviointia ja sisäistä käyttöönottoa, ja sen tarkoitus on mahdollistaa luotettava poikkeamien tutkinta ja estää tahattomat muokkaukset.
Valvonta: Käytössä tulee olla reaaliaikainen valvontajärjestelmä, joka havaitsee mahdollisen tavoitteiden vastaisen toiminnan, jos mallit alkavat toimia näin. Kiireelliset ongelmat tulee käsitellä nopeasti ennen vakavan poikkeaman syntymistä. Tämä voisi sisältää esimerkiksi seuraavaa:
Valvottavuuden varmistaminen: Varmistetaan valvottavuutta ja valvonnan kiertämistä mittaavilla arvioinneilla, että mallit pysyvät valvottavina. Arvioinneissa on oltava selkeät kynnysarvot, jotta huolestuttava toiminta havaitaan varhain.
Tunnettujen ongelmien korkea tunnistusherkkyys: Varmistetaan erillään pidettävällä arviointiaineistolla, että valvontajärjestelmä tunnistaa kattavasti aiemmat poikkeamat.
Valvontajärjestelmien arviointien ajantasaisuus: Luodaan uusiin ajoihin liittyviä täysin uusia riskejä edustavia arviointinäytteitä, jotta valvontajärjestelmien tunnistusherkkyyden ja tarkkuuden mittarit eivät vanhene.
Nopea reagointi: Otetaan käyttöön kiireelliset hälytykset, jotka johtavat toimiin palvelutasosopimuksessa määritellyssä ajassa ennen kuin malli aiheuttaa vahinkoa. Toimena voi olla päivystäjän hälyttäminen tai kyseisen ajon automaattinen keskeyttäminen. Esimerkiksi päivällä poikkeamista voidaan hälyttää tietoturvapäivystäjä ja ajon vastuuhenkilö, ja yöllä ajot voidaan keskeyttää automaattisesti, jos hälytyksiä ei kuitata.
Teknisiä suojatoimia koskevien suositusten ohella olemme kehittäneet parhaita toimintakäytäntöjä edistyneen tekoälyn koulutusajojen turvallisuusperusteluille. Näitä voisivat olla esimerkiksi:
Vasta-argumentit (ennakoivat analyysit): Kun turvallisuusperustelu on laadittu, toisen tiimin jäsenen tulisi kirjoittaa vasta-argumentti, jossa etsitään perustelun mahdollisia aukkoja ja esitetään riskeistä huolellisesti punnittu arvio. Koulutustiimin tulisi sitten käsitellä nämä havainnot turvallisuusperustelun vahvistamiseksi.
Hyväksynnät: Ylimmän johdon jäsenten tulisi arvioida turvallisuusperustelu, ja jokaisella heistä tulisi olla oikeus estää koulutusajo. Näin ajolle varmistetaan useita sisäisiä tarkastuksia (esimerkiksi tutkimusorganisaation johtaja tai tutkimuksesta vastaava varatoimitusjohtaja, turvallisuusjohtaja ja johtava tutkija).
Vastuuvelvollisuus: Koulutusajosta vastaavan ylimmän johdon jäsenen (esimerkiksi tutkimusorganisaation johtajan tai tutkimuksesta vastaavan varatoimitusjohtajan) tulisi olla vastuussa turvallisuusperustelusta ja mahdollisten poikkeamien käsittelystä, myös suoriutumisen arvioinnissa. Näin myös koulutustiimeillä on kannustin edistää turvallisuutta ja tavoitteiden mukaista toimintaa.
Keskeyttäminen: Jos havaitaan ongelmia, jotka kumoavat turvallisuusperustelun (esimerkiksi uusi tietoturvaongelma), kaikkien sen piiriin kuuluvien ajojen keskeyttämistä varten on oltava toimintaohjeet, tekniset hallintakeinot ja palvelutasosopimukset.
Sisäinen avoimuus: Turvallisuusperustelujen tulisi olla sisäisten valvontaryhmien (esimerkiksi Turvallisuus- ja suojelukomitean) saatavilla.
Auditoinnit: Auditoijille tulisi antaa riittävä pääsy tietoihin ja järjestelmiin, jotta he voivat varmistaa turvallisuusperustelun väitteiden paikkansapitävyyden ja kestävyyden sekä tuoda esiin havaitsemansa puutteet.
Eskalointi: Tavoitteiden vastaisen toiminnan eskalointiin tulisi olla selkeä prosessi, johon kuuluu taulukko määritellyistä vakavuustasoista sekä päivystäjä, joka voi hälyttää johtohenkilöitä (esimerkiksi toimitusjohtajan), kun koulutusajossa saavutetaan tietty vakavuustaso.
Tekniset hallintakeinot: Sääntöjenvastaisten ajojen käynnistämisen tulisi olla vaikeaa sekä ihmisille että agenteille. Turvatoimintojen, kuten valvonnan ja automaattisen keskeytyksen, tulisi estää toiminta vikatilanteessa. Ajoa ei esimerkiksi saisi voida käynnistää ilman asianmukaista valvontaa, eikä valvontaa saisi voida poistaa käytöstä vahvistusoppimiskoulutuksen, arvioinnin tai sisäisen käyttöönoton sisältä käsin.
Mahdollisuus perua vaikutukset: Kaikki tavat, joilla tavoitteiden vastaisesti toimivaa mallia hyödynnetään myöhemmin koulutusprosessissa (esimerkiksi datan tuottamiseen tai pisteytykseen), tulisi voida tunnistaa helposti. Näin sen tavoitteiden vastaisten tuotosten vaikutukset voidaan tarvittaessa perua.
Jäännösriskien kattava kartoitus: Turvallisuusperusteluissa tulisi luetella mahdollisimman kattavasti ne jäännösriskit, joita käytössä olevat lieventämistoimet eivät kata. Näin riskien hyväksymisestä voidaan päättää riittävien tietojen pohjalta.
Nämä ovat tämänhetkiset suosituksemme, ja niitä ollaan ottamassa käyttöön OpenAI:lla. Odotamme käytäntöjemme kehittyvän edelleen tulevien viikkojen aikana.
Olemme myös kehittäneet parhaita käytäntöjä tekoälyn tavoitteiden vastaiseen toimintaan liittyvien vakavien poikkeamien tutkintaan. Tutkimuslaboratorioiden tulisi pyrkiä oppimaan yksittäisistä poikkeamista mahdollisimman paljon, jotta vastaavat tapahtumat voidaan ehkäistä tulevaisuudessa. Mallia voi ottaa muiden korkean riskin alojen tutkintakäytännöistä(avautuu uudessa ikkunassa). Tällaisia toimia voisivat olla esimerkiksi:
Sisäinen avoimuus: Koska tutkinta voi kestää pitkään, poikkeamien tutkinnan etenemisestä tulisi tiedottaa sisäisesti säännöllisin väliajoin (esimerkiksi päivittäin tutkinnan ollessa käynnissä). Työntekijöillä tulisi olla selkeät menettelyt laajempien käyttöoikeuksien saamiseksi, mukaan lukien pääsy muokkaamattomiin vuorovaikutuslokeihin ja mahdollisuus tuottaa näytteitä tavoitteiden vastaisesti toimivilla malleilla, jos se on turvallista ja heidän työnsä kannalta olennaista.
Tavoitteiden vastaisen toiminnan juurisyyt: Tutkijoiden tulisi selvittää koulutusdynamiikkaan liittyvät juurisyyt esimerkiksi kohdennetuilla ablaatiokokeilla tai uudelleenotantakokeilla. Näin voidaan ymmärtää, miten tavoitteiden vastainen toiminta syntyi, syventää ilmiön tieteellistä ymmärrystä ja ehkäistä sitä paremmin tulevaisuudessa.
Jälkianalyysi: Toimintatavoista ja -kulttuurista tulisi tehdä jälkianalyysi, jotta kaikki poikkeamaan vaikuttaneet syyt ymmärretään. Näihin kuuluvat esimerkiksi se, miksi ongelmat syntyivät ja miksi ne jäivät havaitsematta tai eskaloimatta ennen poikkeamaa.
Havaitseminen: Meidän tulisi kehittää tavoitteiden mukaisen toiminnan testausmenetelmiä, joilla voidaan havaita taipumus aiheuttaa kyseinen poikkeama ilman, että menetelmiä optimoidaan suoraan poikkeamasta saatujen tietojen (esimerkiksi vuorovaikutuslokien tai poikkeamayhteenvetojen) perusteella. Poikkeamien pohjalta tulisi luoda arviointeja ”regressiotesteiksi”, joilla varmistetaan, ettei tulevilla malleilla ole taipumusta tavoitteiden vastaiseen toimintaan hyvin samankaltaisissa tilanteissa.
Julkinen tiedottaminen: Tutkinnan tulokset, jälkianalyysit ja toimintatapojen muutokset tulisi julkaista tutkinnan päätyttyä. Kolmansille osapuolille, joihin poikkeama vaikuttaa, tulisi ilmoittaa mahdollisimman pian.


