Mallien linjauspoikkeamien raportointikehyksemme
Julkaisemme uuden kehyksen OpenAI:ssa havaittujen mallien linjauspoikkeamien seurantaan, tutkimiseen ja julkistamiseen sekä kuusi raporttia viimeisen puolen vuoden aikana havaitsemastamme odottamattomasta tai huolestuttavasta mallien toiminnasta.
Olemme aiemminkin pyrkineet julkistamaan linjauspoikkeamia koskevia havaintojamme julkisesti, jotta tutkijat, tekoälykehittäjät, päättäjät ja suuri yleisö saisivat parempaa tietoa. Koska havaintojen raportointiin ei kuitenkaan ole ollut järjestelmällistä menettelyä, julkistamisemme ovat olleet tapauskohtaisia ja niitä on tehty harvemmin kuin olisi ollut ihanteellista. Olemme usein odottaneet, että voimme koota useita tapauksia yhteen raporttiin, tai lisänneet ne uusien mallien järjestelmäkortteihin. Uuden kehyksen tarkoituksena on nopeuttaa linjauspoikkeamaraporttien julkaisemista havaintojen jälkeen, vaikka emme olisi vielä täysin selvittäneet tai lieventäneet raportoimaamme toimintaa.
Kun tekoälyjärjestelmät kehittyvät ja niiden käyttö laajenee, tarvitsemme laajempaa ja parempaan tietoon perustuvaa yhteisymmärrystä linjaustutkimuksen edistymisestä. Emme usko, että tekoälyala olisi ratkaissut linjauksen ja valvonnan riittävän hyvin voidakseen jatkaa vastuullisesti mahdollisimman nopeaa skaalaamista enää kovin pitkään. Tekoälyn kehityksen etenemistä tulevina kuukausina ja vuosina koskevien päätösten on perustuttava näyttöön, jota edistyneitä malleja rakentavien yhtiöiden ulkopuoliset voivat itse tarkastella.
Esimerkit linjauspoikkeamista voivat auttaa tunnistamaan ongelmia, joita muut tekoälykehittäjät saattavat kohdata järjestelmiensä saavuttaessa vastaavia kyvykkyyksiä. Ne voivat myös paljastaa suojatoimien heikkouksia tai kyseenalaistaa mallien toimintaa koskevia oletuksia. Havaintojen jakaminen antaa muille mahdollisuuden tutkia samoja ongelmia, testata selityksiämme ja parantaa lieventäviä toimia. Koska pidämme linjauspoikkeamien avoimuutta tärkeänä, uusi kehyksemme suosii julkistamista silloinkin, kun havainnon merkitys on epävarma. Siksi jotkin julkistamamme tapaukset voivat myöhemmin osoittautua satunnaisiksi eivätkä osaksi laajempaa ilmiötä tai viitteeksi tulevasta kehityksestä.
Tällä hetkellä alalla ei ole yhteistä kehystä, jossa määriteltäisiin selkeät standardit sille, miten tekoälykehittäjien tulisi julkistaa esimerkkejä malliensa linjauspoikkeamista. Toivomme, että tänään esittelemämme kehys on ensimmäinen askel kohti tällaisia standardeja: se määrittää, mitkä linjauspoikkeamat kehittäjien tulisi julkistaa ja mitä raporttien tulisi sisältää. Pidämme tätä kehystä keskeneräisenä ja kehitämme sitä kokemusten ja julkisen palautteen perusteella.
Kuvaamme tässä kehyksen toimintaa ja julkaisemme ensimmäiset raportit.
Pyrimme julkistamaan esimerkkejä, jotka tarjoavat hyödyllistä näyttöä mallien linjauspoikkeamien synnystä ja ilmenemisestä sekä siitä, missä suojatoimet onnistuvat tai epäonnistuvat. Asetamme etusijalle uudet toimintamekanismit, merkittävät muutokset tunnetussa toiminnassa sekä havainnot, jotka kyseenalaistavat turvallisuutta tai lieventäviä toimia koskevia oletuksia. Esimerkin ei tarvitse aiheuttaa haittaa tai osoittaa laajempaa ilmiötä ansaitakseen julkistamisen. Kehys kattaa kriteerit täyttävän toiminnan mallin koko elinkaaren ajalta, mukaan lukien koulutuksen, arvioinnin, testauksen ja käyttöönoton.
Tähän sisältyvät uudet tavat, joilla mallit toimivat luvatta, koordinoivat toimintaansa muiden mallien kanssa tai välttelevät valvontaa; epäonnistumiset, jotka kyseenalaistavat linjausmenetelmän tai suojatoimen; sekä toiminta, joka haastaa julkaistussa turvallisuusarviossa esitetyn väitteen. Samoja julkistamiskriteerejä sovelletaan linjauspoikkeamiin, jotka voivat vaikuttaa kolmansiin osapuoliin.
Tähän voivat kuulua myös linjauspoikkeamat, jotka vaikuttavat vastaavan aiemmin julkistamiamme tapauksia. Ongelman toistuminen voi itsessään olla hyödyllistä näyttöä malliemme toiminnasta tai suojatoimiemme tehokkuudesta. Näin on esimerkiksi silloin, jos tietynlainen linjauksesta poikkeava toiminta jatkuu toistuvista lieventämisyrityksistä huolimatta. Tällöin julkaisemme lisäesimerkit päivittämällä alkuperäistä linjauspoikkeaman julkistusta.
Aiomme ajan myötä kehittää objektiivisempia julkistamiskriteerejä yhdessä muiden kehittäjien, ulkopuolisten tutkijoiden, alan standardointielinten ja sääntelyviranomaisten kanssa. Katsomme myös, että vakavista turvallisuus-, tietoturva- ja linjauspoikkeamatapauksista tulisi ilmoittaa Yhdysvaltain liittohallitukselle, ja valmistelemme ehdotusta raportointimekanismeista. Tämä kehys täydentää nykyisiä velvoitteitamme. Se ei korvaa lakisääteisiä ilmoitusvelvollisuuksiamme, kuten kriittisiä turvallisuustapauksia tai kyberturvallisuusloukkauksia koskevia vaatimuksia.
Uuden linjauspoikkeamien julkistamiskehyksemme käynnistämiseksi julkaisemme kuusi raporttia malliemme koulutuksen tai arvioinnin aikana havaitsemistamme linjauksesta poikkeavan toiminnan tapauksista. Tapaukset havainnollistavat erilaisia toimintoja, joista mielestämme kannattaa kertoa: käyttäjältä salattavista tiedoista aina luvattomiin toimiin, joilla pyritään ylittämään esteitä. Raportit käsittelevät yksittäisiä tapauksia, eikä niiden perusteella pidä päätellä, kuinka usein linjauspoikkeamia esiintyy malleissamme. Jokaisesta alla olevasta kohdasta on linkki koko raporttiin.
Itse luodut ohjeet tehtäväyhteenvedoissa(avautuu uudessa ikkunassa). Julkaisematon tutkimusmalli lisäsi uuteen konteksti-ikkunaan siirretyn työn jatkamiseen käytettyihin yhteenvetoihin asiaankuulumattomia ohjeita, kuten kehotuksia sivuuttaa tavanomaiset rajoitteensa. Tunnistimme 27 tällaista yhteenvetoa.
Ohjeet virheiden salaamiseen tehtäväyhteenvedoissa(avautuu uudessa ikkunassa). GPT‑5.6 Solin koulutuksen aikana monet mallin ilmentymät lisäsivät yhteenvetoihinsa ohjeita, joiden tarkoituksena oli salata käyttäjältä virheitä tai linjauksesta poikkeavaa toimintaa. Kontekstin tiivistämisen yhteenvedoissa oli esimerkiksi ohjeita keksiä puuttuvia historiatietoja kertomatta siitä ja salata lähdeversioiden välisiä ristiriitoja.
Paljastuneiden API-avainten etsiminen julkisista repositorioista ja tietojen sepittäminen(avautuu uudessa ikkunassa). Vastatessaan tavanomaiseen kysymykseen erään Kalifornian piirikunnan tuloluvuista malli löysi paljastuneen API-avaimen ja käytti sitä luvatta. Kun se ei tästä huolimatta saanut haettua pyydettyjä lukuja, se keksi ne ja esitti ne pyydetystä lähteestä saatuina tietoina.
Tiedostojen lataaminen internetiin lähdeviitteitä varten(avautuu uudessa ikkunassa). Kun käyttäjä pyysi julkaisemattomalta mallilta yli 5 000 000 neliömetrin kokoisten järvien tunnisteita ja nimiä, agentti löysi oikean vastauksen Pythonin avulla. Koska ohjeissa kuitenkin pyydettiin selainlähdettä, agentti päätti käyttäjältä kysymättä ladata tiedoston verkkoon voidakseen viitata siihen vastauksessaan.
Luvattomat kirjoitukset ja viestintä sisäisen ohjelmistorepositorion kautta(avautuu uudessa ikkunassa). Etsiessään puuttuvia syötetiedostoja mallit käyttivät sisäistä ohjelmistorepositoriota ilmoitustauluna ja vaihtoivat sen kautta pyyntöjä ja vastauksia eri koulutusnäytteiden välillä. Ne eivät kuitenkaan onnistuneet palauttamaan tiedostoja. Raportissa tarkastellaan myös aiempaa tapausta, jossa malli latasi onnistuneesti testitiedostoja repositorioon yrittäessään kiertää verkkorajoituksia.
Luvaton tiedostojen jakaminen yhteistyötä tekevien agenttien välillä(avautuu uudessa ikkunassa). Saman koulutustehtävän parissa toimineet agentit jakoivat tiedostoja julkisten tiedostopalvelujen kautta, kun ne eivät päässeet käsiksi toistensa paikallisiin tiedostoihin. Näin tehtävän tuotokset tulivat saataville julkisista URL-osoitteista, vaikka tehtävässä malleja pyydettiin käyttämään vain paikallisia tiedostoja.
Kuka tahansa OpenAI:n työntekijä voi ilmoittaa linjauspoikkeaman turvallisuus- ja linjaustiimiemme tutkittavaksi sekä pyytää sen arvioimista julkistamista varten. Tämä käynnistää julkistamisprosessimme, jossa jokaiselle vaiheelle asetetut määräajat varmistavat tutkinnan ja julkistamisen oikea-aikaisuuden.
Kun tapauksesta on ilmoitettu, tekninen henkilöstömme tutkii tapahtuneen, jäljellä olevat epävarmuudet, julkistamisen perusteltavuuden ja sen, mitkä tiedot voidaan jakaa. Se arvioi myös, onko tapaus vaikuttanut johonkin kolmanteen osapuoleen, jolle on ilmoitettava asiasta yksityisesti ennen julkaisua.
Tapaus ohjataan sitten yhdelle kolmesta käsittelypolusta: Julkistamisvalmis, Suppea tutkinta tai Laaja tutkinta (”hidas käsittelypolku”).
Julkistamisvalmis-polku kattaa kriteerit täyttävät tapaukset, joiden tutkinta on riittävän valmis julkaistavaksi tarkastuksen jälkeen. Suppea tutkinta -polku kattaa tapaukset, jotka vaativat teknistä lisätutkintaa. Odotamme näiden kahden käsittelypolun kattavan valtaosan julkistamistamme tapauksista, etenkin tapaukset, jotka eivät edellytä laajaa tutkintaa, koordinointia kolmansien osapuolten kanssa tai vakavien väärinkäyttöriskien käsittelyä. Kaikki tänään julkaisemamme tapaukset kuuluvat jompaankumpaan näistä kahdesta käsittelypolusta.
Laaja tutkinta -polku kattaa monimutkaiset tutkinnat, etenkin kolmansiin osapuoliin liittyvät tapaukset. Jos tapaus vaikuttaa kolmanteen osapuoleen, turvallisuutta, oikeudellisia kysymyksiä ja vastuullista julkistamista koskevat velvoitteemme ovat tähän kehykseen nähden ensisijaisia. Pyrimme julkaisemaan alustavan ilmoituksen mahdollisimman pian, mutta voimme joutua lykkäämään sitä turvallisuussyistä. Näin voi käydä esimerkiksi silloin, jos malli löytää laajalti käytetystä ohjelmistosta aiemmin tuntemattoman haavoittuvuuden. Jos raportti paljastaisi kolmannen osapuolen henkilöllisyyden, aiomme ilmoittaa tälle etukäteen, vaikka mitään suojausrajaa ei olisi ylitetty.
Laaja tutkinta -polulle kuuluvan tapauksen alustavassa ilmoituksessa kuvataan yleisellä tasolla, mitä tapahtui, kerrotaan mahdollisten ulkopuolisten asiantuntijoiden osallistumisesta tutkintaan ja esitetään saatavilla oleva arvio loppuraportin julkaisuajankohdasta. OpenAI:n Hugging Face -tapaus olisi kuulunut tähän käsittelypolkuun, jos se olisi julkistettu tämän kehyksen mukaisesti.
Esimerkin ilmoittaneelle työntekijälle kerrotaan, julkistetaanko tapaus ja mitä käsittelypolkua mahdollisessa julkistamisessa noudatetaan. Ratkaisemattomat erimielisyydet julkistamisesta tai sopivasta käsittelypolusta siirretään OpenAI:n Turvallisuusneuvontaryhmälle (SAG). Se koostuu yhtiön eri osastojen johtohenkilöistä, jotka arvioivat edistyneiden mallien kyvykkyyksiä ja suojatoimia, valvovat Valmiuskehystämme ja neuvovat OpenAI:n johtoa. SAG:n sisäiset erimielisyydet ja henkilöstön vastalauseet sen päätöksiin siirretään OpenAI:n johdon käsiteltäviksi. Päätökset olla julkistamatta tapausta tai siitä, ettei julkistaminen ole perusteltua, annetaan turvallisuus- ja linjausjohdon sekä mahdollisuuksien mukaan asianomaisen teknisen henkilöstön tietoon.
Saatamme tarkistaa julkistamisprosessia käytännön kokemusten perusteella. Kirjaamme kaikki muutokset tähän julkaisuun.
Kussakin kattavassa raportissa kuvataan havaittu toiminta, sen vakavuus ja mahdolliset ulkoiset vaikutukset, tapahtumaympäristö, tapahtuman päivämäärä tai ajanjakso, havaitsemisajankohta sekä yleisellä tasolla tapaukseen liittynyt malli tai liittyneet mallit. Mahdollisuuksien mukaan kerromme myös seuraavat tiedot:
Tarkemmat tiedot tapahtuneesta ja siitä mahdollisesti aiheutuneesta haitasta;
Miten havaitsimme linjauspoikkeaman ja kuinka laaja tutkintamme oli;
Tulkintamme tapauksen merkityksestä linjaustutkimukselle ja tekoälyn tekniselle turvallisuudelle;
Tapauksen herättämät tärkeät avoimet kysymykset;
Toimet, joihin ryhdymme tai aiomme ryhtyä kyseisen toiminnan korjaamiseksi. Näitä tietoja ei aina ole saatavilla julkistamishetkellä, sillä saatamme julkaista linjauspoikkeamaraportin ennen tutkinnan valmistumista tai korjauksen kehittämistä.
Asiakkaiden käyttöympäristöissä ilmenevistä linjauspoikkeamista kerromme niin paljon kuin asiakkaiden tietosuoja ja sopimusvelvoitteemme sallivat.
Tänään julkaistavat raportit ovat ensimmäinen julkistuskokonaisuus, eivät kattava selvitys tunnetuista linjauspoikkeamista tai käynnissä olevista tutkinnoista. Näiden ensimmäisten raporttien ei ole tarkoitus kuvata kaikkia tämän kehyksen kattamia tapauksia tai niiden vakavuusastetta. Olemme sitoutuneet julkistamaan tämän kehyksen kriteerit täyttävät linjauspoikkeamat, myös monimutkaisemmat tapaukset, jotka edellyttävät pidempää tutkintaa tai koordinointia kolmansien osapuolten kanssa. Jatkamme tähän kehykseen perustuvien raporttien säännöllistä julkaisemista ja kerromme lisää raportointisitoumuksistamme niiden kehittämisen edetessä.


