Siirry pääsisältöön
OpenAI

22. syyskuuta 2026

Turvallisuus

Tehokkaiden kolmannen osapuolen arviointien painopisteet ja periaatteet

Ladataan...

Edistyneitä tekoälymalleja kehittävillä laboratorioilla on valtava vastuu mallien turvallisesta kouluttamisesta, arvioinnista ja käyttöönotosta. Kolmannen osapuolen arvioinnit ovat olennaisia tämän vastuun tasapainottamiseksi: ne laajentavat mahdollisuuksia vaikuttaa tekoälyn turvallisuuteen, pitävät maailman ajan tasalla ja varmistavat, että laboratoriot vastaavat selkeistä ja riippumattomasti tuetuista turvallisuusväitteistään.

Osana pyrkimyksiämme edetä kehityksen kärjen tahdissa OpenAI on sitoutunut tukemaan riippumattomia arviointeja tarjoamalla laajan pääsyn koulutukseen, arviointiin ja käyttöönottoon. Tämän pääsyn tulee antaa arvioijille mahdollisuus kyseenalaistaa oletuksemme, tunnistaa meiltä huomaamatta jääneitä riskejä ja tehdä omat johtopäätöksensä suojatoimiemme tehokkuudesta.

Olemme jo pitkään tehneet yhteistyötä kolmannen osapuolen arvioijien kanssa mallien kehitys- ja käyttöönottoprosessin eri vaiheissa. Olemme myös sisällyttäneet kolmannen osapuolen arviointeja Valmiuskehyksemme käytäntöihin ja tukeneet organisaatioita ja lainsäädäntöä, jotka edistävät perusteellisempaa ja vastuullisempaa prosessia. Olemme näissä yhteishankkeissa tarjonneet laajan pääsyn muun muassa teknisiä suojatoimiamme koskeviin tietoihin, näkyviin ajatusketjuihin sekä ennennäkemättömän laajoihin luottamuksellisiin tietoihin ja sisäisiin käyttöönottoihin poikkeamiin reagoimista ja valvonnan hyökkäävää tietoturvatestausta varten. Tässä esitetyt painopisteet ja periaatteet koskevat yhteistyötämme yksityisen ja voittoa tavoittelemattoman sektorin riippumattomien arviointiorganisaatioiden kanssa teknisissä turvallisuusarvioinneissa. Ne täydentävät viranomaisten kanssa tehtävää testaus- ja arviointityötämme, jossa erilaiset roolit ja vastuut voivat edellyttää toisenlaisia lähestymistapoja.

Arviointien tehokkuus edellyttää vahvoja riippumattomuusmekanismeja, tieteellistä tinkimättömyyttä, vankkoja turvallisuuskäytäntöjä ja selkeitä vastuita. Laboratorioiden vastuulla on mahdollistaa merkityksellinen tarkastelu ja samalla suojata arkaluonteisia tietoja. Laboratoriot ja riippumattomat arvioijat ovat yhdessä vastuussa onnistumisesta, ja niiden tulee noudattaa yhteisiä kansainvälisiä turvallisuuskäytäntöjen standardeja. Seuraavassa ehdotamme neljää perusteellisemman arvioinnin painopistealuetta sekä tinkimättömän, turvallisen ja riippumattoman työn periaatteita.

Arvioinnin painopistealueet

Kolmannen osapuolen arvioinneista on eniten hyötyä, kun niissä käsitellään tarkkarajaisia ja merkittäviä kysymyksiä: tukeeko näyttö laboratorion turvallisuusperustelua ja turvallisuusväitteitä? Testataanko arvioinneissa riittävästi niitä riskejä, joita niillä on tarkoitus mitata? Toimivatko suojatoimet realistisissa olosuhteissa?

Tässä kuvattujen arviointien on tarkoitus saada erilaisia muotoja tarkasteltavien turvallisuuskysymysten mukaan. Aiomme tukea useita rinnakkaisia ja eripituisia arviointeja, joista osa kestää viikkoja ja osa useita kuukausia. Kolmannen osapuolen arvioinnit voivat olla osa käyttöönottoa edeltävää työtä ja vaikuttaa käyttöönottopäätöksiin, mutta tässä kuvattu työ on yleensä pitkäjänteisempää eikä sidoksissa julkaisuun. Siinä keskitytään tiettyjen turvallisuusväitteiden perusteelliseen tutkimiseen ajan mittaan.

Käytämme painopistealueissamme ja periaatteissamme käsitteitä turvallisuusväite ja turvallisuusperustelu. Tarkoitamme niillä seuraavaa:

Turvallisuusväite: Mallin tai järjestelmän kykyjä, toimintaa tai suojatoimia koskeva yksilöity väite, jolla on merkitystä sen turvallisuuden kannalta ja jota voidaan arvioida näytön perusteella. Väitteessä tulee yksilöidä sen kattamat riskit ja olosuhteet sekä olennaiset oletukset ja rajoitukset.

Turvallisuusperustelu: Näyttöön perustuva jäsennelty argumentti siitä, miksi mallin tai järjestelmän riskit on hallittu asianmukaisesti tiettyä toimintaa, kuten koulutusta, arviointia tai käyttöönottoa, varten. Turvallisuusperustelu yhdistää yksittäiset turvallisuusväitteet niitä tukevaan näyttöön ja tuo selkeästi esiin oletukset, epävarmuudet ja jäljelle jäävät riskit, jotka voivat vaikuttaa johtopäätöksiin.

Ehdotamme neljää perusteellisemman arvioinnin painopistealuetta sekä tinkimättömän, turvallisen ja riippumattoman työn periaatteita.

  1. Turvallisuusperustelujen riippumaton arviointi koulutuksesta ja arvioinnista sisäiseen ja ulkoiseen käyttöönottoon.

    Turvallisuusperustelujen arviointi edellyttää asiantuntemusta kohdistamisesta, valvonnan kaltaisista hallintamenetelmistä, kyberturvallisuudesta, biologisesta ja kemiallisesta väärinkäytöstä sekä hyökkäävästä tietoturvatestauksesta. Turvallisuusperustelut koostuvat muun muassa koulutusta, kykyjen arviointeja ja suojatoimia koskevista väitteistä, joita voidaan arvioida kokonaisuutena tai osissa (katso jäljempänä painopisteet 2 ja 3). Useiden arvioijien on todennäköisesti tarkasteltava perustelujen eri osia oman asiantuntemuksensa pohjalta. Niiden arviointien tulee yhdessä vastata esimerkiksi seuraaviin kysymyksiin:

    1. Onko koulutusta, arviointia ja käyttöönottoja koskevien turvallisuusperustelujen näyttö riittävää? Noudatettiinko turvallisuusperustelun ehtoja koulutuksen, arvioinnin ja käyttöönoton aikana?

    2. Kattavatko turvallisuusperustelumme arvioinnissa tunnistetut kiireellisimmät riskit? Tukevatko turvallisuusväitteet turvallisuusperustelua kokonaisuutena? Onko havaittavissa puutteita tai parannettavaa?

    3. Käytetäänkö koulutuksessa tehokkaita menetelmiä sellaisten kannustimien tunnistamiseen ja vähentämiseen, jotka voisivat palkita harhaanjohtamisesta, palkkiohakkeroinnista, tuhoisasta toiminnasta tai rajoitusten kiertämisestä?

  2. Keskeisten suojatoimien arviointi sisäisissä ja ulkoisissa käyttöönotoissa

    Suojatoimiemme kokonaisuus kehittyy jatkuvasti kykyjen ja toimintaympäristön muuttuessa. Suojatoimemme kattavat koulutuksen sekä sisäisen ja ulkoisen käyttöönoton. Niihin kuuluvat tällä hetkellä mallitason suojatoimet, sääntöjen toimeenpanon suojatoimet, tietoturvasuojaukset ja kohdistuspoikkeamien valvonta. Ne kattavat monenlaisia riskejä, kuten hallinnan menettämisen sekä väärinkäytön kyberturvallisuuden, biologian ja kemian aloilla. Teknisillä kumppanuuksilla voidaan tunnistaa nykyisten suojatoimien heikkouksia sekä parantaa arviointimenetelmiä ja vauhdittaa standardien kehittämistä. Näin luodaan vahvempi tekninen perusta tulevalle julkiselle sääntelylle, jolla pysytään kehityksen kärjen tahdissa. Tämä koskee erityisesti sisäisiä käyttöönottoja, joiden turvallisuusstandardit ovat vielä kehittymässä.

    Riippumattomissa arvioinneissa tulee tarkastella, kuinka hyvin nämä suojatoimet toimivat ja missä ne voivat jäädä puutteellisiksi. Kysymyksiä ovat esimerkiksi:

    1. Kun arvioijilla on ”harmaan laatikon” pääsy, kestävätkö suojatoimet vihamielistä testausta eli rajoitusten kiertämistä (jailbreak), ja suojaavatko ne riittävästi kykyjen vahvistumiselta suuren riskin aloilla, kuten kyberturvallisuudessa ja biologiassa? Kattavatko vihamielinen testauksemme ja hyökkäävä tietoturvatestauksemme tärkeimmät riskit?

    2. Miten agentit toimivat realistisissa käyttöolosuhteissa tehtävässä valtuutetussa testauksessa vuorovaikutuksessa kyberpuolustuksen, kuten pääsynhallinnan, hiekkalaatikoinnin sekä havainnointi- ja reagointijärjestelmien kanssa? Mitkä puolustustoimet estävät, havaitsevat tai rajoittavat haitallista toimintaa, ja missä ne epäonnistuvat?

    3. Onko kohdistuspoikkeamien valvonnassamme kriittisiä puutteita, jotka voisivat johtaa hallinnan menetykseen tai vakavaan kohdistuspoikkeamaan sisäisissä tai ulkoisissa käyttöönotoissa? Kuinka luotettavaa ajatusketjun valvonta on turvallisuutta tai kohdistamista koskevan näytön lähteenä mallien kykyjen kehittyessä?

    4. Onko kaikessa olennaisessa koulutuksessa, arvioinnissa ja käyttöönotossa käytössä asianmukainen valvonta, jota ei voi helposti poistaa käytöstä?

    5. Vastaavatko toteutetut suojatoimet järjestelmän kykyjä?

  3. Valmiuskehyksen riskiluokat (kemialliset ja biologiset riskit, kyberturvallisuus sekä tekoälyn itsensä kehittäminen) kattavien kykyarviointien sekä kohdistuspoikkeamien riskejä koskevien kohdistamisarviointien arviointi

    Valmiuskehyksemme edellyttää arviointeja keskeisillä frontier-riskien alueilla. Kun kynnysarvot ylittyvät ja arvioinnit saavuttavat erotuskykynsä rajat, on tärkeää uudistaa säännöllisesti edistyneiden järjestelmien Valmiuskehyksen riskialueiden kykyarviointeja ja varmistaa niiden kattavuus ja laatu. Sama koskee vakavia kohdistuspoikkeamien riskejä mittaavia kohdistamisarviointeja.

    Olennaisia kysymyksiä ovat esimerkiksi:

    1. Kattavatko Valmiuskehyksen riskejä mittaavat arvioinnit riittävästi Valmiuskehyksen riskikynnysten määritelmät? Onko näiden arviointien kynnysarvot asetettu oikein?

    2. Päivitetäänkö arviointeja, kun mallit saavat jatkuvasti parhaat pisteet, ja mittaavatko uudet testit aidosti edistyneempiä kykyjä?

    3. Kattavatko kohdistamisarviointimme vakavien kohdistuspoikkeamien riskit riittävästi, ja mitä olennaisia toimintamalleja tai olosuhteita niiltä voi jäädä huomaamatta?

  4. Kriittisten kohdistuspoikkeamien riippumaton tutkinta

    Riippumattomasta tutkinnasta voi olla hyötyä monenlaisissa kriittisissä tekoälyn turvallisuuspoikkeamissa. Keskitymme tässä mallien kohdistuspoikkeamiin, kuten luvattomaan toimintaan tai valvonnan välttelyyn. Ne voivat paljastaa kohdistamismenetelmien ja suojatoimien heikkouksia myös ilman tahallista väärinkäyttöä.

    Tietyissä tilanteissa, kuten OpenAI Hugging Face -tapauksessa, riippumaton kolmas osapuoli kannattaa ottaa mukaan kohdistuspoikkeamien riippumattomaan tutkintaan. On ratkaisevan tärkeää, että poikkeamien tutkintaan osallistuvilla kolmansilla osapuolilla on tarvittava asiantuntemus. Tähän kuuluvat soveltuvin osin kyberforensiikan ja kohdistamisen asiantuntemus, laajamittainen ajatusketjujen analysointi sekä henkilöstö ja resurssit tutkinnan suorittamiseen ajoissa. Poikkeamiin reagointi voi edellyttää pääsyä arkaluonteisiin sisäisiin tietoihin ja kolmansien osapuolten tietoihin. Siksi joidenkin tietojen julkaisemista tai niihin pääsyä voidaan joutua rajoittamaan. Riippumattomien tutkintojen havainnot voivat myös tukea mallin turvallisuusperustelua tarjoamalla näyttöä, jonka avulla voidaan arvioida mallin kohdistamista koskevia väitteitä ja aiemmin havaittujen kohdistuspoikkeamien korjaamiseksi toteutettujen toimien tehokkuutta.

    Kohdistuspoikkeamien yhteydessä asetamme riippumattomissa arvioinneissa etusijalle seuraavat kysymykset:

    1. Millaista mallin toimintaa tai millaisia kohdistuspoikkeamia tapauksen aikana ilmeni, ja mitkä olivat tärkeimmät niihin vaikuttaneet tekijät?

    2. Lieventäisivätkö suojatoimet ja korjaustoimet tehokkaasti vastaavia tapauksia tulevaisuudessa?

Tehokkaiden arviointien periaatteet

  • Selkeästi rajatut ja yhteisesti sovitut arvioitavat väitteet: Arvioinnit tulee aloittaa sopimalla yhdessä niiden laajuudesta. Tämän jälkeen määritellään selkeät turvallisuusväitteet, jotka rekisteröidään ennen arviointitoimien aloittamista. Kolmansien osapuolten ja laboratorioiden tulee selventää, ovatko kyseessä arvioitavan yrityksen arvioitavaksi esittämät väitteet vai väitteet, joita kolmannen osapuolen arvioija pyrkii arvioimaan itsenäisesti ja joiden perusteella laboratorio suostuu arvioitavaksi. Jotkin väitteet voivat jäädä arvioinnin ulkopuolelle monista syistä, kuten siksi, ettei kolmas osapuoli voi saada tietoja käyttöönsä, arvioijalla ei ole riittävää asiantuntemusta tai kiireellisen arvioinnin aikataulu asettaa kohtuullisia rajoituksia. Laboratorioiden ja arvioijien tulee luoda menettely alkuperäisen rajauksen ulkopuolella havaittujen merkittävien riskien käsittelyyn, mukaan lukien sen ratkaisemiseen, tarvitaanko lisätutkimuksia. Johtopäätöksissä tulee tehdä selväksi, mitä yhteisesti sovitun rajauksen puitteissa arvioitiin ja mitä ei.

  • Oikeasuhtainen pääsy: Arvioijilla tulee mahdollisuuksien mukaan olla sovittujen väitteiden arviointiin tarvittava oikeasuhtainen pääsy oikeudellisten, turvallisuuteen ja immateriaalioikeuksiin liittyvien rajoitteiden puitteissa. Kun suora pääsy ei ole käytännöllistä tai mahdollista, arvioijat voivat suojata taustatietoja työskentelemällä yrityksen nimeämän edustajan kanssa tai hyödyntämällä epäsuoria tai yksityisyyttä suojaavia pääsymenetelmiä.

  • Avoimet menetelmät ja standardit: Arvioijien tulee selostaa menetelmänsä, arviointiperusteensa ja epävarmuudet sekä hyödyntää vakiintuneita standardeja, jos niitä on saatavilla. Jos standardeja ei vielä ole, arvioijien tulee perustella käyttämänsä kriteerit selkeästi. Raporteissa tulee erottaa suorat havainnot tulkinnoista, kuvata epävarmuudet ja ilmaista selkeästi, mitä johtopäätöksiä näyttö tukee.

  • Asiantuntemus ja riippumattomuus: Arvioijien tulee osoittaa asiaankuuluva tekninen asiantuntemuksensa sekä tunnistaa, ilmoittaa ja käsitellä organisaatioiden ja yksilöiden eturistiriidat, kuten taloudelliset kannustimet, suhteet kehittäjiin ja aiempi osallistuminen arvioitavaan työhön. Suojatoimet tulee suunnitella siten, etteivät kaupalliset paineet tai palkkiojärjestelyt vaikuta havaintoihin. Toimiin voi kuulua esteellisen henkilön vetäytyminen tai asianmukainen määräaikainen osallistumisrajoitus.

  • Turvallisuus ja luottamuksellisuus: Arvioijien tulee osoittaa noudattavansa tietoturvakäytäntöjä ja henkilöstöään koskevia sitovia salassapitotoimia, jotka vastaavat käytettyjen järjestelmien ja tietojen arkaluonteisuutta. Näiden suojausten tulee kattaa immateriaalioikeudet, arkaluonteiset tiedot ja arviointiaineistot. Jos arvioijat eivät pysty täyttämään turvallisuusvaatimuksia omissa ympäristöissään tai käytettävät tiedot ovat erityisen arkaluonteisia, pääsy yrityksen hallinnoimilla laitteilla tai sen tiloissa voi olla perusteltua.

  • Hyödynnettävät havainnot ja korjausaika: Arvioinneissa tulee yksilöidä puutteet ja antaa laboratorioille riittävästi tietoa niiden korjaamiseksi. Laboratorioille tulee tarvittaessa antaa kohtuullinen aika ongelmien korjaamiseen ennen julkaisua. Raporteissa tulee tarvittaessa kuvata myös agenteille tarkoitettujen järjestelmien kehittäjille, käyttöönottajille ja puolustajille saadut opit sekä antaa käytännön toteutussuosituksia.

  • Vastuulliset julkaisukäytännöt: Arviointiraporttien tulee perustua näyttöön, ja ne tulee jakaa mahdollisimman avoimesti arkaluonteisia ja luottamuksellisia tietoja suojaten. Jos tietoja ei voida julkistaa kokonaan, luottamuksellinen raportointi asianmukaisille valvontaelimille, kuten hallintoelimille tai yritysten hallituksille, voi tukea vastuuvelvollisuutta. Riippumattomuuden ja luottamuksellisuuden tasapainon säilyttämiseksi käytössä tulee olla periaatteelliset tietojen peittämistä koskevat suojatoimet ja käytännöt sekä selkeät odotukset palautteesta ja virheiden korjaamisesta. Arvioijien tulee säilyttää toimituksellinen riippumattomuutensa ja samalla varmistaa luottamuksellisuuden ja immateriaalioikeuksien suoja. Arvioijien tulee ottaa käyttöön selkeät tietojen peittämistä koskevat käytännöt, joiden perusteella laboratoriot voivat pyytää arkaluonteisten tietojen peittämistä. Arvioijat voivat puolestaan ilmoittaa olennaisista peitetyistä kohdista ja niiden vaikutuksesta arviointiraporttiin.

Tie eteenpäin

Olemme sitoutuneet tukemaan riippumattomia arvioijia ja luomaan selkeämpiä yhteisiä kansainvälisiä standardeja tehokkaille kolmannen osapuolen arvioinneille sekä tulevan lainsäädännön että yksityisten hallintoelinten kautta. Riippumattomien arviointien ekosysteemi kehittyy yhä. Tuemme sen kasvua tekemällä yhteistyötä sellaisen monimuotoisen riippumattomien arvioijien yhteisön kanssa, jolla on syvällistä asiantuntemusta edistyneiden tekoälyjärjestelmien turvallisuuskysymyksistä. Yksikään kolmas osapuoli ei voi eikä sen pidä kattaa tyhjentävästi kaikkia edistyneiden tekoälyjärjestelmien kiireellisiä turvallisuuskysymyksiä. Kehitämme valmiuksiamme harkitusti ja tavoitteellisesti sekä autamme kasvavaa kolmansien osapuolten ekosysteemiä muodostamaan yhteisen näkemyksen parhaista käytännöistä ja periaatteista. Keskustelemme useiden kolmansien osapuolten kanssa edellä mainittuja painopistealueita vastaavista ehdotuksista.