Siirry pääsisältöön
OpenAI

18. elokuuta 2026

YritysJulkaisu

Mallikehityksen tahti kriittisten kyberkykyjen aikakaudella

Ladataan...

Viime viikkoina kaksi kehityskulkua on korostanut yhä kyvykkäämpiin tekoälyjärjestelmiin liittyviä kasvavia riskejä: OpenAI–Hugging Face -häiriö sekä erikseen alustavat havainnot siitä, että yksi tulevista malleistamme, Astra, saattaa saavuttaa kriittisen kyberturvallisuuskyvyn kynnyksen Valmiuskehyksemme mukaisesti. Yhdessä nämä kehityskulut ja sisäisen tutkimuksemme nopea edistyminen ovat lisänneet tarvetta vahvistaa valvontaa, linjausta ja eristämiseen liittyviä suojatoimia koulutusprosessin kaikissa vaiheissa.

Mallien kyvykkyyden kasvaessa myös niiden sisäiseen kehittämiseen ja testaamiseen liittyvät riskit kasvavat. Valvontaa, linjausta ja turvallisuutta koskevien vaatimustemme on pysyttävä näiden riskien edellä. Halusimme varata vaatimusten täyttämiseen tarvittavan ajan, joten hidastimme skaalaamista väliaikaisesti. Tähän sisältyi kahden viikon tauko uusimpien käyttöönotettaviksi tarkoitettujen malliemme vahvistusoppimiskoulutuksessa (RL), kun vahvistimme tutkimusympäristöjämme, testasimme niitä red team -menetelmin ja laajensimme valvontajärjestelmiemme kattavuutta. Suurin suunnittelemamme edistyneen mallin RL-koulutusajo on edelleen keskeytettynä. Teemme ensin pienempiä koulutusajoja ja arviointeja, jotta voimme arvioida mallin käyttäytymistä, validoida suojatoimemme ja saada lisää näyttöä linjauksesta.

Linjaus eli työ, jolla tekoälyjärjestelmät saadaan toimimaan tarkoitetusti ja ihmisten valvonnassa, on jo pitkään ollut tutkimusohjelmamme ytimessä. Edellytämme nyt vahvempaa näyttöä linjatusta käyttäytymisestä koulutuksen kaikissa vaiheissa ja hyödynnämme jo käynnissä olevaa tutkimusta ja arviointeja. Yhä kyvykkäämpien järjestelmien pitäminen linjattuina on haaste, johon koko alan on vastattava. Tulevien mallien kehityksestä saamamme merkit osoittavat, että tarvitsemme nykyistä Valmiuskehystä laajemman lähestymistavan, joka perustuu siihen mutta ulottuu sitä pidemmälle.

Mielestämme on tärkeää kertoa avoimesti, miten lähestymistapamme muuttuu. Seuraavassa kuvaamme tutkimusprosesseihimme ja infrastruktuuriimme jo tehdyt muutokset sekä vielä käynnissä olevan työn.

Kyvykkäämpien mallien suojatoimien vahvistaminen

Kyvykkäämpien mallien kehittämistapamme perustuu kolmeen toisiaan vahvistavaan suojatoimeen:

  1. Valvonta, jonka avulla havaitsemme huolestuttavan käyttäytymisen ja voimme reagoida siihen.
  2. Linjaus, joka vähentää haitallisten tai luvattomien toimien todennäköisyyttä.
  3. Turvatoimet, jotka rajoittavat sitä, mihin tekoälyjärjestelmät voivat päästä käsiksi tai vaikuttaa.

Odotamme mallien hoitavan pian suurimman osan turvallisuustyöstä, myös puolustautumisen muita malleja vastaan. Näin kaikki kolme suojatoimea voivat skaalautua mallien kyvykkyyden mukana, mitä pidämme ratkaisevan tärkeänä.

Sovellamme näitä suojatoimia tutkimuksessa ja käyttöönotossa sekä mukautamme ne kunkin mallin kyvykkyyksiin, toimintaympäristöön ja riskitasoon.

Tutkimusympäristöjemme suojaaminen

Kun edistyneiden mallien kyberturvallisuuskyvyt vahvistuvat, tiukennamme niiden koulutus- ja arviointiympäristöjen turvallisuusvaatimuksia. Näiden vaatimusten täyttäminen on edellyttänyt huomattavaa teknistä työtä sekä aiheuttanut suuria kustannuksia ja viivästyksiä edistyneelle tutkimukselle. Heti OpenAI–Hugging Face -häiriön* jälkeen keskeytimme edistyneiden mallien päättelyn tutkimusklustereissa sellaisten ajojen osalta, jotka pystyivät suorittamaan koodia tai käyttämään internetiin yhdistettäviä työkaluja. Palautimme melko nopeasti rajatumman ja turvallisemman tavan suorittaa koodia. Sen jälkeen arvioimme jokaisen työkuorman erikseen selvittääksemme, voitiinko sitä jatkaa turvallisesti. Osa tutkimustyökuormista jatkui uusilla valvontatoimilla, kun taas toiset vaativat lisämuutoksia.

Seuraavien viikkojen aikana olemme määritelleet vahvemmat turvallisuusvaatimukset edistyneen tutkimuksen työkuormille ja aloittaneet niiden toteuttamisen. Esimerkkejä:

  • Työkuormien eristäminen: Edellytämme nyt vahvempaa eristystä (”hiekkalaatikoita”) työkuormilta, jotka suorittavat mallin tuottamaa tai muuten epäluotettavaa koodia. Tämä koskee myös ohjelmistoja, jotka voivat vaarantua käsitellessään mallien tulosteita.
  • Verkkojen eristäminen: Olemme ottaneet käyttöön lisää valvontatoimia, joilla suuren riskin ja epäluotettavat työkuormat eristetään internetistä. Olemme suunnitelleet nämä valvontatoimet niin, ettei yksittäisen työkuorman tai tukipalvelun vaarantuminen yksin mahdollista luvatonta pääsyä internetiin tai muihin sisäisiin verkkoihin.
  • Jatkuva tietoturvatestaus: Olemme määrittäneet ympäristömme uudelleen, jotta voimme poistaa mahdollisesti haavoittuvat jaetut palvelut, vähentää pysyviä käyttöoikeuksia sekä parantaa turvallisuus- ja luottamusrajoja. Parannamme myös kykyämme kerätä ja valvoa tietoturvalokeja. Lisäksi investoimme automaatioon, jossa mallimme testaavat näitä rajoja jatkuvasti simuloiduilla hyökkäyksillä.

Yhdessä nämä valvontatoimet muodostavat monikerroksisen suojan ja auttavat suojaamaan tutkimusympäristöämme hyökkäyksiltä. Edellytämme tällä hetkellä tiukimpia turvatoimia Astraa tai kybermalleja sisältäviltä työkuormilta, sillä olemme arvioineet Astra-mallien kyberkykyjen voivan olla kriittisellä tasolla. Nämä suojatoimet koskevat myös kaikkia muita kyberalaan liittyviä työkuormia.

Osa Astran koulutuksesta ja arvioinneista täyttää nämä vaatimukset, mutta merkittävä määrä työkuormia on edelleen keskeytettynä, kunnes ne on siirretty kokonaan uusiin ympäristöihin ja niitä on vahvistettu uuden turvallisuustason mukaisiksi. Siirrämme turvallisuuteen ja linjaukseen liittyvät työkuormat uusiin ympäristöihin ensisijaisesti.

Ajatusketjun valvonnan laajentaminen

Valvonta on jo pitkään ollut tärkeä osa mallikehitysprosessiamme. Siihen kuuluu muun muassa sisäisten koodausagenttien valvonta ja pitkäkestoisten istuntojen valvonta. Valvontamme keskittyi erityisesti edistyneiden mallien sisäisiin käyttöönottoihin ja niiden RL-koulutusajoihin. Pidimme niitä suurimman riskin työkuormina, koska niissä edistyneet mallikyvyt voivat yhdistyä työkalujen, arkaluonteisten järjestelmien sekä sisäisten tai ulkoisten verkkojen käyttöön. Valvontaa ei sovellettu kaikkiin työkaluja käyttäviin päättely- ja koulutusajoihin. Olemme uudistaneet ja laajentaneet lähestymistapaamme uuden valvontajärjestelmämme avulla.

Uusi valvontajärjestelmä on monivaiheinen. Se alkaa aktivaatioluokittimista eli mallin sisäistä toimintaa tarkastavista tunnistimista, jotka toimivat jokaisen otokseen valitun tokenin kohdalla ja siirtävät mahdolliset huolenaiheet yhä kehittyneempien ja enemmän laskentatehoa käyttävien automatisoitujen tutkijoiden käsiteltäviksi. Nämä järjestelmät tarkastelevat työkalutoimia, saatavilla olevaa päättelyä ja koko toimintaketjua havaitakseen luvattoman käytön, tietovarkaudet, tuhoisan toiminnan sekä yritykset kiertää suojatoimia. Tavoitteenamme on lähettää hälytys 30 minuutin kuluessa siitä, kun valvontajärjestelmämme havaitsee huolestuttavaa toimintaa. Jos valvontajärjestelmä tunnistaa kriittisen turvallisuusrajan todennäköisen rikkomisen, se luo korkeimman prioriteetin hälytyksen. Nykyisessä toteutuksessamme turvallisuus-, tietoturva- ja tutkimustiimit saavat kiireellisen hälytyksen. Jos tiimit eivät pysty 30 minuutissa osoittamaan varmasti, että havainto on väärä positiivinen tulos, niiden odotetaan keskeyttävän toiminta.

Tätä valvontaa edellytetään kaikessa työkaluja sisältävässä RL-koulutuksessa ja arvioinnissa malleille, joiden kyvykkyys on Sol-tasolla tai sitä korkeampi. Kun totesimme 7. elokuuta, että Astralla saattaa olla kriittisiä kyberkykyjä, lisäsimme valvontavaatimuksen kaikkeen Astran työkaluja käyttävään päättelyyn, emme vain RL-koulutukseen ja arviointeihin.

Nämä suojatoimet vaativat merkittävästi laskentatehoa. Nykyisten arvioidemme mukaan valvonnan lisäkuorma on noin 20 prosenttia valvottavan päättelyn laskentatehosta, vaikka kustannukset vaihtelevat huomattavasti koulutus- ja arviointityökuormien välillä. Kerromme järjestelmästä tarkemmin tulevassa blogikirjoituksessa.

Linjaustutkimuksen edistäminen

Linjaustutkimus on keskeinen osa tehtäväämme. Tehtävämme on varmistaa, että yleinen tekoäly hyödyttää koko ihmiskuntaa. Kun mallit saavat edistyneitä kykyjä, kuten kyvyn tehdä kyberhyökkäyksiä, ja toimivat entistä monimutkaisemmissa ympäristöissä, linjaamaton käyttäytyminen, kuten palkkiohakkerointi (keinojen löytäminen suurten koulutuspalkkioiden saamiseksi ilman tavoitellun tuloksen todellista saavuttamista), harhauttaminen tai luvaton käyttö, aiheuttaa yhä vakavampia riskejä.

Sovellamme nyt keskeisiä linjaustekniikoitamme kyvykkäimpien mallien RL-ajoissa entistä useammissa koulutusprosessin vaiheissa. Tähän kuuluu palkkiomallien parantaminen, jotta ne tunnistavat ja ehkäisevät turvatonta käyttäytymistä paremmin eri tehtävissä ja ympäristöissä; mallien kouluttaminen kertomaan toimistaan, kyvyistään ja rajoituksistaan rehellisemmin; sekä palkkioiden, arvioijien, työkalujen tai valvonnan heikkouksia hyödyntävän käyttäytymisen vähentäminen. Lisäämme myös koulutuksen kattavuutta sellaisen käyttäytymisen osalta, joka voi aiheuttaa haittaa mallien käyttäessä ulkoisia järjestelmiä tai resursseja.

Jatkamme voimakkaita investointeja linjaustutkimukseen, laajennamme arviointien kattavuutta ja hyödynnämme oppimaamme koulutuksen ja suojatoimien kehittämisessä. Aiomme kertoa lähitulevaisuudessa huomattavasti lisää linjaustutkimuksestamme, kuten siitä, mitä opimme mallien käyttäytymisestä ja millaisia uusia haasteita löydämme.

Mitä seuraavaksi

Kehitämme Valmiuskehystämme niin, että nämä suojatoimet yhdistyvät koulutuksessa ja käyttöönotossa ja että kehys kuvastaa paremmin tulevien mallien kyvykkyyksiä ja niiden toimintaympäristöjä. Näiden kyvykkyyksien mukana skaalautuvien menetelmien kehittäminen edellyttää jatkuvia investointeja malliavusteiseen turvallisuuteen, tehokkaampaan valvontaan ja linjaustutkimuksen edistämiseen. Aiomme ottaa ulkopuolisia organisaatioita mukaan ja jakaa enemmän oppimaamme lähestymistapamme kehittyessä.

Edistyneiden mallien kyvykkyydet kasvavat nopeasti. Kykymme ymmärtää, linjata ja suojata niitä on pysyttävä kehityksen edellä.


*Julkaisemme tulevina viikkoina teknisen raportin oppimastamme.

Tekijä

OpenAI