Siirry pääsisältöön
OpenAI

1. syyskuuta 2026

TurvallisuusTurvallisuus

Tie Astraan: kriittiset kyvykkyydet ja edistyneet suojatoimet

Ladataan...

Sen jälkeen kun aiemmin arvioimme Astran voivan saavuttaa kyberturvallisuuskyvyiltään kriittisen tason, olemme keränneet lisää näyttöä ja arvioineet mallin kyvykkyyksiä uusilla testeillä. Arvioimme nyt Astran täyttävän Valmiuskehyksemme kriittisten kyberturvallisuuskykyjen raja-arvon. Oikeilla työkaluilla ja käyttöoikeuksilla se voi siis löytää aiemmin tuntemattomia tietoturva-aukkoja ja kehittää keinoja niiden hyödyntämiseen monissa hyvin suojatuissa järjestelmissä ilman ihmisen ohjausta jokaisessa vaiheessa. Astra on ensimmäinen tälle tasolle luokittelemamme malli, joten se edellyttää vahvempia suojatoimia kehityksen aikana ja ennen julkaisua.

Olemme viime viikkoina lykänneet osia Astran kehityksestä ja julkaisusta samalla, kun olemme vahvistaneet ja testanneet suojausta kyberväärinkäyttöä ja mallin luvatonta toimintaa vastaan. Tämän työn perusteella uskomme Astran suojatoimien pienentävän vakavan vahingon riskiä riittävästi, jotta malli voidaan julkaista Valmiuskehyksemme mukaisesti.

Vaikka Astra ei liittynyt Hugging Face -välikohtaukseen, olemme sisällyttäneet välikohtauksesta saadut opit(avautuu uudessa ikkunassa) turvallisuustyöhömme. Jälkikäteen tehdyn testauksen perusteella uskomme, että silloiset tuotannon suojatoimemme olisivat estäneet Hugging Face -välikohtauksen. Olemme sittemmin ottaneet Astrassa käyttöön vielä vahvempia suojatoimia. Olemme muun muassa kouluttaneet mallia kieltäytymään haitallisista kyberpyynnöistä entistä luotettavammin ja noudattamaan turvallisuusrajoituksia, lisänneet suojausta väärinkäyttöä vastaan sekä ottaneet käyttöön valvonnan, joka voi pysäyttää mahdollisesti luvattoman toiminnan.

Aiomme tuoda Astran pian saataville, mutta sen edistyneimpien kyberturvallisuuskykyjen käyttöoikeuksia rajoitetaan enemmän. Edistynyt kyberturvallisuustyö tulee aluksi testaajaryhmän käyttöön. Tämän jälkeen käyttöoikeuksia laajennetaan Daybreak Bluen kautta puolustavan käytön lisäämiseksi.

Kerromme julkaisun yhteydessä mallin järjestelmäkortissa tarkemmin turvallisuutta, tietoturvaa ja kohdistusta koskevista testeistämme ja arvioinneistamme. Ennen julkaisua haluamme kertoa työstä, jolla valmistaudumme julkaisemaan näin kyberturvallisuuskyvykkään mallin turvallisesti, sekä kuvata avoimesti jäljellä olevat riskit.

Astran kyberturvallisuuskykyjen arviointi

Valmiuskehyksemme mukaan malli saavuttaa kriittisen raja-arvon, jos jompikumpi seuraavista ehdoista täyttyy:

  • Malli pystyy ilman ihmisen apua tunnistamaan ja kehittämään toimivia, kaikentasoisia nollapäivähaavoittuvuuksien hyödyntämismenetelmiä monissa vahvasti suojatuissa, todellisen maailman kriittisissä järjestelmissä.
  • Malli pystyy pelkän ylätason tavoitteen perusteella suunnittelemaan ja toteuttamaan alusta loppuun uusia kyberhyökkäysstrategioita vahvasti suojattuja kohteita vastaan.

Astran valmiusarvioinnissa yhdistettiin automatisoidut julkiset ja yksityiset vertailutestit asiantuntijavetoisiin arviointeihin. Astran kyberturvallisuuskyvyt ovat merkittävästi GPT‑5.6 Solia paremmat: se käyttää tokeneita huomattavasti tehokkaammin ja tunnistaa haavoittuvuuksia sekä kehittää niiden hyödyntämismenetelmiä paremmin.

Yhdessä testissä Astra saavutti ExploitBench-vertailutestissä täydet 100 %. Testi arvioi mallin kykyä kehittää hyödyntämismenetelmiä tunnetuista haavoittuvuuksista.

Tietojen mahdollisen sekoittumisen vuoksi rakensimme tämän jälkeen sisäisen vertailutestin nimeltä ”ExploitBench – sisäinen porttaus (kesä–elokuu 2026)”. Se sisältää 20 vakavaa V8-haavoittuvuutta, jotka julkistettiin myöhemmin. Tässä aineistossa Astra saavuttaa GPT‑5.6 Solia huomattavasti useammin mielivaltaisen koodin suorittamisen käyttämällä paljon vähemmän tulostokeneita. Arvioinnin aikana malli jopa löysi kaksi nollapäivähaavoittuvuutta ja käytti niitä osana hyödyntämisketjua. Olemme ilmoittamassa näistä kahdesta haavoittuvuudesta ylläpitäjille.

Astran tulokset kuvaavat kyvykkyyksiä Daybreak Blue -käyttöoikeudella, eivät tuotannon oletusmäärityksillä.

Asiantuntijavetoisissa arvioinneissa Astra löysi vahvasti suojatusta selaimesta ja käyttöjärjestelmästä aiemmin tuntemattomia haavoittuvuuksia ja muodosti niistä toimivia hyödyntämisketjuja. Se rakensi täydellisen selaimen haltuunottoketjun, joka poistui hiekkalaatikosta ja suoritti komentoja isäntäjärjestelmässä selaimen avatessa HTML-tiedoston. Malli löysi myös useita haavoittuvuuksia vahvasti suojatusta käyttöjärjestelmästä ja yhdisti ne paikalliseksi käyttöoikeuksien korotusketjuksi tavallisesta käyttäjästä root-käyttäjäksi. Tutkimuksemme kokonaisuus on saanut meidät päättelemään, että Astra saavuttaa kriittisen raja-arvon.

Kriittisten kyvykkyyksien edellyttämät suojatoimet

Astran tasoisilla kyberturvallisuuskyvyillä varustettujen mallien vakavan kybervahingon riskiä on pienennettävä kahdella tavalla sekä kehityksen aikana että ennen käyttöönottoa:

  • Haitalliset toimijat käyttävät mallia. Suojatoimiemme on estettävä luotettavasti haitallisia toimijoita käyttämästä Astraa aiemmin tuntemattomien haavoittuvuuksien hyödyntämismenetelmien kehittämiseen vahvasti suojatuissa kriittisissä järjestelmissä tai päästä päähän toteutettaviin hyökkäyksiin vahvasti suojattuja kohteita vastaan.
  • Malli toimii luvattomasti ja tavoitteiden vastaisesti. Edistyneitä kyberturvallisuuskykyjä omaava malli voisi tavoitteiden vastaisesti toimiessaan aiheuttaa kybervahinkoa ilman haitallista käyttäjääkin. Näin kyvykkäiden mallien kohdistukselle asetettavan erittäin korkean vaatimustason lisäksi suojatoimiemme on toisena puolustuskerroksena havaittava ja pysäytettävä nopeasti tavoitteiden vastainen toiminta, joka voisi aiheuttaa merkittävää vahinkoa todellisessa maailmassa.

On tärkeää huomata, että jälkimmäinen koskee sekä sisäistä kehitystä että ulkoista käyttöönottoa. Kuten aiemmin kerroimme, keskeytimme OpenAI–Hugging Face -välikohtauksen jälkeen kahdeksi viikoksi osan edistyneestä koulutuksesta, myös tiettyjä Astran koulutuksia. Tänä aikana vahvistimme koulutusinfrastruktuuriamme muun muassa eristyksellä ja verkkohallinnalla, laajemmalla valvonnalla sekä tehostetulla kohdistuskoulutuksella ja tiukemmilla raja-arvoilla. Jatkoimme sitten pienemmän mittakaavan työtä tiukemmassa valvonnassa.

Lykkäsimme pidempään tiettyjä laajempia vahvistusoppimisajoja (RL), jotka liittyivät Astran tuleviin versioihin, samalla kun asetimme niiden koulutusympäristön turvallisuudelle ja tietoturvalle tiukemmat vaatimukset. Käynnistimme 28. elokuuta uudelleen aiemmin keskeytetyn laajan edistyneen RL-ajon, kun uudet turvallisuus- ja tietoturvavaatimukset oli otettu käyttöön. Lykkäämme edelleen tilapäisesti joitakin pienempiä kokeellisia koulutusajoja.

Astran julkaisun valmistelu on vaatinut myös vahvempaa suojausta kyberväärinkäytöltä ja luvattomalta toiminnalta. Seuraavassa kuvaamme nämä suojatoimet ja niiden testaamisen.

Kyberväärinkäytön kestävyys

Olemme vahvistaneet kyberturvallisuuden suojatoimiamme jokaisen julkaisun yhteydessä siitä lähtien, kun otimme helmikuussa käyttöön ensimmäisen kyberturvallisuuskyvyiltään Korkea-tasoiseksi arvioimamme mallin. Kokonaisturvallisuutemme perustuu jatkokoulutetun mallin kieltäytymisiin, järjestelmätason turvallisuusluokittimiin sekä offline-havaitsemiseen ja uhkien torjuntaan.

Paransimme GPT‑5.6:n(avautuu uudessa ikkunassa) järjestelmätason kokonaisuuden kestävyyttä merkittävästi. Lisäsimme muun muassa aktivointiluokittimia kyberväärinkäytön havaitsemiseen ja paransimme suojausta intensiivisessä automatisoidussa hyökkäävässä tietoturvatestauksessa löydettyä yleistä rajoitusten kiertämistä (jailbreak) vastaan. Näiden parannusten pohjalta olemme panostaneet Astran suojatoimissa entistä enemmän mallikerrokseen ja parantaneet suojatoimien kykyä käsitellä keskustelujen välistä kontekstia.

  • Mallin kestävyyttä parantavien uusien koulutustekniikoiden ansiosta Astra kieltäytyy luotettavammin kiellettyä kyberapua koskevista pyynnöistä. Kyberturvallisuuden rajoitusten kiertämistä koskevissa arvioinneissamme Astra kieltäytyy 91,5 prosentista pyynnöistä, kun GPT‑5.6 Solin vastaava osuus on 59 %.
  • Suuremman riskin tileihin sovellamme varovaisempaa mallin toimintarajaa, jolloin se kieltäytyy laajemmin mahdollisesti riskialttiista kyberavusta. Olemme laajentaneet valvontajärjestelmiemme kontekstia, jotta voimme havaita tällaisen kyberväärinkäytön suuren riskin käyttäjien kohdalla.

Olemme myös jatkaneet perusteellista testausta, sisäistä ja ulkoista hyökkäävää tietoturvatestausta sekä havaittujen ongelmien korjaamista. Regressiotestauksella varmistamme, että kaikki aiemmilla testausjaksoilla löydetyt rajoitusten kiertämistavat on yhä huomioitu. Lisäksi toteutamme uuden hyökkäävän tietoturvatestauksen kierroksen uusimmilla sisäisillä hyökkäävän tietoturvatestauksen hyökkääjillämme. Määrittelemme alan kumppaneiden kanssa yhteistä järjestelmää rajoitusten kiertämisen arviointiin. Tutkimme uudet havainnot ja reagoimme niihin ympärivuorokautisella nopean toiminnan ohjelmallamme. Kerromme Astran järjestelmäkortissa tarkemmin kyberturvallisuuden suojatoimien testaamisesta.

Puolustajien auttaminen haavoittuvuuksien löytämisessä ja korjaamisessa on edelleen keskeinen osa turvallisuustyötämme. Odotamme Astran suojatoimien aiheuttavan julkaisuvaiheessa väärinkäytön estämiseksi enemmän kitkaa kuin lopulta haluamme. Astran edistyneet kyberturvallisuuden työnkulut tulevat aluksi pienen alfatestaajajoukon käyttöön. Myöhemmin käyttöoikeuksia laajennetaan Daybreak Bluen kautta puolustavan käytön tueksi.

Kohdistus & valvonta

Olemme lisänneet myös kerroksittaisia suojatoimia, joilla estetään mallin mahdollisesti tavoitteiden vastainen toiminta:

  • Mallin kohdistus: Arvioinneissamme Astra noudatti nimenomaisia turvallisuus- ja tietoturvarajoituksia ja pysyi valtuuksiensa rajoissa huomattavasti todennäköisemmin kuin GPT‑5.6 Sol. Se on tähän mennessä parhaiten kohdistettu mallimme. Keskityimme erityisesti siihen, miten malli noudattaa turvallisuus- ja tietoturvarajoituksia ja pysyy valtuuksiensa rajoissa.
  • Valvonta ja hallinta: Sisäisten menettelyjemme tapaan otamme Astrassa käyttöön Ajatusketjun lisävalvontaa, jotta voimme nopeasti havaita ja pysäyttää mahdollisesti tavoitteiden vastaisen toiminnan.

Astra on merkittävä edistysaskel mallien kohdistuksessa ja useiden pitkäaikaisten kohdistushankkeiden huipentuma. Työ ulottuu valmistavan koulutuksen aikaisista toimenpiteistä vahvistusoppimisen huolellisempaan ja johdonmukaisempaan arviointiin. Testauksessa Astra noudattaa nimenomaisia turvallisuusrajoituksia ja varoituksia, kuten automaattitarkastusta, johdonmukaisesti todennäköisemmin kuin GPT 5.6 Sol.

Kehitimme myös Hugging Face -välikohtauksen pohjalta testin, jossa kyberturvallisuusarviointi ExploitGymiä suorittavat agentit murtautuivat kolmannen osapuolen järjestelmiin. Loimme arvioinnin vaikeimmista tehtävistä ”hunajapurkkitestejä”, joilla selvitettiin, yrittäisikö malli murtautua ympäröivään turvallisuusinfrastruktuuriin sille annetun tehtävän ratkaisemisen sijaan. Ilman tuotannon suojatoimia GPT‑5.6 Sol yritti käyttää näitä kohteita 56 prosentissa testeistä. Testit simuloivat vertailutestiympäristöä, jossa mallia käsketään kehittämään haavoittuvuuksien hyödyntämismenetelmiä. Astra ei yrittänyt tätä kertaakaan näissä testeissä. Luvut kuvaavat toimintaa testiolosuhteissa ilman kyberturvallisuuden suojatoimia, eivät normaalia tuotantokäyttöä.

Vasemmalla: Tässä uudessa arvioinnissa tarkastelemme, miten mallit reagoivat automaattitarkastuksen hylkäykseen. Kukin tehtävä sijoittuu tietotyöympäristöön, ja suoritus alkaa heti automaattitarkastuksen hylkäyksen jälkeen. Malli voi tämän jälkeen päättää suorituksen, yrittää löytää turvallisemman vaihtoehdon, yrittää samankaltaista komentoa uudelleen tai hyödyntää puutteellisia määrityksiä(avautuu uudessa ikkunassa) ohittaakseen automaattitarkastuksen kokonaan. Kahden viimeksi mainitun vaihtoehdon tavoittelu merkitsisi arvioinnin epäonnistumista. Astra ei koskaan yrittänyt kiertää automaattitarkastusta.

Oikealla: Tässä arvioinnissa tutkimme mallin taipumusta huijata eli käyttää ”hunajapurkkeja”, kun se kohtaa ExploitGym-arvioinnin vaikeimpia tai mahdottomia tehtäviä. Arviointi suoritettiin simuloidussa ympäristössä, jossa suojatoimet olivat vain havainnointitilassa, jotta mallin käyttäytymistä voitiin arvioida. GPT‑5.6 Sol osoitti näissä tilanteissa suurempaa taipumusta huijaamiseen, mutta Astra ei yrittänyt käyttää tällaisia oikoteitä ja onnistui silti ratkaisemaan joitakin tehtäviä hyväksytyllä tavalla.

Mallien kohdistuskoulutus on yksi turvallisuuden kerros. Kerromme Astran järjestelmäkortissa tarkemmin kohdistustestauksestamme ja sen tuloksista.

Otamme Astran luokan mallien tuotantokäytössä käyttöön myös kohdistuspoikkeamien valvonnan, jotta mahdolliset poikkeamat voidaan havaita ja pysäyttää nopeasti. Nämä suojatoimet muistuttavat sisäisten käyttöönottojemme valvontaa. Luokittimista koostuva järjestelmä tarkistaa mallin päättelyn ja toiminnan luvattoman käyttäytymisen varalta ja pysäyttää mahdollisesti luvattoman toiminnan automaattisesti. Kyvykkyyksien kasvaessa nämä suojatoimet eivät voi korvata mallien hyvää kohdistusta. Tavoitteenamme on kohdistaa tulevat mallit niin hyvin, etteivät nämä suojatoimet koskaan aktivoidu.

Mitä tämä merkitsee käyttäjille

OpenAI haluaa varmistaa, että tekoälyn hyödyt ovat laajasti saatavilla. Astran kyberturvallisuuskykyjen merkittävän kasvun vuoksi varmistamme erityisen huolellisesti, että käyttöönotto on turvallinen. Ylimääräiset turvallisuustarkistukset voivat joskus hidastaa, keskeyttää tai pysäyttää hyväksyttyä työtä, myös puolustavaa kyberturvallisuustyötä.

Järjestelmä voi ajoittain tulkita hyväksytyn toiminnan mahdolliseksi kyberväärinkäytöksi tai luvattomaksi toiminnaksi, jolloin työ saattaa tahattomasti hidastua, keskeytyä tai pysähtyä. Tämä voi koskea myös työtä, joka ei vaikuta liittyvän suoraan kyberturvallisuuteen, tai tehtäviä, joissa agentti toimii pitkään.

Jos kohdistuspoikkeamien valvonta keskeyttää tehtävän, ChatGPT- tai Codex-käyttäjää voidaan pyytää tarkistamaan toiminto ennen jatkamista. Muissa käyttöympäristöissä, kuten APIssa, tehtävä pysähtyy. Aiomme jatkaa suojatoimien säätämistä tarpeettomien keskeytysten vähentämiseksi ja laajentaa edistyneiden kyvykkyyksien saatavuutta Daybreakin kaltaisten ohjelmien kautta.

Katse tulevaan

Olemme siirtymässä tekoälyn kehitysvaiheeseen, jossa mallit voivat hoitaa vaikutuksiltaan merkittävämpiä tehtäviä ja jossa kohdistuksen ja hallinnan epäonnistumisilla voi olla vakavampia seurauksia. Näiden järjestelmien hyötyjen toteutuminen riippuu kyvystämme kohdistaa ja hallita malleja niiden kyvykkyyksien kasvaessa.

Vastuu ulottuu koulutukseen, arviointiin ja käyttöönottoon. Se edellyttää vahvempaa näyttöä tavoitteiden mukaisesta toiminnasta, kyvykkyyksien tahdissa kehittyviä suojatoimia sekä valmiutta hidastaa kehitystä, jos suojaus ei ole riittävä.

Jatkamme näiden järjestelmien testaamista ja oppiemme jakamista sekä kerromme selkeästi, mistä ei vielä ole varmuutta. Astran jälkeiset mallit vaativat meiltä enemmän. Käytämme tarvittavan ajan ja teemme tarvittavan työn täyttääksemme tämän vastuun.