OpenAI ja Hugging Face ratkovat yhdessä mallin arvioinnin aikaista tietoturvapoikkeamaa
Teemme perusteellista arviointia yhdessä ulkopuolisten neuvonantajien kanssa turvallisuus- ja suojelukomitean valvonnassa. Kun tarkastelu on valmis, julkaisemme teknisen raportin havainnoistamme tulevien viikkojen aikana.
Päivitys 28.7.2026:
- Yksikään tulevaan julkaisuun suunnitelluista malleista ei ollut mukana Hugging Facen hyväksikäytössä. Blogikirjoituksessamme mainittu ennakkojulkaisuvaiheen malli on vain sisäiseen käyttöön tarkoitettu tutkimusprototyyppi, eikä sitä ole koskaan tarkoitettu julkaistavaksi yleisölle. Tapauksen jälkeen poistimme sen käytöstä, salasimme sen ja rajoitimme sen saatavuutta tutkimustarkoituksiin.
- ExploitGym-arviointiympäristö ei tarjonnut malleille suoraa Internet-yhteyttä. Saadakseen pääsyn Internetiin mallit tunnistivat ja hyödynsivät aiemmin tuntematonta nollapäivähaavoittuvuutta Artifactoryssa(avautuu uudessa ikkunassa), joka on pakettirekisterin välimuistivälityspalvelin. Ilmoitimme tästä haavoittuvuudesta toimittajalle yhdessä muiden Artifactory-haavoittuvuuksien kanssa, jotka mallimme tunnistivat osana tarkastustamme.
- Jatkamme yhteistyötä Hugging Facen kanssa, muun muassa antamalla panoksemme heidän jälkiselvitykseensä(avautuu uudessa ikkunassa), samalla kun oma tarkastuksemme jatkuu. Olemme myös lisänneet heidät Trusted Access for Cyber -ohjelmaamme.
- Tähänastisen tarkastelumme perusteella emme ole havainneet mitään muuta toimintaa, joka olisi vakavuudeltaan tai laajuudeltaan samalla tasolla kuin Hugging Faceen liittyen jakamamme tiedot, joissa oli kyse alustatason tietoturvaloukkauksesta.
- Hugging Face -tietomurtoa ja malliemme laajempaa toimintaa koskevassa jatkuvassa tarkastelussamme olemme havainneet pienen määrän tapauksia, joissa mallit tunnistivat ja käyttivät julkisesti paljastuneita tunnistetietoja tilitasolla muissa julkisesti saatavilla olevissa palveluissa. Tähän sisältyy neljä tiliä neljässä palvelussa osana Hugging Face -tapausta (sekä muutama tili, joihin on päästy käsiksi muiden arviointien yhteydessä). Yhtä näistä neljästä tilistä käytettiin lähtevän liikenteen välityspisteenä ja välityspolkuna, ja toista tiliä käytettiin tietojen tallennukseen. Jäljelle jääneitä kahta tiliä mallit käyttivät ainoastaan lukuoikeuksin, eikä niitä käytetty Hugging Facen vaarantamisen edistämiseen. Ilmoitamme jatkossakin suoraan palveluiden omistajille, emmekä ole havainneet näyttöä laajemmista vaikutuksista näihin palveluntarjoajiin tai muihin tileihin näiden palveluissa.
- Mallit käyttivät lisäksi useita julkisesti saatavilla olevia palveluja, kuten koodin jakamiseen tarkoitettuja sivustoja, pyyntöjen sieppauspalveluja, kuvakaappauspalveluja ja muita verkkotyökaluja. Näissä tapauksissa ei tapahtunut alusta- tai tilitason vaarantumista.
- Suhtaudumme vakavasti vastuuseemme tunnistaa yhä kyvykkäämmistä tekoälyjärjestelmistä aiheutuvia riskejä ja varautua niihin. Kun olemme saaneet arviointimme päätökseen, käymme sen läpi turvallisuus- ja tietoturvakomitean sekä turvallisuuden neuvonantajaryhmän kanssa oman valmiuskehyksemme mukaisesti.
Viime viikolla Hugging Face kertoi uudenlaisesta tietoturvapoikkeamasta(avautuu uudessa ikkunassa) havaittuaan ja eristettyään tekoälyagentin, joka oli vaarantanut sen infrastruktuurin. Odotamme tällaisen yleistyvän, kun kyberkyvyiltään yhä vahvemmat mallit leviävät laajempaan käyttöön. Tutkinnan jälkeen tiedämme nyt, että tämän nimenomaisen tapauksen taustalla oli OpenAI:n mallien yhdistelmä – mukaan lukien GPT‑5.6 Sol ja vielä kyvykkäämpi ennakkojulkaisun malli, joissa kaikissa kyberaiheisia kieltäytymisiä oli vähennetty arviointia varten – kun niitä testattiin sisäisesti kyberkyvykkyyksien vertailutestissä(avautuu uudessa ikkunassa).
Pidämme tätä tapausta ennennäkemättömänä kybertapahtumana, johon liittyi huipputason kyberkyvykkyyksiä, ja vastaamme siihen sen mukaisesti. Jaamme tässä vaiheessa alustavia havaintoja, jotta puolustajat ymmärtäisivät, mitä tapahtui, ja jotta käsitys mallien nykyisistä kyvyistä tarkentuisi. Jatkamme perusteellista tutkintaa yhdessä Hugging Facen kanssa ja jaamme lisätietoja haavoittuvuuksista, tapauksesta ja havainnoista, kun tutkintamme on valmis.
Tämä tapaus sattui sisäisen arvioinnin aikana. Siinä mallit ohjataan tavoittelemaan edistynyttä hyväksikäyttöä monimutkaisten hyökkäysreittien kautta, jotta niiden kyberkyvykkyyksiä voidaan mitata. Arvioimme suurimmat mahdolliset kyberkyvykkyydet ajamalla tämän arvioinnin ilman tuotannon luokittimia, joilla estetään malleja tavoittelemasta korkean riskin kybertoimintaa. Vertailutestimme ajetaan erittäin eristetyssä ympäristössä, jossa verkkoyhteys on rajattu mahdollisuuteen asentaa paketteja sisäisesti ylläpidetyn kolmannen osapuolen ohjelmiston kautta. Se toimii välityspalvelimena ja välimuistina pakettirekistereille.
Mallit tunnistivat ja ketjuttivat haavoittuvuuksia OpenAI:n tutkimusympäristössä ja Hugging Facen tuotantoinfrastruktuurissa saadakseen testiratkaisuja suoraan Hugging Facen tuotantotietokannasta. Kaikki todisteet viittaavat siihen, että mallit keskittyivät poikkeuksellisen voimakkaasti löytämään ratkaisun ExploitGymiin ja menivät äärimmäisen pitkälle saavuttaakseen varsin kapean testitavoitteen.
Toimiessaan eristetyssä testiympäristössämme mallimme käyttivät huomattavan määrän päättelylaskentaa löytääkseen keinon saada avoin internetyhteys, jotta ne voisivat ratkaista arviointitehtävän. Pääsyn saadakseen mallit tunnistivat ja hyödynsivät nollapäivähaavoittuvuutta pakettirekisterien välimuistivälityspalvelimessa. Olemme nyt ilmoittaneet haavoittuvuudesta vastuullisesti toimittajalle. Tämän pääsyn avulla mallimme tekivät tutkimustestiympäristössämme sarjan käyttöoikeuksien laajentamis- ja sivuttaissiirtymätoimia, kunnes ne pääsivät solmuun, jolla oli internetyhteys.
Saatuaan internetyhteyden mallit päättelivät, että Hugging Face mahdollisesti isännöi malleja, tietoaineistoja ja ratkaisuja ExploitGymiin. Tämän tiedon perusteella malli etsi ja löysi onnistuneesti tapoja päästä käsiksi salaisiin tietoihin, joita se voisi käyttää arvioinnissa huijaamiseen. Yhdessä esimerkissä malli ketjutti useita hyökkäysvektoreita, kuten varastettujen tunnistetietojen ja nollapäivähaavoittuvuuksien käytön, löytääkseen etäkoodin suoritusreitin Hugging Facen palvelimille. OpenAI:n tietoturvatiimi havaitsi tämän poikkeavan toiminnan sisäisesti.
Hugging Facen tietoturvatiimi ja agentit havaitsivat ja pysäyttivät toiminnan heidän infrastruktuurissaan. He olivat jo aloittaneet eristämisen ja forensisen jälleenrakennuksen omilla avoimen lähdekoodin malleillaan, kun tiimimme ottivat yhteyttä. Teemme heidän kanssaan aktiivisesti työtä tapauksen tutkinnan jatkamiseksi. Olemme kiitollisia Hugging Facen nopeasta ja tiiviistä yhteistyöstä tutkinnassa ja korjaavissa toimissa.
- Osana tutkintaa otamme käyttöön tiukat infrastruktuurin määritysvalvonnat tutkimusvauhdin kustannuksella siksi aikaa, kun haavoittuvuuksia korjataan. Tiedotamme turvallisuuskomiteallemme säännöllisesti näistä valvonnoista ja niiden vaikutuksista.
- Teemme Hugging Facen kanssa forensista tutkintaa tapauksesta.
- Olemme vastuullisesti ilmoittaneet tunnistetusta nollapäivähaavoittuvuudesta sisäisesti ylläpidetyssä kolmannen osapuolen ohjelmistossa ja teemme heidän kanssaan työtä korjauksen eteen.
- Olemme ottaneet Hugging Facen mukaan luotetun käytön ohjelmaan ja tuemme heidän tiimejään siinä, että ne voivat nopeasti hyödyntää malliemme kyvykkyyksiä puolustuksensa parantamiseen.
- Parannamme tulevien koulutusten ja arviointien suojauksia ja lisäämme niihin vahvempia suojaustoimia. Tällä viikolla julkaisimme blogikirjoituksen turvallisuuden ja linjauksen parantamisesta pitkän aikajänteen mallien aikakaudella. Näitä käyttöönoton suojatoimia ei tarkoituksella otettu käyttöön tässä arvioinnissa, koska sen tavoitteena oli testata kyberhaavoittuvuuksia. Tämä tapaus osoittaa, että mallimme linjausta, kybersuojauksia arvioinnin aikana ja sisäisen testauksen valvontaa on vahvistettava entisestään.
Kuten äskettäin kerroimme, tekoäly nopeuttaa haavoittuvuuksien löytämistä ja hyödyntämistä. Tämän tapauksen tärkein opetus on, että mallien tietoturvan ja turvallisuuden on pysyttävä nopeasti kehittyvien kyvykkyyksien tahdissa. Vahvistamme mallien kehityksessä käytettäviä eristämisen, valvonnan, käyttöoikeuksien hallinnan ja arvioinnin käytäntöjä.
UK AISI:n arviointi osoittaa, että GPT‑5.6 Solin kaltaiset mallit pystyvät yhä paremmin ylläpitämään monimutkaisia, monivaiheisia kyberoperaatioita pitkien aikajänteiden yli. Tämä tapaus viittaa siihen, että nämä teoreettiset kyvykkyydet pätevät myös todellisissa ympäristöissä.

Tapaus tekee myös selväksi, että edistyneet mallit voivat löytää ja hyödyntää uusia hyökkäysreittejä todellisissa järjestelmissä ilman pääsyä lähdekoodiin. Se korostaa, että edistyneitä kyberkyvykkyyksiä on kehitettävä yhdessä vahvempien suojatoimien ja puolustustyökalujen kanssa.
Uskomme, että edistyneitä kyberkyvykkyyksiä sisältävien mallien on autettava tietoturvatiimejä löytämään heikkoudet ennen hyökkääjiä, ymmärtämään, miten haavoittuvuuksia voidaan ketjuttaa, ja korjaamaan ne koneen nopeudella. Hyödynnämme näitä kyvykkyyksiä jatkaaksemme infrastruktuurin määritysten ja mallien arviointiympäristöjen suojausten vahvistamista. Jaamme havaintomme ja parhaat käytäntömme sitä mukaa kuin opimme. Kannustamme muita puolustajia hakemaan luotettua käyttöoikeutta ja kokeilemaan näitä malleja jo nyt, jotta nämä kyvykkyydet voidaan muuttaa paremmaksi ennaltaehkäisyksi, nopeammaksi havaitsemiseksi ja tehokkaammaksi poikkeamiin reagoinniksi.
”Olemme kiitollisia yhteistyöstä OpenAI:n kanssa tämän ja muiden aiheiden parissa. Tämä mahdollisesti ensimmäinen laatuaan oleva tapaus osoittaa todeksi näkemyksen, johon olemme jo pitkään uskoneet: tekoälyturvallisuutta ei saada ratkaistua minkään yksittäisen salassa työskentelevän yrityksen voimin. Se ratkaistaan avoimesti, yhteistyössä, ja niin, että tekoäly on laajasti jokaisen puolustajan saatavilla kaikkialla.”


