OpenAI-malleja koskevat kolmansien osapuolten kyberarvioinnit
Riippumaton testaus auttaa merkittävästi riskien todentamisessa ja ymmärtämisessä ennen käyttöönottoa. Joissakin kyberarvioinneissa käytetään tarkoituksella mukautettuja määrityksiä ja kevennettyjä suojatoimia, jotta voidaan mitata mallien varsinaista kyvykkyyttä – ei niiden tavanomaista toimintaa julkisissa käyttöympäristöissä.
Kaksi ulkopuolista testauskumppania havaitsi viimeaikaisissa arvioinneissa tapauksia, joissa testausmääritykset ja valvontatoimet yhdessä uusien mallien kehittyneiden kykyjen kanssa mahdollistivat mallien toiminnan ulottumisen niille tarkoitettujen testausrajojen ulkopuolelle. Tapaukset korostavat alan laajuisen ja ulkopuolisten arvioijien kanssa tehtävän yhteistyön merkitystä, jotta testausympäristöjen ja -käytäntöjen standardit kehittyvät mallien kyvykkyyden kasvaessa. Toimittajan huomautus: Nämä tapaukset eivät liity Hugging Face -tietoturvatapaukseen. Jatkamme Hugging Face -tapauksen päivitysten julkaisemista täällä.
Uusissa tapauksissa OpenAI-mallit pääsivät julkiseen internetiin kolmansien osapuolten kyberarviointien aikana erityisolosuhteissa ja kevennetyin suojatoimin, jotka eivät vastanneet tavanomaista käyttöönottoa. Tapaukset olivat seuraavat:
- Yhdistyneen kuningaskunnan hallituksen AI Security Institute eli UK AISI toteutti kyberharjoitusympäristössä arviointeja, joissa internetyhteys oli tarkoituksella käytössä. Näin agentit pystyivät etsimään omat työkalunsa ja toimimaan lähempänä todellisen hyökkääjän olosuhteita. Myös kyberturvallisuusluokittimet oli poistettu käytöstä varsinaisen kyvykkyyden mittaamiseksi. Voit lukea sen blogikirjoituksen täältä.(avautuu uudessa ikkunassa)
- Ulkopuolinen kyberturvallisuuden testauskumppanimme Irregular toteutti internetistä eristettäviksi tarkoitettuja Capture the Flag -tyylisiä arviointeja, mutta testausympäristön virheellinen määritys mahdollisti mallien pääsyn julkiseen internetiin.
Seuraavassa kerromme tapahtumista, toiminnan mahdollistaneista testausolosuhteista, sen rajaamiseksi tehdyistä toimista ja siitä, miten varmistamme riippumattomien laboratorioiden mahdollisuudet arvioida yhä kyvykkäämpiä malleja perusteellisesti ja turvallisesti.
Tapaukset osoittavat saman laajemman haasteen, jota käsittelimme äskettäisessä Hugging Face -tapausta koskevassa kirjoituksessamme: mallien kykyjen kehittyessä myös niitä ympäröivien tietoturva- ja turvallisuusjärjestelmien on kehityttävä. Tämä koskee sekä mallien kehittämiseen käytettäviä ympäristöjä että laboratorioiden ja riippumattomien kumppanien arviointiympäristöjä.
Tarkastelemme lähiviikkoina omaa lähestymistapaamme kolmansien osapuolten testaukseen. Arvioimme muun muassa sitä, miten tunnistamme tavallista riskialttiimmat arvioinnit, sovimme niiden laajuudesta, käsittelemme internetyhteyttä tai suojatoimien keventämistä koskevat pyynnöt, määritämme eristystä, tunnusten käsittelyä, valvontaa ja keskeytysehtoja koskevat odotukset sekä luomme selkeämmät prosessit tapauksista ilmoittamiseen ja niiden eskalointiin.
Olemme sitoutuneet vahvistamaan koko alan yhteisiä käytäntöjä suuren riskin arviointien turvalliseen toteuttamiseen. Kutsumme lähiviikkoina yhteen muun muassa kansallisia tekoälyinstituutteja, riippumattomia arvioijia, muita tekoälylaboratorioita ja muita sidosryhmiä. Tavoitteemme on säilyttää perusteellisen riippumattoman arvioinnin arvo ja samalla varmistaa, että testauskäytännöt kehittyvät yhä kyvykkäämpien mallien tahdissa.
UK AISI kertoi meille 3. elokuuta, että OpenAI:n ja toisen laboratorion mallit olivat joissakin tapauksissa ylittäneet testauksen rajat 25. heinäkuuta alkaneen tavanomaisen kyberarvioinnin aikana. Arviointi tehtiin valvotuissa kyberharjoitusympäristöissä, jotka oli suunniteltu jäljittelemään todellisia verkkoja. Tunnistetuista 19 tapahtumasta kahdessa oli osallisena OpenAI-malli GPT‑5.6 Sol. Muissa tapauksissa kyse oli toisen laboratorion malleista.
Tässä arvioinnissa agentteja ohjeistettiin toimimaan kyberturvallisuusasiantuntijoina Capture the Flag -harjoituksessa: murtautumaan kolmeen toisiinsa yhdistettyyn simuloituun ympäristöön ja hakemaan lopullinen lippu. Tehtävän kehotteessa määritettiin arviointiin kuuluvat testialueen verkot ja nimettiin useita sen ulkopuolelle rajattuja järjestelmiä. UK AISI mahdollisti myös suoran internetyhteyden, jotta agentit voisivat ladata työkaluja ja toimia lähempänä todellisen ihmishyökkääjän olosuhteita. Lisäksi se poisti mallin kyberturvallisuusluokittimet käytöstä varsinaisen kyvykkyyden mittaamiseksi.
UK AISI:n tarkoittama valtuutuksen raja oli simuloitu kyberharjoitusympäristö: agenteilla oli lupa hyökätä määritettyihin simuloituihin verkkoihin ja hakea lippu, mutta ei käyttää testialueen verkkorajojen ulkopuolisia järjestelmiä. Agenteille ei kuitenkaan kerrottu yksiselitteisesti, miten ne saivat ja eivät saaneet käyttää avointa internetyhteyttä. UK AISI pitää tätä yhtenä tapaukseen mahdollisesti vaikuttaneena syynä.
Näissä ajoissa UK AISI havaitsi GPT‑5.6 Solin tehneen kaksi luvatonta toimenpidettä yrittäessään löytää reitin simuloituun testialueeseen ja hakea lipun:
- GPT‑5.6 Sol käytti toisen laboratorion agentin julkisesti saataville jättämää GitHub-tokenia tarkistaakseen, hakiko harjoitusympäristön järjestelmä päivityksiä GitHubista tai muusta päivityspalvelusta. Se kokeili tilinpalautuksen ja pyyntörajoitusten kiertokeinoja sekä rekisteröi tilejä ulkoisille DNS- ja tunnelointipalveluntarjoajille.
- GPT‑5.6 Sol käytti julkista tunnelointipalvelua, jotta sen arviointiympäristössä paikallisesti toimiva DNS-palvelin olisi saavutettavissa julkisesta internetistä. Palvelimella oli hyötykuormia, jotka oli tarkoitettu testialueella käytetyn ohjelmiston tunnetun haavoittuvuuden hyödyntämiseen. Järjestely ei toiminut, eikä ole näyttöä siitä, että mikään todellinen resolveri olisi tehnyt sille kyselyjä. Infrastruktuuri poistettiin arvioinnin päätyttyä.
Vaikka malli yritti suorittaa kyberharjoituksen loppuun, UK AISI piti toimia luvattomina, sillä niissä käytettiin testialueen ulkopuolisia todellisia ulkoisia tilejä ja palveluja eikä niitä tarvittu tehtävän suorittamiseen. DNS-palvelin myös tarjosi julkisessa internetissä haavoittuvuuksien hyödyntämiseen tarkoitettuja hyötykuormia, vaikka järjestely ei toiminut eikä ole näyttöä siitä, että mikään todellinen resolveri olisi tehnyt sille kyselyjä.
UK AISI havaitsi toiminnan 28. heinäkuuta, kun tietoturvavalvonta tunnisti epätavallisia tiedonsiirtoja. Se keskeytti asiaan liittyvät arvioinnit, eristi kyseiset koneet ja rajasi toiminnan noin tunnin kuluessa havaitsemisesta.
Arvostamme UK AISI:n kumppanuutta koko prosessin ajan, mukaan lukien sen työtä toiminnan tunnistamiseksi ja tutkimiseksi sekä sitä koskevien tietojen jakamiseksi. Odotamme yhteistyömme jatkumista.
Yksi ulkopuolisista arviointikumppaneistamme, Irregular, ilmoitti meille 29. heinäkuuta tapauksesta, joka koski OpenAI-malleja Capture the Flag (CTF) -tyylisissä kyberturvallisuusarvioinneissa. Malleja ohjeistettiin etsimään piilotettua tietoa hyödyntämällä simuloidun ympäristön heikkouksia, ja niille kerrottiin, ettei niillä ollut internetyhteyttä. Testausympäristön virheellinen määritys kuitenkin mahdollisti mallien pääsyn julkiseen internetiin.
Yhdessä testissä CTF-haasteen kuvitteellisen kohteen nimi vastasi tahattomasti todellista verkkotunnusta. Koska testausympäristö oli yhdistetty internetiin erehdyksessä, malli hyödynsi todellisen verkkosivuston haavoittuvuutta luullen sivustoa osaksi simuloitua ympäristöä. Kyse ei ollut kehittyneestä eristysympäristöstä murtautumisesta tai nollapäivähaavoittuvuudesta: internetyhteys johtui virheellisestä määrityksestä, ja malli vaikutti hyödyntäneen yksinkertaista tietoturvahaavoittuvuutta.
Irregularin tutkimuksen perusteella malli myös löysi tunnukset ja käytti niitä saman sivuston hallintaan. Irregular ei ole havainnut vaikutuksia kyseisen sivuston omien tietojen ulkopuolella, ja sen tarkastus jatkuu. Se on keskeyttänyt arvioinnit ja aloittanut korjaustoimet, ja vaikutusten kohteena olleille kolmansille osapuolille on ilmoitettu. Irregular on kertonut meille, etteivät mitkään tapaukseen liittyvät havaitut ongelmat ole enää aktiivisia ja että testausympäristöön on lisätty tarvittavat suojatoimet. Irregular on myös tiedottanut samaan testausympäristöön liittyvistä tapauksista, joissa oli mukana muita laboratorioita.
Arvostamme Irregularin kumppanuutta ja jatkamme tiivistä yhteistyötä tukeaksemme sen selvitystä. Irregular laatii myös white paper -julkaisua, jossa jaetaan parhaita käytäntöjä toiminnan rajaamiseen ja kyberarviointien turvalliseen toteuttamiseen. Odotamme osallistumista white paper -julkaisuun, jotta havainnot saadaan yhteisön käyttöön, sekä kumppanuutemme jatkamista. Pidämme tällaista yhteistyötä välttämättömänä nykyisten ja tulevien mallien turvallisen ja perusteellisen arvioinnin varmistamiseksi.


