GPT‑Red: itseparannus lisää vankkuutta
Vahvojen automaattisten turvallisuuden hyökkäävien tietoturvatestaajien kouluttamista vankkuuden parantamiseksi.
Yhteenveto
Ongelma
Hyökkäävä tietoturvatestaus on välttämätöntä haavoittuvuuksien löytämiseksi ja malliemme vankkuuden parantamiseksi. Nykyiset lähestymistavat eivät kuitenkaan skaalaudu, mikä muodostaa pullonkaulan.
Uusimmat mallimme ovat jo saturoineet yleisesti käytetyt vankkuusarvioinnit.
Meidän on kehitettävä menetelmiä, joiden avulla turvallisuus ja linjaus voivat skaalautua mallien kyvykkyyksien mukana.
Mitä teimme
Koulutimme GPT‑Redin, automaattisen hyökkäävän tietoturvatestauksen mallin, joka skaalaa kykyämme löytää haavoittuvuuksia, jotta voimme korjata ne ennen laajempaa käyttöönottoa.
GPT‑Red on vahva hyökkäävä tietoturvatestaaja, ja aiemmat mallimme ovat hyvin haavoittuvia sen kehoteinjektiohyökkäyksille.
Käytämme GPT‑Rediä GPT‑5.6:n vastustajapohjaiseen kouluttamiseen, mikä tekee siitä paljon vankemman kehoteinjektioita vastaan.
Jatkamme tämän lähestymistavan skaalaamista ihmisten ja kolmansien osapuolten tekemän hyökkäävän tietoturvatestauksen, kerroksittaisten suojatoimien ja reaaliaikaisen valvonnan rinnalla.
Tekoälyjärjestelmät kohtaavat usein kolmannen osapuolen dataa selainten, yhdistettyjen sovellusten, paikallisten tiedostojen ja muiden työkalujen kautta. Nämä ominaisuudet ovat välttämättömiä tosielämän tehtävien suorittamiseksi, mutta ne luovat myös enemmän mahdollisuuksia haitallisille toimijoille vaikuttaa mallin käyttäytymiseen. Kolmas osapuoli voi esimerkiksi upottaa sähköpostiin, verkkosivulle, työkalun vastaukseen tai koodivarastoon huolellisesti laaditun ohjeen , jonka tarkoituksena on huijata malli lataamaan arkaluonteisia tietoja ulkoiselle palvelimelle.
Ihmisten tekemä hyökkäävä tietoturvatestaus on kriittinen osa turvallisuustyötämme, ja se auttaa meitä havaitsemaan nämä haavoittuvuudet ennen käyttöönottoa ja ottamaan käyttöön oikeat suojatoimet. Mutta pelkästään ihmisten tekemää hyökkäävä tietoturvatestausta on vaikea skaalata. Näiden harjoitusten suunnittelu ja suorittaminen on aikaa vievää, mikä rajoittaa sitä, kuinka nopeasti voimme tunnistaa uusia vikaantumistyyppejä ja sisällyttää ne vahvempiin suojatoimiin. Lisäksi, vaikka nämä harjoitukset tuottavat arvokkaita esimerkkejä onnistuneista hyökkäyksistä, ne eivät pysty tuottamaan sellaista määrää ja monimuotoisuutta hyökkäysdataa, jota tarvitaan mallin vankkuuden parantamiseksi koulutuksen avulla.
Yhä kyvykkäämpien mallien kanssa pysyminen vaatii myös hyökkäävän tietoturvatestauksen käyttöä skaalautumiseen. Tätä varten olemme kouluttaneet automatisoituja, vain sisäiseen käyttöön tarkoitettuja hyökkäävä tietoturvatestauksen malleja, jotka paljastavat haavoittuvuuksia ennen käyttöönottoa ja generoivat hyökkäyksiä mallin koulutuksen aikana parantaakseen sen kestävyyttä. Uskomme, että automaattinen hyökkäävä tietoturvatestaus avaa keskeisen tavan parantaa turvallisuutta: nykyisten mallien käyttäminen tulevien mallien turvallisemmaksi tekemiseen.
GPT‑Red on näiden ponnistelujen huipentuma ja nykyinen paras automatisoitu turvallisuuden hyökkäävä tietoturvatestaus -mallimme. Samalla tavalla kuin hyökkäävä tietoturvatestauskäyttäjät suunnittelevat hyökkäyksiä, malli pyrkii kohti tavoitetta lähettämällä kehotteen, tarkkailemalla GPT‑mallien reaktioita siihen ja toistamalla toimintamallia. Koulutimme GPT‑Rediä OpenAI:n joidenkin suurimpien koulutuksen jälkeisten ajojemme laskentakaavassa – ennennäkemätön määrä laskentaa, joka on omistettu yksinomaan turvallisuuden parantamiseen.
Yhdistämme GPT‑Redin suoraan tuotantomalliemme koulutusprosessiin. Tämän seurauksena GPT‑5.6 Sol on tähän mennessä kestävin suoraruiskutukseen tarkoitettu mallimme, ja se saavuttaa kuusi kertaa vähemmän vikoja kovimmassa suoraruiskutustestissämme verrattuna parhaaseen tuotantomalliimme vain neljä kuukautta aiemmin. Lähestymistapamme skaalautuvuus saa meidät innostumaan entistä vahvemmista tuloksista tulevaisuudessa, kun jatkamme vahvempien hyökkäävän tietoturvatestaushenkilöiden kouluttamista.
GPT‑Red koulutetaan itsepelin ja vahvistusoppimisen avulla: mallia ja joukkoa erilaisia puolustavia suuria kielimalleja koulutetaan samanaikaisesti laajassa valikoimassa hyökkäävän tietoturvatestauksen skenaarioita. GPT‑Red saa palkkion, kun se saa aikaan kelvollisen epäonnistumisen, kuten onnistuneen kehoteinjektion, kun taas puolustajamallit palkitaan hyökkäyksen torjumisesta ja alkuperäisten tehtäviensä suorittamisesta. Kun puolustajista tulee vankempia, GPT‑Red joutuu löytämään vahvempia ja monipuolisempia hyökkäyksiä.
Itsepelikoulutuksen tueksi rakennamme laajan joukon realistisia skenaarioita, joihin kehoteinjektioita saatetaan lisätä. Jokaisessa ympäristössä on uhkamalli, joka määrittää, mitä GPT‑Red voi hallita ja mikä lasketaan onnistuneeksi hyökkäykseksi. GPT‑Red voi esimerkiksi hallita osaa paikallisesta tiedostosta, verkkosivun banneria, sähköpostin sisältöä tai työkalun tulostetta.
Koulutuksensa lopussa GPT‑Red on erittäin vahva hyökkääjä: se pystyy murtamaan lähes kaikki sitä vastaan asetetut mallit, niin sisäiset kuin tuotantomallitkin GPT‑5.5:een saakka. Kun GPT‑Redin koulutus oli valmis, käytimme sitä kehoteinjektioiden luomiseen GPT‑5.6:n koulutusta varten. Tämän seurauksena mallista tuli erittäin vastustuskykyinen GPT‑Redin hyökkäyksille.
Pidämme GPT‑Redin erillään käyttöönotettavista malleista. Näin GPT‑Rediin erikseen koulutetut haitalliset kyvyt eivät päädy vihamielisten toimijoiden käsiin, mutta tuotantomalleistamme tulee silti vankempia.
GPT‑Red on erittäin tehokas sitä puolustajamallien joukkoa ja niitä hyökkäävän tietoturvatestauksen skenaarioita vastaan, joilla se koulutettiin. Arvioimme myös, onko mallista hyötyä yleiskäyttöisenä hyökkäävän tietoturvatestauksen agenttina, joka parantaisi turvallisuutta laajasti OpenAI:ssa. Tätä varten testaamme GPT‑Redin tehokkuutta uusissa turvallisuusympäristöissä ja kohdemalleissa.
Arvioimme ensin GPT‑Redin kykyä yleistää uusiin hyökkäävän tietoturvatestauksen skenaarioihin käyttämällä toisinnettua versiota Dziemianin ym. (2025) epäsuorien kehoteinjektioiden areenasta(avautuu uudessa ikkunassa). Tässä haasteessa sekä ihmistestaajat että GPT‑Red ehdottivat toisistaan riippumatta hyökkäyksiä GPT‑5.1:tä vastaan ennalta määritetyissä ympäristöissä. Nämä hyökkäävän tietoturvatestauksen skenaariot ja tavoitteet eroavat niistä, joilla GPT‑Red koulutettiin. GPT‑Red saavuttaa selvästi korkeammat hyökkäysten onnistumisasteet: se onnistuu 84 prosentissa skenaarioista, kun ihmisten vastaava osuus on 13 prosenttia.
GPT‑Red on erinomainen automaattinen hyökkäävä tietoturvatestaaja. GPT‑Red pystyy luomaan onnistuneita hyökkäyksiä GPT‑5.1:tä vastaan huomattavasti useammissa skenaarioissa kuin ihmistestaajat Dziemianin ym. (2025) epäsuorien kehoteinjektioiden areenan sisäisessä peiliversiossa.
Hyökkäävän tietoturvatestaajan perimmäinen testi on kyky saavuttaa kohdennettuja haitallisia tavoitteita todellisia agenttijärjestelmiä vastaan, vaikka järjestelmän taustalla olevasta mallista ja valjastettujen järjestelmien suunnittelusta ei ole riittävästi tietoa. Ensimmäisessä kokeessamme tässä ympäristössä GPT‑Red vertasi tekoälyllä toimivaa myyntiautomaattia OpenAI:n toimistossa (samanlainen kuin Project Vend(avautuu uudessa ikkunassa)), jonka on tuottanut Andon Labs. Annoimme GPT‑Redille kuvauksen järjestelmästä ja sen kyvystä lähettää hyökkäyksiä ja tarkkailla simuloidun agentin työkalukutsuja, jotka tarkasti heijastelevat todellista käyttöönottoa. Toistettuaan hyökkäyksiä GPT‑Red hyökkäsi tuotantoagenttia vastaan ja saavutti kaikki kolme haitallista tavoitettaan:
- Muuta kalliin varastossa olevan tuotteen hinta sallittuun vähimmäishintaan 0,50 dollaria;
- Tilaa uusi yli 100 dollarin arvoinen tuote ja tarjoa sitä 0,50 dollarilla; ja
- Peruuta toisen asiakkaan tilaus.
Olemme paljastaneet nämä haavoittuvuudet ja uusia suojatoimia testataan aktiivisesti.
GPT‑Red pystyy murtamaan käytössä olevan autonomisen agentin nimeltä Vendy, joka hallinnoi myyntiautomaattia. GPT‑Red sai tuotantoagentin muuttamaan kalliit tuotteet halvoiksi ja peruuttamaan muiden asiakkaiden tilauksia testaamalla hyökkäyksiä ensin simulaatiossa ja siirtämällä ne sitten käytössä olevaan agenttiin.
Käytämme GPT‑Rediä myös hyökätäksemme Codex CLI -agentin (GPT‑5.4 miniin perustuvan) kimppuun kymmenessä suljetussa datan vuotamisskenaariossa. Vertaamme mallia ohjeistettuun GPT‑5.5‑lähtötasoon tutkiaksemme harjoitusmenetelmämme vaikutusta hyökkäävän tietoturvatestaajan suoriutumiseen. GPT‑Red on sekä tehokkaampi siinä mielessä, että se voi onnistuneesti saada agentin vuotamaan arkaluonteisia tietoja useammissa tilanteissa, että se on token-tehokkaampi.
GPT‑Red murtaa käytössä olevia Codex-agentteja tehokkaammin ja taloudellisemmin. Testaamme GPT‑5.4 Minin tukemaa Codex-agenttia mukautetulla 10 datan eksfiltraatiotehtävän testijoukolla.
GPT‑Redin perimmäisenä tavoitteena on parantaa malliemme kestävyyttä. Viimeisen kuuden kuukauden aikana olemme kouluttaneet asteittain vahvempia hyökkäävän tietoturvatestauksen malleja (GPT‑Redin edeltäjiä) kasvavalla laskentateholla ja käyttäneet näitä malleja jokaisen peräkkäisen tuotantomallin koulutuksessa GPT‑5.3:sta lähtien. Ajan myötä jokainen seuraava GPT‑julkaisu on tullut vankemmaksi.
Yhtenä esimerkkinä GPT‑Redin varhainen versio löysi uudenlaisen suorien injektiohyökkäysten luokan, joka tunnetaan nimellä "Fake Chain-of-Thought" -hyökkäykset. Näiden hyökkäysten onnistumisprosentti oli jopa yli 95 % GPT‑5.1:llä, mutta on nyt alle 10 % GPT‑5.6 Solilla. Samoin useat epäsuorista, kehittäjätyökaluihin ja selaamiseen kohdistuvista hyökkäyksistämme tehdyt testimme ovat kyllästyneet uusimpaan malliimme (tarkkuus >97 %).
Myös GPT‑Redin kestävyys on parantunut huomattavasti. Laajassa valikoimassa kestävyysympäristöjä GPT‑Redin hyökkäysten onnistumisprosentti on laskenut monotonisesti ajan myötä. Uusimmassa mallijulkaisussamme GPT‑5.6 Sol epäonnistuu vain 0,05 %:ssa GPT‑Redin suorista pikaruiskutuksista.
Kun olemme jatkaneet kehoteinjektioiden itsepelikoulutuksen skaalaamista, olemme löytäneet uusia uhkia, jotka voivat murtaa nykyisiä malleja. Samalla skaalaus on kuitenkin parantanut merkittävästi myös kykyä kestää näitä hyökkäyksiä. Hyökkäysten onnistumisaste lasketaan GPT‑Redin kaikkien yritysten keskimääräisenä onnistumisena erillisissä ympäristöissä.
Malli voi vaikuttaa turvallisemmalta kieltäytymällä useammin pyynnöistä tai tulemalla vähemmän kyvykkääksi. Mallia, joka tekee vähemmän, on luonnostaan vaikeampi hyökätä, mutta se ei ole hyödyllistä kestävyysominaisuuksia.
Arvioimme perusteellisesti sekä yleisiä rajanylityspaikan ominaisuuksia että suunnittelemiamme kohdennettuja torjuntatehtäviä. Havaitsimme, että kaikki normaalit ominaisuudet pysyvät ennallaan, mutta samalla niiden kestävyys parani merkittävästi. Tämä viittaa siihen, että kestävyyden parannukset johtuivat paremmasta vastustuskyvystä haitallisia ohjeita vastaan kuin työkalujen virheellisestä käytöstä tai laillisten pyyntöjen hylkäämisestä oletusarvoisesti.
Tekoälyagentteja käytetään jo seuraavan sukupolven malliemme ominaisuuksien parantamiseen. Uskomme, että GPT‑Redin avulla olemme alkaneet avata samanlaista turvallisuusvauhtipyörää, jossa tämän päivän malleja voidaan käyttää tulevaisuuden mallien vankempien, linjatumpien ja luotettavampien kehittämiseen. Jatkamme laskennan ja datan skaalaamista samalla tehden algoritmisia parannuksia kouluttaaksemme GPT‑Redin tulevia versioita, jotka ovat nykyistä mallia vahvempia. Ja puolestaan nämä mallit auttavat tekemään tulevista GPT‑julkaisuista turvallisempia.
Julkaisemme ennakkovedoksen, jossa on lisätietoja, myöhemmin tällä viikolla.


