Siirry pääsisältöön
OpenAI

3. syyskuuta 2026

Turvallisuus

Turvallisuuskatsaus: GPT‑6 Astra

Ladataan...

Julkaisemme tänään GPT‑6 Astran, kyvykkäimmän tähän mennessä laajasti käyttöön ottamamme mallin. Astra on ensimmäinen mallimme, joka saavuttaa Valmiuskehyksessä kriittisen kyberturvallisuuskyvyn tason.

Tämän julkaisun turvallisuudesta on tärkeintä tietää seuraavat asiat:

  1. GPT‑6 Astran kyberkyvykkyydet ovat kehittyneet merkittävästi, ja malli täyttää kriittisen tason kynnysarvomme. Tämä tarkoittaa, että oikeiden työkalujen ja käyttöoikeuksien avulla GPT‑6 Astra voi löytää entuudestaan tuntemattomia tietoturva-aukkoja ja kehittää uusia tapoja hyödyntää niitä useissa hyvin suojatuissa järjestelmissä ilman, että ihminen ohjaa jokaista vaihetta. Siksi vahvistimme merkittävästi suojauksiamme mallin haitallisia kybertoimia vastaan riippumatta siitä, johtuvatko ne väärinkäytöstä vai puutteellisesta kohdistuksesta. Suojasimme myös Astran ja vastaavien mallien sisäistä kehitystä ja käyttöönottoa muun muassa tiukemmalla eristyksellä, tarkistuspisteiden salauksella, koko toimintaketjujen ja ajatusketjujen (CoT) kattavalla valvonnalla sekä sisäistä käyttöä edeltävällä, käytön tarvittaessa estävällä kohdistuksen arviointiprosessilla.
  2. GPT‑6 Astra on huomattavasti edeltäjiään häiriönsietokykyisempi. Uusien turvallisuutta ja häiriönsietokykyä parantavien koulutusmenetelmien ansiosta GPT‑6 Astra kestää rajoitusten kiertämistä (jailbreak) huomattavasti paremmin kuin GPT‑5.6 Sol, myös pidemmissä toimintaketjuissa. Tiedämme tämän offline-testeistä sekä perusteellisesta sisäisestä ja ulkoisesta ohjelmastamme, jossa testaamme ja korjaamme rajoitusten kiertämistä (jailbreak). Mahdollisesti suuren riskin käyttäjiksi merkittyjä varten olemme lisäksi kouluttaneet mallin säätämään kieltäytymisrajaansa varovaisemmaksi ja kattamaan laajemman joukon kaksikäyttöön liittyviä riskejä. Regressiotestauksella varmistamme, että Astra kestää aiemmilla testijaksoilla löydettyä rajoitusten kiertämistä (jailbreak). Lisäksi toteutimme uusilla sisäisillä hyökkäystyökaluillamme uusia automatisoidun hyökkäävän tietoturvatestauksen kierroksia parannustemme vahvistamiseksi.
  3. GPT‑6 Astra on kohdistettu paremmin kuin GPT‑5.6 Sol. Astra on merkittävä edistysaskel mallin kohdistamisessa. Parannukset ulottuvat valmistavan koulutuksen aineiston koostamisesta vahvistusoppimisen aikaiseen arviointiin. Esittelemme uuden kohdistuksen arviointikokonaisuuden(avautuu uudessa ikkunassa). Tulosten mukaan GPT‑6 Astra noudattaa paremmin turvallisuus- ja tietoturvarajoja ja pysyy valtuuksiensa piirissä. Yli 54 000 sisäistä Codex-tehtävää(avautuu uudessa ikkunassa) sisältäneessä simulaatiossa Astra sai myös vakavasta tavoitteiden vastaisesta toiminnasta noin puolet vähemmän merkintöjä kuin Sol.
  4. Otamme tavoitteiden vastaisen toiminnan valvonnan laajasti käyttöön. Pidämme mallien kohdistamista ensisijaisena keinona ehkäistä niiden mahdollista tavoitteiden vastaista toimintaa. Valvonta antaa kuitenkin kattavan kuvan edistyneiden mallien toiminnasta ja auttaa tunnistamaan mahdollisuuksia parantaa kohdistusta ja turvallisuutta entisestään. Lisäksi valvonta muodostaa ylimääräisen suojakerroksen havaittua tavoitteiden vastaista toimintaa vastaan. Näistä syistä olemme lisänneet tavoitteiden vastaisen toiminnan valvonnan myös kaikkeen Astran ulkoiseen käyttöönottoon liittyvään, työkaluja hyödyntävään päättelyyn huomattavista laskentakustannuksista huolimatta. Järjestelmä vastaa sisäistä toteutustamme.
  5. GPT‑6 Astran valvottavuus on heikentynyt GPT‑5.6 Soliin verrattuna. Olemme tutkineet perusteellisesti GPT‑6 Astran valvottavuutta(avautuu uudessa ikkunassa) ja hallittavuutta(avautuu uudessa ikkunassa). Havaitsimme, että GPT‑6 Astra pystyy hallitsemaan omaa ajatusketjuaan paremmin kuin GPT‑5.6 Sol ja sisällyttää ajatusketjuunsa epätodennäköisemmin raskauttavia tietoja. Vastakkainasetteluun perustuvissa tilanteissa, joissa pyrimme saamaan mallin välttämään valvontaamme, malli voi jäädä havaitsematta alisuoriutuessaan arvioinneissa strategisesti (strateginen alisuoritus). Se voi myös toisinaan välttää sisäisen valvontamme, kun sitä pyydetään suorittamaan tiettyjä sabotaasitehtäviä(avautuu uudessa ikkunassa). Emme ole havainneet viitteitä steganografisesta ajatusketjupäättelystä, kuten piilotetun päättelyn kätkemisestä tavalliseen ja näennäisesti asiaan liittymättömään tekstiin. Tämä viittaa siihen, että valvonnan välttämisen riski saattaa rajoittua pääosin vähemmän päättelyä vaativiin tehtäviin.
    • Tulokset osoittavat, että Astra-luokan mallit voisivat vastakkainasetteluun perustuvissa olosuhteissa välttää ajatusketjuvalvontamme. Tällä hetkellä havainnot perustuvat suurelta osin vastakkainasetteluun perustuviin arviointeihin eli tilanteisiin, joissa ohjeistamme mallia välttämään valvontaa. Kohdistusarviointiemme kokonaiskuva kuitenkin osoittaa, että Astra rikkoo turvallisuus- ja tietoturvarajoituksia epätodennäköisemmin kuin GPT‑5.6 Sol.
    • Suhtaudumme kehityssuuntaan silti vakavasti ja jatkamme havaintojen sekä niiden valvottavuudelle aiheuttamien vaikutusten tutkimista malliemme kyvykkyyden kasvaessa. OpenAI on pyrkinyt säilyttämään ajatusketjuvalvonnan ja hyödyntämään sitä. Ajatusketjujen valvottavuuden säilyttäminen on tutkimusohjelman keskeinen tavoite. Tulokset korostavat kuitenkin myös tarvetta kehittää kohdistuksen auditointimenetelmiä, jotka eivät perustu pelkästään mallin ajatusketjun tarkasteluun.
  6. GPT‑6 Astra toimii vastuullisemmin verkkoa selatessaan ja työympäristöissä: GPT‑6 Astra kestää kehotesyöttöhyökkäyksiä huomattavasti paremmin kuin GPT‑5.6 Sol. Olemme lisäksi testanneet mallin toimintaa realistisissa verkkoselaus- ja ammattikäyttöön tarkoitetuissa tietokoneympäristöissä. GPT‑5.6 Soliin verrattuna malli suorittaa huomattavasti epätodennäköisemmin tavoitteiden vastaisia ja mahdollisesti tuhoisia toimia, kuten luvattomia maksutapahtumia, tietojen menetykseen johtavia toimia, liiallista käyttöoikeuksien hyödyntämistä tai valvontakeinojen kiertämistä. Se toimii turvallisemmin myös käsitellessään haitallisia pyyntöjä agenttisissa ympäristöissä, kuten avunpyyntöjä väkivaltaisen iskun suunnitteluun tai petoksen tekemiseen.
  7. GPT‑6 Astra on huomattavasti turvallisempi suuren riskin tilanteissa. GPT‑6 Astra vastaa GPT‑5.6 Solia turvallisemmin haastaviin pyyntöihin, jotka ovat peräisin tuotantokäytöstä ja ihmisten tekemästä hyökkäävästä tietoturvatestauksesta. Astra saavuttaa Pareto-parannuksen: se vastaa vaarallisiin pyyntöihin turvallisemmin ja välttää samalla harmittomien pyyntöjen tarpeettomia torjuntoja. Parannukset ulottuvat myös erittäin vakaviin tilanteisiin, joissa haitan riski syntyy laajemmasta asiayhteydestä eikä nimenomaisesta pyynnöstä. Astra soveltaa myös ikätasolle sopivia turvallisuusrajoja johdonmukaisemmin alle 18-vuotiaisiin käyttäjiin.