Hopp til hovedinnhold
OpenAI

3. september 2026

Sikkerhet

Sikkerhetsoversikt: GPT‑6 Astra

Laster inn …

I dag lanserer vi GPT‑6 Astra, den mest kapable modellen vi noensinne har rullet ut bredt. Astra er vår første modell som når kritisk nivå for cybersikkerhetskapasitet i henhold til vårt Preparedness Framework.

Dette er det viktigste du bør vite om sikkerheten ved denne lanseringen:

  1. GPT‑6 Astra innebærer et betydelig løft i cyberkapasitet og når vår kritiske terskel. Det betyr at GPT‑6 Astra, med de rette verktøyene og tilgangene, kan finne hittil ukjente sikkerhetssårbarheter og utvikle nye metoder for å utnytte dem i mange godt beskyttede systemer, uten at et menneske veileder hvert trinn. Derfor har vi styrket beskyttelsestiltakene betydelig for å hindre modellen i å utføre skadelige cyberhandlinger, enten de skyldes misbruk eller manglende tilpasning. Vi har også sikret vår interne utvikling og utrulling av Astra og lignende modeller bedre, blant annet gjennom strengere isolasjon, kryptering av kontrollpunkter, gjennomgående overvåking av fullstendige handlingsforløp, inkludert tankerekker (CoT), og en tilpasningsevaluering som må bestås før intern bruk.
  2. GPT‑6 Astra er betydelig mer robust enn forgjengerne. GPT‑6 Astra bruker nye sikkerhetsteknikker for robusthetstrening og er betydelig mer motstandsdyktig mot jailbreaks enn GPT‑5.6 Sol, også i lengre handlingsforløp. Dette vet vi fra offline-tester og vårt omfattende program for intern og ekstern testing og utbedring av jailbreaks. For brukere som er flagget med potensielt høy risiko, har vi i tillegg trent modellen til å kunne justere grensen for avvisning i en mer forsiktig retning og dekke et bredere spekter av risikoer knyttet til flerbruksteknologi. Vi bruker regresjonstesting for å sikre at Astra er robust mot jailbreaks som ble funnet i tidligere testperioder. Vi gjennomførte også nye runder med automatisert red teaming med våre nyeste interne red teaming-angripere for å validere forbedringene.
  3. GPT‑6 Astra er bedre tilpasset enn GPT‑5.6 Sol. Astra er et betydelig fremskritt innen modelltilpasning og har forbedringer som spenner fra sammensetningen av førtreningsdataene til vurderingsmetodene under forsterkende læring. Vi presenterer en ny serie evalueringer av tilpasning(åpnes i et nytt vindu) og finner at GPT‑6 Astra er bedre til å respektere sikkerhetsgrenser og holde seg innenfor sitt godkjente virkeområde. I en simulering med mer enn 54 000 interne Codex-oppgaver(åpnes i et nytt vindu) fikk Astra dessuten omtrent halvparten så mange flagg for alvorligere feiltilpasset atferd som Sol.
  4. Vi tar i bruk omfattende overvåking av manglende tilpasning. Vi ser på modelltilpasning som det viktigste virkemiddelet for å forebygge potensiell feiltilpasset atferd fra modellene våre. Overvåking gir imidlertid bred innsikt i atferden til banebrytende modeller og synliggjør muligheter til å forbedre tilpasningen og sikkerheten ytterligere. Overvåking fungerer dessuten som et ekstra beskyttelseslag mot feiltilpasset atferd som blir oppdaget. Derfor har vi, til betydelige beregningskostnader, også lagt til overvåking av manglende tilpasning for all inferens med verktøybruk som inngår i den eksterne utrullingen av Astra. Dette systemet tilsvarer vårt interne oppsett.
  5. GPT‑6 Astra er mindre overvåkbar enn GPT‑5.6 Sol. Vi har gjennomført omfattende undersøkelser av hvor overvåkbar(åpnes i et nytt vindu) og kontrollerbar(åpnes i et nytt vindu) GPT‑6 Astra er. Vi har funnet at GPT‑6 Astra har bedre evne til å kontrollere sin egen CoT enn GPT‑5.6 Sol og sjeldnere inkluderer belastende informasjon i sin CoT. Under adversarielle forhold, der vi presser modellen til å unngå overvåkingen vår, finner vi at modellen kan forbli uoppdaget når den bevisst yter svakere i evalueringer (sandbagging). Den kan også noen ganger unngå våre interne overvåkingssystemer når den blir bedt om å utføre visse sabotasjeoppgaver(åpnes i et nytt vindu). Vi har ikke sett tegn på steganografisk CoT-resonnering, som å skjule resonnering i vanlig og tilsynelatende irrelevant tekst. Det tyder på at risikoen for å omgå overvåkingen i stor grad kan være begrenset til oppgaver som krever mindre resonnering.
    • Disse funnene tyder på at modeller i Astra-klassen kan unngå CoT-overvåkingen vår under adversarielle forhold. Foreløpig bygger disse funnene i stor grad på adversarielle evalueringer, det vil si at vi ber modellen om å unngå overvåking. Samlet viser evalueringene våre av tilpasning at Astra gjennomgående har lavere sannsynlighet enn GPT‑5.6 Sol for å bryte sikkerhetsbegrensninger.
    • Vi tar likevel utviklingen på alvor og fortsetter å undersøke funnene og hva de innebærer for overvåkbarheten etter hvert som modellene blir mer kapable. OpenAI har arbeidet for å bevare og bruke overvåking av tankerekker, og det er et sentralt mål for forskningsprogrammet å bevare muligheten til å overvåke CoT. Samtidig understreker disse resultatene hvor viktig det er å utvikle metoder for revisjon av tilpasning som går lenger enn å undersøke modellens tankerekke.
  6. GPT‑6 Astra håndterer nettlesing og arbeidsmiljøer på en mer ansvarlig måte: GPT‑6 Astra er betydelig mer robust mot promptinjeksjoner enn GPT‑5.6 Sol. Vi har også testet modellens atferd i realistiske nettleser- og profesjonelle datamiljøer. Sammenlignet med GPT‑5.6 Sol er det betydelig mindre sannsynlig at modellen utfører feiltilpassede og potensielt ødeleggende handlinger, som uautoriserte transaksjoner, tap av data, overdreven tilgang eller omgåelse av kontrollmekanismer. Den opptrer også tryggere ved håndtering av skadelige forespørsler i agentbaserte miljøer, for eksempel forespørsler om hjelp til å planlegge voldelige angrep eller begå svindel.
  7. GPT‑6 Astra er betydelig tryggere i scenarioer med høyere risiko. GPT‑6 Astra svarer tryggere enn GPT‑5.6 Sol på krevende forespørsler hentet fra produksjon og adversariell red teaming utført av mennesker. Astra oppnår en Pareto-forbedring ved både å håndtere utrygge forespørsler på en trygg måte og unngå unødvendige avvisninger av harmløse forespørsler. Forbedringene gjelder også svært alvorlige scenarioer der risikoen for skade oppstår gjennom den bredere konteksten, og ikke gjennom en uttrykkelig forespørsel. Astra håndhever også alderstilpassede sikkerhetsgrenser mer konsekvent for brukere under 18 år.