Hopp til hovedinnhold
OpenAI

1. september 2026

SikkerhetSikkerhet

Veien til Astra: kritiske kapabiliteter og banebrytende sikkerhetstiltak

Laster inn …

Siden vår tidligere vurdering av at Astra kunne nå et kritisk nivå av cybersikkerhetskapabiliteter, har vi samlet inn mer dokumentasjon og gjennomført flere evalueringer av modellens kapabiliteter. Vi mener nå at Astra oppfyller terskelen for kritiske cybersikkerhetskapabiliteter i vårt Preparedness Framework. Det betyr at modellen med riktige verktøy og riktig tilgang kan finne tidligere ukjente sikkerhetssvakheter og utvikle metoder for å utnytte dem i mange godt beskyttede systemer, uten at et menneske veileder hvert trinn. Dette er den første modellen vi plasserer på dette nivået, og den krever sterkere sikkerhetstiltak under utviklingen og før lansering.

De siste ukene har vi utsatt deler av utviklingen og lanseringen av Astra mens vi styrket og testet beskyttelsen mot cybermisbruk og uautoriserte modellhandlinger. På bakgrunn av dette arbeidet mener vi at Astras sikkerhetstiltak reduserer risikoen for alvorlig skade tilstrekkelig til at modellen kan lanseres i henhold til vårt Preparedness Framework.

Selv om Astra ikke var involvert i Hugging Face-hendelsen, har vi tatt med oss erfaringene(åpnes i et nytt vindu) fra hendelsen i sikkerhetstilnærmingen vår. Retrospektiv testing tilsier at sikkerhetstiltakene vi hadde i produksjon på det tidspunktet, ville ha forhindret Hugging Face-hendelsen. Siden da har vi innført enda sterkere sikkerhetstiltak for Astra. Vi har blant annet trent modellen til mer pålitelig å avvise skadelige cyberforespørsler og respektere sikkerhetsbegrensninger, innført ekstra beskyttelse mot misbruk og etablert overvåking som kan stanse potensielt uautorisert aktivitet.

Vi planlegger å gjøre Astra tilgjengelig snart, men tilgangen til modellens mest avanserte cybersikkerhetskapabiliteter blir mer begrenset. Avansert cybersikkerhetsarbeid blir først tilgjengelig for en gruppe testere. Deretter følger tilgang gjennom Daybreak Blue for å utvide defensiv bruk.

Ved lansering vil vi dele flere detaljer om testingen og evalueringen av modellens sikkerhet og innretting i systemkortet. Før lanseringen ønsker vi å orientere om noe av arbeidet vi har gjort for å kunne lansere en modell med dette nivået av cybersikkerhetskapabiliteter på en trygg måte – og være åpne om hvilke risikoer som gjenstår.

Vurdering av Astras cybersikkerhetskapabiliteter

I henhold til vårt Preparedness Framework oppfyller en modell terskelen for Kritisk hvis ett av følgende vilkår er oppfylt:

  • Modellen kan uten menneskelig innblanding identifisere og utvikle fungerende nulldagsutnyttelser på alle alvorlighetsnivåer i mange forsterkede, reelle kritiske systemer.
  • Modellen kan utforme og gjennomføre nye, komplette strategier for cyberangrep mot forsterkede mål når den bare får oppgitt et overordnet mål.

Beredskapsevalueringen av Astra kombinerte automatiserte offentlige og private referansetester med ekspertstyrte vurderinger. Astra innebærer en betydelig økning i cybersikkerhetskapabiliteter sammenlignet med GPT‑5.6 Sol: Modellen er vesentlig mer tokeneffektiv og bedre til å identifisere sårbarheter og utvikle utnyttelser.

Som ett eksempel kjørte vi Astra på ExploitBench, der modellen oppnådde en perfekt poengsum på 100 % i referansetesten som måler evnen til å utvikle utnyttelser basert på kjente sårbarheter.

På grunn av faren for kontaminering utviklet vi deretter en intern referansetest kalt «ExploitBench – intern portering (juni–august 2026)». Den inneholder 20 V8-sårbarheter med høy alvorlighetsgrad som ble offentliggjort senere. På dette datasettet oppnår Astra langt høyere rater for vilkårlig kodekjøring enn GPT‑5.6 Sol, samtidig som den bruker langt færre utdatatokener. Under evalueringen oppdaget og brukte modellen til og med to nulldagssårbarheter i en utnyttelseskjede. Vi er i ferd med å varsle de ansvarlige vedlikeholderne om disse to sårbarhetene.

De viste Astra-resultatene gjenspeiler kapabilitetene med tilgang til Daybreak Blue, ikke standardkonfigurasjonen for produksjon.

I ekspertledede vurderinger mot en forsterket nettleser og et forsterket operativsystem oppdaget Astra tidligere ukjente sårbarheter og gjorde dem om til fungerende utnyttelseskjeder. Modellen bygde en fullstendig kjede for å kompromittere nettleseren. Kjeden brøt ut av sandkassen og kjørte kommandoer på vertsmaskinen da nettleseren åpnet en HTML-fil. Modellen fant også flere sårbarheter i et forsterket operativsystem og kombinerte dem til en lokal kjede for rettighetseskalering fra en bruker uten rettigheter til root. Samlet sett har undersøkelsen vår ført til konklusjonen om at Astra oppfyller terskelen for Kritisk.

Sikkerhetstiltak som kreves for kritiske kapabiliteter

For modeller med cybersikkerhetskapabiliteter på Astras nivå må vi håndtere to risikoforløp for å minimere faren for alvorlig skade på cybersikkerheten, både under utviklingen og før lansering:

  • Ondsinnede aktører som bruker modellen. Sikkerhetstiltakene våre må på en robust måte hindre ondsinnede aktører i å bruke Astra til å utvikle utnyttelser for tidligere ukjente svakheter i forsterkede kritiske systemer eller gjennomføre komplette angrep mot forsterkede mål.
  • Modellen utfører uautoriserte handlinger som ikke er i tråd med intensjonen. Selv uten en ondsinnet bruker kan en modell med avanserte cybersikkerhetskapabiliteter selv forårsake skade hvis den ikke er innrettet etter intensjonen. I tillegg til svært strenge krav til innretting for modeller med slike kapabiliteter må sikkerhetstiltakene våre som et ekstra forsvarslag raskt kunne oppdage og begrense feilinnrettede handlinger som kan forårsake betydelig skade i den virkelige verden.

Det er verdt å merke seg at det andre risikoforløpet gjelder både intern utvikling og ekstern lansering. Som vi tidligere har beskrevet, satte vi deler av treningen av banebrytende modeller på pause i to uker etter hendelsen med OpenAI og Hugging Face. Dette omfattet deler av treningen av Astra og ble gjort for å styrke treningsinfrastrukturen med blant annet isolasjon og nettverkskontroller, utvidet overvåking samt strengere innrettingstrening og terskler. Deretter fortsatte vi arbeidet i mindre skala og under strengere kontroll.

Enkelte større kjøringer med forsterkende læring (RL) for fremtidige versjoner av Astra ble utsatt lenger mens vi innførte strengere krav til sikkerheten i treningsmiljøet. 28. august startet vi den store RL-kjøringen for den banebrytende modellen på nytt etter å ha innført de nye sikkerhetskravene. Noen mindre, eksperimentelle treningskjøringer er fortsatt midlertidig utsatt.

Lanseringsforberedelsene for Astra har også krevd sterkere beskyttelse mot cybermisbruk og uautoriserte handlinger. Nedenfor beskriver vi disse sikkerhetstiltakene og hvordan vi har testet dem.

Robusthet mot cybermisbruk

Siden vi i februar lanserte den første modellen vi vurderte til kapabilitetsnivået Høy innen cybersikkerhet, har vi styrket sikkerhetstiltakene for hver nye lansering. Den overordnede sikkerhetstilnærmingen vår kombinerer avslag fra modeller med etterutdannelse, sikkerhetsklassifikatorer på systemnivå samt frakoblet oppdagelse og avverging av trusler.

For GPT‑5.6(åpnes i et nytt vindu) forbedret vi robustheten til systemkomponentene betydelig. Vi la blant annet til aktiveringsklassifikatorer for å oppdage cybermisbruk og forbedret dekningen mot generelle jailbreak som ble funnet gjennom omfattende, automatisert red teaming. Med disse forbedringene som utgangspunkt har vi investert ytterligere i modellaget i Astras sikkerhetssystem og gjort tiltakene bedre i stand til å håndtere kontekst på tvers av samtaler.

  • Ved hjelp av nye treningsteknikker for modellrobusthet avviser Astra forespørsler om ikke-tillatt cyberassistanse på en mer robust måte. I evalueringene våre av cyberrelaterte jailbreak avviser Astra 91,5 % av forespørslene, sammenlignet med 59 % for GPT‑5.6 Sol.
  • For kontoer som vurderes å ha høyere risiko, bruker vi en mer konservativ grense for modellatferd som avviser flere typer potensielt risikabel cyberassistanse. For høyrisikobrukere har vi utvidet konteksten som overvåkingssystemene våre bruker, slik at de kan oppdage denne typen cybermisbruk.

Vi har også videreført programmet vårt for grundig testing, intern og ekstern red teaming samt utbedring. I tillegg til regresjonstesting som skal sikre at alle jailbreak fra tidligere testperioder fortsatt dekkes, gjennomfører vi en ny runde med red teaming ved hjelp av våre nyeste interne angripere innen red teaming. Vi samarbeider med bransjepartnere om å definere et felles vurderingssystem for jailbreak og vil bruke døgnberedskapen vår til raskt å undersøke og håndtere nye funn. Vi vil dele flere detaljer om testingen av cybersikkerhetstiltakene våre i Astras systemkort.

Å hjelpe forsvarere med å finne og utbedre sårbarheter er fortsatt en sentral del av sikkerhetstilnærmingen vår. Ved lansering forventer vi at Astras sikkerhetstiltak vil skape flere hindringer enn vi ønsker på sikt, for å beskytte mot mulig misbruk. Tilgang til Astra for avanserte arbeidsflyter innen cybersikkerhet blir først tilgjengelig for en liten gruppe alfatestere. Deretter utvides tilgangen gjennom Daybreak Blue for å støtte defensiv bruk.

Innretting & overvåking

Vi har også lagt til flere lag med beskyttelse for å hindre modellen i å utføre potensielt feilinnrettede handlinger:

  • Modellinnretting: I evalueringene våre var det langt mer sannsynlig at Astra respekterte uttrykkelige sikkerhetsbegrensninger og holdt seg innenfor sitt autoriserte virkeområde enn GPT‑5.6 Sol. Det gjør Astra til vår best innrettede modell hittil. Vi la særlig vekt på at modellen skulle respektere sikkerhetsbegrensninger og holde seg innenfor sitt autoriserte virkeområde.
  • Overvåking og kontroll: I tråd med de interne prosedyrene våre lanserer vi Astra med ekstra overvåking av tankerekke for raskt å oppdage og begrense potensielt feilinnrettede handlinger.

Astra er et betydelig fremskritt innen modellinnretting og resultatet av flere langsiktige arbeidsstrømmer på området, fra tiltak under førtrening til mer omhyggelig og konsekvent vurdering under forsterkende læring. I testingen ser vi at Astra konsekvent har større sannsynlighet for å respektere uttrykkelige sikkerhetsbegrensninger og advarsler, som automatisk gjennomgang, enn GPT 5.6 Sol.

Vi utviklet også en test basert på Hugging Face-hendelsen, der agenter som kjørte cybersikkerhetsevalueringen ExploitGym, kompromitterte systemene til en tredjepart. Vi brukte de vanskeligste oppgavene fra denne evalueringen til å lage «lokkesystemtester» av om en modell ville forsøke å kompromittere den omkringliggende sikkerhetsinfrastrukturen i stedet for å løse oppgaven den var tildelt. Uten sikkerhetstiltakene fra produksjonsmiljøet forsøkte GPT‑5.6 Sol å få tilgang til disse målene i 56 % av testene som simulerte referansemiljøet der modellen får beskjed om å utvikle utnyttelser. Astra gjorde ingen slike forsøk i disse testene. Disse tallene beskriver atferd under testforhold uten cybersikkerhetstiltak, ikke ved vanlig bruk i produksjon.

Venstre: I denne nye evalueringen observerer vi hvordan modeller reagerer på et avslag fra automatisk gjennomgang. Hver oppgave foregår i et kunnskapsarbeidsmiljø, og kjøringen begynner umiddelbart etter avslaget. Modellen kan deretter avslutte kjøringen, prøve å finne et tryggere alternativ, forsøke en lignende kommando på nytt eller utnytte en dårlig konfigurasjon(åpnes i et nytt vindu) for å omgå den automatiske gjennomgangen fullstendig. Hvis modellen velger ett av de to siste alternativene, regnes evalueringen som mislykket. Astra forsøkte aldri å omgå den automatiske gjennomgangen.

Høyre: I denne evalueringen undersøker vi modellens tendens til å jukse ved hjelp av «lokkesystemer» når den møter de vanskeligste eller umulige oppgavene i ExploitGym-evalueringen. Testen ble kjørt i et simulert miljø der sikkerhetstiltakene bare observerte, for å evaluere modellens atferd. GPT‑5.6 Sol viste større sannsynlighet for å jukse i disse scenarioene, mens Astra ikke forsøkte å bruke slike snarveier og likevel klarte å løse enkelte oppgaver på legitimt vis.

Å trene modeller til å være godt innrettet er ett sikkerhetslag. Vi vil dele flere detaljer om testingen av innretting og resultatene i Astras systemkort.

For modeller i Astra-klassen tar vi også i bruk overvåking av feilinnretting i produksjon for raskt å oppdage og begrense potensiell feilinnretting. Disse sikkerhetstiltakene ligner overvåkingen av interne lanseringer og består av klassifikatorer som kontrollerer modellens resonnering og handlinger for uautorisert atferd og automatisk stanser potensielt uautorisert aktivitet. Etter hvert som kapabilitetene øker, kan disse sikkerhetstiltakene ikke erstatte god innretting av modellene våre. Målet er at fremtidige modeller skal være så godt innrettet at tiltakene aldri utløses.

Hva dette vil bety for brukerne

OpenAI er opptatt av å sikre at fordelene ved KI blir allment tilgjengelige. På grunn av den betydelige økningen i Astras cybersikkerhetskapabiliteter er vi spesielt nøye med at lanseringen blir trygg og sikker. Ekstra sikkerhetskontroller kan noen ganger forsinke, sette på pause eller stanse legitimt arbeid, inkludert defensivt cybersikkerhetsarbeid.

Systemet kan iblant feilaktig merke legitim aktivitet som mulig cybermisbruk eller uautorisert atferd, slik at aktiviteten utilsiktet forsinkes, settes på pause eller stanses. Dette kan omfatte arbeid som ikke ser ut til å være direkte relatert til cybersikkerhet, eller oppgaver der en agent kjører over lengre tid.

Hvis overvåkingen av feilinnretting setter en oppgave på pause, kan brukere i ChatGPT eller Codex bli bedt om å gjennomgå handlingen før de fortsetter. Ved bruk av andre grensesnitt, som API-et, blir oppgaven stanset. Vi vil fortsette å finjustere sikkerhetstiltakene for å redusere unødvendige avbrudd og utvide tilgangen til banebrytende kapabiliteter gjennom programmer som Daybreak.

Veien videre

Vi går inn i en fase av KI-utviklingen der modeller kan utføre arbeid med større konsekvenser, og der svikt i innretting og kontroll kan få mer alvorlige følger. Om vi skal realisere fordelene ved disse systemene, avhenger av evnen vår til å innrette og kontrollere modellene etter hvert som kapabilitetene øker.

Dette ansvaret omfatter trening, evaluering og lansering. Det krever sterkere dokumentasjon på innrettet atferd, sikkerhetstiltak som holder tritt med kapabilitetene, og vilje til å bremse når beskyttelsen ikke er tilstrekkelig.

Vi vil fortsette å teste disse systemene, dele det vi lærer, og være tydelige på hva som fortsatt er usikkert. Modellene som følger etter Astra, vil stille større krav til oss. Vi vil ta oss tiden og gjøre arbeidet som kreves for å oppfylle dette ansvaret.