Slik møter vi neste grense for kritiske cyberkapasiteter
Cybersikkerhet er i rask endring etter hvert som modellene blir mer kapable på måter som både kan styrke cyberforsvaret og muliggjøre angrep i en skala og et tempo uten sidestykke.
Våre siste interne evalueringer av Astra, en av våre kommende modeller, de siste dagene viser betydelige fremskritt innen agentisk koding og cybersikkerhet. Disse resultatene og ekspertvurderinger gjorde at vi i går kveld konkluderte med at vi ikke kan utelukke kritiske cyberkapasiteter i henhold til vårt Preparedness Framework(åpnes i et nytt vindu).
Vi deler dette fordi vi mener det er viktig å være åpne overfor offentligheten og fagmiljøene for trygghet og sikkerhet om denne mulige endringen i kapasitet.
Vi publiserte Preparedness Framework for første gang i desember 2023, lenge før modeller nærmet seg dette kapasitetsnivået innen biologi, kjemi, cybersikkerhet og selvforbedring av KI. Vi utarbeidet rammeverket som en veiledning for å identifisere kapasitetsutvikling og planlegge hva selskapet skulle gjøre etter hvert som disse kapasitetene oppstår. Tidligere modeller, inkludert GPT‑5.6‑Sol, er evaluert for banebrytende cyberkapasiteter og vurdert til terskelen Høy (i stedet for Kritisk).
I henhold til Preparedness Framework når en modell terskelen Kritisk for cybersikkerhet hvis den uten menneskelig innblanding kan identifisere og utvikle fungerende nulldagsutnyttelser på alle alvorlighetsnivåer i mange godt sikrede, kritiske systemer i den virkelige verden, eller kan utarbeide og gjennomføre helt nye, helhetlige strategier for cyberangrep mot godt sikrede mål utelukkende basert på et overordnet ønsket resultat.
Mens vi fortsetter å teste og vurdere denne modellen, viser de foreløpige evalueringene våre så gode resultater at vi på nåværende tidspunkt ikke kan utelukke kapasitetsnivået Kritisk. Astra er en kommende modell og var ikke involvert i utnyttelsen av Hugging Face.
Derfor har vi trappet opp robusthetstestingen av sikringstiltakene og sikkerhetskontrollene våre, slik at de er tilpasset en utrulling av disse kapasitetene. Internt har vi også iverksatt følgende tiltak for at videreutviklingen av denne modellen skal foregå trygt og sikkert:
- Vi innfører strengere sikkerhetskontroller for modeller med høyere kapasitet og tilknyttede aktiviteter. Dette omfatter isolerte testmiljøer, begrenset nettverks- og verktøytilgang, bedre beskyttelse og kryptering av modellvekter, mer omfattende overvåkings- og deteksjonsfunksjoner samt kjøring i sandkasse.
- Vi setter interne aktiviteter som involverer Astra, og som ennå ikke oppfyller disse skjerpede kravene til sikkerhetskontroll, på pause.
- Vi har innført gjennomgående overvåking av risikable handlinger og manglende samsvar i alle agentiske anvendelser av Astra, inkludert opplæring og evaluering. Overvåkingssystemene vurderer modellens resonneringskjede og utløser en sikkerhetsrespons for å gjennomgå og avbryte høyrisikoaktivitet.
- Vi vil samarbeide med relevante offentlige etater og utvalgte organisasjoner for KI-sikkerhet om å teste kapasitetene til denne modellen.
- Vi vil gi tredjepartspartnere som utfører testing, anbefalte sikkerhetskontroller for trygg gjennomføring av evalueringer og arbeidsbelastninger med høyere risiko.
Rammeverket har allerede veiledet oss gjennom andre kapasitetsoverganger. Da modellene våre i juni 2025 nærmet seg terskelen Høy for biologisk kapasitet i Preparedness Framework, beskrev vi tiltakene vi iverksatte for å styrke sikringstiltakene, utvide testingen, samarbeide med eksterne eksperter og innføre ytterligere sikkerhetskontroller. Vi følger det samme prinsippet her.
Vi mener at avanserte modeller med cyberkapasiteter bør hjelpe forsvarere med å identifisere og utbedre sårbarheter før angripere utnytter dem. Vi er opptatt av å samarbeide med myndigheter, sikkerhetsinstitutter og sivilsamfunnet for å sikre at de banebrytende kapasitetene til modeller som Astra og etterfølgerne, tas i bruk på en ansvarlig og bred måte til beste for hele menneskeheten.


