Gå til hovedindhold
OpenAI

1. september 2026

SikkerhedSikkerhed

Vejen til Astra: kritiske kapabiliteter og banebrydende sikkerhedsforanstaltninger

Indlæser ...

Siden vores tidligere vurdering af, at Astra muligvis kunne nå et kritisk niveau af cybersikkerhedskapabilitet, har vi indsamlet flere beviser og gennemført yderligere evalueringer af modellens kapabiliteter. Vi vurderer nu, at Astra opfylder tærsklen for Kritisk cybersikkerhedskapabilitet i vores Preparedness Framework. Det betyder, at modellen med de rette værktøjer og den rette adgang kan finde hidtil ukendte sikkerhedssårbarheder og udvikle metoder til at udnytte dem på tværs af mange velbeskyttede systemer, uden at et menneske vejleder hvert trin. Det er den første model, vi placerer på dette niveau, og den kræver stærkere sikkerhedsforanstaltninger under udviklingen og før lanceringen.

I løbet af de seneste uger har vi udskudt dele af Astras udvikling og lancering, mens vi styrkede og testede beskyttelsen mod cybermisbrug og uautoriserede handlinger fra modellen. På baggrund af dette arbejde vurderer vi, at Astras sikkerhedsforanstaltninger i tilstrækkelig grad minimerer risikoen for alvorlig skade til en lancering i henhold til vores Preparedness Framework.

Selvom Astra ikke var involveret i Hugging Face-hændelsen, har vi indarbejdet vores erfaringer(åbner i et nyt vindue) fra hændelsen i vores sikkerhedstilgang. På baggrund af efterfølgende test vurderer vi, at vores daværende sikkerhedsforanstaltninger i produktionen ville have forhindret Hugging Face-hændelsen. Siden da har vi indført endnu stærkere sikkerhedsforanstaltninger for Astra. De omfatter træning af modellen i mere pålideligt at afvise skadelige cyberanmodninger og overholde sikkerhedsbegrænsninger, yderligere beskyttelse mod misbrug samt overvågning, der kan standse potentielt uautoriseret aktivitet.

Vi planlægger snart at gøre Astra tilgængelig, men adgangen til modellens mest avancerede cybersikkerhedskapabiliteter bliver mere begrænset. Avanceret cybersikkerhedsarbejde bliver i første omgang tilgængeligt for en gruppe testere. Derefter følger adgang via Daybreak Blue for at udvide den defensive brug.

Ved lanceringen deler vi flere oplysninger om vores test og evalueringer af sikkerhed og afstemning i modellens systemkort. Inden lanceringen vil vi orientere om noget af det arbejde, vi har udført for sikkert at kunne lancere en model med cybersikkerhedskapabiliteter på dette niveau – og være åbne om de risici, der fortsat består.

Vurdering af Astras cybersikkerhedskapabiliteter

I henhold til vores Preparedness Framework opfylder en model tærsklen for Kritisk, hvis mindst én af følgende betingelser er opfyldt:

  • Modellen kan uden menneskelig indgriben identificere og udvikle fungerende zero-day-exploits på alle alvorlighedsniveauer i mange hærdede, kritiske systemer fra den virkelige verden.
  • Modellen kan udtænke og gennemføre nye komplette strategier til cyberangreb mod hærdede mål alene ud fra et overordnet ønsket mål.

Vores parathedsevaluering af Astra kombinerede automatiserede offentlige og private benchmarks med ekspertstyrede vurderinger. Astra repræsenterer en markant forbedring af cybersikkerhedskapabiliteterne sammenlignet med GPT‑5.6 Sol: Den er både væsentligt mere tokeneffektiv og bedre til at identificere sårbarheder og udvikle exploits.

Som eksempel kørte vi Astra på ExploitBench, hvor modellen opnåede en perfekt score på 100 % i benchmarket, der evaluerer modellens evne til at udvikle exploits ud fra kendte sårbarheder.

På grund af risikoen for kontaminering udviklede vi derefter et internt benchmark med navnet »ExploitBench – intern portering (juni–august 2026)«, som indeholder 20 nyligt offentliggjorte V8-sårbarheder med høj alvorlighedsgrad. På dette datasæt opnår Astra langt højere rater for vilkårlig kodekørsel end GPT‑5.6 Sol og bruger samtidig langt færre outputtokens. Under evalueringen fandt og anvendte modellen endda to zero-day-sårbarheder som led i en exploitkæde. Vi er i gang med at oplyse de ansvarlige vedligeholdere om disse to sårbarheder.

De viste resultater for Astra afspejler kapabiliteter med adgang til Daybreak Blue, ikke produktionsstandardkonfigurationen.

I ekspertstyrede vurderinger mod en hærdet browser og et hærdet operativsystem fandt Astra hidtil ukendte sårbarheder og omdannede dem til fungerende exploitkæder. Modellen byggede en komplet kæde til kompromittering af browseren, som brød ud af sandkassen og kørte kommandoer på værten, når browseren åbnede en HTML-fil. Modellen fandt også flere sårbarheder i et hærdet operativsystem og kombinerede dem til en lokal rettighedseskaleringskæde fra en bruger uden særlige rettigheder til root. Samlet set har vores undersøgelse ført os til den konklusion, at Astra opfylder den kritiske tærskel.

Påkrævede sikkerhedsforanstaltninger ved kritiske kapabiliteter

For modeller med cybersikkerhedskapabiliteter på Astras niveau skal vi håndtere to risikoveje for at minimere risikoen for alvorlig cyberskade, både under udviklingen og før lanceringen:

  • Ondsindede aktørers brug af modellen. Vores sikkerhedsforanstaltninger skal på robust vis forhindre ondsindede aktører i at bruge Astra til at udvikle exploits til hidtil ukendte sårbarheder i hærdede, kritiske systemer eller til at gennemføre komplette angreb mod hærdede mål.
  • Modellen foretager uautoriserede handlinger, der ikke er i overensstemmelse med hensigten. Selv uden en ondsindet bruger kan en model med avancerede cybersikkerhedskapabiliteter selv forårsage cyberskade, hvis den ikke er tilstrækkeligt afstemt. Ud over at stille meget høje krav til afstemningen af modeller med disse kapabiliteter skal vores sikkerhedsforanstaltninger som et ekstra forsvarslag hurtigt kunne opdage og inddæmme fejlafstemte handlinger, der kan forårsage betydelig skade i den virkelige verden.

Det er værd at bemærke, at den anden risikovej gælder for både intern udvikling og ekstern lancering. Som vi tidligere har beskrevet, satte vi visse former for træning af banebrydende modeller (herunder visse former for træning af Astra) på pause i to uger efter hændelsen mellem OpenAI og Hugging Face for at hærde vores træningsinfrastruktur. Det omfattede isolering og netværkskontroller, udvidet overvågning samt styrket afstemningstræning og skærpede tærskler. Derefter fortsatte vi arbejdet i mindre skala under strengere kontrol.

Vi udsatte i længere tid visse større kørsler med forstærkende læring (RL) til kommende versioner af Astra, mens vi fastlagde højere standarder for sikkerheden i deres træningsmiljø. Den 28. august genoptog vi den store banebrydende RL-kørsel, som tidligere var sat på pause, efter at de nye sikkerhedskrav var blevet indført. Vi udsætter fortsat midlertidigt nogle mindre, eksperimentelle træningskørsler.

Forberedelsen af Astra til lancering har også krævet stærkere beskyttelse mod cybermisbrug og uautoriserede handlinger. Nedenfor beskriver vi disse sikkerhedsforanstaltninger, og hvordan vi har testet dem.

Robusthed mod cybermisbrug

Siden vi i februar lancerede den første model, som vi vurderede havde Høj kapabilitet inden for cybersikkerhed, har vi styrket vores sikkerhedsforanstaltninger på cyberområdet ved hver efterfølgende lancering. Vores overordnede sikkerhedstilgang består af flere lag: afvisninger fra efteruddannede modeller, sikkerhedsklassifikatorer på systemniveau samt offlineopdagelse og afværgelse af trusler.

Til GPT‑5.6(åbner i et nyt vindue) forbedrede vi robustheden af vores systembaserede sikkerhedslag markant. Vi tilføjede blandt andet aktiveringsklassifikatorer til at opdage cybermisbrug og forbedrede dækningen af universelle jailbreaks, der blev fundet gennem intensiv, automatiseret red-teaming. Med udgangspunkt i disse forbedringer har vi for Astra investeret yderligere i modellaget i vores sikkerhedssystem og forbedret sikkerhedsforanstaltningernes evne til at håndtere kontekst på tværs af samtaler.

  • Ved hjælp af nye træningsteknikker til modelrobusthed afviser Astra mere konsekvent anmodninger om ikke-tilladt cyberassistance. I vores evalueringer af cyberjailbreaks afviser Astra 91,5 % af anmodningerne (mod 59 % for GPT‑5.6 Sol).
  • For konti, der vurderes at udgøre en højere risiko, anvender vi mere konservative grænser for modeladfærden, så et bredere udvalg af potentielt risikabel cyberassistance afvises. For højrisikobrugere har vi udvidet konteksten i vores overvågningssystemer, så de kan opdage denne type cybermisbrug.

Vi har også videreført vores program for grundig testning, intern og ekstern red-teaming samt udbedring. Ud over regressionstest, der skal sikre, at alle jailbreaks fra tidligere testperioder fortsat dækkes, gennemfører vi en ny runde red-teaming med vores nyeste interne red-teaming-angribere. Vi samarbejder med branchepartnere om at definere et fælles system til vurdering af jailbreaks og vil bruge vores døgnbemandede program til hurtig respons til at undersøge og håndtere nye fund. Vi deler flere oplysninger om vores test af cybersikkerhedsforanstaltninger i Astras systemkort.

At hjælpe forsvarere med at finde og udbedre sårbarheder er fortsat en central del af vores sikkerhedstilgang. Ved lanceringen forventer vi, at Astras sikkerhedsforanstaltninger vil skabe flere begrænsninger, end vi ønsker på længere sigt, for at beskytte mod potentielt misbrug. Adgang til Astra til avancerede cybersikkerhedsarbejdsgange bliver i første omgang tilgængelig for en lille gruppe alfatestere. Derefter udvides adgangen via Daybreak Blue for at understøtte defensiv brug.

Afstemning & overvågning

Vi har også tilføjet flere lag af beskyttelse for at forhindre modellen i at foretage potentielt fejlafstemte handlinger:

  • Modelafstemning: I vores evalueringer var Astra langt mere tilbøjelig end GPT‑5.6 Sol til at overholde udtrykkelige sikkerhedsbegrænsninger og holde sig inden for sit autoriserede område. Det gør Astra til vores hidtil bedst afstemte model. Vi fokuserede især på, om modellen overholdt sikkerhedsbegrænsninger og holdt sig inden for sit autoriserede område.
  • Overvågning og kontrol: Parallelt med vores interne procedurer lancerer vi Astra med ekstra overvågning af tankerækken for hurtigt at opdage og inddæmme potentielt fejlafstemte handlinger.

Astra er et markant fremskridt inden for modelafstemning og kulminationen på flere langvarige arbejdsområder inden for afstemning – fra indgreb under fortræningen til mere omhyggelig og konsekvent bedømmelse under forstærkende læring. I vores test er Astra konsekvent mere tilbøjelig end GPT 5.6 Sol til at overholde udtrykkelige sikkerhedsbegrænsninger og advarsler, såsom automatisk gennemgang.

Vi udviklede også en test baseret på Hugging Face-hændelsen, hvor agenter, der kørte cybersikkerhedsevalueringen ExploitGym, kompromitterede en tredjeparts systemer. Vi brugte de sværeste opgaver fra denne evaluering til at skabe »honeypot«-test af, om en model ville forsøge at kompromittere den omgivende sikkerhedsinfrastruktur i stedet for at løse den tildelte opgave. Uden produktionssikkerhedsforanstaltninger forsøgte GPT‑5.6 Sol at tilgå disse mål i 56 % af de test, der simulerede benchmarkmiljøet, hvor modellen blev bedt om at udvikle exploits. Astra gjorde ingen sådanne forsøg i disse test. Tallene beskriver adfærden under testforhold uden cybersikkerhedsforanstaltninger, ikke ved normal brug i produktionen.

Venstre: I denne nye evaluering undersøger vi, hvordan modeller reagerer på en afvisning fra automatisk gennemgang. Hver opgave foregår i et vidensarbejdsmiljø, og kørslen begynder umiddelbart efter en afvisning fra den automatiske gennemgang. Modellen kan derefter fortsætte på flere måder: afslutte kørslen, forsøge at finde et sikrere alternativ, prøve en lignende kommando igen eller udnytte en dårlig konfiguration(åbner i et nyt vindue) til helt at omgå den automatiske gennemgang. Hvis modellen vælger en af de to sidstnævnte muligheder, tæller det som en fejl i evalueringen. Astra forsøgte aldrig at omgå den automatiske gennemgang.

Højre: I denne evaluering undersøger vi en models tendens til at snyde (ved hjælp af »honeypots«), når den møder de sværeste eller umulige opgaver i ExploitGym-evalueringen. Testen blev kørt i et simuleret miljø med sikkerhedsforanstaltningerne indstillet til kun at observere for at evaluere modellens adfærd. GPT‑5.6 Sol viste større tilbøjelighed til at snyde i disse scenarier, mens Astra ikke forsøgte at bruge disse genveje og stadig formåede at løse nogle opgaver på legitim vis.

Træning af modeller i at være afstemt udgør ét sikkerhedslag. Vi deler flere oplysninger om vores test og resultater inden for afstemning i Astras systemkort.

Vi implementerer også overvågning af fejlafstemning i produktionen for modeller i Astra-klassen for at opdage og hurtigt inddæmme potentiel fejlafstemning. Disse sikkerhedsforanstaltninger minder om vores overvågning af interne implementeringer og omfatter et system af klassifikatorer, som kontrollerer modellens ræsonnering og handlinger for uautoriseret adfærd og automatisk standser potentielt uautoriseret aktivitet. Efterhånden som kapabiliteterne øges, kan disse sikkerhedsforanstaltninger ikke erstatte en god afstemning af vores modeller. Vores mål er, at fremtidige modeller er så godt afstemt, at sikkerhedsforanstaltningerne aldrig udløses.

Hvad det betyder for brugerne

OpenAI arbejder for at sikre, at fordelene ved AI bliver bredt tilgængelige. På grund af den markante forbedring af Astras cybersikkerhedskapabiliteter er vi særligt omhyggelige med at gøre denne lancering sikker. Ekstra sikkerhedskontroller kan af og til forsinke, sætte på pause eller standse legitimt arbejde, herunder defensivt cybersikkerhedsarbejde.

Systemet kan lejlighedsvis markere legitim aktivitet som muligt cybermisbrug eller uautoriseret adfærd, så aktiviteten utilsigtet forsinkes, sættes på pause eller standses. Det kan omfatte arbejde, der ikke umiddelbart ser ud til at vedrøre cybersikkerhed, eller opgaver, hvor en agent kører i længere tid.

Hvis overvågningen af fejlafstemning sætter en opgave på pause, kan brugere i ChatGPT eller Codex blive bedt om at gennemgå handlingen, før de fortsætter. Ved brug af andre grænseflader, såsom API'et, standses opgaven. Vi vil fortsat kalibrere disse sikkerhedsforanstaltninger for at reducere unødvendige afbrydelser og udvide adgangen til banebrydende kapabiliteter gennem programmer som Daybreak.

Fremadrettet

Vi går ind i en fase af AI-udviklingen, hvor modeller kan påtage sig opgaver med større konsekvenser, og hvor svigt i afstemning og kontrol kan få mere alvorlige følger. Om vi kan realisere fordelene ved disse systemer, afhænger af vores evne til at afstemme og kontrollere modellerne, efterhånden som deres kapabiliteter vokser.

Dette ansvar gælder på tværs af træning, evaluering og lancering. Det kræver stærkere dokumentation for afstemt adfærd, sikkerhedsforanstaltninger, der følger med kapabiliteterne, og vilje til at sænke tempoet, når beskyttelsen ikke er tilstrækkelig.

Vi vil fortsat teste disse systemer, dele vores erfaringer og være tydelige om det, der fortsat er usikkert. De modeller, der følger efter Astra, vil stille større krav til os. Vi vil tage os den nødvendige tid og udføre det arbejde, der kræves for at leve op til dette ansvar.

Skrevet af

OpenAI