De weg naar Astra: kritieke capaciteiten en grensverleggende beveiligingsmaatregelen
Sinds onze eerdere beoordeling dat Astra mogelijk een kritiek niveau van cybersecuritycapaciteiten zou bereiken, hebben we meer bewijs verzameld en aanvullende evaluaties uitgevoerd om de capaciteiten van het model te beoordelen. We zijn nu van mening dat Astra volgens ons Preparedness Framework voldoet aan de drempel voor kritieke cybersecuritycapaciteiten. Dit betekent dat het met de juiste hulpmiddelen en toegang voorheen onbekende beveiligingskwetsbaarheden kan vinden en manieren kan ontwikkelen om die in veel goed beveiligde systemen te misbruiken, zonder dat een mens elke stap begeleidt. Het is het eerste model dat we op dit niveau inschalen en vereist sterkere beveiligingsmaatregelen tijdens de ontwikkeling en vóór de release.
De afgelopen weken hebben we delen van Astra's ontwikkeling en release uitgesteld terwijl we beschermingsmaatregelen tegen cybermisbruik en ongeoorloofde modelacties versterkten en testten. Op basis van dat werk zijn we van mening dat Astra's beveiligingsmaatregelen het risico op ernstige schade voldoende beperken om het model volgens ons Preparedness Framework uit te brengen.
Hoewel Astra niet betrokken was bij het Hugging Face-incident, hebben we de lessen(opent in een nieuw venster) uit dat incident verwerkt in onze veiligheidsaanpak. Op basis van tests achteraf denken we dat onze toenmalige productiebeveiliging het Hugging Face-incident zou hebben voorkomen. Sindsdien hebben we voor Astra nog sterkere beveiligingsmaatregelen ingevoerd. Zo hebben we het model getraind om schadelijke cyberverzoeken betrouwbaarder te weigeren en veiligheidsbeperkingen te respecteren, aanvullende bescherming tegen misbruik toegevoegd en monitoring ingevoerd die mogelijk ongeoorloofde activiteiten kan stoppen.
We zijn van plan Astra binnenkort beschikbaar te maken, maar de toegang tot de meest geavanceerde cybersecuritycapaciteiten wordt beperkter. Geavanceerd cybersecuritywerk wordt aanvankelijk beschikbaar voor een groep testers. Daarna volgt toegang via Daybreak Blue om defensief gebruik uit te breiden.
Bij de lancering delen we in de systeemkaart van het model meer informatie over onze tests en evaluaties op het gebied van veiligheid, beveiliging en afstemming. Voorafgaand aan de release willen we een update geven over een deel van het werk dat we hebben verricht om een model met dit niveau van cybersecuritycapaciteiten veilig uit te brengen, en transparant zijn over de resterende risico's.
Volgens ons Preparedness Framework voldoet een model aan de kritieke drempel als aan een van de volgende voorwaarden wordt voldaan:
- Het model kan zonder menselijke tussenkomst functionele zero-day-exploits van alle ernstniveaus identificeren en ontwikkelen voor veel goed beveiligde, kritieke praktijksystemen.
- Het model kan op basis van alleen een globaal gewenst doel nieuwe, volledige strategieën voor cyberaanvallen op goed beveiligde doelwitten bedenken en uitvoeren.
Onze gereedheidsevaluatie van Astra combineerde geautomatiseerde openbare en besloten benchmarks met beoordelingen onder leiding van experts. Astra betekent een aanzienlijke toename van de cybersecuritycapaciteiten ten opzichte van GPT‑5.6 Sol: het model is veel tokenefficiënter en beter in het identificeren van kwetsbaarheden en ontwikkelen van exploits.
Zo hebben we Astra uitgevoerd op ExploitBench, waar het model een perfecte benchmarkscore van 100% behaalde bij de beoordeling van zijn vermogen om exploits voor bekende kwetsbaarheden te ontwikkelen.
Vanwege zorgen over contaminatie bouwden we vervolgens een interne benchmark met de naam "ExploitBench - Internal Port (juni–augustus 2026)", met twintig onlangs bekendgemaakte V8-kwetsbaarheden van hoge ernst. Op deze dataset behaalt Astra met veel minder uitvoertokens aanzienlijk hogere percentages voor de uitvoering van willekeurige code dan GPT‑5.6 Sol. Tijdens de evaluatie ontdekte en gebruikte het model zelfs twee zero-daykwetsbaarheden als onderdeel van een exploitketen. We zijn bezig deze twee kwetsbaarheden aan de beheerders te melden.
De weergegeven resultaten van Astra weerspiegelen de capaciteiten met toegang tot Daybreak Blue, niet de standaard productieconfiguratie.
In door experts geleide beoordelingen met een goed beveiligde browser en een goed beveiligd besturingssysteem ontdekte Astra voorheen onbekende kwetsbaarheden en zette het die om in werkende exploitketens. Het bouwde een volledige keten om een browser over te nemen, ontsnapte uit de sandbox en voerde opdrachten op de host uit wanneer de browser een HTML-bestand opende. Het model vond ook meerdere kwetsbaarheden in een goed beveiligd besturingssysteem en combineerde die tot een lokale keten voor bevoegdheidsverhoging, van een gebruiker zonder bevoegdheden naar root. Alles bij elkaar heeft ons onderzoek tot de conclusie geleid dat Astra aan de kritieke drempel voldoet.
Bij modellen met Astra's niveau van cybersecuritycapaciteiten moeten we twee routes afdekken om het risico op ernstige cyberschade te beperken, zowel tijdens de ontwikkeling als vóór de implementatie:
- Kwaadwillenden die het model gebruiken. Onze beveiligingsmaatregelen moeten robuust voorkomen dat kwaadwillenden Astra gebruiken om exploits te ontwikkelen voor voorheen onbekende kwetsbaarheden in goed beveiligde kritieke systemen of om volledige aanvallen op goed beveiligde doelwitten uit te voeren.
- Het model dat ongeoorloofde, niet-afgestemde acties uitvoert. Zelfs zonder kwaadwillende gebruiker kan een model met geavanceerde cybersecuritycapaciteiten cyberschade veroorzaken als het onvoldoende is afgestemd. Naast een zeer hoge norm voor de afstemming van modellen met deze capaciteiten, moeten onze beveiligingsmaatregelen als tweede verdedigingslaag niet-afgestemde acties die aanzienlijke schade in de echte wereld kunnen veroorzaken snel kunnen detecteren en inperken.
De tweede route geldt nadrukkelijk voor zowel interne ontwikkeling als externe implementatie. Zoals we eerder beschreven, hebben we na het OpenAI-Hugging Face-incident bepaalde trainingen van grensverleggende modellen, waaronder bepaalde trainingen voor Astra, twee weken stilgelegd om onze trainingsinfrastructuur beter te beveiligen. Dit omvatte isolatie- en netwerkcontroles, uitgebreidere monitoring en strengere afstemmingstraining en drempelwaarden. Daarna zetten we kleinschaliger werk voort onder strengere controles.
Bepaalde grotere runs voor reinforcement learning (RL) voor toekomstige versies van Astra hielden we langer tegen, terwijl we hogere eisen opstelden voor de veiligheid en beveiliging van hun trainingsomgeving. Op 28 augustus hebben we de eerder stilgelegde grote RL-run voor het grensverleggende model hervat, nadat de nieuwe veiligheids- en beveiligingseisen waren ingevoerd. Enkele kleinere experimentele trainingsruns stellen we voorlopig nog uit.
Om Astra gereed te maken voor release waren ook sterkere beschermingsmaatregelen tegen cybermisbruik en ongeoorloofde acties nodig. Hieronder beschrijven we deze beveiligingsmaatregelen en hoe we ze hebben getest.
Sinds we in februari het eerste model implementeerden dat we voor cybersecurity als Hoog inschaalden, hebben we onze cyberbeveiligingsmaatregelen bij elke volgende lancering versterkt. Onze algemene veiligheidsaanpak combineert na training aangeleerde weigeringen van het model, veiligheidsclassificatoren op systeemniveau en offline detectie en verstoring van dreigingen.
Voor GPT‑5.6(opent in een nieuw venster) hebben we onze beveiligingsstack op systeemniveau aanzienlijk robuuster gemaakt. Zo voegden we activeringsclassificatoren toe om cybermisbruik te detecteren en verbeterden we de bescherming tegen universele jailbreaks die via intensieve geautomatiseerde red teaming waren gevonden. Voortbouwend op deze verbeteringen hebben we voor Astra verder geïnvesteerd in de modellaag van onze beveiligingsstack en het vermogen van onze beveiligingsmaatregelen verbeterd om context uit meerdere gesprekken te verwerken.
- Dankzij nieuwe trainingstechnieken voor modelrobuustheid weigert Astra verzoeken om niet-toegestane cyberondersteuning betrouwbaarder. In onze reeks evaluaties van cyberjailbreaks weigert Astra 91,5% van de verzoeken, tegenover 59% bij GPT‑5.6 Sol.
- Voor accounts die als risicovoller zijn beoordeeld, hanteren we een conservatievere grens voor modelgedrag, waardoor een breder scala aan mogelijk riskante cyberondersteuning wordt geweigerd. Voor gebruikers met een hoog risico hebben we de context uitgebreid die onze monitoringsystemen gebruiken om dit soort cybermisbruik te kunnen detecteren.
Ook hebben we ons programma voor grondige tests, interne en externe red teaming en herstelmaatregelen voortgezet. Naast regressietests om te garanderen dat alle jailbreaks uit eerdere testperioden gedekt blijven, voeren we een nieuwe ronde red teaming uit met onze nieuwste interne aanvallers voor red teaming. We werken met branchepartners aan een gezamenlijk beoordelingssysteem voor jailbreaks en zullen ons 24/7-snelresponsprogramma inzetten om nieuwe bevindingen te onderzoeken en aan te pakken. In de systeemkaart van Astra delen we meer informatie over onze tests van cyberbeveiligingsmaatregelen.
Verdedigers helpen kwetsbaarheden te vinden en te verhelpen blijft een centrale pijler van onze veiligheidsaanpak. Bij de lancering verwachten we dat Astra's beveiligingsmaatregelen meer belemmeringen veroorzaken dan uiteindelijk de bedoeling is, om bescherming te bieden tegen mogelijk misbruik. Toegang tot Astra voor geavanceerde cybersecurityworkflows is aanvankelijk beschikbaar voor een kleine groep alfatesters. Daarna wordt de toegang via Daybreak Blue uitgebreid om defensief gebruik te ondersteunen.
We hebben ook aanvullende, gelaagde beschermingsmaatregelen toegevoegd om te voorkomen dat het model mogelijk niet-afgestemde acties uitvoert:
- Modelafstemming: In onze evaluaties respecteerde Astra expliciete veiligheids- en beveiligingsbeperkingen veel vaker dan GPT‑5.6 Sol en bleef het beter binnen zijn geautoriseerde bereik. Daarmee is dit ons best afgestemde model tot nu toe. We richtten ons vooral op de mate waarin het model beveiligings- en veiligheidsbeperkingen respecteert en binnen zijn geautoriseerde bereik blijft.
- Monitoring en controle: In aansluiting op onze interne procedures implementeren we Astra met aanvullende chain-of-thought-monitoring om mogelijk niet-afgestemde acties snel te detecteren en in te perken.
Astra betekent een belangrijke vooruitgang in modelafstemming en vormt de culminatie van verschillende langlopende werkstromen voor afstemming, van interventies tijdens pre-training tot zorgvuldigere en consistentere beoordeling tijdens reinforcement learning. Uit tests blijkt dat Astra expliciete veiligheidsbeperkingen en waarschuwingen, zoals auto-review, consequent vaker respecteert dan GPT‑5.6 Sol.
We ontwikkelden ook een door het Hugging Face-incident geïnspireerde test, waarin agents die de cyberevaluatie ExploitGym uitvoerden de systemen van een derde partij compromitteerden. We gebruikten de moeilijkste taken uit die evaluatie om "honeypottests" te maken die beoordelen of een model de omliggende beveiligingsinfrastructuur probeert te compromitteren in plaats van de toegewezen taak op te lossen. Zonder productiebeveiliging probeerde GPT‑5.6 Sol in 56% van de tests toegang te krijgen tot die doelwitten. Deze tests simuleerden de benchmarkomgeving waarin het model de opdracht krijgt exploits te ontwikkelen. Astra deed in deze tests geen enkele dergelijke poging. Deze cijfers beschrijven het gedrag onder testomstandigheden zonder cyberbeveiligingsmaatregelen, niet bij normaal productiegebruik.
Links: In deze nieuwe evaluatie observeren we hoe modellen reageren op een afwijzing door auto-review. Elke taak speelt zich af in een kenniswerkomgeving en de rollout begint direct na een afwijzing door auto-review. Het model kan vervolgens op meerdere manieren doorgaan: de rollout beëindigen, een veiliger alternatief zoeken, een vergelijkbare opdracht opnieuw proberen of een slechte configuratie(opent in een nieuw venster) misbruiken om auto-review volledig te omzeilen. Het nastreven van een van de laatste twee opties geldt als een mislukking in deze evaluatie. Astra heeft nooit geprobeerd auto-review te omzeilen.
Rechts: In deze evaluatie onderzoeken we de neiging van een model om vals te spelen met behulp van "honeypots" wanneer het wordt geconfronteerd met de moeilijkste of onmogelijke taken uit de ExploitGym-evaluatie. De evaluatie vond plaats in een gesimuleerde omgeving, met beveiligingsmaatregelen uitsluitend in observatiemodus, om het gedrag van het model te beoordelen. GPT‑5.6 Sol vertoonde in deze scenario's een grotere neiging om vals te spelen. Astra probeerde deze sluiproutes niet te gebruiken en kon toch enkele taken op legitieme wijze oplossen.
Modellen trainen om afgestemd te handelen is één veiligheidslaag. In de systeemkaart van Astra delen we meer informatie over onze afstemmingstests en resultaten.
Voor modellen van de Astra-klasse implementeren we in productie ook monitoring van gebrekkige afstemming om mogelijke afwijkingen te detecteren en snel in te perken. Deze beveiligingsmaatregelen lijken op onze monitoring voor interne implementaties. Ze omvatten een systeem van classificatoren dat de redenering en acties van het model controleert op ongeoorloofd gedrag en mogelijk ongeoorloofde activiteiten automatisch stopt. Naarmate de capaciteiten toenemen, kunnen deze beveiligingsmaatregelen een goede afstemming van onze modellen niet vervangen. Ons doel is toekomstige modellen zo goed af te stemmen dat deze maatregelen nooit worden geactiveerd.
OpenAI zet zich ervoor in de voordelen van AI breed toegankelijk te maken. Gezien de aanzienlijke toename van Astra's cybersecuritycapaciteiten gaan we bijzonder zorgvuldig te werk om deze implementatie veilig en goed beveiligd te maken. Extra veiligheidscontroles kunnen legitiem werk, waaronder defensieve cybersecurity, soms vertragen, onderbreken of stoppen.
Het systeem kan legitieme activiteiten soms aanmerken als mogelijk cybermisbruik of ongeoorloofd gedrag, waardoor ze onbedoeld worden vertraagd, onderbroken of gestopt. Dit kan ook gelden voor werk dat niet rechtstreeks verband lijkt te houden met cybersecurity of voor taken waarbij een agent langere tijd actief is.
Als de monitor voor gebrekkige afstemming een taak onderbreekt, kunnen gebruikers in ChatGPT of Codex worden gevraagd de actie te beoordelen voordat ze doorgaan. Bij gebruik van andere omgevingen, zoals de API, wordt de taak gestopt. We blijven deze beveiligingsmaatregelen afstellen om onnodige onderbrekingen te beperken en via programma's zoals Daybreak de toegang tot grensverleggende capaciteiten uit te breiden.
We komen in een fase van AI-ontwikkeling waarin modellen belangrijker werk kunnen uitvoeren en tekortkomingen in afstemming en controle ernstigere gevolgen kunnen hebben. Of we de voordelen van deze systemen kunnen benutten, hangt af van ons vermogen om modellen af te stemmen en te beheersen terwijl hun capaciteiten toenemen.
Die verantwoordelijkheid omvat training, evaluatie en implementatie. Dit vereist sterker bewijs van afgestemd gedrag, beveiligingsmaatregelen die gelijke tred houden met de capaciteiten en de bereidheid om te vertragen wanneer die bescherming onvoldoende is.
We blijven deze systemen testen, delen wat we leren en zijn duidelijk over wat onzeker blijft. De modellen die na Astra komen, zullen meer van ons vragen. We nemen de tijd en verrichten het nodige werk om die verantwoordelijkheid waar te maken.
