Overslaan naar hoofdinhoud
OpenAI

3 september 2026

Veiligheid

Veiligheidsoverzicht: GPT‑6 Astra

Bezig met laden...

Vandaag brengen we GPT‑6 Astra uit, het krachtigste model dat we ooit breed hebben ingezet. Astra is ons eerste model dat binnen ons Preparedness Framework het kritieke niveau voor cyberbeveiligingscapaciteiten bereikt.

Dit zijn de belangrijkste zaken om te weten over de veiligheid van deze release:

  1. GPT‑6 Astra betekent een grote vooruitgang in cybercapaciteiten en bereikt onze kritieke drempel. Dit betekent dat GPT‑6 Astra met de juiste hulpmiddelen en toegang voorheen onbekende beveiligingslekken kan vinden en nieuwe manieren kan ontwikkelen om die in tal van goed beveiligde systemen uit te buiten, zonder dat iemand elke stap begeleidt. Daarom hebben we onze beveiligingsmaatregelen tegen schadelijke cyberacties door het model aanzienlijk versterkt, ongeacht of die het gevolg zijn van misbruik of gebrekkige afstemming. We hebben ook maatregelen genomen om onze interne ontwikkeling en implementatie van Astra en vergelijkbare modellen te beveiligen, waaronder strengere isolatie, versleuteling van checkpoints, universele monitoring van volledige trajecten inclusief redeneerketens (CoT), en een blokkerend evaluatieproces voor afstemming vóór intern gebruik.
  2. GPT‑6 Astra is aanzienlijk robuuster dan zijn voorgangers. Dankzij nieuwe veiligheidstrainingstechnieken voor robuustheid is GPT‑6 Astra aanzienlijk beter bestand tegen jailbreaks dan GPT‑5.6 Sol, ook over langere trajecten. Dit weten we op basis van offlinetests en ons programma voor grondige interne en externe tests op jailbreaks en het verhelpen daarvan. Voor gebruikers die als mogelijk risicovol zijn aangemerkt, hebben we het model bovendien getraind om de weigeringsgrens conservatiever in te stellen en een breder scala aan risico's van tweeërlei gebruik af te dekken. Met regressietests zorgen we ervoor dat Astra bestand is tegen jailbreaks die in eerdere testperioden zijn gevonden. Ook hebben we nieuwe rondes geautomatiseerde red teaming uitgevoerd met onze nieuwste interne aanvallers voor red teaming om onze verbeteringen te valideren.
  3. GPT‑6 Astra is beter afgestemd dan GPT‑5.6 Sol. Astra betekent een grote vooruitgang in modelafstemming en bevat verbeteringen die uiteenlopen van de samenstelling van onze pre-trainingsdata tot onze beoordeling tijdens reinforcement learning. We publiceren een nieuwe reeks evaluaties van de afstemming(opent in een nieuw venster) en constateren dat GPT‑6 Astra beter de grenzen voor veiligheid en beveiliging respecteert en binnen zijn geautoriseerde werkgebied blijft. In een simulatie met meer dan 54.000 interne Codex-taken(opent in een nieuw venster) kreeg Astra bovendien ongeveer half zoveel signaleringen voor ernstiger gebrekkig afgestemd gedrag als Sol.
  4. We zetten monitoring op gebrekkige afstemming breed in. We beschouwen modelafstemming als het belangrijkste middel om mogelijk gebrekkig afgestemd gedrag van onze modellen te voorkomen. Monitoring biedt echter breed inzicht in het gedrag van grensverleggende modellen en maakt duidelijk waar we de afstemming en veiligheid verder kunnen verbeteren. Daarnaast vormt monitoring een extra beschermingslaag tegen gebrekkig afgestemd gedrag dat wordt gedetecteerd. Om deze redenen hebben we, tegen aanzienlijke rekenkosten, ook monitoring op gebrekkige afstemming toegevoegd aan alle inferentie met hulpmiddelen die deel uitmaakt van onze externe implementatie van Astra. Dit systeem komt overeen met onze interne opzet.
  5. GPT‑6 Astra is minder goed te monitoren dan GPT‑5.6 Sol. We hebben uitgebreid onderzoek gedaan naar de monitorbaarheid(opent in een nieuw venster) en beheersbaarheid(opent in een nieuw venster) van GPT‑6 Astra. We hebben vastgesteld dat GPT‑6 Astra zijn eigen CoT beter kan aansturen dan GPT‑5.6 Sol en minder vaak belastende informatie in zijn CoT opneemt. In adversariële situaties, waarin we het model ertoe aanzetten onze monitors te ontwijken, blijkt dat het model onopgemerkt kan blijven wanneer het tijdens evaluaties strategisch onderpresteert (sandbagging). Ook kan het soms onze interne monitors ontwijken wanneer het wordt gevraagd om bepaalde sabotagetaken(opent in een nieuw venster) uit te voeren. We hebben geen bewijs gezien voor steganografische CoT-redenering, zoals het verbergen van een onderliggende redenering in gewone, ogenschijnlijk niet-gerelateerde tekst. Dit wijst erop dat het risico op ontwijking grotendeels beperkt kan zijn tot taken die minder redenering vereisen.
    • Deze bevindingen wijzen erop dat modellen uit de Astra-klasse onze CoT-monitors onder adversariële omstandigheden zouden kunnen ontwijken. Deze bevindingen zijn momenteel grotendeels gebaseerd op adversariële evaluaties, waarbij we het model opdragen monitoring te ontwijken. Onze evaluaties van de afstemming laten over het geheel genomen zien dat Astra minder vaak dan GPT‑5.6 Sol de beveiligings- en veiligheidsbeperkingen schendt.
    • We nemen deze ontwikkeling echter serieus en blijven de bevindingen en de gevolgen ervan voor de monitorbaarheid onderzoeken naarmate onze modellen krachtiger worden. OpenAI heeft zich ingezet om monitoring van redeneerketens te behouden en te benutten. Het behouden van de monitorbaarheid van CoT is een kerndoel van het onderzoeksprogramma. Deze resultaten onderstrepen echter ook het belang van technieken om afstemming te controleren die verder gaan dan het onderzoeken van de redeneerketen van het model.
  6. GPT‑6 Astra gaat verantwoorder om met browser- en werkomgevingen: GPT‑6 Astra is aanzienlijk beter bestand tegen promptinjecties dan GPT‑5.6 Sol. Daarnaast hebben we het gedrag van het model getest in realistische browser- en professionele computeromgevingen. Daaruit blijkt dat het model aanzienlijk minder vaak gebrekkig afgestemde en mogelijk schadelijke handelingen uitvoert dan GPT‑5.6 Sol, zoals ongeautoriseerde transacties, gegevensverlies, buitensporige toegang of het omzeilen van controles. Het handelt ook veiliger bij schadelijke verzoeken in agentische omgevingen, zoals verzoeken om te helpen bij het plannen van gewelddadige aanvallen of het plegen van fraude.
  7. GPT‑6 Astra is aanzienlijk veiliger in scenario's met een hoger risico. GPT‑6 Astra reageert veiliger dan GPT‑5.6 Sol op uitdagende verzoeken uit productieomgevingen en adversariële menselijke red teaming. Astra realiseert een Pareto-verbetering: het handelt onveilige verzoeken veiliger af en weigert onschuldige verzoeken minder vaak onnodig. Deze verbeteringen gelden ook voor zeer ernstige scenario's waarin het risico op schade voortkomt uit de bredere context en niet uit een expliciet verzoek. Astra past bovendien consequenter leeftijdsgeschikte veiligheidsgrenzen toe voor gebruikers jonger dan 18 jaar.