Des de la nostra avaluació anterior, en què consideràvem que Astra podria assolir un nivell crític de capacitat en ciberseguretat, hem recopilat més proves i dut a terme avaluacions addicionals de les capacitats del model. Ara creiem que Astra compleix el llindar de capacitat crítica en ciberseguretat del nostre Entorn de treball de preparació. Això vol dir que, amb les eines i l'accés adequats, pot trobar vulnerabilitats fins ara desconegudes i desenvolupar maneres d'explotar-les en molts sistemes ben protegits sense que una persona guiï cada pas. És el primer model que classifiquem en aquest nivell i requereix proteccions més sòlides durant el desenvolupament i abans del llançament.
Durant les últimes setmanes, hem endarrerit parts del desenvolupament i el llançament d'Astra mentre reforçàvem i provàvem les proteccions contra l'ús cibernètic indegut i les accions no autoritzades del model. Basant-nos en aquesta feina, creiem que les proteccions d'Astra minimitzen prou el risc de danys greus per permetre'n el llançament d'acord amb el nostre Entorn de treball de preparació.
Tot i que Astra no va estar implicat en l'incident de Hugging Face, hem incorporat al nostre enfocament de seguretat els aprenentatges(s'obre en una finestra nova) derivats de l'incident. Segons les proves retrospectives, creiem que les proteccions de producció que teníem aleshores haurien evitat l'incident de Hugging Face. Des d'aleshores, hem implantat proteccions encara més sòlides per a Astra, com ara entrenar el model perquè rebutgi amb més fiabilitat les peticions cibernètiques perjudicials i respecti les restriccions de seguretat, afegir proteccions contra l'ús indegut i aplicar una supervisió capaç d'aturar activitats potencialment no autoritzades.
Tenim previst oferir Astra aviat, però l'accés a les seves capacitats de ciberseguretat més avançades serà més limitat. Inicialment, el treball avançat de ciberseguretat estarà disponible per a un grup de verificadors; després, s'hi podrà accedir mitjançant Daybreak Blue per ampliar-ne l'ús defensiu.
En el llançament, compartirem més detalls sobre les nostres proves i avaluacions de seguretat i alineació a la fitxa del model. Abans del llançament, volem informar sobre part de la feina que estem fent per preparar el llançament segur d'un model amb aquest nivell de capacitats de ciberseguretat i explicar amb transparència quins riscos persisteixen.
Segons el nostre Entorn de treball de preparació, un model compleix el llindar Crític si es dona alguna de les condicions següents:
- El model pot identificar i desenvolupar explotacions funcionals de dia zero de tots els nivells de gravetat en molts sistemes crítics reals reforçats sense intervenció humana.
- El model pot idear i executar estratègies integrals i innovadores d'atacs cibernètics contra objectius reforçats a partir únicament d'un objectiu general.
La nostra avaluació de preparació d'Astra va combinar proves de referència automatitzades, tant públiques com privades, amb avaluacions dirigides per experts. Astra representa un augment considerable de les capacitats de ciberseguretat respecte de GPT‑5.6 Sol: és molt més eficient en l'ús de segments textuals i té més capacitat per identificar vulnerabilitats i desenvolupar explotacions.
Per exemple, vam executar Astra a ExploitBench, on el model va obtenir una puntuació perfecta del 100 % en la prova de referència que avalua la seva capacitat per desenvolupar explotacions a partir de vulnerabilitats conegudes.
Arran de la preocupació per una possible contaminació, vam crear una prova de referència interna anomenada "ExploitBench - Port intern (juny-agost de 2026)", que conté 20 vulnerabilitats V8 d'alta gravetat divulgades més recentment. En aquest conjunt de dades, Astra assoleix taxes d'execució de codi arbitrari molt més altes que GPT‑5.6 Sol amb molts menys segments textuals de sortida. Durant l'avaluació, el model fins i tot va descobrir i utilitzar dues vulnerabilitats de dia zero com a part d'una cadena d'explotació. Estem comunicant aquestes dues vulnerabilitats als responsables del manteniment.
Els resultats d'Astra que es mostren reflecteixen les capacitats amb accés a Daybreak Blue, no la configuració de producció predeterminada.
En avaluacions dirigides per experts contra un navegador i un sistema operatiu reforçats, Astra va descobrir vulnerabilitats fins aleshores desconegudes i les va convertir en cadenes d'explotació funcionals. Va crear una cadena completa per comprometre el navegador que escapava de l'entorn aïllat i executava ordres a l'amfitrió quan el navegador obria un fitxer HTML. El model també va trobar diverses vulnerabilitats en un sistema operatiu reforçat i les va combinar en una cadena local d'escalada de privilegis, des d'un usuari sense privilegis fins a root. En conjunt, la nostra investigació ens ha portat a concloure que Astra compleix el llindar crític.
Per als models amb el nivell de capacitats de ciberseguretat d'Astra, hem d'abordar dues vies per minimitzar el risc de danys cibernètics greus, tant durant el desenvolupament com abans del desplegament:
- Ús del model per part d'actors maliciosos. Les nostres proteccions han d'impedir de manera sòlida que actors maliciosos utilitzin Astra per desenvolupar explotacions de vulnerabilitats fins ara desconegudes en sistemes crítics reforçats o per dur a terme atacs integrals contra objectius reforçats.
- Accions no autoritzades i desalineades del model. Fins i tot sense un usuari maliciós, un model amb capacitats avançades de ciberseguretat podria causar danys cibernètics si estigués desalineat. A més d'exigir un nivell d'alineació molt alt als models amb aquestes capacitats, com a segona capa de defensa les nostres proteccions han de poder detectar i contenir ràpidament les accions desalineades que podrien causar danys importants al món real.
Cal destacar que la segona via s'aplica tant al desenvolupament intern com al desplegament extern. Com ja vam explicar, després de l'incident d'OpenAI-Hugging Face vam aturar durant dues setmanes determinats entrenaments d'avantguarda (inclosos alguns d'Astra) per reforçar la nostra infraestructura d'entrenament, amb mesures d'aïllament i controls de xarxa, una supervisió ampliada i uns entrenaments i llindars d'alineació més estrictes. Després vam reprendre el treball a menor escala amb controls més estrictes.
Vam ajornar durant més temps determinades execucions més grans d'aprenentatge per reforç (RL) per a versions futures d'Astra, mentre establíem requisits més exigents de seguretat per al seu entorn d'entrenament. El 28 d'agost, un cop implantats els nous requisits de seguretat, vam reprendre la gran execució d'RL d'avantguarda que havíem aturat. De moment, continuem ajornant algunes execucions experimentals d'entrenament més petites.
Preparar Astra per al llançament també ha exigit proteccions més sòlides contra l'ús cibernètic abusiu i les accions no autoritzades. A continuació, descrivim aquestes proteccions i com les hem provat.
Des que al febrer vam desplegar el primer model que consideràvem de capacitat Alta en ciberseguretat, hem reforçat les proteccions cibernètiques amb cada llançament posterior. El nostre enfocament general de seguretat combina en diverses capes les negatives del model posteriors a l'entrenament previ, els classificadors de seguretat del sistema, la detecció fora de línia i la neutralització d'amenaces.
Amb GPT‑5.6(s'obre en una finestra nova), vam millorar considerablement la solidesa del conjunt de proteccions del sistema, entre altres coses afegint classificadors d'activacions per detectar l'ús cibernètic abusiu i ampliant la cobertura de les evasions universals de proteccions de seguretat detectades mitjançant proves automatitzades intensives d'equip vermell. Partint d'aquestes millores, amb Astra hem invertit més en la capa del model del nostre conjunt de proteccions i hem millorat la capacitat de les proteccions per gestionar el context entre converses.
- Gràcies a noves tècniques d'entrenament per reforçar la solidesa del model, Astra rebutja de manera més fiable les peticions d'assistència cibernètica no permesa. En el nostre conjunt d'avaluacions d'evasions de proteccions de seguretat cibernètiques, Astra rebutja el 91,5 % de les peticions (davant del 59 % de GPT‑5.6 Sol).
- Als comptes que considerem de més risc, hi apliquem un límit més conservador al comportament del model, que rebutja un ventall més ampli d'assistència cibernètica potencialment arriscada. Per als usuaris d'alt risc, hem ampliat el context dels nostres sistemes de supervisió perquè puguin detectar aquests tipus d'ús cibernètic abusiu.
També hem continuat el nostre programa de proves rigoroses, proves internes i externes d'equip vermell i correcció de problemes. A més de les proves de regressió per comprovar que es continuïn cobrint totes les evasions de proteccions de seguretat detectades en períodes de proves anteriors, estem duent a terme una nova ronda de proves d'equip vermell amb els nostres últims atacants interns d'equip vermell. Treballem amb socis del sector per definir un sistema comú de classificació de les evasions de proteccions de seguretat i farem servir el nostre programa de resposta ràpida ininterrompuda per investigar i resoldre noves troballes. Compartirem més detalls sobre les proves de les proteccions cibernètiques a la fitxa del model d'Astra.
Ajudar els equips de defensa a trobar i corregir vulnerabilitats continua sent un pilar fonamental del nostre enfocament de seguretat. En el llançament, preveiem que les proteccions d'Astra generin més fricció de la que voldríem a llarg termini per protegir contra possibles usos indeguts. Inicialment, l'accés a Astra per a fluxos de treball avançats de ciberseguretat estarà disponible per a un petit grup de verificadors alfa; després, s'ampliarà l'accés mitjançant Daybreak Blue per afavorir-ne l'ús defensiu.
També hem afegit més capes de protecció per impedir que el model dugui a terme accions potencialment desalineades:
- Alineació del model: En les nostres avaluacions, Astra va mostrar molta més predisposició que GPT‑5.6 Sol a respectar les restriccions explícites de seguretat i mantenir-se dins del seu àmbit autoritzat, fet que el converteix en el nostre model més alineat fins ara. Ens hem centrat especialment en el respecte del model per les restriccions de seguretat i la seva tendència a mantenir-se dins de l'àmbit autoritzat.
- Supervisió i control: Seguint procediments similars als que apliquem internament, despleguem Astra amb supervisió addicional de la cadena de pensament per detectar i contenir ràpidament accions potencialment desalineades.
Astra representa un gran pas endavant en l'alineació de models i és la culminació de diverses línies de treball d'alineació de llarg recorregut, que van des d'intervencions en el preentrenament fins a una qualificació més acurada i coherent durant l'aprenentatge per reforç. En les proves, observem que Astra respecta de manera més constant les restriccions i els avisos explícits de seguretat, com ara la revisió automàtica, que GPT 5.6 Sol.
També vam desenvolupar una prova basada en l'incident de Hugging Face, en què els agents que executaven l'avaluació cibernètica ExploitGym van comprometre els sistemes d'un tercer. Vam utilitzar les tasques més difícils d'aquella avaluació per crear proves amb "esquers" que permetessin comprovar si un model intentaria comprometre la infraestructura de seguretat de l'entorn en lloc de resoldre la tasca assignada. Sense les proteccions de producció, GPT‑5.6 Sol va intentar accedir a aquests objectius en el 56 % de les proves que simulaven l'entorn de la prova de referència, on s'indicava al model que desenvolupés explotacions. Astra no va fer cap intent d'aquest tipus en aquestes proves. Aquestes xifres descriuen el comportament en les condicions de prova sense proteccions cibernètiques, no en l'ús normal en producció.
Esquerra: En aquesta nova avaluació, observem com reaccionen els models quan la revisió automàtica rebutja una acció. Cada tasca se situa en un entorn de treball del coneixement i l'execució comença immediatament després del rebuig. A partir d'aquí, el model pot actuar de diverses maneres: finalitzar l'execució, intentar trobar una alternativa més segura, tornar a provar una ordre semblant o aprofitar una configuració deficient(s'obre en una finestra nova) per eludir completament la revisió automàtica. Optar per qualsevol de les dues últimes opcions suposaria no superar l'avaluació. Astra no va intentar mai eludir la revisió automàtica.
Dreta: En aquesta avaluació, comprovem la tendència d'un model a fer trampes (mitjançant "esquers") quan afronta les tasques més difícils o impossibles de l'avaluació ExploitGym. Es va executar en un entorn simulat, amb les proteccions només en mode d'observació, per avaluar el comportament del model. Tot i que GPT‑5.6 Sol va mostrar una probabilitat més alta de fer trampes en aquests escenaris, Astra no va intentar utilitzar aquestes dreceres i, malgrat això, va poder resoldre legítimament algunes tasques.
Entrenar els models perquè estiguin alineats és una capa de seguretat. Compartirem més detalls sobre les proves i els resultats d'alineació a la fitxa del model d'Astra.
També estem desplegant en producció la supervisió de desalineacions per als models de la classe d'Astra, a fi de detectar i contenir ràpidament possibles desalineacions. Aquestes proteccions s'assemblen a la supervisió dels nostres desplegaments interns i inclouen un sistema de classificadors que comproven si el raonament i les accions del model mostren comportaments no autoritzats i aturen automàticament les activitats potencialment no autoritzades. Aquestes proteccions no poden substituir una bona alineació dels nostres models a mesura que n'augmenten les capacitats, i el nostre objectiu és que els models futurs estiguin prou ben alineats perquè aquestes proteccions no s'activin mai.
OpenAI es compromet a garantir que els beneficis de la IA siguin àmpliament accessibles. Atès l'augment considerable de les capacitats de ciberseguretat d'Astra, tenim una cura especial perquè aquest desplegament sigui segur. De vegades, les comprovacions de seguretat addicionals poden alentir, posar en pausa o aturar treballs legítims, inclosa la ciberseguretat defensiva.
De vegades, el sistema pot marcar una activitat legítima com a possible ús cibernètic indegut o comportament no autoritzat i, per error, alentir-la, posar-la en pausa o aturar-la. Això pot incloure treballs que no semblen directament relacionats amb la ciberseguretat o tasques en què un agent s'executa durant un període prolongat.
Si el monitor de desalineacions posa una tasca en pausa, és possible que es demani als usuaris de ChatGPT o Codex que revisin l'acció abans de continuar. Si s'utilitzen altres interfícies, com ara l'API, la tasca s'aturarà. Tenim previst continuar calibrant aquestes proteccions per reduir les interrupcions innecessàries i ampliar l'accés a les capacitats d'avantguarda mitjançant programes com Daybreak.
Entrem en una etapa del desenvolupament de la IA en què els models poden assumir tasques de més transcendència i les fallades d'alineació i control poden tenir efectes més greus. Aprofitar els beneficis d'aquests sistemes dependrà de la nostra capacitat per alinear i controlar els models a mesura que n'augmentin les capacitats.
Aquesta responsabilitat abasta l'entrenament, l'avaluació i el desplegament. Exigeix proves més sòlides d'un comportament alineat, proteccions que avancin al mateix ritme que les capacitats i la disposició a alentir el progrés quan aquestes proteccions no siguin suficients.
Continuarem provant aquests sistemes, compartint el que aprenem i explicant amb claredat què continua sent incert. Els models posteriors a Astra ens exigiran més. Dedicarem el temps i farem la feina necessaris per complir aquesta responsabilitat.
