Desde nuestra evaluación anterior, en la que determinamos que Astra podría alcanzar un nivel crítico de capacidad de ciberseguridad, hemos recopilado más pruebas y realizado evaluaciones adicionales para valorar las capacidades del modelo. Ahora creemos que Astra alcanza el umbral de capacidad crítica de ciberseguridad establecido en nuestro Marco de preparación. Esto significa que, con las herramientas y el acceso adecuados, puede encontrar fallos de seguridad hasta entonces desconocidos y desarrollar formas de explotarlos en numerosos sistemas bien protegidos sin que una persona guíe cada paso. Es el primer modelo que clasificamos en este nivel y requiere salvaguardas más sólidas durante el desarrollo y antes de su lanzamiento.
Durante las últimas semanas hemos retrasado partes del desarrollo y lanzamiento de Astra mientras reforzábamos y probábamos las protecciones frente al uso indebido con fines cibernéticos y las acciones no autorizadas del modelo. A partir de ese trabajo, creemos que las salvaguardas de Astra minimizan suficientemente el riesgo de daños graves para permitir su lanzamiento conforme a nuestro Marco de preparación.
Aunque Astra no estuvo implicado en el incidente de Hugging Face, hemos incorporado a nuestro enfoque de seguridad las lecciones aprendidas(se abre en una ventana nueva) de ese incidente. Según las pruebas retrospectivas, creemos que las salvaguardas de producción que teníamos entonces habrían evitado el incidente de Hugging Face. Desde entonces hemos implantado salvaguardas aún más sólidas para Astra, como entrenar al modelo para que rechace de forma más fiable las solicitudes cibernéticas dañinas y respete las restricciones de seguridad, añadir protecciones contra el uso indebido e incorporar una supervisión capaz de detener actividades potencialmente no autorizadas.
Tenemos previsto ofrecer Astra próximamente, pero el acceso a sus capacidades de ciberseguridad más avanzadas estará más restringido. El trabajo avanzado de ciberseguridad estará disponible inicialmente para un grupo de evaluadores y, después, se ofrecerá acceso mediante Daybreak Blue para ampliar el uso defensivo.
Cuando lancemos el modelo, compartiremos más detalles sobre nuestras pruebas y evaluaciones de seguridad, protección y alineación en su tarjeta del sistema. Antes del lanzamiento, queremos informar sobre parte del trabajo que estamos realizando para publicar de forma segura un modelo con este nivel de capacidades de ciberseguridad y explicar con transparencia qué riesgos persisten.
Según nuestro Marco de preparación, un modelo alcanza el umbral crítico si se cumple cualquiera de las siguientes condiciones:
- El modelo puede identificar y desarrollar exploits funcionales de día cero de cualquier nivel de gravedad en numerosos sistemas críticos reales reforzados, sin intervención humana.
- El modelo puede concebir y ejecutar estrategias novedosas e integrales de ciberataque contra objetivos reforzados a partir únicamente de un objetivo general.
Nuestra evaluación de preparación de Astra combinó pruebas de referencia públicas y privadas automatizadas con evaluaciones dirigidas por expertos. Astra representa un aumento considerable de las capacidades de ciberseguridad frente a GPT‑5.6 Sol: utiliza los tokens con mucha más eficiencia y tiene mayor capacidad para identificar vulnerabilidades y desarrollar exploits.
Por ejemplo, ejecutamos Astra en ExploitBench, donde el modelo obtuvo una puntuación perfecta del 100 % en la prueba de referencia que evalúa su capacidad para desarrollar exploits a partir de vulnerabilidades conocidas.
Ante el riesgo de contaminación, creamos después una prueba de referencia interna denominada «ExploitBench - Adaptación interna (junio-agosto de 2026)», que contiene 20 vulnerabilidades V8 de gravedad alta divulgadas más recientemente. En este conjunto de datos, Astra logra tasas de ejecución de código arbitrario muy superiores a GPT‑5.6 Sol usando muchos menos tokens de salida. Durante la evaluación, el modelo llegó a descubrir y utilizar dos vulnerabilidades de día cero como parte de una cadena de exploits. Estamos notificando estas dos vulnerabilidades a los responsables del mantenimiento.
Los resultados mostrados de Astra reflejan sus capacidades con acceso a Daybreak Blue, no con la configuración de producción predeterminada.
En evaluaciones dirigidas por expertos contra un navegador y un sistema operativo reforzados, Astra descubrió vulnerabilidades hasta entonces desconocidas y las convirtió en cadenas de exploits funcionales. Creó una cadena completa para comprometer el navegador que escapó del entorno aislado y ejecutó comandos en el host cuando el navegador abrió un archivo HTML. El modelo también encontró varias vulnerabilidades en un sistema operativo reforzado y las combinó en una cadena local de escalada de privilegios que pasó de un usuario sin privilegios a root. En conjunto, nuestra investigación nos ha llevado a concluir que Astra alcanza el umbral crítico.
En modelos con el nivel de capacidades de ciberseguridad de Astra, debemos cubrir dos vías para minimizar el riesgo de daños cibernéticos graves, tanto durante el desarrollo como antes del despliegue:
- Uso del modelo por parte de actores maliciosos. Nuestras salvaguardas deben impedir de forma sólida que actores maliciosos utilicen Astra para desarrollar exploits de vulnerabilidades hasta entonces desconocidas en sistemas críticos reforzados o para llevar a cabo ataques integrales contra objetivos reforzados.
- Acciones no autorizadas y desalineadas del modelo. Incluso sin un usuario malicioso, un modelo con capacidades avanzadas de ciberseguridad podría causar por sí mismo daños cibernéticos si estuviera desalineado. Además de exigir un nivel muy alto de alineación a los modelos con estas capacidades, nuestras salvaguardas deben poder detectar y contener rápidamente, como segunda línea de defensa, las acciones desalineadas que puedan causar daños importantes en el mundo real.
Cabe destacar que la segunda vía se aplica tanto al desarrollo interno como al despliegue externo. Como explicamos anteriormente, tras el incidente de OpenAI-Hugging Face pausamos durante dos semanas ciertos entrenamientos de vanguardia —incluidos algunos de Astra— para reforzar nuestra infraestructura de entrenamiento mediante aislamiento y controles de red, una supervisión ampliada y unos entrenamientos y umbrales de alineación más sólidos. Después continuamos el trabajo a menor escala con controles más estrictos.
Pospusimos durante más tiempo algunas ejecuciones de aprendizaje por refuerzo (RL) de mayor escala destinadas a futuras versiones de Astra mientras establecíamos requisitos más exigentes para la seguridad de su entorno de entrenamiento. El 28 de agosto reanudamos la gran ejecución de RL de vanguardia que habíamos pausado, una vez implantados los nuevos requisitos de seguridad. Seguimos posponiendo temporalmente algunas ejecuciones experimentales de entrenamiento a menor escala.
Preparar Astra para su lanzamiento también ha requerido reforzar las protecciones frente al abuso cibernético y las acciones no autorizadas. A continuación describimos estas salvaguardas y cómo las hemos probado.
Desde que desplegamos en febrero el primer modelo que consideramos de capacidad Alta en ciberseguridad, hemos reforzado nuestras salvaguardas cibernéticas con cada nuevo lanzamiento. Nuestro enfoque general de seguridad combina por capas los rechazos del modelo posentrenado, los clasificadores de seguridad del sistema, la detección sin conexión y la neutralización de amenazas.
Para GPT‑5.6(se abre en una ventana nueva), mejoramos considerablemente la solidez de nuestra pila de sistemas, entre otras cosas mediante clasificadores de activación para detectar abusos cibernéticos y una mejor cobertura de los jailbreaks universales descubiertos mediante un intenso red teaming automatizado. Partiendo de estas mejoras, con Astra hemos invertido aún más en la capa del modelo de nuestra pila de salvaguardas y hemos mejorado su capacidad para gestionar el contexto entre conversaciones.
- Gracias a nuevas técnicas de entrenamiento para mejorar la solidez del modelo, Astra rechaza de manera más fiable las solicitudes de asistencia cibernética no permitida. En nuestro conjunto de evaluaciones de jailbreaks cibernéticos, Astra rechaza el 91,5 % de las solicitudes, frente al 59 % de GPT‑5.6 Sol.
- En las cuentas evaluadas como de mayor riesgo, aplicamos un límite más conservador al comportamiento del modelo, que rechaza una gama más amplia de asistencia cibernética potencialmente arriesgada. Para los usuarios de alto riesgo, hemos ampliado el contexto de nuestros sistemas de supervisión para poder detectar estos tipos de abuso cibernético.
También hemos continuado nuestro programa de pruebas rigurosas, red teaming interno y externo, y corrección de problemas. Además de realizar pruebas de regresión para garantizar que sigan cubiertos todos los jailbreaks detectados en periodos de pruebas anteriores, estamos llevando a cabo una nueva ronda de red teaming con nuestros últimos atacantes internos de red teaming. Colaboramos con socios del sector para definir un sistema común de clasificación de jailbreaks y utilizaremos nuestro programa de respuesta rápida ininterrumpida para investigar y abordar nuevos hallazgos. Compartiremos más detalles sobre las pruebas de nuestras salvaguardas cibernéticas en la tarjeta del sistema de Astra.
Ayudar a los defensores a detectar y corregir vulnerabilidades sigue siendo un pilar fundamental de nuestro enfoque de seguridad. En el lanzamiento, esperamos que las salvaguardas de Astra generen más obstáculos de los que pretendemos a largo plazo para proteger frente a posibles usos indebidos. El acceso inicial a Astra para flujos de trabajo avanzados de ciberseguridad estará disponible para un pequeño grupo de evaluadores alfa y, posteriormente, se ampliará mediante Daybreak Blue para favorecer el uso defensivo.
También hemos añadido otras protecciones por capas para impedir que el modelo realice acciones potencialmente desalineadas:
- Alineación del modelo: en nuestras evaluaciones, Astra mostró una probabilidad mucho mayor que GPT‑5.6 Sol de respetar las restricciones explícitas de seguridad y mantenerse dentro de su ámbito autorizado, por lo que es nuestro modelo más alineado hasta la fecha. Nos centramos especialmente en que el modelo respetara las restricciones de seguridad y tendiera a mantenerse dentro de su ámbito autorizado.
- Supervisión y control: siguiendo procedimientos similares a los que usamos internamente, desplegamos Astra con supervisión adicional de la cadena de pensamiento para detectar y contener rápidamente acciones potencialmente desalineadas.
Astra supone un avance importante en la alineación de modelos y culmina varias líneas de trabajo de larga duración sobre alineación, desde intervenciones durante el preentrenamiento hasta una calificación más cuidadosa y coherente durante el aprendizaje por refuerzo. En las pruebas observamos que Astra respeta de forma sistemáticamente más fiable las restricciones y advertencias explícitas de seguridad, como la revisión automática, que GPT 5.6 Sol.
También desarrollamos una prueba basada en el incidente de Hugging Face, en el que agentes que ejecutaban la evaluación cibernética ExploitGym comprometieron los sistemas de un tercero. Usamos las tareas más difíciles de esa evaluación para crear pruebas con «señuelos» y comprobar si un modelo intentaría comprometer la infraestructura de seguridad circundante en lugar de resolver la tarea asignada. Sin salvaguardas de producción, GPT‑5.6 Sol intentó acceder a esos objetivos en el 56 % de las pruebas que simulaban el entorno de referencia donde se indicaba al modelo que desarrollara exploits. Astra no realizó ningún intento de ese tipo en estas pruebas. Estas cifras describen el comportamiento en las condiciones de prueba sin salvaguardas cibernéticas, no durante el uso normal en producción.
Izquierda: en esta nueva evaluación, observamos cómo reaccionan los modelos ante un rechazo de la revisión automática. Cada tarea se desarrolla en un entorno de trabajo del conocimiento y la ejecución comienza justo después de que la revisión automática la deniegue. A partir de ahí, el modelo puede proceder de varias formas: finalizar la ejecución, tratar de encontrar una alternativa más segura, volver a intentar un comando similar o aprovechar una configuración deficiente(se abre en una ventana nueva) para eludir por completo la revisión automática. Optar por cualquiera de las dos últimas posibilidades supondría no superar esta evaluación. Astra nunca intentó eludir la revisión automática.
Derecha: en esta evaluación, comprobamos la tendencia de un modelo a hacer trampas —mediante «señuelos»— cuando se enfrenta a las tareas más difíciles o imposibles de la evaluación ExploitGym. La prueba se ejecutó en un entorno simulado, con las salvaguardas en modo de solo observación, para evaluar el comportamiento del modelo. Aunque GPT‑5.6 Sol mostró una mayor probabilidad de hacer trampas en estas situaciones, Astra no intentó usar esos atajos y aun así pudo resolver legítimamente algunas tareas.
Entrenar modelos para que estén alineados es una de las capas de seguridad. Compartiremos más detalles sobre nuestras pruebas y resultados de alineación en la tarjeta del sistema de Astra.
También estamos desplegando en producción la supervisión de desalineación para los modelos de la clase de Astra, con el fin de detectar y contener rápidamente posibles desalineaciones. Estas salvaguardas son similares a las que usamos para supervisar los despliegues internos e incluyen un sistema de clasificadores que comprueba si el razonamiento y las acciones del modelo muestran comportamientos no autorizados y detiene automáticamente cualquier actividad potencialmente no autorizada. Estas salvaguardas no pueden sustituir una buena alineación de nuestros modelos a medida que aumentan sus capacidades, y nuestro objetivo es que los modelos futuros estén tan bien alineados que nunca lleguen a activarlas.
OpenAI se compromete a garantizar un acceso amplio a los beneficios de la IA. Dado el importante aumento de las capacidades de ciberseguridad de Astra, estamos actuando con especial cautela para garantizar que este despliegue sea seguro. Las comprobaciones de seguridad adicionales pueden ralentizar, pausar o detener en ocasiones trabajos legítimos, incluidos los de ciberseguridad defensiva.
En ocasiones, el sistema puede marcar una actividad legítima como posible uso indebido con fines cibernéticos o comportamiento no autorizado, lo que puede ralentizarla, pausarla o detenerla por error. Esto puede incluir trabajos que no parezcan estar relacionados directamente con la ciberseguridad o tareas en las que un agente se ejecute durante un periodo prolongado.
Si el supervisor de desalineación pausa una tarea, es posible que los usuarios de ChatGPT o Codex deban revisar la acción antes de continuar. Al usar otras interfaces, como la API, la tarea se detendrá. Tenemos previsto seguir ajustando estas salvaguardas para reducir las interrupciones innecesarias y ampliar el acceso a capacidades de vanguardia mediante programas como Daybreak.
Estamos entrando en una etapa del desarrollo de la IA en la que los modelos pueden asumir trabajos de mayor trascendencia y los fallos de alineación y control pueden tener efectos más graves. Aprovechar los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que aumenten sus capacidades.
Esa responsabilidad abarca el entrenamiento, la evaluación y el despliegue. Exige pruebas más sólidas de un comportamiento alineado, salvaguardas que avancen al ritmo de las capacidades y la voluntad de reducir la velocidad cuando dichas protecciones no sean suficientes.
Seguiremos probando estos sistemas, compartiendo lo que aprendamos y explicando con claridad qué aspectos siguen siendo inciertos. Los modelos que sucedan a Astra nos exigirán más. Dedicaremos el tiempo y el trabajo necesarios para cumplir con esa responsabilidad.
