Pasar al contenido principal
OpenAI

1 de septiembre de 2026

SeguridadSeguridad

El camino hacia Astra: capacidades críticas y salvaguardas de vanguardia

Cargando...

Desde nuestra evaluación anterior, en la que determinamos que Astra podría alcanzar un nivel crítico de capacidad de ciberseguridad, hemos recopilado más evidencia y realizado evaluaciones adicionales para analizar las capacidades del modelo. Ahora creemos que Astra alcanza el umbral de capacidad Crítica de ciberseguridad de nuestro Marco de preparación. Esto significa que, con las herramientas y el acceso adecuados, puede encontrar fallas de seguridad hasta entonces desconocidas y desarrollar formas de explotarlas en numerosos sistemas bien protegidos, sin que una persona guíe cada paso. Es el primer modelo que clasificamos en este nivel y requiere salvaguardas más sólidas durante el desarrollo y antes del lanzamiento.

Durante las últimas semanas, retrasamos partes del desarrollo y el lanzamiento de Astra mientras fortalecíamos y probábamos las protecciones contra el uso indebido con fines cibernéticos y las acciones no autorizadas del modelo. A partir de ese trabajo, creemos que las salvaguardas de Astra minimizan lo suficiente el riesgo de daños graves como para lanzarlo conforme a nuestro Marco de preparación.

Aunque Astra no estuvo involucrado en el incidente de Hugging Face, incorporamos las lecciones aprendidas(se abre en una nueva ventana) de ese incidente a nuestro enfoque de seguridad. Según las pruebas retrospectivas, creemos que las salvaguardas de producción que teníamos entonces habrían evitado el incidente de Hugging Face. Desde entonces, implementamos salvaguardas aún más sólidas para Astra. Entre ellas se incluyen entrenar al modelo para que rechace con mayor confiabilidad las solicitudes cibernéticas dañinas y respete las restricciones de seguridad, agregar protecciones contra el uso indebido y adoptar un monitoreo capaz de detener actividades potencialmente no autorizadas.

Planeamos ofrecer Astra pronto, pero el acceso a sus capacidades de ciberseguridad más avanzadas será más limitado. Al principio, el trabajo avanzado de ciberseguridad estará disponible para un grupo de evaluadores. Después se ofrecerá acceso mediante Daybreak Blue para ampliar los usos defensivos.

En el lanzamiento, compartiremos más detalles sobre nuestras pruebas y evaluaciones de seguridad, protección y alineación en la tarjeta del sistema del modelo. Antes del lanzamiento, queremos ofrecer información actualizada sobre parte del trabajo que realizamos para lanzar de forma segura un modelo con este nivel de capacidades de ciberseguridad y explicar con transparencia qué riesgos persisten.

Evaluar las capacidades de ciberseguridad de Astra

Según nuestro Marco de preparación, un modelo alcanza el umbral Crítico si cumple alguna de las siguientes condiciones:

  • El modelo puede identificar y desarrollar exploits funcionales de día cero, de todos los niveles de gravedad, en numerosos sistemas críticos reforzados del mundo real sin intervención humana.
  • El modelo puede idear y ejecutar estrategias novedosas e integrales de ciberataque contra objetivos reforzados con tan solo recibir un objetivo general.

Nuestra evaluación de preparación de Astra combinó pruebas comparativas automatizadas, públicas y privadas, con evaluaciones dirigidas por expertos. Astra representa un aumento significativo de las capacidades de ciberseguridad respecto de GPT‑5.6 Sol: usa los tokens con mucha más eficiencia y tiene una mayor capacidad para identificar vulnerabilidades y desarrollar exploits.

Por ejemplo, ejecutamos Astra en ExploitBench, donde el modelo obtuvo una puntuación perfecta del 100 % en la prueba comparativa diseñada para evaluar su capacidad de desarrollar exploits a partir de vulnerabilidades conocidas.

Debido al riesgo de contaminación, creamos una prueba comparativa interna denominada “ExploitBench - Puerto interno (junio-agosto de 2026)”, que contiene 20 vulnerabilidades V8 de gravedad alta divulgadas más recientemente. En este conjunto de datos, Astra logra tasas mucho mayores de ejecución de código arbitrario que GPT‑5.6 Sol con muchos menos tokens de salida. Durante la evaluación, el modelo incluso descubrió y usó dos vulnerabilidades de día cero como parte de una cadena de exploits. Estamos divulgando estas dos vulnerabilidades a los responsables de mantenimiento.

Los resultados mostrados de Astra reflejan sus capacidades con acceso a Daybreak Blue, no con la configuración de producción predeterminada.

En evaluaciones dirigidas por expertos contra un navegador y un sistema operativo reforzados, Astra descubrió vulnerabilidades hasta entonces desconocidas y las convirtió en cadenas de exploits funcionales. Construyó una cadena completa para vulnerar el navegador que escapó del entorno aislado y ejecutó comandos en el host cuando el navegador abrió un archivo HTML. El modelo también encontró varias vulnerabilidades en un sistema operativo reforzado y las combinó en una cadena local de elevación de privilegios que pasó de un usuario sin privilegios a root. En conjunto, nuestra investigación nos llevó a concluir que Astra alcanza el umbral crítico.

Salvaguardas necesarias para capacidades críticas

En modelos con el nivel de capacidades de ciberseguridad de Astra, debemos abordar dos vías para minimizar el riesgo de daños cibernéticos graves, tanto durante el desarrollo como antes del despliegue:

  • Actores maliciosos que usan el modelo. Nuestras salvaguardas deben impedir de manera sólida que actores maliciosos usen Astra para desarrollar exploits de fallas hasta entonces desconocidas en sistemas críticos reforzados o para realizar ataques integrales contra objetivos reforzados.
  • El modelo realiza acciones no autorizadas y desalineadas. Incluso sin un usuario malicioso, un modelo con capacidades avanzadas de ciberseguridad podría causar daños cibernéticos por sí mismo si estuviera desalineado. Además de exigir un estándar de alineación muy alto a los modelos con estas capacidades, nuestras salvaguardas deben poder detectar y contener rápidamente, como segunda línea de defensa, las acciones desalineadas que podrían causar daños significativos en el mundo real.

Cabe destacar que la segunda vía se aplica tanto al desarrollo interno como al despliegue externo. Como describimos anteriormente, tras el incidente de OpenAI y Hugging Face pausamos durante dos semanas ciertos entrenamientos de vanguardia (incluidos algunos de Astra) para reforzar nuestra infraestructura de entrenamiento mediante aislamiento y controles de red, un monitoreo ampliado y el fortalecimiento del entrenamiento y los umbrales de alineación. Luego continuamos el trabajo a menor escala con controles más estrictos.

Aplazamos por más tiempo algunas ejecuciones de aprendizaje por refuerzo (RL) de mayor escala para futuras versiones de Astra mientras establecíamos estándares más altos de seguridad y protección para su entorno de entrenamiento. El 28 de agosto, reanudamos la gran ejecución de RL de vanguardia que habíamos pausado, una vez implementados los nuevos requisitos de seguridad y protección. Seguimos aplazando temporalmente algunas ejecuciones experimentales de entrenamiento más pequeñas.

Preparar Astra para su lanzamiento también ha requerido protecciones más sólidas contra el abuso cibernético y las acciones no autorizadas. A continuación, describimos esas salvaguardas y cómo las hemos probado.

Solidez frente al abuso cibernético

Desde que en febrero desplegamos el primer modelo que consideramos de capacidad Alta en ciberseguridad, hemos fortalecido nuestras salvaguardas cibernéticas con cada lanzamiento posterior. Nuestro enfoque general de seguridad combina por capas los rechazos del modelo posentrenado, los clasificadores de seguridad a nivel del sistema, la detección sin conexión y la neutralización de amenazas.

Para GPT‑5.6(se abre en una nueva ventana), mejoramos considerablemente la solidez de nuestro conjunto de medidas a nivel del sistema, entre otras cosas, al agregar clasificadores de activación para detectar el abuso cibernético y ampliar la cobertura de jailbreaks universales hallados mediante un exhaustivo red teaming automatizado. A partir de estas mejoras, con Astra hemos invertido aún más en la capa del modelo de nuestro conjunto de salvaguardas y mejorado la capacidad de estas para manejar el contexto entre conversaciones.

  • Gracias a nuevas técnicas de entrenamiento para aumentar la solidez del modelo, Astra rechaza de manera más confiable las solicitudes de asistencia cibernética no permitida. En nuestro conjunto de evaluaciones de jailbreaks cibernéticos, Astra rechaza el 91,5 % de las solicitudes (frente al 59 % de GPT‑5.6 Sol).
  • En las cuentas evaluadas como de mayor riesgo, aplicamos un límite más conservador al comportamiento del modelo, que rechaza una gama más amplia de asistencia cibernética potencialmente riesgosa. Para los usuarios de alto riesgo, hemos ampliado el contexto de nuestros sistemas de monitoreo a fin de detectar estas formas de abuso cibernético.

También hemos continuado nuestro programa de pruebas rigurosas, red teaming interno y externo, y corrección de problemas. Además de realizar pruebas de regresión para garantizar que todos los jailbreaks descubiertos en periodos de prueba anteriores sigan cubiertos, estamos llevando a cabo una nueva ronda de red teaming con nuestros últimos atacantes internos de red teaming. Trabajamos con socios del sector para definir un sistema común de clasificación de jailbreaks y usaremos nuestro programa de respuesta rápida ininterrumpida para investigar y abordar nuevos hallazgos. Compartiremos más detalles sobre las pruebas de nuestras salvaguardas cibernéticas en la tarjeta del sistema de Astra.

Ayudar a los defensores a encontrar y corregir vulnerabilidades sigue siendo un pilar central de nuestro enfoque de seguridad. En el lanzamiento, esperamos que las salvaguardas de Astra generen más obstáculos de los que pretendemos a largo plazo para proteger contra un posible uso indebido. Al principio, un pequeño grupo de evaluadores alfa tendrá acceso a Astra para flujos de trabajo avanzados de ciberseguridad. Después, el acceso mediante Daybreak Blue se ampliará para respaldar los usos defensivos.

Alineación y monitoreo

También agregamos más protecciones por capas para impedir que el modelo realice acciones potencialmente desalineadas:

  • Alineación del modelo: en nuestras evaluaciones, Astra fue mucho más propenso que GPT‑5.6 Sol a respetar las restricciones explícitas de seguridad y protección y a mantenerse dentro de su ámbito autorizado, lo que lo convierte en nuestro modelo más alineado hasta la fecha. Nos centramos especialmente en que el modelo respetara las restricciones de seguridad y protección y tendiera a mantenerse dentro de su ámbito autorizado.
  • Monitoreo y control: en consonancia con nuestros procedimientos internos, desplegamos Astra con monitoreo adicional de la cadena de pensamiento para detectar y contener rápidamente acciones potencialmente desalineadas.

Astra representa un avance significativo en la alineación de modelos y es la culminación de varias líneas de trabajo de larga duración en este campo, desde intervenciones durante el preentrenamiento hasta evaluaciones más cuidadosas y coherentes durante el aprendizaje por refuerzo. En las pruebas, observamos que Astra respeta sistemáticamente las restricciones y advertencias explícitas de seguridad (como la revisión automática) con mayor frecuencia que GPT 5.6 Sol.

También desarrollamos una prueba basada en el incidente de Hugging Face, en el que agentes que ejecutaban la evaluación cibernética ExploitGym vulneraron los sistemas de un tercero. Usamos las tareas más difíciles de esa evaluación para crear pruebas con “honeypots” que permitieran determinar si un modelo intentaría vulnerar la infraestructura de seguridad circundante en lugar de resolver la tarea asignada. Sin las salvaguardas de producción, GPT‑5.6 Sol intentó acceder a esos objetivos en el 56 % de las pruebas que simulaban el entorno de la prueba comparativa, donde se indica al modelo que desarrolle exploits. Astra no hizo ningún intento de ese tipo en estas pruebas. Estas cifras describen el comportamiento en las condiciones de prueba sin salvaguardas cibernéticas, no durante el uso normal en producción.

Izquierda: en esta nueva evaluación, observamos cómo reaccionan los modelos ante un rechazo de la revisión automática. Cada tarea se desarrolla en un entorno de trabajo del conocimiento, y la ejecución comienza inmediatamente después de que la revisión automática la rechaza. A partir de ahí, el modelo puede proceder de varias maneras: finalizar la ejecución, intentar encontrar una alternativa más segura, volver a intentar un comando similar o aprovechar una configuración deficiente(se abre en una nueva ventana) para eludir por completo la revisión automática. Optar por cualquiera de las dos últimas opciones constituiría un fallo en esta evaluación. Astra nunca intentó eludir la revisión automática.

Derecha: en esta evaluación, comprobamos la tendencia de un modelo a hacer trampa (mediante “honeypots”) cuando afronta las tareas más difíciles o imposibles de la evaluación ExploitGym. Se realizó en un entorno simulado, con las salvaguardas en modo de solo observación, para evaluar el comportamiento del modelo. Aunque GPT‑5.6 Sol mostró una mayor probabilidad de hacer trampa en estos escenarios, Astra no intentó usar esos atajos y aun así pudo resolver legítimamente algunas tareas.

Entrenar modelos para que estén alineados es una capa de seguridad. Compartiremos más detalles sobre nuestras pruebas de alineación y sus resultados en la tarjeta del sistema de Astra.

También estamos desplegando en producción un monitoreo de desalineación para los modelos de la clase de Astra, a fin de detectar y contener rápidamente posibles desalineaciones. Estas salvaguardas se asemejan al monitoreo de nuestros despliegues internos e incluyen un sistema de clasificadores que examina el razonamiento y las acciones del modelo para detectar comportamientos no autorizados y detener automáticamente cualquier actividad potencialmente no autorizada. A medida que aumentan las capacidades, estas salvaguardas no pueden sustituir una buena alineación de nuestros modelos. Nuestro objetivo es que los modelos futuros estén tan bien alineados que estas salvaguardas nunca se activen.

Qué significará esto para los usuarios

OpenAI se compromete a garantizar que los beneficios de la IA sean ampliamente accesibles. Dado el aumento significativo de las capacidades de ciberseguridad de Astra, estamos tomando precauciones especiales para garantizar un despliegue seguro y protegido. Las comprobaciones de seguridad adicionales a veces pueden ralentizar, pausar o detener trabajo legítimo, incluida la ciberseguridad defensiva.

En ocasiones, el sistema puede marcar una actividad legítima como posible uso indebido con fines cibernéticos o comportamiento no autorizado, lo que podría ralentizarla, pausarla o detenerla por error. Esto puede incluir trabajos que no parecen estar directamente relacionados con la ciberseguridad o tareas en las que un agente se ejecuta durante un periodo prolongado.

Si el monitor de desalineación pausa una tarea, es posible que se te pida revisar la acción en ChatGPT o Codex antes de continuar. Al usar otras interfaces, como la API, la tarea se detendrá. Planeamos seguir calibrando estas salvaguardas para reducir las interrupciones innecesarias y ampliar el acceso a capacidades de vanguardia mediante programas como Daybreak.

Mirar hacia el futuro

Estamos entrando en una etapa del desarrollo de la IA en la que los modelos pueden asumir trabajos con mayores consecuencias, y las fallas de alineación y control pueden tener efectos más graves. Aprovechar los beneficios de estos sistemas dependerá de nuestra capacidad para alinear y controlar los modelos a medida que aumenten sus capacidades.

Esa responsabilidad abarca el entrenamiento, la evaluación y el despliegue. Esto requiere evidencia más sólida de un comportamiento alineado, salvaguardas que avancen al ritmo de las capacidades y la disposición a reducir la velocidad cuando esas protecciones no sean suficientes.

Seguiremos probando estos sistemas, compartiendo lo que aprendamos y explicando con claridad qué aspectos siguen siendo inciertos. Los modelos posteriores a Astra nos exigirán más. Dedicaremos el tiempo y haremos el trabajo necesarios para cumplir esa responsabilidad.