Ante la próxima frontera de las capacidades cibernéticas críticas
La ciberseguridad evoluciona rápidamente a medida que los modelos adquieren capacidades que pueden tanto reforzar las ciberdefensas como facilitar ataques a una velocidad y una escala sin precedentes.
Nuestras últimas evaluaciones internas de Astra, uno de nuestros próximos modelos, realizadas durante los últimos días revelan avances significativos en programación con agentes y ciberseguridad. Estos resultados, junto con las valoraciones de expertos, nos llevaron anoche a concluir que no podemos descartar que alcance capacidades cibernéticas críticas según nuestro Marco de preparación(se abre en una ventana nueva).
Compartimos esta información porque creemos que es importante actuar con transparencia ante el público y las comunidades dedicadas a la seguridad sobre este posible cambio en las capacidades.
Publicamos por primera vez nuestro Marco de preparación en diciembre de 2023, mucho antes de que los modelos se acercaran a este nivel de capacidad en los ámbitos biológico, químico, de ciberseguridad y de automejora de la IA. Lo creamos para disponer de una guía con la que detectar avances en las capacidades y planificar qué haría nuestra empresa a medida que surgieran. Los modelos anteriores, incluido GPT‑5.6‑Sol, se evaluaron para determinar sus capacidades cibernéticas de vanguardia y se clasificaron en el umbral de capacidad Alta (en lugar de Crítica).
Según nuestro Marco de preparación, un modelo alcanza el umbral Crítico de ciberseguridad si puede identificar y desarrollar exploits funcionales de día cero de todos los niveles de gravedad en numerosos sistemas críticos reales y reforzados sin intervención humana, o si puede idear y ejecutar de principio a fin estrategias novedosas de ciberataque contra objetivos reforzados partiendo únicamente de un objetivo general.
Aunque seguimos realizando pruebas comparativas y evaluando este modelo, nuestras evaluaciones preliminares revelan un rendimiento lo bastante sólido como para que, por ahora, no podamos descartar que alcance el nivel de capacidad Crítica. Astra es un próximo modelo y no participó en el ataque a Hugging Face.
Por ello, hemos ampliado las pruebas de robustez de nuestras salvaguardias y controles de seguridad para que sean adecuados de cara al despliegue de estas capacidades. También hemos adoptado internamente las siguientes medidas para que el desarrollo posterior de este modelo se lleve a cabo de forma segura:
- Estamos implantando controles de seguridad más estrictos para los modelos de mayor capacidad y las actividades relacionadas, como entornos de prueba aislados, acceso restringido a redes y herramientas, mayor protección y cifrado de los pesos del modelo, capacidades adicionales de supervisión y detección, y ejecución en entornos aislados.
- Estamos suspendiendo las actividades internas relacionadas con Astra que aún no cumplen estos requisitos reforzados de control de seguridad.
- Hemos implantado una supervisión universal de las acciones de riesgo y la desalineación en todas las aplicaciones de Astra basadas en agentes, incluidos el entrenamiento y la evaluación. Los sistemas de supervisión evalúan la cadena de pensamiento del modelo y activan una respuesta de seguridad para revisar e interrumpir las actividades de alto riesgo.
- Colaboraremos con los organismos públicos pertinentes y determinadas organizaciones de seguridad de la IA para poner a prueba las capacidades de este modelo.
- Proporcionaremos controles de seguridad recomendados a nuestros colaboradores externos de pruebas para que puedan ejecutar de forma segura evaluaciones y cargas de trabajo de mayor riesgo.
El marco ya nos ha orientado en otras transiciones de capacidad. En junio de 2025, cuando nuestros modelos se acercaron al umbral de capacidad Alta en biología según el Marco de preparación, expusimos las medidas que estábamos adoptando para reforzar las salvaguardias, ampliar las pruebas, colaborar con expertos externos e implantar controles de seguridad adicionales. Aquí estamos aplicando el mismo principio.
Creemos que los modelos con capacidades cibernéticas avanzadas deben ayudar a los defensores a identificar y corregir vulnerabilidades antes de que las aprovechen los atacantes. Nos comprometemos a colaborar con gobiernos, institutos de seguridad y la sociedad civil para garantizar que las capacidades de vanguardia de modelos como Astra y los que le sigan se desplieguen de forma responsable y generalizada en beneficio de toda la humanidad.


