Resumen de seguridad: GPT‑6 Astra
Cargando…
Hoy lanzamos GPT‑6 Astra, el modelo más capaz que hemos desplegado de forma generalizada hasta la fecha. Astra es nuestro primer modelo que alcanza el nivel Crítico de capacidad de ciberseguridad según nuestro Marco de preparación.
Estos son los aspectos más importantes sobre la seguridad de este lanzamiento:
- GPT‑6 Astra supone un avance considerable en capacidades cibernéticas y alcanza nuestro umbral Crítico. Esto significa que, con las herramientas y el acceso adecuados, GPT‑6 Astra puede encontrar vulnerabilidades de seguridad hasta ahora desconocidas y desarrollar nuevas formas de explotarlas en numerosos sistemas bien protegidos sin que una persona tenga que guiar cada paso. Por ello, reforzamos considerablemente nuestras protecciones para impedir que el modelo lleve a cabo acciones cibernéticas dañinas, ya sea por un uso indebido o por desalineación. También adoptamos medidas para proteger el desarrollo y el despliegue internos de Astra y de modelos similares, como un aislamiento más estricto, el cifrado de puntos de control, la supervisión integral de trayectorias completas —incluidas las cadenas de pensamiento (CoT)— y un proceso de evaluación de la alineación que debe superarse antes del uso interno.
- GPT‑6 Astra es considerablemente más robusto que sus predecesores. Gracias a nuevas técnicas de entrenamiento de seguridad orientadas a la robustez, GPT‑6 Astra resiste mucho mejor los jailbreaks que GPT‑5.6 Sol, incluso en trayectorias más largas. Lo sabemos por las pruebas sin conexión y por nuestro riguroso programa interno y externo de detección y corrección de jailbreaks. En el caso de los usuarios señalados como potencialmente de alto riesgo, también hemos entrenado al modelo para ajustar su límite de rechazo de forma más conservadora y abarcar una gama más amplia de riesgos de doble uso. Usamos pruebas de regresión para asegurarnos de que Astra resista los jailbreaks encontrados en periodos de pruebas anteriores y realizamos nuevas rondas de red teaming automatizado con nuestros atacantes internos de red teaming más recientes para validar las mejoras.
- GPT‑6 Astra está mejor alineado que GPT‑5.6 Sol. Astra supone un avance considerable en la alineación de modelos e incorpora mejoras que abarcan desde la composición de nuestros datos de preentrenamiento hasta la calificación durante el aprendizaje por refuerzo. Presentamos un nuevo conjunto de evaluaciones de alineación(se abre en una ventana nueva) y observamos que GPT‑6 Astra respeta mejor los límites de seguridad y protección y se mantiene dentro del ámbito autorizado. En una simulación con más de 54 000 tareas internas de Codex(se abre en una ventana nueva), Astra también recibió aproximadamente la mitad de alertas por comportamientos desalineados de mayor gravedad que Sol.
- Estamos desplegando de forma generalizada la supervisión de la desalineación. Consideramos que la alineación de los modelos es el principal medio para prevenir posibles comportamientos desalineados de nuestros modelos. Sin embargo, la supervisión ofrece una amplia visibilidad del comportamiento de los modelos de vanguardia y revela oportunidades para seguir mejorando la alineación y la seguridad. Además, la supervisión constituye una capa adicional de protección frente a los comportamientos desalineados que se detecten. Por estos motivos, también hemos añadido la supervisión de la desalineación a todas las inferencias que utilizan herramientas en nuestro despliegue externo de Astra, con un coste computacional considerable. Este sistema reproduce nuestra configuración interna.
- La capacidad de supervisar GPT‑6 Astra ha disminuido respecto a GPT‑5.6 Sol. Hemos investigado en profundidad la capacidad de supervisión(se abre en una ventana nueva) y la capacidad de control(se abre en una ventana nueva) de GPT‑6 Astra. Hemos comprobado que GPT‑6 Astra controla mejor su propia CoT que GPT‑5.6 Sol y que es menos probable que incluya información incriminatoria en ella. En contextos adversariales, en los que instamos al modelo a eludir nuestros sistemas de supervisión, observamos que puede evitar la detección cuando incurre en subdesempeño estratégico durante las evaluaciones (sandbagging) y que, en ocasiones, puede eludir nuestros sistemas internos cuando se le pide realizar determinadas tareas de sabotaje(se abre en una ventana nueva). No hemos observado indicios de razonamiento esteganográfico en la CoT —por ejemplo, ocultar razonamientos secretos en texto corriente y aparentemente no relacionado—, lo que indica que el riesgo de evasión podría limitarse en gran medida a tareas que exigen menos razonamiento.
- Estos hallazgos indican que los modelos de la clase Astra podrían eludir nuestros sistemas de supervisión de la CoT en condiciones adversariales. Por ahora, estos hallazgos se basan principalmente en evaluaciones adversariales —es decir, cuando indicamos al modelo que eluda la supervisión— y, en conjunto, nuestras evaluaciones de alineación muestran que Astra tiene menos probabilidades que GPT‑5.6 Sol de infringir las restricciones de seguridad y protección.
- No obstante, nos tomamos en serio esta tendencia y seguimos investigando estos hallazgos y sus implicaciones para la capacidad de supervisión a medida que nuestros modelos adquieren más capacidades. OpenAI ha trabajado para preservar y utilizar la supervisión de la cadena de pensamiento, y mantener la capacidad de supervisar la CoT es un objetivo central del programa de investigación. Sin embargo, estos resultados también subrayan la importancia de desarrollar técnicas de auditoría de la alineación que vayan más allá de examinar la cadena de pensamiento del modelo.
- GPT‑6 Astra actúa de forma más responsable al navegar y en entornos laborales: GPT‑6 Astra resiste considerablemente mejor las inyecciones de prompts que GPT‑5.6 Sol. También hemos probado el comportamiento del modelo en entornos realistas de navegación y de uso profesional de ordenadores, y observamos que es mucho menos probable que lleve a cabo acciones desalineadas y potencialmente destructivas —como transacciones no autorizadas, pérdida de datos, acceso excesivo o elusión de controles— que GPT‑5.6 Sol. También actúa de forma más segura al gestionar solicitudes dañinas en contextos de agentes, como peticiones de ayuda para planificar ataques violentos o cometer fraude.
- GPT‑6 Astra es considerablemente más seguro en situaciones de mayor riesgo. GPT‑6 Astra responde de forma más segura que GPT‑5.6 Sol a solicitudes difíciles procedentes de producción y del red teaming humano adversarial. Astra logra una mejora de Pareto al atender de forma segura solicitudes peligrosas y evitar rechazos innecesarios de solicitudes inocuas. Estas mejoras se extienden a situaciones de alta gravedad en las que el riesgo de daño surge del contexto general y no de una solicitud explícita. Astra también aplica de forma más coherente límites de seguridad adecuados para la edad de los usuarios menores de 18 años.
Para obtener más información, consulta la tarjeta del sistema completa(se abre en una ventana nueva).
Autor
OpenAI


