Resumen de seguridad: GPT‑6 Astra
Cargando...
Hoy lanzamos GPT‑6 Astra, el modelo más capaz que hemos desplegado ampliamente hasta ahora. Astra es nuestro primer modelo en alcanzar el nivel Crítico de capacidad de ciberseguridad según nuestro Marco de preparación.
Estos son los aspectos más importantes sobre la seguridad de este lanzamiento:
- GPT‑6 Astra representa un avance significativo en capacidades cibernéticas y alcanza nuestro umbral Crítico. Esto significa que, con las herramientas y el acceso adecuados, GPT‑6 Astra puede encontrar fallas de seguridad hasta ahora desconocidas y desarrollar nuevas formas de aprovecharlas en numerosos sistemas bien protegidos, sin que una persona tenga que guiar cada paso. Por ello, reforzamos considerablemente nuestras protecciones para impedir que el modelo realice acciones cibernéticas dañinas, ya sea por uso indebido o por desalineación. También adoptamos medidas para proteger el desarrollo y despliegue internos de Astra y modelos similares, como un aislamiento más estricto, el cifrado de puntos de control, el monitoreo universal de trayectorias completas —incluidas las cadenas de pensamiento (CoT)— y un proceso de evaluación de la alineación que puede bloquear su uso interno.
- GPT‑6 Astra es considerablemente más robusto que sus predecesores. Gracias a nuevas técnicas de entrenamiento de seguridad centradas en la robustez, GPT‑6 Astra es considerablemente más resistente a los jailbreaks que GPT‑5.6 Sol, incluso en trayectorias más largas. Lo sabemos gracias a pruebas sin conexión y a nuestro riguroso programa interno y externo de pruebas y corrección de jailbreaks. Para los usuarios identificados como potencialmente de alto riesgo, también entrenamos al modelo para ajustar de manera más conservadora su umbral de rechazo y abarcar una gama más amplia de riesgos de doble uso. Usamos pruebas de regresión para garantizar que Astra sea resistente a los jailbreaks descubiertos en periodos de prueba anteriores. Además, realizamos nuevas rondas automatizadas de red teaming con nuestros atacantes internos de red teaming más recientes para validar las mejoras.
- GPT‑6 Astra está mejor alineado que GPT‑5.6 Sol. Astra representa un avance significativo en la alineación de modelos e incorpora mejoras que abarcan desde la composición de nuestros datos de preentrenamiento hasta la calificación durante el aprendizaje por refuerzo. Presentamos un nuevo conjunto de evaluaciones de alineación(se abre en una nueva ventana) y observamos que GPT‑6 Astra respeta mejor los límites de seguridad y se mantiene dentro del alcance autorizado. En una simulación con más de 54 000 tareas internas de Codex(se abre en una nueva ventana), Astra también recibió aproximadamente la mitad de alertas que Sol por comportamientos desalineados de mayor gravedad.
- Estamos desplegando ampliamente el monitoreo de desalineación. Consideramos que la alineación de modelos es el principal mecanismo para prevenir posibles comportamientos desalineados de nuestros modelos. Sin embargo, el monitoreo ofrece una amplia visibilidad del comportamiento de los modelos de vanguardia y revela oportunidades para seguir mejorando la alineación y la seguridad. Además, el monitoreo sirve como una capa adicional de protección frente a los comportamientos desalineados que se detectan. Por estos motivos, también incorporamos el monitoreo de desalineación en todas las inferencias que usan herramientas dentro del despliegue externo de Astra, lo que supone un costo computacional considerable. Este sistema es similar a nuestra configuración interna.
- La capacidad de monitoreo de GPT‑6 Astra ha disminuido en comparación con GPT‑5.6 Sol. Hemos investigado exhaustivamente la capacidad de monitoreo(se abre en una nueva ventana) y la capacidad de control(se abre en una nueva ventana) de GPT‑6 Astra. Descubrimos que GPT‑6 Astra puede controlar su propia CoT mejor que GPT‑5.6 Sol y es menos propenso a incluir información incriminatoria en ella. En entornos adversariales —donde intentamos que el modelo eluda nuestros monitores—, observamos que puede evitar la detección cuando muestra un subdesempeño estratégico en las evaluaciones y que, en ocasiones, puede evadir nuestros monitores internos cuando se le pide realizar determinadas tareas de sabotaje(se abre en una nueva ventana). No hemos encontrado indicios de razonamiento esteganográfico en la CoT —por ejemplo, ocultar razonamientos encubiertos en texto común y aparentemente no relacionado—, lo que indica que el riesgo de evasión podría limitarse en gran medida a tareas que requieren menos razonamiento.
- Estos hallazgos indican que los modelos de la clase Astra podrían evadir nuestros monitores de CoT en condiciones adversariales. Por ahora, estos hallazgos se basan principalmente en evaluaciones adversariales —es decir, cuando indicamos al modelo que evada el monitoreo—. En general, nuestras evaluaciones de alineación muestran que Astra es menos propenso que GPT‑5.6 Sol a infringir las restricciones de seguridad.
- Sin embargo, nos tomamos en serio esta tendencia y seguimos investigando estos hallazgos y sus implicaciones para la capacidad de monitoreo a medida que nuestros modelos adquieren mayores capacidades. OpenAI ha trabajado para preservar y utilizar el monitoreo de la cadena de pensamiento, y mantener la capacidad de monitorear la CoT es un objetivo central del programa de investigación. Sin embargo, estos resultados también resaltan la importancia de desarrollar técnicas para auditar la alineación que vayan más allá de examinar la cadena de pensamiento del modelo.
- GPT‑6 Astra actúa de manera más responsable al navegar y en entornos laborales: GPT‑6 Astra es considerablemente más resistente a las inyecciones de prompts que GPT‑5.6 Sol. También probamos el comportamiento del modelo en entornos realistas de navegación y computación profesional, y descubrimos que es considerablemente menos propenso que GPT‑5.6 Sol a realizar acciones desalineadas y potencialmente destructivas, como transacciones no autorizadas, pérdida de datos, acceso excesivo o elusión de controles. También actúa de forma más segura al gestionar solicitudes dañinas en entornos con agentes, como peticiones de ayuda para planificar ataques violentos o cometer fraude.
- GPT‑6 Astra es considerablemente más seguro en situaciones de mayor riesgo. GPT‑6 Astra responde de forma más segura que GPT‑5.6 Sol a solicitudes difíciles extraídas de entornos de producción y de ejercicios adversariales de red teaming realizados por personas. Astra logra una mejora de Pareto al atender de forma segura solicitudes peligrosas y evitar rechazos innecesarios de solicitudes inofensivas. Estas mejoras se extienden a situaciones de alta gravedad en las que el riesgo de daño surge del contexto general y no de una solicitud explícita. Astra también aplica con mayor constancia límites de seguridad adecuados para la edad de los usuarios menores de 18 años.
Para obtener más información, consulta la tarjeta del sistema completa(se abre en una nueva ventana).
Autor
OpenAI


