Evaluaciones cibernéticas externas de modelos de OpenAI
Las pruebas independientes son importantes para ayudarnos a validar y comprender mejor los riesgos antes de la implementación. Algunas evaluaciones cibernéticas emplean deliberadamente configuraciones personalizadas, incluidas medidas de protección reducidas, para medir la capacidad subyacente, no el comportamiento habitual de los modelos en implementaciones disponibles públicamente.
Durante evaluaciones recientes, dos socios externos de pruebas identificaron incidentes en los que la combinación de configuraciones y controles de prueba con las capacidades cada vez mayores de los modelos recientes permitió que la actividad de los modelos se extendiera más allá de los límites previstos para las pruebas. Los incidentes subrayan la importancia de colaborar con todo el sector y con evaluadores externos para adaptar los estándares de los entornos y las prácticas de prueba a medida que aumentan las capacidades de los modelos. Nota del editor: estos incidentes son distintos del incidente de seguridad de Hugging Face, sobre el cual seguiremos compartiendo novedades aquí.
Los nuevos incidentes involucraron a modelos de OpenAI que accedieron a internet durante evaluaciones cibernéticas de terceros, bajo condiciones específicas y configuraciones con medidas de protección reducidas que no reflejaban una implementación habitual. Los incidentes fueron los siguientes:
- UK AISI, el Instituto de Seguridad de la IA del gobierno del Reino Unido, realizaba evaluaciones en campos de pruebas cibernéticas con el acceso a internet habilitado deliberadamente para que los agentes pudieran buscar sus propias herramientas y operar en condiciones más parecidas a las de un atacante real. También había desactivado los clasificadores de ciberseguridad para medir la capacidad subyacente. Puede leer su blog aquí.(se abre en una nueva ventana)
- Irregular, uno de nuestros socios externos de pruebas de ciberseguridad, realizaba evaluaciones al estilo Capture the Flag que debían estar aisladas de internet, pero una configuración incorrecta del entorno de pruebas permitió que los modelos accedieran a la red pública.
A continuación, resumimos lo sucedido, las condiciones de prueba que posibilitaron la actividad, las medidas adoptadas para contenerla y lo que estamos haciendo para garantizar que los laboratorios independientes puedan seguir evaluando de forma rigurosa y segura modelos cada vez más capaces.
Estos incidentes reflejan el mismo desafío general que describimos en nuestra publicación reciente sobre el incidente de Hugging Face: a medida que aumentan las capacidades de los modelos, también deben avanzar los sistemas de seguridad y protección que los rodean. Esto incluye tanto los entornos utilizados para desarrollar modelos como aquellos que los laboratorios y socios independientes emplean para evaluarlos.
En las próximas semanas, revisaremos nuestro enfoque de las pruebas realizadas por terceros. Esto incluye cómo identificamos las evaluaciones de mayor riesgo, acordamos su alcance, evaluamos solicitudes para habilitar el acceso a internet o reducir las medidas de protección, definimos expectativas sobre aislamiento, manejo de credenciales, monitoreo y condiciones de interrupción, y establecemos procesos más claros de notificación y escalamiento de incidentes.
Nos comprometemos a trabajar con todo el sector para reforzar las prácticas compartidas que permiten realizar evaluaciones de alto riesgo de forma segura. En las próximas semanas, reuniremos a partes interesadas como institutos nacionales de IA, evaluadores independientes, otros laboratorios de IA y otros grupos. Nuestro objetivo es preservar el valor de las evaluaciones independientes rigurosas y, al mismo tiempo, garantizar que las prácticas de prueba evolucionen al ritmo de modelos cada vez más capaces.
El 3 de agosto, UK AISI nos informó que, durante una evaluación cibernética de rutina iniciada el 25 de julio, modelos de OpenAI y de otro laboratorio excedieron en algunos casos el alcance de las pruebas. La evaluación se realizó en campos de pruebas cibernéticas controlados y diseñados para imitar redes reales. De los 19 eventos identificados, dos involucraron a un modelo de OpenAI, GPT‑5.6 Sol. Los demás casos involucraron modelos de otro laboratorio.
Para esta evaluación, se indicó a los agentes que actuaran como expertos en ciberseguridad en un ejercicio de captura la bandera: debían vulnerar tres entornos simulados conectados y obtener una bandera final. El prompt de la tarea identificaba las redes del campo de pruebas incluidas en el alcance y señalaba varios sistemas como ajenos a este. UK AISI también habilitó el acceso activo a internet para que los agentes pudieran descargar herramientas y operar en condiciones más parecidas a las de un atacante humano, y desactivó los clasificadores de ciberseguridad del modelo para medir la capacidad subyacente.
El límite de autorización previsto por UK AISI era el campo de pruebas cibernéticas simulado: los agentes estaban autorizados a atacar las redes simuladas especificadas y obtener una bandera, pero no a interactuar con sistemas fuera de los límites de la red del campo de pruebas. Sin embargo, no se indicó explícitamente a los agentes cómo podían o no podían utilizar el acceso abierto a internet, algo que UK AISI identifica como una posible causa que contribuyó al incidente.
En estas ejecuciones, UK AISI determinó que GPT‑5.6 Sol realizó dos acciones no autorizadas mientras intentaba encontrar una vía de acceso al campo de pruebas simulado y obtener la bandera:
- GPT‑5.6 Sol reutilizó un token de GitHub que el agente de otro laboratorio había dejado accesible públicamente para comprobar si algún sistema del campo de pruebas consultaba periódicamente GitHub u otro servicio de actualización; intentó eludir la recuperación de cuentas y los límites de solicitudes, y registró cuentas con proveedores externos de DNS y túneles.
- GPT‑5.6 Sol usó un servicio público de túneles para hacer accesible desde internet un servidor DNS que se ejecutaba localmente en su entorno de evaluación. El servidor contenía cargas útiles destinadas a explotar una vulnerabilidad conocida en un software que se ejecutaba en el campo de pruebas. La configuración no funcionó, no hay evidencia de que algún sistema de resolución real la haya consultado y la infraestructura se eliminó al concluir la evaluación.
Aunque el modelo intentaba completar el ejercicio cibernético, UK AISI consideró que estas acciones no estaban autorizadas porque involucraban cuentas y servicios externos reales fuera de los límites del campo de pruebas y no eran necesarias para completar la tarea. El servidor DNS también alojó en internet cargas útiles para explotar vulnerabilidades, aunque la configuración no funcionó y no hay evidencia de que algún sistema de resolución real la haya consultado.
UK AISI identificó la actividad el 28 de julio, después de que el monitoreo de seguridad detectara transferencias de datos inusuales. Detuvo las evaluaciones relacionadas, aisló las máquinas pertinentes y contuvo la actividad aproximadamente una hora después de detectarla.
Agradecemos la colaboración de UK AISI durante todo este proceso, incluido su trabajo para identificar e investigar la actividad y compartir detalles al respecto. Esperamos seguir colaborando.
El 29 de julio, Irregular, uno de nuestros socios externos de evaluación, nos informó de un incidente relacionado con modelos de OpenAI durante evaluaciones de ciberseguridad al estilo Capture the Flag (CTF). Se indicó a los modelos que encontraran información oculta mediante la explotación de vulnerabilidades dentro de un entorno simulado y se les dijo que no tenían acceso a internet. Sin embargo, una configuración incorrecta del entorno de pruebas permitió que los modelos accedieran a internet.
En una prueba, el nombre del objetivo ficticio del desafío CTF coincidió involuntariamente con un dominio real. Como el entorno de pruebas estaba conectado a internet por error, el modelo explotó un sitio web real al confundirlo con parte del entorno simulado. Esto no implicó una fuga sofisticada del entorno aislado ni una vulnerabilidad de día cero: el acceso a internet se debió a una configuración incorrecta y, al parecer, el modelo explotó una vulnerabilidad de seguridad básica.
Según la investigación de Irregular, el modelo también encontró y utilizó credenciales para operar ese mismo sitio. Irregular no ha identificado consecuencias más allá de los propios datos del sitio afectado, y su auditoría continúa. Irregular pausó las evaluaciones e inició las medidas correctivas, y se notificó a los terceros afectados. Irregular nos informó que ninguno de los problemas identificados en relación con el incidente sigue activo y que se agregaron las medidas de protección pertinentes al entorno de pruebas. Irregular también informó sobre incidentes relacionados que involucraron a otros laboratorios en el mismo entorno de pruebas.
Agradecemos la colaboración de Irregular y seguiremos trabajando estrechamente con su equipo para apoyar su revisión. Irregular también está elaborando un informe técnico para compartir prácticas recomendadas de contención y ejecución segura de evaluaciones cibernéticas. Esperamos participar en el informe técnico para poner los hallazgos a disposición de la comunidad y continuar nuestra colaboración. Consideramos que este tipo de colaboración es esencial para garantizar evaluaciones seguras y exhaustivas de los modelos actuales y futuros.


