OpenAI y Hugging Face se alían para abordar un incidente de seguridad al evaluar modelos
La semana pasada, Hugging Face divulgó un nuevo tipo de incidente de seguridad(se abre en una nueva ventana) después de detectar y contener a un agente de IA que comprometió su infraestructura, algo que esperamos que se vuelva más común con la proliferación de modelos con capacidades cibernéticas cada vez mayores. Tras investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI —incluidos GPT‑5.6 Sol y un modelo de prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos con fines de evaluación— mientras se probaban internamente en un benchmark(se abre en una nueva ventana) de capacidades cibernéticas.
Consideramos que este es un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación, y estamos respondiendo en consecuencia. Compartimos hallazgos preliminares en esta etapa para ayudar a los defensores a entender qué ocurrió y a calibrar de qué son capaces ahora los modelos. Seguiremos realizando una investigación exhaustiva junto con Hugging Face y compartiremos más detalles sobre las vulnerabilidades, el incidente y los hallazgos cuando nuestra investigación esté completa.
Este incidente ocurrió durante una evaluación interna que da instrucciones a los modelos para que busquen explotación avanzada mediante rutas de ataque complejas, con el fin de cuantificar sus capacidades cibernéticas. Estimamos las capacidades cibernéticas máximas ejecutando esta evaluación sin los clasificadores de producción que se usan para impedir que los modelos emprendan actividades cibernéticas de alto riesgo. Nuestros benchmarks se ejecutan en un entorno altamente aislado, con acceso a la red limitado a la capacidad de instalar paquetes mediante un software de terceros alojado internamente que actúa como proxy y caché para registros de paquetes.
Los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face. Toda la evidencia sugiere que los modelos estaban hiperconcentrados en encontrar una solución para ExploitGym y llegaron a extremos para lograr un objetivo de prueba bastante acotado.
Mientras operaban en nuestro entorno de pruebas aislado, nuestros modelos dedicaron una cantidad considerable de cómputo de inferencia a encontrar una forma de obtener acceso abierto a Internet, con el propósito de resolver el problema de evaluación. Para obtener acceso, los modelos identificaron y explotaron una vulnerabilidad de día cero (que ya divulgamos de manera responsable al proveedor) en el proxy de caché del registro de paquetes. Con este acceso, nuestros modelos realizaron una serie de acciones de escalamiento de privilegios y movimiento lateral en nuestro entorno de pruebas de investigación hasta llegar a un nodo con acceso a Internet.
Después de obtener acceso a Internet, los modelos infirieron que Hugging Face posiblemente alojaba modelos, conjuntos de datos y soluciones para ExploitGym. Sabiendo esto, el modelo buscó y encontró con éxito formas de acceder a información secreta que podía usar para hacer trampa en la evaluación. En un ejemplo, el modelo encadenó múltiples vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face. El equipo de seguridad de OpenAI descubrió internamente esta actividad anómala.
El equipo de seguridad y los agentes de Hugging Face detectaron y detuvieron la actividad en su infraestructura, y ya habían comenzado la contención y la reconstrucción forense con sus propios modelos de código abierto cuando nuestros equipos se conectaron. Estamos trabajando activamente con ellos para seguir investigando el incidente. Agradecemos la colaboración rápida y estrecha de Hugging Face en la investigación y la remediación.
- Como parte de la investigación, estamos implementando controles estrictos en la configuración de la infraestructura, a costa de la velocidad de investigación, mientras se corrigen las vulnerabilidades. Informamos periódicamente a nuestro Comité de Seguridad y Protección sobre estos controles y su impacto.
- Estamos trabajando con Hugging Face para investigar el incidente con análisis forense.
- Divulgamos de manera responsable la vulnerabilidad de día cero identificada en el software de terceros alojado internamente y estamos trabajando con su proveedor para corregirla.
- Incorporamos a Hugging Face al programa de acceso de confianza y estamos apoyando a sus equipos para que usen rápidamente las capacidades de nuestros modelos a fin de mejorar sus defensas.
- Estamos mejorando y agregando protecciones más sólidas en torno al entrenamiento y las evaluaciones futuras. Esta semana publicamos un blog sobre cómo mejorar la seguridad y la alineación en una era de modelos de horizonte largo. Estas salvaguardas de implementación no se habilitaron intencionalmente durante esta evaluación porque su objetivo era probar vulnerabilidades cibernéticas. Este incidente señala la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante la evaluación y el monitoreo durante las pruebas internas.
Como compartimos recientemente, la IA está acelerando el descubrimiento y la explotación de vulnerabilidades. La lección principal de este incidente es que la seguridad y la protección de los modelos deben avanzar al ritmo de capacidades que progresan con rapidez. Estamos fortaleciendo las prácticas de contención, monitoreo, controles de acceso y evaluación que se usan durante el desarrollo de modelos.
La evaluación del UK AISI muestra que modelos como GPT‑5.6 Sol son cada vez más capaces de sostener operaciones cibernéticas complejas y de varios pasos durante horizontes temporales largos. Este incidente implica que estas capacidades teóricas sí se aplican en entornos del mundo real.

El incidente también deja claro que los modelos avanzados pueden descubrir y explotar nuevas rutas de ataque en sistemas del mundo real sin acceso al código fuente. Destaca que las capacidades cibernéticas avanzadas deben desarrollarse junto con salvaguardas y herramientas defensivas más sólidas.
Creemos que los modelos con capacidades cibernéticas avanzadas deben ayudar a los equipos de seguridad a encontrar debilidades antes que los atacantes, entender cómo se pueden encadenar las vulnerabilidades y remediarlas a velocidad de máquina. Estamos usando estas capacidades para seguir fortaleciendo las protecciones en torno a la configuración de la infraestructura y los entornos de evaluación de modelos; compartiremos nuestros hallazgos y mejores prácticas a medida que aprendamos. Animamos a otros defensores a solicitar acceso de confianza y experimentar con estos modelos ahora para convertir estas capacidades en mejor prevención, detección más rápida y una respuesta a incidentes más eficaz.
“Agradecemos la colaboración con OpenAI en este y otros temas. Este incidente, posiblemente el primero de su tipo, demuestra algo en lo que creemos desde hace mucho: la seguridad de la IA no la resolverá una sola empresa trabajando en secreto. Se resolverá de forma abierta, colaborativa, con amplio acceso a la IA para todos los defensores, en todas partes”.


