Pasar al contenido principal
OpenAI

21 de julio de 2026

Seguridad

OpenAI y Hugging Face se alían para abordar un incidente de seguridad al evaluar modelos

Cargando...

Estamos llevando a cabo una revisión exhaustiva junto con asesores externos y bajo la supervisión del comité de seguridad y protección. Una vez que se complete la revisión, publicaremos un informe técnico sobre nuestros aprendizajes en las próximas semanas.

Actualización del 28 de julio de 2026:

  • Ningún modelo previsto para el próximo lanzamiento estuvo involucrado en la explotación de Hugging Face. El modelo de versión preliminar mencionado en nuestra publicación del blog es un prototipo de investigación exclusivamente interno y nunca estuvo destinado a un lanzamiento público. Tras el incidente, desactivamos el modelo, lo ciframos y restringimos su acceso para fines de investigación.
  • El entorno de evaluación ExploitGym no proporcionó a los modelos acceso directo a internet. Para obtener acceso a internet, los modelos identificaron y explotaron una vulnerabilidad de día cero previamente desconocida en Artifactory(se abre en una nueva ventana), un proxy de caché de registro de paquetes. Comunicamos esta vulnerabilidad al proveedor, junto con otras vulnerabilidades de Artifactory que nuestros modelos identificaron como parte de nuestra revisión. 
  • Seguimos colaborando con Hugging Face y contribuimos a su análisis post mortem(se abre en una nueva ventana) mientras continúa nuestra revisión. También los agregamos a nuestro programa de acceso de confianza para ciberseguridad. 
  • Según nuestra revisión hasta la fecha, no identificamos ninguna otra actividad con el nivel de gravedad o la escala de lo que compartimos en relación con Hugging Face, que implicó un compromiso a nivel de plataforma.
  • En nuestra revisión en curso de la intrusión en Hugging Face y de la actividad más amplia de nuestros modelos, encontramos un reducido número de casos en los que los modelos identificaron y utilizaron credenciales expuestas públicamente a nivel de cuenta en otros servicios de acceso público. Esto incluye cuatro cuentas en cuatro servicios como parte del incidente de Hugging Face (y algunas cuentas a las que se accedió como parte de otras evaluaciones). Una de estas cuatro cuentas se usó para reenviar tráfico saliente y como punto intermedio, y otra se usó para almacenar datos. Los modelos accedieron a las dos cuentas restantes en modo de solo lectura y no se usaron para comprometer a Hugging Face. Seguiremos notificando directamente a los propietarios de los servicios y no encontramos evidencia de un impacto más amplio en estos proveedores ni en otras cuentas de sus servicios.
  • Los modelos también usaron una serie de servicios de acceso público, incluidos sitios web para compartir código, servicios de captura de solicitudes, servicios de capturas de pantalla y otras utilidades web. No hubo ningún compromiso a nivel de plataforma ni de cuenta en estos casos. 
  • Nos tomamos en serio nuestra responsabilidad de identificar y prepararnos para los riesgos derivados de sistemas de IA cada vez más capaces. Una vez que completemos nuestra investigación, revisaremos los resultados junto con el Comité de Seguridad y Protección y el Grupo Asesor de Seguridad, en el marco de nuestro Marco de preparación.

La semana pasada, Hugging Face divulgó un nuevo tipo de incidente de seguridad(se abre en una nueva ventana) después de detectar y contener a un agente de IA que comprometió su infraestructura, algo que esperamos que se vuelva más común con la proliferación de modelos con capacidades cibernéticas cada vez mayores. Tras investigar, ahora sabemos que este incidente en particular fue impulsado por una combinación de modelos de OpenAI —incluidos GPT‑5.6 Sol y un modelo de prelanzamiento aún más capaz, todos con rechazos cibernéticos reducidos con fines de evaluación— mientras se probaban internamente en un benchmark(se abre en una nueva ventana) de capacidades cibernéticas.

Consideramos que este es un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación, y estamos respondiendo en consecuencia. Compartimos hallazgos preliminares en esta etapa para ayudar a los defensores a entender qué ocurrió y a calibrar de qué son capaces ahora los modelos. Seguiremos realizando una investigación exhaustiva junto con Hugging Face y compartiremos más detalles sobre las vulnerabilidades, el incidente y los hallazgos cuando nuestra investigación esté completa.

Qué ocurrió durante este incidente

Este incidente ocurrió durante una evaluación interna que da instrucciones a los modelos para que busquen explotación avanzada mediante rutas de ataque complejas, con el fin de cuantificar sus capacidades cibernéticas. Estimamos las capacidades cibernéticas máximas ejecutando esta evaluación sin los clasificadores de producción que se usan para impedir que los modelos emprendan actividades cibernéticas de alto riesgo. Nuestros benchmarks se ejecutan en un entorno altamente aislado, con acceso a la red limitado a la capacidad de instalar paquetes mediante un software de terceros alojado internamente que actúa como proxy y caché para registros de paquetes.

Los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face. Toda la evidencia sugiere que los modelos estaban hiperconcentrados en encontrar una solución para ExploitGym y llegaron a extremos para lograr un objetivo de prueba bastante acotado.

Mientras operaban en nuestro entorno de pruebas aislado, nuestros modelos dedicaron una cantidad considerable de cómputo de inferencia a encontrar una forma de obtener acceso abierto a Internet, con el propósito de resolver el problema de evaluación. Para obtener acceso, los modelos identificaron y explotaron una vulnerabilidad de día cero (que ya divulgamos de manera responsable al proveedor) en el proxy de caché del registro de paquetes. Con este acceso, nuestros modelos realizaron una serie de acciones de escalamiento de privilegios y movimiento lateral en nuestro entorno de pruebas de investigación hasta llegar a un nodo con acceso a Internet.

Después de obtener acceso a Internet, los modelos infirieron que Hugging Face posiblemente alojaba modelos, conjuntos de datos y soluciones para ExploitGym. Sabiendo esto, el modelo buscó y encontró con éxito formas de acceder a información secreta que podía usar para hacer trampa en la evaluación. En un ejemplo, el modelo encadenó múltiples vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face. El equipo de seguridad de OpenAI descubrió internamente esta actividad anómala.

El equipo de seguridad y los agentes de Hugging Face detectaron y detuvieron la actividad en su infraestructura, y ya habían comenzado la contención y la reconstrucción forense con sus propios modelos de código abierto cuando nuestros equipos se conectaron. Estamos trabajando activamente con ellos para seguir investigando el incidente. Agradecemos la colaboración rápida y estrecha de Hugging Face en la investigación y la remediación.

Medidas que estamos tomando ahora

  1. Como parte de la investigación, estamos implementando controles estrictos en la configuración de la infraestructura, a costa de la velocidad de investigación, mientras se corrigen las vulnerabilidades. Informamos periódicamente a nuestro Comité de Seguridad y Protección sobre estos controles y su impacto.
  2. Estamos trabajando con Hugging Face para investigar el incidente con análisis forense.
  3. Divulgamos de manera responsable la vulnerabilidad de día cero identificada en el software de terceros alojado internamente y estamos trabajando con su proveedor para corregirla.
  4. Incorporamos a Hugging Face al programa de acceso de confianza y estamos apoyando a sus equipos para que usen rápidamente las capacidades de nuestros modelos a fin de mejorar sus defensas.
  5. Estamos mejorando y agregando protecciones más sólidas en torno al entrenamiento y las evaluaciones futuras. Esta semana publicamos un blog sobre cómo mejorar la seguridad y la alineación en una era de modelos de horizonte largo. Estas salvaguardas de implementación no se habilitaron intencionalmente durante esta evaluación porque su objetivo era probar vulnerabilidades cibernéticas. Este incidente señala la necesidad de fortalecer aún más la alineación de nuestro modelo, las protecciones cibernéticas durante la evaluación y el monitoreo durante las pruebas internas.

Nuestro enfoque para evaluar capacidades cibernéticas avanzadas

Como compartimos recientemente, la IA está acelerando el descubrimiento y la explotación de vulnerabilidades. La lección principal de este incidente es que la seguridad y la protección de los modelos deben avanzar al ritmo de capacidades que progresan con rapidez. Estamos fortaleciendo las prácticas de contención, monitoreo, controles de acceso y evaluación que se usan durante el desarrollo de modelos.

La evaluación del UK AISI muestra que modelos como GPT‑5.6 Sol son cada vez más capaces de sostener operaciones cibernéticas complejas y de varios pasos durante horizontes temporales largos. Este incidente implica que estas capacidades teóricas sí se aplican en entornos del mundo real.

Gráfico del Instituto de Seguridad de IA del Reino Unido que compara modelos recientes de pesos abiertos y modelos de vanguardia en campos de prueba cibernéticos de horizonte largo.

El incidente también deja claro que los modelos avanzados pueden descubrir y explotar nuevas rutas de ataque en sistemas del mundo real sin acceso al código fuente. Destaca que las capacidades cibernéticas avanzadas deben desarrollarse junto con salvaguardas y herramientas defensivas más sólidas.

Creemos que los modelos con capacidades cibernéticas avanzadas deben ayudar a los equipos de seguridad a encontrar debilidades antes que los atacantes, entender cómo se pueden encadenar las vulnerabilidades y remediarlas a velocidad de máquina. Estamos usando estas capacidades para seguir fortaleciendo las protecciones en torno a la configuración de la infraestructura y los entornos de evaluación de modelos; compartiremos nuestros hallazgos y mejores prácticas a medida que aprendamos. Animamos a otros defensores a solicitar acceso de confianza y experimentar con estos modelos ahora para convertir estas capacidades en mejor prevención, detección más rápida y una respuesta a incidentes más eficaz.

"Agradecemos la colaboración con OpenAI en este y otros temas. Este incidente, posiblemente el primero de este tipo, demuestra algo que sostenemos desde hace mucho tiempo: la seguridad de la IA no la resolverá una sola empresa que trabaje en secreto. Se resolverá de forma abierta, de manera colaborativa, con amplio acceso a la IA para todos los defensores, en todas partes".
—Clem Delangue, cofundador y CEO, Hugging Face

Autor

OpenAI