La ventana de oportunidad de los defensores se está cerrando

Los defensores cuentan con una ventaja inicial, pero tenemos que actuar

El enfoque de OpenAI

Defense Factory

Construcción de una defensa continua

Las defensas cibernéticas tradicionales por sí solas ya no son suficientes

Ahora los agentes pueden llevar a cabo operaciones cibernéticas de larga duración mediante el uso indebido de modelos de pesos abiertos cada vez más disponibles. Como respuesta, en OpenAI estamos creando una Defense Factory. Una operación de defensa automatizada para encontrar, validar y corregir vulnerabilidades de forma continua.

Los equipos de Cloudflare(se abre en una ventana nueva), Ramp(se abre en una ventana nueva) y Google(se abre en una ventana nueva) también están explorando este enfoque. Aquí compartimos la arquitectura y los procesos detrás de nuestra propia fábrica de defensa, junto con lo que aprendimos al desarrollarla.

Los últimos modelos de vanguardia detectan vulnerabilidades en software ya en producción

En una reciente campaña de seguridad, utilizamos nuestros últimos modelos cibernéticos para detectar, validar y corregir vulnerabilidades en todo OpenAI. Movilizamos a más de 250 personas y abordamos el trabajo con la urgencia propia de una respuesta ante incidentes.

Cinco semanas completas de informes seleccionados sobre incidencias urgentes y de alto riesgo marcados como «Finalizados» o «Resueltos», en relación con la semana de mayor actividad. El hecho de que se haya registrado su finalización no implica que se haya verificado de forma independiente la aplicación de las medidas correctoras.Medidas correctivas P0/P1Medidas correctivas P0/P154631491535Semanas

Los agentes ahora pueden encadenar exploits

Los agentes conservan lo que aprenden de una sesión a otra para desarrollar una comprensión detallada de un sistema y relacionar sus puntos débiles. Ataques complejos que antes eran inviables ahora pueden llevarse a cabo de forma autónoma.

Cadena de ataque ilustrativaUn camino conecta nodos sucesivos a través de un laberinto. Cada nodo alcanzado permite avanzar al siguiente, y los pasos anteriores permanecen conectados. Se trata de una ilustración conceptual, no de una reconstrucción de un incidente.

Las flotas de agentes multiplican la escala de los ataques

Los agentes de ejecución prolongada que se ejecutan en flotas pueden aprovechar las vulnerabilidades a mayor escala y mucho antes de que una respuesta de seguridad en la que intervenga un ser humano pueda detectar y corregir dichas vulnerabilidades.

Los modelos y los agentes convergen para acelerar el trabajoLos modelos ampliamente disponibles y los agentes de larga duración están conectados en la parte superior. Dos trazas descienden hacia la explotación a velocidad de máquina, que se va llenando de arriba abajo a medida que llegan. Las etiquetas permanecen visibles en todo momento.

Los defensores cuentan con una ventaja inicial, pero tenemos que actuar

Los defensores tienen dos ventajas estructurales. Pueden dar a los agentes acceso directo a su código y usar modelos de vanguardia para tomar la delantera frente a atacantes que hacen un uso malicioso de modelos de pesos abiertos ampliamente disponibles.

Capacidad cibernética

Alcanza de vanguardia y luego sigue el ritmoLa capacidad cibernética aumenta hacia arriba; el tiempo avanza hacia la derecha. La capacidad de los modelos de vanguardia y de los modelos ampliamente difundidos sigue acelerándose. La capacidad defensiva se mantiene sin cambios hasta que se implemente la defensa continua. Después aumenta siguiendo una curva S: progreso gradual, mejora rápida y, a continuación, una unión fluida de vanguardia. Las curvas de defensa y de vanguardia se encuentran y después comparten una trayectoria ascendente. El área azul entre la defensa desplegada y la capacidad ampliamente difundida es la ventana de oportunidad para los defensores. Mantener el ritmo requiere un trabajo continuo. Se trata de trayectorias ilustrativas, no de resultados medidos ni de una previsión.

Tiempo

  • De vanguardia
  • Capacidad de los defensores
  • Ampliamente difundido

Implementar la defensa continua

Ventana de oportunidad para la defensa

Esta ventaja inicial es la ventana de oportunidad de los defensores.

Una Defense Factory es una operación continua, centrada en el agente, para encontrar y corregir vulnerabilidades. Ayuda a los defensores a seguir el ritmo a medida que los atacantes hacen un uso malicioso de modelos de pesos abiertos cada vez más capaces para acelerar sus operaciones. Los agentes utilizan herramientas de seguridad e ingeniería existentes, las habilidades reutilizables definen los flujos de trabajo que siguen y los entornos aislados y reproducibles les permiten investigar hallazgos y preparar correcciones probadas para su revisión. Los equipos automatizan progresivamente una mayor parte del proceso, al reducir los traspasos y acortar el tiempo desde la detección hasta la corrección.

Seguridad tradicional

Tus herramientas existentes, idealmente accesibles para los agentes a través de MCP, CLI o API.

Control de fuentes

GitHub · GitLab

Herramientas de seguridad

Snyk · Semgrep · Tenable

Incidencias y flujos de trabajo

Jira · Linear · ServiceNow

Defense Factory

El nexo entre tus herramientas actuales, que permite a los agentes detectar y corregir vulnerabilidades de forma proactiva en un flujo de trabajo continuo.

Entorno de desarrollo

Entornos aislados y reproducibles · Ona, Cloudflare, Modal

Agentes
  • Codex Desktop
  • Codex CLI
  • Codex Security CLI
Habilidades de seguridad

Análisis de seguridad · Clasificar hallazgo · Corregir hallazgo

Habilidades personalizadas

Modelos de uso general

Astra · Sol · Terra · Luna

Modelos de seguridad

Daybreak Blue · Daybreak Red

Una Defense Factory necesita reproducir vulnerabilidades y verificar que las correcciones funcionen. Eso requiere entornos de desarrollo reproducibles y aislados con el código, las dependencias y los servicios adecuados, respaldados por orquestación y controles de acceso que permitan a los agentes trabajar de forma segura a escala.

Plano de control

Escala los entornos de ejecución y centraliza las políticas y los secretos.

Plano de datos

Entornos aislados y efímeros para validar los hallazgos.

Contenedores

Sistemas para desarrolladores

Proporciona las herramientas que los agentes necesitan para operar.

Estado y flujos de trabajo

Lleva un registro de lo que proteges, lo que encuentran los agentes y lo que se debe corregir.

Seguridad y auditoría

Supervisa los agentes que ejecutan modelos cibernéticos para ayudar a garantizar una ejecución segura y un acceso protegido al contexto y a los datos sensibles.

Dentro de la red privada, los sistemas de desarrolladores y los almacenes de estado se ubican junto a un plano de control y un plano de datos. El plano de control contiene orquestación de cargas de trabajo, aplicación de políticas y un proxy de credenciales. El plano de datos contiene entornos de desarrollo con contenedores de desarrollo, identidades de entorno y monitoreo de hosts. Cada contenedor de desarrollo contiene un arnés de ejecución de agentes, habilidades y la aplicación. La seguridad y la auditoría proporcionan supervisión en todo el sistema mediante la actividad del host, la seguridad de la infraestructura y la auditoría de agentes. Los recuadros muestran componentes y límites.

Cómo la fábrica de defensa amplía la seguridad tradicional

Desplázate horizontalmente para ver qué aporta Factory.

WorkCuello de botella comúnLo que te aporta Defense Factory
DescubrimientoLos hallazgos están a la espera de su investigación.
Los hallazgos activan investigaciones automáticas.
TriajeLos duplicados dificultan la identificación de las prioridades.
Se han fusionado los duplicados. Se ha comprobado la explotabilidad.
PropiedadLos hallazgos están a la espera de un propietario.
Cada hallazgo tiene un responsable verificado.
Medidas correctivasLos ingenieros repiten investigaciones.
Los parches probados se envían a los revisores acompañados de pruebas.
VerificaciónLas correcciones fusionadas no se verifican.
Las correcciones implementadas se vuelven a probar de forma independiente.

A medida que las nuevas capacidades de los modelos nos permitían examinar nuestros sistemas con mayor profundidad, aumentamos el ritmo y la envergadura de nuestro trabajo en materia de seguridad. Declaramos una «alerta roja» interna y reunimos a los equipos de Seguridad, Aplicaciones e Investigación en una campaña coordinada que abarcó cientos de sistemas.

personas movilizadas
250+
áreas de servicio cubiertas
100+

«Estamos reforzando nuestras defensas con la urgencia que requiere un incidente. Se trata de un esfuerzo en el que participamos todos y que tiene prioridad sobre todo lo demás, excepto sobre las operaciones empresariales críticas. Mantendremos la misma urgencia más allá de esta fase mientras seguimos probando y reforzando nuestras defensas».

— Thibault Sottiaux, director de productos centrales y plataforma, OpenAI

El sprint fue el punto de partida de nuestra fábrica de defensa. Estamos avanzando hacia un ciclo defensivo continuo para mapear nuestros sistemas, encontrar y validar vulnerabilidades, asignar propietarios, verificar las correcciones y mejorar el sistema con cada ejecución.

El bucle defensivo

  1. 01

    Inventario

    Mapear, vincular, actualizar

  2. 02

    Descubrimiento

    Escanear, analizar, importar

  3. 03

    Validación dinámica

    Reproducir, probar, confirmar

  4. 04

    Asignación de responsable

    Identificar, derivar, hacer seguimiento

  5. 05

    Corrección verificada

    Corregir, desplegar, verificar

Aprender, adaptarse y aumentar la autonomía

SECURITY.mdContexto compartido

SECURITY.md representa el contexto del sistema compartido, no otro paso del bucle. El inventario, el descubrimiento, la validación dinámica, la asignación de responsabilidad y la corrección verificada analizan el contexto existente y aportan la información que obtienen. En cada revisión se reutilizan el mapa del sistema, la propiedad, las pruebas de la investigación y las comprobaciones ya realizadas, de modo que las revisiones posteriores puedan centrarse en los cambios y los riesgos pendientes, en lugar de empezar de cero. Las personas revisan los cambios de mayor impacto y verifican de forma independiente las correcciones implementadas. Pulse ilustra una contribución de contexto, no un progreso medido ni un ahorro.

Lo que aprendimos al crear el bucle defensivo

Los bucles defensivos necesitan los entornos de desarrollo adecuados

Los entornos de desarrollo reproducibles son la base de un ciclo defensivo autónomo. Los agentes necesitan entornos aislados que puedan aprovisionarse automáticamente a escala, con los servicios, las dependencias y la configuración necesarios para reproducir vulnerabilidades y probar soluciones. Dichos entornos deben ser efímeros, crearse de nuevo para cada ejecución y descartarse posteriormente junto con su estado, de modo que una ejecución no contamine a la siguiente.

La autonomía debe construirse de forma incremental a partir de pasos manuales

Empezamos con lotes pequeños y revisiones manuales; luego, a medida que los resultados iban ganándose la confianza, fuimos eliminando los pasos manuales repetitivos. Ampliamos el volumen de trabajo que los agentes podían realizar, independientemente de lo que se les permitiera modificar. El personal pasó a centrarse en establecer límites, gestionar excepciones y comprobar los resultados, a medida que los agentes asumían una mayor parte del trabajo rutinario.

  • Sistemas inventariados mientras se iniciaban las correcciones

    Empezamos por mapear nuestros sistemas. Codex ayudó a crear el inventario mientras reuníamos los hallazgos existentes en una lista compartida de pendientes. Al principio, la identificación de responsables seguía dependiendo de que las personas encontraran el equipo adecuado. Convertimos la información de servicio y de propiedad en entradas reutilizables para que los agentes pudieran etiquetar y redirigir lotes de incidencias, dejando los casos ambiguos en manos de personas. Eso elevó al 90,6 % nuestras asignaciones de responsable aceptadas. En paralelo, los equipos abordaron problemas urgentes incluso antes de que se completaran el inventario y el modelo de propiedad. El primer día cerramos 53 problemas urgentes o de alta prioridad en todos nuestros sistemas.

    Propiedad aceptada tras el enrutamiento
    90,6 %
  • Triaje de agentes creado y perfeccionado

    Codex evaluó lotes de hallazgos según una rúbrica de gravedad y añadió contexto sobre el servicio y el responsable. Las primeras etiquetas de gravedad eran demasiado generales, y las clasificaciones variaban en función de las instrucciones que recibían los agentes. Asignamos versiones a la rúbrica y los prompts, agregamos evaluaciones repetibles y registramos las prioridades y el razonamiento esperados de los revisores. Las verificaciones humanas puntuales ayudaron a perfeccionar las prioridades y detectar informes deficientes o duplicados. También pausamos el enrutamiento hasta que mejorara la eliminación de duplicados, progresando de un lote pequeño revisado a ejecuciones repetidas, lo que permitió identificar el 37 % de los hallazgos como problemas duplicados.

    de conclusiones identificadas como duplicadas
    37 %
  • Hacer repetible la validación en tiempo de ejecución

    La creación de entornos aislados para que los agentes ejecutaran código, evaluaran la gravedad y filtraran los falsos positivos fue un paso clave para separar la señal del ruido. Sin embargo, la configuración de los entornos se convirtió en una limitación para la validación, por lo que empezamos con servicios seleccionados que podíamos ejecutar repetidamente. Resolvimos los problemas de dependencias que faltaban y las diferencias de configuración para poder distinguir un hallazgo que no se reproducía de una prueba que no se podía ejecutar correctamente. Con esas mejoras, el 19,5% de los hallazgos se reprodujeron en tiempo de ejecución, y la tasa de falsos positivos tras la validación dinámica fue del 0,81 %.

    tasa de falsos positivos tras la validación dinámica
    0,81 %
  • Introducción de la automatización de parches y creación de flujos de trabajo reutilizables

    La remediación se basó al 100 % en el Codex, y los agentes generaron parches mientras mejorábamos el enrutamiento y las prioridades. Proporcionamos a los agentes entornos de desarrollo reproducibles para reproducir problemas y probar los parches propuestos con servicios en ejecución, verificando tanto la corrección de seguridad como sus efectos en el comportamiento normal. Recopilamos lecciones en archivos SECURITY.md y habilidades reutilizables, y ampliamos el escaneo y la clasificación ejecutados por agentes junto con verificaciones automatizadas de correcciones. Las verificaciones de seguimiento expusieron una brecha entre los parches fusionados y las correcciones desplegadas en toda la flota. Tras una breve prueba, ampliamos la verificación y publicamos comentarios sobre las correcciones confirmadas, al tiempo que mantuvimos desactivada la reapertura automática mientras resolvíamos cómo tener en cuenta los retrasos en la implementación.

    tasa de correcciones anuladas
    0,53 %

Próximamente: publicación técnica en el blog

Inventario

Los agentes concilian registros en la nube, la configuración de implementación y los datos de titularidad del servicio en un inventario de activos. Conectan puntos de acceso expuestos con código y propietarios, y preservan la evidencia y las brechas para que el descubrimiento comience con un alcance más claro.

Desplázate horizontalmente para explorar el diagrama.

Los registros de nube y de activos, la configuración de la fuente y el despliegue, y los datos de servicios y propietarios entran juntos en el entorno de desarrollo reproducible. Codex usa una habilidad propuesta para crear y actualizar el inventario y la referencia existente de atribución de servicios para generar un inventario de activos. El mismo inventario es la primera entrada de Discovery. Las operaciones de escritura de inventario y la programación de actualizaciones deben configurarse mediante el flujo de trabajo invocador.

Entradas

Flujo de trabajo del agente

Entorno de desarrollo reproducible

Salidas

  • Plataformas de terceros
  • Artefactos
  • Productos de OpenAI
  • Habilidades/complementos
  • Entornos

Haz de la defensa continua una prioridad

Informa a tu equipo, comienza con un flujo de trabajo y avanza gradualmente hacia una fábrica de defensa. Seguiremos publicando lo que estamos aprendiendo en OpenAI, junto con flujos de trabajo prácticos, herramientas y orientación.

  1. Informar a tu equipo

    Utiliza la presentación informativa para defender la creación de una Defense Factory, marcar el rumbo y acordar un primer flujo de trabajo.

  2. Solicitar acceso a modelos de ciberseguridad

    Solicita tu inscripción en Daybreak para tener acceso a los modelos cibernéticos avanzados de OpenAI destinados a tareas defensivas autorizadas.

  3. Ejecutar un flujo de trabajo

    Utiliza las funciones del complemento Codex Security para detectar vulnerabilidades, validar los resultados y preparar soluciones.

¿Ya eres cliente de OpenAI? Habla con tu equipo de cuenta sobre tu arquitectura.

Más información

El incidente de Hugging Face

La ponencia de Black Hat sobre la reconstrucción del incidente de Hugging Face.

(se abre en una ventana nueva)
  1. Intrusión de agentes: cronograma técnicoEl informe forense de Hugging Face sobre la intrusión, incluidos la ruta de ataque, la investigación y los cambios defensivos.(se abre en una ventana nueva)
  2. Incidente de seguridad en la evaluación de modelos de Hugging FaceEl relato de OpenAI sobre el incidente relacionado con la evaluación del modelo, su respuesta junto con Hugging Face y los cambios introducidos en las medidas de seguridad de la evaluación.(se abre en una ventana nueva)
  3. Ventana de oportunidad para la defensaPor qué los defensores tienen un margen de tiempo limitado para actuar y cómo las organizaciones pueden usar la IA para fortalecer sus ciberdefensas.(se abre en una ventana nueva)
  4. Expansión de Daybreak a medida que se estrecha la ventana de ciberdefensaCómo Daybreak amplía el acceso a modelos cibernéticos avanzados y ayuda a los responsables de la seguridad a ponerlos en práctica con las medidas de protección adecuadas.(se abre en una ventana nueva)
  5. Complemento Codex SecurityGuía para instalar el complemento Codex Security, analizar un repositorio y revisar los hallazgos de seguridad.(se abre en una ventana nueva)