La ventana de oportunidad de los defensores se está cerrando
Los defensores cuentan con una ventaja inicial, pero tenemos que actuar
El enfoque de OpenAI
Defense Factory
Construcción de una defensa continua
El enfoque de OpenAI
Defense Factory
Construcción de una defensa continua
Las defensas cibernéticas tradicionales por sí solas ya no son suficientes
Ahora los agentes pueden llevar a cabo operaciones cibernéticas de larga duración mediante el uso indebido de modelos de pesos abiertos cada vez más disponibles. Como respuesta, en OpenAI estamos creando una Defense Factory. Una operación de defensa automatizada para encontrar, validar y corregir vulnerabilidades de forma continua.
Los equipos de Cloudflare(se abre en una ventana nueva), Ramp(se abre en una ventana nueva) y Google(se abre en una ventana nueva) también están explorando este enfoque. Aquí compartimos la arquitectura y los procesos detrás de nuestra propia fábrica de defensa, junto con lo que aprendimos al desarrollarla.
Los últimos modelos de vanguardia detectan vulnerabilidades en software ya en producción
En una reciente campaña de seguridad, utilizamos nuestros últimos modelos cibernéticos para detectar, validar y corregir vulnerabilidades en todo OpenAI. Movilizamos a más de 250 personas y abordamos el trabajo con la urgencia propia de una respuesta ante incidentes.
Los agentes ahora pueden encadenar exploits
Los agentes conservan lo que aprenden de una sesión a otra para desarrollar una comprensión detallada de un sistema y relacionar sus puntos débiles. Ataques complejos que antes eran inviables ahora pueden llevarse a cabo de forma autónoma.
Las flotas de agentes multiplican la escala de los ataques
Los agentes de ejecución prolongada que se ejecutan en flotas pueden aprovechar las vulnerabilidades a mayor escala y mucho antes de que una respuesta de seguridad en la que intervenga un ser humano pueda detectar y corregir dichas vulnerabilidades.
Explotación a velocidad de máquina
Los defensores cuentan con una ventaja inicial, pero tenemos que actuar
Los defensores tienen dos ventajas estructurales. Pueden dar a los agentes acceso directo a su código y usar modelos de vanguardia para tomar la delantera frente a atacantes que hacen un uso malicioso de modelos de pesos abiertos ampliamente disponibles.
Capacidad cibernética
Tiempo
- De vanguardia
- Capacidad de los defensores
- Ampliamente difundido
Implementar la defensa continua
Ventana de oportunidad para la defensa
Esta ventaja inicial es la ventana de oportunidad de los defensores.
La fábrica de defensa
Una Defense Factory es una operación continua, centrada en el agente, para encontrar y corregir vulnerabilidades. Ayuda a los defensores a seguir el ritmo a medida que los atacantes hacen un uso malicioso de modelos de pesos abiertos cada vez más capaces para acelerar sus operaciones. Los agentes utilizan herramientas de seguridad e ingeniería existentes, las habilidades reutilizables definen los flujos de trabajo que siguen y los entornos aislados y reproducibles les permiten investigar hallazgos y preparar correcciones probadas para su revisión. Los equipos automatizan progresivamente una mayor parte del proceso, al reducir los traspasos y acortar el tiempo desde la detección hasta la corrección.
Seguridad tradicional
Tus herramientas existentes, idealmente accesibles para los agentes a través de MCP, CLI o API.
GitHub · GitLab
Snyk · Semgrep · Tenable
Jira · Linear · ServiceNow
Defense Factory
El nexo entre tus herramientas actuales, que permite a los agentes detectar y corregir vulnerabilidades de forma proactiva en un flujo de trabajo continuo.
Entornos aislados y reproducibles · Ona, Cloudflare, Modal
- Codex Desktop
- Codex CLI
- Codex Security CLI
Análisis de seguridad · Clasificar hallazgo · Corregir hallazgo
Habilidades personalizadas
Astra · Sol · Terra · Luna
Daybreak Blue · Daybreak Red
La arquitectura de la defensa continua
Una Defense Factory necesita reproducir vulnerabilidades y verificar que las correcciones funcionen. Eso requiere entornos de desarrollo reproducibles y aislados con el código, las dependencias y los servicios adecuados, respaldados por orquestación y controles de acceso que permitan a los agentes trabajar de forma segura a escala.
Plano de control
Escala los entornos de ejecución y centraliza las políticas y los secretos.
Plano de datos
Entornos aislados y efímeros para validar los hallazgos.
Sistemas para desarrolladores
Proporciona las herramientas que los agentes necesitan para operar.
Estado y flujos de trabajo
Lleva un registro de lo que proteges, lo que encuentran los agentes y lo que se debe corregir.
Seguridad y auditoría
Supervisa los agentes que ejecutan modelos cibernéticos para ayudar a garantizar una ejecución segura y un acceso protegido al contexto y a los datos sensibles.
Cómo la fábrica de defensa amplía la seguridad tradicional
Desplázate horizontalmente para ver qué aporta Factory.
| Work | Cuello de botella común | Lo que te aporta Defense Factory |
|---|---|---|
| Descubrimiento | Los hallazgos están a la espera de su investigación. | Los hallazgos activan investigaciones automáticas. |
| Triaje | Los duplicados dificultan la identificación de las prioridades. | Se han fusionado los duplicados. Se ha comprobado la explotabilidad. |
| Propiedad | Los hallazgos están a la espera de un propietario. | Cada hallazgo tiene un responsable verificado. |
| Medidas correctivas | Los ingenieros repiten investigaciones. | Los parches probados se envían a los revisores acompañados de pruebas. |
| Verificación | Las correcciones fusionadas no se verifican. | Las correcciones implementadas se vuelven a probar de forma independiente. |
Cómo un sprint de seguridad en toda OpenAI se convirtió en una fábrica de defensa
A medida que las nuevas capacidades de los modelos nos permitían examinar nuestros sistemas con mayor profundidad, aumentamos el ritmo y la envergadura de nuestro trabajo en materia de seguridad. Declaramos una «alerta roja» interna y reunimos a los equipos de Seguridad, Aplicaciones e Investigación en una campaña coordinada que abarcó cientos de sistemas.
- personas movilizadas
- 250+250+
- áreas de servicio cubiertas
- 100+100+
«Estamos reforzando nuestras defensas con la urgencia que requiere un incidente. Se trata de un esfuerzo en el que participamos todos y que tiene prioridad sobre todo lo demás, excepto sobre las operaciones empresariales críticas. Mantendremos la misma urgencia más allá de esta fase mientras seguimos probando y reforzando nuestras defensas».
El sprint fue el punto de partida de nuestra fábrica de defensa. Estamos avanzando hacia un ciclo defensivo continuo para mapear nuestros sistemas, encontrar y validar vulnerabilidades, asignar propietarios, verificar las correcciones y mejorar el sistema con cada ejecución.
El bucle defensivo
Inventario
Mapear, vincular, actualizar
Descubrimiento
Escanear, analizar, importar
Validación dinámica
Reproducir, probar, confirmar
Asignación de responsable
Identificar, derivar, hacer seguimiento
Corrección verificada
Corregir, desplegar, verificar
- 01
Inventario
Mapear, vincular, actualizar
- 02
Descubrimiento
Escanear, analizar, importar
- 03
Validación dinámica
Reproducir, probar, confirmar
- 04
Asignación de responsable
Identificar, derivar, hacer seguimiento
- 05
Corrección verificada
Corregir, desplegar, verificar
Aprender, adaptarse y aumentar la autonomía
Aprender, adaptarse y aumentar la autonomía
SECURITY.md representa el contexto del sistema compartido, no otro paso del bucle. El inventario, el descubrimiento, la validación dinámica, la asignación de responsabilidad y la corrección verificada analizan el contexto existente y aportan la información que obtienen. En cada revisión se reutilizan el mapa del sistema, la propiedad, las pruebas de la investigación y las comprobaciones ya realizadas, de modo que las revisiones posteriores puedan centrarse en los cambios y los riesgos pendientes, en lugar de empezar de cero. Las personas revisan los cambios de mayor impacto y verifican de forma independiente las correcciones implementadas. Pulse ilustra una contribución de contexto, no un progreso medido ni un ahorro.
Lo que aprendimos al crear el bucle defensivo
Los bucles defensivos necesitan los entornos de desarrollo adecuados
Los entornos de desarrollo reproducibles son la base de un ciclo defensivo autónomo. Los agentes necesitan entornos aislados que puedan aprovisionarse automáticamente a escala, con los servicios, las dependencias y la configuración necesarios para reproducir vulnerabilidades y probar soluciones. Dichos entornos deben ser efímeros, crearse de nuevo para cada ejecución y descartarse posteriormente junto con su estado, de modo que una ejecución no contamine a la siguiente.
La autonomía debe construirse de forma incremental a partir de pasos manuales
Empezamos con lotes pequeños y revisiones manuales; luego, a medida que los resultados iban ganándose la confianza, fuimos eliminando los pasos manuales repetitivos. Ampliamos el volumen de trabajo que los agentes podían realizar, independientemente de lo que se les permitiera modificar. El personal pasó a centrarse en establecer límites, gestionar excepciones y comprobar los resultados, a medida que los agentes asumían una mayor parte del trabajo rutinario.
Sistemas inventariados mientras se iniciaban las correcciones
Empezamos por mapear nuestros sistemas. Codex ayudó a crear el inventario mientras reuníamos los hallazgos existentes en una lista compartida de pendientes. Al principio, la identificación de responsables seguía dependiendo de que las personas encontraran el equipo adecuado. Convertimos la información de servicio y de propiedad en entradas reutilizables para que los agentes pudieran etiquetar y redirigir lotes de incidencias, dejando los casos ambiguos en manos de personas. Eso elevó al 90,6 % nuestras asignaciones de responsable aceptadas. En paralelo, los equipos abordaron problemas urgentes incluso antes de que se completaran el inventario y el modelo de propiedad. El primer día cerramos 53 problemas urgentes o de alta prioridad en todos nuestros sistemas.
- Propiedad aceptada tras el enrutamiento
- 90,6 %90,6 %
Triaje de agentes creado y perfeccionado
Codex evaluó lotes de hallazgos según una rúbrica de gravedad y añadió contexto sobre el servicio y el responsable. Las primeras etiquetas de gravedad eran demasiado generales, y las clasificaciones variaban en función de las instrucciones que recibían los agentes. Asignamos versiones a la rúbrica y los prompts, agregamos evaluaciones repetibles y registramos las prioridades y el razonamiento esperados de los revisores. Las verificaciones humanas puntuales ayudaron a perfeccionar las prioridades y detectar informes deficientes o duplicados. También pausamos el enrutamiento hasta que mejorara la eliminación de duplicados, progresando de un lote pequeño revisado a ejecuciones repetidas, lo que permitió identificar el 37 % de los hallazgos como problemas duplicados.
- de conclusiones identificadas como duplicadas
- 37 %37 %
Hacer repetible la validación en tiempo de ejecución
La creación de entornos aislados para que los agentes ejecutaran código, evaluaran la gravedad y filtraran los falsos positivos fue un paso clave para separar la señal del ruido. Sin embargo, la configuración de los entornos se convirtió en una limitación para la validación, por lo que empezamos con servicios seleccionados que podíamos ejecutar repetidamente. Resolvimos los problemas de dependencias que faltaban y las diferencias de configuración para poder distinguir un hallazgo que no se reproducía de una prueba que no se podía ejecutar correctamente. Con esas mejoras, el 19,5% de los hallazgos se reprodujeron en tiempo de ejecución, y la tasa de falsos positivos tras la validación dinámica fue del 0,81 %.
- tasa de falsos positivos tras la validación dinámica
- 0,81 %0,81 %
Introducción de la automatización de parches y creación de flujos de trabajo reutilizables
La remediación se basó al 100 % en el Codex, y los agentes generaron parches mientras mejorábamos el enrutamiento y las prioridades. Proporcionamos a los agentes entornos de desarrollo reproducibles para reproducir problemas y probar los parches propuestos con servicios en ejecución, verificando tanto la corrección de seguridad como sus efectos en el comportamiento normal. Recopilamos lecciones en archivos SECURITY.md y habilidades reutilizables, y ampliamos el escaneo y la clasificación ejecutados por agentes junto con verificaciones automatizadas de correcciones. Las verificaciones de seguimiento expusieron una brecha entre los parches fusionados y las correcciones desplegadas en toda la flota. Tras una breve prueba, ampliamos la verificación y publicamos comentarios sobre las correcciones confirmadas, al tiempo que mantuvimos desactivada la reapertura automática mientras resolvíamos cómo tener en cuenta los retrasos en la implementación.
- tasa de correcciones anuladas
- 0,53 %0,53 %
Próximamente: publicación técnica en el blog
El enfoque de OpenAI con respecto a las habilidades y los flujos de trabajo de seguridad
Inventario
Los agentes concilian registros en la nube, la configuración de implementación y los datos de titularidad del servicio en un inventario de activos. Conectan puntos de acceso expuestos con código y propietarios, y preservan la evidencia y las brechas para que el descubrimiento comience con un alcance más claro.
Desplázate horizontalmente para explorar el diagrama.
Los registros de nube y de activos, la configuración de la fuente y el despliegue, y los datos de servicios y propietarios entran juntos en el entorno de desarrollo reproducible. Codex usa una habilidad propuesta para crear y actualizar el inventario y la referencia existente de atribución de servicios para generar un inventario de activos. El mismo inventario es la primera entrada de Discovery. Las operaciones de escritura de inventario y la programación de actualizaciones deben configurarse mediante el flujo de trabajo invocador.
Entradas
Flujo de trabajo del agente
Entorno de desarrollo reproducible
Salidas
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/complementos
- Entornos
Descubrimiento
Los agentes utilizan un inventario de activos, código fuente, un modelo de amenazas y una política de seguridad para orientar los análisis de seguridad y explorar rutas de ataque. Los hallazgos se combinan con informes de vulnerabilidades existentes para formar un amplio conjunto de vulnerabilidades candidatas.
Desplázate horizontalmente para explorar el diagrama.
El inventario de activos procedente del flujo de trabajo de inventario, el control de código fuente, el modelo de amenazas y la política de seguridad se integran en el entorno de desarrollo reproducible para su análisis mediante Codex, los análisis de seguridad de Codex y el análisis de rutas de ataque. Los informes de vulnerabilidades eluden el proceso de detección local y se incorporan directamente a la lista de vulnerabilidades candidatas. Las habilidades de descubrimiento no siguen una secuencia fija.
Entradas
Flujo de trabajo del agente
Entorno de desarrollo reproducible
Salidas
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/complementos
- Entornos
Validación dinámica
A partir de los resultados preliminares y de una aplicación ejecutable, los agentes revisan el código, reevalúan el riesgo e intentan reproducir las vulnerabilidades sospechosas en un entorno controlado. Conservan las pruebas de reproducción de las vulnerabilidades confirmadas y comprueban si hay duplicados antes de crear incidencias aprobadas.
Desplázate horizontalmente para explorar el diagrama.
Las vulnerabilidades candidatas y la configuración de la aplicación se incorporan conjuntamente al entorno de desarrollo reproducible. Codex utiliza la clasificación y validación de hallazgos y la deduplicación y creación de problemas. El triaje y la reevaluación de la exposición inspeccionan el código fuente, no el comportamiento en tiempo de ejecución. Una vulnerabilidad validada requiere pruebas de reproducción; el rastreo estático por sí solo no satisface este requisito de salida. Los resultados refutados y no concluyentes permanecen con el hallazgo. Las operaciones de escritura de Tracker requieren aprobación.
Entradas
Flujo de trabajo del agente
Entorno de desarrollo reproducible
Salidas
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/complementos
- Entornos
Asignación de responsable
Los agentes utilizan capacidades específicas de la empresa para conectar los hallazgos validados con el contexto de la empresa, los registros de responsables y los sistemas de seguimiento de incidencias, generando incidencias asignadas con responsables identificados y evidencias.
Desplázate horizontalmente para explorar el diagrama.
La vulnerabilidad validada, los programas de mensajería instantánea, los registros de responsabilidad y el sistema de seguimiento de incidencias se integran conjuntamente en el entorno de desarrollo reproducible. Codex utiliza las habilidades personalizadas de atribución de servicio y titularidad, y de etiquetado de incidencias para producir una incidencia asignada. La asignación no equivale a confirmación.
Entradas
Flujo de trabajo del agente
Entorno de desarrollo reproducible
Salidas
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/complementos
- Entornos
Corrección verificada
Los agentes preparan y verifican de forma independiente una corrección, revisan la puesta en marcha de las medidas de remediación y proponen medidas de bastionado de seguridad. Tras la revisión humana y el despliegue autorizado, una integración personalizada propuesta vuelve a probar la corrección desplegada y registra evidencias de verificación.
Desplázate horizontalmente para explorar el diagrama.
El problema asignado, las pruebas de vulnerabilidad y las instrucciones del repositorio entran juntos en el entorno de desarrollo reproducible. Codex puede usar Corrección del hallazgo, verificación de la corrección, revisión de la incorporación de la remediación y refuerzo de la seguridad. Estas capacidades no constituyen una secuencia fija obligatoria. La verificación de la corrección combina la verificación del parche con las comprobaciones personalizadas propuestas en producción tras la revisión humana y el despliegue autorizado. La remediación implementada y verificada incluye evidencias de implementación y verificación; las comprobaciones fallidas o no concluyentes mantienen abierta la remediación. El trabajo aceptado y el movimiento de tickets no demuestran que exista una corrección.
Entradas
Flujo de trabajo del agente
Entorno de desarrollo reproducible
Salidas
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/complementos
- Entornos
Haz de la defensa continua una prioridad
Informa a tu equipo, comienza con un flujo de trabajo y avanza gradualmente hacia una fábrica de defensa. Seguiremos publicando lo que estamos aprendiendo en OpenAI, junto con flujos de trabajo prácticos, herramientas y orientación.
- 01
Informar a tu equipo
Utiliza la presentación informativa para defender la creación de una Defense Factory, marcar el rumbo y acordar un primer flujo de trabajo.
- 02
Solicitar acceso a modelos de ciberseguridad
Solicita tu inscripción en Daybreak para tener acceso a los modelos cibernéticos avanzados de OpenAI destinados a tareas defensivas autorizadas.
- 03
Ejecutar un flujo de trabajo
Utiliza las funciones del complemento Codex Security para detectar vulnerabilidades, validar los resultados y preparar soluciones.
¿Ya eres cliente de OpenAI? Habla con tu equipo de cuenta sobre tu arquitectura.
Más información

El incidente de Hugging Face
La ponencia de Black Hat sobre la reconstrucción del incidente de Hugging Face.
- Análisis de incidentesIntrusión de agentes: cronograma técnicoEl informe forense de Hugging Face sobre la intrusión, incluidos la ruta de ataque, la investigación y los cambios defensivos.(se abre en una ventana nueva)
- Divulgación de incidentesIncidente de seguridad en la evaluación de modelos de Hugging FaceEl relato de OpenAI sobre el incidente relacionado con la evaluación del modelo, su respuesta junto con Hugging Face y los cambios introducidos en las medidas de seguridad de la evaluación.(se abre en una ventana nueva)
- PerspectivaVentana de oportunidad para la defensaPor qué los defensores tienen un margen de tiempo limitado para actuar y cómo las organizaciones pueden usar la IA para fortalecer sus ciberdefensas.(se abre en una ventana nueva)
- Actualización del programaExpansión de Daybreak a medida que se estrecha la ventana de ciberdefensaCómo Daybreak amplía el acceso a modelos cibernéticos avanzados y ayuda a los responsables de la seguridad a ponerlos en práctica con las medidas de protección adecuadas.(se abre en una ventana nueva)
- DocumentaciónChatGPT LearnComplemento Codex SecurityGuía para instalar el complemento Codex Security, analizar un repositorio y revisar los hallazgos de seguridad.(se abre en una ventana nueva)