La ventana del defensor se está cerrando
Los defensores tienen una ventaja inicial, pero tenemos que actuar
El enfoque de OpenAI
La fábrica de defensa
Crear una defensa continua
El enfoque de OpenAI
La fábrica de defensa
Crear una defensa continua
Las defensas cibernéticas tradicionales por sí solas ya no son suficientes
Los agentes ahora pueden llevar a cabo operaciones cibernéticas de larga duración mediante el uso malicioso de modelos de pesos abiertos cada vez más disponibles. Como respuesta, en OpenAI estamos creando una Defense Factory. Una operación de defensa automatizada para encontrar, validar y corregir vulnerabilidades de forma continua.
Los equipos de Cloudflare(se abre en una nueva ventana), Ramp(se abre en una nueva ventana) y Google(se abre en una nueva ventana) también están explorando este enfoque. Aquí compartimos la arquitectura y los procesos detrás de nuestra propia fábrica de defensa, junto con lo que aprendimos al desarrollarla.
Los modelos de vanguardia más recientes encuentran vulnerabilidades ya presentes en la etapa de producción
En un sprint de seguridad reciente, usamos nuestros modelos de ciberseguridad más recientes para encontrar, validar y corregir vulnerabilidades en toda OpenAI. Movilizamos a más de 250 personas y abordamos el trabajo con la urgencia propia de una respuesta a incidentes.
Los agentes ahora pueden encadenar exploits
Los agentes conservan lo que aprenden entre sesiones para desarrollar una comprensión detallada de un sistema y conectar vulnerabilidades. Los ataques complejos que antes eran inviables ahora pueden llevarse a cabo de forma autónoma.
Los grupos de agentes multiplican la escala de los ataques
Los agentes de ejecución prolongada que operan en flotas pueden aprovechar debilidades a mayor escala y mucho antes de que una respuesta de seguridad con intervención humana pueda identificar y corregir esas mismas vulnerabilidades.
Explotación a velocidad de máquina
Los defensores tienen una ventaja inicial, pero tenemos que actuar
Los defensores tienen dos ventajas estructurales. Pueden dar a los agentes acceso directo a su código y usar modelos de vanguardia para obtener una ventaja temporal frente a atacantes que hacen un uso malicioso de modelos de pesos abiertos ampliamente disponibles.
Capacidad cibernética
Tiempo
- De vanguardia
- Capacidad de los defensores
- De amplia difusión
Implementar defensa continua
Ventana de oportunidad de los defensores
Esta ventaja inicial es la ventana de oportunidad de los defensores.
La fábrica de defensa
Una fábrica de defensa es una operación continua, centrada en agentes, para detectar y corregir vulnerabilidades. Ayuda a los defensores a mantener el ritmo a medida que los atacantes abusan de modelos de pesos abiertos cada vez más capaces para acelerar sus operaciones. Los agentes usan herramientas existentes de seguridad e ingeniería; las habilidades reutilizables definen los flujos de trabajo que siguen, y los entornos de cómputo aislados y reproducibles les permiten investigar los hallazgos y preparar correcciones probadas para su revisión. Los equipos automatizan progresivamente una mayor parte del proceso, lo que reduce las transferencias y acorta el tiempo desde el descubrimiento hasta la remediación.
Seguridad tradicional
Tus herramientas existentes, idealmente accesibles para los agentes a través de MCP, CLI o API.
GitHub · GitLab
Snyk · Semgrep · Tenable
Jira · Linear · ServiceNow
Fábrica de defensa
El nexo entre tus herramientas existentes, que permite a los agentes encontrar y corregir vulnerabilidades de forma proactiva en un flujo de trabajo continuo.
Entornos aislados y reproducibles · Ona, Cloudflare, Modal
- Codex Desktop
- Codex CLI
- Codex Security CLI
Análisis de seguridad · Priorizar hallazgo · Corregir hallazgo
Habilidades personalizadas
Astra · Sol · Terra · Luna
Daybreak Blue · Daybreak Red
La arquitectura de la defensa continua
Una fábrica de defensa necesita reproducir vulnerabilidades y verificar que las correcciones funcionen. Eso requiere entornos de desarrollo reproducibles y aislados con el código, las dependencias y los servicios adecuados, respaldados por orquestación y controles de acceso que permitan a los agentes trabajar de forma segura a escala.
Plano de control
Escala los entornos de ejecución y centraliza las políticas y los secretos.
Plano de datos
Entornos aislados y efímeros para validar hallazgos.
Sistemas para desarrolladores
Proporciona las herramientas que los agentes necesitan para operar.
Estado y flujos de trabajo
Lleva un registro de lo que proteges, lo que encuentran los agentes y lo que se debe corregir.
Seguridad y auditoría
Supervisa los agentes que ejecutan modelos cibernéticos para ayudar a garantizar una ejecución segura y un acceso protegido al contexto y a los datos sensibles.
Cómo la fábrica de defensa amplía la seguridad tradicional
Desplázate horizontalmente para ver lo que agrega la fábrica de defensa.
| Work | Cuello de botella común | Lo que te ofrece la fábrica de defensa |
|---|---|---|
| Descubrimiento | Los hallazgos están a la espera de su investigación. | Los hallazgos activan investigaciones automáticas. |
| Triaje | Los duplicados ofuscan las prioridades. | Duplicados fusionados. Posibilidad de explotación probada. |
| Propiedad | Los hallazgos están a la espera de un propietario. | Cada hallazgo tiene un propietario verificado. |
| Remediación | Los ingenieros repiten investigaciones. | Los parches probados llegan a los revisores con evidencia. |
| Verificación | Las correcciones fusionadas quedan sin verificar. | Las correcciones implementadas se vuelven a probar de forma independiente. |
Cómo un sprint de seguridad en toda OpenAI se convirtió en una fábrica de defensa
A medida que las nuevas capacidades de los modelos nos permitieron examinar nuestros sistemas con mayor profundidad, aumentamos el ritmo y la escala de nuestro trabajo de seguridad. Declaramos un código rojo interno y reunimos a los equipos de Seguridad, Aplicaciones e Investigación en un sprint coordinado en cientos de sistemas.
- personas movilizadas
- 250+250+
- áreas de servicio cubiertas
- 100+100+
“Estamos fortaleciendo nuestras defensas con la urgencia que se aplica a los incidentes. Es un esfuerzo de todo el personal que tiene prioridad por sobre todo lo demás, excepto las operaciones críticas de la empresa. Mantendremos ese mismo sentido de urgencia más allá del sprint a medida que seguimos probando y fortaleciendo nuestras defensas”.
El sprint fue el punto de partida de nuestra fábrica de defensa. Estamos avanzando hacia un ciclo defensivo continuo para mapear nuestros sistemas, encontrar y validar vulnerabilidades, asignar propietarios, verificar las correcciones y mejorar el sistema con cada ejecución.
El bucle defensivo
Inventario
Mapear, vincular, actualizar
Descubrimiento
Escanear, analizar, importar
Validación dinámica
Reproducir, probar, confirmar
Asignación de responsables
Identificar, derivar, dar seguimiento
Remediación verificada
Corregir, implementar, verificar
- 01
Inventario
Mapear, vincular, actualizar
- 02
Descubrimiento
Escanear, analizar, importar
- 03
Validación dinámica
Reproducir, probar, confirmar
- 04
Asignación de responsables
Identificar, derivar, dar seguimiento
- 05
Remediación verificada
Corregir, implementar, verificar
Aprender, adaptarse y aumentar la autonomía
Aprender, adaptarse y aumentar la autonomía
SECURITY.md representa el contexto del sistema compartido, no otro paso en el ciclo. El inventario, la detección, la validación dinámica, la asignación de titularidad y la remediación verificada leen, cada uno, el contexto existente y aportan lo que aprenden. Cada iteración reutiliza el mapa del sistema, la titularidad, la evidencia de investigación y las verificaciones ya establecidas, por lo que las iteraciones posteriores pueden enfocarse en los cambios y los riesgos pendientes en lugar de empezar desde cero. Las personas revisan los cambios importantes y verifican las correcciones implementadas de forma independiente. El pulso ilustra una contribución de contexto, no progreso ni ahorro medidos.
Lo que aprendimos al crear el ciclo defensivo
Los bucles defensivos necesitan los entornos de desarrollo adecuados
Los entornos de desarrollo reproducibles son la base de un ciclo defensivo autónomo. Los agentes necesitan entornos aislados que puedan aprovisionarse automáticamente a escala, con los servicios, las dependencias y la configuración necesarios para reproducir vulnerabilidades y probar correcciones. Esos entornos deben ser efímeros, creados desde cero para cada ejecución y, luego, descartados junto con su estado, para que una ejecución no contamine la siguiente.
La autonomía debe construirse de forma incremental a partir de pasos manuales
Comenzamos con lotes pequeños y revisión humana; luego eliminamos los pasos manuales repetitivos a medida que los resultados generaban confianza. Ampliamos la cantidad de trabajo que los agentes podían realizar, independientemente de lo que se les permitía modificar. Las personas pasaron a enfocarse en establecer límites, gestionar excepciones y verificar resultados a medida que los agentes asumían más del trabajo rutinario.
Inventario de sistemas mientras comenzaban las correcciones
Comenzamos por mapear nuestros sistemas. Codex ayudó a crear el inventario mientras reuníamos los hallazgos existentes en una lista de pendientes compartida. Al principio, la identificación de la titularidad aún dependía de que las personas encontraran al equipo adecuado. Convertimos la información de servicio y titularidad en insumos reutilizables para que los agentes pudieran etiquetar y enrutar lotes de incidencias, mientras las personas se encargaban de los casos ambiguos. Eso aumentó nuestras asignaciones de titularidad aceptadas al 90,6 %. En paralelo, los equipos abordaron problemas urgentes incluso antes de que se completaran el inventario y el modelo de titularidad. El primer día cerramos 53 problemas urgentes o de alta prioridad en todos nuestros sistemas.
- Asignaciones de propiedad aceptadas después del enrutamiento
- 90.6%90.6%
Crear y perfeccionar la clasificación de agentes
Codex evaluó lotes de hallazgos según una rúbrica de severidad y agregó contexto del servicio y del propietario. Las etiquetas de gravedad iniciales eran demasiado amplias y las clasificaciones variaban según las instrucciones que recibían los agentes. Asignamos versiones a la rúbrica y los prompts, agregamos evaluaciones repetibles y registramos las prioridades y el razonamiento esperados de los revisores. Las verificaciones humanas puntuales ayudaron a perfeccionar las prioridades y detectar informes deficientes o duplicados. También pausamos el enrutamiento hasta que mejorara la eliminación de duplicados, progresando de un lote pequeño revisado a ejecuciones repetidas, lo que permitió identificar el 37 % de los hallazgos como problemas duplicados.
- de los hallazgos identificados como duplicados
- 37%37%
Hacer repetible la validación en tiempo de ejecución
La creación de entornos aislados para que los agentes pudieran ejecutar código, evaluar la severidad y filtrar falsos positivos fue un paso clave para separar la señal del ruido. Sin embargo, la configuración del entorno se convirtió en una limitación para la validación, así que empezamos con servicios seleccionados que podíamos ejecutar de forma repetida. Resolvimos las dependencias faltantes y las diferencias de configuración para poder distinguir entre un hallazgo que no se reprodujo y una prueba que no pudo ejecutarse correctamente. Con estas mejoras, el 19,5 % de los hallazgos se reprodujo en tiempo de ejecución y la tasa de falsos positivos después de la validación dinámica fue del 0,81 %.
- tasa de falsos positivos después de la validación dinámica
- 0.81%0.81%
Automatización de parches y creación de flujos de trabajo reutilizables
La remediación estuvo basada al 100 % en Codex, con agentes que generaban parches mientras mejorábamos el enrutamiento y las prioridades. Proporcionamos a los agentes entornos de desarrollo reproducibles para reproducir problemas y probar los parches propuestos con servicios en ejecución, verificando tanto la corrección de seguridad como sus efectos en el comportamiento normal. Recopilamos lecciones en archivos SECURITY.md y habilidades reutilizables, y ampliamos el escaneo y la clasificación ejecutados por agentes junto con verificaciones automatizadas de correcciones. Las verificaciones de seguimiento expusieron una brecha entre los parches fusionados y las correcciones desplegadas en toda la flota. Después de una pequeña prueba piloto, ampliamos la verificación y publicamos comentarios sobre las correcciones confirmadas, a la vez que mantuvimos desactivada la reapertura automática mientras definíamos cómo tener en cuenta los retrasos en el despliegue.
- tasa de correcciones revertidas
- 0.53%0.53%
Próximamente: publicación técnica en el blog
El enfoque de OpenAI con respecto a las habilidades y los flujos de trabajo de seguridad
Inventario
Los agentes concilian registros en la nube, la configuración de implementación y los datos de titularidad del servicio en un inventario de activos. Conectan puntos de acceso expuestos con código y propietarios, y preservan la evidencia y las brechas para que el descubrimiento comience con un alcance más claro.
Desplázate horizontalmente para explorar el diagrama.
Los registros de nube y de activos, la configuración de la fuente y el despliegue, y los datos de servicios y propietarios entran juntos en el entorno de desarrollo reproducible. Codex usa una habilidad propuesta para crear y actualizar el inventario y la referencia existente de atribución de servicios para generar un inventario de activos. El mismo inventario es la primera entrada para Discovery. Las operaciones de escritura en el inventario y la programación de actualizaciones deben configurarse mediante el flujo de trabajo que realiza la llamada.
Entradas
Flujo de trabajo de agentes
Entorno de desarrollo reproducible
Resultados
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/plugins
- Entornos
Descubrimiento
Los agentes usan un inventario de activos, código fuente, un modelo de amenazas y una política de seguridad para orientar los análisis de seguridad y explorar rutas de ataque. Los hallazgos se combinan con los informes de vulnerabilidades existentes para formar un amplio conjunto de vulnerabilidades candidatas.
Desplázate horizontalmente para explorar el diagrama.
El inventario de activos del flujo de trabajo de Inventory, el control de código fuente, el modelo de amenazas y la política de seguridad ingresan juntos al entorno de desarrollo reproducible para el descubrimiento con Codex, Codex Security Scans y análisis de rutas de ataque. Los informes de vulnerabilidades omiten el descubrimiento local y se unen directamente a las vulnerabilidades candidatas. Las habilidades de descubrimiento no son una secuencia fija.
Entradas
Flujo de trabajo de agentes
Entorno de desarrollo reproducible
Resultados
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/plugins
- Entornos
Validación dinámica
Dados los posibles hallazgos y una aplicación ejecutable, los agentes inspeccionan el código, reevalúan la exposición e intentan reproducir vulnerabilidades sospechosas en un entorno controlado. Conservan la evidencia de reproducción de las vulnerabilidades confirmadas y verifican si hay duplicados antes de crear incidencias aprobadas.
Desplázate horizontalmente para explorar el diagrama.
Las vulnerabilidades candidatas y la configuración de la aplicación entran juntas en el entorno de desarrollo reproducible. Codex usa la clasificación y validación de hallazgos y la deduplicación y creación de incidencias. El triaje y la reevaluación de la exposición inspeccionan el código fuente, no el comportamiento en tiempo de ejecución. Una vulnerabilidad validada requiere evidencia de reproducción; el rastreo estático por sí solo no cumple con este resultado. Los resultados refutados y no concluyentes permanecen asociados al hallazgo. Las escrituras en Tracker requieren aprobación.
Entradas
Flujo de trabajo de agentes
Entorno de desarrollo reproducible
Resultados
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/plugins
- Entornos
Asignación de responsables
Los agentes usan capacidades específicas de la empresa para conectar hallazgos validados con el contexto de la empresa, los registros de responsables y los sistemas de seguimiento de incidencias, lo que genera incidencias asignadas con responsables identificados y evidencia.
Desplázate horizontalmente para explorar el diagrama.
La vulnerabilidad validada, los mensajeros Instant, los registros de propiedad y el rastreador de problemas ingresan juntos al entorno de desarrollo reproducible. Codex usa las habilidades personalizadas de atribución de servicio y propiedad y de etiquetado de problemas para generar un problema asignado. La asignación no implica reconocimiento.
Entradas
Flujo de trabajo de agentes
Entorno de desarrollo reproducible
Resultados
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/plugins
- Entornos
Remediación verificada
Los agentes preparan y verifican de forma independiente una corrección, revisan si se ha reconocido o iniciado la remediación y proponen medidas para reforzar la seguridad. Después de la revisión humana y el despliegue autorizado, una integración personalizada propuesta vuelve a probar la corrección desplegada y registra evidencia de verificación.
Desplázate horizontalmente para explorar el diagrama.
El problema asignado, la evidencia de vulnerabilidad y las instrucciones del repositorio ingresan juntas al entorno de desarrollo reproducible. Codex puede usar Corregir hallazgo, Verificar corrección, Revisar adopción de remediación y Refuerzo de seguridad. Estas capacidades no siguen una secuencia fija obligatoria. Verificar corrección combina la verificación del parche con las verificaciones personalizadas propuestas en producción después de la revisión humana y la implementación autorizada. La remediación implementada y verificada incluye evidencia de implementación y verificación; las comprobaciones fallidas o no concluyentes mantienen abierta la remediación. El trabajo aceptado y el movimiento de tickets no demuestran que haya una corrección.
Entradas
Flujo de trabajo de agentes
Entorno de desarrollo reproducible
Resultados
- Plataformas de terceros
- Artefactos
- Productos de OpenAI
- Habilidades/plugins
- Entornos
Haz de la defensa continua una prioridad
Informa a tu equipo, comienza con un flujo de trabajo y avanza gradualmente hacia una fábrica de defensa. Seguiremos publicando lo que estamos aprendiendo en OpenAI, junto con flujos de trabajo prácticos, herramientas y orientación.
- 01
Informa a tu equipo
Usa la presentación informativa para argumentar a favor de la fábrica de defensa, definir el rumbo y acordar un primer flujo de trabajo.
- 02
Solicitar acceso a modelos de ciberseguridad
Solicita acceso a Daybreak para usar los modelos avanzados de ciberseguridad de OpenAI en tareas defensivas autorizadas.
- 03
Ejecutar un flujo de trabajo
Usa las habilidades del plugin de Codex Security para encontrar vulnerabilidades, validar hallazgos y preparar correcciones.
¿Ya eres cliente de OpenAI? Habla con tu equipo de cuenta sobre tu arquitectura.
Lectura adicional

El incidente de Hugging Face
La charla de Black Hat detrás de la reconstrucción del incidente de Hugging Face.
- Análisis de incidentesIntrusión de agentes: el cronograma técnicoEl informe forense de Hugging Face sobre la intrusión, incluidos la ruta de ataque, la investigación y los cambios defensivos.(se abre en una nueva ventana)
- Divulgación de incidentesIncidente de seguridad en la evaluación de modelos de Hugging FaceRelato de OpenAI sobre el incidente durante la evaluación del modelo, su respuesta junto con Hugging Face y los cambios en las medidas de protección para la evaluación.(se abre en una nueva ventana)
- PerspectivaVentana de oportunidad de los defensoresPor qué los equipos de defensa tienen un plazo limitado para actuar y cómo las organizaciones pueden usar la IA para fortalecer sus ciberdefensas.(se abre en una nueva ventana)
- Actualización del programaAmpliar Daybreak a medida que se reduce la ventana de defensa cibernéticaCómo Daybreak amplía el acceso a modelos de ciberseguridad avanzados y ayuda a los equipos de defensa a usarlos con las medidas de protección adecuadas.(se abre en una nueva ventana)
- DocumentaciónChatGPT LearnComplemento Codex SecurityUna guía para instalar el plugin Codex Security, analizar un repositorio y revisar hallazgos de seguridad.(se abre en una nueva ventana)