La ventana del defensor se está cerrando

Los defensores tienen una ventaja inicial, pero tenemos que actuar

El enfoque de OpenAI

La fábrica de defensa

Crear una defensa continua

Las defensas cibernéticas tradicionales por sí solas ya no son suficientes

Los agentes ahora pueden llevar a cabo operaciones cibernéticas de larga duración mediante el uso malicioso de modelos de pesos abiertos cada vez más disponibles. Como respuesta, en OpenAI estamos creando una Defense Factory. Una operación de defensa automatizada para encontrar, validar y corregir vulnerabilidades de forma continua.

Los equipos de Cloudflare(se abre en una nueva ventana), Ramp(se abre en una nueva ventana) y Google(se abre en una nueva ventana) también están explorando este enfoque. Aquí compartimos la arquitectura y los procesos detrás de nuestra propia fábrica de defensa, junto con lo que aprendimos al desarrollarla.

Los modelos de vanguardia más recientes encuentran vulnerabilidades ya presentes en la etapa de producción

En un sprint de seguridad reciente, usamos nuestros modelos de ciberseguridad más recientes para encontrar, validar y corregir vulnerabilidades en toda OpenAI. Movilizamos a más de 250 personas y abordamos el trabajo con la urgencia propia de una respuesta a incidentes.

Cinco semanas completas de informes seleccionados sobre hallazgos de prioridad urgente y alta, marcados como completados o resueltos, en relación con la semana de mayor actividad. La finalización registrada no establece una remediación implementada y verificada de forma independiente.Remediaciones de P0/P1Remediaciones de P0/P154631491535Semanas

Los agentes ahora pueden encadenar exploits

Los agentes conservan lo que aprenden entre sesiones para desarrollar una comprensión detallada de un sistema y conectar vulnerabilidades. Los ataques complejos que antes eran inviables ahora pueden llevarse a cabo de forma autónoma.

Cadena de ataque ilustrativaUn camino conecta nodos sucesivos a través de un laberinto. Cada nodo alcanzado habilita el siguiente, y los pasos anteriores permanecen conectados. Esta es una ilustración conceptual, no una reconstrucción de un incidente.

Los grupos de agentes multiplican la escala de los ataques

Los agentes de ejecución prolongada que operan en flotas pueden aprovechar debilidades a mayor escala y mucho antes de que una respuesta de seguridad con intervención humana pueda identificar y corregir esas mismas vulnerabilidades.

Los modelos y agentes convergen para acelerar el trabajoLos modelos ampliamente disponibles y los agentes de ejecución prolongada están conectados en la parte superior. Dos trazas descienden hacia la explotación a velocidad de máquina, la cual se llena de arriba hacia abajo a medida que llegan. Las etiquetas permanecen visibles en todo momento.

Los defensores tienen una ventaja inicial, pero tenemos que actuar

Los defensores tienen dos ventajas estructurales. Pueden dar a los agentes acceso directo a su código y usar modelos de vanguardia para obtener una ventaja temporal frente a atacantes que hacen un uso malicioso de modelos de pesos abiertos ampliamente disponibles.

Capacidad cibernética

Alcanzar de vanguardia y mantener el ritmoLa capacidad cibernética aumenta hacia arriba; el tiempo avanza hacia la derecha. La capacidad de los modelos de vanguardia y de amplia difusión sigue aumentando cada vez más rápido. La capacidad defensiva se mantiene sin cambios hasta que se implementa la defensa continua. Luego aumenta siguiendo una curva en S: un progreso gradual, una mejora rápida y, finalmente, una transición suave hasta unirse con la curva de vanguardia. Las curvas de defensa y de vanguardia se encuentran y luego comparten una trayectoria ascendente. El área azul entre la defensa implementada y la capacidad de los modelos de amplia difusión es la ventana del defensor. Mantener el ritmo requiere trabajo continuo. Estas son trayectorias ilustrativas, no resultados medidos ni un pronóstico.

Tiempo

  • De vanguardia
  • Capacidad de los defensores
  • De amplia difusión

Implementar defensa continua

Ventana de oportunidad de los defensores

Esta ventaja inicial es la ventana de oportunidad de los defensores.

Una fábrica de defensa es una operación continua, centrada en agentes, para detectar y corregir vulnerabilidades. Ayuda a los defensores a mantener el ritmo a medida que los atacantes abusan de modelos de pesos abiertos cada vez más capaces para acelerar sus operaciones. Los agentes usan herramientas existentes de seguridad e ingeniería; las habilidades reutilizables definen los flujos de trabajo que siguen, y los entornos de cómputo aislados y reproducibles les permiten investigar los hallazgos y preparar correcciones probadas para su revisión. Los equipos automatizan progresivamente una mayor parte del proceso, lo que reduce las transferencias y acorta el tiempo desde el descubrimiento hasta la remediación.

Seguridad tradicional

Tus herramientas existentes, idealmente accesibles para los agentes a través de MCP, CLI o API.

Control de código fuente

GitHub · GitLab

Herramientas de seguridad

Snyk · Semgrep · Tenable

Problemas y flujos de trabajo

Jira · Linear · ServiceNow

Fábrica de defensa

El nexo entre tus herramientas existentes, que permite a los agentes encontrar y corregir vulnerabilidades de forma proactiva en un flujo de trabajo continuo.

Entorno de desarrollo

Entornos aislados y reproducibles · Ona, Cloudflare, Modal

Agentes
  • Codex Desktop
  • Codex CLI
  • Codex Security CLI
Habilidades de seguridad

Análisis de seguridad · Priorizar hallazgo · Corregir hallazgo

Habilidades personalizadas

Modelos de uso general

Astra · Sol · Terra · Luna

Modelos de seguridad

Daybreak Blue · Daybreak Red

Una fábrica de defensa necesita reproducir vulnerabilidades y verificar que las correcciones funcionen. Eso requiere entornos de desarrollo reproducibles y aislados con el código, las dependencias y los servicios adecuados, respaldados por orquestación y controles de acceso que permitan a los agentes trabajar de forma segura a escala.

Plano de control

Escala los entornos de ejecución y centraliza las políticas y los secretos.

Plano de datos

Entornos aislados y efímeros para validar hallazgos.

Contenedores

Sistemas para desarrolladores

Proporciona las herramientas que los agentes necesitan para operar.

Estado y flujos de trabajo

Lleva un registro de lo que proteges, lo que encuentran los agentes y lo que se debe corregir.

Seguridad y auditoría

Supervisa los agentes que ejecutan modelos cibernéticos para ayudar a garantizar una ejecución segura y un acceso protegido al contexto y a los datos sensibles.

Dentro de la red privada, los sistemas de desarrolladores y los almacenes de estado se ubican junto a un plano de control y un plano de datos. El plano de control contiene orquestación de cargas de trabajo, aplicación de políticas y un proxy de credenciales. El plano de datos contiene entornos de desarrollo con contenedores de desarrollo, identidades de entorno y monitoreo de hosts. Cada contenedor de desarrollo contiene un arnés de ejecución de agentes, habilidades y la aplicación. La seguridad y la auditoría proporcionan supervisión en todo el sistema mediante la actividad del host, la seguridad de la infraestructura y la auditoría de agentes. Los recuadros muestran componentes y límites.

Cómo la fábrica de defensa amplía la seguridad tradicional

Desplázate horizontalmente para ver lo que agrega la fábrica de defensa.

WorkCuello de botella comúnLo que te ofrece la fábrica de defensa
DescubrimientoLos hallazgos están a la espera de su investigación.
Los hallazgos activan investigaciones automáticas.
TriajeLos duplicados ofuscan las prioridades.
Duplicados fusionados. Posibilidad de explotación probada.
PropiedadLos hallazgos están a la espera de un propietario.
Cada hallazgo tiene un propietario verificado.
RemediaciónLos ingenieros repiten investigaciones.
Los parches probados llegan a los revisores con evidencia.
VerificaciónLas correcciones fusionadas quedan sin verificar.
Las correcciones implementadas se vuelven a probar de forma independiente.

A medida que las nuevas capacidades de los modelos nos permitieron examinar nuestros sistemas con mayor profundidad, aumentamos el ritmo y la escala de nuestro trabajo de seguridad. Declaramos un código rojo interno y reunimos a los equipos de Seguridad, Aplicaciones e Investigación en un sprint coordinado en cientos de sistemas.

personas movilizadas
250+
áreas de servicio cubiertas
100+

“Estamos fortaleciendo nuestras defensas con la urgencia que se aplica a los incidentes. Es un esfuerzo de todo el personal que tiene prioridad por sobre todo lo demás, excepto las operaciones críticas de la empresa. Mantendremos ese mismo sentido de urgencia más allá del sprint a medida que seguimos probando y fortaleciendo nuestras defensas”.

— Thibault Sottiaux, director de productos centrales y plataforma, OpenAI

El sprint fue el punto de partida de nuestra fábrica de defensa. Estamos avanzando hacia un ciclo defensivo continuo para mapear nuestros sistemas, encontrar y validar vulnerabilidades, asignar propietarios, verificar las correcciones y mejorar el sistema con cada ejecución.

El bucle defensivo

  1. 01

    Inventario

    Mapear, vincular, actualizar

  2. 02

    Descubrimiento

    Escanear, analizar, importar

  3. 03

    Validación dinámica

    Reproducir, probar, confirmar

  4. 04

    Asignación de responsables

    Identificar, derivar, dar seguimiento

  5. 05

    Remediación verificada

    Corregir, implementar, verificar

Aprender, adaptarse y aumentar la autonomía

SECURITY.mdContexto compartido

SECURITY.md representa el contexto del sistema compartido, no otro paso en el ciclo. El inventario, la detección, la validación dinámica, la asignación de titularidad y la remediación verificada leen, cada uno, el contexto existente y aportan lo que aprenden. Cada iteración reutiliza el mapa del sistema, la titularidad, la evidencia de investigación y las verificaciones ya establecidas, por lo que las iteraciones posteriores pueden enfocarse en los cambios y los riesgos pendientes en lugar de empezar desde cero. Las personas revisan los cambios importantes y verifican las correcciones implementadas de forma independiente. El pulso ilustra una contribución de contexto, no progreso ni ahorro medidos.

Lo que aprendimos al crear el ciclo defensivo

Los bucles defensivos necesitan los entornos de desarrollo adecuados

Los entornos de desarrollo reproducibles son la base de un ciclo defensivo autónomo. Los agentes necesitan entornos aislados que puedan aprovisionarse automáticamente a escala, con los servicios, las dependencias y la configuración necesarios para reproducir vulnerabilidades y probar correcciones. Esos entornos deben ser efímeros, creados desde cero para cada ejecución y, luego, descartados junto con su estado, para que una ejecución no contamine la siguiente.

La autonomía debe construirse de forma incremental a partir de pasos manuales

Comenzamos con lotes pequeños y revisión humana; luego eliminamos los pasos manuales repetitivos a medida que los resultados generaban confianza. Ampliamos la cantidad de trabajo que los agentes podían realizar, independientemente de lo que se les permitía modificar. Las personas pasaron a enfocarse en establecer límites, gestionar excepciones y verificar resultados a medida que los agentes asumían más del trabajo rutinario.

  • Inventario de sistemas mientras comenzaban las correcciones

    Comenzamos por mapear nuestros sistemas. Codex ayudó a crear el inventario mientras reuníamos los hallazgos existentes en una lista de pendientes compartida. Al principio, la identificación de la titularidad aún dependía de que las personas encontraran al equipo adecuado. Convertimos la información de servicio y titularidad en insumos reutilizables para que los agentes pudieran etiquetar y enrutar lotes de incidencias, mientras las personas se encargaban de los casos ambiguos. Eso aumentó nuestras asignaciones de titularidad aceptadas al 90,6 %. En paralelo, los equipos abordaron problemas urgentes incluso antes de que se completaran el inventario y el modelo de titularidad. El primer día cerramos 53 problemas urgentes o de alta prioridad en todos nuestros sistemas.

    Asignaciones de propiedad aceptadas después del enrutamiento
    90.6%
  • Crear y perfeccionar la clasificación de agentes

    Codex evaluó lotes de hallazgos según una rúbrica de severidad y agregó contexto del servicio y del propietario. Las etiquetas de gravedad iniciales eran demasiado amplias y las clasificaciones variaban según las instrucciones que recibían los agentes. Asignamos versiones a la rúbrica y los prompts, agregamos evaluaciones repetibles y registramos las prioridades y el razonamiento esperados de los revisores. Las verificaciones humanas puntuales ayudaron a perfeccionar las prioridades y detectar informes deficientes o duplicados. También pausamos el enrutamiento hasta que mejorara la eliminación de duplicados, progresando de un lote pequeño revisado a ejecuciones repetidas, lo que permitió identificar el 37 % de los hallazgos como problemas duplicados.

    de los hallazgos identificados como duplicados
    37%
  • Hacer repetible la validación en tiempo de ejecución

    La creación de entornos aislados para que los agentes pudieran ejecutar código, evaluar la severidad y filtrar falsos positivos fue un paso clave para separar la señal del ruido. Sin embargo, la configuración del entorno se convirtió en una limitación para la validación, así que empezamos con servicios seleccionados que podíamos ejecutar de forma repetida. Resolvimos las dependencias faltantes y las diferencias de configuración para poder distinguir entre un hallazgo que no se reprodujo y una prueba que no pudo ejecutarse correctamente. Con estas mejoras, el 19,5 % de los hallazgos se reprodujo en tiempo de ejecución y la tasa de falsos positivos después de la validación dinámica fue del 0,81 %.

    tasa de falsos positivos después de la validación dinámica
    0.81%
  • Automatización de parches y creación de flujos de trabajo reutilizables

    La remediación estuvo basada al 100 % en Codex, con agentes que generaban parches mientras mejorábamos el enrutamiento y las prioridades. Proporcionamos a los agentes entornos de desarrollo reproducibles para reproducir problemas y probar los parches propuestos con servicios en ejecución, verificando tanto la corrección de seguridad como sus efectos en el comportamiento normal. Recopilamos lecciones en archivos SECURITY.md y habilidades reutilizables, y ampliamos el escaneo y la clasificación ejecutados por agentes junto con verificaciones automatizadas de correcciones. Las verificaciones de seguimiento expusieron una brecha entre los parches fusionados y las correcciones desplegadas en toda la flota. Después de una pequeña prueba piloto, ampliamos la verificación y publicamos comentarios sobre las correcciones confirmadas, a la vez que mantuvimos desactivada la reapertura automática mientras definíamos cómo tener en cuenta los retrasos en el despliegue.

    tasa de correcciones revertidas
    0.53%

Próximamente: publicación técnica en el blog

Inventario

Los agentes concilian registros en la nube, la configuración de implementación y los datos de titularidad del servicio en un inventario de activos. Conectan puntos de acceso expuestos con código y propietarios, y preservan la evidencia y las brechas para que el descubrimiento comience con un alcance más claro.

Desplázate horizontalmente para explorar el diagrama.

Los registros de nube y de activos, la configuración de la fuente y el despliegue, y los datos de servicios y propietarios entran juntos en el entorno de desarrollo reproducible. Codex usa una habilidad propuesta para crear y actualizar el inventario y la referencia existente de atribución de servicios para generar un inventario de activos. El mismo inventario es la primera entrada para Discovery. Las operaciones de escritura en el inventario y la programación de actualizaciones deben configurarse mediante el flujo de trabajo que realiza la llamada.

Entradas

Flujo de trabajo de agentes

Entorno de desarrollo reproducible

Resultados

  • Plataformas de terceros
  • Artefactos
  • Productos de OpenAI
  • Habilidades/plugins
  • Entornos

Haz de la defensa continua una prioridad

Informa a tu equipo, comienza con un flujo de trabajo y avanza gradualmente hacia una fábrica de defensa. Seguiremos publicando lo que estamos aprendiendo en OpenAI, junto con flujos de trabajo prácticos, herramientas y orientación.

  1. Informa a tu equipo

    Usa la presentación informativa para argumentar a favor de la fábrica de defensa, definir el rumbo y acordar un primer flujo de trabajo.

  2. Solicitar acceso a modelos de ciberseguridad

    Solicita acceso a Daybreak para usar los modelos avanzados de ciberseguridad de OpenAI en tareas defensivas autorizadas.

  3. Ejecutar un flujo de trabajo

    Usa las habilidades del plugin de Codex Security para encontrar vulnerabilidades, validar hallazgos y preparar correcciones.

¿Ya eres cliente de OpenAI? Habla con tu equipo de cuenta sobre tu arquitectura.

Lectura adicional

El incidente de Hugging Face

La charla de Black Hat detrás de la reconstrucción del incidente de Hugging Face.

(se abre en una nueva ventana)
  1. Intrusión de agentes: el cronograma técnicoEl informe forense de Hugging Face sobre la intrusión, incluidos la ruta de ataque, la investigación y los cambios defensivos.(se abre en una nueva ventana)
  2. Incidente de seguridad en la evaluación de modelos de Hugging FaceRelato de OpenAI sobre el incidente durante la evaluación del modelo, su respuesta junto con Hugging Face y los cambios en las medidas de protección para la evaluación.(se abre en una nueva ventana)
  3. Ventana de oportunidad de los defensoresPor qué los equipos de defensa tienen un plazo limitado para actuar y cómo las organizaciones pueden usar la IA para fortalecer sus ciberdefensas.(se abre en una nueva ventana)
  4. Ampliar Daybreak a medida que se reduce la ventana de defensa cibernéticaCómo Daybreak amplía el acceso a modelos de ciberseguridad avanzados y ayuda a los equipos de defensa a usarlos con las medidas de protección adecuadas.(se abre en una nueva ventana)
  5. Complemento Codex SecurityUna guía para instalar el plugin Codex Security, analizar un repositorio y revisar hallazgos de seguridad.(se abre en una nueva ventana)