Pasar al contenido principal
OpenAI

28 de septiembre de 2026

Seguridad

Hacia casos de seguridad para el entrenamiento de IA de vanguardia

Cargando...

Creemos que estamos entrando en una nueva era en la que debería exigirse documentación de seguridad estructurada antes de continuar cualquier ejecución de aprendizaje por refuerzo de IA de vanguardia. Idealmente, esa documentación alcanzaría el nivel de los "casos de seguridad": argumentaciones exhaustivas, estructuradas y basadas en evidencia sobre el riesgo, que se utilizan en otros sectores donde la seguridad es crítica. Consideramos los casos de seguridad como una meta que orienta nuestro trabajo, aunque reconocemos los desafíos de lograr que sean tan rigurosos para los modelos de IA como para la aviación o la energía nuclear, debido a la complejidad que surge con cada nuevo nivel de capacidad de la IA. Estamos trabajando en un marco para formalizar estas prácticas.

A continuación, presentamos algunas pautas iniciales que creemos que deberían formar parte de estos casos de seguridad para el entrenamiento de IA de vanguardia. Estas mejores prácticas reflejan lo que hemos aprendido hasta ahora y esperamos que evolucionen a medida que sigamos perfeccionando los procesos internos para un desarrollo cuidadoso. Las compartimos ahora para transparentar nuestra perspectiva actual e invitar a la comunidad a aportar sus comentarios. Ten en cuenta que este documento se centra en el entrenamiento mediante aprendizaje por refuerzo de IA de vanguardia; los despliegues internos y externos requieren considerar un conjunto mucho más amplio de propiedades de alineación.

1. Salvaguardas técnicas

Los casos de seguridad deberían cubrir tres aspectos del conjunto tecnológico: el entrenamiento para la alineación, la contención y el monitoreo. Estas salvaguardas ayudan a garantizar que el modelo no intente realizar acciones desalineadas y que, incluso si lo hiciera, le resulte difícil superar la contención y el monitoreo lo detecte antes de que pueda causar daños.

  • Alineación del modelo: la primera línea de defensa debería ser entrenar los modelos para que estén alineados; es decir, para que actúen de manera confiable según nuestras intenciones. Esto podría incluir:

    • Entornos de entrenamiento y calificación: reduce el riesgo de que los modelos desarrollen comportamientos desalineados al evitar que los reward hacks reciban refuerzo positivo durante el entrenamiento. Esto podría incluir:

      • Revisiones automatizadas de conjuntos de datos: usa agentes para detectar y corregir entornos de aprendizaje por refuerzo defectuosos que podrían permitir que trayectorias desalineadas obtengan altas recompensas al aprovechar fallas, en lugar de seguir el comportamiento previsto. Así se reducen las oportunidades de reforzar la desalineación durante el entrenamiento.

      • Revisiones manuales de conjuntos de datos: complementa el red teaming automatizado con revisiones manuales y controles de calidad de los conjuntos de datos para identificar tareas defectuosas que podrían reforzar inadvertidamente comportamientos desalineados.

      • Ajuste de calificadores: ajusta los calificadores para penalizar los intentos del modelo de aprovechar fallas o manipular los entornos de aprendizaje por refuerzo durante el entrenamiento.

      • Análisis de ejecuciones anteriores: aplica clasificadores a los registros de experimentos anteriores para asegurarte de que los calificadores funcionen según lo previsto.

    • Medición de la alineación: realiza evaluaciones que rastreen las tendencias del modelo a la desalineación para medir la eficacia del entrenamiento para la alineación. Esto podría incluir:

      • Evaluaciones de alineación fuera de línea: realiza evaluaciones de alineación durante las ejecuciones de entrenamiento de modelos de vanguardia para determinar si el entrenamiento funciona según lo previsto e investigar cualquier retroceso significativo.

      • Validación retrospectiva: valida las evaluaciones de alineación con incidentes anteriores para confirmar que detecten modelos previamente desalineados y no se estén sobreajustando a incidentes particulares.

      • Rastrear la manipulación de evaluaciones: rastrea la conciencia de la evaluación o el uso estratégico del contexto de evaluación (cuando los modelos reconocen que se los está poniendo a prueba) que podrían inducir un cambio de comportamiento, con umbrales específicos de bloqueo. Por ejemplo, activa sistemas de monitoreo de estos fenómenos en las evaluaciones de alineación.

      • Pruebas de estrés en el peor escenario: provoca el peor comportamiento indebido posible y comprueba que al menos una evaluación lo detectaría.

    • Evitar el entrenamiento con la cadena de pensamiento: no permitas que los calificadores automatizados vean la cadena de pensamiento durante el aprendizaje por refuerzo, para evitar que los modelos evolucionen hasta eludir los sistemas de monitoreo de la cadena de pensamiento.

  • Contención: en caso de que un modelo se desalinee, asegúrate de que el aislamiento y la seguridad sean lo suficientemente sólidos para impedir acciones dañinas. Esto podría incluir:

    • Múltiples capas de seguridad de la infraestructura: invierte considerablemente en reforzar tanto el entorno aislado donde se ejecuta el modelo como la infraestructura de investigación que lo aloja, para garantizar una capa adicional de protección si el modelo escapa de ese entorno.

    • Red teaming de contención: mejora la seguridad del entorno aislado, la infraestructura de investigación y el perímetro mediante red teaming iterativo de estos sistemas, usando puntos de control de ejecuciones de entrenamiento de modelos de vanguardia, sujetos a un análisis de seguridad, para detectar y corregir cualquier deficiencia. También somete a pruebas adversariales todos los servicios con los que el modelo podría interactuar durante el entrenamiento (por ejemplo, la caché de internet).

    • Comunicación entre muestras: limita la comunicación de alto ancho de banda entre muestras a las vías aprobadas, como las herramientas multiagente, y cierra los canales laterales de la infraestructura que tengan un alto ancho de banda y que los agentes puedan descubrir fácilmente.

    • Transcripciones inmutables: guarda las transcripciones de los agentes de forma inmutable durante un plazo razonable (por ejemplo, en cuentas de almacenamiento de escritura única) para todo entrenamiento mediante aprendizaje por refuerzo, evaluación y despliegue interno, a fin de permitir investigaciones confiables de incidentes y evitar modificaciones inadvertidas.

  • Monitoreo: en caso de que los modelos comiencen a realizar acciones desalineadas, cuenta con un sistema de monitoreo en tiempo real para detectar cualquier posible desalineación y resolver rápidamente los problemas prioritarios antes de que ocurra un incidente grave. Esto podría incluir:

    • Garantizar la capacidad de monitoreo: asegúrate de que los modelos sigan siendo monitoreables, según lo midan las evaluaciones de capacidad de monitoreo y de evasión del sistema de monitoreo con umbrales claros, para detectar a tiempo comportamientos preocupantes.

    • Alta exhaustividad en problemas conocidos: asegúrate de que el sistema de monitoreo detecte una alta proporción de los incidentes anteriores en una evaluación con datos reservados.

    • Evaluaciones actualizadas para los sistemas de monitoreo: crea ejemplos de evaluación representativos de riesgos totalmente nuevos para las nuevas ejecuciones, de modo que las mediciones de exhaustividad y precisión del sistema de monitoreo no queden obsoletas.

    • Respuesta rápida: implementa alertas prioritarias que desencadenen una acción dentro de un SLA definido, ya sea al avisar a una persona de guardia o al pausar automáticamente la ejecución afectada, antes de que el modelo cause daños (por ejemplo, avisar a la persona de guardia de seguridad y al responsable de la ejecución ante incidentes durante el día, y pausar automáticamente las ejecuciones si las alertas no se confirman durante la noche).

2. Pautas operativas

Además de las recomendaciones sobre salvaguardas técnicas, hemos trabajado en mejores prácticas operativas para los casos de seguridad de una ejecución de entrenamiento de IA de vanguardia. Estas podrían incluir:

  • Objeciones (análisis preventivos): una vez redactado un caso de seguridad, un integrante de otro equipo debería elaborar un documento con objeciones para detectar posibles deficiencias y ofrecer una valoración calibrada del riesgo. El equipo de entrenamiento debería responder a esas objeciones para ayudar a fortalecer el caso de seguridad.

  • Aprobaciones: el caso de seguridad debería ser revisado por miembros de la alta dirección, cada uno con la facultad de vetar la ejecución, para garantizar múltiples controles internos (por ejemplo, el líder o vicepresidente del área de investigación, el responsable de seguridad y el director científico).

  • Rendición de cuentas: el alto directivo responsable de una ejecución de entrenamiento (por ejemplo, el líder o vicepresidente del área de investigación) debería rendir cuentas por el caso de seguridad y por la respuesta a cualquier incidente, incluso en las evaluaciones de desempeño, para que los equipos de entrenamiento también tengan incentivos para promover la seguridad y la alineación.

  • Pausas: si se detectan problemas que invalidarían un caso de seguridad (por ejemplo, un nuevo problema de seguridad), asegúrate de que existan procedimientos operativos, controles técnicos y acuerdos de nivel de servicio (SLA) para pausar todas las ejecuciones cubiertas.

  • Transparencia interna: los casos de seguridad deberían estar a disposición de los grupos internos de supervisión (por ejemplo, el Comité de Seguridad y Protección).

  • Auditorías: los auditores deberían contar con acceso suficiente para verificar que las afirmaciones del caso de seguridad sean válidas y sólidas, y señalar las deficiencias que detecten.

  • Escalamiento: debería existir un proceso claro para escalar problemas de desalineación, con una tabla de niveles de gravedad definidos y una persona de guardia encargada de estos problemas que pueda alertar a los directivos (por ejemplo, al director ejecutivo) cuando una ejecución alcance cierto nivel de gravedad.

  • Controles técnicos: debería ser difícil para las personas y los agentes iniciar ejecuciones que incumplan los requisitos. Las funciones de seguridad, como el monitoreo y las pausas automáticas, deberían bloquear la operación ante fallas (por ejemplo, no debería ser posible iniciar ejecuciones sin el monitoreo adecuado activado, ni desactivar el sistema de monitoreo desde el entrenamiento mediante aprendizaje por refuerzo, la evaluación o un despliegue interno).

  • Capacidad de reversión: debería ser fácil identificar todos los usos posteriores de un modelo desalineado en el proceso de entrenamiento (por ejemplo, la generación de datos o la calificación) para poder revertir el efecto de los resultados desalineados si fuera necesario.

  • Exhaustividad de los riesgos residuales: los casos de seguridad deberían incluir una lista lo más completa posible de los riesgos residuales no cubiertos por las mitigaciones implementadas, para permitir decisiones informadas sobre la aceptación de riesgos.

Estas son nuestras recomendaciones actuales y están en proceso de implementación en OpenAI. Esperamos que nuestras prácticas sigan evolucionando en las próximas semanas.

3. Investigación de incidentes de desalineación

También hemos desarrollado algunas mejores prácticas para investigar incidentes graves de desalineación de la IA. Los laboratorios deberían procurar aprender lo máximo posible de cada incidente (como ocurre con las prácticas de investigación⁠(se abre en una nueva ventana) de otros sectores de alto riesgo) para evitar que se repitan en el futuro. Algunos ejemplos de estas acciones podrían incluir:

  • Transparencia interna: dado que completar una investigación puede llevar bastante tiempo, deberían presentarse actualizaciones internas periódicas sobre las investigaciones de incidentes (por ejemplo, actualizaciones diarias para las investigaciones en curso). Los empleados deberían contar con vías definidas para obtener mayor acceso, incluidas las transcripciones sin procesar y la posibilidad de generar muestras con modelos desalineados, siempre que sea seguro y pertinente para su trabajo.

  • Causa raíz de la desalineación: los investigadores deberían identificar las causas raíz en la dinámica del entrenamiento (por ejemplo, mediante ablaciones específicas o experimentos de remuestreo) para comprender cómo se introdujeron los comportamientos desalineados, profundizar en la ciencia de la desalineación y prevenirla mejor en el futuro.

  • Análisis posterior al incidente: debería realizarse un análisis operativo y cultural para comprender todas las causas que contribuyeron al incidente, como por qué se introdujeron problemas y por qué no se detectaron o escalaron antes de que ocurriera.

  • Detección: deberíamos desarrollar métodos de prueba de alineación capaces de descubrir la propensión a causar el incidente, sin optimizarlos iterativamente de forma directa con información derivada de este (por ejemplo, transcripciones o resúmenes del incidente). Deberían crearse evaluaciones derivadas de los incidentes como "pruebas de regresión", para garantizar que los modelos futuros no muestren propensión a la desalineación en incidentes muy similares.

  • Divulgación pública: los resultados de las investigaciones, los análisis posteriores a los incidentes y los cambios operativos deberían compartirse con el público una vez concluida la investigación. Debería notificarse a los terceros afectados lo antes posible.

Autor

OpenAI