Pasar al contenido principal
OpenAI

16 de septiembre de 2026

InvestigaciónSeguridad

Nuestro marco para informar sobre desalineación de modelos

Cargando...

Presentamos un nuevo marco para registrar, investigar y divulgar casos de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos inesperados o preocupantes que observamos en modelos durante los últimos seis meses.

En el pasado, para mantener mejor informados a investigadores, desarrolladores de IA, responsables de políticas públicas y al público general, hemos procurado hacer públicas nuestras conclusiones sobre la desalineación. Sin embargo, al no contar con un enfoque sistemático para comunicar estas conclusiones, nuestras divulgaciones han sido puntuales y menos frecuentes de lo ideal: a menudo esperamos hasta poder reunir varios casos en un solo informe o los añadimos a las tarjetas del sistema de modelos recién lanzados. Este nuevo marco busca acelerar la publicación de informes de desalineación tras observar un caso, incluso cuando todavía no hayamos explicado o mitigado por completo el comportamiento informado.

A medida que los sistemas de IA se vuelven más avanzados y se implementan de forma más generalizada, necesitamos generar un consenso más amplio y mejor informado sobre los avances de la investigación en alineación. No creemos que la industria de la IA haya resuelto la alineación y la supervisión en un grado suficiente como para seguir aumentando responsablemente la escala a la máxima velocidad durante mucho más tiempo. Las decisiones sobre cómo debe avanzar el desarrollo de la IA en los próximos meses y años deben basarse en evidencia que las personas ajenas a las empresas que crean modelos de vanguardia puedan examinar por sí mismas.

Los ejemplos de desalineación pueden ayudar a identificar problemas que otros desarrolladores de IA podrían encontrar cuando sus sistemas alcancen capacidades similares, revelar debilidades en las salvaguardas o cuestionar supuestos sobre el comportamiento de los modelos. Compartir estas conclusiones permite que otras personas investiguen los mismos problemas, pongan a prueba nuestras explicaciones y mejoren las medidas de mitigación. Como creemos en el valor de la transparencia sobre la desalineación, nuestro nuevo marco favorece la divulgación incluso cuando no está clara la importancia del caso. Esto significa que algunos de los casos que divulguemos podrían resultar aislados, no formar parte de un patrón más amplio ni ser indicios de acontecimientos futuros.

Por el momento, no existe un marco para toda la industria con normas explícitas sobre cómo los desarrolladores de IA deben divulgar ejemplos de desalineación en sus modelos. Esperamos que el marco que presentamos hoy sea un primer paso hacia la creación de esas normas, al establecer qué casos de desalineación deben divulgar los desarrolladores y qué deben contener sus informes. Consideramos que este marco es un trabajo en curso que perfeccionaremos a partir de la experiencia y los comentarios del público.

Aquí describimos cómo funcionará el marco y compartimos los primeros informes que publicamos.

Qué ejemplos de desalineación informaremos

Nuestro objetivo es divulgar ejemplos que aporten evidencia útil sobre cómo surge la desalineación de los modelos, cómo se manifiesta y dónde funcionan o fallan las salvaguardas. Damos prioridad a mecanismos nuevos, cambios significativos en comportamientos conocidos y conclusiones que cuestionen supuestos sobre la seguridad o la mitigación. No es necesario que un ejemplo cause daños ni demuestre un patrón más amplio para que amerite divulgarse. Este marco abarcará los comportamientos que cumplan los requisitos durante todo el ciclo de vida de un modelo, incluidos el entrenamiento, la evaluación, las pruebas y la implementación.

Esto incluye nuevas formas en que los modelos actúen sin autorización, se coordinen con otros modelos o eludan la supervisión; fallas que pongan en duda un método de alineación o una salvaguarda; y comportamientos que cuestionen una afirmación incluida en una evaluación de seguridad publicada. Los mismos criterios de divulgación se aplican a las desalineaciones que puedan afectar a terceros.

Esto también podría incluir casos de desalineación que parezcan duplicar otros que divulgamos anteriormente. La repetición del problema podría ser en sí misma evidencia útil sobre el comportamiento de nuestros modelos o la eficacia de nuestras salvaguardas; por ejemplo, si un tipo específico de comportamiento desalineado continúa repitiéndose a pesar de los reiterados esfuerzos por mitigarlo. En estas circunstancias, publicaremos los ejemplos adicionales mediante una actualización de la divulgación original sobre la desalineación.

Con el tiempo, planeamos desarrollar criterios de divulgación más objetivos junto con otros desarrolladores, investigadores externos, organismos de normalización de la industria y entidades reguladoras. También creemos que los incidentes graves de seguridad, ciberseguridad y desalineación deben comunicarse al gobierno federal de Estados Unidos, y estamos trabajando para proponer mecanismos de notificación. Consideramos que este marco complementa nuestras obligaciones vigentes y señalamos que no sustituye nuestros requisitos legales de divulgación, incluidos los relacionados con incidentes críticos de seguridad o vulneraciones de ciberseguridad.

Los ejemplos de desalineación que compartimos hoy

Para inaugurar nuestro nuevo marco de divulgación de desalineaciones, publicamos seis informes sobre casos de comportamiento desalineado que observamos durante el entrenamiento o la evaluación de nuestros modelos. Estos casos ilustran diversos comportamientos que consideramos importante compartir, desde ocultarle información al usuario hasta realizar acciones no autorizadas para superar obstáculos. Estos informes describen casos individuales y no deben considerarse representativos de la frecuencia con la que ocurre la desalineación en nuestros modelos. Cada elemento a continuación enlaza al informe completo.

  1. Instrucciones autogeneradas en resúmenes de tareas(se abre en una nueva ventana). Un modelo de investigación aún no lanzado insertó instrucciones no relacionadas, incluidas instrucciones para ignorar sus restricciones habituales, en resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. Identificamos 27 resúmenes afectados.

  2. Instrucciones para ocultar errores en resúmenes de tareas(se abre en una nueva ventana). Durante el entrenamiento de GPT‑5.6 Sol, muchas instancias del modelo añadieron instrucciones a sus resúmenes para ocultarle al usuario errores o comportamientos desalineados. Por ejemplo, los resúmenes de compactación incluían instrucciones para inventar datos históricos faltantes sin revelarlo y ocultar discrepancias entre versiones de las fuentes.

  3. Buscar claves de API expuestas en repositorios públicos y luego inventar información(se abre en una nueva ventana). Mientras respondía una pregunta rutinaria sobre cifras de ingresos en un condado de California, un modelo encontró y utilizó sin autorización una clave de API expuesta. Cuando aun así no pudo obtener las cifras solicitadas, las inventó y las presentó como datos de la fuente solicitada.

  4. Subir archivos a internet para citarlos(se abre en una nueva ventana). Cuando un usuario le pidió a un modelo aún no lanzado los identificadores y nombres de lagos con una superficie superior a 5 000 000 de metros cuadrados, el agente encontró la respuesta correcta mediante Python. Sin embargo, como las instrucciones exigían una cita del navegador, el agente decidió subir el archivo para poder citarlo en su respuesta, sin preguntarle al usuario.

  5. Escritura y comunicación no autorizadas mediante un repositorio interno de software(se abre en una nueva ventana). Los modelos utilizaron un repositorio interno de software como tablero de mensajes para intercambiar solicitudes y respuestas entre distintas muestras de entrenamiento mientras buscaban archivos de entrada faltantes, aunque no lograron recuperarlos. Este informe también analiza un caso anterior en el que un modelo logró subir archivos de prueba a un repositorio mientras intentaba eludir restricciones de red.

  6. Intercambio no autorizado de archivos entre agentes colaboradores(se abre en una nueva ventana). Los agentes que colaboraban en la misma tarea de entrenamiento utilizaron sitios web públicos de alojamiento de archivos para compartirlos cuando no podían acceder a los archivos locales de los demás. Esto hizo que los entregables de la tarea estuvieran disponibles en URL públicas, aunque la tarea indicaba que los modelos debían usar únicamente archivos locales.

Cómo funciona nuestro proceso de divulgación

Cualquier persona empleada por OpenAI puede señalar un ejemplo de desalineación para que nuestros equipos de seguridad y alineación lo investiguen y solicitar que se considere su divulgación pública. Esto pone en marcha nuestro proceso de divulgación, que establece plazos para cada etapa a fin de garantizar que la investigación y la divulgación sean oportunas.

Una vez señalado un ejemplo, nuestro personal técnico investigará qué ocurrió, qué aspectos siguen siendo inciertos, si se justifica divulgarlo públicamente y qué hechos pueden compartirse. También evaluará si algún tercero se vio afectado y debe recibir una notificación privada antes de la publicación.

Luego, el ejemplo se asignará a una de tres vías: Listo para divulgación, Investigación menor o Investigación ampliada (“Vía lenta”).

La vía Listo para divulgación abarca los casos que cumplen los requisitos y cuya investigación está lo suficientemente completa como para publicarlos tras una revisión. La vía Investigación menor abarca los casos que requieren más investigación técnica. Esperamos que estas dos vías abarquen la gran mayoría de los casos que divulguemos, en particular aquellos que no requieran una investigación exhaustiva, coordinación con terceros ni gestionar riesgos graves de uso indebido. Todos los casos que publicamos hoy corresponden a una de estas dos vías.

La vía Investigación ampliada abarca investigaciones complejas, especialmente las que involucran a terceros. Cuando un tercero se ve afectado, nuestras obligaciones de seguridad, legales y de divulgación responsable tienen prioridad sobre este marco. Procuraremos publicar un aviso inicial lo antes posible, pero es posible que debamos demorarlo por motivos de seguridad; por ejemplo, si un modelo descubre una vulnerabilidad hasta entonces desconocida en software de uso generalizado. Si un informe permitiera identificar a un tercero, prevemos avisarle con antelación aunque no se haya traspasado ningún límite de seguridad.

El aviso inicial de un caso de Investigación ampliada ofrecerá una descripción general de lo ocurrido, indicará si expertos externos colaboran en la investigación e incluirá cualquier estimación disponible de cuándo prevemos publicar un informe final. El incidente de OpenAI en Hugging Face habría correspondido a esta vía si se hubiera divulgado conforme a este marco.

Se informará al empleado que presentó el ejemplo sobre la decisión de divulgarlo o no y, si se divulga, qué vía seguirá. Los desacuerdos no resueltos sobre la divulgación o la vía adecuada se remitirán al Grupo Asesor de Seguridad (SAG) de OpenAI, un grupo de altos cargos de distintas áreas de la empresa que evalúa las capacidades y salvaguardas de los modelos de vanguardia, supervisa nuestro Marco de preparación y asesora a la dirección de OpenAI. Los desacuerdos dentro del SAG o las objeciones del personal a sus decisiones se elevarán a la dirección de OpenAI. Las decisiones de no divulgar un caso o de que su divulgación no está justificada se comunicarán a los responsables de seguridad y alineación y, en la medida de lo posible, al personal técnico pertinente.

Es posible que revisemos este proceso de divulgación a medida que aprendamos cómo funciona en la práctica, y registraremos cualquier cambio en esta publicación.

Qué incluirá cada informe

Cada informe completo describirá el comportamiento observado, su gravedad y cualquier impacto externo, el entorno en el que ocurrió, la fecha o el intervalo de fechas, cuándo lo descubrimos y, a grandes rasgos, el modelo o los modelos involucrados. Cuando sea posible, también compartiremos:

  • Más detalles sobre lo ocurrido y cualquier daño resultante;

  • Cómo descubrimos la desalineación y el alcance de nuestra investigación;

  • Nuestra interpretación de sus implicaciones para la investigación sobre alineación y la seguridad técnica de la IA;

  • Preguntas importantes sin respuesta que plantea el ejemplo;

  • Medidas que estamos tomando o que planeamos tomar para abordar el comportamiento. Es posible que esta información no siempre esté disponible al momento de la divulgación, ya que podríamos publicar el informe de desalineación antes de completar nuestra investigación o desarrollar una solución.

En el caso de desalineaciones que ocurran en implementaciones de clientes, compartiremos tanta información como permitan la privacidad del cliente y nuestras obligaciones contractuales.

Los informes de hoy constituyen un conjunto inicial de divulgaciones, no una relación exhaustiva de las desalineaciones conocidas ni de las investigaciones en curso. Estos informes iniciales no pretenden representar toda la variedad ni la gravedad de los casos comprendidos en este marco. Nos comprometemos a divulgar los casos de desalineación que cumplan los criterios de este marco, incluidos casos más complejos que requieran una investigación más prolongada o coordinación con terceros. Seguiremos publicando informes de manera continua conforme a este marco y compartiremos más información sobre nuestros compromisos de presentación de informes a medida que sigamos desarrollándolos.

Autor

OpenAI