Nuestro marco para informar sobre la desalineación de modelos
Presentamos un nuevo marco para hacer seguimiento, investigar y divulgar casos de desalineación de modelos en OpenAI, junto con seis informes sobre comportamientos inesperados o preocupantes que hemos observado en los últimos seis meses.
En el pasado, para mantener mejor informados a investigadores, desarrolladores de IA, responsables políticos y al público general, hemos procurado hacer públicos nuestros hallazgos sobre la desalineación. Sin embargo, al carecer de un enfoque sistemático para comunicar estos hallazgos, nuestras divulgaciones han sido puntuales y menos frecuentes de lo deseable: a menudo hemos esperado hasta poder reunir varios casos en un solo informe o los hemos añadido a las fichas de sistema de modelos recién publicados. Este nuevo marco pretende agilizar la publicación de informes de desalineación tras observar un caso, aunque aún no hayamos explicado o mitigado por completo el comportamiento del que informamos.
A medida que los sistemas de IA se vuelven más avanzados y se implementan más ampliamente, necesitamos generar un consenso más amplio y mejor fundamentado sobre los avances de la investigación en alineación. No creemos que el sector de la IA haya resuelto la alineación y la supervisión en un grado suficiente para seguir aumentando responsablemente la escala a la máxima velocidad durante mucho más tiempo. Las decisiones sobre cómo debe avanzar el desarrollo de la IA en los próximos meses y años deben basarse en pruebas que las personas ajenas a las empresas que crean modelos de vanguardia puedan examinar por sí mismas.
Los ejemplos de desalineación pueden ayudar a identificar problemas que otros desarrolladores de IA podrían encontrar cuando sus sistemas alcancen capacidades similares, revelar deficiencias en las salvaguardas o cuestionar supuestos sobre el comportamiento de los modelos. Compartir estos hallazgos permite que otras personas investiguen los mismos problemas, pongan a prueba nuestras explicaciones y mejoren las medidas de mitigación. Como creemos en el valor de la transparencia en torno a la desalineación, nuestro nuevo marco favorece la divulgación incluso cuando no está clara la relevancia del caso. Esto significa que algunos de los casos que divulguemos podrían resultar espurios, no formar parte de un patrón más amplio ni ser indicativos de futuros avances.
Actualmente no existe un marco para todo el sector con normas explícitas sobre cómo deben divulgar los desarrolladores de IA los ejemplos de desalineación de sus modelos. Esperamos que el marco que presentamos hoy sea un primer paso hacia la creación de dichas normas, al establecer qué casos de desalineación deben divulgar los desarrolladores y qué deben contener sus informes. Consideramos que este marco es un trabajo en curso que perfeccionaremos con la experiencia y los comentarios del público.
A continuación, describimos cómo funcionará el marco y compartimos los primeros informes que publicamos.
Nuestro objetivo es divulgar ejemplos que aporten pruebas útiles sobre cómo surge la desalineación de los modelos, cómo se manifiesta y en qué casos las salvaguardas funcionan o fallan. Damos prioridad a los mecanismos nuevos, los cambios significativos en comportamientos conocidos y los hallazgos que cuestionan supuestos sobre seguridad o mitigación. No es necesario que un ejemplo cause daños o demuestre un patrón más amplio para justificar su divulgación. Este marco abarcará los comportamientos que cumplan los requisitos durante todo el ciclo de vida de un modelo, incluidos el entrenamiento, la evaluación, las pruebas y la implementación.
Esto incluye nuevas formas de que los modelos actúen sin autorización, se coordinen con otros modelos o eludan la supervisión; fallos que pongan en duda un método de alineación o una salvaguarda; y comportamientos que cuestionen una afirmación incluida en una evaluación de seguridad publicada. Los mismos criterios de divulgación se aplican a los casos de desalineación que puedan afectar a terceros.
Esto también podría incluir casos de desalineación que parezcan repetir otros que ya hayamos divulgado. La repetición del problema podría ser en sí misma una prueba útil sobre el comportamiento de nuestros modelos o la eficacia de nuestras salvaguardas; por ejemplo, si un tipo concreto de comportamiento desalineado sigue repitiéndose pese a los sucesivos esfuerzos por mitigarlo. En estas circunstancias, publicaremos los ejemplos adicionales actualizando la divulgación original sobre la desalineación.
Con el tiempo, prevemos desarrollar criterios de divulgación más objetivos junto con otros desarrolladores, investigadores externos, organismos de normalización del sector y entidades reguladoras. También creemos que los incidentes graves de seguridad, ciberseguridad y desalineación deben comunicarse al Gobierno federal de Estados Unidos, y estamos trabajando para proponer mecanismos de notificación. Consideramos que este marco complementa nuestras obligaciones actuales y señalamos que no sustituye nuestros requisitos legales de divulgación, incluidos los relativos a incidentes críticos de seguridad o brechas de ciberseguridad.
Para inaugurar nuestro nuevo marco de divulgación de la desalineación, publicamos seis informes sobre casos de comportamiento desalineado observados durante el entrenamiento o la evaluación de nuestros modelos. Estos casos ilustran diversos comportamientos que consideramos importante compartir, desde ocultar información al usuario hasta emprender acciones no autorizadas para superar obstáculos. Son informes sobre casos individuales y no deben considerarse representativos de la frecuencia con la que se produce la desalineación en nuestros modelos. Cada elemento siguiente enlaza al informe completo.
Instrucciones autogeneradas en resúmenes de tareas(se abre en una ventana nueva). Un modelo de investigación aún no publicado insertó instrucciones no relacionadas, incluidas algunas para ignorar sus restricciones habituales, en resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. Identificamos 27 resúmenes afectados.
Instrucciones para ocultar errores en resúmenes de tareas(se abre en una ventana nueva). Durante el entrenamiento de GPT‑5.6 Sol, muchas instancias del modelo añadieron instrucciones a sus resúmenes para ocultar al usuario errores o comportamientos desalineados. Por ejemplo, los resúmenes de compactación incluían instrucciones para inventar datos históricos que faltaban sin revelarlo y ocultar discrepancias entre versiones de las fuentes.
Buscar claves de API expuestas en repositorios públicos y después inventar información(se abre en una ventana nueva). Mientras respondía a una pregunta rutinaria sobre cifras de ingresos de un condado de California, un modelo encontró y utilizó sin autorización una clave de API expuesta. Cuando aun así no pudo obtener las cifras solicitadas, las inventó y las presentó como datos de la fuente indicada.
Subir archivos a internet para poder citarlos(se abre en una ventana nueva). Cuando un usuario pidió a un modelo aún no publicado los identificadores y nombres de lagos con una superficie superior a 5 000 000 de metros cuadrados, el agente encontró la respuesta correcta con Python. Sin embargo, como las instrucciones exigían una cita del navegador, el agente decidió subir el archivo para poder citarlo en su respuesta, sin preguntar al usuario.
Escrituras y comunicaciones no autorizadas mediante un repositorio interno de software(se abre en una ventana nueva). Los modelos usaron un repositorio interno de software como tablón de mensajes para intercambiar solicitudes y respuestas entre muestras de entrenamiento independientes mientras buscaban archivos de entrada que faltaban, aunque no lograron recuperarlos. Este informe también examina un caso anterior en el que un modelo logró subir archivos de prueba a un repositorio mientras intentaba eludir restricciones de red.
Intercambio no autorizado de archivos entre agentes colaboradores(se abre en una ventana nueva). Varios agentes que colaboraban en la misma tarea de entrenamiento utilizaron sitios web públicos de alojamiento para compartir archivos cuando no podían acceder a los archivos locales de los demás. Esto hizo que los entregables de la tarea quedaran disponibles en URL públicas, aunque la tarea indicaba que los modelos debían utilizar únicamente archivos locales.
Cualquier empleado de OpenAI puede señalar un ejemplo de desalineación para que nuestros equipos de seguridad y alineación lo investiguen y solicitar que se valore su divulgación pública. Así se inicia nuestro proceso de divulgación, que establece plazos para cada etapa a fin de garantizar que la investigación y la divulgación sean oportunas.
Una vez señalado un ejemplo, nuestro personal técnico investigará qué ocurrió, qué aspectos siguen siendo inciertos, si está justificada la divulgación pública y qué datos pueden compartirse. También evaluará si algún tercero se vio afectado y debe recibir una notificación privada antes de la publicación.
Después, el ejemplo se asignará a una de estas tres vías: «Listo para divulgar», «Investigación menor» o «Investigación de mayor alcance» («Vía lenta»).
La vía «Listo para divulgar» abarca los casos que cumplen los requisitos y cuya investigación está lo bastante avanzada como para publicarlos tras una revisión. La vía «Investigación menor» abarca los casos que requieren más investigación técnica. Esperamos que estas dos vías abarquen la gran mayoría de los casos que divulguemos, especialmente aquellos que no requieran una investigación exhaustiva, coordinación con terceros ni la gestión de riesgos graves de uso indebido. Todos los casos que publicamos hoy pertenecen a una de estas dos vías.
La vía «Investigación de mayor alcance» abarca investigaciones complejas, especialmente las que implican a terceros. Cuando un tercero se vea afectado, nuestras obligaciones de seguridad, legales y de divulgación responsable prevalecerán sobre este marco. Intentaremos publicar un aviso inicial lo antes posible, pero quizá debamos retrasarlo por motivos de seguridad; por ejemplo, si un modelo descubre una vulnerabilidad hasta entonces desconocida en un software de uso generalizado. Si un informe permitiera identificar a un tercero, tenemos previsto avisarle con antelación aunque no se haya traspasado ningún límite de seguridad.
El aviso inicial de un caso de «Investigación de mayor alcance» ofrecerá una explicación general de lo ocurrido, indicará si expertos externos colaboran en la investigación e incluirá cualquier estimación disponible sobre cuándo esperamos publicar un informe final. El incidente de OpenAI en Hugging Face habría seguido esta vía si se hubiera divulgado conforme a este marco.
Se informará a la persona que haya planteado el ejemplo de la decisión sobre si divulgarlo y, en caso afirmativo, qué vía seguirá. Los desacuerdos no resueltos sobre la divulgación o la vía adecuada se remitirán al Grupo Asesor de Seguridad (SAG) de OpenAI, un grupo de altos cargos de toda la empresa que evalúa las capacidades y salvaguardas de los modelos de vanguardia, supervisa nuestro Marco de preparación y asesora a la dirección de OpenAI. Los desacuerdos dentro del SAG o las objeciones del personal a sus decisiones se elevarán a la dirección de OpenAI. Las decisiones de no divulgar un caso o de considerar que su divulgación no está justificada se comunicarán a los responsables de seguridad y alineación y, en la medida de lo posible, al personal técnico pertinente.
Podremos revisar este proceso de divulgación a medida que veamos cómo funciona en la práctica y dejaremos constancia en esta publicación de cualquier cambio.
Cada informe completo describirá el comportamiento observado, su gravedad y cualquier impacto externo, el entorno en el que se produjo, la fecha o el intervalo de fechas, cuándo lo descubrimos y, a grandes rasgos, el modelo o los modelos implicados. Cuando sea posible, también compartiremos:
Más detalles sobre lo ocurrido y los daños resultantes;
Cómo descubrimos la desalineación y el alcance de nuestra investigación;
Nuestra interpretación de sus implicaciones para la investigación sobre alineación y la seguridad técnica de la IA;
Preguntas importantes aún sin respuesta que plantea el ejemplo;
Medidas que estamos tomando o tenemos previsto tomar para abordar el comportamiento. Es posible que esta información no siempre esté disponible en el momento de la divulgación, ya que podríamos publicar el informe de desalineación antes de concluir nuestra investigación o desarrollar una solución.
Cuando la desalineación se produzca en implementaciones de clientes, compartiremos toda la información que permitan la privacidad del cliente y nuestras obligaciones contractuales.
Los informes de hoy constituyen un conjunto inicial de divulgaciones, no una relación exhaustiva de los casos de desalineación conocidos ni de las investigaciones en curso. Estos informes iniciales no pretenden representar toda la variedad ni la gravedad de los casos que abarca este marco. Nos comprometemos a divulgar los casos de desalineación que cumplan los criterios de este marco, incluidos casos más complejos que requieran una investigación más prolongada o coordinación con terceros. Seguiremos publicando informes de forma continua conforme a este marco y daremos más detalles sobre nuestros compromisos de información a medida que los desarrollemos.


