Pasar al contenido principal
OpenAI

30 de septiembre de 2026

Seguridad

Frenar una campaña coordinada de destilación de modelos

Cargando...

Recientemente identificamos y frenamos una campaña coordinada para extraer razonamiento protegido de nuestros modelos. La primera actividad observada tuvo lugar en la primera semana de julio. Esta actividad es consistente con la destilación adversaria: el uso sistemático y no autorizado de los resultados o el razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. El razonamiento protegido es el registro interno del proceso que sigue el modelo para resolver una tarea; extraerlo puede revelar información que no se incluye en la respuesta final y ayudar a otros a reproducir las capacidades del modelo.

Los operadores no vulneraron nuestro cifrado, no comprometieron ninguna base de datos ni obtuvieron acceso directo a conversaciones almacenadas de los usuarios. En cambio, manipularon las interacciones con los modelos para reproducir razonamiento protegido de forma visible para quien lo solicitaba. Lo hicieron de manera coordinada y a gran escala, en contravención de nuestros términos de servicio. Esta manipulación no es una vulnerabilidad exclusiva de los modelos de OpenAI. Compartimos información al respecto con socios de la industria a través del Frontier Model Forum para fortalecer las defensas colectivas contra la destilación adversaria.

Antes de publicar esta información, investigamos el alcance y el impacto potencial, implementamos nuestras propias medidas de mitigación y compartimos información con investigadores y socios de la industria. También incorporamos sus comentarios para garantizar que existan protecciones contra este tipo de ataque. Las tareas adicionales de mitigación e investigación continúan. Creemos que compartir ahora lo que aprendimos ayudará al ecosistema en general a fortalecer sus defensas.

Lo que observamos

Observamos que los operadores intentaban extraer razonamiento protegido de formas novedosas. Por ejemplo, copiaban razonamiento cifrado de una conversación y le pedían a un modelo en otra conversación que descifrara y transcribiera el contenido del razonamiento oculto.

Investigadores de seguridad independientes⁠(se abre en una nueva ventana) también nos informaron, mediante divulgación responsable, sobre vulnerabilidades relacionadas que afectan las interacciones entre modelos y la compactación de conversaciones. Investigamos sus hallazgos y confirmamos que las vías de ataque que identificaron eran reales. Su trabajo nos ayudó a comprender la categoría más amplia de ataques y a acelerar las medidas de mitigación.

La actividad comenzó el 1 de julio, inicialmente con un volumen bajo, hasta que observamos picos de alto volumen el 24 y el 25 de julio: 16 000 solicitudes1 de más de 4000 usuarios que utilizaban un patrón de extracción relacionado. Una investigación más profunda identificó actividad con patrones de prompts relacionados en un grupo de más de 15 000 usuarios. Para el 28 de julio, habíamos frenado por completo esa actividad.

La actividad evolucionó con el tiempo, lo que refuerza que la destilación adversaria es un desafío de seguridad más amplio que requiere defensas adaptativas en múltiples capas.

Nuestra evaluación de la atribución

No está claro si todos los operadores que observamos durante el período en cuestión respondían a un mismo actor. Sin embargo, atribuimos un núcleo central de la actividad a personas vinculadas con Moonshot AI, la empresa desarrolladora de Kimi.

Por qué es importante

La destilación adversaria plantea riesgos para la seguridad, incluida la seguridad nacional. El razonamiento extraído podría usarse para entrenar otro modelo sin conservar las salvaguardas aplicadas a los resultados que el modelo original muestra a los usuarios. A gran escala, la destilación también puede acelerar la transferencia de capacidades avanzadas sin requerir la misma inversión en seguridad. Estas preocupaciones se intensifican a medida que los modelos adquieren capacidades en ámbitos de doble uso.

Este riesgo no es exclusivo de OpenAI. Como se señaló antes, técnicas similares pueden afectar a otros sistemas avanzados de IA, por lo que este es un desafío de seguridad compartido que requiere coordinación en toda la industria.

Cómo respondimos

Mitigamos esta reciente campaña de destilación mediante una combinación de sanciones a cuentas, controles técnicos y coordinación con socios. Bloqueamos o restringimos cuentas fraudulentas, reforzamos los controles de registro y de infraestructura, y ampliamos el monitoreo de redes relacionadas.

También reforzamos las protecciones del razonamiento oculto entre usuarios, espacios de trabajo, organizaciones y familias de modelos. Cerramos una vía que permitía a quien ya tuviera el razonamiento cifrado de otro usuario volver a introducirlo y recuperar su contenido. Además, agregamos verificaciones para detectar y retener resultados transmitidos en tiempo real que pudieran exponer razonamiento. Cuando la actividad relacionada pasó a través de servicios de terceros, colaboramos con esos proveedores para identificar las cuentas involucradas y frenar su actividad.

Por último, compartimos los hallazgos pertinentes a través del Frontier Model Forum y de los canales gubernamentales correspondientes de intercambio de información, para que otros desarrolladores de modelos de vanguardia y socios del sector público pudieran buscar actividad similar y fortalecer sus propias defensas. Los sistemas que admiten artefactos de razonamiento transferibles o reutilizables pueden enfrentar riesgos relacionados.

Próximos pasos

Prevemos que los intentos de destilación adversaria se vuelvan más sofisticados a medida que mejoren los modelos de vanguardia y que los actores busquen formas más económicas de imitar sus capacidades. La defensa contra esta actividad requiere controles en múltiples capas y una adaptación continua.

Este trabajo aún no termina. Las implementaciones alojadas por socios necesitan las mismas protecciones que los servicios propios, y los ataques a través de los resultados de herramientas requieren protecciones que examinen más que el texto visible habitual. Seguimos mejorando las defensas de las herramientas, la cobertura de los clasificadores y el rechazo de solicitudes por parte de los modelos, además de extender los controles pertinentes a nuestros socios de servicios en la nube.

Nuestra respuesta seguirá centrada en tres áreas: protecciones técnicas más sólidas contra la extracción, una mejor detección y aplicación de medidas contra campañas coordinadas, y un intercambio más profundo de información sobre amenazas entre la industria y el gobierno.

Autor

OpenAI

Notas al pie

  1. 1

    Estas cifras corresponden a intentos de extracción, no necesariamente a extracciones exitosas.