Frenar una campaña coordinada de destilación de modelos
Recientemente identificamos y frenamos una campaña coordinada para extraer razonamiento protegido de nuestros modelos, cuya primera actividad observamos en la primera semana de julio. Esta actividad encaja con la destilación adversaria: el uso sistemático y no autorizado de las respuestas o el razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. El razonamiento protegido es el registro interno del modelo sobre cómo aborda una tarea; extraerlo puede revelar información que no se muestra en la respuesta final y ayudar a otros a reproducir las capacidades del modelo.
Los operadores no vulneraron nuestro cifrado, no comprometieron ninguna base de datos ni accedieron directamente a las conversaciones almacenadas de los usuarios. En su lugar, manipularon las interacciones con los modelos para reproducir el razonamiento protegido de forma visible para quien realizaba la solicitud, de manera coordinada y a gran escala, en contra de nuestros términos del servicio. Esta manipulación no se debe a una vulnerabilidad exclusiva de los modelos de OpenAI. Hemos compartido información al respecto con socios del sector a través del Frontier Model Forum para reforzar las defensas colectivas frente a la destilación adversaria.
Antes de publicar esta información, investigamos el alcance y el posible impacto, desplegamos nuestras propias medidas de mitigación y compartimos información con investigadores y socios del sector, cuyas aportaciones incorporamos para garantizar la existencia de protecciones frente a este tipo de ataque. Las labores de mitigación e investigación continúan. Creemos que compartir ahora lo que hemos aprendido ayudará al conjunto del ecosistema a reforzar sus defensas.
Observamos intentos de extraer razonamiento protegido con métodos novedosos, entre ellos copiar el razonamiento cifrado de una conversación y pedir a un modelo en otra conversación que descifrara y transcribiera el contenido del razonamiento oculto.
Investigadores de seguridad independientes(se abre en una ventana nueva) también nos alertaron, mediante divulgación responsable, de vulnerabilidades relacionadas que afectaban a las interacciones entre modelos y a la compactación de conversaciones. Investigamos sus hallazgos y confirmamos que las vías de ataque que habían identificado eran reales. Su trabajo nos ayudó a comprender esta categoría de ataques en su conjunto y a acelerar las medidas de mitigación.
La actividad comenzó el 1 de julio, con un volumen inicialmente bajo, hasta que observamos picos de gran volumen los días 24 y 25 de julio: 16 000 solicitudes1 de más de 4000 usuarios que empleaban un patrón de extracción relevante. Al profundizar en la investigación, identificamos actividad con patrones de prompts relacionados en un grupo de más de 15 000 usuarios. El 28 de julio ya habíamos frenado por completo esta actividad.
La actividad evolucionó con el tiempo, lo que refuerza la idea de que la destilación adversaria es un reto de seguridad más amplio que exige defensas adaptativas y en varias capas.
No está claro si todos los operadores que observamos durante el periodo analizado procedían de un único actor. Sin embargo, atribuimos un núcleo de la actividad a personas vinculadas a Moonshot AI, la empresa desarrolladora de Kimi.
La destilación adversaria plantea riesgos para la seguridad, incluida la seguridad nacional. El razonamiento extraído podría utilizarse para entrenar otro modelo sin conservar las salvaguardas aplicadas a las respuestas que el modelo original muestra a los usuarios. A gran escala, la destilación también puede acelerar la transferencia de capacidades avanzadas sin exigir la misma inversión en seguridad. Estas preocupaciones se acentúan a medida que los modelos adquieren capacidades en ámbitos de doble uso.
Este riesgo no es exclusivo de OpenAI. Como se ha señalado, técnicas similares pueden afectar a otros sistemas avanzados de IA, por lo que se trata de un reto de seguridad compartido que exige coordinación en todo el sector.
Mitigamos esta reciente campaña de destilación mediante una combinación de medidas contra cuentas infractoras, controles técnicos y coordinación con nuestros socios. Bloqueamos o restringimos las cuentas fraudulentas, reforzamos los controles de registro y de infraestructura, y ampliamos la supervisión de las redes relacionadas.
También reforzamos las protecciones del razonamiento oculto en todos los usuarios, espacios de trabajo, organizaciones y familias de modelos. Cerramos una vía que permitía a alguien que ya tuviera el razonamiento cifrado de otro usuario volver a enviarlo y recuperar su contenido, y añadimos comprobaciones para detectar y retener las respuestas en streaming que pudieran revelar razonamiento. Cuando la actividad relacionada pasó a realizarse a través de servicios de terceros, colaboramos con esos proveedores para identificar las cuentas implicadas e interrumpir su actividad.
Por último, compartimos los hallazgos relevantes a través del Frontier Model Forum y de los canales gubernamentales de intercambio de información pertinentes, para que otros desarrolladores de modelos de vanguardia y socios del sector público pudieran buscar actividad similar y reforzar sus propias defensas. Los sistemas que admiten artefactos de razonamiento portables o que pueden volver a enviarse podrían afrontar riesgos relacionados.
Prevemos que los intentos de destilación adversaria serán más sofisticados a medida que mejoren los modelos de vanguardia y los actores busquen formas más baratas de imitar sus capacidades. Defenderse de esta actividad exige controles en varias capas y una adaptación continua.
Este trabajo aún no ha terminado. Los despliegues alojados por socios necesitan las mismas protecciones que los servicios propios, y los ataques a través de las salidas de herramientas exigen protecciones que analicen algo más que el texto visible convencional. Seguimos mejorando las defensas de las herramientas, la cobertura de los clasificadores y el rechazo de solicitudes por parte de los modelos, además de extender los controles pertinentes a nuestros socios de servicios en la nube.
Nuestra respuesta seguirá centrándose en tres áreas: protecciones técnicas más sólidas frente a la extracción, mejores medidas de detección y actuación contra campañas coordinadas, y un mayor intercambio de información sobre amenazas entre el sector y los gobiernos.

