Pasar al contenido principal
OpenAI

El incidente de Hugging Face y otros efectos en terceros causados por modelos desalineados

A medida que los sistemas de IA adquieren más capacidades y autonomía, el comportamiento desalineado puede traducirse en acciones con consecuencias en el mundo real, como incidentes de ciberseguridad y otros resultados que los desarrolladores quizá no hayan previsto. Por lo tanto, comprender cómo surgen y se intensifican estos comportamientos, así como la forma de detectarlos y responder ante ellos, es cada vez más importante para desarrollar e implementar sistemas avanzados de IA de manera segura.

Al principio, consideramos el incidente de Hugging Face principalmente como un problema de seguridad, ya que implicó una vulneración a nivel de plataforma. Hasta la fecha, sigue siendo la actividad más grave de este tipo que hemos identificado en nuestros modelos, y se debió principalmente a un modelo de investigación de uso exclusivamente interno con capacidades muy avanzadas. Desde entonces, comprendimos que esta intrusión se debió a que los modelos recurrieron a estrategias desalineadas para resolver tareas difíciles, como se documenta en el informe técnico de Hugging Face. Los incidentes de ciberseguridad son una manifestación de ese riesgo; la desalineación también puede provocar otros comportamientos inesperados o preocupantes que no pertenecen a las categorías tradicionales de seguridad, como cuando nuestros modelos publican en sitios de terceros, algo que llamamos “spam de agentes”. Y debemos abordar ambos aspectos.

Hemos seguido revisando actividades más amplias, priorizando los incidentes más graves y extendiendo el análisis a actividades desalineadas de menor gravedad, incluido el spam de agentes.

Esta página reúne nuestros informes y novedades sobre el incidente de Hugging Face, investigaciones y presentaciones públicas relacionadas, otras actividades que identificamos, lo que aprendimos sobre el papel de la desalineación de los modelos y las medidas que estamos tomando para reforzar nuestros sistemas. Actualizaremos esta página a medida que avancen nuestras investigaciones.


Actividad que afecta a terceros

Para comprender mejor el alcance de estos comportamientos inesperados, hemos estado realizando una revisión amplia de las actividades de nuestros modelos en Internet durante el entrenamiento y la evaluación. Como parte de nuestra revisión, estamos identificando y notificando a terceros de manera continua, comenzando por los casos en los que:

  • Nuestros modelos podrían haber eludido los controles de seguridad de un tercero o afectado la disponibilidad de un servicio en línea; o

  • Los casos de desalineación afectaron negativamente sitios web o servicios de terceros.

Según nuestra revisión hasta la fecha, hemos notificado a decenas de terceros conforme a los criterios anteriores. Nuestra revisión de actividades anteriores continúa y requerirá mucho tiempo y recursos. Notificaremos a otros terceros a medida que avance este trabajo.

A continuación, publicamos resúmenes anonimizados que describen los tipos de actividad desalineada que observamos. Actualizaremos estas descripciones conforme notifiquemos a otros terceros y mejore nuestra comprensión. Además, compartiremos novedades pertinentes sobre el estado de la revisión. Por lo general, omitiremos nombres y otros datos identificativos cuando sea necesario para proteger a las partes afectadas, aunque quienes reciban información podrán optar por divulgar públicamente lo que les proporcionemos.

Resúmenes de las actividades observadas

Nuestro proceso de revisión y notificación ha identificado hasta la fecha las siguientes categorías de actividad:

  • Elusión de controles de acceso: los agentes acceden a información o funciones que normalmente requieren verificar la identidad, contar con un permiso específico, una suscripción o una cuenta. Por ejemplo, un agente usó otra dirección web, modificó datos de una solicitud o utilizó una sesión iniciada que le otorgaba más acceso del previsto.

  • Uso de credenciales expuestas: los agentes encontraron datos de inicio de sesión o claves de acceso que se habían hecho públicos y los usaron para acceder a un servicio.

  • Inyección de consultas o comandos: los agentes ingresaron texto en un sitio web o servicio que este interpretó como una instrucción, en lugar de una entrada normal. Esto podría hacer que el servicio ejecutara una consulta de base de datos, código de una aplicación o un comando en su servidor.

  • Acceso a componentes internos del entorno de ejecución: los agentes leyeron archivos que contenían la implementación de un servicio o interactuaron con un sistema en segundo plano destinado al uso interno. En estos casos, el agente accedió a partes del servicio que estaban fuera del alcance previsto.

  • Spam de agentes: los agentes publican información en sitios de terceros que puede modificar su contenido y requerir tareas de limpieza; por ejemplo, al usar páginas wiki públicas como foros de mensajes compartidos.


Cronología de los acontecimientos

Septiembre

Agosto

Julio