Ir al contenido principal
OpenAI

El incidente de Hugging Face y otros efectos de modelos no alineados en terceros

A medida que los sistemas de IA adquieren más capacidades y autonomía, los comportamientos no alineados pueden traducirse en acciones con consecuencias en el mundo real, incluidos incidentes de ciberseguridad y otros resultados que los desarrolladores quizá no hayan previsto. Por tanto, entender cómo surgen estos comportamientos, cómo se intensifican y cómo detectarlos y responder a ellos es una parte cada vez más importante del desarrollo e implementación seguros de sistemas avanzados de IA.

Al principio entendimos el incidente de Hugging Face principalmente como un problema de seguridad, ya que implicaba una vulneración de la plataforma. Sigue siendo la actividad de este tipo más grave que hemos identificado hasta la fecha en nuestros modelos y estuvo impulsada principalmente por un modelo de investigación de gran capacidad y uso exclusivamente interno. Desde entonces, hemos comprendido que esta intrusión se debió a que los modelos recurrieron a estrategias no alineadas para resolver tareas difíciles, como se documenta en el informe técnico de Hugging Face. Los incidentes de ciberseguridad son una manifestación de ese riesgo; la falta de alineación también puede provocar otros comportamientos inesperados o preocupantes que quedan fuera de las categorías de seguridad tradicionales, como que nuestros modelos publiquen en sitios de terceros, algo que denominamos «spam de agentes». Y debemos abordar ambos.

Hemos seguido revisando una gama más amplia de actividades, dando prioridad a los incidentes más graves y ampliando el análisis a actividades no alineadas de menor gravedad, incluido el spam de agentes.

Esta página reúne nuestros informes y novedades sobre el incidente de Hugging Face, investigaciones y presentaciones públicas relacionadas, otras actividades que hemos identificado, lo que hemos aprendido sobre el papel de la falta de alineación de los modelos y las medidas que estamos tomando para reforzar nuestros sistemas. Actualizaremos esta página a medida que avancen nuestras investigaciones.


Actividad que afecta a terceros

Para comprender mejor el alcance de estos comportamientos inesperados, estamos llevando a cabo una revisión exhaustiva de las actividades de nuestros modelos en internet durante el entrenamiento y la evaluación. Como parte de nuestra revisión, estamos identificando y avisando progresivamente a terceros, empezando por los casos en los que:

  • nuestros modelos podrían haber eludido los controles de seguridad de un tercero o haber perjudicado la disponibilidad de un servicio en línea; o

  • la falta de alineación afectó negativamente a sitios web o servicios de terceros.

Según nuestra revisión hasta la fecha, hemos avisado a decenas de terceros aplicando los criterios anteriores. Nuestra revisión de actividades pasadas sigue en curso y requerirá mucho tiempo y recursos. Avisaremos a más terceros a medida que avance este trabajo.

A continuación, publicamos resúmenes anonimizados para describir los tipos de actividad no alineada que observamos. Actualizaremos estas descripciones conforme avisemos a más terceros y mejore nuestra comprensión. Además, compartiremos novedades relevantes sobre el estado de la revisión. Por lo general, omitiremos nombres y otros datos identificativos cuando sea necesario para proteger a las partes afectadas, aunque estas podrán decidir hacer pública la información que les proporcionemos.

Resúmenes de las actividades observadas

Nuestro proceso de revisión y notificación ha identificado hasta la fecha las siguientes categorías de actividad:

  • Elusión del control de acceso: los agentes acceden a información o funciones que normalmente requieren verificar la identidad, un permiso específico, una suscripción o una cuenta. Por ejemplo, un agente utilizó otra dirección web, modificó los detalles de una solicitud o aprovechó una sesión iniciada que le daba más acceso del esperado.

  • Uso de credenciales expuestas: los agentes encontraron datos de inicio de sesión o claves de acceso que se habían hecho públicos y los utilizaron para acceder a un servicio.

  • Inyección de consultas o comandos: los agentes introdujeron texto en un sitio web o servicio que este interpretó como una instrucción y no como una entrada normal. Esto podía hacer que el servicio ejecutara una consulta de base de datos, código de aplicación o un comando en su servidor.

  • Acceso a componentes internos del entorno de ejecución: los agentes leyeron archivos que contenían la implementación de un servicio o interactuaron con un sistema en segundo plano destinado a uso interno. En estos casos, el agente accedió a partes del servicio que quedaban fuera del acceso previsto.

  • Spam de agentes: los agentes publican información en sitios de terceros que puede modificar su contenido y exigir tareas de limpieza, por ejemplo, al utilizar páginas wiki públicas como foros de mensajes.


Cronología de los acontecimientos

Septiembre

Agosto

Julio