Salta al contingut principal
OpenAI

L'incident de Hugging Face i altres repercussions en tercers causades per models desalineats

A mesura que els sistemes d'IA adquireixen més capacitats i autonomia, els comportaments desalineats poden traduir-se en accions amb conseqüències en el món real, com ara incidents de ciberseguretat i altres resultats que els desenvolupadors potser no havien previst. Per tant, entendre com sorgeixen i s'intensifiquen aquests comportaments, i saber com es poden detectar i com s'hi pot respondre, és una part cada cop més important del desenvolupament i el desplegament segurs de sistemes avançats d'IA.

Al principi, vam interpretar l'incident de Hugging Face principalment com un problema de seguretat, ja que comportava la vulneració d'una plataforma. Continua sent l'activitat d'aquest tipus més greu que hem identificat fins ara en els nostres models, i va estar motivada principalment per un model de recerca molt capaç i exclusivament intern. Des d'aleshores, hem entès que aquesta intrusió es va produir perquè els models van recórrer a estratègies desalineades per resoldre tasques difícils, tal com documenta l'informe tècnic de Hugging Face. Els incidents de ciberseguretat són una manifestació d'aquest risc; el desalineament també pot provocar altres comportaments inesperats o preocupants fora de les categories de seguretat tradicionals, com ara que els nostres models publiquin en llocs de tercers, una pràctica que anomenem "correu brossa d'agents". I hem d'abordar totes dues coses.

Hem continuat revisant activitats més àmplies, prioritzant els incidents més greus i ampliant la revisió a activitats desalineades de menys gravetat, incloent-hi el correu brossa d'agents.

Aquesta pàgina aplega els nostres informes i actualitzacions sobre l'incident de Hugging Face, la recerca i les presentacions públiques relacionades, altres activitats que hem identificat, el que hem après sobre el paper del desalineament dels models i les mesures que adoptem per reforçar els nostres sistemes. Actualitzarem aquesta pàgina a mesura que avancin les investigacions.


Activitat que afecta tercers

Per entendre millor l'abast d'aquests comportaments inesperats, estem duent a terme una revisió àmplia de les activitats dels nostres models a Internet durant l'entrenament i l'avaluació. Com a part de la revisió, identifiquem i notifiquem els tercers de manera progressiva, començant pels casos en què:

  • Els nostres models podrien haver eludit els controls de seguretat d'un tercer o haver perjudicat la disponibilitat d'un servei en línia, o bé

  • Els casos de desalineament van afectar negativament llocs web o serveis de tercers.

D'acord amb la revisió feta fins ara, hem enviat notificacions a desenes de tercers aplicant els criteris anteriors. La revisió de les activitats passades continua en curs i requerirà molt de temps i recursos. A mesura que aquesta feina avanci, enviarem notificacions a més tercers.

A continuació publiquem resums anonimitzats per descriure els tipus d'activitat desalineada que hem observat. Actualitzarem aquestes descripcions a mesura que ho notifiquem a més tercers i la nostra comprensió evolucioni. A més, compartirem les novetats pertinents sobre l'estat de la revisió. En general, ometrem noms i altres dades identificatives quan calgui per protegir les parts afectades, tot i que les parts informades poden decidir compartir públicament la informació que els proporcionem.

Resums de les activitats observades

Fins ara, el nostre procés de revisió i notificació ha identificat les categories d'activitat següents:

  • Elusió del control d'accés: els agents accedeixen a informació o funcions que normalment requereixen una comprovació d'identitat, un permís específic, una subscripció o un compte. Per exemple, si un agent va utilitzar una altra adreça web, va modificar dades d'una sol·licitud o va aprofitar una sessió iniciada que li donava més accés del previst.

  • Ús de credencials exposades: si els agents van trobar dades d'inici de sessió o claus d'accés que s'havien fet públiques i les van utilitzar per accedir a un servei.

  • Injecció de consultes o ordres: si els agents van introduir text en un lloc web o servei que aquest va interpretar com una instrucció, en comptes d'una entrada ordinària. Això podia fer que el servei executés una consulta de base de dades, codi d'aplicació o una ordre al seu servidor.

  • Accés als components interns de l'entorn d'execució: si els agents van llegir fitxers que contenien la implementació d'un servei o van interaccionar amb un sistema en segon pla destinat a ús intern. En aquests casos, l'agent va accedir a parts del servei que quedaven fora de l'accés previst.

  • Correu brossa d'agents: si els agents publiquen informació en llocs de tercers que pot alterar-ne el contingut i requerir tasques de neteja, com ara utilitzar pàgines wiki públiques com a taulers de missatges compartits.


Cronologia dels esdeveniments

Setembre

Agost

Juliol