Hugging Face-hændelsen og andre konsekvenser for tredjeparter af modeller med mangelfuld tilpasning
Efterhånden som AI-systemer bliver mere avancerede og selvstændige, kan adfærd, der ikke er i overensstemmelse med hensigten, føre til alvorlige handlinger i den virkelige verden, herunder cybersikkerhedshændelser og andre konsekvenser, som udviklerne måske ikke havde forudset. Det bliver derfor stadig vigtigere for sikker udvikling og ibrugtagning af avancerede AI-systemer at forstå, hvordan denne adfærd opstår og eskalerer, og hvordan den kan opdages og håndteres.
I første omgang opfattede vi primært Hugging Face-hændelsen som et sikkerhedsproblem, fordi den omfattede kompromittering på platformsniveau. Det er fortsat den alvorligste aktivitet af denne type, som vi til dato har identificeret fra vores modeller, og den var primært drevet af en særdeles avanceret forskningsmodel, der kun var til intern brug. Vi har siden konstateret, at indtrængningen skyldtes, at modellerne greb til strategier, som ikke var i overensstemmelse med hensigten, for at løse vanskelige opgaver, sådan som det er dokumenteret i den tekniske rapport om Hugging Face. Cybersikkerhedshændelser er ét udtryk for denne risiko. Manglende tilpasning kan også føre til anden uventet eller bekymrende adfærd, der falder uden for traditionelle sikkerhedskategorier, såsom at vores modeller slår indhold op på tredjepartswebsteder – noget, vi kalder »agentspam«. Vi er nødt til at håndtere begge dele.
Vi har fortsat gennemgangen af den bredere aktivitet med prioritering af de alvorligste hændelser og har udvidet den til mindre alvorlig adfærd, der ikke er i overensstemmelse med hensigten, herunder agentspam.
Denne side samler vores rapporter og opdateringer om Hugging Face-hændelsen, relateret forskning og offentlige præsentationer, yderligere aktivitet, vi har identificeret, vores erfaringer med betydningen af manglende modeltilpasning samt de tiltag, vi iværksætter for at styrke vores systemer. Vi opdaterer siden, efterhånden som vores undersøgelser skrider frem.
Aktivitet med konsekvenser for tredjeparter
For bedre at forstå omfanget af denne uventede adfærd har vi iværksat en bred gennemgang af vores modellers aktiviteter på internettet under træning og evaluering. Som led i gennemgangen identificerer og underretter vi løbende tredjeparter. Vi begynder med tilfælde, hvor:
Vores modeller kan have omgået en tredjeparts sikkerhedskontroller eller forringet tilgængeligheden af en onlinetjeneste, eller
Tilfælde af manglende tilpasning har haft negative konsekvenser for tredjepartswebsteder eller -tjenester.
På baggrund af vores hidtidige gennemgang har vi underrettet snesevis af tredjeparter efter ovenstående kriterier. Vores gennemgang af tidligere aktivitet fortsætter og vil kræve betydelig tid og mange ressourcer. Vi underretter yderligere tredjeparter, efterhånden som arbejdet skrider frem.
Nedenfor offentliggør vi anonymiserede resuméer, som beskriver de typer aktivitet med manglende tilpasning, vi har observeret. Vi opdaterer beskrivelserne, efterhånden som vi underretter flere tredjeparter og får en bedre forståelse. Vi vil desuden dele relevante opdateringer om gennemgangens status. Vi udelader som udgangspunkt navne og andre identificerende oplysninger, når det er nødvendigt for at beskytte berørte parter. Underrettede parter kan dog vælge at offentliggøre de oplysninger, vi giver dem.
Resuméer af den observerede aktivitet
Vores hidtidige gennemgang og underretningsproces har identificeret følgende aktivitetskategorier:
Omgåelse af adgangskontrol: Agenter får adgang til oplysninger eller funktioner, der normalt kræver identitetskontrol, specifik tilladelse, abonnement eller en konto. En agent kan eksempelvis have brugt en anden webadresse, ændret oplysninger i en anmodning eller benyttet en login-session, der gav større adgang end forventet.
Brug af eksponerede loginoplysninger: Agenter fandt loginoplysninger eller adgangsnøgler, som var blevet gjort offentligt tilgængelige, og brugte dem til at tilgå en tjeneste.
Injektion af forespørgsler eller kommandoer: Agenter indtastede tekst på et websted eller i en tjeneste, som tjenesten behandlede som en instruktion frem for almindeligt input. Det kunne få tjenesten til at køre en databaseforespørgsel, programkode eller en kommando på sin server.
Adgang til interne dele af kørselsmiljøet: Agenter læste filer med en tjenestes implementering eller interagerede med et baggrundssystem, der var beregnet til intern brug. I disse tilfælde fik agenten adgang til dele af tjenesten, som lå uden for den tilsigtede adgang.
Agentspam: Agenter slår oplysninger op på tredjepartswebsteder, som kan ændre oplysningerne på disse websteder og kræve oprydning, eksempelvis ved at bruge offentlige wikisider som fælles opslagstavler.