Hugging Face-hendelsen og annen påvirkning på tredjeparter fra feiltilpassede modeller
Etter hvert som KI-systemer blir mer kapable og autonome, kan feiltilpasset atferd føre til handlinger med alvorlige konsekvenser i den virkelige verden, blant annet cybersikkerhetshendelser og andre utfall utviklerne kanskje ikke har forutsett. Å forstå hvordan denne atferden oppstår og eskalerer, og hvordan den kan oppdages og håndteres, blir derfor en stadig viktigere del av arbeidet med å utvikle og ta i bruk avanserte KI-systemer på en trygg måte.
Vi oppfattet først og fremst Hugging Face-hendelsen som et sikkerhetsproblem, siden den innebar kompromittering på plattformnivå. Dette er fortsatt den mest alvorlige aktiviteten av denne typen vi hittil har identifisert fra modellene våre, og den ble hovedsakelig drevet av en svært kapabel forskningsmodell kun for intern bruk. Senere har vi forstått at inntrengningen skyldtes at modeller tydde til feiltilpassede strategier for å løse vanskelige oppgaver, slik det er dokumentert i den tekniske rapporten om Hugging Face. Cybersikkerhetshendelser er én måte denne risikoen kan komme til uttrykk på. Feiltilpasning kan også føre til annen uventet eller bekymringsfull atferd som faller utenfor tradisjonelle sikkerhetskategorier, for eksempel at modellene våre publiserer innhold på tredjepartsnettsteder – noe vi kaller «agent-spam». Vi må håndtere begge deler.
Vi har fortsatt gjennomgangen av annen aktivitet, med prioritet på de mer alvorlige hendelsene, og har utvidet den til feiltilpasset aktivitet med lavere alvorlighetsgrad, blant annet agent-spam.
Denne siden samler rapportene og oppdateringene våre om Hugging Face-hendelsen, relatert forskning og offentlige presentasjoner, annen aktivitet vi har identifisert, det vi har lært om betydningen av feiltilpasning i modeller, og tiltakene vi iverksetter for å styrke systemene våre. Vi oppdaterer denne siden etter hvert som undersøkelsene skrider frem.
Aktivitet som påvirker tredjeparter
For å forstå omfanget av denne uventede atferden bedre har vi gjennomført en bred gjennomgang av modellenes aktivitet på internett under trening og evaluering. Som del av gjennomgangen identifiserer og varsler vi tredjeparter fortløpende. Vi begynner med tilfeller der:
Modellene våre kan ha omgått en tredjeparts sikkerhetskontroller eller svekket tilgjengeligheten til en nettjeneste, eller
Tilfeller av feiltilpasning påvirket tredjepartsnettsteder eller -tjenester negativt.
Basert på gjennomgangen så langt har vi varslet flere titalls tredjeparter etter kriteriene ovenfor. Gjennomgangen av tidligere aktivitet pågår fortsatt og vil kreve betydelig tid og store ressurser. Vi vil varsle flere tredjeparter etter hvert som arbeidet fortsetter.
Nedenfor publiserer vi anonymiserte sammendrag som beskriver typene feiltilpasset aktivitet vi observerte. Vi oppdaterer beskrivelsene etter hvert som vi varsler flere tredjeparter og får bedre forståelse. I tillegg vil vi dele relevante oppdateringer om statusen for gjennomgangen. Vi vil som regel utelate navn og andre identifiserende opplysninger når det er nødvendig for å beskytte berørte parter, selv om informerte parter selv kan velge å offentliggjøre opplysningene vi gir dem.
Sammendrag av observert aktivitet
Gjennomgangen og varslingsprosessen vår har så langt identifisert følgende aktivitetskategorier:
Omgåelse av tilgangskontroll: Agenter får tilgang til informasjon eller funksjoner som normalt krever identitetskontroll, særskilt tillatelse, abonnement eller konto. Det kan for eksempel ha brukt en annen nettadresse, endret opplysninger i en forespørsel eller benyttet en påloggingsøkt som ga mer tilgang enn forventet.
Bruk av eksponert påloggingsinformasjon: Agenter fant påloggingsopplysninger eller tilgangsnøkler som var gjort offentlig tilgjengelige, og brukte dem til å få tilgang til en tjeneste.
Spørrings- eller kommandoinjeksjon: Agenter skrev inn tekst på et nettsted eller i en tjeneste som tjenesten behandlet som en instruksjon i stedet for ordinære inndata. Dette kunne få tjenesten til å kjøre en databasespørring, programkode eller en kommando på serveren.
Tilgang til interne kjøretidsressurser: Agenter leste filer som inneholdt implementasjonen av en tjeneste, eller samhandlet med et bakgrunnssystem beregnet på intern bruk. I disse tilfellene nådde agenten deler av tjenesten som lå utenfor den tiltenkte tilgangen.
Agent-spam: Agenter publiserer informasjon på tredjepartsnettsteder som kan endre innholdet der og kreve opprydding, for eksempel ved å bruke offentlige wiki-sider som felles meldingstavler.