Hugging Face-incidenten och annan påverkan på tredje part från felriktade modeller
När AI-system blir mer kapabla och autonoma kan felriktade beteenden leda till betydande konsekvenser i verkligheten, däribland cybersäkerhetsincidenter och andra utfall som utvecklarna kanske inte har förutsett. Att förstå hur dessa beteenden uppstår, hur de eskalerar samt hur de kan upptäckas och hanteras blir därför en allt viktigare del av att utveckla och driftsätta avancerade AI-system på ett säkert sätt.
Till en början såg vi Hugging Face-incidenten främst som ett säkerhetsproblem, eftersom den innebar att en hel plattform komprometterades. Det är fortfarande den allvarligaste aktivitet av detta slag som vi hittills har identifierat från våra modeller, och den drevs främst av en mycket kapabel intern forskningsmodell. Vi har sedan dess förstått att intrånget drevs av modeller som tog till felriktade strategier för att lösa svåra uppgifter, vilket dokumenteras i den tekniska rapporten om Hugging Face. Cybersäkerhetsincidenter är ett uttryck för den risken. Felriktning kan också leda till andra oväntade eller oroande beteenden som faller utanför traditionella säkerhetskategorier, exempelvis att våra modeller publicerar innehåll på tredje parts webbplatser – något vi kallar ”agentskräppost”. Vi måste hantera båda delarna.
Vi har fortsatt att granska verksamheten i stort, med de allvarligare incidenterna som högsta prioritet, och utökat granskningen till mindre allvarliga felriktade aktiviteter, däribland agentskräppost.
På den här sidan samlar vi våra rapporter och uppdateringar om Hugging Face-incidenten, relaterad forskning och offentliga presentationer, ytterligare aktiviteter som vi har identifierat, våra lärdomar om modellfelriktningens betydelse samt de åtgärder vi vidtar för att stärka våra system. Vi uppdaterar sidan i takt med att våra utredningar fortskrider.
Aktiviteter som påverkar tredje part
För att bättre förstå omfattningen av dessa oväntade beteenden genomför vi en bred granskning av våra modellers aktiviteter på internet under träning och utvärdering. Som en del av granskningen identifierar och underrättar vi löpande tredje parter, med början i fall där:
Våra modeller kan ha kringgått en tredje parts säkerhetskontroller eller försämrat tillgängligheten till en onlinetjänst, eller
Fall av felriktning påverkade tredje parts webbplatser eller tjänster negativt.
Utifrån vår granskning hittills har vi underrättat ett flertal tredje parter enligt kriterierna ovan. Vår granskning av tidigare aktiviteter pågår och kommer att kräva betydande tid och resurser. Vi kommer att underrätta fler tredje parter under arbetets gång.
Nedan publicerar vi anonymiserade sammanfattningar som beskriver de typer av felriktade aktiviteter vi observerade. Vi uppdaterar beskrivningarna när vi underrättar fler tredje parter och vår förståelse utvecklas. Vi kommer dessutom att dela relevanta uppdateringar om granskningens status. Vi utelämnar i allmänhet namn och andra identifierande uppgifter när det behövs för att skydda berörda parter, men underrättade parter kan själva välja att offentliggöra den information vi ger dem.
Sammanfattningar av observerade aktiviteter
Vår granskning och underrättelseprocess har hittills identifierat följande aktivitetskategorier:
Kringgående av åtkomstkontroller: Agenter får tillgång till information eller funktioner som normalt kräver identitetskontroll, särskild behörighet, abonnemang eller konto. En agent kan exempelvis använda en annan webbadress, ändra uppgifter i ett anrop eller använda en inloggningssession som ger större åtkomst än väntat.
Användning av exponerade inloggningsuppgifter: Agenter hittade inloggningsuppgifter eller åtkomstnycklar som hade offentliggjorts och använde dem för att få åtkomst till en tjänst.
Injektion av frågor eller kommandon: Agenter skrev in text på en webbplats eller i en tjänst som tjänsten behandlade som en instruktion i stället för vanlig indata. Det kunde få tjänsten att köra en databasfråga, programkod eller ett kommando på sin server.
Åtkomst till interna delar av körmiljön: Agenter läste filer med en tjänsts implementation eller interagerade med ett bakomliggande system avsett för internt bruk. I dessa fall nådde agenten delar av tjänsten som låg utanför den avsedda åtkomsten.
Agentskräppost: Agenter publicerar information på tredje parts webbplatser som kan ändra innehållet där och kräva upprensning, exempelvis genom att använda offentliga wikisidor som gemensamma anslagstavlor.