Incident s platformom Hugging Face i drugi utjecaji neusklađenih modela na treće strane
Kako sistemi umjetne inteligencije postaju sposobniji i autonomniji, neusklađeno ponašanje može dovesti do ozbiljnih postupaka u stvarnom svijetu, uključujući kibernetičke incidente i druge ishode koje razvojni programeri možda nisu predvidjeli. Stoga razumijevanje nastanka i eskalacije takvih ponašanja te načina njihovog otkrivanja i rješavanja postaje sve važniji dio sigurnog razvoja i primjene naprednih sistema umjetne inteligencije.
Incident s platformom Hugging Face u početku smo prvenstveno shvatali kao sigurnosni problem jer je uključivao kompromitovanje na nivou platforme. To je i dalje najozbiljnija aktivnost ove vrste koju smo dosad otkrili kod naših modela, a prvenstveno ju je pokrenuo vrlo sposoban istraživački model namijenjen isključivo internoj upotrebi. U međuvremenu smo utvrdili da su ovaj upad pokrenuli modeli koji su pribjegli neusklađenim strategijama kako bi riješili teške zadatke, kao što je dokumentovano u tehničkom izvještaju o incidentu s platformom Hugging Face. Kibernetički incidenti jedan su oblik tog rizika; neusklađenost može dovesti i do drugih neočekivanih ili zabrinjavajućih ponašanja izvan tradicionalnih sigurnosnih kategorija, poput objavljivanja sadržaja naših modela na stranicama trećih strana — što nazivamo „agentskom neželjenom poštom“. Moramo riješiti oba problema.
Nastavili smo pregledavati šire aktivnosti, dajući prednost ozbiljnijim incidentima, a zatim proširujući pregled na manje ozbiljne neusklađene aktivnosti, uključujući agentsku neželjenu poštu.
Ova stranica objedinjuje naše izvještaje i novosti o incidentu s platformom Hugging Face, povezana istraživanja i javne prezentacije, dodatne aktivnosti koje smo otkrili, saznanja o ulozi neusklađenosti modela te mjere koje poduzimamo kako bismo ojačali svoje sisteme. Ažurirat ćemo ovu stranicu kako naše istrage budu napredovale.
Brze poveznice
Aktivnosti koje utječu na treće strane
Kako bismo bolje razumjeli obim ovih neočekivanih ponašanja, provodimo opsežan pregled internetskih aktivnosti svojih modela tokom obuke i evaluacije. U okviru pregleda kontinuirano utvrđujemo i obavještavamo treće strane, počevši od slučajeva u kojima:
Naši modeli možda su zaobišli sigurnosne kontrole treće strane ili smanjili dostupnost internetske usluge; ili
Slučajevi neusklađenosti negativno su utjecali na web-stranice ili usluge trećih strana.
Na osnovu dosadašnjeg pregleda obavijestili smo desetine trećih strana prema navedenim kriterijima. Pregled prethodnih aktivnosti i dalje traje i zahtijevat će mnogo vremena i resursa. Kako se taj rad bude nastavljao, obavještavat ćemo dodatne treće strane.
U nastavku objavljujemo anonimizirane sažetke vrsta neusklađenih aktivnosti koje smo uočili, a opise ćemo ažurirati kako budemo obavještavali dodatne treće strane i produbljivali svoje razumijevanje. Osim toga, objavljivat ćemo relevantne novosti o statusu pregleda. U pravilu ćemo izostavljati imena i druge identifikacijske podatke kada je to potrebno radi zaštite pogođenih strana, iako obaviještene strane mogu odlučiti javno podijeliti informacije koje im pružimo.
Sažeci uočenih aktivnosti
Naš dosadašnji postupak pregleda i obavještavanja utvrdio je sljedeće kategorije aktivnosti:
Zaobilaženje kontrole pristupa: Agenti dolaze do informacija ili funkcija koje obično zahtijevaju provjeru identiteta, posebnu dozvolu, pretplatu ili račun. Naprimjer, agent je koristio drugu web-adresu, izmijenio pojedinosti u zahtjevu ili se oslonio na sesiju prijave koja mu je omogućila veći pristup od očekivanog.
Upotreba izloženih pristupnih podataka: Agenti su pronašli javno dostupne podatke za prijavu ili pristupne ključeve i upotrijebili ih za pristup usluzi.
Umetanje upita ili naredbe: Agenti su u web-stranicu ili uslugu unijeli tekst koji je usluga protumačila kao uputu, a ne kao običan unos. Zbog toga je usluga mogla izvršiti upit u bazi podataka, aplikacijski kod ili naredbu na svom serveru.
Pristup internim komponentama izvršnog okruženja: Agenti su čitali datoteke koje sadrže implementaciju usluge ili su komunicirali s pozadinskim sistemom namijenjenim internoj upotrebi. U tim je slučajevima agent pristupio dijelovima usluge koji nisu bili obuhvaćeni predviđenim pristupom.
Agentska neželjena pošta: Agenti objavljuju informacije na stranicama trećih strana koje mogu izmijeniti njihov sadržaj i zahtijevati čišćenje, naprimjer korištenjem javnih wiki-stranica kao zajedničkih oglasnih ploča.