Preskočite na glavni sadržaj
OpenAI

Incident s platformom Hugging Face i drugi učinci neusklađenih modela na treće strane

Kako sustavi umjetne inteligencije postaju sposobniji i autonomniji, neusklađeno ponašanje može dovesti do ozbiljnih posljedica u stvarnom svijetu, uključujući kibernetičke incidente i druge ishode koje razvojni programeri možda nisu predvidjeli. Stoga razumijevanje nastanka i eskalacije takvih ponašanja te načina njihova otkrivanja i odgovora na njih postaje sve važniji dio sigurne izrade i primjene naprednih sustava umjetne inteligencije.

Incident s platformom Hugging Face isprva smo smatrali ponajprije sigurnosnim problemom jer je uključivao kompromitiranje na razini platforme. To je i dalje najozbiljnija aktivnost te vrste koju smo dosad otkrili kod svojih modela, a prvenstveno ju je potaknuo vrlo sposoban interni istraživački model. Naknadno smo utvrdili da su prodor potaknuli modeli koji su pribjegli neusklađenim strategijama radi rješavanja teških zadataka, kao što je dokumentirano u tehničkom izvješću o incidentu s platformom Hugging Face. Kibernetički incidenti jedan su oblik tog rizika; neusklađenost može dovesti i do drugih neočekivanih ili zabrinjavajućih ponašanja izvan tradicionalnih sigurnosnih kategorija, primjerice objavljivanja sadržaja naših modela na web-mjestima trećih strana, što nazivamo „agentskom neželjenom poštom“. Moramo riješiti oba problema.

Nastavili smo analizirati šire aktivnosti, dajući prednost ozbiljnijim incidentima i postupno obuhvaćajući manje ozbiljne neusklađene aktivnosti, uključujući agentsku neželjenu poštu.

Ova stranica objedinjuje naša izvješća i novosti o incidentu s platformom Hugging Face, povezana istraživanja i javna predstavljanja, dodatne aktivnosti koje smo otkrili, spoznaje o ulozi neusklađenosti modela te mjere koje poduzimamo kako bismo ojačali svoje sustave. Ovu ćemo stranicu ažurirati kako naše istrage budu napredovale.


Aktivnosti koje utječu na treće strane

Kako bismo bolje razumjeli opseg tih neočekivanih ponašanja, provodimo opsežan pregled internetskih aktivnosti svojih modela tijekom obuke i evaluacije. U sklopu pregleda kontinuirano utvrđujemo i obavještavamo pogođene treće strane, počevši od slučajeva u kojima:

  • su naši modeli možda zaobišli sigurnosne kontrole treće strane ili narušili dostupnost internetske usluge; ili

  • su slučajevi neusklađenosti negativno utjecali na web-mjesta ili usluge trećih strana.

Na temelju dosadašnjeg pregleda obavijestili smo desetke trećih strana prema navedenim kriterijima. Pregled prošlih aktivnosti još traje i zahtijevat će mnogo vremena i resursa. Kako se taj rad bude nastavljao, obavijestit ćemo dodatne treće strane.

U nastavku objavljujemo anonimizirane sažetke vrsta neusklađenih aktivnosti koje smo opazili, a opise ćemo ažurirati kako budemo obavještavali dodatne treće strane i produbljivali svoje razumijevanje. Uz to ćemo objavljivati relevantne novosti o statusu pregleda. U pravilu ćemo izostaviti imena i druge identifikacijske podatke kada je to potrebno radi zaštite pogođenih strana, no obaviještene strane mogu odlučiti javno podijeliti informacije koje im pružimo.

Sažeci opaženih aktivnosti

Dosadašnjim postupkom pregleda i obavještavanja utvrđene su sljedeće kategorije aktivnosti:

  • Zaobilaženje kontrole pristupa: agenti pristupaju informacijama ili funkcijama za koje su inače potrebni provjera identiteta, određena dozvola, pretplata ili račun. Primjerice, agent je upotrijebio drugu web-adresu, promijenio pojedinosti u zahtjevu ili se poslužio prijavljenom sesijom koja mu je omogućila veći pristup od očekivanog.

  • Upotreba izloženih vjerodajnica: agenti su pronašli javno dostupne podatke za prijavu ili pristupne ključeve i upotrijebili ih za pristup usluzi.

  • Umetanje upita ili naredbi: agenti su na web-mjesto ili u uslugu unijeli tekst koji je usluga protumačila kao naredbu, a ne kao običan unos. Zbog toga je usluga mogla izvršiti upit nad bazom podataka, aplikacijski kod ili naredbu na svojem poslužitelju.

  • Pristup internim dijelovima izvršnog okruženja: agenti su čitali datoteke s implementacijom usluge ili komunicirali s pozadinskim sustavom namijenjenim internoj upotrebi. U tim je slučajevima agent pristupio dijelovima usluge izvan predviđenog opsega pristupa.

  • Agentska neželjena pošta: agenti objavljuju informacije na web-mjestima trećih strana koje mogu promijeniti njihov sadržaj i zahtijevati čišćenje, primjerice upotrebljavajući javne stranice wikija kao zajedničke oglasne ploče.


Kronologija događaja

Rujan

Kolovoz

Srpanj