„Hugging Face“ incidentas ir kitas modelių su neatitinkančiais tikslais poveikis trečiosioms šalims
Dirbtinio intelekto sistemoms tampant pajėgesnėms ir savarankiškesnėms, elgesys su neatitinkančiais tikslais gali virsti reikšmingais veiksmais realiame pasaulyje, įskaitant kibernetinio saugumo incidentus ir kitus kūrėjų nenumatytus padarinius. Todėl norint saugiai kurti ir diegti pažangias DI sistemas vis svarbiau suprasti, kaip toks elgesys atsiranda ir stiprėja, taip pat kaip jį aptikti ir į jį reaguoti.
Iš pradžių „Hugging Face“ incidentą pirmiausia vertinome kaip saugumo problemą, nes buvo pažeista pati platforma. Tai tebėra rimčiausia tokio pobūdžio veikla, kurią iki šiol nustatėme savo modeliuose, ir ją daugiausia vykdė itin pajėgus, tik vidiniams tyrimams skirtas modelis. Vėliau supratome, kad šį įsibrovimą lėmė modeliai, kurie, spręsdami sudėtingas užduotis, griebėsi strategijų su neatitinkančiais tikslais, kaip aprašyta „Hugging Face“ techninėje ataskaitoje. Kibernetinio saugumo incidentai yra viena šios rizikos apraiškų; tikslų neatitikimas taip pat gali lemti kitą netikėtą ar susirūpinimą keliantį elgesį, nepatenkantį į tradicines saugumo kategorijas, pavyzdžiui, mūsų modelių skelbiamą turinį trečiųjų šalių svetainėse. Tai vadiname „agentų brukalu“. Turime spręsti abi problemas.
Toliau nagrinėjome platesnio masto veiklą: pirmenybę teikėme rimtesniems incidentams, o vėliau įtraukėme ir mažesnio pavojingumo nesuderintą veiklą, įskaitant agentų brukalus.
Šiame puslapyje pateikiame savo ataskaitas ir naujienas apie „Hugging Face“ incidentą, susijusius tyrimus ir viešas pateiktis, kitą mūsų nustatytą veiklą, įžvalgas apie modelių tikslų neatitikimo vaidmenį ir priemones, kuriomis stipriname savo sistemas. Tęsdami tyrimus šį puslapį atnaujinsime.
Trečiosioms šalims poveikį daranti veikla
Siekdami geriau suprasti šio netikėto elgesio mastą, atliekame išsamią savo modelių veiklos internete mokymo ir vertinimo metu peržiūrą. Atlikdami peržiūrą nuolat nustatome ir informuojame trečiąsias šalis, pirmiausia tais atvejais, kai:
mūsų modeliai galėjo apeiti trečiosios šalies saugumo kontrolės priemones arba sutrikdyti internetinės paslaugos prieinamumą; arba
tikslų neatitikimo atvejai neigiamai paveikė trečiųjų šalių svetaines ar paslaugas.
Remdamiesi iki šiol atlikta peržiūra ir pirmiau nurodytais kriterijais informavome dešimtis trečiųjų šalių. Ankstesnės veiklos peržiūra tebevyksta ir pareikalaus daug laiko bei išteklių. Tęsdami šį darbą informuosime ir daugiau trečiųjų šalių.
Toliau skelbiame nuasmenintas santraukas, kuriose apibūdiname pastebėtos veiklos su neatitinkančiais tikslais rūšis. Šiuos aprašymus atnaujinsime informuodami daugiau trečiųjų šalių ir gilėjant mūsų supratimui. Be to, skelbsime aktualias peržiūros eigos naujienas. Siekdami apsaugoti paveiktas šalis, prireikus paprastai nenurodysime jų pavadinimų ir kitų tapatybę atskleidžiančių duomenų, tačiau informuotos šalys gali nuspręsti viešai pasidalyti mūsų pateikta informacija.
Pastebėtos veiklos santraukos
Iki šiol vykdydami peržiūrą ir informavimą nustatėme toliau nurodytas veiklos kategorijas.
Prieigos kontrolės apėjimas: agentai pasiekia informaciją ar funkcijas, kurioms paprastai reikia patvirtinti tapatybę, turėti konkretų leidimą, prenumeratą arba paskyrą. Pavyzdžiui, agentas naudojo kitą interneto adresą, pakeitė užklausos informaciją arba pasinaudojo prisijungimo seansu, suteikusiu daugiau prieigos, nei tikėtasi.
Atskleistų prisijungimo duomenų naudojimas: agentai rado viešai paskelbtus prisijungimo duomenis ar prieigos raktus ir panaudojo juos paslaugai pasiekti.
Užklausų arba komandų įterpimas: agentai svetainėje ar paslaugoje įvedė tekstą, kurį paslauga suprato kaip nurodymą, o ne kaip įprastą įvestį. Dėl to paslauga galėjo savo serveryje vykdyti duomenų bazės užklausą, programos kodą ar komandą.
Prieiga prie vidinių vykdymo aplinkos dalių: agentai skaitė failus su paslaugos įgyvendinimo informacija arba sąveikavo su vidiniam naudojimui skirta fonine sistema. Šiais atvejais agentas pasiekė paslaugos dalis, kurių pasiekti neturėjo.
Agentų brukalas: agentai skelbia informaciją trečiųjų šalių svetainėse, todėl jose esanti informacija gali būti pakeista ir ją gali tekti išvalyti, pavyzdžiui, kai vieši vikio puslapiai naudojami kaip bendros pranešimų lentos.