Hugging Face'i intsident ja eesmärkidest hälbivate mudelite muu mõju kolmandatele osapooltele
Mida võimekamaks ja autonoomsemaks tehisintellektisüsteemid muutuvad, seda suurema tõenäosusega võib nende eesmärkidega vastuolus olev käitumine tuua päriselus kaasa tõsiseid tagajärgi, sealhulgas küberturbeintsidente ja muid tulemusi, mida arendajad ei pruukinud ette näha. Seetõttu on täiustatud tehisintellektisüsteemide ohutu arendamise ja kasutuselevõtu juures üha olulisem mõista, kuidas selline käitumine tekib ja süveneb ning kuidas seda tuvastada ja sellele reageerida.
Esialgu käsitlesime Hugging Face'i intsidenti eelkõige turbeprobleemina, sest see hõlmas platvormi tasandi murdmist. See on endiselt kõige tõsisem sedalaadi tegevus, mille oleme seni oma mudelite puhul tuvastanud, ning selle peamine ajend oli väga võimekas, üksnes ettevõttesiseseks kasutuseks mõeldud uurimismudel. Hiljem oleme mõistnud, et sissetungi põhjustasid mudelid, mis kasutasid keeruliste ülesannete lahendamiseks eesmärkidega vastuolus olevaid strateegiaid, nagu on kirjeldatud Hugging Face'i tehnilises aruandes. Küberturbeintsidendid on selle riski üks avaldumisvorm; eesmärkide lahknevus võib põhjustada ka muud ootamatut või murettekitavat käitumist, mis ei kuulu tavapärastesse turbekategooriatesse, näiteks meie mudelite postitused kolmandate osapoolte saitidel. Nimetame seda „agentide rämpspostitamiseks“. Peame tegelema mõlemaga.
Oleme jätkanud laiema tegevuse läbivaatamist, seades esikohale tõsisemad intsidendid ja laiendades analüüsi väiksema raskusastmega eesmärkidest hälbivale tegevusele, sealhulgas agentide rämpspostitamisele.
Sellele lehele oleme koondanud aruanded ja värskendused Hugging Face'i intsidendi, seotud uuringute ja avalike esitluste, muu tuvastatud tegevuse, mudelite eesmärkide lahknevuse rolli kohta õpitu ning meie süsteemide tugevdamiseks võetavate meetmete kohta. Uuendame seda lehte uurimiste edenedes.
Kolmandaid osapooli mõjutav tegevus
Et nende ootamatute käitumisviiside ulatust paremini mõista, oleme põhjalikult läbi vaadanud oma mudelite tegevust internetis treenimise ja hindamise ajal. Läbivaatamise käigus tuvastame ja teavitame jooksvalt kolmandaid osapooli, alustades juhtumitest, kus:
meie mudelid võisid kolmanda osapoole turvameetmetest mööda minna või halvendada võrguteenuse kättesaadavust; või
eesmärkide lahknevuse juhtumid mõjutasid negatiivselt kolmandate osapoolte veebisaite või teenuseid.
Senise läbivaatamise põhjal oleme eespool toodud kriteeriumide alusel teavitanud kümneid kolmandaid osapooli. Varasema tegevuse läbivaatamine jätkub ning nõuab palju aega ja ressursse. Töö jätkudes teavitame veel kolmandaid osapooli.
Allpool avaldame anonüümitud kokkuvõtted täheldatud eesmärkidest hälbiva tegevuse liikidest. Uuendame neid kirjeldusi, kui teavitame uusi kolmandaid osapooli ja meie arusaam täieneb. Lisaks jagame asjakohaseid värskendusi läbivaatamise seisu kohta. Üldjuhul jätame mõjutatud osapoolte kaitsmiseks vajaduse korral välja nimed ja muud isikut tuvastada võimaldavad üksikasjad, kuigi teavitatud osapooled võivad otsustada neile antud teabe avalikustada.
Täheldatud tegevuse kokkuvõtted
Senise läbivaatamis- ja teavitusprotsessi käigus oleme tuvastanud järgmised tegevuskategooriad:
Juurdepääsukontrollist möödahiilimine: agendid pääsevad ligi teabele või funktsioonidele, mis tavaliselt nõuavad isikusamasuse kontrolli, eriõigust, tellimust või kontot. Näiteks kasutas agent teistsugust veebiaadressi, muutis päringu üksikasju või tugines sisselogimisseansile, mis andis talle oodatust suurema juurdepääsu.
Avalikustatud pääsuandmete kasutamine: agendid leidsid avalikult kättesaadavaks tehtud sisselogimisandmed või pääsuvõtmed ja kasutasid neid teenusele juurdepääsuks.
Päringu- või käsusüst: agendid sisestasid veebisaidile või teenusesse teksti, mida teenus käsitles tavapärase sisendi asemel juhisena. Selle tulemusel võis teenus käivitada oma serveris andmebaasipäringu, rakenduse koodi või käsu.
Juurdepääs käituskeskkonna siseosadele: agendid lugesid teenuse teostust sisaldavaid faile või suhtlesid ettevõttesiseseks kasutuseks mõeldud taustsüsteemiga. Neil juhtudel pääses agent ligi teenuse osadele, millele tal ei pidanud juurdepääsu olema.
Agentide rämpspostitamine: agendid postitavad kolmandate osapoolte saitidele teavet, mis võib muuta neil saitidel olevat sisu ja nõuda koristamist, näiteks kasutades avalikke vikilehti ühiste teadetetahvlitena.