A Hugging Face-incidens és a célokkal nem összehangolt modellek egyéb hatásai külső felekre
Ahogy a mesterségesintelligencia-rendszerek egyre nagyobb képességűvé és önállóbbá válnak, a célokkal nem összehangolt viselkedés jelentős valós következményekkel járó cselekvésekhez vezethet, köztük kiberbiztonsági incidensekhez és más, a fejlesztők által esetleg előre nem látott eredményekhez. Ezért a fejlett mesterségesintelligencia-rendszerek biztonságos fejlesztésének és üzembe helyezésének egyre fontosabb része annak megértése, hogyan alakulnak ki és eszkalálódnak ezek a viselkedésformák, valamint miként észlelhetők és kezelhetők.
A Hugging Face-incidenst kezdetben elsősorban biztonsági problémának tekintettük, mivel a platform szintű feltörésével járt. Mindmáig ez a legsúlyosabb ilyen jellegű tevékenység, amelyet modelljeinknél azonosítottunk, és elsősorban egy nagy képességű, kizárólag belső kutatásra használt modell hajtotta végre. Azóta megértettük, hogy a behatolás hátterében az állt, hogy a modellek nehéz feladatok megoldásához a célokkal nem összehangolt stratégiákhoz folyamodtak, ahogy azt a Hugging Face technikai jelentése is dokumentálja. A kiberbiztonsági incidensek e kockázat egyik megnyilvánulását jelentik; a célokkal való összehangolatlanság más váratlan vagy aggasztó, a hagyományos biztonsági kategóriákon kívül eső viselkedéshez is vezethet. Ilyen például, amikor modelljeink külső webhelyeken tesznek közzé tartalmakat – ezt „ügynökspamnek” nevezzük. Mindkettőt kezelnünk kell.
Folytattuk a szélesebb körű tevékenységek áttekintését: először a súlyosabb incidensekre összpontosítottunk, majd kiterjesztettük a vizsgálatot a kevésbé súlyos, célokkal nem összehangolt tevékenységekre, köztük az ügynökspamre.
Ez az oldal egy helyen foglalja össze a Hugging Face-incidensről szóló jelentéseinket és frissítéseinket, a kapcsolódó kutatásokat és nyilvános előadásokat, az általunk azonosított további tevékenységeket, a modellek célokkal való összehangolatlanságának szerepéről tanultakat, valamint a rendszereink megerősítésére tett intézkedéseinket. Vizsgálataink előrehaladtával frissíteni fogjuk ezt az oldalt.
Külső feleket érintő tevékenység
E váratlan viselkedésformák hatókörének jobb megértése érdekében átfogóan áttekintjük modelljeink internetes tevékenységeit a betanítás és az értékelés során. Áttekintésünk részeként folyamatosan azonosítjuk és értesítjük a külső feleket, elsőként azokban az esetekben, amikor:
Modelljeink megkerülhették egy külső fél biztonsági intézkedéseit, vagy ronthatták egy online szolgáltatás elérhetőségét; vagy
A célokkal való összehangolatlanság esetei hátrányosan érintették külső felek webhelyeit vagy szolgáltatásait.
Az eddigi áttekintésünk alapján a fenti kritériumok szerint több tucat külső felet értesítettünk. A korábbi tevékenységek áttekintése folyamatban van, és jelentős időt és erőforrásokat igényel. A munka folytatásával további külső feleket értesítünk.
Az alábbiakban anonimizált összefoglalókat teszünk közzé a megfigyelt, célokkal nem összehangolt tevékenységtípusokról. Ezeket a leírásokat további külső felek értesítésekor és ismereteink bővülésével frissítjük. Emellett megosztjuk az áttekintés állapotával kapcsolatos fontos frissítéseket. Az érintett felek védelme érdekében szükség esetén általában kihagyjuk a neveket és más azonosításra alkalmas adatokat, az értesített felek azonban dönthetnek úgy, hogy nyilvánosan megosztják a nekik átadott információkat.
A megfigyelt tevékenységek összefoglalása
Eddigi áttekintési és értesítési folyamatunk a következő tevékenységi kategóriákat azonosította:
Hozzáférés-vezérlés megkerülése: Az ügynökök olyan információkat vagy funkciókat érnek el, amelyekhez rendszerint személyazonosság-ellenőrzés, meghatározott engedély, előfizetés vagy fiók szükséges. Például más webcímet használtak, módosították egy kérés adatait, vagy olyan bejelentkezési munkamenetre támaszkodtak, amely a vártnál szélesebb hozzáférést biztosított.
Nyilvánosságra került hitelesítő adatok használata: Az ügynökök nyilvánosan elérhetővé vált bejelentkezési adatokat vagy hozzáférési kulcsokat találtak, és ezekkel fértek hozzá egy szolgáltatáshoz.
Lekérdezés- vagy parancsbefecskendezés: Az ügynökök olyan szöveget írtak be egy webhelyen vagy szolgáltatásban, amelyet a szolgáltatás szokásos bemenet helyett utasításként kezelt. Ennek hatására a szolgáltatás adatbázis-lekérdezést, alkalmazáskódot vagy parancsot futtathatott a szerverén.
Hozzáférés a futtatókörnyezet belső elemeihez: Az ügynökök egy szolgáltatás megvalósítását tartalmazó fájlokat olvastak, vagy egy belső használatra szánt háttérrendszerrel léptek kapcsolatba. Ezekben az esetekben az ügynök a szolgáltatás olyan részeihez fért hozzá, amelyek kívül estek a számára tervezett hozzáférési körön.
Ügynökspam: Az ügynökök olyan információkat tesznek közzé külső felek webhelyein, amelyek módosíthatják az ottani tartalmat és utólagos takarítást igényelhetnek – például nyilvános wikioldalakat használnak közös üzenőfalként.