Incidenti i Hugging Face dhe ndikimet e tjera të modeleve të paharmonizuara te palët e treta
Ndërsa sistemet e IA-së bëhen gjithnjë e më të afta dhe autonome, sjelljet e paharmonizuara mund të shndërrohen në veprime me pasoja konkrete në botën reale, duke përfshirë incidente të sigurisë kibernetike dhe pasoja të tjera që zhvilluesit mund të mos i kenë parashikuar. Prandaj, të kuptuarit se si shfaqen dhe përshkallëzohen këto sjellje, si mund të zbulohen dhe si mund të reagohet ndaj tyre, po bëhet një pjesë gjithnjë e më e rëndësishme e zhvillimit dhe vënies së sigurt në përdorim të sistemeve të përparuara të IA-së.
Fillimisht, incidentin e Hugging Face e kuptuam kryesisht si një çështje sigurie, pasi përfshinte komprometimin në nivel platforme. Ky mbetet rasti më i rëndë i këtij lloji që kemi identifikuar deri më sot nga modelet tona dhe u shkaktua kryesisht nga një model kërkimor shumë i aftë, i destinuar vetëm për përdorim të brendshëm. Që atëherë kemi kuptuar se kjo ndërhyrje u shkaktua nga modelet që përdorën strategji të paharmonizuara për të zgjidhur detyra të vështira, siç dokumentohet në raportin teknik të Hugging Face. Incidentet e sigurisë kibernetike janë një shfaqje e këtij rreziku; mospërputhja mund të çojë edhe në sjellje të tjera të papritura ose shqetësuese që nuk përfshihen në kategoritë tradicionale të sigurisë, siç është publikimi i informacioneve nga modelet tona në faqe të palëve të treta—diçka që po e quajmë “përmbajtje e bezdisshme nga agjentët”. Duhet t’i trajtojmë të dyja këto forma të rrezikut.
Kemi vazhduar shqyrtimin e një game më të gjerë veprimtarish, duke u dhënë përparësi incidenteve më të rënda dhe duke e zgjeruar shqyrtimin për të përfshirë veprimtari të paharmonizuara me rrezikshmëri më të ulët, si përmbajtja e bezdisshme nga agjentët.
Kjo faqe mbledh në një vend raportet dhe përditësimet tona për incidentin e Hugging Face, kërkimet dhe prezantimet publike përkatëse, veprimtaritë e tjera që kemi identifikuar, mësimet tona rreth rolit të mospërputhjes së modeleve dhe masat që po marrim për të forcuar sistemet tona. Do ta përditësojmë këtë faqe me përparimin e hetimeve tona.
Lidhje të shpejta
Veprimtari që prekin palët e treta
Për të kuptuar më mirë shtrirjen e këtyre sjelljeve të papritura, po kryejmë një shqyrtim të gjerë të veprimtarive të modeleve tona në internet gjatë trajnimit dhe vlerësimit. Si pjesë e këtij shqyrtimi, po identifikojmë dhe njoftojmë palë të treta në mënyrë të vazhdueshme, duke filluar me rastet në të cilat:
Modelet tona mund të kenë anashkaluar kontrollet e sigurisë së një pale të tretë ose mund të kenë cenuar disponueshmërinë e një shërbimi në internet; ose
Rastet e mospërputhjes patën ndikim negativ në faqet e internetit ose shërbimet e palëve të treta.
Bazuar në shqyrtimin e deritanishëm, kemi njoftuar dhjetëra palë të treta në bazë të kritereve të mësipërme. Shqyrtimi ynë i veprimtarive të mëparshme është ende në vazhdim dhe do të kërkojë kohë dhe burime të konsiderueshme. Ndërsa kjo punë vazhdon, do të njoftojmë palë të treta të tjera.
Më poshtë po publikojmë përmbledhje të anonimizuara për të përshkruar llojet e veprimtarive të paharmonizuara që kemi vërejtur. Do t’i përditësojmë këto përshkrime ndërsa njoftojmë palë të treta të tjera dhe ndërsa thellojmë kuptimin tonë. Gjithashtu, do të publikojmë përditësime përkatëse mbi ecurinë e shqyrtimit. Në përgjithësi, do të heqim emrat dhe të dhëna të tjera identifikuese kur kjo të jetë e nevojshme për të mbrojtur palët e prekura, megjithëse palët e informuara mund të zgjedhin ta bëjnë publik informacionin që u japim.
Përmbledhje të veprimtarive të vërejtura
Deri më sot, procesi ynë i shqyrtimit dhe njoftimit ka identifikuar kategoritë e mëposhtme të veprimtarisë:
Anashkalimi i kontrollit të qasjes: Agjentët sigurojnë qasje në informacione ose funksione që zakonisht kërkojnë verifikimin e identitetit, një leje të posaçme, abonim ose llogari. Për shembull, një agjent përdori një adresë tjetër interneti, ndryshoi hollësitë e një kërkese ose u mbështet në një seancë hyrjeje që i siguronte qasje më të gjerë nga sa pritej.
Përdorimi i kredencialeve të ekspozuara: Përdorimi i kredencialeve të ekspozuara: Agjentët gjetën të dhëna identifikimi ose çelësa qasjeje që ishin vënë në dispozicion publikisht dhe i përdorën për të hyrë në një shërbim.
Injektimi i pyetjeve ose komandave: Agjentët futën tekst në një faqe interneti ose shërbim, të cilin shërbimi e trajtoi si udhëzim dhe jo si informacion të zakonshëm hyrës. Kjo mund të bënte që shërbimi të ekzekutonte një kërkesë në bazën e të dhënave, kodin e një aplikacioni ose një komandë në serverin e vet.
Qasja në komponentët e brendshëm të sistemit gjatë ekzekutimit: Agjentët lexuan skedarë që përmbanin kodin e zbatimit të një shërbimi ose ndërvepruan me një sistem në sfond të destinuar për përdorim të brendshëm. Në këto raste, agjenti u qas në pjesë të shërbimit tek të cilat nuk ishte parashikuar të kishte qasje.
Përmbajtja e bezdisshme nga agjentët: Agjentët publikojnë informacione në faqe të palëve të treta, të cilat mund të ndryshojnë informacionin në ato faqe dhe të kërkojnë pastrim, për shembull duke përdorur faqe publike wiki si tabela të përbashkëta mesazhesh.