Ndërprerja e një fushate të koordinuar distilimi modelesh
Së fundmi identifikuam dhe ndërpremë një fushatë të koordinuar që synonte të nxirrte arsyetimin e mbrojtur nga modelet tona. Aktiviteti më i hershëm i vëzhguar u regjistrua në javën e parë të korrikut. Ky aktivitet përputhet me distilimin keqdashës: përdorimin sistematik dhe të paautorizuar të rezultateve ose arsyetimit të një modeli për të ndihmuar në trajnimin, riprodhimin ose përmirësimin e një modeli tjetër. Arsyetimi i mbrojtur është regjistri i brendshëm i hapave që ndjek modeli për të kryer një detyrë; nxjerrja e tij mund të zbulojë informacione që nuk janë përfshirë në përgjigjen përfundimtare dhe t’i ndihmojë të tjerët të riprodhojnë aftësitë e modelit.
Personat që kryen këtë aktivitet nuk thyen enkriptimin tonë, nuk cenuan ndonjë bazë të dhënash dhe as nuk siguruan qasje të drejtpërdrejtë në bisedat e ruajtura të përdoruesve. Në vend të kësaj, ata manipuluan ndërveprimet me modelet, në mënyrë që arsyetimi i mbrojtur të mund të riprodhohej në forma të dukshme për kërkuesin. Këtë e bënë në mënyrë të koordinuar dhe në shkallë të gjerë, duke shkelur kushtet tona të shërbimit. Ky manipulim nuk shfrytëzon një dobësi që prek vetëm modelet e OpenAI. Për të forcuar mbrojtjen e përbashkët kundër distilimit keqdashës, kemi ndarë informacione rreth tij me partnerë të industrisë përmes Frontier Model Forum.
Para publikimit, hetuam shtrirjen dhe ndikimin e mundshëm, zbatuam masat tona zbutëse dhe ndamë gjetjet me studiues e partnerë të industrisë, duke marrë edhe mendimet e tyre, për t’u siguruar që masat mbrojtëse ndaj këtij lloji sulmi të jenë në fuqi. Puna për masa të mëtejshme zbutëse dhe hetimi po vazhdojnë. Besojmë se ndarja tani e asaj që kemi mësuar do ta ndihmojë ekosistemin më të gjerë të forcojë mbrojtjen e vet.
Vëzhguam përpjekje për ta nxjerrë arsyetimin e mbrojtur në mënyra të reja, përfshirë kopjimin e arsyetimit të enkriptuar nga një bisedë dhe kërkesën drejtuar një modeli në një bisedë tjetër për ta dekriptuar dhe transkriptuar përmbajtjen e arsyetimit të fshehur.
Studiues të pavarur të sigurisë(hapet në një dritare të re) na njoftuan gjithashtu, përmes raportimit të përgjegjshëm, për dobësi të lidhura me ndërveprimin mes modeleve dhe kompaktimin e bisedave. Hetuam gjetjet e tyre dhe konfirmuam se rrugët e sulmit që kishin identifikuar ishin reale. Puna e tyre na ndihmoi të kuptonim kategorinë më të gjerë të këtyre sulmeve dhe të përshpejtonim masat zbutëse.
Aktiviteti filloi më 1 korrik, fillimisht me volum të ulët, derisa më 24 dhe 25 korrik vëzhguam rritje të vrullshme: 16 000 kërkesa1 nga mbi 4 000 përdorues, që ndiqnin një skemë nxjerrjeje të lidhur me këtë aktivitet. Hetimi i mëtejshëm identifikoi aktivitet me skema të ngjashme kërkesash në një grup prej më shumë se 15 000 përdoruesish, të cilin e ndërpremë plotësisht deri më 28 korrik.
Aktiviteti ndryshoi me kalimin e kohës, duke përforcuar faktin se distilimi keqdashës është një sfidë më e gjerë sigurie që kërkon mbrojtje në disa nivele dhe të përshtatshme ndaj ndryshimeve.
Nuk është e qartë nëse të gjithë personat që vëzhguam gjatë periudhës përkatëse vepronin për llogari të një aktori të vetëm. Megjithatë, një pjesë qendrore të aktivitetit ua atribuojmë individëve të lidhur me Moonshot AI, zhvilluesin e Kimi.
Distilimi keqdashës paraqet rreziqe për sigurinë në përgjithësi dhe për sigurinë kombëtare. Arsyetimi i nxjerrë mund të përdoret për të trajnuar një model tjetër pa ruajtur masat mbrojtëse të zbatuara për përgjigjet që modeli origjinal u jep përdoruesve. Në shkallë të gjerë, distilimi mund të përshpejtojë edhe transferimin e aftësive të avancuara pa kërkuar të njëjtin investim në siguri. Këto shqetësime shtohen teksa modelet fitojnë aftësi në fusha me përdorim të dyfishtë.
Ky rrezik nuk prek vetëm OpenAI. Siç u përmend më sipër, teknika të ngjashme mund të prekin sisteme të tjera të avancuara të IA-së, duke e bërë këtë një sfidë të përbashkët sigurie që kërkon koordinim në mbarë industrinë.
E frenuam këtë fushatë të fundit distilimi duke kombinuar masa ndaj llogarive, kontrolle teknike dhe koordinim me partnerët. Bllokuam ose kufizuam llogaritë mashtruese, forcuam kontrollet e regjistrimit dhe të infrastrukturës dhe zgjeruam monitorimin e rrjeteve të lidhura me këtë aktivitet.
Gjithashtu forcuam mbrojtjen e arsyetimit të fshehur në të gjithë përdoruesit, hapësirat e punës, organizatat dhe familjet e modeleve. Mbyllëm një rrugë që i lejonte dikujt, i cili zotëronte tashmë arsyetimin e enkriptuar të një përdoruesi tjetër, ta riparaqiste atë dhe të rikuperonte përmbajtjen e tij. Shtuam gjithashtu kontrolle për të zbuluar dhe ndaluar daljen e përmbajtjes së transmetuar në kohë reale që mund të ekspozonte arsyetimin. Kur aktiviteti i lidhur kaloi përmes shërbimeve të palëve të treta, bashkëpunuam me ofruesit e tyre për të identifikuar dhe bllokuar llogaritë e përfshira.
Së fundi, ndamë gjetjet përkatëse përmes Frontier Model Forum dhe kanaleve të përshtatshme qeveritare të shkëmbimit të informacionit, në mënyrë që zhvillues të tjerë të modeleve avangardë dhe partnerë të sektorit publik të mund të kërkonin aktivitet të ngjashëm dhe të forconin mbrojtjen e tyre. Sistemet që mbështesin artefakte arsyetimi të transferueshme ose të ripërdorshme mund të përballen me rreziqe të ngjashme.
Presim që përpjekjet për distilim keqdashës të bëhen më të sofistikuara, ndërsa modelet avangardë përmirësohen dhe aktorët kërkojnë mënyra më të lira për të imituar aftësitë e tyre. Mbrojtja ndaj këtij aktiviteti kërkon kontrolle në disa nivele dhe përshtatje të vazhdueshme.
Kjo punë nuk ka përfunduar. Implementimet e strehuara nga partnerët kanë nevojë për të njëjtat masa mbrojtëse si shërbimet tona të drejtpërdrejta, ndërsa sulmet përmes rezultateve të mjeteve kërkojnë masa mbrojtëse që shqyrtojnë më shumë sesa tekstin e zakonshëm të dukshëm. Po vazhdojmë të përmirësojmë mbrojtjen e mjeteve, mbulimin nga klasifikuesit dhe refuzimet nga modelet, si dhe të shtrijmë kontrollet përkatëse te partnerët e shërbimeve në renë kompjuterike.
Përgjigjja jonë do të vazhdojë të përqendrohet në tri fusha: mbrojtje teknike më të forta kundër nxjerrjes, zbulim më të mirë të fushatave të koordinuara dhe masa më të efektshme ndaj tyre, si dhe shkëmbim më të thelluar të informacionit mbi kërcënimet mes industrisë dhe qeverisë.

