Samhæfð herferð til þekkingareimingar líkana stöðvuð
Við greindum nýlega og stöðvuðum samhæfða herferð sem miðaði að því að ná vernduðum rökum úr líkönum okkar. Fyrstu ummerki hennar sáust í fyrstu viku júlí. Þessi starfsemi samræmist illviljaðri þekkingareimingu: kerfisbundinni og óheimilli notkun úttaks eða raka eins líkans til að þjálfa, endurgera eða bæta annað líkan. Vernduð rök eru innri skráning líkansins á því hvernig það vinnur úr verkefni. Með því að ná þeim út má afhjúpa upplýsingar sem koma ekki fram í lokasvarinu og auðvelda öðrum að endurskapa getu líkansins.
Aðilarnir sem stóðu að þessu brutu ekki dulkóðun okkar, brutust ekki inn í gagnagrunn og fengu ekki beinan aðgang að vistuðum samtölum notenda. Þess í stað beittu þeir brögðum í samskiptum við líkön svo hægt væri að birta vernduð rök á formi sem sendandi beiðninnar gat séð. Þetta var gert með samhæfðum hætti og í miklum mæli og braut gegn þjónustuskilmálum okkar. Veikleikinn sem þessi brögð nýta sér er ekki bundinn við líkön OpenAI. Við höfum miðlað upplýsingum um hann til samstarfsaðila í greininni í gegnum Frontier Model Forum til að efla sameiginlegar varnir gegn illviljaðri þekkingareimingu.
Fyrir birtingu könnuðum við umfangið og hugsanleg áhrif, innleiddum eigin mótvægisaðgerðir og miðluðum upplýsingum til rannsakenda og samstarfsaðila í greininni. Við tókum einnig mið af ábendingum þeirra til að tryggja að varnir gegn árásum af þessu tagi væru til staðar. Frekari mótvægisaðgerðir og rannsóknarvinna standa enn yfir. Við teljum að með því að miðla því sem við höfum lært núna getum við hjálpað öðrum á þessu sviði að efla varnir sínar.
Við sáum aðila reyna að ná út vernduðum rökum með nýjum aðferðum, meðal annars með því að afrita dulkóðuð rök úr einu samtali og biðja líkan í öðru samtali að afkóða og skrifa upp falda efnið.
Óháðir öryggisrannsakendur(opnast í nýjum glugga) vöktu einnig athygli okkar á tengdum veikleikum milli líkana og við þjöppun samtala með ábyrgri upplýsingagjöf. Við könnuðum niðurstöður þeirra og staðfestum að árásarleiðirnar sem þeir höfðu greint væru raunverulegar. Vinna þeirra hjálpaði okkur að skilja þennan flokk árása í víðara samhengi og flýta fyrir mótvægisaðgerðum.
Starfsemin hófst 1. júlí og var lítil að umfangi þar til við sáum mikla aukningu 24. og 25. júlí. Þá bárust 16.000 beiðnir1 frá yfir 4.000 notendum sem fylgdu tilteknu mynstri til að ná út gögnum. Við frekari rannsókn greindum við tengda starfsemi með svipuðum kvaðningamynstrum hjá hópi yfir 15.000 notenda. Við höfðum stöðvað hana að fullu 28. júlí.
Starfsemin breyttist með tímanum. Það undirstrikar að illviljuð þekkingareiming er víðtækt öryggisvandamál sem krefst marglaga varna sem laga sig að breyttum aðstæðum.
Óljóst er hvort allir sem við urðum vör við að stæðu að starfseminni á umræddu tímabili störfuðu á vegum sama aðila. Við rekjum þó kjarnahluta starfseminnar til einstaklinga sem tengjast Moonshot AI, fyrirtækinu sem þróar Kimi.
Illviljuð þekkingareiming hefur í för með sér hættu fyrir almennt öryggi og þjóðaröryggi. Rök sem náð er út mætti nota til að þjálfa annað líkan án þess að varðveita þær varnir sem gilda um úttak upprunalega líkansins sem notendur sjá. Þekkingareiming í stórum stíl getur einnig flýtt fyrir yfirfærslu háþróaðrar getu án þess að krefjast sömu fjárfestingar í öryggi. Þessar áhyggjur aukast eftir því sem líkön öðlast meiri getu á sviðum þar sem nýta má hana bæði í friðsamlegum og hernaðarlegum tilgangi.
Þessi áhætta er ekki bundin við OpenAI. Eins og áður hefur komið fram geta svipaðar aðferðir haft áhrif á önnur háþróuð gervigreindarkerfi. Þetta er því sameiginlegt öryggisvandamál sem krefst samhæfingar í greininni.
Við brugðumst við þessari nýlegu þekkingareimingarherferð með samspili aðgerða gegn notendareikningum, tæknilegra varna og samhæfingar við samstarfsaðila. Við lokuðum eða takmörkuðum reikninga sem notaðir voru til svika, hertum eftirlit með nýskráningu og innviðum og víkkuðum út vöktun á tengdum netum.
Við styrktum einnig vernd falinna raka milli notenda, vinnusvæða, fyrirtækja og stofnana og líkanaflokka. Við lokuðum leið sem gerði þeim sem þegar höfðu dulkóðuð rök annars notanda kleift að senda þau aftur inn og endurheimta innihaldið. Við bættum einnig við athugunum til að greina og halda eftir streymdu úttaki sem gæti afhjúpað rök. Þegar tengd starfsemi færðist yfir á þjónustur þriðju aðila unnum við með þeim þjónustuveitendum að því að finna reikningana sem komu við sögu og stöðva starfsemi þeirra.
Að lokum miðluðum við viðeigandi niðurstöðum í gegnum Frontier Model Forum og viðeigandi upplýsingamiðlunarleiðir stjórnvalda. Þannig gátu aðrir þróunaraðilar háþróaðra líkana og samstarfsaðilar á opinberum vettvangi leitað að svipaðri starfsemi og eflt eigin varnir. Kerfi sem styðja gagnaeiningar með rökum sem hægt er að flytja á milli eða senda aftur inn geta staðið frammi fyrir svipaðri áhættu.
Við búumst við að tilraunir til illviljaðrar þekkingareimingar verði þróaðri eftir því sem háþróuð líkön batna og aðilar leita ódýrari leiða til að líkja eftir getu þeirra. Varnir gegn þessari starfsemi krefjast marglaga öryggisráðstafana og stöðugrar aðlögunar.
Þessari vinnu er ekki lokið. Lausnir sem hýstar eru hjá samstarfsaðilum þurfa sömu varnir og þjónustur sem við rekum sjálf. Árásir í gegnum úttak verkfæra krefjast varna sem skoða fleira en venjulegan sýnilegan texta. Við höldum áfram að bæta varnir verkfæra, auka umfang þess sem flokkarar greina, bæta getu líkana til að hafna óheimilum beiðnum og innleiða viðeigandi öryggisráðstafanir hjá samstarfsaðilum í skýjaþjónustu.
Viðbrögð okkar munu áfram beinast að þremur sviðum: sterkari tæknilegum vörnum gegn því að gögnum sé náð út, betri greiningu og aðgerðum gegn samhæfðum herferðum og nánara samstarfi um miðlun upplýsinga um ógnir innan greinarinnar og með stjórnvöldum.

