Viimastel nädalatel on üha võimekamate tehisintellektisüsteemidega seotud kasvavaid riske rõhutanud kaks arengut: OpenAI ja Hugging Face’i intsident ning eraldiseisvalt esialgsed tõendid selle kohta, et üks meie tulevastest mudelitest, Astra, võib ületada meie Valmisoleku raamistikus määratletud kriitilise küberturbevõime lävendi. Need arengud koos meie siseuuringute kiire edenemisega on muutnud pakilisemaks töö, millega tugevdame kogu treenimisprotsessi vältel seire-, joondamis- ja piiramismeetmeid.
Mida võimekamaks mudelid muutuvad, seda suuremad on ka nende ettevõttesisese arendamise ja katsetamise riskid. Meie seire-, joondamis- ja turbestandardid peavad neist riskidest sammu võrra ees püsima. Tahtsime võtta nende standardite täitmiseks vajaliku aja, mistõttu aeglustasime ajutiselt skaleerimist. Muu hulgas peatasime kaheks nädalaks juurutamiseks mõeldud uusimate mudelite kinnistava õppimise (RL) treeningu, et oma uurimiskeskkondi veelgi tugevdada ja vastasmeeskonnaga katsetada ning laiendada seiresüsteemide katvust. Meie suurim kavandatud tipptasemel kinnistava õppimise treening on endiselt ootel. Seni korraldame väiksemaid treeninguid ja hindamisi, et analüüsida mudeli käitumist, valideerida kaitsemeetmeid ja koguda enne jätkamist rohkem tõendeid joondatuse kohta.
Joondamine – töö selle nimel, et tehisintellektisüsteemid käituksid ettenähtult ja alluksid inimeste järelevalvele – on juba ammu olnud meie uurimisprogrammi keskmes. Nüüd nõuame kogu treeningu vältel kaalukamaid tõendeid joondatud käitumise kohta, tuginedes juba käimasolevatele uuringutele ja hindamistele. Üha võimekamate süsteemide joondatuna hoidmine on probleem, millega peab tegelema kogu valdkond. Tulevaste mudelite arengust saadavad märgid näitavad selgelt, et vajame laiemat käsitlust, mis tugineb praegusele Valmisoleku raamistikule, kuid ulatub sellest kaugemale.
Peame oluliseks olla oma käsitluse muutumise suhtes läbipaistvad. Allpool kirjeldame muudatusi, mille oleme oma uurimisprotsessides ja taristus juba teinud, ning tööd, mis veel jätkub.
Meie käsitlus võimekamate mudelite arendamiseks tugineb kolmele üksteist toetavale kaitsemeetmele:
- Seire, mis tuvastab murettekitava käitumise ja võimaldab meil sellele reageerida.
- Joondamine, mis vähendab kahjulike või volitamata toimingute tõenäosust.
- Turbemeetmed, mis piiravad seda, millele tehisintellektisüsteemid ligi pääsevad või mida mõjutada saavad.
Eeldame, et peagi teevad mudelid suurema osa turbetööst, sealhulgas kaitsevad teiste mudelite eest. See võimaldab kõigil kolmel kaitsemeetmel mudeli võimekusega kaasa kasvada, mis on meie arvates ülioluline.
Rakendame neid kaitsemeetmeid nii uuringutes kui ka juurutamisel, kohandades neid iga mudeli võimete, töökeskkonna ja riskitasemega.
Kuna tipptasemel mudelite küberturbevõime kasvab, tõstame nende treenimis- ja hindamiskeskkondade turbestandardeid. Nende standardite täitmine on nõudnud ulatuslikku inseneritööd ning toonud tipptasemel uuringutele kaasa suuri kulusid ja viivitusi. Kohe pärast OpenAI ja Hugging Face’i intsidenti* peatasime uurimisklastrites tipptasemel mudelite inferentsi nende käituste puhul, mis võisid käivitada koodi või kasutada internetti pääsevaid tööriistu. Taastasime üsna kiiresti piiratuma ja turvalisema koodikäivituse võimaluse ning vaatasime seejärel iga töökoormuse eraldi läbi, et otsustada, kas selle saab ohutult taastada. Osa uurimistöökoormusi jätkus uute kontrollimeetmete alusel, teised vajasid lisamuudatusi.
Järgnenud nädalatel määratlesime tipptasemel uurimistöökoormustele rangemad turbenõuded ja alustasime nende rakendamist. Näiteks:
- Töökoormuste isoleerimine: nõuame nüüd mudeli loodud või muu ebausaldusväärse koodi käitamiseks tugevamat isolatsiooni („liivakaste“). See kehtib ka tarkvarale, mis võib mudeli väljundite töötlemisel ohtu sattuda.
- Võrgu isoleerimine: oleme rakendanud rohkem kontrollimeetmeid, et eraldada suurema riskiga ja ebausaldusväärsed töökoormused internetist. Oleme need kontrollimeetmed kujundanud nii, et ühe töökoormuse või tugiteenuse kompromiteerimine ei võimaldaks iseenesest volitamata juurdepääsu internetile ega teistele sisevõrkudele.
- Pidev turbetestimine: oleme oma keskkonna ümber seadistanud, et eemaldada potentsiaalselt haavatavad ühisteenused, vähendada püsivaid õigusi ning parandada turbe- ja usalduspiire. Parandame ka oma võimet turbelogisid koguda ja jälgida. Samuti investeerime automatiseerimisse, kasutades oma mudeleid nende piiride pidevaks katsetamiseks simuleeritud rünnakutega.
Koos loovad need kontrollimeetmed mitmekihilise kaitse ja aitavad meie uurimiskeskkonda rünnakute eest kaitsta. Praegu nõuame Astra või kübermudelitega seotud töökoormustele kõige rangemaid turbemeetmeid, sest oleme kindlaks teinud, et Astra mudelitel võib olla kriitilise taseme kübervõimekus. Need kaitsemeetmed kehtivad ka kõigile teistele kübervaldkonnaga seotud töökoormustele.
Kuigi osa Astra treeninguid ja hindamisi vastab neile nõuetele, on suur hulk töökoormusi endiselt peatatud, kuni need on täielikult üle viidud ja uue turbetaseme saavutamiseks täiustatud. Viime uutesse keskkondadesse esmajärjekorras ohutuse ja joondamisega seotud töökoormused.
Seire on juba ammu olnud meie mudeliarendusprotsessi oluline osa, sealhulgas ettevõttesiseste kodeerimisagentide seire ja pikaajaliste seansside jälgimine. Meie seire keskendus eelkõige tipptasemel mudelite ettevõttesisesele juurutamisele ja tipptasemel kinnistava õppimise treeningutele. Pidasime neid suurima riskiga töökoormusteks, sest neis võivad mudeli täiustatud võimed olla ühendatud juurdepääsuga tööriistadele, tundlikele süsteemidele ning sise- või välisvõrkudele. Neid meetmeid ei rakendatud kõigile tööriistu kasutavatele inferentsidele ja treeningutele. Oleme oma käsitlust uue seirelahendusega muutnud ja laiendanud.
Uus seirelahendus on mitmeetapiline. See algab aktivatsiooniklassifikaatoritest ehk detektoritest, mis uurivad mudeli sisemist aktiivsust iga valimisse võetud tokeni juures ning edastavad võimalikud probleemid üha keerukamatele ja suuremat arvutusvõimsust kasutavatele automaatuurijatele. Need süsteemid uurivad tööriistade toiminguid, kättesaadavat arutlust ja kogu tegevuste jada, et tuvastada volitamata juurdepääsu, andmevargust, hävitavat käitumist ning katseid kaitsemeetmeid nurjata. Meie eesmärk on väljastada hoiatus 30 minuti jooksul pärast seda, kui seiresüsteem on murettekitava tegevuse tuvastanud. Kui seiresüsteem tuvastab kriitilise turbepiiri tõenäolise rikkumise, loob see kõrgeima prioriteediga hoiatuse. Praeguses rakenduses kutsutakse välja ohutus-, turbe- ja uurimisrühmad. Kui nad ei suuda 30 minuti jooksul veenvalt kindlaks teha, et märguanne on valepositiivne, peavad need rühmad tegevuse peatama.
See seire on kohustuslik kõigil Soli võimekusega või võimekamate mudelite kinnistava õppimise treeningutel ja hindamistel, kus kasutatakse tööriistu. Kui tegime 7. augustil kindlaks, et Astral võib olla kriitiline kübervõimekus, lisasime täiendava seirenõude kõigile Astra tööriistu kasutavatele inferentsidele, mitte ainult kinnistava õppimise treeningutele ja hindamistele.
Need kaitsemeetmed nõuavad märkimisväärset arvutusvõimsust. Praeguste hinnangute kohaselt moodustab seire lisakulu ligikaudu 20% jälgitava inferentsi arvutusmahust, kuigi treeningu- ja hindamistöökoormuste lõikes on kulud väga erinevad. Jagame selle süsteemi kohta rohkem üksikasju peagi ilmuvas blogipostituses.
Joondamisuuringud on meie missiooni keskmes. Meie missioon on tagada, et üldine tehisintellekt tooks kasu kogu inimkonnale. Kui mudelid omandavad täiustatud võimeid, näiteks suutlikkuse korraldada küberrünnakuid, ja tegutsevad keerukamates keskkondades, tekitavad joondamata käitumisviisid üha tõsisemaid riske. Nende hulka kuuluvad preemia häkkimine ehk viiside leidmine, kuidas saada treeningul suurt preemiat ilma soovitud tulemust tegelikult saavutamata, petmine ja volitamata juurdepääs.
Kõige võimekamate mudelite kinnistava õppimise treeningutel rakendame nüüd oma põhilisi joondamismeetodeid treenimisprotsessi rohkemates etappides. See hõlmab preemiamudelite täiustamist, et tuvastada ja pärssida ohtlikku käitumist eri ülesannetes ja keskkondades; mudelite treenimist nii, et nad oleksid oma toimingute, võimete ja piirangute suhtes ausamad; ning sellise käitumise vähendamist, mis kasutab ära preemiate, hindajate, tööriistade või järelevalve nõrkusi. Samuti laiendame treeningu katvust käitumisviisidele, mis võivad põhjustada kahju, kui mudelid suhtlevad väliste süsteemide või ressurssidega.
Investeerime jätkuvalt jõuliselt joondamisuuringutesse, laiendame hindamiste katvust ning kasutame õpitut treeningute ja kaitsemeetmete täiustamiseks. Kavatseme lähitulevikus oma joondamisuuringutest märksa rohkem jagada, sealhulgas sellest, mida õpime mudelite käitumise kohta ja milliseid uusi probleeme avastame.
Arendame oma Valmisoleku raamistikku edasi, et ühendada need kaitsemeetmed kogu treenimise ja juurutamise ulatuses ning kajastada paremini tulevaste mudelite võimeid ja nende töökeskkondi. Nende võimetega skaleeruvate meetodite väljatöötamine nõuab püsivaid investeeringuid mudelitoega turbesse, tõhusamasse seiresse ja joondamisuuringute jätkuvasse arengusse. Kavatseme kaasata väliseid organisatsioone ja jagada oma käsitluse arenedes rohkem õpitut.
Tipptasemel mudelite võimed arenevad kiiresti. Meie suutlikkus neid mõista, joondada ja turvata peab sellest arengust sammu võrra ees püsima.
*Avaldame lähinädalatel õpitu kohta tehnilise aruande.

