Priešakinio DI mokymo saugos pagrindimų link
Manome, kad žengiame į naują erą, kurioje prieš tęsiant bet kurį priešakinio DI skatinamojo mokymosi ciklą turėtų būti privaloma parengti struktūruotus saugos dokumentus. Idealiu atveju tokie dokumentai atitiktų „saugos pagrindimų“ lygį – tai išsamūs, struktūruoti, įrodymais paremti argumentai apie riziką, naudojami kitose srityse, kuriose sauga yra itin svarbi. Saugos pagrindimus laikome siekiamybe, kurios link judame. Kartu pripažįstame, kad kiekviename naujame DI gebėjimų lygyje atsirandantis sudėtingumas apsunkina galimybę DI modeliams taikyti tokius pat griežtus pagrindimus kaip aviacijoje ar branduolinėje energetikoje. Kuriame sistemą, kurioje ši praktika būtų įtvirtinta.
Toliau pateikiame kelias pradines gaires, kurios, mūsų manymu, turėtų būti priešakinio DI mokymo saugos pagrindimų dalis. Ši geroji praktika atspindi tai, ko iki šiol išmokome. Tikimės, kad ji keisis mums toliau tobulinant vidinius atsakingo kūrimo procesus. Dalijamės ja dabar, kad atvirai parodytume savo dabartinį požiūrį, ir kviečiame bendruomenę pateikti atsiliepimų. Atkreipiame dėmesį, kad šiame dokumente daugiausia dėmesio skiriama priešakinio DI skatinamajam mokymuisi; diegiant vidiniam ir išoriniam naudojimui reikia atsižvelgti į gerokai platesnį suderinamumo savybių spektrą.
Saugos pagrindimai turėtų apimti tris techninės sistemos aspektus: mokymą siekiant suderinamumo, izoliavimą ir stebėseną. Šios apsaugos priemonės padeda užtikrinti, kad modelis nemėgintų atlikti su mūsų ketinimais nesuderintų veiksmų, o net ir mėginant jam būtų sunku įveikti izoliavimo ribas ir stebėsenos sistema tai aptiktų dar prieš padarant žalą.
Modelio suderinimas: pirmoji gynybos linija turėtų būti modelių mokymas siekiant suderinamumo, t. y. kad jie patikimai veiktų taip, kaip numatome. Tai galėtų apimti šias priemones:
Mokymo aplinkos ir rezultatų vertinimas: mažinti nesuderinto modelių elgesio išsivystymo riziką, mokymo metu neleidžiant teigiamai pastiprinti atlygio sistemos spragų išnaudojimo. Tai galėtų apimti šias priemones:
Automatizuotos duomenų rinkinių peržiūros: pasitelkti agentus netinkamai veikiančioms skatinamojo mokymosi aplinkoms aptikti ir pataisyti. Tokiose aplinkose nesuderintos veiksmų sekos galėtų pelnyti didelį atlygį išnaudojant spragas, o ne elgiantis taip, kaip numatyta. Tai sumažintų galimybes mokymo metu pastiprinti nesuderintą elgesį.
Rankinės duomenų rinkinių peržiūros: automatizuotą testavimą spragoms nustatyti papildyti rankinėmis duomenų rinkinių peržiūromis ir kokybės patikromis, siekiant aptikti ydingas užduotis, kurios galėtų netyčia pastiprinti nesuderintą elgesį.
Vertinimo sistemų derinimas: suderinti vertinimo sistemas taip, kad mokymo metu jos baustų modelį už bandymus išnaudoti skatinamojo mokymosi aplinkų spragas ar į jas įsilaužti.
Ankstesnių mokymo ciklų analizė: klasifikatoriais analizuoti ankstesnių eksperimentų veiksmų įrašus, siekiant įsitikinti, kad vertinimo sistemos veikia taip, kaip numatyta.
Suderinamumo matavimas: atlikti vertinimus, kuriais stebimas modelio polinkis į nesuderinamumą, kad būtų galima išmatuoti mokymo siekiant suderinamumo veiksmingumą. Tai galėtų apimti šias priemones:
Atskiri suderinamumo vertinimai: vykdant priešakinių modelių mokymo ciklus atlikti suderinamumo vertinimus, siekiant nustatyti, ar mokymas veikia taip, kaip numatyta, ir ištirti bet kokį reikšmingą rezultatų pablogėjimą.
Retrospektyvus tikrinimas: tikrinti suderinamumo vertinimus remiantis ankstesniais incidentais, siekiant patvirtinti, kad vertinimai aptinka anksčiau nesuderintai veikusius modelius ir nėra pernelyg pritaikyti konkretiems incidentams.
Manipuliavimo vertinimu stebėjimas: stebėti vertinimo suvokimą ar strateginį prisitaikymą prie testo (kai modeliai atpažįsta, kad yra testuojami), galintį pakeisti elgesį (pvz., atliekant suderinamumo vertinimus įjungti vertinimo suvokimo ir strateginio prisitaikymo stebėseną), ir nustatyti konkrečius blokavimo slenksčius.
Nepalankiausių sąlygų testai: išprovokuoti blogiausią galimą netinkamą elgesį ir patikrinti, ar bent vienas vertinimas jį aptiktų.
Neleisti mokyti pagal minčių grandinę: skatinamojo mokymosi metu neleisti automatizuotoms vertinimo sistemoms matyti minčių grandinės, kad modeliai neišmoktų išvengti minčių grandinės stebėsenos.
Izoliavimas: užtikrinti pakankamai patikimą izoliavimą ir saugumą, kad modeliui tapus nesuderintam būtų užkirstas kelias žalingiems veiksmams. Tai galėtų apimti šias priemones:
Keli infrastruktūros saugumo sluoksniai: daug investuoti tiek į izoliuotosios aplinkos, kurioje veikia modelis, tiek į ją palaikančios tyrimų infrastruktūros saugumo stiprinimą, kad modeliui ištrūkus iš izoliuotosios aplinkos liktų papildomas apsaugos sluoksnis.
Izoliavimo testavimas spragoms nustatyti: stiprinti izoliuotosios aplinkos, tyrimų infrastruktūros ir perimetro saugumą, pakartotinai testuojant šias sistemas spragoms nustatyti. Atlikus saugos analizę, tam naudoti tarpines priešakinių modelių mokymo cikluose išsaugotas modelių versijas, kad būtų aptiktos ir pašalintos visos spragos. Taip pat testuoti visas paslaugas, su kuriomis modelis galėtų sąveikauti mokymo metu (pvz., interneto podėlį), siekiant nustatyti jų spragas.
Ryšys tarp generavimo egzempliorių: didelio pralaidumo ryšį tarp generavimo egzempliorių leisti tik patvirtintais kanalais, pavyzdžiui, per kelių agentų įrankius, ir užverti didelio pralaidumo infrastruktūros šalutinius kanalus, kuriuos agentai gali lengvai aptikti.
Nekeičiami sąveikų įrašai: visų skatinamojo mokymosi, vertinimo ir vidinio diegimo procesų agentų sąveikų įrašus pagrįstą laikotarpį saugoti nekeičiamu pavidalu (pvz., vienkartinio įrašymo saugyklų paskyrose), kad būtų galima patikimai tirti incidentus ir išvengti netyčinių pakeitimų.
Stebėsena: turėti realiuoju laiku veikiančią stebėsenos sistemą, kuri modeliams pradėjus atlikti nesuderintus veiksmus aptiktų galimą nesuderinamumą ir leistų skubiai spręsti prioritetines problemas, kol neįvyko rimtas incidentas. Tai galėtų apimti šias priemones:
Stebimumo užtikrinimas: užtikrinti, kad modelius ir toliau būtų galima stebėti, tai matuojant stebimumo ir stebėsenos vengimo vertinimais su aiškiais slenksčiais, kad nerimą keliantis elgesys būtų aptiktas anksti.
Didelis žinomų problemų aptikimo jautrumas: užtikrinti, kad vertinant pagal atskirai laikomus, mokymui nenaudotus duomenis stebėsenos sistema aptiktų didelę ankstesnių incidentų dalį.
Stebėsenos vertinimų aktualumas: naujiems mokymo ciklams kurti vertinimo duomenų pavyzdžius, atspindinčius visiškai naujas rizikas, kad stebėsenos jautrumo ir tikslumo rodikliai išliktų aktualūs.
Greitas reagavimas: įdiegti prioritetinius perspėjimus, pagal kuriuos būtų imamasi veiksmų per SLA nustatytą laiką: skubiai iškviečiamas budintis specialistas arba automatiškai pristabdomas paveiktas mokymo ciklas, kol modelis dar nepadarė žalos (pvz., dieną apie incidentus skubiai pranešama budinčiam saugumo specialistui ir už ciklą atsakingam asmeniui, o naktį ciklai automatiškai pristabdomi, jei perspėjimo gavimas nepatvirtinamas).
Kartu su rekomendacijomis dėl techninių apsaugos priemonių rengiame gerąją veiklos praktiką, skirtą priešakinio DI mokymo ciklų saugos pagrindimams. Ji galėtų apimti šiuos aspektus:
Prieštaravimai (išankstinė galimų nesėkmių analizė): parengus saugos pagrindimą, kitos komandos narys turėtų raštu pateikti prieštaravimus, atskleisdamas galimas pagrindimo spragas ir pateikdamas pasvertą rizikos vertinimą. Mokymo komanda turėtų į juos atsižvelgti, kad saugos pagrindimas būtų tvirtesnis.
Patvirtinimai: saugos pagrindimą turėtų peržiūrėti aukščiausio lygio vadovai, kurių kiekvienas galėtų vetuoti mokymo ciklą. Taip būtų užtikrinta kelių pakopų vidinė ciklo kontrolė (pvz., tyrimų padalinio vadovo arba viceprezidento, saugos vadovo ir vyriausiojo mokslininko).
Atskaitomybė: už mokymo ciklą atsakingas aukščiausio lygio vadovas (pvz., tyrimų padalinio vadovas arba už tyrimus atsakingas viceprezidentas) turėtų atsakyti už saugos pagrindimą ir reagavimą į incidentus, taip pat ir vertinant jo darbo rezultatus. Taip ir mokymo komandos būtų skatinamos siekti saugos ir suderinamumo.
Pristabdymas: jei nustatoma problemų, dėl kurių saugos pagrindimas nebegaliotų (pvz., nauja saugumo problema), būtina turėti veiksmų instrukcijas, technines kontrolės priemones ir paslaugų lygio susitarimus (SLA), leidžiančius pristabdyti visus į pagrindimo aprėptį patenkančius mokymo ciklus.
Vidinis skaidrumas: saugos pagrindimai turėtų būti prieinami vidinėms priežiūros grupėms (pvz., Saugos ir saugumo komitetui).
Auditai: auditoriams turėtų būti suteikta pakankama prieiga, kad jie galėtų patikrinti saugos pagrindimo teiginių pagrįstumą ir patikimumą bei pranešti apie aptiktas spragas.
Problemų perdavimas aukštesniu lygiu: turėtų būti aiški nesuderinamumo problemų perdavimo aukštesniu lygiu tvarka, lentelė su apibrėžtais nesuderinamumo sunkumo lygiais ir už tokias problemas atsakingas budintis specialistas, galintis skubiai iškviesti vadovus (pvz., generalinį direktorių), kai mokymo cikle pasiekiamas tam tikras sunkumo lygis.
Techninės kontrolės priemonės: žmonėms ir agentams turėtų būti sunku pradėti reikalavimų neatitinkančius mokymo ciklus. Sutrikus tokioms saugos funkcijoms kaip stebėsena ir automatinis pristabdymas, veikla turėtų būti blokuojama (pvz., neturėtų būti įmanoma pradėti mokymo ciklų neįjungus tinkamos stebėsenos arba išjungti stebėseną iš skatinamojo mokymosi, vertinimo ar vidinio diegimo aplinkos).
Galimybė atšaukti poveikį: turėtų būti lengva nustatyti visus tolesnius nesuderinto modelio panaudojimo mokymo procese atvejus (pvz., duomenims generuoti ar rezultatams vertinti), kad prireikus būtų galima panaikinti nesuderintų išvesčių poveikį.
Išsamus likutinių rizikų aprašas: saugos pagrindimuose turėtų būti kuo išsamiau išvardytos likutinės rizikos, kurių neapima šiuo metu įgyvendintos rizikos mažinimo priemonės, kad sprendimai dėl rizikos prisiėmimo būtų pagrįsti turima informacija.
Tai dabartinės mūsų rekomendacijos, kurias šiuo metu įgyvendiname „OpenAI“. Tikimės, kad artimiausiomis savaitėmis mūsų praktika toliau keisis.
Taip pat rengiame gerąją sunkių DI nesuderinamumo incidentų tyrimo praktiką. Laboratorijos turėtų siekti kuo daugiau pasimokyti iš atskirų incidentų (panašiai kaip taikant tyrimo praktiką(atsidaro naujame lange) kitose srityse, kur klaidos gali turėti rimtų pasekmių), kad ateityje galėtų užkirsti kelią tokiems atvejams. Galimų veiksmų pavyzdžiai:
Vidinis skaidrumas: kadangi tyrimas gali užtrukti, organizacijos viduje turėtų būti periodiškai teikiama naujausia informacija apie incidentų tyrimus (pvz., kasdienės ataskaitos apie vykdomus tyrimus). Darbuotojams turėtų būti nustatyta tvarka, pagal kurią jie galėtų gauti platesnę prieigą, įskaitant neredaguotus sąveikų įrašus ir galimybę generuoti nesuderintų modelių išvestis, jei tai saugu ir svarbu jų darbui.
Pirminės nesuderinamumo priežastys: tyrėjai turėtų nustatyti pirmines su mokymo dinamika susijusias priežastis (pvz., atlikdami tikslinius atskirų komponentų pašalinimo ar pakartotinio išvesčių generavimo eksperimentus), kad išsiaiškintų, kaip atsirado nesuderintas elgesys. Tai padėtų geriau suprasti nesuderinamumą moksliniu požiūriu ir veiksmingiau jo išvengti ateityje.
Poincidentinė analizė: reikėtų atlikti veiklos ir organizacinės kultūros analizę, kad būtų išsiaiškintos visos prie incidento prisidėjusios priežastys, pavyzdžiui, kodėl problemos atsirado ir iki incidento liko nepastebėtos arba nebuvo perduotos spręsti aukštesniu lygiu.
Aptikimas: turėtume kurti suderinamumo tikrinimo metodus, kurie galėtų aptikti polinkį sukelti tokį incidentą, tačiau nebūtų tiesiogiai optimizuojami pagal iš incidento gautą informaciją (pvz., sąveikų įrašus ar incidento santraukas). Pagal incidentus parengti vertinimai turėtų būti naudojami kaip „regresijos testai“, siekiant užtikrinti, kad būsimi modeliai nerodytų polinkio į nesuderinamumą labai panašiose situacijose.
Viešas informacijos atskleidimas: baigus tyrimą, jo rezultatais, poincidentinėmis analizėmis ir veiklos pokyčiais reikėtų pasidalyti su visuomene. Apie incidentą paveiktoms trečiosioms šalims reikėtų pranešti kuo greičiau.


