Tipptasemel tehisintellekti treenimise ohutuspõhjenduste poole
Usume, et oleme jõudmas uude ajastusse, kus enne tipptasemel mudelite mis tahes kinnistava õppimise treeningkäigu jätkamist tuleks nõuda struktureeritud ohutusdokumentatsiooni. Ideaalis peaks selline dokumentatsioon vastama „ohutuspõhjenduse“ tasemele: see on terviklik, struktureeritud ja tõenduspõhine riske käsitlev argumentatsioon, mida kasutatakse ka teistes ohutuskriitilistes valdkondades. Peame ohutuspõhjendusi sihiks, mille poole liigume, kuid tunnistame, et tehisintellekti mudelite puhul on raske saavutada sama ranget põhjendatust nagu lennunduses või tuumaenergeetikas. Põhjuseks on tehisintellekti võimekuse iga uue tasemega kaasnev uus keerukus. Töötame raamistiku kallal, mis need tavad süstematiseeriks.
Allpool on esialgsed suunised, mis peaksid meie arvates kuuluma tipptasemel tehisintellekti treenimise ohutuspõhjendustesse. Need head tavad peegeldavad meie seniseid õppetunde. Eeldame, et need arenevad edasi, kui täiustame hoolikaks arendustööks vajalikke sisemisi protsesse. Jagame neid juba praegu, et meie praegused seisukohad oleksid läbipaistvad, ning ootame kogukonna tagasisidet. Pange tähele, et see dokument keskendub tipptasemel mudelite treenimisele kinnistava õppimise abil. Ettevõttesisesel ja -välisel kasutuselevõtul tuleb arvestada märksa laiema hulga eesmärkidega kooskõla aspektidega.
Ohutuspõhjendused peaksid hõlmama tehnilise lahenduse kolme aspekti: eesmärkidega kooskõlla viivat treeningut, isoleerimist ja seiret. Need kaitsemeetmed aitavad tagada, et mudel ei püüaks tegutseda eesmärkidega vastuolus. Isegi kui ta seda teeks, oleks tal raske isolatsioonist välja pääseda ning seire avastaks selle enne kahju tekkimist.
Mudeli kooskõla eesmärkidega: esimene kaitseliin peaks olema mudelite treenimine eesmärkidega kooskõlas tegutsema, st käituma usaldusväärselt nii, nagu me soovime. See võiks hõlmata järgmist.
Treeningkeskkonnad ja hindamine: vähendage riski, et mudelitel kujuneb eesmärkidega vastuolus olev käitumine, vältides tasusüsteemi ärakasutamise positiivset kinnistamist treeningu ajal. See võiks hõlmata järgmist.
Andmestike automaatne ülevaatus: kasutage agente, et leida ja parandada vigaseid kinnistava õppimise keskkondi, kus eesmärkidega vastuolus olevad tegevusjadad võivad saada suure tasu nõrkuste ärakasutamise, mitte soovitud käitumise eest. Nii väheneb võimalus sellist käitumist treeningu käigus kinnistada.
Andmestike käsitsi ülevaatus: täiendage automaatset lööktestimist andmestike käsitsi ülevaatuse ja kvaliteedikontrolliga, et leida vigased ülesanded, mis võivad tahtmatult kinnistada eesmärkidega vastuolus olevat käitumist.
Hindajate häälestamine: häälestage hindajaid karistama mudeli katseid treeningu ajal kinnistava õppimise keskkondade nõrkusi ära kasutada või neid keskkondi manipuleerida.
Varasemate treeningkäikude analüüs: rakendage klassifikaatoreid varasemate katsete tegevuslogidele, et kontrollida hindajate ettenähtud toimimist.
Eesmärkidega kooskõla mõõtmine: tehke hindamisi, mis jälgivad mudeli kalduvust käituda eesmärkidega vastuolus, et mõõta kooskõlla viiva treeningu tõhusust. See võiks hõlmata järgmist.
Eesmärkidega kooskõla eraldiseisvad hindamised: hinnake tipptasemel mudelite treeningkäikude jooksul nende kooskõla eesmärkidega, et kontrollida, kas treening toimib ettenähtult, ning uurige kõiki olulisi tagasilangusi.
Tagantjärele testimine: testige eesmärkidega kooskõla hindamise meetodeid varasemate intsidentide peal, et kinnitada nende suutlikkust tuvastada varem eesmärkidega vastuolus käitunud mudeleid ning veenduda, et meetodid pole konkreetsete intsidentidega üle sobitatud.
Hindamisega manipuleerimise jälgimine: jälgige hindamisteadlikkust või metatasandi strateegilist käitumist (mudel saab aru, et teda testitakse), mis võib põhjustada käitumise muutust. Näiteks lubage eesmärkidega kooskõla hindamisel nende nähtuste seire ja määrake konkreetsed blokeerimisläved.
Halvima stsenaariumi koormustestid: kutsuge esile halvim võimalik väärkäitumine ja kontrollige, et vähemalt üks hindamistest selle tuvastaks.
Mõttekäigu põhjal treenimise vältimine: ärge andke automaatsetele hindajatele kinnistava õppimise ajal juurdepääsu mõttekäigule, et mudelid ei õpiks mõttekäigu seirest kõrvale hoidma.
Isoleerimine: tagage piisavalt tugev liivakastieraldus ja turve, et vältida kahjulikke tegevusi juhul, kui mudel hakkab käituma eesmärkidega vastuolus. See võiks hõlmata järgmist.
Taristu mitmekihiline turve: panustage oluliselt nii mudeli töökeskkonnaks oleva liivakasti kui ka seda majutava teadustaristu turbe tugevdamisse, et liivakastist väljapääsemise korral oleks olemas täiendav kaitsekiht.
Isolatsiooni lööktestimine: parandage liivakasti, teadustaristu ja perimeetri turvet, tehes neile süsteemidele korduvalt lööktestimist tipptasemel mudelite treeningkäikude vaheversioonidega. Lähtuge ohutusanalüüsist, et leida ja kõrvaldada kõik lüngad. Tehke lööktestimist ka kõigile teenustele, millega mudel võib treeningu ajal kokku puutuda (nt interneti vahemälu).
Genereerimiskordade vaheline suhtlus: lubage suure läbilaskevõimega suhtlust genereerimiskordade vahel ainult heakskiidetud kanalite kaudu, näiteks mitme agendi tööriistade abil, ning sulgege taristu kõrvalkanalid, mis on suure läbilaskevõimega ja agentidele kergesti leitavad.
Muutmatud vestlussalvestised: säilitage agentide vestlussalvestisi mõistliku aja vältel muutmatul kujul (näiteks ühekordset kirjutamist võimaldavatel salvestuskontodel) kogu kinnistava õppimise, hindamise ja ettevõttesisese kasutuselevõtu ulatuses, et võimaldada intsidente usaldusväärselt uurida ja vältida tahtmatuid muudatusi.
Seire: kui mudelid hakkavad käituma eesmärkidega vastuolus, peab reaalajas seiresüsteem võimaliku kõrvalekalde tuvastama ja võimaldama kiireloomuliste probleemidega kiiresti tegeleda, enne kui saab tekkida tõsine intsident. See võiks hõlmata järgmist.
Seiratavuse tagamine: tagage, et mudelid jäävad seiratavaks, mõõtes seda selgete lävenditega seiratavuse ja seirest kõrvalehoidmise testidega, et tuvastada murettekitav käitumine varakult.
Teadaolevate probleemide kõrge saagis: tagage, et seiresüsteem tuvastab eraldi hoitud hindamisandmestikus suure osa varasematest intsidentidest.
Seire hindamisandmete ajakohasus: looge hindamisnäiteid, mis esindavad uute treeningkäikude täiesti uusi riske, et seire saagise ja täpsuse mõõdikud ei vananeks.
Kiire reageerimine: rakendage prioriteetseid hoiatusi, mis toovad kaasa tegutsemise teenustaseme kokkuleppes määratud aja jooksul, kas valvevastutaja väljakutsumise või asjaomase treeningkäigu automaatse peatamise kaudu, enne kui mudel kahju põhjustab. Näiteks kutsuge päevaste intsidentide korral reageerima turbe valvevastutaja ja treeningkäigu vastutaja ning peatage öösel treeningkäigud automaatselt, kui hoiatusele ei vastata.
Lisaks tehniliste kaitsemeetmete soovitustele oleme töötanud välja töökorralduslikke häid tavasid tipptasemel tehisintellekti treeningkäikude ohutuspõhjenduste jaoks. Need võiksid hõlmata järgmist.
Vastuargumendid (ennetav analüüs): pärast ohutuspõhjenduse koostamist peaks teise meeskonna liige kirjutama vastuväiteid esitava analüüsi, et leida põhjenduses võimalikke lünki ja anda tasakaalustatud riskihinnang. Treeningmeeskond peaks seejärel neile vastama, et ohutuspõhjendusi tugevdada.
Heakskiidud: ohutuspõhjenduse peaksid läbi vaatama tippjuhid, kellest igaühel peaks olema õigus treeningkäik keelata, et tagada mitu sisemist kontrollitasandit (nt teadusüksuse juht või teadusvaldkonna asepresident, ohutusjuht ja peateadur).
Vastutus: treeningkäigu eest vastutav tippjuht (nt teadusüksuse juht või teadusvaldkonna asepresident) peaks vastutama ohutuspõhjenduse ja võimalikele intsidentidele reageerimise eest. Seda tuleks arvestada ka tema töötulemuste hindamisel, et motiveerida treeningmeeskondi edendama ohutust ja kooskõla seatud eesmärkidega.
Peatamine: kui leitakse probleeme, mis muudavad ohutuspõhjenduse kehtetuks (nt uus turvaprobleem), peavad kõigi sellega hõlmatud treeningkäikude peatamiseks olema olemas tegevusjuhised, tehnilised kontrollimeetmed ja teenustaseme kokkulepped.
Sisemine läbipaistvus: ohutuspõhjendused peaksid olema kättesaadavad sisemistele järelevalverühmadele (nt Ohutuse ja turvalisuse komiteele).
Auditid: audiitoritele tuleks anda piisav juurdepääs, et kontrollida ohutuspõhjenduses esitatud väidete paikapidavust ja põhjendatust ning tuua esile leitud lüngad.
Probleemide suunamine kõrgemale tasandile: eesmärkidega vastuolus oleva käitumise probleemide edastamiseks peaks olema selge kord, rikkumiste raskusastmete tabel ja valvevastutaja, kes saab kutsuda juhtkonna liikmed (nt tegevjuhi) reageerima, kui treeningkäigus ilmnev probleem jõuab kindla raskusastmeni.
Tehnilised kontrollimeetmed: nõuetele mittevastavate treeningkäikude käivitamine peaks olema keeruline nii inimestele kui ka agentidele. Ohutusfunktsioonid, nagu seire ja automaatne peatamine, peaksid tõrke korral tegevuse blokeerima (nt ei tohiks olla võimalik käivitada treeningkäike ilma asjakohase seireta ega lülitada seiret välja kinnistava õppimise, hindamise või ettevõttesisese kasutuselevõtu käigus).
Tagasipööramise võimalus: eesmärkidega vastuolus oleva mudeli kõik edasised kasutuskohad treeningprotsessis (nt andmete genereerimine või hindamine) peaksid olema hõlpsasti tuvastatavad, et vajaduse korral saaks kõrvaldada eesmärkidega vastuolus olevate väljundite mõju.
Jääkriskide täielik käsitlus: ohutuspõhjendustes tuleks võimalikult ammendavalt loetleda jääkriskid, mida praegu rakendatavad leevendusmeetmed ei kata, et riskide aktsepteerimise otsused oleksid teadlikud.
Need on meie praegused soovitused, mida OpenAI-s parajasti rakendatakse. Eeldame, et meie töövõtted arenevad ka lähinädalatel edasi.
Oleme välja töötanud ka häid tavasid selliste tõsiste intsidentide uurimiseks, kus tehisintellekt käitub seatud eesmärkidega vastuolus. Uurimislaborid peaksid püüdma üksikjuhtumitest võimalikult palju õppida (sarnaselt teiste suurte riskidega valdkondade uurimistavadele(avaneb uues aknas)), et tulevikus selliseid juhtumeid ennetada. Võimalikud tegevused on näiteks järgmised.
Sisemine läbipaistvus: kuna uurimise lõpuleviimine võib võtta palju aega, tuleks intsidentide uurimise edenemisest organisatsiooni sees korrapäraselt ülevaateid anda (nt poolelioleva uurimise ajal iga päev). Töötajatel peaks olema kindlaksmääratud kord laiema juurdepääsu taotlemiseks, sealhulgas algsetele vestlussalvestistele ja eesmärkidega vastuolus olevatelt mudelitelt väljundite genereerimisele, kui see on ohutu ja nende töö jaoks vajalik.
Eesmärkidega vastuolus oleva käitumise algpõhjus: teadlased peaksid uurima treeningu dünaamikat algpõhjuste tasandil (nt sihipäraste ablatsiooni- või kordusgenereerimiskatsete abil), et mõista, kuidas eesmärkidega vastuolus olev käitumine tekkis. See aitaks nähtust teaduslikult paremini mõista ja tulevikus tõhusamalt ennetada.
Järelanalüüs: teha tuleks töökorralduse ja organisatsioonikultuuri järelanalüüs, et mõista kõiki intsidenti soodustanud põhjuseid, näiteks miks probleemid tekkisid ning miks neid enne intsidenti ei avastatud või kõrgemale tasandile ei edastatud.
Tuvastamine: peaksime arendama eesmärkidega kooskõla testimise meetodeid, mis suudavad tuvastada kalduvuse intsidenti põhjustada, optimeerimata neid otseselt intsidendist saadud teabe (nt vestlussalvestiste või intsidendi kokkuvõtete) põhjal. Intsidentidel põhinevad hindamistestid tuleks luua „regressioonitestidena“, et tulevased mudelid ei ilmutaks väga sarnastes olukordades kalduvust käituda eesmärkidega vastuolus.
Avalikustamine: uurimistulemusi, järelanalüüse ja töökorralduslikke muudatusi tuleks pärast uurimise lõppu avalikkusega jagada. Mõjutatud kolmandaid osapooli tuleks teavitada esimesel võimalusel.


