Tõhusate kolmandate osapoolte hindamiste prioriteedid ja põhimõtted
Tipptasemel tehisintellekti laboritel on tohutu vastutus mudelite ohutu treenimise, hindamise ja kasutuselevõtu eest. Kolmandate osapoolte hinnangud on selle vastutuse tasakaalustamisel üliolulised: need avardavad võimalusi tehisintellekti ohutuse teemal kaasa rääkida, hoiavad maailma kursis ning tagavad, et laborid vastutavad selgete ja sõltumatult kinnitatud ohutusväidete eest.
Osana meie jõupingutustest tipptasemel tehisintellekti arenguga sammu pidada on OpenAI pühendunud sõltumatute hindamiste toetamisele, pakkudes ulatuslikku juurdepääsu treenimisele, hindamisele ja kasutuselevõtule. See juurdepääs peaks võimaldama hindajatel meie eeldusi kahtluse alla seada, leida riske, mida me ei pruukinud märgata, ning teha meie kaitsemeetmete tõhususe kohta oma järeldusi.
Oleme juba pikka aega teinud mudeli arendamise ja kasutuselevõtu eri etappides koostööd kolmandatest osapooltest hindajatega. Oleme lisanud kolmandate osapoolte hindamised ka oma Valmisoleku raamistiku tavadesse ning toetanud organisatsioone ja õigusakte, mis edendavad rangemat ja vastutustundlikumat protsessi. Oleme nende koostööprojektide käigus pakkunud ulatuslikku juurdepääsu, sealhulgas teavet oma tehniliste kaitsemeetmete kohta, juurdepääsu nähtavale mõttekäigule ning enneolematul tasemel juurdepääsu konfidentsiaalsetele andmetele ja sisemisele kasutuskeskkonnale, et reageerida intsidentidele ja teha seire lööktestimist. Siin esitatud prioriteedid ja põhimõtted käsitlevad meie koostööd erasektori ja mittetulundussektori sõltumatute hindamisorganisatsioonidega tehnilise ohutuse hindamisel. Need täiendavad meie koostööd valitsustega testimise ja hindamise vallas, kus erinevad rollid ja kohustused võivad nõuda teistsuguseid lähenemisviise.
Tõhus hindamine eeldab tugevaid sõltumatuse tagamise mehhanisme, teaduslikku rangust, töökindlaid turvatavasid ja selgeid kohustusi. Laborid peavad võimaldama sisulist kontrolli, kaitstes samal ajal tundlikku teavet. Laborid ja sõltumatud hindajad vastutavad ühiselt selle eest, et hindamine toimiks õigesti, ning peaksid lähtuma ühistest rahvusvahelistest ohutus- ja turvatavade standarditest. Allpool pakume põhjalikumaks hindamiseks välja neli prioriteetset valdkonda ning range, turvalise ja sõltumatu töö põhimõtted.
Kolmandate osapoolte hinnangud on kõige kasulikumad siis, kui need käsitlevad konkreetseid ja olulisi küsimusi. Kas tõendid toetavad labori ohutuspõhjendust ja ohutusväiteid? Kas hindamised kontrollivad piisavalt riske, mille mõõtmiseks need on mõeldud? Kas kaitsemeetmed toimivad realistlikes tingimustes?
Siin kirjeldatud hindamised võivad sõltuvalt uuritavast ohutusküsimusest olla eri vormis. Kavatseme toetada mitut hindamist paralleelselt ja eri ajavahemike jooksul: mõni kestab nädalaid, teine mitu kuud. Kuigi kolmandate osapoolte hindamised võivad kuuluda ka kasutuselevõtule eelneva töö hulka ja mõjutada kasutuselevõtuotsuseid, on siin kirjeldatud töö üldiselt pikaajalisem ega sõltu turuletoomisest. Selle eesmärk on uurida aja jooksul põhjalikult konkreetseid ohutusväiteid.
Kasutame oma prioriteetsete valdkondade ja põhimõtete kirjeldamisel mõisteid „ohutusväited“ ja „ohutuspõhjendused“. Nende mõistete all peame silmas järgmist:
Ohutusväide: konkreetne väide mudeli või süsteemi võimekuse, käitumise või kaitsemeetmete kohta, mis puudutab selle ohutust ja mida saab tõendite alusel hinnata. Väites tuleks määratleda käsitletavad riskid ja tingimused ning asjakohased eeldused ja piirangud.
Ohutuspõhjendus: tõenditele tuginev struktureeritud argument, mis selgitab, miks on mudeli või süsteemi riskid konkreetse tegevuse, näiteks treenimise, hindamise või kasutuselevõtu jaoks piisavalt maandatud. Ohutuspõhjendus seob üksikud ohutusväited neid toetavate tõenditega ning toob selgelt välja eeldused, ebakindluse ja allesjäänud riskid, mis võivad järeldusi mõjutada.
Pakume põhjalikumaks hindamiseks välja neli prioriteetset valdkonda ning range, turvalise ja sõltumatu töö põhimõtted.
Ohutuspõhjenduste sõltumatu hindamine treenimise, hindamise ning sisemise ja välise kasutuselevõtu ulatuses.
Ohutuspõhjenduste hindamine nõuab eriteadmisi joondamise, juhtimismeetodite (näiteks seire), küberturvalisuse, bioloogilise ja keemilise väärkasutuse ning lööktestimise alal. Ohutuspõhjendused koosnevad muu hulgas treenimist, võimekuse hindamisi ja kaitsemeetmeid puudutavatest väidetest, mida saab hinnata tervikuna või osade kaupa (vt allpool prioriteete 2 ja 3). Tõenäoliselt peavad põhjenduste eri osi uurima mitu hindajat, kes tuginevad oma vastavatele eriteadmistele. Nende hinnangud peaksid üheskoos vastama näiteks järgmistele küsimustele:
Kas treenimise, hindamise ja kasutuselevõtu ohutuspõhjenduste tõendid on piisavalt kinnitatud? Kas treenimisel, hindamisel ja kasutuselevõtul järgiti ohutuspõhjenduse tingimusi?
Kas meie ohutuspõhjendused hõlmavad hindamise käigus tuvastatud kõige pakilisemaid riske? Kas ohutusväited toetavad üldist ohutuspõhjendust? Kas esineb puudusi või täiustamist vajavaid valdkondi?
Kas kasutatakse tõhusaid meetodeid, et tuvastada ja vähendada treenimisel stiimuleid, mis võivad premeerida petmist, preemia häkkimist, hävitavat tegevust või piirangutest kõrvalehoidmist?
Kriitiliste kaitsemeetmete hindamine sisemise ja välise kasutuselevõtu ulatuses
Arendame oma kaitsemeetmete kogumit pidevalt, et see vastaks muutuvale võimekusele ja olukorrale. Meie kaitsemeetmed hõlmavad treenimist ning sisemist ja välist kasutuselevõttu. Praegu hõlmavad need mudelitasandi, reeglite jõustamise ja turbe kaitsemeetmeid ning joondamatuse seirevahendeid, kattes mitmesuguseid riske, nagu kontrolli kaotus ning väärkasutus küber-, bioloogiliste ja keemiliste riskide valdkonnas. Tehnilised partnerlused aitavad juba praegu kaitsemeetmete nõrkusi tuvastada, täiustades samal ajal hindamismeetodeid ja kiirendades standardite väljatöötamist. See loob tugevama tehnilise aluse tulevasele avalikule poliitikale, mis aitab tipptasemel tehisintellekti arenguga sammu pidada, eriti sisemise kasutuselevõtu puhul, kus ohutus- ja turvastandardid on alles kujunemas.
Sõltumatute hindamiste käigus tuleks uurida, kui hästi need kaitsemeetmed toimivad ja millised võivad olla nende puudused, näiteks:
Kas „halli kasti“ juurdepääsu korral peavad kaitsemeetmed vastu vastandtestimisele (jailbreak’idele) ja kaitsevad piisavalt võimekuse suurenemise eest suure riskiga valdkondades, näiteks küber- ja biovaldkonnas? Kas meie vastandtestimine ja lööktestimine hõlmavad kõige olulisemaid riske?
Kuidas suhtlevad agendid realistlikes töötingimustes volitatud testimise käigus küberkaitsemeetmetega, nagu juurdepääsukontroll, liivakastid ning tuvastus- ja reageerimissüsteemid? Millised kaitsemeetmed ennetavad, tuvastavad või piiravad kahjulikke tegevusi ning kus need ebaõnnestuvad?
Kas meie joondamatuse seirevahendites on kriitilisi puudusi, mis võivad sisemise või välise kasutuselevõtu korral põhjustada kontrolli kaotuse või ränga joondamatuse? Kui usaldusväärne on mudelite võimekuse paranedes mõttekäigu seire ohutust või joondatust tõendava teabe allikana?
Kas kogu asjakohase treenimise, hindamise ja kasutuselevõtu vältel rakendatakse sobivat seiret viisil, mida ei saa hõlpsasti välja lülitada?
Kas rakendatud kaitsemeetmed vastavad võimekusele?
Valmisoleku riskikategooriaid (keemilised ja bioloogilised riskid, küberturvalisus, tehisintellekti enesetäiustamine) hõlmavate võimekuse hindamiste ning joondamatuse riske käsitlevate joondatuse hindamiste analüüs
Meie Valmisoleku raamistik nõuab peamiste eesliiniriskide hindamist. Kui künnised ületatakse ja hindamiste eristusvõime ammendub, on oluline Valmisoleku riskivaldkondade võimekuse hindamisi ning ränka joondamatust käsitlevaid joondatuse hindamisi järjepidevalt uuendada ning tagada nende katvus ja kvaliteet.
Asjakohased küsimused on muu hulgas järgmised:
Kas Valmisoleku riske käsitlevad hindamised hõlmavad piisavalt Valmisoleku riskikünnise määratlust? Kas nende hindamiste künnised on õigesti määratud?
Kas hindamisi uuendatakse, kui mudelid saavutavad pidevalt kõrgeimaid tulemusi, ja kas uued testid mõõdavad sisuliselt arenenumat võimekust?
Kas meie joondatuse hindamised hõlmavad piisavalt ränga joondamatuse riske ning millised olulised käitumisviisid või tingimused võivad neis tähelepanuta jääda?
Kriitiliste joondamatuse intsidentide sõltumatu uurimine
Sõltumatu uurimine võib olla kasulik mitmesuguste kriitiliste tehisintellekti ohutusintsidentide puhul. Keskendume siin mudelite joondamatusele, sealhulgas juhtudele, kus mudelid tegutsevad loata või väldivad järelevalvet. Selline käitumine võib ka tahtliku väärkasutuseta paljastada joondamismeetodite ja kaitsemeetmete nõrkusi.
Teatud juhtudel, nagu OpenAI Hugging Face’i intsidendi puhul, võib olla kasulik kaasata sõltumatu kolmas osapool tegema sõltumatut joondamatuse intsidendi uurimist. On ülioluline, et intsidendi uurimisse kaasatud kolmandatel osapooltel oleksid vajalikud uurimisteadmised, sealhulgas vajaduse korral küberkriminalistika- ja joondamisalased eriteadmised, ulatusliku mõttekäiguanalüüsi oskus ning piisavalt töötajaid ja ressursse uurimise õigeaegseks läbiviimiseks. Intsidendile reageerimine võib nõuda juurdepääsu tundlikele siseandmetele ja kolmandate osapoolte andmetele, mistõttu võib mõne üksikasja avaldamine või neile juurdepääsu andmine olla tundlik. Sõltumatute uurimiste leiud võivad toetada ka mudeli ohutuspõhjendust, pakkudes tõendeid selle joondatust ja varem täheldatud joondamatuse kõrvaldamiseks võetud meetmete tõhusust puudutavate väidete hindamiseks.
Joondamatuse intsidentide puhul peame sõltumatus hindamises esmatähtsaks järgmisi küsimusi:
Milline mudeli käitumine või millised joondamatuse probleemid intsidendi käigus ilmnesid ning mis olid peamised soodustavad tegurid?
Kas kaitsemeetmed ja parandusmeetmed vähendaksid tulevikus sarnaste intsidentide ohtu tõhusalt?
Selgelt piiritletud ja vastastikku kokku lepitud hinnatavad väited: hindamist tuleks alustada vastastikku kokku lepitud ulatusest ning seejärel määratleda selgelt ohutusväited, mis registreeritakse enne hindamistegevuse algust. Kolmandad osapooled ja laborid peaksid selgitama, kas tegemist on väidetega, mille hinnatav ettevõte soovib hindamiseks esitada, või väidetega, mida kolmandast osapoolest hindaja soovib sõltumatult hinnata ja mille alusel hindamisega labor nõustub. Mõni väide võib jääda hindamisest välja mitmel põhjusel, sealhulgas seetõttu, et kolmandatel osapooltel pole võimalik andmetele juurde pääseda, hindajal puuduvad piisavad eriteadmised või kiireloomulise hindamise aeg on põhjendatult piiratud. Laborid ja hindajad peaksid kehtestama korra algsest ulatusest väljaspool tuvastatud oluliste riskide käsitlemiseks, sealhulgas otsustamiseks, kas neid tuleks täiendavalt uurida. Järeldustes tuleks vastastikku kokku lepitud ulatuse alusel selgelt märkida, mida hinnati ja mida mitte.
Proportsionaalne juurdepääs: võimaluse korral peaks hindajatel olema kokkulepitud väidete hindamiseks piisav juurdepääs, arvestades õiguslikke, turbe- ja intellektuaalomandi piiranguid. Kui otsene juurdepääs pole otstarbekas või võimalik, võivad hindajad teha koostööd ettevõtte määratud esindajaga või kasutada teabe kaitsmiseks kaudseid või privaatsust säilitavaid juurdepääsumehhanisme.
Läbipaistev metoodika ja standardid: hindajad peaksid selgitama oma meetodeid, hindamiskriteeriume ja ebakindlust ning võimaluse korral tuginema kehtestatud standarditele. Kui standardeid veel pole, peaksid nad kasutatavaid kriteeriume selgelt põhjendama. Aruannetes tuleks eristada otseseid leide tõlgendustest, selgitada ebakindlust ja näidata selgelt, milliseid järeldusi tõendid toetavad.
Asjatundlikkus ja sõltumatus: hindajad peaksid tõendama asjakohaseid tehnilisi eriteadmisi ning tuvastama, avalikustama ja lahendama organisatsioonilised ja isiklikud huvide konfliktid, sealhulgas rahalised stiimulid, suhted arendajatega ja varasema osaluse hinnatavas töös. Kaitsemeetmed tuleks kujundada nii, et äriline surve ja tasustamiskord ei mõjutaks leide. Need võivad hõlmata taandumist või sobivaid taandamisperioode.
Turvalisus ja konfidentsiaalsus: hindajad peaksid rakendama infoturbetavasid ja jõustatavaid konfidentsiaalsusmeetmeid, mis hõlmavad nende töötajaid ning vastavad juurdepääsetavate süsteemide ja teabe tundlikkusele. Need kaitsemeetmed peaksid hõlmama intellektuaalomandit, tundlikku teavet ja hindamisdokumente. Kui hindajad ei suuda oma keskkonnas turvanõudeid täita või juurdepääsetavad andmed on eriti tundlikud, võib olla kohane kasutada ettevõtte hallatavaid seadmeid või ruume.
Rakendatavad leiud ja aeg puuduste kõrvaldamiseks: hindamisel tuleks tuvastada konkreetsed puudused ja esitada piisavalt üksikasju, et laborid saaksid need kõrvaldada. Vajaduse korral tuleks anda laboritele enne avaldamist mõistlik aeg probleemide kõrvaldamiseks. Asjakohasel juhul tuleks aruannetes kirjeldada ka agentide arendajatele, kasutuselevõtjatele ja kaitsjatele kasulikke õppetunde ning anda praktilisi rakendussoovitusi.
Vastutustundlik avaldamine: hindamisaruanded peaksid põhinema tõenditel ja olema võimalikult avalikud, kaitstes samal ajal tundlikku ja konfidentsiaalset teavet. Kui täielik avalikustamine pole võimalik, võib aruandekohustust toetada konfidentsiaalne aruandlus asjakohastele järelevalveorganitele, näiteks ettevõtte juhtimisorganitele või nõukogudele. Sõltumatuse ja konfidentsiaalsuse tasakaalu säilitamiseks peaksid kehtima põhimõttekindlad teabe eemaldamise kaitsemeetmed ja eeskirjad ning selged ootused tagasiside ja ebatäpsuste parandamise kohta. Hindajad peaksid säilitama toimetusliku sõltumatuse ning tagama konfidentsiaalsuse ja intellektuaalomandi kaitse. Hindajad peaksid kehtestama selged teabe eemaldamise eeskirjad, mis võimaldavad laboritel taotleda tundliku teabe eemaldamist, kuid hindajatel märkida, kus on tehtud sisulisi eemaldusi ja kuidas need hindamisaruannet mõjutavad.
Oleme pühendunud sõltumatute hindajate toetamisele ning selgemate ühiste rahvusvaheliste standardite loomisele tõhusaks kolmandate osapoolte hindamiseks nii tulevaste seaduste kui ka eraõiguslike juhtimisasutuste kaudu. Kuigi sõltumatu hindamise ökosüsteem alles kasvab, aitame selle arengule kaasa, toetades mitmekesist sõltumatute hindajate kogukonda, kellel on tipptasemel tehisintellekti ohutusküsimustes põhjalikud eriteadmised, ja tehes nendega koostööd. Ükski kolmas osapool ei suuda ega peakski kõiki pakilisi tipptasemel tehisintellekti ohutusküsimusi ammendavalt käsitlema. Suurendame oma suutlikkust läbimõeldult ja sihipäraselt ning aitame kasvaval kolmandate osapoolte ökosüsteemil parimate tavade ja põhimõtete suhtes ühisele seisukohale jõuda. Arutame mitme kolmanda osapoolega ettepanekuid, mis vastavad eespool nimetatud prioriteetsetele valdkondadele.


