Í átt að öryggisrökstuðningi fyrir þjálfun háþróaðrar gervigreindar
Við teljum að við séum að ganga inn í nýtt tímabil þar sem krefjast ætti skipulegra öryggisgagna áður en haldið er áfram með nokkra þjálfunarkeyrslu háþróaðra líkana með styrkingarnámi. Helst ættu slík gögn að uppfylla kröfur um „öryggisrökstuðning“ — heildstæðan, skipulegan og gagnreyndan rökstuðning um áhættu, eins og notaður er í öðrum atvinnugreinum þar sem öryggi skiptir sköpum. Við lítum á öryggisrökstuðning sem metnaðarfullt langtímamarkmið sem við vinnum að. Jafnframt viðurkennum við að erfitt er að gera jafn strangar kröfur til hans fyrir gervigreindarlíkön og í flugi eða kjarnorkuvinnslu, vegna hins nýja flækjustigs sem myndast við hvert nýtt getustig gervigreindar. Við vinnum að ramma til að festa þessar starfsvenjur í sessi.
Hér að neðan eru fyrstu leiðbeiningar sem við teljum að ættu að vera hluti af slíkum öryggisrökstuðningi fyrir þjálfun háþróaðrar gervigreindar. Þessar bestu starfsvenjur endurspegla það sem við höfum lært hingað til. Við gerum ráð fyrir að þær þróist áfram samhliða stöðugum endurbótum á innri ferlum okkar fyrir vandaða þróun. Við deilum þeim nú til að sýna með gagnsæjum hætti hvernig við hugsum þessi mál og óskum eftir ábendingum frá samfélaginu. Athugið að þetta skjal beinist að þjálfun háþróaðra líkana með styrkingarnámi. Við innri og ytri notkun þarf að huga að mun fleiri þáttum sem varða samræmi við ætluð markmið.
Öryggisrökstuðningur ætti að ná yfir þrjá þætti tæknikerfisins: þjálfun í samræmi við ætluð markmið, afmörkun og vöktun. Þessar öryggisráðstafanir hjálpa til við að tryggja að líkanið reyni ekki að grípa til aðgerða sem stangast á við ætluð markmið. Jafnvel þótt það gerði slíka tilraun væri erfitt að brjótast út úr afmörkuðu umhverfi og vöktun myndi greina hana áður en tjón gæti orðið.
Samræmi líkana við ætluð markmið: Fyrsta varnarlínan ætti að vera að þjálfa líkön þannig að þau samræmist ætluðum markmiðum, þ.e. hegði sér á áreiðanlegan hátt eins og við ætlumst til. Þetta gæti meðal annars falið í sér:
Þjálfunarumhverfi og einkunnagjöf: Draga úr hættu á að líkön þrói með sér hegðun sem víkur frá ætluðum markmiðum með því að koma í veg fyrir að misnotkun umbunarkerfa fái jákvæða styrkingu í þjálfun. Þetta gæti meðal annars falið í sér:
Sjálfvirk yfirferð gagnasafna: Nota fulltrúa til að finna og laga galla í styrkingarnámsumhverfum sem gætu gert aðgerðarrunum er víkja frá ætluðum markmiðum kleift að fá háa umbun með misnotkun veikleika fremur en tilætlaðri hegðun. Þannig megi fækka tækifærum til að styrkja slík frávik í þjálfun.
Handvirk yfirferð gagnasafna: Bæta handvirkri yfirferð og gæðaeftirliti með gagnasöfnum við sjálfvirkar prófanir rauðteyma til að greina gölluð verkefni sem gætu óviljandi styrkt hegðun sem víkur frá ætluðum markmiðum.
Stilling einkunnagjafa: Stilla einkunnagjafa þannig að þeir refsi fyrir tilraunir líkansins til að nýta veikleika í styrkingarnámsumhverfum eða brjótast inn í þau meðan á þjálfun stendur.
Greining fyrri keyrslna: Keyra flokkara á ferilskrám úr fyrri tilraunum til að ganga úr skugga um að einkunnagjafar virki eins og til er ætlast.
Mæling á samræmi við ætluð markmið: Keyra matspróf sem fylgjast með tilhneigingu líkansins til að víkja frá ætluðum markmiðum, til að mæla árangur þjálfunarinnar í að tryggja slíkt samræmi. Þetta gæti meðal annars falið í sér:
Aðskilin matspróf á samræmi við ætluð markmið: Keyra matspróf á samræmi við ætluð markmið meðan á þjálfunarkeyrslum háþróaðra líkana stendur til að meta hvort þjálfunin skili tilætluðum árangri, og rannsaka alla umtalsverða afturför.
Prófun á sögulegum gögnum: Prófa mat á samræmi við ætluð markmið á fyrri atvikum til að staðfesta að það greini líkön sem áður hafa vikið frá þeim og sé ekki ofsniðið að tilteknum atvikum.
Eftirlit með tilraunum til að spila á matspróf: Fylgjast með matsvitund eða herkænsku gagnvart prófunum (þegar líkön átta sig á að verið er að prófa þau) sem gæti valdið hegðunarbreytingu. Til dæmis mætti virkja vöktun á matsvitund og slíkri herkænsku í prófum á samræmi við ætluð markmið, með tilteknum stöðvunarmörkum.
Álagspróf fyrir verstu tilvik: Kalla fram verstu mögulegu óæskilegu hegðun og athuga hvort að minnsta kosti eitt matspróf greini hana.
Koma í veg fyrir þjálfun út frá hugsanakeðju: Ekki leyfa sjálfvirkum einkunnagjöfum að sjá hugsanakeðjuna í styrkingarnámi, svo líkön þrói ekki með sér hæfni til að komast hjá vöktun hugsanakeðjunnar.
Afmörkun: Tryggja nægilega öflugt sandkassaumhverfi og öryggisvarnir til að koma í veg fyrir skaðlegar aðgerðir ef líkan fer að víkja frá ætluðum markmiðum. Þetta gæti meðal annars falið í sér:
Marglaga öryggi innviða: Leggja mikið í að herða varnir bæði sandkassans sem líkanið keyrir í og rannsóknainnviðanna sem hýsa hann, svo við höfum viðbótarvörn ef líkanið sleppur úr sandkassanum.
Prófanir rauðteyma á afmörkun: Bæta öryggi sandkassa, rannsóknainnviða og ytri varna með endurteknum prófunum rauðteyma á þessum kerfum. Nota til þess vistaðar millistöður úr þjálfunarkeyrslum háþróaðra líkana, að undangenginni öryggisgreiningu, til að finna og loka glufum. Láta rauðteymi einnig prófa allar þjónustur sem líkanið gæti komist í snertingu við í þjálfun (t.d. vefskyndiminni).
Samskipti milli sýna: Takmarka samskipti með mikla bandbreidd milli sýna við samþykktar leiðir, svo sem verkfæri fyrir marga fulltrúa, og loka hliðarrásum í innviðum sem hafa mikla bandbreidd og fulltrúar geta auðveldlega fundið.
Óbreytanlegar samskiptaskrár: Vista samskiptaskrár fulltrúa á óbreytanlegu formi í hæfilega langan tíma (til dæmis á geymslureikningum sem aðeins leyfa eina ritun) fyrir allt styrkingarnám, mat og innri notkun. Þannig megi tryggja áreiðanlegar atvikarannsóknir og koma í veg fyrir óviljandi breytingar.
Vöktun: Hafa vöktunarkerfi í rauntíma sem greinir hugsanleg frávik frá ætluðum markmiðum ef líkön fara að grípa til aðgerða sem stangast á við þau, og bregðast hratt við brýnum vandamálum áður en alvarlegt atvik getur orðið. Þetta gæti meðal annars falið í sér:
Tryggja að hægt sé að vakta líkön: Tryggja að áfram sé hægt að vakta líkön, samkvæmt matsprófum með skýrum viðmiðunarmörkum sem mæla vöktunarhæfi og tilraunir til að komast hjá vöktun, svo varhugaverð hegðun greinist snemma.
Hátt heimtuhlutfall fyrir þekkt vandamál: Tryggja að vöktunarkerfið greini hátt hlutfall fyrri atvika í matsprófi á gögnum sem haldið hefur verið utan við þjálfun.
Uppfærð matspróf fyrir vöktun: Útbúa matsdæmi sem endurspegla alveg nýja áhættu í nýjum keyrslum, svo mælingar á heimtuhlutfalli og nákvæmni vöktunar úreldist ekki.
Skjót viðbrögð: Innleiða forgangsviðvaranir sem leiða til aðgerða innan skilgreindra tímamarka samkvæmt þjónustustigssamningi (SLA), annaðhvort með því að kalla út bakvakt eða stöðva viðkomandi keyrslu sjálfkrafa áður en líkanið veldur skaða. Til dæmis mætti kalla út öryggisbakvakt og ábyrgðaraðila keyrslu vegna atvika að degi til og stöðva keyrslur sjálfkrafa ef viðvörunum er ekki svarað að næturlagi.
Samhliða ráðleggingum um tæknilegar öryggisráðstafanir höfum við unnið að bestu starfsvenjum við gerð öryggisrökstuðnings fyrir þjálfunarkeyrslur háþróaðrar gervigreindar. Þær gætu meðal annars falið í sér:
Mótrök (fyrirframgreining á mögulegum mistökum): Þegar drög að öryggisrökstuðningi liggja fyrir ætti starfsmaður úr öðru teymi að skrifa mótrök til að finna hugsanlega veikleika í rökstuðningnum og setja fram yfirvegað áhættumat. Þjálfunarteymið ætti síðan að bregðast við því til að styrkja öryggisrökstuðninginn.
Samþykki: Æðstu stjórnendur ættu að yfirfara öryggisrökstuðninginn og hver þeirra að geta beitt neitunarvaldi gegn keyrslunni. Þannig séu til staðar margar innri eftirlitsstöðvar (t.d. yfirmaður rannsóknasviðs eða aðstoðarforstjóri rannsókna, yfirmaður öryggismála og aðalvísindamaður).
Ábyrgð: Æðsti stjórnandinn sem ber ábyrgð á þjálfunarkeyrslu (t.d. yfirmaður rannsóknasviðs eða aðstoðarforstjóri rannsókna) ætti að svara fyrir öryggisrökstuðninginn og viðbrögð við atvikum, meðal annars í frammistöðumati. Þannig séu þjálfunarteymin einnig hvött til að stuðla að öryggi og samræmi við ætluð markmið.
Stöðvun: Ef upp koma vandamál sem ógilda öryggisrökstuðning (t.d. nýr öryggisvandi) þarf að tryggja að til séu verklagsáætlanir, tæknilegar stýringar og þjónustustigssamningar (SLA) um að stöðva tímabundið allar keyrslur sem rökstuðningurinn nær til.
Innra gagnsæi: Innri eftirlitshópar (t.d. Öryggisnefndin) ættu að hafa aðgang að öryggisrökstuðningi.
Úttektir: Úttektaraðilar ættu að fá nægilegan aðgang til að sannreyna að fullyrðingar í öryggisrökstuðningnum séu gildar og traustar og benda á annmarka ef þeir finnast.
Tilkynningar til æðra stigs: Skýrt ferli ætti að vera til staðar til að vísa frávikum frá ætluðum markmiðum til æðra stigs, ásamt töflu yfir skilgreind alvarleikastig frávika. Bakvakt vegna slíkra frávika ætti að geta boðað stjórnendur (t.d. forstjóra) til viðbragða þegar keyrsla nær tilteknu alvarleikastigi.
Tæknilegar stýringar: Erfitt ætti að vera fyrir fólk og fulltrúa að hefja keyrslur sem uppfylla ekki kröfur. Öryggisbúnaður á borð við vöktun og sjálfvirka stöðvun ætti að stöðva virkni við bilun fremur en að leyfa áframhaldandi keyrslu. Til dæmis ætti ekki að vera hægt að hefja keyrslur án viðeigandi virkrar vöktunar eða slökkva á vöktuninni innan úr styrkingarnámi, mati eða innri notkun.
Möguleiki á að afturkalla áhrif: Auðvelt ætti að vera að greina alla síðari notkun líkans sem víkur frá ætluðum markmiðum í þjálfunarferlinu (til dæmis við gagnagerð eða einkunnagjöf). Þannig megi afturkalla áhrif frálags sem samræmist ekki markmiðunum ef þörf krefur.
Heildstætt yfirlit yfir eftirstæða áhættu: Í öryggisrökstuðningi ætti eftir fremsta megni að telja upp alla eftirstæða áhættu sem núverandi mótvægisaðgerðir ná ekki til, svo hægt sé að taka upplýstar ákvarðanir um hvort samþykkja eigi áhættuna.
Þetta eru núverandi ráðleggingar okkar og unnið er að innleiðingu þeirra hjá OpenAI. Við gerum ráð fyrir að starfsvenjur okkar haldi áfram að þróast á næstu vikum.
Við höfum einnig unnið að bestu starfsvenjum við rannsókn alvarlegra atvika þar sem gervigreind víkur frá ætluðum markmiðum. Rannsóknastofur ættu að leitast við að læra sem mest af einstökum atvikum, líkt og gert er með rannsóknarverklagi(opnast í nýjum glugga) í öðrum atvinnugreinum þar sem mikið er í húfi, til að geta komið í veg fyrir slík atvik í framtíðinni. Dæmi um slíkar aðgerðir eru:
Innra gagnsæi: Þar sem rannsókn getur tekið langan tíma ætti að miðla stöðufréttum af atvikarannsóknum reglulega innan fyrirtækisins (t.d. daglega meðan rannsókn stendur yfir). Starfsfólk ætti að hafa skýrar leiðir til að fá víðtækari aðgang, meðal annars að óunnum samskiptaskrám og sýnatöku úr líkönum sem víkja frá ætluðum markmiðum, ef það er öruggt og viðeigandi fyrir störf þess.
Frumorsök frávika frá ætluðum markmiðum: Rannsakendur ættu að rekja frumorsakir í þjálfunarferlinu (t.d. með markvissum tilraunum þar sem einstakir þættir eru fjarlægðir eða endursýnatöku) til að skilja hvernig hegðun sem víkur frá ætluðum markmiðum varð til. Þannig megi dýpka vísindalegan skilning á slíkum frávikum og koma betur í veg fyrir þau í framtíðinni.
Eftirágreining: Gera ætti eftirágreiningu á verklagi og vinnumenningu til að skilja allar orsakir sem stuðluðu að atvikinu, svo sem hvers vegna vandamál komu upp og fundust ekki eða var ekki vísað til æðra stigs áður en atvikið átti sér stað.
Greining: Við ættum að þróa aðferðir til að prófa samræmi við ætluð markmið sem geta greint tilhneigingu til að valda atvikinu, án þess að fínstilla þær beint út frá upplýsingum úr atvikinu (t.d. samskiptaskrám eða samantektum um það). Útbúa ætti matspróf út frá atvikum sem „afturfararpróf“ til að tryggja að framtíðarlíkön sýni ekki tilhneigingu til að víkja frá ætluðum markmiðum við mjög svipaðar aðstæður.
Opinber upplýsingagjöf: Birta ætti almenningi niðurstöður rannsóknar, eftirágreiningar og breytingar á verklagi þegar rannsókninni er lokið. Tilkynna ætti þriðju aðilum sem verða fyrir áhrifum eins fljótt og auðið er.


