Drejt dosjeve të argumentimit për sigurinë në trajnimin e IA-së avangardë
Besojmë se po hyjmë në një epokë të re, ku dokumentacioni i strukturuar për sigurinë duhet të jetë i detyrueshëm përpara se të vazhdohet çfarëdo cikli trajnimi përforcues të modeleve avangardë. Në rastin ideal, ky dokumentacion do të arrinte nivelin e “dosjeve të argumentimit për sigurinë”: argumentime gjithëpërfshirëse, të strukturuara dhe të bazuara në prova për rrezikun, si ato që përdoren në industri të tjera ku siguria është kritike. Dosjet e argumentimit për sigurinë i shohim si një synim udhërrëfyes drejt të cilit po punojmë. Njëkohësisht, pranojmë se është e vështirë që ato të jenë po aq rigoroze për modelet e IA-së sa për aviacionin ose energjinë bërthamore, për shkak të kompleksitetit që shfaqet në çdo nivel të ri aftësish të IA-së. Po punojmë për një kuadër që t’i kthejë këto praktika në rregulla të përcaktuara.
Më poshtë paraqiten disa udhëzime fillestare që, sipas nesh, duhet të jenë pjesë e këtyre dosjeve të argumentimit për sigurinë në trajnimin e IA-së avangardë. Këto praktika të mira pasqyrojnë atë që kemi mësuar deri tani dhe presim që të zhvillohen më tej, ndërsa vazhdojmë të përmirësojmë proceset e brendshme për zhvillim të kujdesshëm. Po i ndajmë tani për ta bërë transparent qëndrimin tonë aktual dhe për të ftuar komunitetin të japë mendime. Vini re se ky dokument përqendrohet te trajnimi përforcues i modeleve avangardë; përdorimi i brendshëm dhe i jashtëm kërkojnë të merret parasysh një gamë shumë më e gjerë vetish të përputhjes me synimet.
Dosjet e argumentimit për sigurinë duhet të mbulojnë tri aspekte të sistemit teknik: trajnimin për përputhje me synimet, izolimin dhe monitorimin. Këto masa mbrojtëse ndihmojnë që modeli të mos përpiqet të ndërmarrë veprime që devijojnë nga synimet dhe që, edhe nëse do të përpiqej, ta kishte të vështirë të dilte nga izolimi dhe të kapej nga monitorimi përpara se të shkaktonte dëm.
Përputhja e modelit me synimet: Linja e parë e mbrojtjes duhet të jetë trajnimi i modeleve për të qenë në përputhje me synimet tona, pra, për të vepruar në mënyrë të besueshme ashtu siç dëshirojmë. Kjo mund të përfshijë:
Mjediset e trajnimit dhe vlerësimi me pikë: Ulni rrezikun që modelet të zhvillojnë sjellje që devijojnë nga synimet, duke parandaluar përforcimin pozitiv të manipulimeve të sistemit të shpërblimit gjatë trajnimit. Kjo mund të përfshijë:
Shqyrtime të automatizuara të grupeve të të dhënave: Përdorni agjentë për të gjetur e korrigjuar mjediset me defekte të trajnimit përforcues, ku rrjedhat e veprimeve që devijojnë nga synimet mund të marrin shpërblime të larta duke shfrytëzuar dobësitë dhe jo përmes sjelljes së synuar. Kështu ulen mundësitë që devijimi të përforcohet gjatë trajnimit.
Shqyrtime manuale të grupeve të të dhënave: Plotësojeni simulimin e automatizuar të sulmeve me shqyrtime manuale dhe kontrolle cilësie të grupeve të të dhënave, për të identifikuar detyra me mangësi që mund të përforcojnë pa dashje sjellje që devijojnë nga synimet.
Rregullimi i vlerësuesve: Rregullojini vlerësuesit që të penalizojnë përpjekjet e modelit për të shfrytëzuar dobësitë ose për të manipuluar mjediset e trajnimit përforcues gjatë trajnimit.
Analiza e cikleve të mëparshme: Përdorni klasifikues mbi gjurmët e regjistruara të eksperimenteve të mëparshme, për t’u siguruar që vlerësuesit funksionojnë siç synohet.
Matja e përputhjes me synimet: Kryeni vlerësime që ndjekin prirjet e modelit për të devijuar nga synimet, për të matur efektshmërinë e trajnimit për përputhje me to. Kjo mund të përfshijë:
Vlerësime jashtë linje të përputhjes me synimet: Kryeni vlerësime të përputhjes me synimet gjatë cikleve të trajnimit të modeleve avangardë, për të parë nëse trajnimi po funksionon siç synohet, dhe hetoni çdo përkeqësim të konsiderueshëm.
Testim mbi të kaluarën: Testojini vlerësimet e përputhjes me synimet mbi incidentet e mëparshme, për të konfirmuar që ato zbulojnë modelet që kanë devijuar më parë dhe nuk po përshtaten tepër me incidente të veçanta.
Gjurmimi i manipulimit të vlerësimeve: Ndiqni vetëdijen për vlerësim ose përshtatjen strategjike ndaj testimit (kur modelet e kuptojnë se po testohen), që mund të shkaktojnë ndryshim sjelljeje. Për shembull, aktivizoni monitorues për këto dukuri gjatë vlerësimeve të përputhjes me synimet, me pragje të posaçme bllokimi.
Teste sforcimi për skenarët më të këqij: Provokoni sjelljet e papërshtatshme më të rënda të mundshme dhe kontrolloni që të paktën një vlerësim do t’i zbulonte ato.
Parandaloni trajnimin mbi zinxhirin e mendimit: Mos i lejoni vlerësuesit e automatizuar të shohin zinxhirin e mendimit gjatë trajnimit përforcues, për të parandaluar që modelet të zhvillojnë aftësi për t’iu shmangur monitoruesve të zinxhirit të mendimit.
Izolimi: Nëse një model fillon të devijojë nga synimet, izolimi në mjedis të kontrolluar dhe siguria duhet të jenë mjaftueshëm të forta për të parandaluar veprimet e dëmshme. Kjo mund të përfshijë:
Shtresa të shumëfishta sigurie të infrastrukturës: Investoni ndjeshëm në forcimin si të mjedisit të izoluar ku ekzekutohet modeli, ashtu edhe të infrastrukturës kërkimore që e strehon atë, për të siguruar një shtresë shtesë mbrojtjeje në rast se modeli del nga mjedisi i izoluar.
Simulim sulmesh ndaj izolimit: Përmirësoni sigurinë e mjedisit të izoluar, të infrastrukturës kërkimore dhe të perimetrit, duke kryer vazhdimisht simulim sulmesh ndaj këtyre sistemeve me versione të ruajtura gjatë cikleve të trajnimit të modeleve avangardë, pas një analize sigurie, për të gjetur e mbyllur çdo boshllëk. Kryeni gjithashtu simulim sulmesh ndaj të gjitha shërbimeve me të cilat modeli mund të ndërveprojë gjatë trajnimit (p.sh., memoria e përkohshme e internetit).
Komunikimi mes mostrave: Kufizojeni komunikimin me kapacitet të lartë mes mostrave vetëm në rrugë të miratuara, si mjetet për shumë agjentë, dhe mbyllni kanalet anësore të infrastrukturës që kanë kapacitet të lartë dhe zbulohen lehtësisht nga agjentët.
Transkripte të pandryshueshme: Ruajini transkriptet e agjentëve në formë të pandryshueshme për një periudhë të arsyeshme (p.sh., në llogari ruajtjeje që lejojnë shkrim vetëm një herë), për të gjithë trajnimin përforcues, vlerësimin dhe përdorimin e brendshëm, që të mundësohet hetim i besueshëm i incidenteve dhe të parandalohen ndryshimet pa dashje.
Monitorimi: Nëse modelet fillojnë të ndërmarrin veprime që devijojnë nga synimet, duhet të ketë një sistem monitorimi në kohë reale për të kapur çdo devijim të mundshëm dhe për të trajtuar shpejt çështjet me përparësi, përpara se të ndodhë një incident i rëndë. Kjo mund të përfshijë:
Siguroni mundësinë e monitorimit: Sigurohuni që modelet të mbeten të monitorueshme, sipas vlerësimeve me pragje të qarta për mundësinë e monitorimit dhe shmangien e monitoruesve, për të kapur herët sjelljet shqetësuese.
Shkallë e lartë zbulimi të problemeve të njohura: Sigurohuni që sistemi i monitorimit të zbulojë një përqindje të lartë të incidenteve të kaluara në një vlerësim me të dhëna të mbajtura veçmas.
Përditësimi i vlerësimeve për monitoruesit: Krijoni të dhëna vlerësimi që përfaqësojnë rreziqet krejtësisht të reja të cikleve të reja, në mënyrë që matjet e shkallës së zbulimit dhe të saktësisë së monitoruesve të mos vjetrohen.
Reagim i shpejtë: Zbatoni alarme me përparësi që çojnë në veprim brenda afatit të përcaktuar në SLA, ose duke njoftuar urgjentisht një person në gatishmëri, ose duke pezulluar automatikisht ciklin e prekur, përpara se modeli të shkaktojë dëm. Për shembull, gjatë ditës njoftoni përgjegjësin e sigurisë në gatishmëri dhe përgjegjësin e ciklit për incidentet; natën, pezulloni automatikisht ciklet nëse marrja e alarmit nuk konfirmohet.
Krahas rekomandimeve për masat teknike mbrojtëse, kemi punuar për praktikat më të mira operative lidhur me dosjet e argumentimit për sigurinë e një cikli trajnimi të IA-së avangardë. Këto mund të përfshijnë:
Kundërshtime (analiza paraprake të dështimeve të mundshme): Pasi të hartohet një dosje argumentimi për sigurinë, një anëtar i një ekipi tjetër duhet të shkruajë një kundërshtim për të gjetur mangësi të mundshme në të dhe të paraqesë një vlerësim të peshuar të rrezikut. Ekipi i trajnimit duhet më pas t’i trajtojë këto çështje, për ta bërë dosjen më të fortë.
Miratime: Dosja e argumentimit për sigurinë duhet të shqyrtohet nga drejtues të lartë, secili me të drejtën për t’i vënë veton ciklit të trajnimit, në mënyrë që ai t’u nënshtrohet disa kontrolleve të brendshme (p.sh., nga drejtuesi ose zëvendëspresidenti i kërkimit, kreu i sigurisë dhe kryeshkencëtari).
Llogaridhënie: Drejtuesi i lartë përgjegjës për një cikël trajnimi (p.sh., drejtuesi ose zëvendëspresidenti i kërkimit) duhet të japë llogari për dosjen e argumentimit për sigurinë dhe për reagimin ndaj çdo incidenti, edhe gjatë vlerësimit të performancës. Kështu, edhe ekipet e trajnimit nxiten të punojnë për sigurinë dhe përputhjen me synimet.
Pezullim: Nëse zbulohen probleme që do ta zhvlerësonin një dosje argumentimi për sigurinë (p.sh., një problem i ri sigurie), duhet të ketë procedura operative, kontrolle teknike dhe marrëveshje për nivelin e shërbimit (SLA) për pezullimin e të gjitha cikleve të mbuluara prej saj.
Transparencë e brendshme: Dosjet e argumentimit për sigurinë duhet t’u vihen në dispozicion grupeve të brendshme mbikëqyrëse (p.sh., Komitetit të Sigurisë dhe të Mbrojtjes).
Auditime: Audituesve duhet t’u jepet qasje e mjaftueshme për të verifikuar që pohimet në dosjen e argumentimit për sigurinë janë të vlefshme e të bazuara, si dhe për të raportuar mangësitë që zbulojnë.
Referim te nivelet më të larta: Duhet të ketë një proces të qartë për referimin e rasteve të devijimit nga synimet, një tabelë me nivele të përcaktuara të rëndësisë së tyre dhe një person në gatishmëri për këto raste, i cili mund të njoftojë urgjentisht drejtuesit (p.sh., drejtorin ekzekutiv) kur një cikël arrin një nivel të caktuar rëndësie.
Kontrolle teknike: Njerëzit dhe agjentët duhet ta kenë të vështirë të nisin cikle trajnimi që nuk respektojnë kërkesat. Mekanizmat e sigurisë, si monitorimi dhe pezullimi automatik, duhet ta bllokojnë funksionimin në rast dështimi (p.sh., nuk duhet të jetë e mundur të nisen cikle pa aktivizuar monitorimin e duhur, apo të çaktivizohet monitoruesi nga brenda trajnimit përforcues, vlerësimit ose një përdorimi të brendshëm).
Mundësi zhbërjeje: Duhet të jetë e lehtë të identifikohen të gjitha përdorimet pasuese të një modeli që devijon nga synimet në procesin e trajnimit (për shembull, gjenerimi i të dhënave ose vlerësimi me pikë), që të mund të zhbëhen efektet e rezultateve të tij të devijuara nëse është e nevojshme.
Pasqyrim i plotë i rreziqeve të mbetura: Dosjet e argumentimit për sigurinë duhet të renditin, sa më plotësisht të jetë e mundur, rreziqet e mbetura që nuk mbulohen nga masat zbutëse aktualisht në zbatim, për të mundësuar vendime të informuara për pranimin e rrezikut.
Këto janë rekomandimet tona aktuale dhe po vihen në zbatim në OpenAI. Presim që praktikat tona të vazhdojnë të zhvillohen gjatë javëve në vijim.
Kemi punuar edhe për disa praktika të mira për hetimin e incidenteve të rënda të devijimit të IA-së nga synimet. Laboratorët duhet të synojnë të mësojnë sa më shumë nga çdo incident (ngjashëm me praktikat e hetimit(hapet në një dritare të re) në industri të tjera ku pasojat mund të jenë të rënda), që të mund të parandalojnë përsëritjen e tyre. Disa shembuj masash të tilla mund të përfshijnë:
Transparencë e brendshme: Meqë përfundimi i një hetimi mund të kërkojë kohë të konsiderueshme, për ecurinë e hetimeve të incidenteve duhet të jepen përditësime periodike brenda organizatës (p.sh., përditësime të përditshme për hetimet në vazhdim). Punonjësit duhet të kenë procedura të përcaktuara për të marrë qasje më të gjerë, përfshirë transkriptet e papërpunuara dhe marrjen e mostrave nga modelet që devijojnë nga synimet, nëse kjo është e sigurt dhe lidhet me punën e tyre.
Shkaku rrënjësor i devijimit nga synimet: Studiuesit duhet të identifikojnë shkaqet rrënjësore në dinamikën e trajnimit (p.sh., përmes heqjes së synuar të komponentëve ose eksperimenteve me rimostrim), për të kuptuar si lindën sjelljet e devijuara, për të thelluar njohuritë shkencore mbi këtë dukuri dhe për ta parandaluar më mirë në të ardhmen.
Analizë pas incidentit: Duhet të kryhet një analizë e praktikave operative dhe e kulturës organizative për të kuptuar të gjitha shkaqet që kontribuuan në incident, si arsyet pse problemet lindën dhe mbetën të pazbuluara ose nuk iu referuan niveleve më të larta përpara incidentit.
Zbulim: Duhet të zhvillojmë metoda testimi të përputhjes me synimet, të afta të zbulojnë prirjen për të shkaktuar incidentin, pa i optimizuar drejtpërdrejt mbi informacionin e nxjerrë prej tij (p.sh., transkriptet ose përmbledhjet e incidentit). Vlerësimet e nxjerra nga incidentet duhet të krijohen si “teste regresioni”, për të siguruar që modelet e ardhshme të mos shfaqin prirje për devijim nga synimet në incidente shumë të ngjashme.
Njoftime publike: Rezultatet e hetimit, analizat pas incidentit dhe ndryshimet operative duhet të bëhen publike pas përfundimit të hetimit. Palët e treta të prekura duhet të njoftohen sa më shpejt që të jetë e mundur.


