Prema sigurnosnim obrazloženjima za treniranje graničnih modela umjetne inteligencije
Vjerujemo da ulazimo u novo razdoblje u kojem bi strukturirana sigurnosna dokumentacija trebala biti obvezna prije nastavka bilo kojeg ciklusa treniranja graničnih modela učenjem s potkrepljivanjem. U idealnom slučaju takva bi dokumentacija dosegnula razinu „sigurnosnih obrazloženja” — sveobuhvatnih, strukturiranih i dokazima potkrijepljenih argumentacija o riziku kakve se upotrebljavaju u drugim industrijama u kojima je sigurnost ključna. Sigurnosna obrazloženja smatramo ambicioznim ciljem kojem težimo. Pritom prepoznajemo koliko je zahtjevno postići da ona za modele umjetne inteligencije budu jednako rigorozna kao u zrakoplovstvu ili nuklearnoj energetici, zbog nove složenosti koja nastaje na svakoj višoj razini sposobnosti umjetne inteligencije. Radimo na okviru kojim ćemo formalizirati te prakse.
U nastavku donosimo početne smjernice za koje smatramo da bi trebale biti dio takvih sigurnosnih obrazloženja za treniranje graničnih modela umjetne inteligencije. Ove najbolje prakse odražavaju naše trenutačne spoznaje. Očekujemo da će se razvijati kako nastavljamo usavršavati interne procese za promišljen razvoj. Objavljujemo ih sada kako bismo transparentno prikazali svoja trenutačna razmišljanja i pozvali zajednicu da nam pošalje povratne informacije. Napominjemo da je ovaj dokument usmjeren na treniranje graničnih modela učenjem s potkrepljivanjem; interna i vanjska primjena zahtijevaju razmatranje mnogo šireg skupa svojstava usklađenosti.
Sigurnosna obrazloženja trebala bi obuhvatiti tri aspekta tehnološkog sustava: treniranje za usklađenost, izolaciju i nadzor. Te zaštitne mjere pomažu osigurati da model ne pokuša poduzimati neusklađene radnje te da bi mu, čak i kad bi to pokušao, bilo teško probiti izolaciju, a nadzor bi takvo ponašanje otkrio prije nego što bi moglo prouzročiti štetu.
Usklađenost modela: Prva linija obrane trebala bi biti treniranje modela za usklađenost, odnosno za pouzdano djelovanje na način koji smo predvidjeli. To bi moglo uključivati sljedeće:
Okruženja za treniranje i ocjenjivanje: Smanjite rizik od razvoja neusklađenog ponašanja modela sprječavanjem pozitivnog potkrepljivanja manipulacije sustavom nagrađivanja tijekom treniranja. To bi moglo uključivati sljedeće:
Automatizirani pregledi skupova podataka: Upotrebljavajte agente za pronalaženje i ispravljanje neispravnih okruženja za učenje s potkrepljivanjem u kojima bi neusklađeni slijedovi radnji mogli dobiti visoke nagrade iskorištavanjem propusta, umjesto predviđenim ponašanjem. Time se smanjuju mogućnosti za potkrepljivanje neusklađenosti tijekom treniranja.
Ručni pregledi skupova podataka: Dopunite automatizirano red-team testiranje ručnim pregledom i provjerama kvalitete skupova podataka kako biste utvrdili koji bi zadaci zbog nedostataka mogli nenamjerno potkrepljivati neusklađeno ponašanje.
Podešavanje ocjenjivača: Podesite ocjenjivače tako da kažnjavaju pokušaje modela da tijekom treniranja iskorištava propuste u okruženjima za učenje s potkrepljivanjem ili manipulira njima.
Analiza prethodnih ciklusa treniranja: Primijenite klasifikatore na zapise prethodnih eksperimenata kako biste provjerili rade li ocjenjivači kako je predviđeno.
Mjerenje usklađenosti: Provodite evaluacije koje prate sklonost modela neusklađenosti kako biste izmjerili učinkovitost treniranja za usklađenost. To bi moglo uključivati sljedeće:
Izvanmrežne evaluacije usklađenosti: Provodite evaluacije usklađenosti tijekom ciklusa treniranja graničnih modela kako biste procijenili odvija li se treniranje kako je predviđeno te istražite svako znatno pogoršanje.
Retrospektivno testiranje: Testirajte evaluacije usklađenosti na prethodnim incidentima kako biste potvrdili da otkrivaju modele koji su ranije bili neusklađeni te da nisu pretjerano prilagođene pojedinim incidentima.
Praćenje manipulacije evaluacijama: Pratite svjesnost evaluacije ili metastrategije (modeli prepoznaju da ih se testira) koje bi mogle izazvati promjenu ponašanja, uz definirane pragove za blokiranje (npr. uključite nadzor svjesnosti evaluacije i metastrategija pri evaluacijama usklađenosti).
Testovi otpornosti za najgore scenarije: Izazovite najgore moguće neprihvatljivo ponašanje i provjerite bi li ga barem jedna evaluacija otkrila.
Sprječavanje treniranja na lancu razmišljanja: Ne dopustite automatiziranim ocjenjivačima uvid u lanac razmišljanja tijekom učenja s potkrepljivanjem kako biste spriječili da modeli razviju načine za izbjegavanje nadzora lanca razmišljanja.
Izolacija: Osigurajte dovoljno snažno izolirano okruženje i sigurnosne mjere da se spriječe štetne radnje ako model postane neusklađen. To bi moglo uključivati sljedeće:
Višeslojna sigurnost infrastrukture: Uložite znatna sredstva u jačanje zaštite izoliranog okruženja u kojem model radi i istraživačke infrastrukture na kojoj se to okruženje nalazi, kako bismo imali dodatni sloj zaštite u slučaju izlaska modela iz izoliranog okruženja.
Red-team testiranje izolacije: Poboljšajte sigurnost izoliranog okruženja, istraživačke infrastrukture i perimetra iterativnim red-team testiranjem tih sustava. Pritom, uz prethodnu sigurnosnu analizu, upotrebljavajte kontrolne točke iz ciklusa treniranja graničnih modela kako biste pronašli i uklonili sve propuste. Provedite red-team testiranje i svih usluga kojima bi model mogao pristupiti tijekom treniranja (npr. internetske predmemorije).
Komunikacija među uzorcima: Komunikaciju visoke propusnosti među uzorcima ograničite na odobrene kanale, poput alata za više agenata, te zatvorite bočne kanale infrastrukture koji imaju visoku propusnost i koje agenti mogu lako otkriti.
Nepromjenjivi transkripti: Transkripte agenata čuvajte u nepromjenjivom obliku tijekom razumnog razdoblja (primjerice na računima za pohranu s jednokratnim zapisivanjem) za sve postupke treniranja učenjem s potkrepljivanjem, evaluacije i interne primjene, kako biste omogućili pouzdanu istragu incidenata i spriječili nenamjerne izmjene.
Nadzor: Ako modeli počnu poduzimati neusklađene radnje, sustav nadzora u stvarnom vremenu trebao bi otkriti svaku moguću neusklađenost i omogućiti brzo rješavanje prioritetnih problema prije nego što dođe do ozbiljnog incidenta. To bi moglo uključivati sljedeće:
Obvezna mogućnost nadzora: Osigurajte da modeli ostanu podložni nadzoru, što se mjeri evaluacijama mogućnosti nadzora i njegova izbjegavanja s jasnim pragovima, kako bi se zabrinjavajuće ponašanje rano otkrilo.
Visok odziv za poznate probleme: Osigurajte da sustav nadzora ima visok odziv pri prepoznavanju prošlih incidenata u evaluaciji na izdvojenim podacima.
Ažurnost evaluacija sustava nadzora: Za nove cikluse treniranja izradite evaluacijske primjere koji predstavljaju posve nove rizike kako mjere odziva i preciznosti sustava nadzora ne bi zastarjele.
Brz odgovor: Uvedite prioritetna upozorenja koja dovode do djelovanja unutar roka definiranog sporazumom o razini usluge (SLA), bilo pozivanjem dežurne osobe ili automatskim pauziranjem pogođenog ciklusa treniranja, prije nego što model prouzroči štetu (npr. tijekom dana o incidentima obavijestite dežurnu osobu za sigurnost i osobu odgovornu za ciklus treniranja, a noću automatski pauzirajte cikluse ako primitak upozorenja nije potvrđen).
Uz preporuke o tehničkim zaštitnim mjerama, radimo i na najboljim operativnim praksama za sigurnosna obrazloženja za pojedinačne cikluse treniranja graničnih modela umjetne inteligencije. One bi mogle uključivati sljedeće:
Izdvojena mišljenja (analize mogućih neuspjeha): Nakon izrade nacrta sigurnosnog obrazloženja, član drugog tima trebao bi napisati izdvojeno mišljenje kako bi pronašao moguće propuste i iznio odmjerenu procjenu rizika. Tim za treniranje potom bi trebao odgovoriti na te primjedbe kako bi sigurnosno obrazloženje bilo čvršće.
Odobrenja: Sigurnosno obrazloženje trebali bi pregledati članovi višeg rukovodstva, od kojih bi svaki trebao moći zabraniti ciklus treniranja kako bi se osiguralo više internih provjera (npr. voditelj istraživačkog odjela / potpredsjednik za istraživanje, voditelj sigurnosti i glavni znanstvenik).
Odgovornost: Viši rukovoditelj zadužen za ciklus treniranja (npr. voditelj istraživačkog odjela / potpredsjednik za istraživanje) trebao bi odgovarati za sigurnosno obrazloženje i postupanje u slučaju incidenata, među ostalim i pri ocjenjivanju radne uspješnosti, kako bi se i timove za treniranje poticalo na zalaganje za sigurnost i usklađenost.
Pauziranje: Ako se otkriju problemi koji bi učinili sigurnosno obrazloženje nevaljanim (npr. novi sigurnosni problem), treba osigurati operativne priručnike, tehničke kontrole i sporazume o razini usluge (SLA) za pauziranje svih obuhvaćenih ciklusa treniranja.
Interna transparentnost: Sigurnosna obrazloženja trebala bi biti dostupna internim nadzornim tijelima (npr. Odboru za sigurnost i zaštitu).
Revizije: Revizorima treba omogućiti dovoljan pristup kako bi provjerili jesu li tvrdnje u sigurnosnom obrazloženju valjane i utemeljene te upozorili na eventualne propuste.
Eskalacije: Trebao bi postojati jasan postupak za eskalaciju problema neusklađenosti, s tablicom definiranih razina ozbiljnosti te dežurnom osobom za neusklađenost koja može pozvati rukovoditelje (npr. glavnog izvršnog direktora) kada ciklus treniranja dosegne određenu razinu ozbiljnosti.
Tehničke kontrole: Ljudima i agentima trebalo bi biti teško pokrenuti cikluse treniranja koji nisu u skladu s pravilima. Sigurnosne značajke poput nadzora i automatskog pauziranja trebale bi u slučaju kvara blokirati rad (npr. ne bi smjelo biti moguće pokrenuti cikluse treniranja bez uključenog odgovarajućeg nadzora niti isključiti nadzor iz procesa treniranja učenjem s potkrepljivanjem, evaluacije ili interne primjene).
Mogućnost poništavanja učinaka: Trebalo bi biti lako utvrditi sve daljnje upotrebe neusklađenog modela u procesu treniranja (primjerice generiranje podataka ili ocjenjivanje) kako bi se po potrebi mogli poništiti učinci neusklađenih izlaznih rezultata.
Potpunost popisa preostalih rizika: Sigurnosna obrazloženja trebala bi sadržavati što potpuniji popis preostalih rizika koji nisu obuhvaćeni trenutačno uvedenim mjerama ublažavanja, kako bi se omogućilo informirano odlučivanje o prihvaćanju rizika.
To su naše trenutačne preporuke, koje upravo uvodimo u OpenAI. Očekujemo da će se naše prakse nastaviti razvijati tijekom sljedećih tjedana.
Razvijamo i najbolje prakse za istragu ozbiljnih incidenata neusklađenosti umjetne inteligencije. Laboratoriji bi trebali nastojati iz pojedinačnih incidenata naučiti što više (slično istražnim praksama(otvara se u novom prozoru) u drugim industrijama u kojima su posljedice pogrešaka ozbiljne) kako bi spriječili njihovo ponavljanje. Primjeri takvih aktivnosti mogli bi uključivati sljedeće:
Interna transparentnost: Budući da istraga može potrajati, o njezinu bi tijeku trebalo redovito izvještavati unutar organizacije (npr. svakodnevnim izvješćima o istragama u tijeku). Zaposlenici bi trebali imati jasno definirane postupke za dobivanje šireg pristupa, uključujući pristup neobrađenim transkriptima i uzorkovanje izlaznih rezultata neusklađenih modela, ako je to sigurno i relevantno za njihov rad.
Temeljni uzrok neusklađenosti: Istraživači bi trebali utvrditi temeljne uzroke u dinamici treniranja (npr. ciljanim ablacijskim eksperimentima ili eksperimentima ponovnog uzorkovanja) kako bi razumjeli kako su se pojavila neusklađena ponašanja, bolje razumjeli znanstvenu podlogu neusklađenosti i uspješnije je sprječavali u budućnosti.
Naknadna analiza: Trebalo bi provesti naknadnu analizu operativnih postupaka i organizacijske kulture kako bi se razumjeli svi uzroci koji su pridonijeli incidentu, primjerice zašto su problemi nastali te zašto prije incidenta nisu bili otkriveni ili eskalirani.
Otkrivanje: Trebali bismo razviti metode testiranja usklađenosti koje mogu otkriti sklonost izazivanju incidenta, bez izravne iterativne optimizacije na temelju informacija dobivenih iz tog incidenta (npr. transkripata ili sažetaka incidenta). Evaluacije izvedene iz incidenata trebalo bi izraditi kao „regresijske testove” kako bi se osiguralo da budući modeli ne pokazuju sklonost neusklađenosti u vrlo sličnim incidentima.
Javno objavljivanje: Rezultate istrage, naknadne analize i promjene operativnih postupaka trebalo bi podijeliti s javnošću nakon završetka istrage. Pogođene treće strane trebalo bi obavijestiti što prije.


