Tempo razvoja modela u eri kritičnih kibernetičkih sposobnosti
Tijekom proteklih nekoliko tjedana dva su događaja istaknula sve veće rizike povezane sa sve sposobnijim sustavima umjetne inteligencije: incident OpenAI-Hugging Face i, zasebno, preliminarni dokazi da bi jedan od naših nadolazećih modela, Astra, mogao dosegnuti prag kritične kibernetičke sposobnosti prema našem Okviru pripravnosti. Ti su događaji, uz brz napredak naših internih istraživanja, povećali hitnost rada na jačanju zaštitnih mjera za nadzor, usklađivanje i ograničavanje u svim fazama procesa treniranja.
Kako modeli postaju sposobniji, rastu i rizici povezani s njihovim internim razvojem i testiranjem. Naši standardi nadzora, usklađivanja i sigurnosti moraju biti korak ispred tih rizika. Željeli smo odvojiti dovoljno vremena za ispunjavanje tih standarda pa smo privremeno usporili povećavanje razmjera. To je uključivalo dvotjednu stanku u treniranju učenjem s potkrepljivanjem (RL) naših najnovijih modela namijenjenih primjeni, dok smo dodatno osiguravali i testirali svoja istraživačka okruženja simuliranim napadima te proširivali obuhvat sustava za nadzor. Naše najveće planirano RL treniranje najnaprednijeg modela ostaje obustavljeno dok provodimo treniranja i evaluacije manjeg opsega kako bismo procijenili ponašanje modela, provjerili zaštitne mjere i prikupili više dokaza o usklađenosti prije nastavka
Usklađivanje — rad kojim se osigurava da se sustavi umjetne inteligencije ponašaju na predviđen način i podliježu ljudskom nadzoru — već je dugo u središtu našeg istraživačkog programa. Sada tijekom cijelog treniranja zahtijevamo čvršće dokaze o usklađenom ponašanju, oslanjajući se na istraživanja i evaluacije koji su već u tijeku. Održavanje usklađenosti sve sposobnijih sustava izazov je kojim će se morati pozabaviti cijelo područje. Signali koje vidimo u napretku nadolazećih modela jasno pokazuju da nam je potreban širi pristup, koji se nadovezuje na postojeći Okvir pripravnosti i nadilazi ga.
Smatramo da je važno transparentno prikazati kako se naš pristup mijenja. U nastavku opisujemo promjene koje smo već uveli u svoje istraživačke procese i infrastrukturu, kao i rad koji je još u tijeku.
Naš pristup razvoju sposobnijih modela počiva na trima zaštitnim mjerama koje se međusobno osnažuju:
- Nadzor, koji otkriva zabrinjavajuće ponašanje i omogućuje nam da na njega odgovorimo.
- Usklađivanje, koje smanjuje vjerojatnost štetnih ili neovlaštenih radnji.
- Sigurnosne mjere, koje ograničavaju čemu sustavi umjetne inteligencije mogu pristupiti ili na što mogu utjecati.
Očekujemo da će modeli uskoro obavljati većinu sigurnosnih poslova, uključujući obranu od drugih modela. To će omogućiti da se sve tri zaštitne mjere razvijaju usporedno sa sposobnostima modela, što smatramo ključnim.
Te zaštitne mjere primjenjujemo u istraživanju i uvođenju modela, prilagođavajući ih sposobnostima svakog modela, njegovu radnom okruženju i razini rizika.
Kako najnapredniji modeli stječu naprednije kibernetičke sposobnosti, podižemo sigurnosne standarde za okruženja u kojima ih treniramo i evaluiramo. Ispunjavanje tih standarda zahtijevalo je znatan inženjerski rad te prouzročilo velike troškove i kašnjenja u istraživanju najnaprednijih modela. Odmah nakon incidenta OpenAI-Hugging Face* obustavili smo izvođenje zaključivanja najnaprednijih modela u istraživačkim klasterima za procese koji su mogli izvršavati kôd ili upotrebljavati alate s pristupom internetu. Ubrzo smo ponovno omogućili ograničeniji i sigurniji način izvršavanja koda, a zatim smo pojedinačno pregledali svako radno opterećenje kako bismo utvrdili može li se sigurno nastaviti. Neka su istraživačka radna opterećenja nastavljena uz nove kontrole, dok su druga zahtijevala dodatne promjene.
Tijekom sljedećih tjedana definirali smo strože sigurnosne zahtjeve za radna opterećenja u istraživanju najnaprednijih modela i počeli ih provoditi. Primjerice:
- Izolacija radnih opterećenja: sada zahtijevamo snažniju izolaciju („zaštićena okruženja”) za radna opterećenja koja izvršavaju kôd koji je generirao model ili drugi nepouzdani kôd. To se odnosi i na softver koji bi mogao biti kompromitiran tijekom obrade izlaznih podataka modela.
- Mrežna izolacija: uveli smo dodatne kontrole kako bismo od interneta izolirali nepouzdana i visokorizična radna opterećenja. Te smo kontrole osmislili tako da samo kompromitiranje jednog radnog opterećenja ili pomoćne usluge ne omogućuje neovlašten pristup internetu ili drugim internim mrežama.
- Kontinuirano sigurnosno testiranje: rekonfigurirali smo svoje okruženje kako bismo uklonili potencijalno ranjive dijeljene usluge, smanjili trajne ovlasti te poboljšali granice sigurnosti i povjerenja. Poboljšavamo i svoju sposobnost prikupljanja i nadziranja sigurnosnih zapisnika. Naposljetku, ulažemo u automatizaciju kojom se naši modeli upotrebljavaju za kontinuirano testiranje tih granica simuliranim napadima.
Te kontrole zajedno pružaju višeslojnu obranu i pomažu zaštititi naše istraživačko okruženje od napada. Danas zahtijevamo najstrožu razinu sigurnosnih mjera za radna opterećenja koja uključuju Astru ili kibernetičke modele jer smo utvrdili da bi modeli Astra mogli imati kritičnu razinu kibernetičkih sposobnosti. Te se zaštitne mjere primjenjuju i na sva ostala radna opterećenja povezana s kibernetičkom sigurnošću.
Iako neka treniranja i evaluacije Astre ispunjavaju te zahtjeve, znatan broj radnih opterećenja ostaje obustavljen dok se potpuno ne premjeste i unaprijede radi ispunjavanja novog sigurnosnog standarda. Pri prelasku na nova okruženja prednost dajemo radnim opterećenjima povezanima sa sigurnošću i usklađivanjem.
Nadzor je već dugo važan dio našeg procesa razvoja modela, uključujući nadzor internih agenata za kodiranje i dugotrajne sesije. Naš nadzor bio je osobito usmjeren na internu primjenu najnaprednijih modela i RL treniranja najnaprednijih modela, koja smo smatrali najrizičnijim radnim opterećenjima jer mogu objediniti napredne sposobnosti modela s pristupom alatima, osjetljivim sustavima te internim ili vanjskim mrežama. Nadzor se nije primjenjivao na sva zaključivanja i treniranja koja upotrebljavaju alate. Revidirali smo i proširili svoj pristup novim sustavom nadzora.
Novi sustav nadzora sastoji se od više faza. Počinje klasifikatorima aktivacija, odnosno detektorima koji pregledavaju internu aktivnost modela, a koji se pokreću pri svakom uzorkovanom tokenu i prosljeđuju moguće probleme sve sofisticiranijim automatiziranim istražiteljima s velikim računalnim zahtjevima. Ti sustavi pregledavaju radnje alata, dostupno rasuđivanje i cijeli slijed aktivnosti radi otkrivanja neovlaštenog pristupa, krađe podataka, destruktivnog ponašanja i pokušaja zaobilaženja zaštitnih mjera. Cilj nam je izdati upozorenje u roku od 30 minuta nakon što sustav nadzora otkrije zabrinjavajuću aktivnost. Ako sustav nadzora utvrdi vjerojatno kršenje kritične sigurnosne granice, generira upozorenje najvišeg prioriteta. U trenutačnoj se implementaciji pozivaju timovi za sigurnost, zaštitu i istraživanje. Ako u roku od 30 minuta ne mogu nedvojbeno utvrditi da je oznaka lažno pozitivna, od tih se timova očekuje da obustave aktivnost.
Taj je nadzor obvezan za sva RL treniranja i evaluacije koji uključuju alate za modele razine sposobnosti Sol ili više. Nakon što smo 7. kolovoza utvrdili da bi Astra mogla imati kritične kibernetičke sposobnosti, uveli smo dodatni zahtjev za nadzor svih zaključivanja Astre s alatima, a ne samo RL treniranja i evaluacija.
Te zaštitne mjere zahtijevaju znatne računalne resurse. Prema trenutačnim procjenama, dodatni računalni trošak nadzora iznosi oko 20 % resursa za zaključivanje koje se nadzire, iako se trošak znatno razlikuje među radnim opterećenjima za treniranje i evaluaciju. Više pojedinosti o tom sustavu objavit ćemo u nadolazećem članku na blogu.
Istraživanje usklađivanja ključno je za našu misiju. Naša je misija osigurati da opća umjetna inteligencija koristi cijelom čovječanstvu. Kako modeli stječu napredne sposobnosti, poput izvođenja kibernetičkih napada, i djeluju u složenijim okruženjima, neusklađena ponašanja poput iskorištavanja sustava nagrađivanja (pronalaženja načina za dobivanje visokih nagrada tijekom treniranja bez stvarnog postizanja željenog ishoda), obmane ili neovlaštenog pristupa stvarat će sve ozbiljnije rizike.
U RL treniranjima najsposobnijih modela sada primjenjujemo svoje temeljne tehnike usklađivanja u više faza procesa treniranja. To uključuje poboljšavanje modela nagrađivanja kako bi bolje otkrivali i suzbijali nesigurno ponašanje u različitim zadacima i okruženjima; treniranje modela da iskrenije izvještavaju o svojim radnjama, sposobnostima i ograničenjima; te smanjivanje ponašanja koja iskorištavaju slabosti nagrada, ocjenjivača, alata ili nadzora. Također povećavamo obuhvat treniranja za ponašanja koja bi mogla prouzročiti štetu pri interakciji modela s vanjskim sustavima ili resursima.
Nastavljamo intenzivno ulagati u istraživanje usklađivanja, proširivati obuhvat evaluacija te stečene spoznaje primjenjivati u treniranju i zaštitnim mjerama. U bliskoj budućnosti planiramo podijeliti znatno više informacija o svojim istraživanjima usklađivanja, uključujući spoznaje o ponašanju modela i sve nove izazove koje otkrijemo.
Razvijat ćemo svoj Okvir pripravnosti kako bismo objedinili te zaštitne mjere u treniranju i primjeni te bolje obuhvatili sposobnosti budućih modela i okruženja u kojima djeluju. Razvoj metoda koje se mogu prilagođavati tim sposobnostima zahtijevat će kontinuirano ulaganje u sigurnost potpomognutu modelima, učinkovitiji nadzor i daljnji napredak u istraživanju usklađivanja. Namjeravamo uključiti vanjske organizacije i dijeliti više stečenih spoznaja kako se naš pristup bude razvijao.
Sposobnosti najnaprednijih modela ubrzano napreduju. Naša sposobnost da ih razumijemo, uskladimo i zaštitimo mora ostati korak ispred.
*U nadolazećim tjednima objavit ćemo tehničko izvješće o stečenim spoznajama.

