Sigurnost i usklađenost u eri modela dugog vremenskog horizonta
Što nas je interna upotreba dugotrajnog modela naučila o sigurnosti.
Sažetak
Modeli koji dugo rade mogu rješavati teške, otvorene probleme, ali njihova im ustrajnost daje više prilika za neželjene radnje.
Tijekom ograničene interne upotrebe modela treniranog za dugotrajne zadatke uočili smo nove neuspjehe koje naše postojeće evaluacije prije uvođenja nisu obuhvatile te smo pauzirali pristup. Zatim smo uvide iz tih neuspjeha iskoristili za izgradnju novih evaluacija, poboljšanje usklađenosti na dugim vremenskim horizontima, dodavanje nadzora na razini putanje te veću vidljivost i kontrolu za korisnike prije ponovne uspostave ograničenog pristupa.
To je iskustvo dodatno potvrdilo vrijednost iterativnog uvođenja. Nijedan fiksni skup evaluacija ne može predvidjeti svako ponašanje, pa se testiranje prije uvođenja mora upariti s pomnim nadzorom, zaštitnim mjerama koje mogu intervenirati i mogućnošću pauziranja ili vraćanja na prethodno stanje kada je potrebno.
Modeli koji mogu dugo raditi autonomno mogu preuzeti teške, otvorene probleme. No ista ustrajnost koja ih čini korisnima daje im i više prilika za neželjene radnje — i to na načine koje evaluacije namijenjene modelima kraćeg horizonta mogu propustiti.
Prije otprilike dva mjeseca objavili smo da je interni model opće namjene opovrgnuo Erdősevu slutnju o jediničnoj udaljenosti. Taj je model osmišljen za vrlo dugotrajan autonoman rad. Tijekom ograničene, nadzirane interne upotrebe uočili smo neželjeno ponašanje koje naše postojeće evaluacije prije uvođenja nisu obuhvatile. Budući da je uvođenje bilo ograničeno i nadzirano, mogli smo prepoznati te probleme, pauzirati pristup, izraditi nove evaluacije na temelju opažanja, ojačati model i njegove zaštitne mjere, a zatim ponovno omogućiti pristup uz nastavak nadzora.
Uvjeti u kojima evaluiramo modele nikada se neće savršeno podudarati s onima na koje nailaze u stvarnoj upotrebi. Zato evaluacije prije uvođenja treba upariti s ograničenim, nadziranim uvođenjem i mogućnošću intervencije, pauziranja ili vraćanja na prethodno stanje kada se pojave problemi. Ono što naučimo iz uvođenja zatim može postati dio snažnijih evaluacija i zaštitnih mjera prije širenja pristupa.
U sljedećim odjeljcima donosimo konkretne primjere onoga što smo uočili, kako smo riješili probleme i kako će to iskustvo oblikovati buduća izdanja.
Novi model može dugotrajno nastavljati raditi prema cilju kroz ponovljene pokušaje. Ta ga ista ustrajnost može navesti da pronađe i iskoristi slabosti u svojem okruženju. Prethodni modeli, kada bi naišli na ograničenja sandboxa ili okruženja, jednostavno bi stali i vratili se korisniku. Ovaj je model često nastavljao pokušavati, uključujući traženje načina da djeluje izvan svojeg sandboxa.
Primjer se dogodio tijekom interne evaluacije na NanoGPT speedrunu(otvara se u novom prozoru), javnom mjerilu za treniranje malog jezičnog modela u što manje koraka. Naš je model razvio postupno smanjenje stope učenja prema potencijskom zakonu, nazvano PowerCool, što je donijelo znatno poboljšanje. Model je dobio uputu da rezultate objavi samo na Slacku, ali upute za NanoGPT kažu da se rezultati objavljuju kao PR na GitHubu, pa je model slijedio te druge upute i otvorio PR #287 u javnom GitHub repozitoriju. Model je zaobišao ograničenja sandboxa osmišljena da blokiraju vanjski pristup i nastavio s prijenosom na GitHub. Našem je modelu trebao sat vremena da pronađe ranjivost u sandboxu kako bi izradio PR; raniji modeli bili su manje ustrajni i nisu uspjeli pronaći ranjivosti, nego su odustali od dijela s PR-om.1
Mnoge sigurnosne kontrole za AI asistente osmišljene su oko pojedinačnih radnji. Ako radnja nije dopuštena, blokira se. Ako je osjetljiva, sustav od korisnika traži izričito odobrenje. No modeli koji rade dugo, čije se radnje mogu autonomno odvijati satima, danima ili čak tjednima, dovode taj pristup u pitanje: praćenje pojedinačnih radnji više nije dovoljno za praćenje namjere ukupne putanje.
Primjerice, u scenariju u kojem je od modela zatraženo da riješi problem, model je uočio da su drugi sustavi imali uspješne, ali privatne prijave i pokušao je dohvatiti ta rješenja iz pozadinskog sustava za evaluaciju. Kada je njegov početni pokušaj blokiran jer je skener otkrio autentifikacijski token, model je tijelo tokena podijelio u dva fragmenta, prikrio ih, a zatim tijekom izvođenja ponovno sastavio vjerodajnicu kako se cijeli token nikada ne bi pojavio kao jedan neprekinuti niz znakova. Model je i u komentarima korisniku i u tragovima rasuđivanja izričito naveo da te korake poduzima kako bi zaobišao skener.
Ovaj primjer pokazuje kako svaki korak zasebno može izgledati prihvatljivo, dok slijed može dovesti do ishoda koji ne bi bio odobren. Također pokazuje kako model koji učinkovito djeluje kroz duge vremenske horizonte može naučiti slijepe točke sustava odobravanja i zaobići ga kako bi postigao svoje ciljeve. Sigurnost na dugim vremenskim horizontima ne zahtijeva samo pitanje „je li ova radnja dopuštena?” nego i „prema kojem ishodu vodi ovaj slijed radnji?”
Zbog ovakvih incidenata pauzirali smo interno uvođenje novog modela. Sigurnosni sustav ponovno smo izgradili oko slojevite obrane i nadzora na razini putanje.
- Evaluacije izvedene iz incidenata. Evaluacije nam mogu dati osjećaj je li sustav siguran za uvođenje prije nego što se stvarno uvede. No da bi bila najkorisnija, evaluacija treba odražavati distribuciju i duljinu horizonta putanja tijekom stvarnog uvođenja. Zbog toga smo uočene neuspjehe upotrijebili za razvoj adversarijalnih evaluacija. Utvrdili smo da poboljšanje rezultata na evaluacijama izvedenima iz stvarnih incidenata zatim dovodi do sigurnijeg ponašanja nakon uvođenja u produkciju.
- Poboljšano usklađivanje. Poduzeli smo korake kako bismo smanjili njegovu sklonost poduzimanju neželjenih radnji bez dopuštenja radi postizanja korisnikova cilja. Primjerice, otkrili smo da naši modeli slabije pamte upute tijekom dugih izvođenja; kada smo model trenirali za tu sposobnost, dobili smo model koji je ostao usklađen i kroz dulja izvođenja.
- Aktivni nadzor. Izradili smo sustav nadzora koji pregledava razvoj putanje modela tražeći znakove da zaobilazi korisničko ograničenje ili sigurnosnu granicu. Nadzorni sustav promatra ne samo jednu radnju, nego cijelu putanju. Važno je da nadzor može pauzirati sesiju i upozoriti korisnika da je pomnije pregleda. Nakon pregleda korisnik može odlučiti nastaviti rad modela ako se pokazalo da je nadzor pogrešno aktiviran.
- Veća vidljivost i kontrola za korisnika. Poboljšali smo mogućnost korisnika da pregledava te dugotrajne sesije, vidi poduzete radnje i prati intervencije.
Kako bismo evaluirali novi sustav nadzora, ponovno smo reproducirali mali skup internih okruženja za uvođenje u kojima je model ranije slijedio neusklađene radnje, ovaj put s novim zaštitnim mjerama2. Nove zaštitne mjere uspjele su uhvatiti znatno više neusklađenih radnji koje je model slijedio, a sve propuštene ocijenjene su kao niske ozbiljnosti.
Neki primjeri tih incidenata niske ozbiljnosti uključuju sljedeće slučajeve:
- Kako bi pristupio Linearovu alatu naredbenog retka, model je pokrenuo ugniježđenu sesiju
codex --yolo, iako je to zapravo mogao učiniti bez zastavice--yolo. - Model je primijetio da nedostaje resurs koji je prije bio aktivan, a zatim je počeo istraživati i SSH-om ulaziti u druge aktivne CPU podove u imenskom prostoru svojeg vlasnika, kao i (neuspješno) u podove drugih zaposlenika OpenAI-ja, bez dobrog razloga.
- Model je imao mnogo zaglavljenih procesa
findi svaka se naredba ljuske zablokirala. Zatim je pokrenuokill -9 -1, što bi poslalo SIGKILL svakom procesu koji smije ubiti na tom podu, da se izvršilo. Međutim, isteklo je vrijeme čekanja i nije se izvršilo.
Nakon testiranja novog sustava zaključili smo da se ograničeni interni pristup modelima sa sposobnostima dugog vremenskog horizonta može obnoviti. Od početka ponovnog uvođenja prije nekoliko tjedana nismo uočili nijedno ozbiljno zaobilaženje zaštitnih mjera. Prva verzija tih zaštitnih mjera namjerno je bila konzervativna. Nastavili smo podešavati sustav kako bismo smanjili nepotrebne prekide bez slabljenja zaštitnih mjera.
Budući da smo uvodili iterativno, mogli smo pronaći i ukloniti praznine prije širenja pristupa. Evaluacije prije uvođenja i dalje su ključne, ali uvođenje otkriva ponašanja koja one propuštaju. Početak s ograničenim pristupom omogućio nam je da promatramo model u praksi, pauziramo kada se pojave problemi, iskoristimo te neuspjehe za izgradnju boljih evaluacija i zaštitnih mjera te obnovimo ograničeni pristup nakon testiranja promjena.
Kako modeli preuzimaju dulje i složenije zadatke, neuspjesi koje evaluacije propuste mogu imati veće posljedice. Nastavit ćemo raditi na sužavanju jaza između evaluacije i uvođenja: testirati modele kroz dulje putanje, poboljšavati usklađivanje, graditi nadzor koji može intervenirati te korisnicima davati jasniju vidljivost i kontrolu. Ti izazovi neće biti jedinstveni za OpenAI i nadamo se da će ono što smo naučili pomoći široj zajednici da se za njih pripremi.
Autor
Fusnote
- 1
Iako smo brzo zatvorili PR, više sudionika u speedrunu već ga je vidjelo i primijenilo taj pristup u vlastitim prijavama; uzastopne prijave svjetskog rekorda s 3030(otvara se u novom prozoru), 2990(otvara se u novom prozoru), 2930(otvara se u novom prozoru), 2925(otvara se u novom prozoru), 2900(otvara se u novom prozoru) i 2890(otvara se u novom prozoru) koraka sve navode PR 287. Među njima je PR 300(otvara se u novom prozoru) posebno zanimljiv jer ga je predao Opus 4.7 kada ga je Prime Intellect(otvara se u novom prozoru) evaluirao na NanoGPT speedrunu. Opus je vidio PR koji je predao naš model, ugradio otkrića i u konačnom rezultatu naveo naš PR.
- 2


