Preskočite na glavni sadržaj
OpenAI

28. septembar 2026.

Sigurnost

Ka sigurnosnoj argumentaciji za obuku graničnih AI modela

Učitavanje…

Vjerujemo da ulazimo u novo doba u kojem bi strukturirana sigurnosna dokumentacija trebala biti obavezna prije nastavka bilo kojeg ciklusa obuke graničnih modela učenjem s potkrepljivanjem. U idealnom slučaju, takva dokumentacija dostigla bi nivo „sigurnosne argumentacije“ — sveobuhvatnog, strukturiranog i dokazima potkrijepljenog obrazloženja o rizicima, kakvo se koristi u drugim industrijama u kojima je sigurnost presudna. Sigurnosnu argumentaciju smatramo dugoročnim ciljem prema kojem usmjeravamo svoj rad. Pritom prepoznajemo koliko je izazovno postići isti nivo rigoroznosti za AI modele kao za avijaciju ili nuklearnu energetiku, zbog nove složenosti koja nastaje na svakom narednom nivou sposobnosti AI sistema. Radimo na okviru kojim ćemo formalizirati ove prakse.

U nastavku su neke početne smjernice za koje smatramo da trebaju biti dio takve sigurnosne argumentacije za obuku graničnih AI modela. Ove najbolje prakse odražavaju naša dosadašnja saznanja i očekujemo da će se razvijati dok nastavljamo unapređivati interne procese za pažljiv razvoj. Objavljujemo ih sada kako bismo transparentno predstavili svoje trenutno razmišljanje i pozvali zajednicu da podijeli povratne informacije. Napominjemo da je ovaj dokument usmjeren na obuku graničnih modela učenjem s potkrepljivanjem; interna i eksterna upotreba zahtijevaju razmatranje znatno šireg skupa svojstava usklađenosti.

1. Tehničke zaštitne mjere

Sigurnosna argumentacija treba obuhvatiti tri aspekta tehničkog sistema: obuku za usklađenost, izolaciju i nadzor. Ove zaštitne mjere pomažu osigurati da model ne pokušava poduzimati neusklađene radnje. Čak i ako bi to pokušao, bilo bi mu teško probiti izolaciju, a nadzor bi to otkrio prije nego što nastane šteta.

  • Usklađenost modela: Prva linija odbrane treba biti obuka modela za usklađenost, odnosno za pouzdano djelovanje na način koji smo namjeravali. To bi moglo uključivati:

    • Okruženja za obuku i ocjenjivanje: Smanjiti rizik da modeli razviju neusklađeno ponašanje sprečavanjem pozitivnog potkrepljivanja zloupotrebe sistema nagrađivanja tokom obuke. To bi moglo uključivati:

      • Automatizirani pregledi skupova podataka: Koristiti agente za pronalaženje i ispravljanje neispravnih okruženja za učenje s potkrepljivanjem koja bi mogla omogućiti da neusklađeni nizovi radnji dobiju visoku nagradu iskorištavanjem propusta umjesto namjeravanim ponašanjem. Time se smanjuju prilike za potkrepljivanje neusklađenosti tokom obuke.

      • Ručni pregledi skupova podataka: Dopuniti automatizirani red teaming ručnim pregledima i provjerama kvaliteta skupova podataka kako bi se prepoznali zadaci s nedostacima koji bi mogli nenamjerno potkrepljivati neusklađeno ponašanje.

      • Podešavanje ocjenjivača: Podesiti ocjenjivače da kažnjavaju pokušaje modela da tokom obuke iskorištava propuste ili manipulira okruženjima za učenje s potkrepljivanjem.

      • Analiza prethodnih ciklusa obuke: Primijeniti klasifikatore na zapise iz prethodnih eksperimenata kako bi se provjerilo rade li ocjenjivači kako je predviđeno.

    • Mjerenje usklađenosti: Provoditi procjene koje prate sklonost modela neusklađenosti kako bi se izmjerila djelotvornost obuke za usklađenost. To bi moglo uključivati:

      • Offline procjene usklađenosti: Provoditi procjene usklađenosti tokom ciklusa obuke graničnih modela kako bi se utvrdilo daje li obuka predviđene rezultate i istražila sva značajna pogoršanja.

      • Retrospektivno testiranje: Testirati procjene usklađenosti na prethodnim incidentima kako bi se potvrdilo da otkrivaju ranije neusklađene modele i da nisu pretjerano prilagođene pojedinačnim incidentima.

      • Praćenje manipuliranja procjenama: Pratiti svijest o procjeni ili strateško prilagođavanje testiranju (kada modeli prepoznaju da ih se testira) koji bi mogli izazvati promjenu ponašanja. Naprimjer, pri procjenama usklađenosti uključiti nadzor svijesti o procjeni i strateškog prilagođavanja, uz konkretne pragove za blokiranje.

      • Testovi otpornosti za najgore scenarije: Izazvati najgore oblike nepoželjnog ponašanja i provjeriti bi li barem jedna procjena otkrila takvo ponašanje.

    • Sprečavanje obuke na lancu razmišljanja: Automatiziranim ocjenjivačima ne dozvoliti uvid u lanac razmišljanja tokom učenja s potkrepljivanjem, kako modeli ne bi razvili sposobnost izbjegavanja nadzora lanca razmišljanja.

  • Izolacija: Osigurati dovoljno snažnu izolaciju izvršavanja i sigurnosne mjere da spriječe štetne radnje ako model postane neusklađen. To bi moglo uključivati:

    • Više slojeva infrastrukturne sigurnosti: Znatno ulagati u jačanje zaštite i izolovanog okruženja u kojem model radi i istraživačke infrastrukture na kojoj se to okruženje nalazi, kako bismo imali dodatni sloj zaštite u slučaju izlaska iz izolovanog okruženja.

    • Red teaming izolacije: Unapređivati sigurnost izolovanog okruženja, istraživačke infrastrukture i mrežnog perimetra kroz iterativni red teaming tih sistema, koristeći kontrolne tačke iz ciklusa obuke graničnih modela uz sigurnosnu analizu, kako bi se pronašli i otklonili svi propusti. Također provoditi red teaming svih servisa kojima bi model mogao pristupiti tokom obuke (npr. internetske predmemorije).

    • Komunikacija između uzoraka: Komunikaciju velike propusnosti između uzoraka ograničiti na odobrene kanale, poput alata za više agenata, i zatvoriti bočne infrastrukturne kanale velike propusnosti koje agenti lako mogu otkriti.

    • Nepromjenjivi transkripti: Čuvati transkripte agenata u nepromjenjivom obliku tokom razumnog perioda (npr. na računima za pohranu koji dopuštaju samo jednokratno zapisivanje) za svu obuku učenjem s potkrepljivanjem, procjene i internu upotrebu, kako bi se omogućile pouzdane istrage incidenata i spriječile nenamjerne izmjene.

  • Nadzor: Imati sistem nadzora u realnom vremenu koji će, ako modeli počnu poduzimati neusklađene radnje, otkriti svaku potencijalnu neusklađenost i omogućiti brzo rješavanje prioritetnih problema prije nego što dođe do ozbiljnog incidenta. To bi moglo uključivati:

    • Osiguravanje mogućnosti nadzora: Osigurati da modeli i dalje mogu biti nadzirani, što se mjeri procjenama mogućnosti nadzora i njegovog izbjegavanja uz jasne pragove, kako bi se zabrinjavajuće ponašanje rano otkrilo.

    • Visoka stopa otkrivanja poznatih problema: Osigurati da sistem nadzora ima visoku stopu otkrivanja prethodnih incidenata u procjeni na izdvojenom testnom skupu.

    • Ažurnost procjena sistema nadzora: Izrađivati primjere za procjenu koji predstavljaju potpuno nove rizike u novim ciklusima obuke, kako mjere stope otkrivanja i preciznosti nadzora ne bi zastarjele.

    • Brzo reagovanje: Uvesti prioritetna upozorenja koja dovode do reakcije u roku definisanom sporazumom o nivou usluge (SLA), bilo hitnim obavještavanjem dežurne osobe ili automatskim pauziranjem pogođenog ciklusa obuke, prije nego što model prouzrokuje štetu (npr. tokom dana o incidentima hitno obavijestiti dežurnu osobu za sigurnost i osobu odgovornu za ciklus obuke, a noću automatski pauzirati cikluse ako prijem upozorenja nije potvrđen).

2. Operativne smjernice

Uz preporuke o tehničkim zaštitnim mjerama, radimo i na najboljim operativnim praksama za sigurnosnu argumentaciju za cikluse obuke graničnih AI modela. One bi mogle obuhvatati sljedeće:

  • Izdvojena mišljenja (unaprijed provedene analize mogućih neuspjeha): Nakon izrade nacrta sigurnosne argumentacije, član drugog tima treba napisati izdvojeno mišljenje kako bi otkrio moguće nedostatke i iznio odmjerenu procjenu rizika. Tim za obuku zatim treba odgovoriti na te primjedbe kako bi sigurnosna argumentacija bila čvršća.

  • Odobrenja: Sigurnosnu argumentaciju trebaju pregledati članovi višeg rukovodstva, od kojih svaki treba imati pravo veta na pokretanje ciklusa obuke. Time se osigurava više internih nivoa provjere ciklusa (npr. rukovodilac istraživačkog odjela / potpredsjednik, rukovodilac za sigurnost i glavni naučnik).

  • Odgovornost: Viši rukovodilac zadužen za ciklus obuke (npr. rukovodilac istraživačkog odjela / potpredsjednik za istraživanje) treba snositi odgovornost za sigurnosnu argumentaciju i reagovanje na sve incidente, uključujući i kroz ocjenu radnog učinka. Time se i timovi za obuku potiču da se zalažu za sigurnost i usklađenost.

  • Pauziranje: Ako se otkriju problemi koji bi poništili valjanost sigurnosne argumentacije (npr. novi sigurnosni problem), treba osigurati operativne priručnike, tehničke kontrole i sporazume o nivou usluge (SLA) za pauziranje svih obuhvaćenih ciklusa obuke.

  • Interna transparentnost: Sigurnosna argumentacija treba biti dostupna internim nadzornim tijelima (npr. Odboru za sigurnost i zaštitu).

  • Revizije: Revizorima treba omogućiti dovoljan pristup da provjere jesu li tvrdnje u sigurnosnoj argumentaciji valjane i utemeljene te da ukažu na eventualne nedostatke.

  • Eskalacije: Treba postojati jasan postupak za eskalaciju problema neusklađenosti, uz tabelu definisanih nivoa ozbiljnosti neusklađenosti i dežurnu osobu koja može hitno obavijestiti rukovodioce (npr. generalnog direktora) kada ciklus obuke dostigne određeni nivo ozbiljnosti.

  • Tehničke kontrole: Ljudima i agentima treba otežati pokretanje ciklusa obuke koji ne ispunjavaju zahtjeve. Sigurnosne funkcije, poput nadzora i automatskog pauziranja, u slučaju otkaza trebaju blokirati rad (npr. ne smije biti moguće pokrenuti ciklus obuke bez uključenog odgovarajućeg nadzora niti isključiti nadzor iz same obuke učenjem s potkrepljivanjem, procjene ili interne upotrebe).

  • Mogućnost vraćanja na prethodno stanje: Treba biti lako utvrditi sve naknadne upotrebe neusklađenog modela u procesu obuke (npr. generisanje podataka ili ocjenjivanje) kako bi se, po potrebi, mogli poništiti učinci neusklađenih izlaznih rezultata.

  • Potpunost popisa preostalih rizika: Sigurnosna argumentacija treba sadržavati što potpuniji popis preostalih rizika koji nisu obuhvaćeni postojećim mjerama ublažavanja, kako bi se omogućilo informisano odlučivanje o prihvatanju rizika.

Ovo su naše trenutne preporuke i u toku je njihovo uvođenje u OpenAI. Očekujemo da će se naše prakse nastaviti razvijati u narednim sedmicama.

3. Istrage incidenata neusklađenosti

Razvijamo i najbolje prakse za istraživanje ozbiljnih incidenata neusklađenosti AI sistema. Laboratorije trebaju nastojati izvući što više pouka iz pojedinačnih incidenata (slično istražnim praksama⁠(otvara se u novom prozoru) u drugim industrijama u kojima greške mogu imati ozbiljne posljedice) kako bi spriječile takve događaje u budućnosti. Primjeri takvih mjera mogli bi uključivati:

  • Interna transparentnost: Budući da završetak istrage može potrajati, o istragama incidenata treba periodično izvještavati unutar organizacije (npr. svakodnevno za istrage koje su u toku). Zaposlenici trebaju imati definisane načine da dobiju širi pristup, uključujući izvorne transkripte i uzorkovanje izlaznih rezultata neusklađenih modela, ako je to sigurno i relevantno za njihov rad.

  • Osnovni uzrok neusklađenosti: Istraživači trebaju utvrditi osnovne uzroke u dinamici obuke (npr. ciljanim ablacijama ili eksperimentima ponovnog uzorkovanja) kako bi razumjeli kako su nastala neusklađena ponašanja, unaprijedili naučno razumijevanje neusklađenosti i uspješnije je sprečavali u budućnosti.

  • Naknadna analiza: Treba provesti naknadnu analizu operativnih postupaka i organizacijske kulture kako bi se razumjeli svi uzroci koji su doprinijeli incidentu, uključujući razloge zbog kojih su problemi nastali i ostali neotkriveni ili nisu eskalirani prije incidenta.

  • Otkrivanje: Trebamo razviti metode testiranja usklađenosti koje mogu otkriti sklonost izazivanju takvog incidenta, bez direktnog iterativnog optimiziranja na osnovu informacija iz incidenta (npr. transkripata ili sažetaka incidenta). Procjene izvedene iz incidenata treba izraditi kao „regresijske testove“ kako bi se osiguralo da budući modeli ne pokazuju sklonost neusklađenosti u vrlo sličnim incidentima.

  • Javno objavljivanje: Rezultate istrage, naknadne analize i operativne promjene treba podijeliti s javnošću nakon završetka istrage. Pogođene treće strane treba obavijestiti što prije.

Autor

OpenAI