Prioriteti i principi djelotvornih procjena trećih strana
Laboratorije za graničnu umjetnu inteligenciju imaju ogromnu odgovornost da modele sigurno obučavaju, evaluiraju i uvode u upotrebu. Procjene trećih strana ključne su za uravnoteženje te odgovornosti, proširenje mogućnosti za doprinos sigurnosti umjetne inteligencije, informiranje javnosti i pozivanje laboratorija na odgovornost prema jasnim i nezavisno potkrijepljenim tvrdnjama o sigurnosti.
U okviru nastojanja da držimo korak s graničnim razvojem, OpenAI se obavezuje podržavati nezavisne procjene uz opsežan pristup tokom obuke, evaluacije i uvođenja u upotrebu. Taj pristup treba omogućiti procjeniteljima da preispitaju naše pretpostavke, utvrde rizike koje smo možda previdjeli i donesu vlastite zaključke o djelotvornosti naših zaštitnih mjera.
Već dugo sarađujemo s procjeniteljima iz trećih strana u različitim fazama razvoja i uvođenja modela u upotrebu. Procjene trećih strana uvrstili smo i u svoje prakse povezane s Okvirom pripravnosti te podržali organizacije i zakonodavstvo koji se zalažu za strožiji i odgovorniji proces. Tokom te saradnje pružili smo opsežne oblike pristupa, uključujući informacije o našim tehničkim zaštitnim mjerama, pristup vidljivom lancu razmišljanja te dosad nezabilježen nivo pristupa povjerljivim podacima i internim implementacijama radi odgovora na incidente i praćenja kroz red teaming. Ovdje izneseni prioriteti i principi usmjereni su na našu saradnju s nezavisnim organizacijama za procjenu iz privatnog i neprofitnog sektora u području tehničkih procjena sigurnosti. Oni dopunjuju naš rad s vladama na testiranju i evaluaciji, gdje različite uloge i odgovornosti mogu zahtijevati drugačije pristupe.
Za djelotvornost ovih procjena potrebni su snažni mehanizmi nezavisnosti, naučna strogost, robusne sigurnosne prakse i jasne odgovornosti. Laboratorije su odgovorne omogućiti smislen nadzor uz zaštitu osjetljivih informacija. Laboratorije i nezavisni procjenitelji dijele odgovornost da se ovaj posao obavi ispravno te trebaju raditi u skladu sa zajedničkim međunarodnim standardima sigurnosnih i zaštitnih praksi. U nastavku predlažemo četiri prioritetna područja za dublju procjenu, uz principe strogog, sigurnog i nezavisnog rada.
Procjene trećih strana najkorisnije su kada se bave konkretnim, važnim pitanjima: Potkrepljuju li dokazi sigurnosnu argumentaciju i tvrdnje o sigurnosti laboratorije? Ispituju li evaluacije na odgovarajući način rizike koje trebaju mjeriti? Djeluju li zaštitne mjere u realnim uslovima?
Ovdje opisane procjene trebaju poprimiti različite oblike zavisno od sigurnosnih pitanja koja se ispituju. Očekujemo da ćemo paralelno i tokom različitih razdoblja podržavati više procjena, od kojih će neke trajati sedmicama, a druge nekoliko mjeseci. Iako procjene trećih strana mogu biti dio rada prije uvođenja i utjecati na odluke o uvođenju, ovdje opisani rad uglavnom je dugoročniji i nije vezan za lansiranje, već je usmjeren na temeljito, kontinuirano ispitivanje konkretnih tvrdnji o sigurnosti.
U svim našim prioritetnim područjima i principima spominjemo tvrdnje o sigurnosti i sigurnosne argumentacije. Pod tim pojmovima podrazumijevamo sljedeće:
Tvrdnja o sigurnosti: Konkretna tvrdnja o sposobnostima, ponašanju ili zaštitnim mjerama modela ili sistema koja je važna za njegovu sigurnost i može se procijeniti na osnovu dokaza. Tvrdnja treba navesti rizike i uslove na koje se odnosi, kao i relevantne pretpostavke i ograničenja.
Sigurnosna argumentacija: Strukturiran argument, potkrijepljen dokazima, koji objašnjava zašto se rizicima modela ili sistema adekvatno upravlja u okviru određene aktivnosti, kao što su obuka, evaluacija ili uvođenje u upotrebu. Sigurnosna argumentacija povezuje pojedinačne tvrdnje o sigurnosti s dokazima koji ih potkrepljuju te jasno navodi pretpostavke, neizvjesnosti i preostale rizike koji bi mogli utjecati na njene zaključke.
Predlažemo četiri prioritetna područja za dublju procjenu, uz principe strogog, sigurnog i nezavisnog rada.
Nezavisna procjena sigurnosnih argumentacija koja obuhvata obuku, evaluaciju te interno i vanjsko uvođenje u upotrebu.
Procjena sigurnosnih argumentacija zahtijeva stručnost u području usklađivanja, metoda kontrole poput praćenja, kibernetičke sigurnosti, biološke i hemijske zloupotrebe te red teaminga. Sigurnosne argumentacije sastoje se od tvrdnji koje obuhvataju obuku, evaluacije sposobnosti i zaštitne mjere, a mogu se procjenjivati u cjelini ili po dijelovima (pogledajte prioritete 2 i 3 u nastavku). Vjerovatno će biti potrebno da više procjenitelja ispita različite dijelove argumentacija, oslanjajući se na svoju stručnost. Njihove procjene zajedno trebaju odgovoriti na pitanja kao što su:
Jesu li dokazi za sigurnosne argumentacije povezane s obukom, evaluacijom i uvođenjem u upotrebu dovoljno potkrijepljeni? Jesu li uslovi sigurnosne argumentacije poštovani tokom obuke, evaluacije i uvođenja u upotrebu?
Obuhvataju li naše sigurnosne argumentacije najhitnije rizike utvrđene tokom procjene? Potkrepljuju li tvrdnje o sigurnosti cjelokupnu sigurnosnu argumentaciju? Postoje li nedostaci ili područja koja treba poboljšati?
Koriste li se djelotvorne metode za prepoznavanje i smanjenje poticaja u obuci koji bi mogli nagrađivati obmanu, manipulisanje nagradom, destruktivne radnje ili zaobilaženje ograničenja?
Procjena ključnih zaštitnih mjera u internim i vanjskim implementacijama
Naš skup zaštitnih mjera stalno se razvija kako bi odgovorio na promjene sposobnosti i okruženja. Naše zaštitne mjere obuhvataju obuku te interno i vanjsko uvođenje u upotrebu. Trenutno uključuju zaštitne mjere na nivou modela, mjere provedbe i sigurnosne mjere, kao i sisteme za praćenje neusklađenosti, čime obuhvataju širok raspon rizika poput gubitka kontrole te kibernetičke, biološke i hemijske zloupotrebe. Tehnička partnerstva mogu već sada utvrditi slabosti zaštitnih mjera, istovremeno poboljšavajući metode procjene i ubrzavajući razvoj standarda. Time se stvara čvršća tehnička osnova za buduće javne politike koje će držati korak s graničnim razvojem, naročito za interne implementacije, gdje su sigurnosni i zaštitni standardi još u začetku.
Nezavisnim procjenama treba ispitati koliko dobro ove zaštitne mjere djeluju i gdje mogu zakazati, na primjer:
Uz pristup „sivoj kutiji“, jesu li zaštitne mjere otporne na protivničko testiranje (jailbreakove) i pružaju li dovoljnu zaštitu od povećanja sposobnosti u visokorizičnim područjima, npr. kibernetičkom i biološkom? Obuhvataju li naše protivničko testiranje i red teaming najvažnije rizike?
Kako agenti tokom odobrenog testiranja u realnim radnim uslovima stupaju u interakciju s kibernetičkom odbranom, kao što su kontrole pristupa, izolirana okruženja te sistemi za otkrivanje i odgovor? Koje odbrambene mjere sprečavaju, otkrivaju ili ograničavaju štetne radnje i gdje zakazuju?
Imaju li naši sistemi za praćenje neusklađenosti kritične nedostatke koji bi mogli dovesti do gubitka kontrole ili ozbiljne neusklađenosti pri internom ili vanjskom uvođenju u upotrebu? Koliko je praćenje lanca razmišljanja pouzdan izvor dokaza o sigurnosti ili usklađenosti dok se sposobnosti modela poboljšavaju?
Je li odgovarajuće praćenje provedeno u svim relevantnim obukama, evaluacijama i implementacijama tako da se ne može lako onemogućiti?
Jesu li zaštitne mjere provedene razmjerno sposobnostima?
Procjena evaluacija sposobnosti koje obuhvataju kategorije rizika pripravnosti (hemijske i biološke rizike, kibernetičku sigurnost i samousavršavanje umjetne inteligencije) te evaluacija usklađenosti za rizike neusklađenosti
Naš Okvir pripravnosti zahtijeva evaluacije ključnih područja graničnog rizika. Kako se pragovi premašuju, a evaluacije dostižu svoje granice, važno ih je redovno osvježavati te osigurati obuhvat i kvalitet evaluacija sposobnosti u područjima rizika pripravnosti, kao i evaluacija usklađenosti namijenjenih procjeni rizika ozbiljne neusklađenosti.
Relevantna pitanja uključuju:
Obuhvataju li evaluacije rizika pripravnosti na odgovarajući način definiciju praga rizika pripravnosti? Jesu li pragovi za ove evaluacije pravilno postavljeni?
Ažuriraju li se evaluacije kada modeli dosljedno postižu najviše rezultate i mjere li novi testovi smisleno naprednije sposobnosti?
Obuhvataju li naše evaluacije usklađenosti na odgovarajući način rizike ozbiljne neusklađenosti i koja bi važna ponašanja ili uslove mogle previdjeti?
Nezavisna istraga kritičnih incidenata neusklađenosti
Nezavisna istraga može biti korisna kod različitih kritičnih incidenata povezanih sa sigurnošću umjetne inteligencije. Ovdje se usmjeravamo na neusklađenost modela, uključujući modele koji djeluju bez odobrenja ili izbjegavaju nadzor, što može otkriti slabosti metoda usklađivanja i zaštitnih mjera čak i bez namjerne zloupotrebe.
U određenim okolnostima, kao u slučaju incidenta OpenAI Hugging Face, može biti korisno angažirati nezavisnu treću stranu za nezavisne istrage incidenata neusklađenosti. Ključno je da treće strane uključene u istragu incidenta imaju potrebnu stručnost, uključujući, gdje je primjenjivo, stručnost u kibernetičkoj forenzici i usklađivanju, analizu lanca razmišljanja velikih razmjera te osoblje i resurse potrebne za pravovremenu istragu. Odgovor na incident može zahtijevati pristup osjetljivim internim podacima i podacima trećih strana, pa neki detalji mogu biti previše osjetljivi za objavljivanje ili pristup. Nalazi nezavisnih istraga mogu doprinijeti i sigurnosnoj argumentaciji modela pružanjem dokaza za procjenu tvrdnji o njegovoj usklađenosti i djelotvornosti mjera poduzetih radi otklanjanja prethodno uočene neusklađenosti.
U kontekstu incidenata neusklađenosti prednost dajemo nezavisnim procjenama sljedećeg:
Koja su ponašanja modela ili problemi s neusklađenošću nastali tokom incidenta i koji su glavni faktori koji su im doprinijeli?
Bi li zaštitne i korektivne mjere djelotvorno ublažile slične incidente u budućnosti?
Jasno utvrđen obim i međusobno usaglašene tvrdnje za procjenu: Procjene trebaju početi međusobnim usaglašavanjem obima, nakon čega se jasno definiraju tvrdnje o sigurnosti koje se unaprijed registriraju prije početka aktivnosti procjene. Treće strane i laboratorije trebaju razjasniti jesu li to tvrdnje koje procjenjivana kompanija želi podnijeti na procjenu ili tvrdnje koje nezavisni procjenitelj želi samostalno procijeniti, a laboratorija pristaje da se prema njima ocjenjuje. Postoje brojni razlozi zbog kojih neke tvrdnje mogu biti izvan obima, uključujući nemogućnost trećih strana da pristupe podacima, nedovoljnu stručnost procjenitelja ili razumna vremenska ograničenja kada je procjena hitna. Laboratorije i procjenitelji trebaju uspostaviti postupak razmatranja značajnih rizika utvrđenih izvan prvobitnog obima, uključujući odluku o tome je li potrebno dodatno istraživanje. U zaključcima treba jasno navesti šta je procijenjeno, a šta nije, u odnosu na međusobno usaglašeni obim.
Proporcionalan pristup: Procjeniteljima treba, gdje je moguće i u okviru pravnih, sigurnosnih i ograničenja intelektualnog vlasništva, omogućiti pristup proporcionalan procjeni dogovorenih tvrdnji. Kada je direktan pristup nepraktičan ili nemoguć, procjenitelji mogu sarađivati s ovlaštenim predstavnikom kompanije ili razmotriti posredne mehanizme pristupa, odnosno one koji čuvaju privatnost, radi zaštite osnovnih informacija.
Transparentna metodologija i standardi: Procjenitelji trebaju objasniti svoje metode, kriterije procjene i neizvjesnosti te se, gdje su dostupni, osloniti na uspostavljene standarde. Ako standardi još ne postoje, trebaju jasno obrazložiti kriterije koje koriste. Izvještaji trebaju razlikovati direktne nalaze od tumačenja, objasniti neizvjesnost i jasno navesti koje zaključke dokazi potkrepljuju.
Stručnost i nezavisnost: Procjenitelji trebaju pokazati odgovarajuću tehničku stručnost te utvrditi, objaviti i riješiti organizacijske i pojedinačne sukobe interesa, uključujući finansijske poticaje, odnose s programerima i prethodno učešće u radu koji se procjenjuje. Zaštitne mjere trebaju biti osmišljene tako da komercijalni pritisci i modeli naknade ne utječu na nalaze, a mogu uključivati izuzeće iz postupka ili odgovarajuća razdoblja zabrane učešća.
Sigurnost i povjerljivost: Procjenitelji trebaju pokazati da primjenjuju prakse informacijske sigurnosti i provedive mjere zaštite povjerljivosti koje obuhvataju njihovo osoblje i proporcionalne su osjetljivosti sistema i informacija kojima pristupaju. Ove mjere trebaju obuhvatiti intelektualno vlasništvo, osjetljive informacije i evidenciju procjene. Kada procjenitelji ne mogu ispuniti sigurnosne zahtjeve u vlastitim okruženjima ili su podaci kojima pristupaju naročito osjetljivi, može biti primjeren pristup putem uređaja ili u prostorijama kojima upravlja kompanija.
Primjenjivi nalazi i vrijeme za otklanjanje nedostataka: Procjene trebaju utvrditi konkretne nedostatke i pružiti dovoljno detalja da ih laboratorije mogu otkloniti. Kada je primjereno, laboratorijama treba dati razuman rok da otklone probleme prije objavljivanja. Kada je relevantno, izvještaji trebaju objasniti i pouke za programere, implementatore i zaštitnike agenata te ponuditi praktične preporuke za primjenu.
Odgovorne prakse objavljivanja: Izvještaji o procjeni trebaju se zasnivati na dokazima i dijeliti što otvorenije, uz zaštitu osjetljivih i povjerljivih informacija. Kada potpuno javno objavljivanje nije moguće, povjerljivo izvještavanje odgovarajućih nadzornih tijela, poput upravljačkih tijela ili upravnih odbora kompanija, može doprinijeti odgovornosti. Radi očuvanja ravnoteže između nezavisnosti i povjerljivosti, trebaju postojati principijelne mjere i pravila za redigiranje, kao i jasna očekivanja u pogledu povratnih informacija i ispravljanja netačnosti. Procjenitelji trebaju zadržati uredničku nezavisnost i istovremeno osigurati zaštitu povjerljivosti i intelektualnog vlasništva. Procjenitelji trebaju usvojiti jasna pravila redigiranja koja laboratorijama omogućavaju da zatraže uklanjanje osjetljivih informacija, dok procjenitelji mogu naznačiti gdje su izvršena značajna redigiranja i kako su utjecala na njihov izvještaj o procjeni.
Posvećeni smo podršci nezavisnim procjeniteljima i uspostavljanju jasnijih zajedničkih međunarodnih standarda za djelotvorne procjene trećih strana, kako kroz buduće zakone tako i kroz privatne institucije upravljanja. Iako se ekosistem nezavisnih evaluacija još razvija, pomoći ćemo njegovom rastu podržavajući raznoliku zajednicu nezavisnih procjenitelja s velikom stručnošću u pitanjima sigurnosti granične umjetne inteligencije i sarađujući s njima. Nijedna treća strana ne može niti treba sveobuhvatno obuhvatiti hitna pitanja sigurnosti granične umjetne inteligencije. Postupat ćemo promišljeno i ciljano kako bismo povećali svoje kapacitete i omogućili rastućem ekosistemu trećih strana da se usaglasi o najboljim praksama i principima. Razgovaramo s više trećih strana o prijedlozima usklađenim s prethodno navedenim prioritetnim područjima.


