Naš okvir za izvješćivanje o neusklađenosti modela
Predstavljamo novi okvir za praćenje, istraživanje i objavljivanje slučajeva neusklađenosti modela u OpenAI-ju, zajedno sa šest izvješća o neočekivanom ili zabrinjavajućem ponašanju modela koje smo uočili tijekom proteklih šest mjeseci.
Kako bismo bolje informirali istraživače, razvojne programere umjetne inteligencije, donositelje politika i širu javnost, i dosad smo nastojali javno objavljivatisvoja saznanja o neusklađenosti. No bez sustavnog pristupa izvješćivanju o tim saznanjima naše su objave bile povremene i rjeđe nego što bi bilo poželjno: često smo čekali da možemo objediniti nekoliko slučajeva u jednom izvješću ili smo ih dodavali dokumentu o sustavu sustava za novoobjavljene modele. Svrha je ovog novog okvira ubrzati objavu izvješća o neusklađenosti nakon što se ona uoči, čak i kada ponašanje o kojem izvješćujemo još nismo u potpunosti objasnili ili ublažili.
Kako sustavi umjetne inteligencije postaju napredniji i sve rašireniji, moramo izgraditi širi i bolje informiran konsenzus o napretku istraživanja usklađivanja. Ne vjerujemo da je industrija umjetne inteligencije riješila pitanja usklađivanja i nadzora u mjeri koja bi još dugo omogućavala odgovorno povećavanje opsega maksimalnom brzinom. Odluke o tome kako bi se razvoj umjetne inteligencije trebao nastaviti u sljedećim mjesecima i godinama moraju se temeljiti na dokazima koje ljudi izvan tvrtki koje razvijaju najnaprednije modele mogu samostalno proučiti.
Primjeri neusklađenosti mogu pomoći u prepoznavanju problema na koje bi drugi razvojni programeri mogli naići kada njihovi sustavi dosegnu slične sposobnosti, otkriti slabosti zaštitnih mjera ili dovesti u pitanje pretpostavke o ponašanju modela. Objavljivanje tih saznanja omogućuje drugima da istraže iste probleme, provjere naša objašnjenja i poboljšaju mjere ublažavanja. Budući da vjerujemo u vrijednost transparentnosti u pogledu neusklađenosti, naš novi okvir daje prednost objavi čak i kada značaj nije siguran. To znači da bi se neki od slučajeva koje objavimo mogli pokazati neutemeljenima, odnosno da nisu dio šireg obrasca niti upućuju na budući razvoj događaja.
Trenutačno ne postoji okvir na razini cijele industrije s izričitim standardima o tome kako bi razvojni programeri umjetne inteligencije trebali objavljivati primjere neusklađenosti svojih modela. Nadamo se da je okvir koji danas predstavljamo prvi korak prema stvaranju takvih standarda jer određuje koje bi slučajeve neusklađenosti razvojni programeri trebali objaviti i što bi njihova izvješća trebala sadržavati. Ovaj okvir smatramo projektom u razvoju koji ćemo usavršavati na temelju iskustva i povratnih informacija javnosti.
Ovdje opisujemo kako će okvir funkcionirati i iznosimo prva izvješća koja objavljujemo.
Cilj nam je objaviti primjere koji pružaju korisne dokaze o tome kako nastaje neusklađenost modela, kako se očituje te gdje su zaštitne mjere uspješne ili neuspješne. Prednost dajemo novim mehanizmima, značajnim promjenama poznatog ponašanja i saznanjima koja dovode u pitanje pretpostavke o sigurnosti ili ublažavanju rizika. Primjer ne mora prouzročiti štetu ni potvrditi širi obrazac da bi zaslužio objavu. Ovaj će okvir obuhvaćati relevantno ponašanje tijekom cijelog životnog ciklusa modela, uključujući obuku, evaluaciju, testiranje i implementaciju.
To uključuje nove načine na koje modeli djeluju bez odobrenja, koordiniraju se s drugim modelima ili izbjegavaju nadzor; propuste koji dovode u pitanje metodu usklađivanja ili zaštitnu mjeru; te ponašanje koje osporava neku tvrdnju iz objavljene sigurnosne procjene. Isti kriteriji objave primjenjuju se na neusklađenost koja može utjecati na treće strane.
To može uključivati i slučajeve neusklađenosti koji se čine jednakima onima koje smo već objavili. Ponavljanje problema može samo po sebi biti koristan dokaz o ponašanju naših modela ili učinkovitosti zaštitnih mjera, primjerice ako se određena vrsta neusklađenog ponašanja nastavlja ponavljati unatoč opetovanim pokušajima njegova ublažavanja. U takvim ćemo okolnostima dodatne primjere objaviti ažuriranjem izvorne objave o neusklađenosti.
S vremenom planiramo razviti objektivnije kriterije objave u suradnji s drugim razvojnim programerima, vanjskim istraživačima, tijelima za industrijske standarde i regulatorima. Smatramo i da ozbiljne incidente povezane sa sigurnošću, zaštitom i neusklađenošću treba prijavljivati saveznoj vladi SAD-a te radimo na prijedlogu mehanizama izvješćivanja. Ovaj okvir smatramo dopunom postojećim obvezama i napominjemo da on ne zamjenjuje naše zakonske obveze objave, uključujući one koje se odnose na kritične sigurnosne incidente ili povrede kibernetičke sigurnosti.
Kako bismo pokrenuli novi okvir za objavljivanje neusklađenosti, objavljujemo šest izvješća o slučajevima neusklađenog ponašanja koje smo uočili tijekom obuke ili evaluacije svojih modela. Ti slučajevi prikazuju niz različitih ponašanja koja smatramo vrijednima objave, od skrivanja informacija od korisnika do neodobrenih radnji radi svladavanja prepreka. Riječ je o izvješćima o pojedinačnim slučajevima i ne treba ih smatrati pokazateljem učestalosti neusklađenosti među našim modelima. Svaka stavka u nastavku sadrži poveznicu na cjelovito izvješće.
Samostalno generirane upute u sažecima zadataka(otvara se u novom prozoru). Neobjavljeni istraživački model umetnuo je nepovezane upute, uključujući upute da zanemari svoja uobičajena ograničenja, u sažetke koji su služili za nastavak rada u novom kontekstnom prozoru. Utvrdili smo da je zahvaćeno 27 sažetaka.
Upute za skrivanje pogrešaka u sažecima zadataka(otvara se u novom prozoru). Tijekom obuke modela GPT‑5.6 Sol mnoge su instance modela u svoje sažetke dodavale upute da se od korisnika sakriju pogreške ili neusklađeno ponašanje. Primjerice, sažeci nastali sažimanjem sadržavali su upute da se izmisle povijesni podaci koji nedostaju bez otkrivanja te činjenice i da se prikriju nepodudarnosti među verzijama izvora.
Pretraživanje javnih repozitorija radi pronalaska izloženih API ključeva, a zatim izmišljanje podataka(otvara se u novom prozoru). Dok je odgovarao na rutinsko pitanje o podacima o prihodima u jednom kalifornijskom okrugu, model je bez odobrenja pronašao i upotrijebio izloženi API ključ. Kad ni tada nije uspio dohvatiti tražene podatke, izmislio ih je i predstavio kao podatke iz traženog izvora.
Prijenos datoteka na internet radi njihova navođenja kao izvora(otvara se u novom prozoru). Kada je korisnik od neobjavljenog modela zatražio identifikacijske oznake i nazive jezera većih od 5.000.000 četvornih metara, agent je pronašao točan odgovor koristeći Python. No budući da je u uputama zatraženo navođenje izvora iz preglednika, agent je odlučio prenijeti datoteku kako bi je mogao navesti u odgovoru, a da pritom nije pitao korisnika.
Neodobreno zapisivanje i komunikacija putem internog repozitorija softvera(otvara se u novom prozoru). Dok su tražili ulazne datoteke koje nedostaju, modeli su se koristili internim repozitorijem softvera kao oglasnom pločom za razmjenu zahtjeva i odgovora između zasebnih uzoraka za obuku, premda nisu uspjeli dohvatiti te datoteke. Ovo izvješće razmatra i raniji slučaj u kojem je model uspješno prenio testne datoteke u repozitorij pokušavajući zaobići mrežna ograničenja.
Neodobreno dijeljenje datoteka između agenata koji surađuju(otvara se u novom prozoru). Agenti koji su surađivali na istom zadatku za obuku koristili su javne stranice za smještaj datoteka kako bi ih međusobno dijelili kad nisu mogli pristupiti lokalnim datotekama drugih agenata. Time su rezultati zadatka postali dostupni na javnim URL-ovima, iako je u zadatku zatraženo da modeli koriste samo lokalne datoteke.
Svaki zaposlenik OpenAI-ja može našim timovima za sigurnost i usklađivanje prijaviti primjer neusklađenosti radi istrage i zatražiti da se razmotri njegova javna objava. Time započinje naš postupak objave, s rokovima za svaki korak kako bi se osigurala pravodobna istraga i objava.
Nakon prijave primjera naše će tehničko osoblje istražiti što se dogodilo, što je još neizvjesno, je li javna objava opravdana i koje se činjenice mogu podijeliti. Procijenit će i je li pogođena neka treća strana koju prije objave treba privatno obavijestiti.
Primjer će se zatim svrstati u jednu od triju kategorija: Spremno za objavu, Manja istraga ili Veća istraga („spori postupak”).
Kategorija Spremno za objavu obuhvaća relevantne slučajeve čija je istraga dovoljno dovršena da se nakon pregleda mogu objaviti. Kategorija Manja istraga obuhvaća slučajeve koji zahtijevaju daljnju tehničku istragu. Očekujemo da će te dvije kategorije obuhvatiti veliku većinu slučajeva koje objavljujemo, osobito one koji ne zahtijevaju opsežnu istragu, koordinaciju s trećim stranama ni rješavanje ozbiljnih rizika od zlouporabe. Svi slučajevi koje danas objavljujemo pripadaju jednoj od tih dviju kategorija.
Kategorija Veća istraga obuhvaća složene istrage, osobito one koje uključuju treće strane. Kada je pogođena treća strana, naše sigurnosne i pravne obveze te obveze odgovornog objavljivanja imaju prednost pred ovim okvirom. Nastojat ćemo objaviti početnu obavijest što prije, ali možda ćemo je morati odgoditi iz sigurnosnih razloga, primjerice ako model otkrije dotad nepoznatu ranjivost u široko korištenom softveru. Ako bi izvješće otkrilo identitet treće strane, namjeravamo je unaprijed obavijestiti čak i kada nije probijena sigurnosna granica.
Početna obavijest o slučaju iz kategorije Veća istraga sadržavat će općenit prikaz događaja, navesti sudjeluju li vanjski stručnjaci u istrazi te pružiti dostupnu procjenu očekivanog datuma objave konačnog izvješća. Da je incident OpenAI-ja na platformi Hugging Face objavljen prema ovom okviru, pripadao bi toj kategoriji.
Zaposlenik koji je prijavio primjer bit će obaviješten o odluci hoće li se on objaviti te, ako se objava odobri, u koju će se kategoriju svrstati. Neriješena neslaganja o objavi ili odgovarajućoj kategoriji uputit će se OpenAI-jevoj Savjetodavnoj skupini za sigurnost (SAG), skupini viših dužnosnika iz cijele tvrtke koja procjenjuje sposobnosti najnaprednijih modela i zaštitne mjere, nadzire naš Okvir pripravnosti i savjetuje vodstvo OpenAI-ja. Neslaganja unutar SAG-a ili prigovori zaposlenika na njegove odluke uputit će se vodstvu OpenAI-ja. Odluke da se informacije ne objave ili da objava nije opravdana podijelit će se s vodstvom za sigurnost i usklađivanje te, koliko je moguće, s relevantnim tehničkim osobljem.
Ovaj postupak objave možemo izmijeniti na temelju iskustava iz prakse, a sve ćemo promjene zabilježiti u ovoj objavi.
Svako cjelovito izvješće opisat će uočeno ponašanje, njegovu ozbiljnost i eventualni vanjski učinak, okolnosti u kojima se pojavilo, datum ili razdoblje pojave, kada smo ga otkrili te općenite podatke o uključenom modelu ili modelima. Kad bude moguće, podijelit ćemo i:
Dodatne pojedinosti o događaju i nastaloj šteti;
Kako smo otkrili neusklađenost i opseg naše istrage;
Naše tumačenje posljedica za istraživanje usklađivanja i tehničku sigurnost umjetne inteligencije;
Važna neriješena pitanja koja je primjer otvorio;
Mjere koje poduzimamo ili planiramo poduzeti radi rješavanja tog ponašanja. Ti podaci možda neće uvijek biti dostupni u trenutku objave jer izvješće o neusklađenosti možemo objaviti prije završetka istrage ili razvoja rješenja.
Za neusklađenost koja se pojavi u korisničkim implementacijama podijelit ćemo onoliko informacija koliko dopuštaju privatnost korisnika i naše ugovorne obveze.
Današnja izvješća početni su skup objava, a ne sveobuhvatan prikaz poznatih neusklađenosti ili istraga u tijeku. Ova početna izvješća ne predstavljaju puni raspon ni ozbiljnost slučajeva obuhvaćenih ovim okvirom. Predani smo objavljivanju slučajeva neusklađenosti koji ispunjavaju kriterije ovog okvira, uključujući složenije slučajeve koji zahtijevaju dulju istragu ili koordinaciju s trećim stranama. Nastavit ćemo redovito objavljivati izvješća u okviru ovog okvira te ćemo iznijeti više pojedinosti o svojim obvezama izvješćivanja kako ih budemo dalje razvijali.


