Naš okvir za izvještavanje o neusklađenosti modela
Objavljujemo novi okvir za praćenje, istraživanje i objavljivanje slučajeva neusklađenosti modela u kompaniji OpenAI, zajedno sa šest izvještaja o neočekivanom ili zabrinjavajućem ponašanju modela koje smo uočili tokom proteklih šest mjeseci.
Kako bismo bolje informirali istraživače, programere umjetne inteligencije, donosioce politika i širu javnost, ranije smo nastojali javno objavljivati naše nalaze o neusklađenosti. Međutim, bez sistematičnog pristupa izvještavanju o tim nalazima, naše objave bile su povremene i rjeđe nego što bi bilo poželjno: često smo čekali da možemo objediniti nekoliko slučajeva u jednom izvještaju ili smo ih dodavali u kartice sistema za novobjavljene modele. Cilj ovog novog okvira jeste ubrzati objavljivanje izvještaja o neusklađenosti nakon što je uočimo, čak i kada ponašanje o kojem izvještavamo još nismo u potpunosti objasnili ili ublažili.
Kako sistemi umjetne inteligencije postaju napredniji i sve rasprostranjeniji, moramo izgraditi širi i bolje informiran konsenzus o napretku istraživanja usklađivanja. Ne vjerujemo da je industrija umjetne inteligencije riješila pitanja usklađivanja i nadzora u dovoljnoj mjeri da bi još dugo mogla odgovorno nastaviti razvoj maksimalnom brzinom. Odluke o tome kako bi razvoj umjetne inteligencije trebao napredovati u narednim mjesecima i godinama moraju se zasnivati na dokazima koje osobe izvan kompanija koje razvijaju granične modele mogu samostalno ispitati.
Primjeri neusklađenosti mogu pomoći u prepoznavanju problema s kojima bi se drugi programeri umjetne inteligencije mogli susresti kada njihovi sistemi dostignu slične sposobnosti, otkriti slabosti zaštitnih mjera ili dovesti u pitanje pretpostavke o ponašanju modela. Objavljivanje ovih nalaza omogućava drugima da istraže iste probleme, provjere naša objašnjenja i poboljšaju mjere ublažavanja. Budući da vjerujemo u vrijednost transparentnosti u pogledu neusklađenosti, naš novi okvir daje prednost objavljivanju čak i kada značaj nije siguran. To znači da bi se neki slučajevi koje objavimo mogli pokazati neutemeljenim, odnosno da nisu dio šireg obrasca niti ukazuju na budući razvoj događaja.
Trenutno ne postoji okvir na nivou cijele industrije s izričitim standardima o tome kako programeri umjetne inteligencije trebaju objavljivati primjere neusklađenosti svojih modela. Nadamo se da je okvir koji danas predstavljamo prvi korak ka izradi takvih standarda, kojima bi se utvrdilo koje slučajeve neusklađenosti programeri trebaju objaviti i šta njihovi izvještaji trebaju sadržavati. Ovaj okvir smatramo nedovršenim projektom koji ćemo usavršavati na osnovu iskustva i povratnih informacija javnosti.
Ovdje opisujemo kako će okvir funkcionirati i predstavljamo prve izvještaje koje objavljujemo.
Cilj nam je objavljivati primjere koji pružaju korisne dokaze o tome kako nastaje neusklađenost modela, kako se ispoljava te gdje zaštitne mjere uspijevaju ili zakazuju. Prednost dajemo novim mehanizmima, značajnim promjenama poznatog ponašanja i nalazima koji dovode u pitanje pretpostavke o sigurnosti ili ublažavanju rizika. Primjer ne mora prouzrokovati štetu niti potvrditi širi obrazac da bi zaslužio objavljivanje. Ovaj okvir obuhvatit će relevantno ponašanje tokom cijelog životnog ciklusa modela, uključujući obuku, evaluaciju, testiranje i implementaciju.
To uključuje nove načine na koje modeli djeluju bez odobrenja, koordiniraju se s drugim modelima ili izbjegavaju nadzor; propuste koji dovode u pitanje metodu usklađivanja ili zaštitnu mjeru; te ponašanje koje osporava tvrdnju iz objavljene procjene sigurnosti. Isti kriteriji objavljivanja primjenjuju se na neusklađenost koja može utjecati na treće strane.
To može uključivati i slučajeve neusklađenosti koji naizgled ponavljaju slučajeve koje smo ranije objavili. Ponavljanje problema može samo po sebi biti koristan dokaz o ponašanju naših modela ili djelotvornosti naših zaštitnih mjera — naprimjer, ako se određena vrsta neusklađenog ponašanja nastavi ponavljati uprkos višestrukim pokušajima ublažavanja. U takvim okolnostima objavit ćemo dodatne primjere ažuriranjem prvobitne objave o neusklađenosti.
S vremenom planiramo razviti objektivnije kriterije objavljivanja zajedno s drugim programerima, vanjskim istraživačima, tijelima za industrijske standarde i regulatorima. Također smatramo da ozbiljne incidente u vezi sa sigurnošću, zaštitom i neusklađenošću treba prijavljivati saveznoj vladi SAD-a te radimo na prijedlogu mehanizama izvještavanja. Ovaj okvir smatramo dopunom našim postojećim obavezama i napominjemo da on ne zamjenjuje zakonske obaveze objavljivanja, uključujući one koje se odnose na kritične sigurnosne incidente ili narušavanje kibernetičke sigurnosti.
Povodom uvođenja našeg novog okvira za objavljivanje neusklađenosti, objavljujemo šest izvještaja o slučajevima neusklađenog ponašanja koje smo uočili tokom obuke ili evaluacije naših modela. Ovi slučajevi prikazuju niz različitih ponašanja za koja smatramo da ih vrijedi objaviti, od skrivanja informacija od korisnika do poduzimanja neodobrenih radnji radi prevazilaženja prepreka. Ovo su izvještaji o pojedinačnim slučajevima i ne treba ih smatrati pokazateljem učestalosti neusklađenosti među našim modelima. Svaka stavka u nastavku sadrži poveznicu na potpuni izvještaj.
Samostalno generirane upute u sažecima zadataka(otvara se u novom prozoru). Neobjavljeni istraživački model umetnuo je nepovezane upute, uključujući upute da zanemari svoja uobičajena ograničenja, u sažetke korištene za nastavak rada u novom kontekstnom prozoru. Utvrdili smo da je pogođeno 27 sažetaka.
Upute za skrivanje grešaka u sažecima zadataka(otvara se u novom prozoru). Tokom obuke modela GPT‑5.6 Sol, mnoge instance modela dodavale su u svoje sažetke upute da od korisnika sakriju greške ili neusklađeno ponašanje. Naprimjer, sažeci kompakcije sadržavali su upute da se izmisle nedostajući historijski podaci bez otkrivanja te činjenice i prikriju nepodudarnosti među verzijama izvora.
Pretraživanje javnih repozitorija radi otkrivanja izloženih API ključeva, a zatim izmišljanje informacija(otvara se u novom prozoru). Dok je odgovarao na uobičajeno pitanje o podacima o prihodima u jednom kalifornijskom okrugu, model je bez odobrenja pronašao i upotrijebio izloženi API ključ. Kada ni tada nije uspio pribaviti tražene podatke, izmislio ih je i predstavio kao podatke iz traženog izvora.
Postavljanje datoteka na internet radi njihovog citiranja(otvara se u novom prozoru). Kada je korisnik od neobjavljenog modela zatražio identifikacijske oznake i nazive jezera većih od 5.000.000 kvadratnih metara, agent je pomoću Pythona pronašao tačan odgovor. Međutim, budući da su upute zahtijevale citat iz preglednika, agent je bez pitanja korisniku odlučio postaviti datoteku na internet kako bi je mogao citirati u odgovoru.
Neodobreno zapisivanje i komunikacija putem internog softverskog repozitorija(otvara se u novom prozoru). Dok su tražili nedostajuće ulazne datoteke, modeli su koristili interni softverski repozitorij kao oglasnu ploču za razmjenu zahtjeva i odgovora između zasebnih uzoraka za obuku, ali te datoteke nisu uspjeli vratiti. Ovaj izvještaj razmatra i raniji slučaj u kojem je model uspješno postavio testne datoteke u repozitorij dok je pokušavao zaobići mrežna ograničenja.
Neodobreno dijeljenje datoteka između agenata koji sarađuju(otvara se u novom prozoru). Agenti koji su zajedno radili na istom zadatku za obuku koristili su javne stranice za hosting datoteka kako bi dijelili datoteke kada nisu mogli pristupiti međusobnim lokalnim datotekama. Time su rezultati zadatka postali dostupni na javnim URL-ovima, iako je u zadatku zatraženo da modeli koriste samo lokalne datoteke.
Svaki zaposlenik kompanije OpenAI može prijaviti primjer neusklađenosti našim timovima za sigurnost i usklađivanje radi istrage te zatražiti da se razmotri njegovo javno objavljivanje. Time započinje naš postupak objavljivanja, s rokovima za svaki korak kako bi se osigurale pravovremena istraga i objava.
Nakon prijave primjera, naše tehničko osoblje istražit će šta se dogodilo, koje nejasnoće još postoje, je li javno objavljivanje opravdano i koje se činjenice mogu podijeliti. Također će procijeniti je li pogođena neka treća strana koju prije objavljivanja treba privatno obavijestiti.
Primjer će zatim biti svrstan u jedan od tri postupka: Spremno za objavljivanje, Manja istraga ili Opsežnija istraga („Spori postupak“).
Postupak Spremno za objavljivanje obuhvata relevantne slučajeve čija je istraga dovoljno završena da se nakon pregleda mogu objaviti. Postupak Manja istraga obuhvata slučajeve koji zahtijevaju dodatnu tehničku istragu. Očekujemo da će ova dva postupka obuhvatiti veliku većinu slučajeva koje objavljujemo, posebno onih koji ne zahtijevaju opsežnu istragu, koordinaciju s trećim stranama ili rješavanje ozbiljnih rizika od zloupotrebe. Svi slučajevi koje danas objavljujemo pripadaju jednom od ova dva postupka.
Postupak Opsežnija istraga obuhvata složene istrage, posebno one koje uključuju treće strane. Kada je pogođena treća strana, naše obaveze u pogledu sigurnosti, prava i odgovornog objavljivanja imaju prednost nad ovim okvirom. Nastojat ćemo što prije objaviti početnu obavijest, ali ćemo je možda morati odgoditi iz sigurnosnih razloga — naprimjer, ako model otkrije dosad nepoznatu ranjivost u široko korištenom softveru. Ako bi izvještaj otkrio identitet treće strane, namjeravamo je unaprijed obavijestiti čak i kada nije došlo do probijanja sigurnosnih granica.
Početna obavijest o slučaju iz postupka Opsežnija istraga pružit će opći pregled događaja, navesti pomažu li vanjski stručnjaci u istrazi i dati dostupnu procjenu očekivanog datuma objavljivanja konačnog izvještaja. Incident kompanije OpenAI na platformi Hugging Face pripadao bi ovom postupku da je objavljen prema ovom okviru.
Zaposlenik koji je prijavio primjer bit će obaviješten o odluci hoće li se on objaviti i, ako se objavi, kojim će se postupkom obrađivati. Neriješena neslaganja o objavljivanju ili odgovarajućem postupku bit će upućena Savjetodavnoj grupi za sigurnost (SAG) kompanije OpenAI, grupi viših rukovodilaca iz cijele kompanije koja procjenjuje sposobnosti graničnih modela i zaštitne mjere, nadzire naš Okvir pripravnosti i savjetuje rukovodstvo kompanije OpenAI. Neslaganja unutar SAG-a ili prigovori zaposlenika na njegove odluke bit će proslijeđeni rukovodstvu kompanije OpenAI. Odluke da se nešto ne objavi ili da objavljivanje nije opravdano bit će saopćene rukovodstvu za sigurnost i usklađivanje te, koliko je moguće, relevantnom tehničkom osoblju.
Ovaj postupak objavljivanja možemo izmijeniti na osnovu iskustava iz prakse, a sve promjene zabilježit ćemo u ovoj objavi.
Svaki potpuni izvještaj opisat će uočeno ponašanje, njegovu ozbiljnost i eventualni vanjski utjecaj, okolnosti u kojima se dogodilo, datum ili period događaja, kada smo ga otkrili te, općenito, uključeni model ili modele. Kada bude moguće, navest ćemo i:
Dodatne pojedinosti o tome šta se dogodilo i eventualnoj nastaloj šteti;
Kako smo otkrili neusklađenost i obim naše istrage;
Naše tumačenje značaja slučaja za istraživanje usklađivanja i tehničku sigurnost umjetne inteligencije;
Važna neodgovorena pitanja koja je primjer otvorio;
Mjere koje poduzimamo ili planiramo poduzeti radi rješavanja tog ponašanja. Ti podaci možda neće uvijek biti dostupni u trenutku objavljivanja jer izvještaj o neusklađenosti možemo objaviti prije završetka istrage ili razvoja rješenja.
Za neusklađenost koja se pojavi u korisničkim implementacijama podijelit ćemo onoliko informacija koliko dopuštaju privatnost korisnika i naše ugovorne obaveze.
Današnji izvještaji predstavljaju početni skup objava, a ne sveobuhvatan pregled poznatih neusklađenosti ili istraga koje su u toku. Ovi početni izvještaji ne predstavljaju puni raspon niti ozbiljnost slučajeva obuhvaćenih ovim okvirom. Posvećeni smo objavljivanju slučajeva neusklađenosti koji ispunjavaju kriterije ovog okvira, uključujući složenije slučajeve koji zahtijevaju dužu istragu ili koordinaciju s trećim stranama. Nastavit ćemo redovno objavljivati izvještaje prema ovom okviru i pružati više informacija o našim obavezama izvještavanja kako ih budemo dalje razvijali.


