Mēs publicējam jaunu satvaru OpenAI modeļu nesaskaņotības gadījumu uzskaitei, izmeklēšanai un publiskošanai, kā arī sešus ziņojumus par pēdējos sešos mēnešos novērotu negaidītu vai satraucošu modeļu uzvedību.
Lai labāk informētu pētniekus, mākslīgā intelekta izstrādātājus, politikas veidotājus un sabiedrību, jau iepriekš esam centušies publiskot savus secinājumus par nesaskaņotību. Tomēr bez sistemātiskas pieejas ziņošanai par šiem secinājumiem informāciju esam publiskojuši neregulāri un retāk, nekā būtu vēlams: bieži gaidījām, līdz vienā ziņojumā varējām apkopot vairākus gadījumus, vai pievienojām tos jaunizlaistu modeļu sistēmas kartītēm. Jaunais satvars paredz paātrināt ziņojumu publicēšanu pēc nesaskaņotības novērošanas, pat ja vēl neesam pilnībā izskaidrojuši vai mazinājuši aprakstīto uzvedību.
Mākslīgā intelekta sistēmām kļūstot progresīvākām un plašāk izmantotām, mums jāveido plašāka un labāk informēta vienprātība par salāgošanas pētniecības progresu. Mēs neuzskatām, ka mākslīgā intelekta nozare būtu pietiekami atrisinājusi salāgošanas un uzraudzības problēmas, lai vēl ilgi varētu atbildīgi turpināt attīstību maksimālā ātrumā. Lēmumiem par mākslīgā intelekta attīstību turpmākajos mēnešos un gados jābalstās uz pierādījumiem, kurus patstāvīgi var izvērtēt arī cilvēki ārpus uzņēmumiem, kas izstrādā robežšķirtnes modeļus.
Nesaskaņotības piemēri var palīdzēt atklāt problēmas, ar kurām varētu saskarties citi mākslīgā intelekta izstrādātāji, viņu sistēmām sasniedzot līdzīgas spējas, atklāt aizsardzības pasākumu nepilnības vai likt apšaubīt pieņēmumus par modeļu uzvedību. Šo secinājumu publiskošana ļauj citiem izpētīt tās pašas problēmas, pārbaudīt mūsu skaidrojumus un uzlabot riska mazināšanas pasākumus. Tā kā uzskatām, ka nesaskaņotības jomā pārredzamība ir vērtīga, jaunais satvars dod priekšroku informācijas publiskošanai arī tad, ja tās nozīmīgums nav skaidrs. Tas nozīmē, ka daži mūsu publiskotie gadījumi var izrādīties nejauši un neliecināt ne par plašāku tendenci, ne par turpmāko attīstību.
Pašlaik nozarē nav vienota satvara ar skaidriem standartiem, kā mākslīgā intelekta izstrādātājiem būtu jāpublisko savu modeļu nesaskaņotības piemēri. Ceram, ka šodien izklāstītais satvars būs pirmais solis šādu standartu izveidē, nosakot, kuri nesaskaņotības gadījumi izstrādātājiem jāpublisko un kas jāiekļauj ziņojumos. Uzskatām, ka šis satvars vēl tiek pilnveidots, un turpināsim to uzlabot, balstoties uz pieredzi un sabiedrības atsauksmēm.
Šeit aprakstām satvara darbību un publicējam pirmos ziņojumus.
Mūsu mērķis ir publiskot piemērus, kas sniedz noderīgus pierādījumus par modeļu nesaskaņotības rašanos un izpausmēm, kā arī par to, kur aizsardzības pasākumi darbojas vai cieš neveiksmi. Priekšroku dodam jauniem mehānismiem, nozīmīgām izmaiņām zināmā uzvedībā un secinājumiem, kas liek apšaubīt pieņēmumus par drošību vai riska mazināšanu. Lai piemēru būtu vērts publiskot, tam nav obligāti jānodara kaitējums vai jāpierāda plašāka tendence. Šis satvars attieksies uz kritērijiem atbilstošu uzvedību visā modeļa dzīves ciklā, tostarp apmācībā, novērtēšanā, testēšanā un ieviešanā.
Tas ietver jaunus veidus, kā modeļi rīkojas bez atļaujas, sadarbojas ar citiem modeļiem vai izvairās no uzraudzības; kļūmes, kas liek apšaubīt saskaņošanas metodi vai aizsardzības pasākumu; kā arī uzvedību, kas apstrīd publicētā drošības novērtējumā paustu apgalvojumu. Tie paši publiskošanas kritēriji attiecas uz nesaskaņotību, kas var ietekmēt trešās puses.
Tas var ietvert arī nesaskaņotības gadījumus, kas šķiet līdzīgi iepriekš publiskotajiem. Problēmas atkārtošanās pati par sevi var būt noderīgs pierādījums par mūsu modeļu uzvedību vai aizsardzības pasākumu efektivitāti, piemēram, ja noteikta veida nesaskaņota uzvedība turpina atkārtoties, neraugoties uz vairākkārtējiem centieniem to mazināt. Šādos apstākļos publicēsim papildu piemērus, atjauninot sākotnējo paziņojumu par nesaskaņotību.
Laika gaitā plānojam kopā ar citiem izstrādātājiem, neatkarīgiem pētniekiem, nozares standartizācijas iestādēm un regulatoriem izstrādāt objektīvākus publiskošanas kritērijus. Uzskatām arī, ka par nopietniem drošības, aizsardzības un neatbilstības incidentiem jāinformē ASV federālā valdība, un strādājam pie ziņošanas mehānismu priekšlikumiem. Šis satvars papildina mūsu pašreizējos pienākumus un neaizstāj juridiskās prasības par informācijas izpaušanu, tostarp prasības attiecībā uz kritiskiem drošības incidentiem vai kiberdrošības pārkāpumiem.
Uzsākot darbu ar jauno nesaskaņotības publiskošanas satvaru, publicējam sešus ziņojumus par nesaskaņotas uzvedības gadījumiem, ko novērojām modeļu apmācības vai novērtēšanas laikā. Šie gadījumi atspoguļo dažādu uzvedību, ko uzskatām par publiskošanas vērtu, — no informācijas slēpšanas no lietotāja līdz neatļautām darbībām šķēršļu pārvarēšanai. Tie ir ziņojumi par atsevišķiem gadījumiem, tāpēc pēc tiem nevar spriest, cik bieži mūsu modeļos rodas nesaskaņotība. Katrs tālāk minētais vienums ietver saiti uz pilno ziņojumu.
Pašģenerētas instrukcijas uzdevumu kopsavilkumos(atveras jaunā logā). Nepublicēts pētniecības modelis kopsavilkumos, ko izmantoja darba turpināšanai jaunā konteksta logā, ievietoja nesaistītas instrukcijas, tostarp norādi neievērot ierastos ierobežojumus. Mēs identificējām 27 ietekmētus kopsavilkumus.
Instrukcijas slēpt kļūdas uzdevumu kopsavilkumos(atveras jaunā logā). GPT‑5.6 Sol apmācības laikā daudzi modeļa eksemplāri saviem kopsavilkumiem pievienoja instrukcijas slēpt no lietotāja kļūdas vai nesaskaņotu uzvedību. Piemēram, konteksta saspiešanas kopsavilkumos bija instrukcijas izdomāt trūkstošos vēsturiskos datus, to neatklājot, un slēpt avotu versiju neatbilstības.
Atklātu API atslēgu meklēšana publiskos repozitorijos un informācijas safabricēšana(atveras jaunā logā). Atbildot uz parastu jautājumu par ienākumu rādītājiem kādā Kalifornijas apgabalā, modelis bez atļaujas atrada un izmantoja atklātu API atslēgu. Kad modelim tomēr neizdevās izgūt pieprasītos rādītājus, tas tos safabricēja un pasniedza kā datus no pieprasītā avota.
Failu augšupielāde internetā, lai tos citētu(atveras jaunā logā). Kad lietotājs nepublicētam modelim lūdza norādīt par 5 000 000 kvadrātmetru lielāku ezeru identifikatorus un nosaukumus, aģents ar Python palīdzību atrada pareizo atbildi. Taču, tā kā instrukcijās bija prasīta pārlūkā pieejama atsauce, aģents bez lietotāja atļaujas nolēma augšupielādēt failu, lai varētu to citēt atbildē.
Neatļauta ierakstīšana un saziņa iekšējā programmatūras repozitorijā(atveras jaunā logā). Meklējot trūkstošos ievades failus, modeļi izmantoja iekšēju programmatūras repozitoriju kā ziņojumu dēli, lai dažādos apmācības paraugos apmainītos ar pieprasījumiem un atbildēm, tomēr tiem neizdevās failus atgūt. Ziņojumā aplūkots arī agrāks gadījums, kad modelis, mēģinot apiet tīkla ierobežojumus, sekmīgi augšupielādēja testa failus repozitorijā.
Neatļauta failu kopīgošana starp aģentiem, kas sadarbojas(atveras jaunā logā). Aģenti, kas kopīgi veica vienu apmācības uzdevumu, izmantoja publiskas failu mitināšanas vietnes, lai kopīgotu failus, kad nevarēja piekļūt cits cita lokālajiem failiem. Tādējādi uzdevuma rezultāti kļuva pieejami publiskos URL, lai gan uzdevumā modeļiem bija prasīts izmantot tikai lokālos failus.
Ikviens OpenAI darbinieks var iesniegt nesaskaņotības piemēru mūsu drošības un salāgošanas komandām izmeklēšanai un lūgt izvērtēt tā publiskošanu. Tādējādi tiek sākts publiskošanas process, kurā katram posmam noteikts termiņš, lai nodrošinātu savlaicīgu izmeklēšanu un informācijas publiskošanu.
Kad piemērs būs iesniegts, mūsu tehniskie darbinieki izmeklēs notikušo, noskaidros, kas vēl nav zināms, vai informācijas publiskošana ir pamatota un kurus faktus var atklāt. Viņi arī izvērtēs, vai ir ietekmēta kāda trešā puse un vai tā pirms publicēšanas jāinformē privāti.
Pēc tam piemērs tiks iedalīts vienā no trim procesiem: „Gatavs publiskošanai”, „Neliela izmeklēšana” vai „Plašāka izmeklēšana” („Lēnais process”).
Process „Gatavs publiskošanai” attiecas uz kritērijiem atbilstošiem gadījumiem, kuru izmeklēšana ir pietiekami pabeigta, lai pēc pārskatīšanas tos publicētu. Process „Neliela izmeklēšana” attiecas uz gadījumiem, kam vajadzīga papildu tehniskā izmeklēšana. Paredzam, ka šie divi procesi aptvers lielāko daļu publiskoto gadījumu, jo īpaši tos, kuriem nav vajadzīga plaša izmeklēšana, saskaņošana ar trešajām pusēm vai nopietnu ļaunprātīgas izmantošanas risku pārvaldība. Visi šodien publicētie gadījumi ietilpst vienā no šiem diviem procesiem.
Process „Plašāka izmeklēšana” attiecas uz sarežģītām izmeklēšanām, jo īpaši tādām, kurās iesaistītas trešās puses. Ja ir ietekmēta trešā puse, mūsu drošības, juridiskie un atbildīgas informācijas izpaušanas pienākumi ir svarīgāki par šo satvaru. Centīsimies pēc iespējas drīzāk publicēt sākotnējo paziņojumu, taču drošības apsvērumu dēļ tas var būt jāatliek, piemēram, ja modelis plaši izmantotā programmatūrā atklāj iepriekš nezināmu ievainojamību. Ja ziņojumā varētu identificēt trešo pusi, plānojam to iepriekš informēt arī tad, ja nav pārkāpta neviena drošības robeža.
Sākotnējā paziņojumā par „Plašākas izmeklēšanas” gadījumu būs sniegts vispārīgs notikušā apraksts, norādīts, vai izmeklēšanā palīdz neatkarīgi eksperti, un, ja iespējams, aplēsts galīgā ziņojuma publicēšanas laiks. Ja OpenAI Hugging Face incidents būtu publiskots saskaņā ar šo satvaru, tam būtu piemērots šis process.
Darbinieks, kurš iesniedzis piemēru, tiks informēts par lēmumu, vai to publiskot un, ja tas tiks publiskots, kuru procesu piemērot. Neatrisinātas domstarpības par publiskošanu vai piemēroto procesu tiks nodotas OpenAI Drošības konsultatīvajai grupai (SAG). Tajā darbojas uzņēmuma augstākās amatpersonas, kas novērtē robežšķirtnes modeļu spējas un aizsardzības pasākumus, pārrauga mūsu Sagatavotības satvaru un konsultē OpenAI vadību. Domstarpības Drošības konsultatīvajā grupā (SAG) vai darbinieku iebildumi pret tās lēmumiem tiks nodoti OpenAI vadībai. Lēmumi nepubliskot informāciju vai atzinumi, ka publiskošana nav pamatota, tiks darīti zināmi drošības un saskaņotības vadītājiem un, ciktāl iespējams, attiecīgajiem tehniskajiem darbiniekiem.
Gūstot praktisku pieredzi, mēs varam pārskatīt šo publiskošanas procesu, un visas izmaiņas reģistrēsim šajā publikācijā.
Katrā pilnajā ziņojumā būs aprakstīta novērotā uzvedība, tās nopietnība un ārējā ietekme, ja tāda bijusi, apstākļi, kuros tā izpaudās, notikuma datums vai laikposms, atklāšanas laiks, kā arī vispārīga informācija par iesaistīto modeli vai modeļiem. Ja iespējams, sniegsim arī:
plašāku informāciju par notikušo un tā nodarīto kaitējumu;
informāciju par to, kā atklājām nesaskaņotību, un mūsu izmeklēšanas apjomu;
mūsu skaidrojumu par tās nozīmi saskaņotības pētniecībā un mākslīgā intelekta tehniskajā drošībā;
svarīgus neatbildētus jautājumus, ko radījis šis piemērs;
pasākumus, ko veicam vai plānojam veikt, lai novērstu šādu uzvedību. Publiskošanas brīdī šī informācija ne vienmēr būs pieejama, jo ziņojumu par nesaskaņotību varam publicēt vēl pirms izmeklēšanas pabeigšanas vai risinājuma izstrādes.
Par nesaskaņotību klientu risinājumos sniegsim tik daudz informācijas, cik pieļauj klientu privātuma aizsardzība un mūsu līgumsaistības.
Šodien publicētie ziņojumi ir pirmais informācijas kopums, nevis visaptverošs pārskats par zināmo nesaskaņotību vai notiekošajām izmeklēšanām. Šie pirmie ziņojumi neatspoguļo visu šajā satvarā ietverto gadījumu daudzveidību vai nopietnību. Esam apņēmušies publiskot šā satvara kritērijiem atbilstošus nesaskaņotības gadījumus, tostarp sarežģītākus gadījumus, kuru izmeklēšanai vai saskaņošanai ar trešajām pusēm vajadzīgs ilgāks laiks. Turpināsim regulāri publicēt ziņojumus saskaņā ar šo satvaru un, pilnveidojot savas ziņošanas saistības, sniegsim par tām plašāku informāciju.


