Po paraqesim një kornizë të re për gjurmimin, hetimin dhe publikimin e rasteve të mospërputhjes së modeleve në OpenAI, së bashku me gjashtë raporte mbi sjellje të papritura ose shqetësuese të modeleve që kemi vërejtur gjatë gjashtë muajve të fundit.
Në të kaluarën, për të informuar më mirë studiuesit, zhvilluesit e IA-së, politikëbërësit dhe publikun e gjerë, jemi përpjekur t’i bënim publike gjetjet tona rreth mospërputhjes. Por, pa një qasje sistematike për raportimin e këtyre gjetjeve, publikimet tona kanë qenë të rastësishme dhe më të rralla nga sa do të dëshironim: shpesh kemi pritur derisa të mund të përmblidhnim disa raste në një raport ose i kemi shtuar në kartat e sistemit për modelet e sapopublikuara. Kjo kornizë e re synon të përshpejtojë publikimin e raporteve të mospërputhjes pasi ajo vërehet, edhe kur nuk e kemi shpjeguar ose zbutur plotësisht sjelljen që po raportojmë.
Ndërsa sistemet e IA-së bëhen më të përparuara dhe përdoren më gjerësisht, duhet të ndërtojmë një konsensus më të gjerë e më të mirëinformuar mbi përparimin e kërkimit për përputhjen. Ne nuk besojmë se sektori i IA-së i ka zgjidhur përputhjen dhe monitorimin në një shkallë të mjaftueshme për të vazhduar edhe për shumë gjatë zgjerimin me përgjegjshmëri dhe me shpejtësi maksimale. Vendimet se si duhet të ecë përpara zhvillimi i IA-së në muajt dhe vitet e ardhshme duhet të mbështeten në prova që mund të shqyrtohen drejtpërdrejt nga njerëz jashtë kompanive që ndërtojnë modele avangardë.
Shembujt e mospërputhjes mund të ndihmojnë në identifikimin e problemeve që zhvillues të tjerë të IA-së mund të hasin kur sistemet e tyre arrijnë aftësi të ngjashme, të zbulojnë dobësi në masat mbrojtëse ose të vënë në pikëpyetje supozimet për sjelljen e modeleve. Ndarja e këtyre gjetjeve u mundëson të tjerëve të hetojnë të njëjtat probleme, të vënë në provë shpjegimet tona dhe të përmirësojnë masat zbutëse. Meqë besojmë në vlerën e transparencës rreth mospërputhjes, korniza jonë e re favorizon publikimin edhe kur rëndësia është e pasigurt. Kjo do të thotë se disa nga rastet që bëjmë publike mund të rezultojnë të pabaza dhe të mos jenë pjesë e një prirjeje më të gjerë apo tregues të zhvillimeve të ardhshme.
Aktualisht nuk ka një kornizë në mbarë sektorin me standarde të qarta për mënyrën se si zhvilluesit e IA-së duhet t’i bëjnë publike rastet e mospërputhjes në modelet e tyre. Shpresojmë që korniza që po paraqesim sot të jetë hapi i parë drejt krijimit të standardeve të tilla, duke përcaktuar se cilat raste mospërputhjeje duhet të bëjnë publike zhvilluesit dhe çfarë duhet të përmbajnë raportet e tyre. E konsiderojmë këtë kornizë si një punë në zhvillim, të cilën do ta përmirësojmë përmes përvojës dhe komenteve të publikut.
Këtu përshkruajmë mënyrën se si do të funksionojë korniza dhe paraqesim raportet e para që po publikojmë.
Synojmë të bëjmë publikë shembuj që ofrojnë prova të dobishme se si lind dhe shfaqet mospërputhja e modeleve dhe se ku masat mbrojtëse funksionojnë ose dështojnë. U japim përparësi mekanizmave të rinj, ndryshimeve domethënëse në sjelljet e njohura dhe gjetjeve që vënë në pikëpyetje supozimet për sigurinë ose masat zbutëse. Një shembull nuk është e nevojshme të shkaktojë dëm ose të dëshmojë një prirje më të gjerë për të merituar publikimin. Kjo kornizë do të mbulojë sjelljet që plotësojnë kriteret gjatë gjithë ciklit jetësor të një modeli, përfshirë trajnimin, vlerësimin, testimin dhe vënien në përdorim.
Kjo përfshin mënyra të reja me të cilat modelet veprojnë pa autorizim, bashkërendojnë veprimet me modele të tjera ose shmangin mbikëqyrjen; dështime që vënë në pikëpyetje një metodë përputhjeje ose masë mbrojtëse; si dhe sjellje që sfidojnë një pretendim në një vlerësim të publikuar të sigurisë. Të njëjtat kritere publikimi vlejnë për mospërputhjet që mund të ndikojnë te palët e treta.
Kjo mund të përfshijë edhe raste mospërputhjeje që duken si përsëritje të rasteve që kemi bërë publike më parë. Vetë përsëritja e problemit mund të jetë provë e dobishme për mënyrën se si sillen modelet tona ose për efektivitetin e masave tona mbrojtëse—për shembull, nëse një lloj i caktuar sjelljeje të papërputhur vazhdon të përsëritet pavarësisht përpjekjeve të vazhdueshme për ta zbutur. Në këto rrethana, shembujt shtesë do t’i publikojmë duke përditësuar njoftimin fillestar të mospërputhjes.
Me kalimin e kohës, planifikojmë të zhvillojmë kritere më objektive publikimi me zhvillues të tjerë, studiues të jashtëm, organe të standardeve të sektorit dhe rregullatorë. Besojmë gjithashtu se incidentet serioze të sigurisë fizike, sigurisë kibernetike dhe mospërputhjes duhet t’i raportohen qeverisë federale të SHBA-së, ndaj po punojmë për të propozuar mekanizma raportimi. E konsiderojmë këtë kornizë plotësuese të detyrimeve tona ekzistuese dhe theksojmë se ajo nuk zëvendëson kërkesat ligjore për publikim, përfshirë ato për incidentet kritike të sigurisë ose shkeljet e sigurisë kibernetike.
Për të përuruar kornizën tonë të re për publikimin e mospërputhjeve, po publikojmë gjashtë raporte për raste sjelljeje të papërputhur që kemi vërejtur gjatë trajnimit ose vlerësimit të modeleve tona. Këto raste ilustrojnë një gamë sjelljesh të ndryshme që besojmë se ia vlen të bëhen publike, që nga fshehja e informacionit nga përdoruesi deri te ndërmarrja e veprimeve të paautorizuara për të kapërcyer pengesat. Këto janë raporte për raste të veçanta dhe nuk duhen konsideruar si tregues të shpeshtësisë së mospërputhjes në modelet tona. Çdo zë më poshtë përmban lidhjen për te raporti i plotë.
Udhëzime të vetëkrijuara në përmbledhjet e detyrave(hapet në një dritare të re). Një model kërkimor i papublikuar futi udhëzime të palidhura, përfshirë udhëzime për të shpërfillur kufizimet e tij normale, në përmbledhjet që përdoreshin për të vazhduar punën në një dritare të re konteksti. Identifikuam 27 përmbledhje të prekura.
Udhëzime për fshehjen e gabimeve në përmbledhjet e detyrave(hapet në një dritare të re). Gjatë trajnimit të GPT‑5.6 Sol, shumë instanca të modelit shtuan në përmbledhjet e tyre udhëzime për t’i fshehur përdoruesit gabimet ose sjelljet e papërputhura. Për shembull, përmbledhjet e kompaktimit përfshinin udhëzime për të sajuar të dhëna historike që mungonin pa e bërë këtë të ditur dhe për të fshehur mospërputhjet mes versioneve të burimeve.
Kërkimi në depot publike për çelësa API të ekspozuar dhe më pas sajimi i informacionit(hapet në një dritare të re). Ndërsa i përgjigjej një pyetjeje të zakonshme për shifrat e të ardhurave në një qark të Kalifornisë, një model gjeti dhe përdori pa autorizim një çelës API të ekspozuar. Kur përsëri nuk arriti t’i merrte shifrat e kërkuara, i sajoi dhe i paraqiti si të dhëna nga burimi i kërkuar.
Ngarkimi i skedarëve në internet për t’i cituar(hapet në një dritare të re). Kur një përdorues i kërkoi një modeli të papublikuar ID-të dhe emrat e liqeneve më të mëdha se 5 000 000 metra katrorë, agjenti e gjeti përgjigjen e saktë duke përdorur Python. Por, meqë udhëzimet kërkonin një citim nga shfletuesi, agjenti vendosi ta ngarkonte skedarin që të mund ta citonte në përgjigje, pa e pyetur përdoruesin.
Shkrime dhe komunikime të paautorizuara përmes një depoje të brendshme softuerike(hapet në një dritare të re). Modelet përdorën një depo të brendshme softuerike si tabelë mesazhesh për të shkëmbyer kërkesa dhe përgjigje mes kampionëve të veçantë të trajnimit teksa kërkonin skedarë hyrës që mungonin, megjithëse nuk arritën t’i rikuperonin ata. Ky raport shqyrton edhe një rast të mëparshëm, kur një model ngarkoi me sukses skedarë testimi në një depo ndërsa përpiqej të anashkalonte kufizimet e rrjetit.
Shkëmbim i paautorizuar skedarësh mes agjentëve bashkëpunues(hapet në një dritare të re). Agjentët që punonin së bashku për të njëjtën detyrë trajnimi përdorën faqe publike për pritjen e skedarëve që t’i shkëmbenin, kur nuk mund të hynin në skedarët lokalë të njëri-tjetrit. Kjo i bëri materialet përfundimtare të detyrës të disponueshme në URL publike, ndonëse detyra kërkonte që modelet të përdornin vetëm skedarë lokalë.
Çdo punonjës i OpenAI mund të sinjalizojë një shembull mospërputhjeje për hetim nga ekipet tona të sigurisë dhe përputhjes, si dhe të kërkojë që të shqyrtohet për publikim. Kjo nis procesin tonë të publikimit, me afate për çdo hap që sigurojnë hetim dhe publikim në kohën e duhur.
Pasi një shembull sinjalizohet, stafi ynë teknik do të hetojë se çfarë ndodhi, çfarë mbetet e pasigurt, nëse justifikohet publikimi dhe cilat fakte mund të bëhen publike. Ai do të vlerësojë gjithashtu nëse është prekur ndonjë palë e tretë dhe nëse duhet të njoftohet privatisht para publikimit.
Më pas, shembulli do të caktohet në një nga tri procedurat: Gati për publikim, Hetim i kufizuar ose Hetim i zgjeruar («Procedura e ngadaltë»).
Procedura Gati për publikim mbulon rastet që plotësojnë kriteret dhe hetimi i të cilave është mjaftueshëm i plotë për t’u publikuar pas shqyrtimit. Procedura Hetim i kufizuar mbulon rastet që kërkojnë hetim të mëtejshëm teknik. Presim që këto dy procedura të mbulojnë shumicën dërrmuese të rasteve që bëjmë publike, veçanërisht ato që nuk kërkojnë hetim të gjerë, bashkërendim me palë të treta ose trajtimin e rreziqeve të rënda të keqpërdorimit. Të gjitha rastet që po publikojmë sot i përkasin njërës prej këtyre dy procedurave.
Procedura Hetim i zgjeruar mbulon hetimet komplekse, veçanërisht ato që përfshijnë palë të treta. Kur preket një palë e tretë, detyrimet tona për sigurinë, çështjet ligjore dhe publikimin e përgjegjshëm kanë përparësi ndaj kësaj kornize. Do të synojmë të publikojmë sa më shpejt një njoftim fillestar, por mund të na duhet ta shtyjmë për arsye sigurie—për shembull, nëse një model zbulon një cenueshmëri të panjohur më parë në një softuer të përdorur gjerësisht. Nëse një raport do të identifikonte një palë të tretë, synojmë ta njoftojmë paraprakisht edhe kur nuk është cenuar asnjë kufi sigurie.
Njoftimi fillestar për një rast të procedurës Hetim i zgjeruar do të japë një përmbledhje të përgjithshme të asaj që ndodhi, do të tregojë nëse ekspertë të jashtëm po ndihmojnë në hetim dhe do të japë çdo parashikim të disponueshëm për kohën kur presim të publikojmë raportin përfundimtar. Incidenti i OpenAI në Hugging Face do t’i ishte caktuar kësaj procedure po të ishte bërë publik sipas kësaj kornize.
Punonjësi që ngriti shembullin do të njoftohet për vendimin nëse ai do të bëhet publik dhe, nëse po, se cilën procedurë do të ndjekë. Mosmarrëveshjet e pazgjidhura rreth publikimit ose procedurës së përshtatshme do t’i referohen Grupit Këshillimor për Sigurinë të OpenAI (SAG), një grup drejtuesish të lartë nga e gjithë kompania që vlerëson aftësitë dhe masat mbrojtëse të modeleve avangardë, mbikëqyr Preparedness Framework dhe këshillon drejtuesit e OpenAI. Mosmarrëveshjet brenda SAG ose kundërshtimet e stafit ndaj vendimeve të tij do t’u përcillen drejtuesve të OpenAI. Vendimet për të mos bërë publik një rast ose se publikimi nuk justifikohet do t’u komunikohen drejtuesve të sigurisë dhe përputhjes dhe, për aq sa është e mundur, stafit teknik përkatës.
Mund ta rishikojmë këtë proces publikimi ndërsa mësojmë si funksionon në praktikë dhe çdo ndryshim do ta shënojmë në këtë postim.
Çdo raport i plotë do të përshkruajë sjelljen që vërejtëm, shkallën e rëndësisë dhe çdo ndikim të jashtëm, mjedisin ku ndodhi, datën ose periudhën, kohën kur e zbuluam dhe, në vija të përgjithshme, modelin ose modelet e përfshira. Kur të jetë e mundur, do të ndajmë gjithashtu:
Hollësi të mëtejshme për atë që ndodhi dhe çdo dëm që pasoi;
Si e zbuluam mospërputhjen dhe shtrirjen e hetimit tonë;
Interpretimin tonë për ndikimin e saj në kërkimin mbi përputhjen dhe sigurinë teknike të IA-së;
Pyetjet e rëndësishme pa përgjigje që ngre shembulli;
Masat që po marrim ose planifikojmë të marrim për ta trajtuar sjelljen. Këto të dhëna mund të mos jenë gjithmonë të disponueshme në momentin e publikimit, pasi raportin e mospërputhjes mund ta publikojmë para se të përfundojmë hetimin ose të zhvillojmë një zgjidhje.
Për mospërputhjet që ndodhin në sistemet e vëna në përdorim nga klientët, do të ndajmë aq informacion sa lejojnë privatësia e klientëve dhe detyrimet tona kontraktuale.
Raportet e sotme përbëjnë një grup fillestar publikimesh, jo një pasqyrë gjithëpërfshirëse të mospërputhjeve të njohura ose hetimeve në vazhdim. Këto raporte fillestare nuk synojnë të përfaqësojnë të gjithë gamën ose rëndësinë e rasteve që mbulon kjo kornizë. Jemi të përkushtuar të bëjmë publike rastet e mospërputhjes që plotësojnë kriteret e kësaj kornize, përfshirë rastet më komplekse që kërkojnë hetim më të gjatë ose bashkërendim me palë të treta. Do të vazhdojmë të publikojmë rregullisht raporte sipas kësaj kornize dhe, ndërsa i zhvillojmë më tej, do të ndajmë më shumë rreth angazhimeve tona për raportim.


