Mga prayoridad at prinsipyo para sa mabisang pagtatasa ng third party
Napakalaki ng pananagutan ng mga frontier AI lab sa ligtas na pagsasanay, pagsusuri, at pag-deploy ng mga modelo. Mahalaga ang mga pagtatasa ng third party sa pagbalanse sa pananagutang iyon, pagpapalawak ng mga pagkakataong makapag-ambag sa kaligtasan ng AI, pagpapanatiling may alam ang mundo, at pagpapanagot sa mga lab batay sa malinaw at independiyenteng sinusuportahang mga pahayag sa kaligtasan.
Bilang bahagi ng aming mga pagsisikap na umagapay sa pag-usad ng frontier, nakatuon ang OpenAI sa pagsuporta sa mga independiyenteng pagtatasa sa pamamagitan ng malalim na access sa pagsasanay, pagsusuri, at deployment. Dapat bigyang-daan ng access na iyon ang mga assessor na kuwestiyunin ang aming mga palagay, tukuyin ang mga panganib na maaaring hindi namin napansin, at bumuo ng sarili nilang mga konklusyon tungkol sa bisa ng aming mga pananggalang.
Matagal na kaming nakikipagtulungan sa mga third-party assessor sa iba't ibang yugto ng pagbuo at pag-deploy ng modelo. Isinama rin namin ang mga pagtatasa ng third party sa aming mga gawain sa Preparedness Framework at sinuportahan ang mga organisasyon at batas na nagsusulong ng mas masusi at may pananagutang proseso. Sa lahat ng pakikipagtulungang ito, nagbigay kami ng malalim na uri ng access, kabilang ang impormasyon tungkol sa aming mga teknikal na pananggalang, access sa nakikitang chain-of-thought, at walang kapantay na access sa kumpidensyal na datos at panloob na deployment para sa pagtugon sa insidente at red teaming ng mga monitor. Nakatuon ang mga prayoridad at prinsipyong ibinahagi rito sa pakikipagtulungan namin sa mga independiyenteng organisasyon ng pagtatasa sa pribado at nonprofit na sektor para sa mga teknikal na pagtatasa sa kaligtasan. Dinadagdagan ng mga ito ang pakikipagtulungan namin sa mga pamahalaan sa pagsubok at pagsusuri, kung saan maaaring mangailangan ng ibang pamamaraan ang magkakaibang tungkulin at pananagutan.
Upang maging mabisa ang mga pagtatasa, kailangan ang matatag na mekanismo para sa kalayaan, mahigpit na pamamaraang siyentipiko, matibay na kasanayan sa seguridad, at malinaw na pananagutan. Pananagutan ng mga lab na bigyang-daan ang makabuluhang pagsusuri habang pinoprotektahan ang sensitibong impormasyon. Kapwa responsable ang mga lab at independiyenteng assessor sa maayos na pagsasagawa nito, at dapat silang gumamit ng magkakatugmang internasyonal na pamantayan para sa mga kasanayan sa kaligtasan at seguridad. Sa ibaba, nagmumungkahi kami ng apat na prayoridad para sa mas malalim na pagtatasa, kasama ang mga prinsipyo para sa masusi, ligtas, at independiyenteng gawain.
Pinakakapaki-pakinabang ang mga pagtatasa ng third party kapag sinasagot ng mga ito ang mga partikular at mahalagang tanong: Sinusuportahan ba ng ebidensya ang kaso at mga pahayag sa kaligtasan ng isang lab? Nasusuri ba nang sapat ng mga pagsusuri ang mga panganib na layon nilang sukatin? Gumagana ba ang mga pananggalang sa makatotohanang mga kondisyon?
Ang mga pagtatasa na inilalarawan dito ay nilalayong magkaroon ng iba't ibang anyo depende sa mga usapin ng kaligtasang sinusuri. Inaasahan naming susuportahan ang maraming pagtatasa nang sabay-sabay at sa magkakaibang haba ng panahon—ang ilan ay tatagal nang ilang linggo at ang iba naman ay ilang buwan. Bagama't maaari ding maging bahagi ng paghahanda bago ang deployment ang mga pagtatasa ng third party at makatulong sa mga pasya sa deployment, karaniwang mas pangmatagalan at hindi nakatali sa paglulunsad ang gawaing inilalarawan dito—nakatuon ito sa masusing pagsusuri sa paglipas ng panahon ng mga partikular na pahayag sa kaligtasan.
Sa kabuuan ng aming mga prayoridad at prinsipyo, tinutukoy namin ang mga pahayag at kaso sa kaligtasan. Ganito ang ibig naming sabihin sa mga terminong ito:
Pahayag sa kaligtasan: Isang partikular na pahayag tungkol sa mga kakayahan, gawi, o pananggalang ng isang modelo o system na may kaugnayan sa kaligtasan nito at maaaring tasahin batay sa ebidensya. Dapat tukuyin ng isang pahayag ang mga panganib at kondisyong tinutugunan nito, kasama ang mahahalagang palagay at limitasyon.
Kaso sa kaligtasan: Isang sistematikong argumento na sinusuportahan ng ebidensya at nagpapaliwanag kung bakit sapat na napamamahalaan ang mga panganib ng isang modelo o system para sa isang tinukoy na gawain, gaya ng pagsasanay, pagsusuri, o deployment. Iniuugnay ng isang kaso sa kaligtasan ang bawat pahayag sa kaligtasan sa sumusuportang ebidensya at malinaw nitong inilalahad ang mga palagay, kawalang-katiyakan, at natitirang panganib na maaaring makaapekto sa mga konklusyon nito.
Nagmumungkahi kami ng apat na prayoridad para sa mas malalim na pagtatasa, kasama ang mga prinsipyo para sa masusi, ligtas, at independiyenteng gawain.
Independiyenteng pagtatasa ng mga kaso sa kaligtasan, mula sa pagsasanay at pagsusuri hanggang sa panloob at panlabas na deployment.
Ang pagtatasa ng mga kaso sa kaligtasan ay nangangailangan ng kadalubhasaan sa alignment, mga paraan ng pagkontrol gaya ng monitoring, cybersecurity, maling paggamit sa larangang biyolohikal at kemikal, at red teaming. Binubuo ang mga kaso sa kaligtasan ng mga pahayag tungkol sa pagsasanay, mga pagsusuri sa kakayahan, at mga pananggalang, na maaaring tasahin nang buo o bahagi-bahagi (tingnan ang mga prayoridad 2 at 3 sa ibaba). Malamang na kailangang suriin ng maraming assessor ang iba't ibang bahagi ng mga kaso, gamit ang kani-kanilang kadalubhasaan. Kapag pinagsama, dapat masagot ng kanilang mga pagtatasa ang mga tanong na gaya ng:
May sapat bang batayan ang ebidensya para sa mga kaso sa kaligtasan ng pagsasanay, pagsusuri, at mga deployment? Sinunod ba ang mga kondisyon ng kaso sa kaligtasan sa panahon ng pagsasanay, pagsusuri, at deployment?
Saklaw ba ng aming mga kaso sa kaligtasan ang pinakamahahalagang panganib na natukoy habang isinasagawa ang isang pagtatasa? Sinusuportahan ba ng mga pahayag sa kaligtasan ang pangkalahatang kaso sa kaligtasan? Mayroon bang mga kakulangan o bahaging dapat pagbutihin?
Gumagamit ba ng mabisang mga pamamaraan upang tukuyin at bawasan ang mga insentibo sa pagsasanay na maaaring gantimpalaan ang panlilinlang, reward hacking, mapaminsalang pagkilos, o pag-iwas sa mga paghihigpit?
Pagtatasa ng mahahalagang pananggalang sa panloob at panlabas na deployment
Patuloy na umuunlad ang aming magkakaugnay na mga pananggalang upang makasabay sa nagbabagong mga kakayahan at kalagayan. Saklaw ng aming mga pananggalang ang pagsasanay, panloob na deployment, at panlabas na deployment. Kasalukuyang kabilang dito ang mga pananggalang sa antas ng modelo, pagpapatupad, at seguridad, pati mga monitor ng misalignment—na sumasaklaw sa maraming uri ng panganib, gaya ng pagkawala ng kontrol at maling paggamit na nauugnay sa panganib sa cyber, biyolohiya, at kemika. Matutukoy ng mga teknikal na pakikipagtulungan ang mga kasalukuyang kahinaan sa mga pananggalang habang pinahuhusay ang mga pamamaraan ng pagtatasa at pinabibilis ang pagbuo ng mga pamantayan. Nagbibigay ito ng mas matibay na teknikal na batayan para sa mga pampublikong patakaran sa hinaharap upang umagapay sa frontier—lalo na sa mga panloob na deployment, kung saan nagsisimula pa lamang mabuo ang mga pamantayan sa kaligtasan at seguridad.
Dapat suriin ng mga independiyenteng pagtatasa kung gaano kabisa ang mga pananggalang na ito at kung saan maaaring may mga kakulangan, gaya ng:
Gamit ang “grey box” na access, matatag ba ang mga pananggalang laban sa adversarial testing (mga jailbreak), at sapat ba ang proteksyon ng mga ito laban sa pagtaas ng kakayahan sa mga domain na mataas ang panganib, gaya ng cyber at bio? Saklaw ba ng aming adversarial testing at red teaming ang pinakamahahalagang panganib?
Sa awtorisadong pagsubok sa makatotohanang mga kondisyon ng pagpapatakbo, paano nakikipag-ugnayan ang mga agent sa mga cyber defense gaya ng mga access control, sandboxing, at mga system sa pag-detect at pagtugon? Aling mga depensa ang pumipigil, tumutukoy, o kumokontrol sa mapaminsalang mga pagkilos, at saan nabibigo ang mga ito?
Mayroon bang malalaking kakulangan ang aming mga monitor ng misalignment na maaaring humantong sa pagkawala ng kontrol o malubhang misalignment sa panloob at panlabas na deployment? Gaano maaasahan ang monitoring ng chain-of-thought bilang pinagmumulan ng ebidensya para sa kaligtasan o alignment habang humuhusay ang mga kakayahan ng modelo?
Naipatutupad ba ang angkop na monitoring sa lahat ng nauugnay na pagsasanay, pagsusuri, at deployment sa paraang hindi madaling ma-disable?
Naipatutupad ba ang mga pananggalang na naaayon sa mga kakayahan?
Pagtatasa ng mga pagsusuri sa kakayahang sumasaklaw sa mga kategorya ng panganib sa Preparedness (Mga Panganib na Kemikal at Biyolohikal, Cybersecurity, at Pagpapahusay ng AI sa Sarili Nito) at mga pagsusuri sa alignment para sa mga panganib ng misalignment
Iniaatas ng aming Preparedness Framework ang mga pagsusuri sa mahahalagang larangan ng frontier risk. Habang nalalampasan ang mga threshold at naaabot ng mga pagsusuri ang limitasyon ng pagsukat nito, mahalagang regular na i-update at tiyakin ang saklaw at kalidad ng mga pagsusuri sa mga kakayahan sa mga larangan ng panganib sa Preparedness, pati ng mga pagsusuri sa alignment na sumusukat sa mga panganib ng malubhang misalignment.
Kabilang sa mahahalagang tanong ang:
Sapat bang saklaw ng mga pagsusuri sa mga panganib sa Preparedness ang kahulugan ng threshold para sa mga panganib na iyon? Tama ba ang pagkakatakda ng mga threshold para sa mga pagsusuring ito?
Ina-update ba ang mga pagsusuri kapag palaging nakakamit ng mga modelo ang pinakamataas na marka, at makabuluhan bang nasusukat ng mga bagong pagsubok ang mas advanced na mga kakayahan?
Sapat bang saklaw ng aming mga pagsusuri sa alignment ang mga panganib ng malubhang misalignment, at anong mahahalagang gawi o kondisyon ang maaaring hindi nito makita?
Independiyenteng pagsisiyasat sa mahahalagang insidente ng misalignment
Maaaring maging mahalaga ang independiyenteng pagsisiyasat sa iba't ibang kritikal na insidente sa kaligtasan ng AI. Dito, nakatuon kami sa misalignment ng modelo, kabilang ang pagkilos ng mga modelo nang walang awtorisasyon o pag-iwas sa pangangasiwa. Maaari nitong ibunyag ang mga kahinaan sa mga pamamaraan ng alignment at mga pananggalang kahit walang sinasadyang maling paggamit.
Sa ilang piling sitwasyon, gaya ng insidente ng OpenAI sa Hugging Face, maaaring makatulong ang pagkuha ng independiyenteng third party para sa hiwalay na pagsisiyasat sa insidente ng misalignment. Napakahalagang taglay ng mga third party na sangkot sa pagsisiyasat ng insidente ang kinakailangang kadalubhasaan, kabilang, kung naaangkop, ang kadalubhasaan sa cyber forensics at alignment, malawakang pagsusuri ng chain-of-thought, at sapat na tauhan at mapagkukunan upang maisagawa agad ang pagsisiyasat. Maaaring kailanganin sa pagtugon sa insidente ang access sa sensitibong panloob na datos at datos ng third party, kaya maaaring sensitibo ang ilang detalye para ilathala o i-access. Makakatulong din ang mga natuklasan mula sa mga independiyenteng pagsisiyasat sa kaso sa kaligtasan ng isang modelo sa pamamagitan ng pagbibigay ng ebidensya para tasahin ang mga pahayag tungkol sa alignment nito at sa bisa ng mga hakbang upang maitama ang naunang natukoy na misalignment.
Sa konteksto ng mga insidente ng misalignment, inuuna namin ang mga independiyenteng pagtatasa sa mga sumusunod:
Anong gawi ng modelo o mga problema sa misalignment ang naganap sa insidente, at ano ang mga pangunahing salik na nag-ambag dito?
Mabisa bang mababawasan ng mga pananggalang at hakbang sa pagwawasto ang mga katulad na insidente sa hinaharap?
Malinaw ang saklaw at kapwa napagkasunduang mga pahayag na tatasahin: Dapat magsimula ang mga pagtatasa sa saklaw na kapwa napagkasunduan, na susundan ng malinaw na pagtukoy sa mga pahayag sa kaligtasan na paunang irerehistro bago magsimula ang mga gawain sa pagtatasa. Dapat linawin ng mga third party at lab kung ang mga ito ay mga pahayag na nais iharap para sa pagtatasa ng kumpanyang sinusuri, o mga pahayag na nais tasahin nang hiwalay ng third-party assessor at sinasang-ayunan ng lab na gamiting batayan ng pagtatasa rito. Maraming dahilan kung bakit maaaring wala sa saklaw ang ilang pahayag, kabilang ang kawalan ng praktikal na paraan para ma-access ng mga third party ang datos, kakulangan ng assessor sa kinakailangang kadalubhasaan, o makatuwirang limitasyon sa oras kapag apurahan ang pagtatasa. Dapat magtakda ang mga lab at assessor ng proseso para isaalang-alang ang malalaking panganib na natukoy sa labas ng orihinal na saklaw, kabilang ang pagpapasya kung kailangan ng higit pang pagsisiyasat. Dapat linawin sa mga konklusyon kung ano ang tinasa at hindi tinasa kaugnay ng saklaw na kapwa napagkasunduan.
Angkop na antas ng access: Hangga't maaari at nasa loob ng mga limitasyong legal, panseguridad, at nauugnay sa IP, dapat magkaroon ang mga assessor ng access na angkop sa pagtatasa ng mga napagkasunduang pahayag. Kapag hindi praktikal o posible ang direktang access, maaaring makipagtulungan ang mga assessor sa itinalagang kinatawan ng kumpanya o gumamit ng di-tuwiran o privacy-preserving na mekanismo ng access upang maprotektahan ang pinagbabatayang impormasyon.
Malinaw na pamamaraan at mga pamantayan: Dapat ipaliwanag ng mga assessor ang kanilang mga pamamaraan, pamantayan sa pagtatasa, at mga kawalang-katiyakan, gamit ang mga naitatag nang pamantayan kung mayroon. Kung wala pang mga pamantayan, dapat nilang malinaw na ipaliwanag ang batayan ng mga pamantayang ginagamit nila. Dapat ihiwalay sa mga ulat ang mga direktang natuklasan sa interpretasyon, ipaliwanag ang kawalang-katiyakan, at linawin kung aling mga konklusyon ang sinusuportahan ng ebidensya.
Kadalubhasaan at kalayaan: Dapat ipakita ng mga assessor ang kinakailangang teknikal na kadalubhasaan at tukuyin, ihayag, at tugunan ang mga salungatan ng interes sa organisasyon at indibidwal, kabilang ang mga insentibong pinansyal, ugnayan sa mga developer, at dating pagkakasangkot sa gawaing tinatasa. Dapat idisenyo ang mga pananggalang upang matiyak na hindi maiimpluwensyahan ng komersyal na presyon at mga kasunduan sa bayad ang mga natuklasan, at maaaring kabilang dito ang pag-atras sa isang gawain o angkop na panahon ng hindi pagsali.
Seguridad at pagiging kumpidensyal: Dapat magpakita ang mga assessor ng mga kasanayan sa seguridad ng impormasyon at maipatutupad na proteksyon sa pagiging kumpidensyal para sa kanilang mga tauhan, na naaayon sa pagiging sensitibo ng mga system at impormasyong ina-access. Dapat saklawin ng mga proteksyong ito ang intellectual property, sensitibong impormasyon, at mga rekord ng pagtatasa. Kapag hindi matugunan ng mga assessor ang mga kinakailangan sa seguridad sa sarili nilang kapaligiran, o kung lubhang sensitibo ang datos na ina-access, maaaring angkop ang pag-access gamit ang mga device o pasilidad na pinamamahalaan ng kumpanya.
Mga natuklasang maaaring aksyunan at panahon para ayusin ang mga problema: Dapat tukuyin ng mga pagtatasa ang mga partikular na kakulangan at magbigay ng sapat na detalye upang matugunan ng mga lab ang mga ito. Kung naaangkop, dapat bigyan ang mga lab ng makatuwirang panahon upang ayusin ang mga problema bago ilathala ang ulat. Kung may kaugnayan, dapat ding ipaliwanag sa mga ulat ang mga aral para sa mga developer, deployer, at tagapagtanggol ng agent, kasama ang mga praktikal na rekomendasyon sa pagpapatupad.
Responsableng paraan ng paglalathala: Dapat nakabatay sa ebidensya ang mga ulat sa pagtatasa at ibahagi nang bukas hangga't maaari, habang pinoprotektahan ang sensitibo at kumpidensyal na impormasyon. Kapag hindi posible ang ganap na pagsisiwalat sa publiko, makatutulong sa pananagutan ang kumpidensyal na pag-uulat sa mga naaangkop na lupon ng pangangasiwa, gaya ng mga lupong namamahala o board ng mga kumpanya. Dapat may malinaw at may-prinsipyong mga proteksyon at patakaran sa pagtatakip ng sensitibong impormasyon, pati na malinaw na inaasahan tungkol sa feedback at pagwawasto ng mga kamalian, upang mapanatili ang balanse ng kalayaan at pagiging kumpidensyal. Dapat panatilihin ng mga assessor ang kalayaan sa pag-edit habang tinitiyak na napapanatili ang pagiging kumpidensyal at mga proteksyon sa IP. Dapat magpatupad ang mga assessor ng malinaw na mga patakaran sa pagtatakip ng impormasyon na nagbibigay-daan sa mga lab na hilinging itago ang sensitibong impormasyon, habang maaaring isaad ng mga assessor kung saan may malalaking bahaging itinago at kung paano ito nakaapekto sa kanilang ulat sa pagtatasa.
Nakatuon kami sa pagsuporta sa mga independiyenteng assessor at pagtatatag ng mas malinaw at magkakatugmang internasyonal na pamantayan—sa pamamagitan ng mga batas sa hinaharap at mga pribadong institusyon ng pamamahala—para sa mabisang pagtatasa ng third party. Habang patuloy pang lumalago ang ecosystem ng independiyenteng pagsusuri, tutulungan namin itong umunlad sa pamamagitan ng pagsuporta at pakikipagtulungan sa magkakaibang komunidad ng mga independiyenteng assessor na may malalim na kadalubhasaan sa mga usapin ng kaligtasan ng frontier AI. Walang iisang third party na kaya o dapat sumaklaw nang lubusan sa mga agarang usapin ng kaligtasan ng frontier AI. Kikilos kami nang maingat at may malinaw na layunin upang palawakin ang aming kakayahan at tulungan ang lumalagong ecosystem ng mga third party na magkaisa sa pinakamahuhusay na kasanayan at prinsipyo. Nakikipag-usap kami sa maraming third party tungkol sa mga panukalang naaayon sa mga prayoridad na nabanggit sa itaas.


