Tungo sa mga pangangatwiran sa kaligtasan para sa pagsasanay ng frontier AI
Naniniwala kaming pumapasok tayo sa isang bagong panahon kung kailan dapat kailanganin ang sistematikong dokumentasyon sa kaligtasan bago ipagpatuloy ang anumang sesyon ng pagsasanay ng frontier AI gamit ang pagpapatibay ng pag-aaral. Sa pinakamainam na kalagayan, dapat umabot ang dokumentasyong ito sa antas ng “mga pangangatwiran sa kaligtasan”—mga komprehensibo, sistematiko, at batay-sa-ebidensiyang pangangatwiran tungkol sa panganib na ginagamit sa ibang industriyang kritikal ang kaligtasan. Itinuturing naming gabay na mithiin ang mga pangangatwiran sa kaligtasan na unti-unti naming binubuo. Kinikilala rin namin ang hamong gawing kasinghigpit ang mga ito para sa mga modelo ng AI gaya ng sa abyasyon o enerhiyang nuklear, dahil sa lumilitaw na pagkakumplikado sa bawat bagong antas ng kakayahan ng AI. Bumubuo kami ng balangkas upang maisapormal ang mga gawing ito.
Nasa ibaba ang ilang paunang gabay na sa tingin namin ay dapat maging bahagi ng mga pangangatwiran sa kaligtasan para sa pagsasanay ng frontier AI. Sinasalamin ng pinakamahuhusay na gawing ito ang aming mga natutuhan sa ngayon. Inaasahan naming magbabago pa ang mga ito habang patuloy naming pinapahusay ang mga panloob na proseso para sa maingat na pagbuo. Ibinabahagi namin ang mga ito ngayon upang maging bukas tungkol sa aming kasalukuyang pananaw at makahingi ng puna mula sa komunidad. Tandaang nakatuon ang dokumentong ito sa pagsasanay ng frontier AI gamit ang pagpapatibay ng pag-aaral; para sa panloob at panlabas na deployment, kailangang isaalang-alang ang mas malawak na hanay ng mga katangian ng pagkakaayon.
Dapat saklawin ng mga pangangatwiran sa kaligtasan ang tatlong aspeto ng teknikal na sistema: pagsasanay sa pagkakaayon, pagpapanatili sa itinakdang hangganan, at pagsubaybay. Nakakatulong ang mga proteksiyong ito upang matiyak na hindi susubukan ng modelo na kumilos nang hindi nakaayon, at kahit gawin nito iyon, magiging mahirap para rito na makalampas sa itinakdang hangganan at matutukoy ito ng pagsubaybay bago pa makapagdulot ng pinsala.
Pagkakaayon ng modelo: Ang unang depensa ay dapat ang pagsasanay sa mga modelo na maging nakaayon; ibig sabihin, mapagkakatiwalaang kumilos ayon sa ating nilalayon. Maaaring kabilang dito ang:
Mga kapaligiran ng pagsasanay at pagbibigay ng marka: Bawasan ang panganib na magkaroon ng mga kilos na hindi nakaayon ang mga modelo sa pamamagitan ng pagpigil na magantimpalaan ang pagmanipula sa sistema ng gantimpala habang nagsasanay. Maaaring kabilang dito ang:
Awtomatikong pagsusuri ng dataset: Gumamit ng mga agent upang hanapin at ayusin ang mga depektibong kapaligiran ng RL na maaaring magbigay ng mataas na gantimpala sa mga sunod-sunod na kilos na hindi nakaayon dahil sa pagsasamantala sa mga kahinaan, sa halip na sa nilalayong kilos. Mababawasan nito ang mga pagkakataong mapalakas ang hindi pagkakaayon habang nagsasanay.
Manwal na pagsusuri ng dataset: Dagdagan ang awtomatikong red teaming ng manwal na pagsusuri at pagtiyak sa kalidad ng mga dataset upang matukoy ang mga depektibong gawain na maaaring di-sinasadyang magpalakas ng mga kilos na hindi nakaayon.
Pagsasaayos ng mga tagapagbigay ng marka: Isaayos ang mga tagapagbigay ng marka upang magparusa sa mga pagtatangka ng modelo na pagsamantalahan ang mga kahinaan o i-hack ang mga kapaligiran ng RL habang nagsasanay.
Pagsusuri sa mga naunang sesyon: Gumamit ng mga classifier sa mga tala ng mga naunang eksperimento upang matiyak na gumagana ang mga tagapagbigay ng marka ayon sa nilalayon.
Pagsukat sa pagkakaayon: Magsagawa ng mga pagsusuring sumusubaybay sa tendensiya ng modelo na hindi umayon, upang masukat ang bisa ng pagsasanay sa pagkakaayon. Maaaring kabilang dito ang:
Mga offline na pagsusuri sa pagkakaayon: Magsagawa ng mga pagsusuri sa pagkakaayon habang tumatakbo ang mga sesyon ng pagsasanay ng frontier AI upang mataya kung gumagana ang pagsasanay ayon sa nilalayon, at siyasatin ang anumang makabuluhang paglala.
Pagsubok gamit ang mga nakaraang kaso: Subukan ang mga pagsusuri sa pagkakaayon gamit ang mga nakaraang insidente upang matiyak na natutukoy ng mga ito ang mga dating modelong hindi nakaayon at hindi labis na naiaangkop sa mga partikular na insidente lamang.
Pagsubaybay sa pagmanipula ng pagsusuri: Subaybayan ang evaluation awareness o metagaming (pagkilala ng mga modelo na sinusubok sila) na maaaring magpabago ng kilos. Halimbawa, paganahin ang mga tagasubaybay ng evaluation awareness at metagaming sa mga pagsusuri sa pagkakaayon, na may mga tiyak na limitasyon kung kailan haharangin ang pagpapatuloy.
Mga pagsubok sa pinakamatinding kalagayan: Subukang palitawin ang pinakamalalang maling kilos at tiyaking matutukoy ito ng kahit isang pagsusuri.
Pigilan ang pagsasanay batay sa chain-of-thought: Huwag hayaang makita ng mga awtomatikong tagapagbigay ng marka ang chain-of-thought sa pagpapatibay ng pag-aaral upang maiwasang matuto ang mga modelo na umiwas sa mga tagasubaybay ng chain-of-thought.
Pagpapanatili sa itinakdang hangganan: Kung maging hindi nakaayon ang isang modelo, dapat sapat ang tibay ng sandboxing at seguridad upang maiwasan ang mga mapaminsalang kilos. Maaaring kabilang dito ang:
Maraming patong ng seguridad sa imprastraktura: Maglaan ng malaking pondo at pagsisikap sa pagpapatibay ng sandbox kung saan tumatakbo ang modelo at ng imprastraktura ng pananaliksik na nagho-host dito, upang may dagdag na proteksiyon sakaling makalabas ang modelo sa sandbox.
Red teaming sa mga itinakdang hangganan: Pahusayin ang seguridad ng sandbox, imprastraktura ng pananaliksik, at perimeter sa pamamagitan ng paulit-ulit na red teaming sa mga sistemang ito. Gumamit ng mga checkpoint mula sa mga sesyon ng pagsasanay ng frontier AI, alinsunod sa pagsusuri sa kaligtasan, upang matukoy at maisara ang anumang puwang. Isailalim din sa red teaming ang lahat ng serbisyong maaaring maakses ng modelo habang nagsasanay (hal., internet cache).
Komunikasyon sa pagitan ng mga sample: Limitahan ang komunikasyong may mataas na bandwidth sa pagitan ng mga sample sa mga aprubadong daan, gaya ng mga tool para sa maraming agent. Isara ang mga di-pangunahing daan ng komunikasyon sa imprastraktura na may mataas na bandwidth at madaling matuklasan ng mga agent.
Mga transcript na hindi mababago: Para sa lahat ng pagsasanay sa RL, pagsusuri, at panloob na deployment, itabi ang mga transcript ng agent sa paraang hindi mababago sa loob ng makatwirang panahon (halimbawa, sa mga storage account na minsan lang maaaring sulatan). Makakatulong ito sa maaasahang pagsisiyasat ng insidente at pag-iwas sa di-sinasadyang pag-edit.
Pagsubaybay: Kung magsimulang kumilos nang hindi nakaayon ang mga modelo, dapat may real-time na sistema ng pagsubaybay upang matukoy ang anumang posibleng hindi pagkakaayon at mabilis na matugunan ang mga prayoridad na isyu bago magkaroon ng malubhang insidente. Maaaring kabilang dito ang:
Tiyaking masusubaybayan ang mga modelo: Tiyaking patuloy na masusubaybayan ang mga modelo, batay sa mga pagsusuring may malinaw na pamantayan para sa kakayahang subaybayan at pag-iwas sa pagsubaybay, upang maagang matukoy ang mga nakababahalang kilos.
Mataas na antas ng pagtukoy sa mga kilalang isyu: Tiyaking natutukoy ng sistema ng pagsubaybay ang malaking bahagdan ng mga nakaraang insidente sa isang pagsusuring hindi ginamit sa pagsasanay.
Napapanahong pagsusuri para sa mga tagasubaybay: Bumuo ng mga datos sa pagsusuri na kumakatawan sa mga ganap na bagong panganib para sa mga bagong sesyon ng pagsasanay, upang manatiling napapanahon ang pagsukat sa recall at precision ng mga tagasubaybay.
Mabilis na pagtugon: Magpatupad ng mga prayoridad na alerto na hahantong sa pagkilos sa loob ng itinakdang SLA, sa pamamagitan ng pag-alerto sa taong nakaantabay o awtomatikong paghinto sa apektadong sesyon ng pagsasanay, bago makapinsala ang modelo. Halimbawa, alertuhan ang nakaantabay sa seguridad at ang tagapangasiwa ng sesyon kapag may insidente sa araw, at awtomatikong ihinto ang mga sesyon kapag may mga alertong hindi kinumpirmang natanggap sa gabi.
Bukod sa mga rekomendasyon sa teknikal na proteksiyon, bumubuo rin kami ng pinakamahuhusay na gawi sa operasyon para sa mga pangangatwiran sa kaligtasan ng isang sesyon ng pagsasanay ng frontier AI. Maaaring kabilang dito ang:
Mga pagtutol (paunang pagsusuri sa posibleng pagkabigo): Matapos mabuo ang burador ng pangangatwiran sa kaligtasan, dapat sumulat ng pagtutol ang isang miyembro ng ibang pangkat upang tukuyin ang mga posibleng puwang at magbahagi ng maingat na pagtaya sa panganib. Dapat itong tugunan ng pangkat ng pagsasanay upang mas mapatatag ang pangangatwiran sa kaligtasan.
Mga pag-apruba: Dapat suriin ng mga nakatataas na pinuno ang pangangatwiran sa kaligtasan. Bawat isa ay dapat may kapangyarihang pigilan ang sesyon ng pagsasanay upang matiyak na may maraming panloob na pagsusuri rito (hal., pinuno / VP ng organisasyon ng pananaliksik, Pinuno ng Kaligtasan, at Punong Siyentipiko).
Pananagutan: Ang nakatataas na pinunong namamahala sa isang sesyon ng pagsasanay (hal., pinuno / VP ng pananaliksik) ay dapat managot sa pangangatwiran sa kaligtasan at anumang pagtugon sa insidente, pati sa pagsusuri ng kanyang pagganap. Sa ganitong paraan, mahihikayat din ang mga pangkat ng pagsasanay na isulong ang kaligtasan at pagkakaayon.
Pansamantalang paghinto: Kung may matukoy na mga isyung magpapawalang-bisa sa pangangatwiran sa kaligtasan (hal., bagong isyu sa seguridad), tiyaking may mga gabay sa operasyon, teknikal na kontrol, at SLA para pansamantalang ihinto ang lahat ng saklaw na sesyon ng pagsasanay.
Panloob na transparensiya: Dapat maakses ng mga panloob na pangkat ng pangangasiwa (hal., ang Safety and Security Committee) ang mga pangangatwiran sa kaligtasan.
Mga audit: Dapat bigyan ang mga auditor ng sapat na akses upang mapatunayan na wasto at matibay ang mga pahayag sa pangangatwiran sa kaligtasan, at maiulat ang anumang matukoy na kakulangan.
Pag-akyat ng mga isyu: Dapat may malinaw na proseso para iakyat ang mga isyu ng hindi pagkakaayon, na may talahanayan ng mga itinakdang antas ng kalubhaan. Dapat ding may nakatalagang nakaantabay na maaaring mag-alerto sa mga ehekutibo (hal., CEO) kapag umabot ang isang sesyon ng pagsasanay sa partikular na antas ng kalubhaan.
Mga teknikal na kontrol: Dapat maging mahirap para sa mga tao at agent na magsimula ng mga sesyon ng pagsasanay na hindi sumusunod sa mga kinakailangan. Dapat awtomatikong humarang sa operasyon ang mga tampok na pangkaligtasan, gaya ng pagsubaybay at awtomatikong paghinto, kapag pumalya ang mga ito (hal., hindi dapat masimulan ang pagsasanay nang walang aktibong naaangkop na pagsubaybay, o ma-disable ang tagasubaybay mula sa loob ng pagsasanay sa RL, pagsusuri, o panloob na deployment).
Kakayahang ibalik sa dating kalagayan: Dapat madaling matukoy ang lahat ng kasunod na paggamit ng isang modelong hindi nakaayon sa proseso ng pagsasanay (halimbawa: pagbuo ng datos o pagbibigay ng marka), upang mapawalang-bisa ang epekto ng mga output na hindi nakaayon kung kinakailangan.
Kumpletong talaan ng natitirang panganib: Dapat ilista sa mga pangangatwiran sa kaligtasan, nang komprehensibo hangga't maaari, ang mga natitirang panganib na hindi saklaw ng kasalukuyang mga hakbang sa pagbabawas ng panganib. Makakatulong ito sa pagpapasya kung katanggap-tanggap ang panganib.
Ito ang aming kasalukuyang mga rekomendasyon, na unti-unti nang ipinapatupad sa OpenAI. Inaasahan naming patuloy na magbabago ang aming mga gawi sa mga darating na linggo.
Bumubuo rin kami ng pinakamahuhusay na gawi para sa pagsisiyasat sa malulubhang insidente ng hindi pagkakaayon ng AI. Dapat sikapin ng mga laboratoryo na matuto hangga't maaari mula sa bawat insidente (tulad ng mga gawi sa pagsisiyasat(magbubukas sa bagong window) sa iba pang industriyang may malalaking panganib), upang maiwasang maulit ang mga ito. Maaaring kabilang sa mga hakbang ang:
Panloob na transparensiya: Dahil maaaring matagalan ang pagsisiyasat, dapat regular na magbahagi ng mga ulat sa loob ng organisasyon tungkol sa progreso nito (hal., araw-araw na ulat para sa mga nagpapatuloy na pagsisiyasat). Dapat may malinaw na mga paraan para makakuha ang mga empleyado ng higit na akses, kabilang ang mga orihinal na transcript at pagkuha ng mga sample mula sa mga modelong hindi nakaayon, kung ligtas ito at may kaugnayan sa kanilang trabaho.
Ugat ng hindi pagkakaayon: Dapat tukuyin ng mga mananaliksik ang ugat ng problema sa mga proseso ng pagsasanay (hal., sa pamamagitan ng piling pag-aalis ng mga bahagi o mga eksperimento sa muling pagkuha ng sample) upang maunawaan kung paano nabuo ang mga kilos na hindi nakaayon. Makakatulong ito upang mas maunawaan ang agham ng hindi pagkakaayon at mas maiwasan ito sa hinaharap.
Pagsusuri matapos ang insidente: Dapat suriin ang operasyon at kultura ng organisasyon upang maunawaan ang lahat ng sanhi ng insidente, gaya ng kung bakit lumitaw ang mga problema at hindi natukoy o naiakyat ang mga ito bago ang insidente.
Pagtukoy: Dapat tayong bumuo ng mga paraan ng pagsubok sa pagkakaayon na kayang matukoy ang tendensiyang magdulot ng insidente, nang hindi direktang ino-optimize ang mga ito batay sa impormasyong mula sa insidente (hal., mga transcript o buod ng insidente). Dapat bumuo ng mga pagsusuring batay sa insidente bilang “mga pagsubok sa pagbalik ng dating problema,” upang matiyak na walang tendensiya sa hindi pagkakaayon ang mga susunod na modelo sa mga halos kaparehong insidente.
Pagsisiwalat sa publiko: Dapat ibahagi sa publiko ang mga resulta ng pagsisiyasat, pagsusuri matapos ang insidente, at pagbabago sa operasyon kapag natapos na ang pagsisiyasat. Dapat abisuhan sa lalong madaling panahon ang mga apektadong ikatlong partido.


