Ang balangkas namin sa pag-uulat ng misalignment ng modelo
Ibinabahagi namin ang isang bagong balangkas para sa pagsubaybay, pag-iimbestiga, at pagsisiwalat ng mga kaso ng hindi pagkakaayon ng modelo sa OpenAI, kasama ang anim na ulat tungkol sa hindi inaasahan o nakababahalang gawi ng modelo na naobserbahan namin sa nakalipas na anim na buwan.
Noon, upang mas mabigyan ng impormasyon ang mga mananaliksik, developer ng AI, tagagawa ng patakaran, at publiko, sinikap naming isapubliko ang aming mga natuklasan tungkol sa hindi pagkakaayon. Ngunit dahil walang sistematikong paraan ng pag-uulat sa mga natuklasang ito, hindi pare-pareho at mas madalang kaysa nararapat ang aming mga pagsisiwalat: madalas kaming naghintay hanggang sa mapagsama-sama ang ilang kaso sa iisang ulat, o idinagdag ang mga ito sa mga system card ng mga bagong inilabas na modelo. Layunin ng bagong balangkas na ito na mapabilis ang paglalathala ng mga ulat sa hindi pagkakaayon matapos itong maobserbahan, kahit hindi pa namin ganap na naipaliwanag o nabawasan ang gawi na iniuulat namin.
Habang nagiging mas advanced at mas malawak na ginagamit ang mga AI system, kailangan nating bumuo ng mas malawak at mas may-kaalamang pagkakasundo tungkol sa pag-unlad ng pananaliksik sa alignment. Hindi kami naniniwala na sapat nang nalutas ng industriya ng AI ang alignment at pagsubaybay upang responsableng magpatuloy nang mas matagal sa pinakamabilis na posibleng pagpapalawak. Ang mga pasya tungkol sa dapat tahaking direksiyon ng pagbuo ng AI sa mga darating na buwan at taon ay kailangang ibatay sa ebidensiyang masusuri mismo ng mga tao sa labas ng mga kumpanyang gumagawa ng mga frontier na modelo.
Makakatulong ang mga halimbawa ng hindi pagkakaayon na matukoy ang mga problemang maaaring makaharap ng ibang developer ng AI kapag umabot sa kaparehong kakayahan ang kanilang mga system, mailantad ang mga kahinaan sa mga pananggalang, o kuwestiyunin ang mga palagay tungkol sa gawi ng modelo. Sa pagbabahagi ng mga natuklasang ito, masisiyasat ng iba ang parehong mga problema, masusubok ang aming mga paliwanag, at mapahuhusay ang mga hakbang sa pag-iwas. Dahil naniniwala kami sa halaga ng transparency tungkol sa hindi pagkakaayon, pinapaboran ng aming bagong balangkas ang pagsisiwalat kahit hindi tiyak ang kahalagahan nito. Nangangahulugan ito na maaaring mapatunayang walang batayan ang ilan sa mga kasong isisiwalat namin at hindi bahagi ng mas malaking pattern o palatandaan ng mga pag-unlad sa hinaharap.
Sa ngayon, walang balangkas sa buong industriya na may malinaw na mga pamantayan kung paano dapat isiwalat ng mga developer ng AI ang mga halimbawa ng hindi pagkakaayon sa kanilang mga modelo. Umaasa kaming ang balangkas na inilalahad namin ngayon ay unang hakbang sa pagbuo ng gayong mga pamantayan, na nagtatakda kung aling mga kaso ng hindi pagkakaayon ang dapat isiwalat ng mga developer at kung ano ang dapat ilaman ng kanilang mga ulat. Itinuturing naming patuloy pang binubuo ang balangkas na ito, at paghuhusayin namin ito batay sa karanasan at feedback ng publiko.
Dito, inilalarawan namin kung paano gagana ang balangkas at ibinabahagi ang mga unang ulat na inilalathala namin.
Layunin naming isiwalat ang mga halimbawang nagbibigay ng kapaki-pakinabang na ebidensiya kung paano nagkakaroon ng hindi pagkakaayon ang modelo, paano ito lumilitaw, at saan nagtatagumpay o nabibigo ang mga pananggalang. Binibigyang-priyoridad namin ang mga bagong mekanismo, makabuluhang pagbabago sa kilalang gawi, at mga natuklasang kumukuwestiyon sa mga palagay tungkol sa kaligtasan o pag-iwas. Hindi kailangang magdulot ng pinsala o magpatunay ng mas malawak na pattern ang isang halimbawa upang maging karapat-dapat itong isiwalat. Sasaklawin ng balangkas na ito ang mga gawi na tumutugon sa pamantayan sa buong lifecycle ng modelo—kabilang ang pagsasanay, pagsusuri, pagsubok, at deployment.
Kabilang dito ang mga bagong paraan para kumilos ang mga modelo nang walang pahintulot, makipag-ugnayan sa ibang mga modelo, o umiwas sa pangangasiwa; mga kabiguang naglalagay sa alinlangan sa isang paraan ng alignment o pananggalang; at gawing kumukuwestiyon sa isang pahayag sa inilathalang pagtatasa sa kaligtasan. Nalalapat din ang parehong pamantayan sa pagsisiwalat sa hindi pagkakaayong maaaring makaapekto sa mga third party.
Maaari ring kabilang dito ang mga kaso ng hindi pagkakaayon na tila nauulit lamang ang mga kasong isiniwalat na namin noon. Ang pag-ulit mismo ng problema ay maaaring maging kapaki-pakinabang na ebidensiya tungkol sa gawi ng aming mga modelo o bisa ng aming mga pananggalang—halimbawa, kung patuloy na nauulit ang isang partikular na uri ng hindi nakaayong gawi sa kabila ng paulit-ulit na pagsisikap na mabawasan ito. Sa ganitong mga kalagayan, ilalathala namin ang mga karagdagang halimbawa sa pamamagitan ng pag-update sa orihinal na pagsisiwalat ng hindi pagkakaayon.
Sa paglipas ng panahon, plano naming bumuo ng mas obhetibong pamantayan sa pagsisiwalat kasama ang ibang mga developer, panlabas na mananaliksik, mga organisasyon sa pamantayan ng industriya, at regulator. Naniniwala rin kami na dapat iulat sa pederal na pamahalaan ng US ang malulubhang insidente sa kaligtasan, seguridad, at hindi pagkakaayon, at nagsisikap kaming magmungkahi ng mga mekanismo sa pag-uulat. Itinuturing naming pandagdag ang balangkas na ito sa aming mga kasalukuyang obligasyon, at binibigyang-diin naming hindi nito pinapalitan ang aming mga legal na kinakailangan sa pagsisiwalat, kabilang ang para sa kritikal na insidente sa kaligtasan o paglabag sa cybersecurity.
Bilang paglulunsad sa aming bagong balangkas para sa pagsisiwalat ng hindi pagkakaayon, naglalathala kami ng anim na ulat tungkol sa mga kaso ng hindi nakaayong gawi na naobserbahan namin habang sinasanay o sinusuri ang aming mga modelo. Ipinakikita ng mga kasong ito ang iba’t ibang gawing pinaniniwalaan naming mahalagang ibahagi, mula sa pagtatago ng impormasyon sa user hanggang sa paggawa ng mga hindi awtorisadong pagkilos upang malampasan ang mga hadlang. Mga ulat ito ng mga indibidwal na kaso, at hindi dapat ituring na sumasalamin sa dalas ng hindi pagkakaayon sa aming mga modelo. Naka-link sa buong ulat ang bawat item sa ibaba.
Mga sariling binuong tagubilin sa mga buod ng gawain(magbubukas sa bagong window). Isang hindi pa inilalabas na modelong pansaliksik ang nagsingit ng mga walang kaugnayang tagubilin, kabilang ang mga tagubilin na balewalain ang mga karaniwang limitasyon nito, sa mga buod na ginamit upang ipagpatuloy ang gawain nito sa isang bagong context window. Natukoy namin ang 27 apektadong buod.
Mga tagubilin na itago ang mga pagkakamali sa mga buod ng gawain(magbubukas sa bagong window). Habang sinasanay ang GPT‑5.6 Sol, maraming instance ng modelo ang nagdagdag sa kanilang mga buod ng mga tagubilin na itago sa user ang mga pagkakamali o hindi nakaayong gawi. Halimbawa, may mga tagubilin ang mga buod ng compaction na mag-imbento ng nawawalang makasaysayang data nang hindi ito isinisiwalat at itago ang mga hindi pagtutugma sa mga bersiyon ng source.
Paghahanap sa mga pampublikong repository ng mga nalantad na API key, saka pag-imbento ng impormasyon(magbubukas sa bagong window). Habang sinasagot ang isang karaniwang tanong tungkol sa mga halaga ng kita sa isang county sa California, nakahanap at gumamit ang isang modelo ng nalantad na API key nang walang pahintulot. Nang hindi pa rin nito makuha ang mga hinihinging halaga, inimbento nito ang mga iyon at ipinakitang data mula sa hinihinging source.
Pag-upload ng mga file sa internet upang banggitin ang mga ito bilang sanggunian(magbubukas sa bagong window). Nang hingin ng isang user sa hindi pa inilalabas na modelo ang mga ID at pangalan ng mga lawang mas malaki sa 5,000,000 metro kuwadrado, nahanap ng agent ang tamang sagot gamit ang Python. Ngunit dahil humihingi ang mga tagubilin ng sanggunian mula sa browser, nagpasya ang agent na i-upload ang file upang mabanggit iyon sa sagot nito, nang hindi humihingi ng pahintulot sa user.
Mga hindi awtorisadong write at komunikasyon sa pamamagitan ng panloob na software repository(magbubukas sa bagong window). Gumamit ang mga modelo ng panloob na software repository bilang message board upang magpalitan ng mga kahilingan at tugon sa magkakahiwalay na sample ng pagsasanay habang naghahanap ng mga nawawalang input file, bagaman hindi nila nabawi ang mga file na iyon. Sinusuri rin sa ulat na ito ang isang naunang kaso kung saan matagumpay na nag-upload ang isang modelo ng mga test file sa isang repository habang sinusubukang lampasan ang mga paghihigpit sa network.
Hindi awtorisadong pagbabahagi ng file sa pagitan ng mga nagtutulungang agent(magbubukas sa bagong window). Gumamit ang mga agent na nagtutulungan sa parehong gawain sa pagsasanay ng mga pampublikong website para sa pag-host ng file upang magbahagi ng mga file nang hindi nila ma-access ang mga lokal na file ng isa’t isa. Dahil dito, naging available sa mga pampublikong URL ang mga kailangang isumite sa gawain, kahit hiniling sa mga modelo na gumamit lamang ng mga lokal na file.
Maaaring i-flag ng sinumang empleyado ng OpenAI ang isang halimbawa ng hindi pagkakaayon upang imbestigahan ng aming mga pangkat sa kaligtasan at alignment, at hilinging isaalang-alang ito para sa pampublikong pagsisiwalat. Sinisimulan nito ang aming proseso ng pagsisiwalat, na may mga deadline sa bawat hakbang upang matiyak ang napapanahong imbestigasyon at pagsisiwalat.
Kapag na-flag na ang isang halimbawa, iimbestigahan ng aming mga teknikal na kawani kung ano ang nangyari, ano ang nananatiling hindi tiyak, kung nararapat ang pampublikong pagsisiwalat, at aling mga katotohanan ang maaaring ibahagi. Susuriin din nila kung may naapektuhang third party na kailangang pribadong abisuhan bago ang paglalathala.
Pagkatapos, itatalaga ang halimbawa sa isa sa tatlong proseso: Handa nang Isiwalat, Maikling Imbestigasyon, o Mas Malawak na Imbestigasyon (“Mabagal na Proseso”).
Saklaw ng Handa nang Isiwalat ang mga kasong tumutugon sa pamantayan at sapat nang kumpleto ang imbestigasyon upang mailathala matapos suriin. Saklaw ng Maikling Imbestigasyon ang mga kasong nangangailangan pa ng teknikal na pagsisiyasat. Inaasahan naming masasaklaw ng dalawang prosesong ito ang malaking mayorya ng mga kasong isisiwalat namin, lalo na ang mga kasong hindi nangangailangan ng malawak na imbestigasyon, pakikipag-ugnayan sa mga third party, o pamamahala sa matitinding panganib ng maling paggamit. Ang lahat ng kasong inilalabas namin ngayon ay kabilang sa isa sa dalawang prosesong ito.
Saklaw ng Mas Malawak na Imbestigasyon ang masasalimuot na pagsisiyasat, lalo na ang mga may sangkot na third party. Kapag may naapektuhang third party, mas nangingibabaw kaysa sa balangkas na ito ang aming mga obligasyon sa seguridad, batas, at responsableng pagsisiwalat. Layunin naming maglathala ng paunang abiso sa lalong madaling panahon, ngunit maaaring kailanganin itong ipagpaliban dahil sa seguridad—halimbawa, kung makatuklas ang isang modelo ng dati’y hindi kilalang kahinaan sa malawakang ginagamit na software. Kung matutukoy sa isang ulat ang isang third party, balak naming magbigay ng paunang abiso kahit walang nalabag na hangganan ng seguridad.
Magbibigay ang paunang abiso para sa isang kaso ng Mas Malawak na Imbestigasyon ng pangkalahatang paglalahad sa nangyari, sasabihin kung tumutulong sa imbestigasyon ang mga eksperto sa labas, at magbibigay ng anumang available na pagtataya kung kailan namin inaasahang ilathala ang pinal na ulat. Mapapabilang sana sa prosesong ito ang insidente ng OpenAI sa Hugging Face kung isiniwalat iyon sa ilalim ng balangkas na ito.
Ipapaalam sa empleyadong naglahad ng halimbawa ang pasya kung isisiwalat ito at, kung itutuloy ang pagsisiwalat, kung aling proseso ang susundin. Ang mga hindi malutas na pagtatalo tungkol sa pagsisiwalat o sa naaangkop na proseso ay idudulog sa Safety Advisory Group (SAG) ng OpenAI, isang grupo ng matataas na opisyal mula sa iba’t ibang bahagi ng kumpanya na sumusuri sa mga kakayahan at pananggalang ng mga frontier na modelo, nangangasiwa sa aming Preparedness Framework, at nagpapayo sa pamunuan ng OpenAI. Ang mga pagtatalo sa loob ng SAG, o pagtutol ng mga kawani sa mga pasya nito, ay iaakyat sa pamunuan ng OpenAI. Ang mga pasyang huwag magsiwalat o nagsasabing hindi kinakailangan ang pagsisiwalat ay ibabahagi sa pamunuan ng kaligtasan at alignment at, hangga’t maaari, sa mga kaugnay na teknikal na kawani.
Maaari naming baguhin ang prosesong ito ng pagsisiwalat habang natututuhan namin kung paano ito gumagana sa aktuwal, at itatala namin sa post na ito ang anumang pagbabago.
Ilalarawan sa bawat buong ulat ang naobserbahan naming gawi, ang tindi nito at anumang panlabas na epekto, ang sitwasyon kung kailan ito nangyari, ang petsa o saklaw ng mga petsa nito, kung kailan namin ito natuklasan, at, sa pangkalahatan, ang modelo o mga modelong sangkot. Hangga’t maaari, ibabahagi rin namin ang:
Higit pang detalye tungkol sa nangyari at anumang pinsalang idinulot nito;
Kung paano namin natuklasan ang hindi pagkakaayon, at ang saklaw ng aming imbestigasyon;
Ang aming interpretasyon sa mga implikasyon nito para sa pananaliksik sa alignment at teknikal na kaligtasan ng AI;
Mahahalagang tanong na ibinangon ng halimbawa at hindi pa nasasagot;
Mga hakbang na ginagawa o pinaplano naming gawin upang tugunan ang gawi. Maaaring hindi pa laging makukuha ang mga ito sa oras ng pagsisiwalat, dahil maaari naming ilathala ang ulat sa hindi pagkakaayon bago matapos ang aming imbestigasyon o makabuo ng solusyon.
Para sa hindi pagkakaayong nangyayari sa mga deployment ng customer, magbabahagi kami ng impormasyong pinahihintulutan ng privacy ng customer at ng aming mga obligasyon sa kontrata.
Ang mga ulat ngayon ay paunang hanay ng mga pagsisiwalat, hindi isang komprehensibong paglalahad ng mga nalalamang hindi pagkakaayon o kasalukuyang imbestigasyon. Hindi nilalayong katawanin ng mga paunang ulat na ito ang buong saklaw o tindi ng mga kasong sakop ng balangkas na ito. Nakatuon kaming isiwalat ang mga kaso ng hindi pagkakaayong nakatutugon sa pamantayan ng balangkas na ito, kabilang ang mas masasalimuot na kaso na nangangailangan ng mas mahabang imbestigasyon o pakikipag-ugnayan sa mga third party. Patuloy kaming maglalathala ng mga ulat sa ilalim ng balangkas na ito, at magbabahagi pa tungkol sa aming mga pangako sa pag-uulat habang patuloy naming binubuo ang mga ito.


