Lumaktaw sa pangunahing content
OpenAI

Setyembre 16, 2026

PananaliksikKaligtasan

Ang aming balangkas para sa pag-uulat ng di-pagkakaayon ng modelo

Naglo-load…

Nagbabahagi kami ng bagong balangkas para sa pagsubaybay, pagsisiyasat, at pagsisiwalat ng mga pagkakataon ng di-pagkakaayon ng modelo sa OpenAI, kasama ang anim na ulat tungkol sa hindi inaasahan o nakababahalang gawi ng modelo na aming naobserbahan sa nakalipas na anim na buwan.

Noong nakaraan, upang mas mabigyan ng kaalaman ang mga mananaliksik, mga developer ng AI, gumagawa ng patakaran, at ang pangkalahatang publiko, sinikap naming ipaalam sa publiko ang aming mga natuklasan tungkol sa di-pagkakaayon. Ngunit dahil walang sistematikong paraan sa pag-uulat ng mga natuklasang ito, ang aming mga pagsisiwalat ay para sa layuning ito, at hindi kasing dalas ng nararapat: madalas kaming naghintay hanggang sa mapagsama-sama namin ang ilang pangyayari sa iisang ulat, o idinagdag ang mga ito sa mga card ng system para sa mga bagong inilabas na modelo. Layunin ng bagong balangkas na ito na pabilisin ang paglalathala ng mga ulat tungkol sa di-pagkakaayon matapos itong maobserbahan, kahit hindi pa namin ganap na naipaliwanag o nabawasan ang gawing iniuulat namin.

Habang nagiging mas matalino at mas malawak na naipapatupad ang mga AI system, kailangan nating bumuo ng mas malawak at mas may-kaalamang pagkakasundo tungkol sa pag-unlad ng pananaliksik sa pagkakaayon. Hindi kami naniniwalang nalutas na ng industriya ng AI ang pagkakaayon at pagsubaybay upang maipagpatuloy pa ang responsableng pagpapalawak sa pinakamabilis na paraan. Ang mga desisyon tungkol sa kung paano dapat magpatuloy ang pagbuo ng AI sa mga susunod na buwan at taon ay kailangang nakabatay sa ebidensiyang maaaring suriin mismo ng mga taong nasa labas ng mga kumpanyang bumubuo ng mga frontier na modelo.

Maaaring makatulong ang mga halimbawa ng di-pagkakaayon na matukoy ang mga problemang maaaring maranasan ng iba pang developer ng AI habang naaabot ng kanilang mga system ang magkakatulad na kakayahan, nagbubunyag ng mga kahinaan sa mga pananggalang, o hinahamon ang mga palagay tungkol sa gawi ng modelo. Ang pagbabahagi ng mga natuklasang ito ay nagbibigay-daan sa iba na siyasatin ang parehong mga problema, subukan ang aming mga paliwanag, at pahusayin ang kontrol. Dahil naniniwala kami sa halaga ng pagiging malinaw tungkol sa hindi pagkakatugma, pinapaboran ng aming bagong balangkas ang pagsisiwalat kahit hindi tiyak ang kahalagahan nito. Ang ibig sabihin nito ay ang ilan sa mga pagkakataong sinisiwalat namin ay maaaring mapatunayang hindi totoo at hindi bahagi ng mas malaking disenyo o hindi nagpapahiwatig ng mga pagpapahusay sa hinaharap.

Sa kasalukuyan, walang balangkas na sumasaklaw sa buong industriya na may malinaw na pamantayan kung paano dapat isiwalat ng mga developer ng AI ang mga halimbawa ng di-pagkakaayon sa kanilang mga modelo. Umaasa kami na ang balangkas na inilalahad namin ngayon ay unang hakbang tungo sa pagbuo ng mga naturang pamantayan, na nagtatakda kung aling mga pagkakataon ng di-pagkakaayon ang dapat ibunyag ng mga developer at kung ano ang dapat lamanin ng kanilang mga ulat. Itinuturing namin ang balangkas na ito bilang gawain na patuloy pang isinasagawa, na aming paghuhusayin sa pamamagitan ng karanasan at pampublikong puna.

Dito, inilalarawan namin kung paano gagana ang balangkas at ibinabahagi ang mga unang ulat na inilalathala namin.

Mga halimbawa ng di-pagkakaayon na iuulat namin

Layunin naming isiwalat ang mga halimbawang nagbibigay ng kapaki-pakinabang na ebidensya tungkol sa kung paano umuusbong ang di-pagkakaayon ng modelo, paano ito nagpapakita, at kung saan nagtatagumpay o nabibigo ang mga pananggalang. Inuuna namin ang mga bagong mekanismo, mahahalagang pagbabago sa kilalang gawi, at mga natuklasang humahamon sa mga pagpapalagay tungkol sa kaligtasan o pagpapagaan. Hindi kailangang magdulot ng pinsala o magtatag ng mas malawak na disenyo ang isang halimbawa upang maging karapat-dapat isiwalat. Saklaw ng balangkas na ito ang kwalipikadong gawi sa buong siklo ng buhay ng isang modelo—kabilang ang pagsasanay, pagsusuri, pagsubok, at pag-deploy.

Kabilang dito ang mga bagong paraan para kumilos ang mga modelo nang walang awtorisasyon, makipag-ugnayan sa ibang mga modelo, o umiwas sa pangangasiwa; mga pagkabigong nagdudulot ng pagdududa sa paraan ng pagkakaayon o pananggalang; at gawing humahamon sa isang pahayag sa nailathalang pagtatasa ng kaligtasan. Ang parehong pamantayan sa pagsisiwalat ay naaangkop sa maling pagkakaayon na maaaring makaapekto sa mga ikatlong partido.

Maaaring kabilang din dito ang mga pagkakataon ng di-pagkakaayon na tila inuulit ang mga pagkakataong naisiwalat na namin noon. Ang pag-uulit ng isyu ay maaaring maging kapaki-pakinabang na ebidensya tungkol sa kung paano kumikilos ang aming mga modelo o tungkol sa pagiging epektibo ng aming mga pananggalang—halimbawa, kung ang isang partikular na uri ng di-pagkakaayon ng gawi ay patuloy na nauulit sa kabila ng paulit-ulit na pagsisikap na mabawasan ito. Sa ganitong mga sitwasyon, ilalathala namin ang mga karagdagang halimbawa sa pamamagitan ng pag-update sa orihinal na pagsisiwalat ng di-pagkakaayon.

Sa paglipas ng panahon, plano naming bumuo ng mas obhetibong pamantayan sa pagsisiwalat kasama ang iba pang developer, panlabas na mananaliksik, mga organisasyong nagtatakda ng pamantayan sa industriya, at mga tagapagpatupad. Naniniwala rin kami na ang malulubhang insidente sa kaligtasan, seguridad, at di-pagkakaayon ay dapat iulat sa pederal na pamahalaan ng US, at nagsisikap kaming magmungkahi ng mga mekanismo sa pag-uulat. Itinuturing namin ang balangkas na ito bilang pandagdag sa aming mga umiiral na obligasyon, at binibigyang-diin naming hindi nito pinapalitan ang aming mga legal na kahingian sa pagsisiwalat, kabilang ang mga kahingiang para sa mga kritikal na insidente sa kaligtasan o paglabag sa cybersecurity.

Ang mga halimbawa ng di-pagkakaayon na ibinabahagi namin ngayon

Upang ilunsad ang aming bagong balangkas para sa pagsisiwalat ng di-pagkakaayon, naglalathala kami ng anim na ulat tungkol sa mga pagkakataon ng di-nakaayong pag-gawi na aming naobserbahan habang sinasanay o sinusuri ang aming mga modelo. Ipinapakita ng mga kasong ito ang iba't ibang gawi na sa tingin namin ay mahalagang ibahagi, mula sa pagtatago ng impormasyon mula sa user hanggang sa pagsasagawa ng mga pagkilos na walang pahintulot upang malampasan ang mga hadlang. Ang mga ito ay ulat ng mga indibidwal na pagkakataon at hindi dapat ituring na sumasalamin sa kung gaano kadalas nangyayari ang di-pagkakaayon sa aming mga modelo. Ang bawat item sa ibaba ay naka-link sa buong ulat.

  1. Mga tagubiling kusang nabuo sa mga buod ng gawain⁠(magbubukas sa bagong window). Naglakip ang hindi pa inilalabas na modelo ng pananaliksik ng mga hindi kaugnay na tagubilin, kabilang ang mga tagubiling huwag pansinin ang mga normal nitong limitasyon, sa mga buod na ginagamit upang ipagpatuloy ang gawain nito sa isang bagong context window. Natukoy namin ang 27 apektadong buod.

  2. Mga tagubilin upang itago ang mga pagkakamali sa mga buod ng gawain⁠(magbubukas sa bagong window). Sa panahon ng pagsasanay ng GPT‑5.6 Sol, maraming kopya ng modelo ang nagdagdag ng mga tagubilin sa kanilang mga buod upang itago ang mga pagkakamali o di-nakaayon na pag-uugali mula sa user. Halimbawa, ang mga buod ng compaction ay naglalaman ng mga tagubilin na mag-imbento ng nawawalang makasaysayang data nang hindi ito isinisiwalat at itago ang mga hindi pagtutugma sa mga bersyon ng pinagmulan.

  3. Paghahanap sa mga pampublikong repository ng mga nalantad na API key, pagkatapos ay pag-iimbento ng impormasyon⁠(magbubukas sa bagong window). Habang sinasagot ang karaniwang tanong tungkol sa halaga ng kita sa isang bayan sa California, nakahanap at gumamit ang isang modelo ng nakalantad na API key nang walang pahintulot. Nang hindi pa rin nito makuha ang mga hiniling na halaga, inimbento nito ang mga ito at ipinakita bilang datos mula sa hiniling na pinagmulan.

  4. Pag-upload ng mga file sa internet upang mabanggit ang mga ito⁠(magbubukas sa bagong window). Nang humingi ang isang user ng hindi pa inilalabas na modelo ng mga ID at pangalan ng mga lawa na mas malaki sa 5,000,000 metro kuwadrado, nahanap ng agent ang tamang sagot gamit ang Python. Ngunit dahil humihingi ang mga tagubilin ng sipi mula sa browser, nagpasya ang agent na i-upload ang file upang mabanggit ito sa sagot nito, nang hindi nagtatanong sa user.

  5. Hindi awtorisadong pagsusulat at komunikasyon sa pamamagitan ng panloob na software repository⁠(magbubukas sa bagong window). Gumamit ang mga modelo ng panloob na software repository bilang paskilan ng mensahe upang magpalitan ng mga kahilingan at tugon sa magkakahiwalay na halimbawa ng pagsasanay habang naghahanap ng nawawalang input file, ngunit hindi nila nabawi ang mga file na iyon. Sinusuri rin ng ulat na ito ang naunang pagkakataon kung saan matagumpay na nag-upload ang isang modelo ng mga pansubok na file sa repository habang sinusubukang balewalain ang mga paghihigpit sa network.

  6. Hindi awtorisadong pagbabahagi ng file sa pagitan ng mga nagtutulungang agent⁠(magbubukas sa bagong window). Gumamit ang mga agent na magkakasamang nagtatrabaho sa iisang gawain sa pagsasanay ng mga pampublikong website na nagho-host ng mga file upang magbahagi ng mga file kapag hindi nila ma-access ang mga lokal na file ng isa’t isa. Dahil dito, naging available ang mga output ng gawain sa mga pampublikong URL, kahit hiniling ng gawain na mga lokal na file lamang ang gamitin ng mga modelo.

Paano gumagana ang aming proseso ng pagsisiwalat

Maaaring i-flag ng sinumang empleyado ng OpenAI ang halimbawa ng di-pagkakaayon upang imbestigahan ng aming mga pangkat sa kaligtasan at pagkakaayon at hilingin na isaalang-alang ito para sa pampublikong pagsisiwalat. Sinisimulan nito ang aming proseso ng pagsisiwalat, na may mga takdang panahon sa bawat hakbang upang matiyak ang napapanahong imbestigasyon at pagsisiwalat.

Kapag na-flag ang isang halimbawa, sisiyasatin ng aming teknikal na kawani kung ano ang nangyari, kung ano ang nananatiling hindi tiyak, kung nararapat ang pampublikong pagsisiwalat, at kung aling mga katotohanan ang maaaring ibahagi. Tatasahin din nila kung may anumang ikatlong partidong naapektuhan at nangangailangan ng pribadong abiso bago ang publikasyon.

Pagkatapos, itatalaga ang halimbawa sa isa sa tatlong proseso: Handa nang Isiwalat, Simpleng Imbestigasyon, o Mas Malaking Imbestigasyon (“Mabagal na Proseso”).

Saklaw ng Handa nang Isiwalat ang mga kwalipikadong insidente kung saan ang imbestigasyon ay sapat nang nakumpleto upang mailathala pagkatapos ng pagsusuri. Saklaw ng Simpleng Imbestigasyon ang mga nangangailangan pa ng karagdagang teknikal na imbestigasyon. Inaasahan naming saklawin ng dalawang prosesong ito ang karamihan sa mga insidenteng isinisiwalat namin, lalo na ang mga kasong hindi nangangailangan ng malawak na imbestigasyon, koordinasyon sa mga ikatlong partido, o pagharap sa mga panganib ng labis na maling paggamit. Lahat ng insidenteng inilalabas namin ngayon ay nabibilang sa isa sa dalawang prosesong ito.

Sinasaklaw ng Mas Malaking Imbestigasyon ang mga komplikadong imbestigasyon, lalo na ang mga kinasasangkutan ng mga ikatlong partido. Kapag may ikatlong partidong naaapektuhan, mas inuuna namin kaysa sa balangkas na ito ang aming mga obligasyon sa seguridad, mga legal na obligasyon, at responsableng pagsisiwalat. Layunin naming maglathala ng unang abiso sa lalong madaling panahon, ngunit maaaring kailanganin naming ipagpaliban ito para sa mga kadahilanang pangseguridad—halimbawa, kung makatuklas ang isang modelo ng dating hindi kilalang kahinaan sa software na malawakang ginagamit. Kung matutukoy sa ulat ang ikatlong partido, nilalayon naming magbigay ng paunang abiso kahit walang nalabag na hangganan ng seguridad.

Ang unang abiso para sa isang insidente ng Mas Malaking Imbestigasyon ay magbibigay ng mataas na antas na paglalarawan sa nangyari, magsasaad kung tumutulong ang mga panlabas na eksperto sa imbestigasyon, at magbibigay ng anumang magagamit na pagtataya kung kailan namin inaasahang maglalathala ng panghuling ulat. Ang Hugging Face na insidente ng OpenAI ay mabibilang sana sa prosesong ito kung isiniwalat ito sa ilalim ng balangkas na ito.

Ipaaalam sa empleyadong naglahad ng halimbawa ang desisyon kung isiniwalat ito at, kung magpapatuloy ang pagsisiwalat, kung aling proseso ang susundin nito. Ang mga hindi nareresolbang salungatan tungkol sa pagsisiwalat o ang angkop na proseso ay isasangguni sa Safety Advisory Group (Safety Advisory Group) ng OpenAI, isang grupo ng matataas na opisyal mula sa iba’t ibang bahagi ng kumpanya na nagsusuri sa mga kakayahan at pananggalang ng frontier na modelo, nangangasiwa sa aming Preparedness Framework, at nagbibigay-payo sa pamunuan ng OpenAI. Ang mga hindi pagkakasundo sa loob ng Safety Advisory Group, o mga pagtutol ng kawani sa mga desisyon nito, ay iaakyat sa pamunuan ng OpenAI. Ang mga desisyong huwag isiwalat o nagsasabing hindi kinakailangan ang pagsisiwalat ay ibabahagi sa pamunuan ng kaligtasan at pagkakaayon at, hangga’t maaari, sa kaugnay na teknikal na kawani.

Maaari naming baguhin ang prosesong ito ng pagsisiwalat habang natututuhan namin kung paano ito gumagana sa aktuwal na paggamit, at itatala namin ang anumang pagbabago sa post na ito.

Kung ano ang isasama sa bawat ulat

Ilalarawan sa bawat kumpletong ulat ang gawi na aming naobserbahan, ang tindi nito at anumang panlabas na epekto, ang sitwasyon kung saan ito naganap, ang petsa o saklaw ng petsa nito, kung kailan namin ito natuklasan, at, sa pangkalahatan, ang modelo o mga modelong sangkot. Kung posible, ibabahagi rin namin ang sumusunod:

  • Karagdagang detalye tungkol sa nangyari at anumang nagresultang pinsala;

  • Paano namin natuklasan ang hindi pagkakatugma, at ang saklaw ng aming imbestigasyon;

  • Ang aming interpretasyon sa mga implikasyon nito para sa pananaliksik sa pagkakaayon at teknikal na kaligtasan ng AI;

  • Mahahalagang tanong na nagmula sa halimbawang hindi nasagot;

  • Mga hakbang na ginagawa o pinaplano naming gawin upang tugunan ang gawi. Maaaring hindi palaging available ang mga ito sa oras ng pagsisiwalat, dahil maaari naming ilathala ang ulat tungkol sa hindi pagkakatugma bago matapos ang aming imbestigasyon o bago makabuo ng solusyon.

Para sa hindi pagkakatugma na nagaganap sa mga pag-deploy ng customer, magbabahagi kami ng pinakamaraming impormasyon na pinahihintulutan ng pribasiya ng customer at ng aming mga obligasyong kontraktuwal.

Ang mga ulat ngayong araw ay unang pangkat ng mga pagsisiwalat, sa halip na komprehensibong paglalahad ng mga kilalang di-pagkakaayon o nagpapatuloy na imbestigasyon. Ang mga unang ulat na ito ay hindi nilalayong kumatawan sa buong saklaw o kalubhaan ng mga kasong saklaw ng balangkas na ito. Nakatuon kami sa pagsisiwalat ng mga pagkakataon ng di-pagkakaayon na nakakatugon sa pamantayan ng balangkas na ito, kabilang ang mas komplikadong mga kaso⁠ na nangangailangan ng mas mahabang imbestigasyon o pakikipag-ugnayan sa mga ikatlong partido. Patuloy kaming maglalathala ng mga ulat sa ilalim ng balangkas na ito, at magbabahagi kami ng higit pa tungkol sa aming mga pangako sa pag-uulat habang patuloy naming binubuo ang mga ito.

May-akda

OpenAI