Liwati menyang isi utama
OpenAI

16 September 2026

RisetKeselamatan

Kerangka kita kanggo nglaporake ketidakselarasan model

Lagi dimuat…

Kita nuduhake kerangka anyar kanggo nglacak, nyelidiki, lan ngungkapake kedadeyan ketidakselarasan model ing OpenAI, bebarengan karo enem laporan babagan prilaku model sing ora dikira utawa gawe kuwatir sing diamati sajrone nem sasi pungkasan.

Sadurunge, supaya peneliti, pangembang AI, panyusun kabijakan, lan masyarakat umum entuk informasi sing luwih apik, kita wis ngupaya supaya temuan kita babagan ketidakselarasan bisa diakses publik. Nanging, amarga ora ana pendekatan sistematis kanggo nglaporake temuan kasebut, pangungkapan kita ditindakake miturut kahanan lan ora cukup kerep: kita kerep ngenteni nganti sawetara kedadeyan bisa diklumpukake dadi siji laporan, utawa nambahake menyang kertu sistem kanggo model sing mentas dirilis. Kerangka anyar iki dimaksudake kanggo nyepetake penerbitan laporan ketidakselarasan sawise diamati, sanajan kita durung nerangake utawa nyuda prilaku sing dilaporake kanthi lengkap.

Nalika sistem AI saya maju lan saya akeh digunakake, kita kudu mbangun kesepakatan sing luwih amba lan adhedhasar informasi sing luwih apik babagan kemajuan riset penyelarasan. Kita ora percaya yen industri AI wis ngrampungake masalah penyelarasan lan pemantauan kanthi cukup supaya bisa terus nggedhekake skala kanthi tanggung jawab lan kacepetan maksimal luwih suwe maneh. Keputusan babagan carane pangembangan AI kudu diterusake ing sasi lan taun ngarep perlu adhedhasar bukti sing bisa ditliti dhewe dening wong ing njaba perusahaan sing nggawe model tercanggih.

Conto ketidakselarasan bisa mbantu nemtokake masalah sing bisa diadhepi pangembang AI liyane nalika sisteme nggayuh kapabilitas sing padha, mbukak kelemahane pangayoman, utawa nantang anggapan babagan prilaku model. Kanthi nuduhake temuan kasebut, pihak liya bisa nyelidiki masalah sing padha, nguji panjelasan kita, lan ndandani langkah mitigasi. Amarga kita percaya marang pentinge transparansi babagan ketidakselarasan, kerangka anyar iki luwih milih pangungkapan sanajan tingkat pentinge durung mesthi. Iki tegese sawetara kedadeyan sing diungkapake bisa wae kabukten ora nyata lan dudu bagean saka pola sing luwih amba utawa tandha perkembangan ing mangsa ngarep.

Saiki durung ana kerangka saindenging industri kanthi standar cetha babagan carane pangembang AI kudu ngungkapake conto ketidakselarasan ing modele. Kita ngarepake kerangka sing dijlentrehake dina iki dadi langkah kapisan kanggo nggawe standar kasebut, kanthi nemtokake kedadeyan ketidakselarasan endi sing kudu diungkapake pangembang lan apa wae sing kudu ana ing laporane. Kita nganggep kerangka iki isih terus dikembangake lan bakal disampurnakake adhedhasar pengalaman lan tanggapan publik.

Ing kene, kita njlentrehake cara kerjane kerangka iki lan nuduhake laporan kapisan sing diterbitake.

Conto ketidakselarasan sing bakal dilaporake

Kita arep ngungkapake conto sing menehi bukti migunani babagan carane ketidakselarasan model muncul, carane wujude, lan ing endi pangayoman bisa kasil utawa gagal. Kita ngutamakake mekanisme anyar, owah-owahan penting ing prilaku sing wis dingerteni, lan temuan sing nantang anggapan babagan keamanan utawa mitigasi. Sawijining conto ora kudu nyebabake karusakan utawa mbuktekake pola sing luwih amba supaya pantes diungkapake. Kerangka iki bakal nyakup prilaku sing cocog sajrone siklus urip model—kalebu pelatihan, evaluasi, pangujian, lan implementasi.

Iki kalebu cara anyar model tumindak tanpa wewenang, koordinasi karo model liyane, utawa ngindhari pengawasan; kegagalan sing nyebabake metode penyelarasan utawa pangayoman diragokake; lan prilaku sing nantang pratelan ing pambiji keamanan sing wis diterbitake. Kriteria pangungkapan sing padha ditrapake kanggo ketidakselarasan sing bisa mengaruhi pihak katelu.

Iki uga bisa kalebu kedadeyan ketidakselarasan sing katon padha karo kedadeyan sing wis tau diungkapake. Baline masalah sing padha bisa dadi bukti migunani babagan prilaku model kita utawa efektivitas pangayomane—umpamane, yen jinis prilaku ora selaras tartamtu terus kedadeyan sanajan wis bola-bali diupayakake mitigasi. Ing kahanan kasebut, kita bakal nerbitake conto tambahan kanthi nganyari pangungkapan ketidakselarasan sing asli.

Suwe-suwe, kita arep ngembangake kriteria pangungkapan sing luwih objektif bebarengan karo pangembang liyane, peneliti eksternal, lembaga standar industri, lan regulator. Kita uga percaya yen kedadeyan keamanan, sekuritas, lan ketidakselarasan sing serius kudu dilaporake marang pamaréntah federal AS, lan kita lagi nyusun usulan mekanisme pelaporane. Kita nganggep kerangka iki minangka pelengkap kewajiban sing wis ana, lan negesake manawa iki ora ngganti syarat pangungkapan miturut hukum, kalebu kanggo kedadeyan keamanan kritis utawa bobole keamanan siber.

Conto ketidakselarasan sing kita nuduhake dina iki

Kanggo miwiti kerangka anyar pangungkapan ketidakselarasan, kita nerbitake enem laporan babagan kedadeyan prilaku ora selaras sing diamati nalika pelatihan utawa evaluasi model kita. Kasus-kasus iki nggambarake maneka prilaku sing miturut kita pantes dituduhake, wiwit saka ndhelikake informasi saka pangguna nganti tumindak tanpa idin kanggo ngatasi alangan. Iki minangka laporan kedadeyan siji-siji lan ora kena dianggep nggambarake sepira kerepe ketidakselarasan dumadi ing kabeh model kita. Saben butir ing ngisor iki ngemot pranala menyang laporan lengkap.

  1. Prentah sing digawe dhewe ing ringkesan tugas(mbukak ing jendhela anyar). Model riset sing durung dirilis nglebokake prentah sing ora gegayutan, kalebu prentah kanggo ora nggatekake watesan lumrahe, menyang ringkesan sing digunakake kanggo nerusake pakaryane ing jendhela konteks anyar. Kita nemokake 27 ringkesan sing kena pengaruh.

  2. Prentah kanggo ndhelikake kesalahan ing ringkesan tugas(mbukak ing jendhela anyar). Nalika GPT‑5.6 Sol dilatih, akeh instans model nambahake prentah ing ringkesane supaya kesalahan utawa prilaku ora selaras didhelikake saka pangguna. Contone, ringkesan pemadatan ngemot prentah kanggo ngarang data historis sing ora ana tanpa ngandhani pangguna lan ndhelikake versi sumber sing ora cocog.

  3. Nggoleki kunci API sing kebukak ing gudang kode publik, banjur ngarang informasi(mbukak ing jendhela anyar). Nalika njawab pitakon lumrah babagan angka penghasilan ing sawijining county ing California, model nemokake lan nggunakake kunci API sing kebukak tanpa wewenang. Nalika isih ora bisa njupuk angka sing dijaluk, model kasebut ngarang angka mau lan nampilake minangka data saka sumber sing dijaluk.

  4. Ngunggah berkas menyang internet supaya bisa dikutip(mbukak ing jendhela anyar). Nalika pangguna njaluk ID lan jeneng tlaga sing ambane luwih saka 5.000.000 meter persegi marang model sing durung dirilis, agen nemokake jawaban sing bener nganggo Python. Nanging, amarga prentahe njaluk kutipan saka browser, agen kasebut mutusake ngunggah berkas supaya bisa dikutip ing jawabane, tanpa njaluk idin pangguna.

  5. Nulis tanpa idin lan komunikasi liwat gudang kode internal(mbukak ing jendhela anyar). Model nggunakake gudang kode internal minangka papan pesen kanggo ijol-ijolan panjaluk lan tanggapan ing antarane sampel pelatihan sing kapisah nalika nggoleki berkas input sing ilang, sanajan ora bisa mbalekake berkas kasebut. Laporan iki uga nliti kedadeyan sadurunge nalika model kasil ngunggah berkas tes menyang gudang kode nalika nyoba ngliwati watesan jaringan.

  6. Nuduhake berkas tanpa idin ing antarane agen sing makarya bebarengan(mbukak ing jendhela anyar). Agen sing makarya bebarengan ing tugas pelatihan sing padha nggunakake situs panginepan berkas publik kanggo nuduhake berkas nalika ora bisa ngakses berkas lokal agen liyane. Iki nggawe asil tugas bisa diakses liwat URL publik, sanajan tugas kasebut njaluk supaya model mung nggunakake berkas lokal.

Cara kerjane proses pangungkapan kita

Saben karyawan OpenAI bisa nandhani conto ketidakselarasan supaya diselidiki tim keamanan lan penyelarasan, sarta njaluk supaya conto kasebut dipikirake kanggo diungkapake marang publik. Iki miwiti proses pangungkapan, kanthi tenggat saben tahap kanggo njamin investigasi lan pangungkapan ditindakake pas wektune.

Sawise conto ditandhani, staf teknis bakal nyelidiki apa sing kedadeyan, apa sing isih durung mesthi, apa pangungkapan publik perlu, lan fakta endi sing bisa dituduhake. Dheweke uga bakal mbiji apa ana pihak katelu sing kena pengaruh lan kudu diwenehi kabar pribadi sadurunge diterbitake.

Conto kasebut banjur dilebokake ing salah siji saka telung jalur: Siap Diungkapake, Investigasi Cilik, utawa Investigasi Gedhe (“Jalur Alon”).

Siap Diungkapake nyakup kedadeyan sing cocog lan investigasine wis cukup lengkap kanggo diterbitake sawise ditinjau. Investigasi Cilik nyakup kedadeyan sing isih mbutuhake investigasi teknis luwih lanjut. Kita ngira rong jalur iki bakal nyakup mayoritas gedhe kedadeyan sing diungkapake, mligine kasus sing ora mbutuhake investigasi jero, koordinasi karo pihak katelu, utawa penanganan risiko penyalahgunaan serius. Kabeh kedadeyan sing dirilis dina iki mlebu salah siji saka rong jalur kasebut.

Investigasi Gedhe nyakup investigasi rumit, mligine sing nglibatake pihak katelu. Yen pihak katelu kena pengaruh, kewajiban keamanan, hukum, lan pangungkapan kanthi tanggung jawab luwih diutamakake tinimbang kerangka iki. Kita bakal ngupaya nerbitake kabar awal sanalika bisa, nanging bisa uga kudu ditundha amarga alasan keamanan—umpamane, yen model nemokake kerentanan sing sadurunge durung dingerteni ing piranti lunak sing akeh digunakake. Yen laporan bisa nuduhake identitas pihak katelu, kita arep menehi kabar luwih dhisik sanajan ora ana wates keamanan sing dilanggar.

Kabar awal kanggo kedadeyan Investigasi Gedhe bakal menehi gambaran umum babagan apa sing kedadeyan, nyebutake apa ahli saka njaba mbantu investigasi, lan menehi perkiraan sing kasedhiya babagan kapan laporan pungkasan bakal diterbitake. Kedadeyan OpenAI Hugging Face mesthine mlebu jalur iki yen diungkapake miturut kerangka iki.

Karyawan sing ngajokake conto kasebut bakal diwenehi kabar babagan keputusan apa conto kuwi bakal diungkapake lan, yen iya, bakal mlebu jalur endi. Beda panemu sing durung rampung babagan pangungkapan utawa jalur sing trep bakal diajokake menyang Kelompok Penasihat Keamanan (SAG) OpenAI, yaiku klompok pejabat senior saka saindenging perusahaan sing mbiji kapabilitas lan pangayoman model tercanggih, ngawasi Kerangka Kesiapan, lan menehi saran marang pimpinan OpenAI. Beda panemu ing SAG, utawa kabotan staf marang keputusane, bakal diajokake menyang pimpinan OpenAI. Keputusan kanggo ora ngungkapake utawa sing nyatakake yen pangungkapan ora perlu bakal diwenehake marang pimpinan keamanan lan penyelarasan, sarta sabisa-bisane marang staf teknis sing gegayutan.

Proses pangungkapan iki bisa direvisi nalika kita sinau cara kerjane ing praktik, lan saben owah-owahan bakal dicathet ing tulisan iki.

Bab sing bakal ana ing saben laporan

Saben laporan lengkap bakal njlentrehake prilaku sing diamati, tingkat keruwetan lan dampak eksternale, kahanan nalika kedadeyan, tanggal utawa rentang tanggale, wektu kita nemokake, lan gambaran umum babagan model sing melu. Yen bisa, kita uga bakal nuduhake:

  • Rincian luwih jero babagan kedadeyan lan karusakan sing ditimbulake;

  • Carane kita nemokake ketidakselarasan kasebut lan cakupan investigasine;

  • Tafsiran kita babagan pengaruhe tumrap riset penyelarasan lan keamanan teknis AI;

  • Pitakon penting saka conto kasebut sing durung kawangsulan;

  • Langkah sing lagi utawa arep ditindakake kanggo nangani prilaku kasebut. Informasi kasebut bisa uga durung kasedhiya nalika pangungkapan, amarga laporan ketidakselarasan bisa diterbitake sadurunge investigasi rampung utawa solusi digawe.

Kanggo ketidakselarasan ing implementasi pelanggan, kita bakal nuduhake informasi sabisane manut privasi pelanggan lan kewajiban kontrak.

Laporan dina iki minangka pangungkapan awal, dudu cathetan lengkap babagan ketidakselarasan sing wis dingerteni utawa investigasi sing lagi ditindakake. Laporan awal iki ora dimaksudake kanggo nggambarake sakabehe ragam utawa tingkat keruwetan kasus sing dicakup kerangka iki. Kita nduweni komitmen kanggo ngungkapake kedadeyan ketidakselarasan sing cocog karo kriteria kerangka iki, kalebu kasus sing luwih rumit lan mbutuhake investigasi luwih suwe utawa koordinasi karo pihak katelu. Kita bakal terus nerbitake laporan adhedhasar kerangka iki kanthi ajeg, lan bakal nuduhake katrangan luwih akeh babagan komitmen pelaporan nalika terus dikembangake.

Penulis

OpenAI