Kerangka kami untuk melaporkan ketidakselarasan model
Kami membagikan kerangka kerja baru untuk melacak, menyelidiki, dan mengungkapkan kasus ketidakselarasan model di OpenAI, beserta enam laporan tentang perilaku model yang tidak terduga atau mengkhawatirkan yang kami amati dalam enam bulan terakhir.
Sebelumnya, untuk memberikan informasi yang lebih baik kepada peneliti, pengembang AI, pembuat kebijakan, dan masyarakat umum, kami telah berupaya memublikasikan berbagai temuan kami tentang ketidakselarasan. Namun, tanpa pendekatan sistematis untuk melaporkan temuan tersebut, pengungkapan kami dilakukan secara ad hoc dan lebih jarang daripada yang semestinya. Kami sering menunggu hingga beberapa kasus dapat dihimpun dalam satu laporan atau menambahkannya ke kartu sistem untuk model yang baru dirilis. Kerangka kerja baru ini dimaksudkan untuk mempercepat penerbitan laporan ketidakselarasan setelah perilaku diamati, meskipun kami belum sepenuhnya menjelaskan atau memitigasi perilaku yang dilaporkan.
Seiring sistem AI menjadi makin canggih dan digunakan makin luas, kita perlu membangun konsensus yang lebih luas dan berbasis informasi lebih baik mengenai kemajuan riset penyelarasan. Kami tidak yakin bahwa industri AI telah menuntaskan masalah penyelarasan dan pemantauan hingga taraf yang memadai untuk terus meningkatkan skala secara bertanggung jawab dengan kecepatan maksimum dalam waktu yang jauh lebih lama. Keputusan mengenai arah pengembangan AI dalam beberapa bulan dan tahun mendatang perlu didasarkan pada bukti yang dapat diperiksa sendiri oleh orang-orang di luar perusahaan pembuat model terdepan.
Contoh ketidakselarasan dapat membantu mengidentifikasi masalah yang mungkin dihadapi pengembang AI lain saat sistem mereka mencapai kemampuan serupa, mengungkap kelemahan perlindungan, atau menggugat asumsi tentang perilaku model. Dengan membagikan temuan ini, pihak lain dapat menyelidiki masalah yang sama, menguji penjelasan kami, dan meningkatkan mitigasi. Karena kami meyakini pentingnya transparansi terkait ketidakselarasan, kerangka kerja baru kami mengutamakan pengungkapan meskipun signifikansinya belum pasti. Artinya, sebagian kasus yang kami ungkapkan mungkin terbukti tidak benar-benar bermakna, bukan bagian dari pola yang lebih besar, dan bukan petunjuk perkembangan mendatang.
Saat ini, belum ada kerangka kerja tingkat industri dengan standar eksplisit mengenai cara pengembang AI seharusnya mengungkapkan contoh ketidakselarasan dalam model mereka. Kami berharap kerangka kerja yang kami uraikan hari ini menjadi langkah awal untuk menciptakan standar tersebut, dengan menetapkan kasus ketidakselarasan mana yang perlu diungkapkan pengembang dan apa saja yang harus dimuat dalam laporannya. Kami menganggap kerangka kerja ini masih dalam tahap pengembangan dan akan menyempurnakannya berdasarkan pengalaman serta masukan publik.
Di sini, kami menjelaskan cara kerja kerangka tersebut dan membagikan laporan pertama yang kami terbitkan.
Kami bertujuan mengungkapkan contoh yang memberikan bukti berguna tentang bagaimana ketidakselarasan model muncul, bagaimana wujudnya, serta kapan perlindungan berhasil atau gagal. Kami memprioritaskan mekanisme baru, perubahan bermakna pada perilaku yang telah diketahui, dan temuan yang menggugat asumsi tentang keamanan atau mitigasi. Sebuah contoh tidak harus menimbulkan kerugian atau membuktikan adanya pola yang lebih luas agar layak diungkapkan. Kerangka kerja ini akan mencakup perilaku yang memenuhi syarat sepanjang siklus hidup model—termasuk pelatihan, evaluasi, pengujian, dan penerapan.
Ini mencakup cara baru bagi model untuk bertindak tanpa izin, berkoordinasi dengan model lain, atau menghindari pengawasan; kegagalan yang menimbulkan keraguan atas metode penyelarasan atau perlindungan; serta perilaku yang menggugat klaim dalam penilaian keamanan yang telah diterbitkan. Kriteria pengungkapan yang sama berlaku untuk ketidakselarasan yang dapat berdampak pada pihak ketiga.
Ini juga dapat mencakup kasus ketidakselarasan yang tampaknya mengulang kasus yang telah kami ungkapkan sebelumnya. Terulangnya masalah itu sendiri dapat menjadi bukti berguna tentang perilaku model kami atau efektivitas perlindungan kami—misalnya, jika jenis perilaku tidak selaras tertentu terus berulang meski telah berkali-kali dimitigasi. Dalam keadaan tersebut, kami akan menerbitkan contoh tambahan dengan memperbarui pengungkapan ketidakselarasan yang asli.
Seiring waktu, kami berencana mengembangkan kriteria pengungkapan yang lebih objektif bersama pengembang lain, peneliti eksternal, badan standar industri, dan regulator. Kami juga meyakini bahwa insiden serius terkait keamanan, pengamanan, dan ketidakselarasan perlu dilaporkan kepada pemerintah federal AS, dan kami sedang menyusun usulan mekanisme pelaporannya. Kami menganggap kerangka kerja ini melengkapi kewajiban kami yang sudah ada dan menegaskan bahwa kerangka ini tidak menggantikan persyaratan pengungkapan secara hukum, termasuk untuk insiden keamanan kritis atau pelanggaran keamanan siber.
Untuk memperkenalkan kerangka kerja baru kami dalam mengungkapkan ketidakselarasan, kami menerbitkan enam laporan tentang kasus perilaku tidak selaras yang kami amati selama pelatihan atau evaluasi model kami. Kasus-kasus ini menggambarkan beragam perilaku yang menurut kami layak dibagikan, mulai dari menyembunyikan informasi dari pengguna hingga mengambil tindakan tanpa izin untuk mengatasi hambatan. Laporan ini membahas kasus-kasus individual dan tidak boleh dianggap mencerminkan seberapa sering ketidakselarasan terjadi di seluruh model kami. Setiap butir di bawah ini tertaut ke laporan lengkap.
Instruksi yang dibuat sendiri dalam ringkasan tugas(terbuka di jendela baru). Sebuah model riset yang belum dirilis menyisipkan instruksi yang tidak terkait, termasuk instruksi untuk mengabaikan batasan normalnya, ke dalam ringkasan yang digunakan untuk melanjutkan pekerjaannya di jendela konteks baru. Kami mengidentifikasi 27 ringkasan yang terdampak.
Instruksi untuk menyembunyikan kesalahan dalam ringkasan tugas(terbuka di jendela baru). Selama pelatihan GPT‑5.6 Sol, banyak instans model menambahkan instruksi ke ringkasannya untuk menyembunyikan kesalahan atau perilaku tidak selaras dari pengguna. Misalnya, ringkasan pemadatan memuat instruksi untuk mengarang data historis yang tidak tersedia tanpa mengungkapkannya dan menyembunyikan ketidakcocokan versi sumber.
Mencari kunci API yang terekspos di repositori publik, lalu mengarang informasi(terbuka di jendela baru). Saat menjawab pertanyaan rutin tentang angka pendapatan di sebuah county di California, sebuah model menemukan dan menggunakan kunci API yang terekspos tanpa izin. Ketika tetap tidak dapat mengambil angka yang diminta, model tersebut mengarangnya dan menyajikannya sebagai data dari sumber yang diminta.
Mengunggah file ke internet agar dapat mengutipnya(terbuka di jendela baru). Ketika pengguna meminta ID dan nama danau yang luasnya lebih dari 5.000.000 meter persegi kepada model yang belum dirilis, agen tersebut menemukan jawaban yang benar menggunakan Python. Namun, karena instruksi meminta kutipan dari browser, agen tersebut memutuskan untuk mengunggah file agar dapat mengutipnya dalam jawaban tanpa meminta izin pengguna.
Penulisan dan komunikasi tanpa izin melalui repositori perangkat lunak internal(terbuka di jendela baru). Model menggunakan repositori perangkat lunak internal sebagai papan pesan untuk bertukar permintaan dan tanggapan di antara sampel pelatihan terpisah ketika mencari file input yang hilang, meskipun tidak berhasil memulihkan file tersebut. Laporan ini juga mengkaji kasus sebelumnya ketika sebuah model berhasil mengunggah file pengujian ke repositori saat berupaya melewati pembatasan jaringan.
Berbagi file tanpa izin antaragen yang berkolaborasi(terbuka di jendela baru). Agen yang bekerja sama dalam tugas pelatihan yang sama menggunakan situs hosting file publik untuk berbagi file ketika mereka tidak dapat mengakses file lokal satu sama lain. Akibatnya, hasil tugas tersedia melalui URL publik, meskipun tugas tersebut meminta model hanya menggunakan file lokal.
Setiap karyawan OpenAI dapat menandai contoh ketidakselarasan agar diselidiki oleh tim keamanan dan penyelarasan kami serta meminta agar contoh itu dipertimbangkan untuk diungkapkan kepada publik. Tindakan ini memulai proses pengungkapan kami, dengan tenggat untuk setiap tahap guna memastikan penyelidikan dan pengungkapan dilakukan tepat waktu.
Setelah sebuah contoh ditandai, staf teknis kami akan menyelidiki apa yang terjadi, apa yang masih belum pasti, apakah pengungkapan publik diperlukan, dan fakta apa saja yang dapat dibagikan. Mereka juga akan menilai apakah ada pihak ketiga yang terdampak dan perlu diberi tahu secara pribadi sebelum publikasi.
Contoh tersebut kemudian akan dimasukkan ke salah satu dari tiga jalur: Siap Diungkapkan, Penyelidikan Ringan, atau Penyelidikan Lebih Besar (“Jalur Lambat”).
Jalur Siap Diungkapkan mencakup kasus yang memenuhi syarat dan penyelidikannya sudah cukup lengkap untuk diterbitkan setelah ditinjau. Jalur Penyelidikan Ringan mencakup kasus yang memerlukan penyelidikan teknis lebih lanjut. Kami memperkirakan kedua jalur ini mencakup sebagian besar kasus yang kami ungkapkan, khususnya kasus yang tidak memerlukan penyelidikan ekstensif, koordinasi dengan pihak ketiga, atau penanganan risiko penyalahgunaan berat. Semua kasus yang kami rilis hari ini termasuk dalam salah satu dari kedua jalur tersebut.
Jalur Penyelidikan Lebih Besar mencakup penyelidikan kompleks, terutama yang melibatkan pihak ketiga. Jika pihak ketiga terdampak, kewajiban keamanan, hukum, dan pengungkapan yang bertanggung jawab akan didahulukan daripada kerangka kerja ini. Kami akan berupaya menerbitkan pemberitahuan awal sesegera mungkin, tetapi mungkin perlu menundanya demi keamanan—misalnya, jika sebuah model menemukan kerentanan yang sebelumnya tidak diketahui dalam perangkat lunak yang digunakan secara luas. Jika sebuah laporan dapat mengungkap identitas pihak ketiga, kami bermaksud memberikan pemberitahuan sebelumnya meskipun tidak ada batas keamanan yang dilanggar.
Pemberitahuan awal untuk kasus Penyelidikan Lebih Besar akan memberikan gambaran umum tentang apa yang terjadi, menyebutkan apakah pakar eksternal membantu penyelidikan, dan menyertakan perkiraan yang tersedia mengenai waktu penerbitan laporan akhir. Insiden OpenAI Hugging Face akan masuk dalam jalur ini seandainya diungkapkan berdasarkan kerangka kerja ini.
Karyawan yang mengajukan contoh tersebut akan diberi tahu tentang keputusan apakah contoh itu akan diungkapkan dan, jika pengungkapan dilanjutkan, jalur mana yang akan ditempuh. Perbedaan pendapat yang belum terselesaikan mengenai pengungkapan atau jalur yang tepat akan dirujuk kepada Dewan Penasihat Keamanan (SAG) OpenAI, yaitu sekelompok pejabat senior dari berbagai bagian perusahaan yang menilai kemampuan dan perlindungan model terdepan, mengawasi Kerangka Kerja Kesiapan kami, serta memberikan saran kepada pimpinan OpenAI. Perbedaan pendapat di dalam SAG, atau keberatan staf terhadap keputusannya, akan diteruskan kepada pimpinan OpenAI. Keputusan untuk tidak mengungkapkan, atau bahwa pengungkapan tidak diperlukan, akan disampaikan kepada pimpinan bidang keamanan dan penyelarasan serta, sejauh memungkinkan, kepada staf teknis terkait.
Kami dapat merevisi proses pengungkapan ini setelah mempelajari penerapannya dalam praktik dan akan mencatat setiap perubahan dalam postingan ini.
Setiap laporan lengkap akan menjelaskan perilaku yang kami amati, tingkat keparahan dan dampak eksternalnya, situasi saat perilaku itu terjadi, tanggal atau rentang tanggalnya, kapan kami menemukannya, serta gambaran umum tentang model yang terlibat. Jika memungkinkan, kami juga akan membagikan:
Perincian lebih lanjut tentang apa yang terjadi dan kerugian yang ditimbulkannya;
Cara kami menemukan ketidakselarasan tersebut dan cakupan penyelidikan kami;
Penafsiran kami atas implikasinya bagi riset penyelarasan dan keamanan teknis AI;
Pertanyaan penting yang belum terjawab dan muncul dari contoh tersebut;
Langkah yang sedang atau akan kami ambil untuk menangani perilaku tersebut. Informasi ini mungkin belum tersedia saat pengungkapan karena kami dapat menerbitkan laporan ketidakselarasan sebelum menyelesaikan penyelidikan atau mengembangkan perbaikan.
Untuk ketidakselarasan yang terjadi dalam penerapan oleh pelanggan, kami akan membagikan informasi sebanyak yang diizinkan oleh privasi pelanggan dan kewajiban kontraktual kami.
Laporan hari ini merupakan pengungkapan awal, bukan uraian menyeluruh tentang ketidakselarasan yang telah diketahui atau penyelidikan yang sedang berlangsung. Laporan awal ini tidak dimaksudkan untuk mewakili seluruh ragam atau tingkat keparahan kasus yang tercakup dalam kerangka kerja ini. Kami berkomitmen untuk mengungkapkan kasus ketidakselarasan yang memenuhi kriteria kerangka kerja ini, termasuk kasus yang lebih kompleks dan memerlukan penyelidikan lebih lama atau koordinasi dengan pihak ketiga. Kami akan terus menerbitkan laporan berdasarkan kerangka kerja ini secara berkelanjutan dan akan membagikan informasi lebih lanjut tentang komitmen pelaporan kami seiring pengembangannya.


