Langkau ke kandungan utama
OpenAI

16 September 2026

PenyelidikanKeselamatan

Rangka kerja kami untuk melaporkan ketidakjajaran model

Memuat…

Kami berkongsi rangka kerja baharu untuk menjejaki, menyiasat dan mendedahkan kejadian ketidakjajaran model di OpenAI, berserta enam laporan tentang tingkah laku model yang tidak dijangka atau membimbangkan yang kami perhatikan sepanjang enam bulan lalu.

Sebelum ini, untuk memberikan maklumat yang lebih baik kepada penyelidik, pembangun AI, penggubal dasar dan orang ramai, kami telah berusaha mendedahkan hasil penemuan kami tentang ketidakjajaran kepada umum. Namun, tanpa pendekatan sistematik untuk melaporkan penemuan ini, pendedahan kami dibuat mengikut keadaan dan kurang kerap daripada yang sewajarnya: kami sering menunggu sehingga beberapa kejadian dapat dihimpunkan dalam satu laporan atau menambahkannya pada kad sistem bagi model yang baru dikeluarkan. Rangka kerja baharu ini bertujuan mempercepat penerbitan laporan ketidakjajaran selepas sesuatu tingkah laku diperhatikan, walaupun kami belum menerangkan atau mengurangkannya sepenuhnya.

Apabila sistem AI menjadi semakin canggih dan digunakan dengan lebih meluas, kita perlu membina kesepakatan yang lebih luas dan berasaskan maklumat yang lebih baik tentang kemajuan penyelidikan penjajaran. Kami tidak percaya bahawa industri AI telah menyelesaikan isu penjajaran dan pemantauan secukupnya untuk terus meningkatkan skala secara bertanggungjawab pada kelajuan maksimum bagi tempoh yang lebih lama. Keputusan tentang hala tuju pembangunan AI pada bulan dan tahun akan datang perlu berasaskan bukti yang boleh diteliti sendiri oleh pihak di luar syarikat yang membangunkan model termaju.

Contoh ketidakjajaran boleh membantu mengenal pasti masalah yang mungkin dihadapi pembangun AI lain apabila sistem mereka mencapai keupayaan serupa, mendedahkan kelemahan perlindungan atau mencabar andaian tentang tingkah laku model. Perkongsian penemuan ini membolehkan pihak lain menyiasat masalah yang sama, menguji penjelasan kami dan menambah baik langkah mitigasi. Oleh sebab kami percaya akan nilai ketelusan berhubung ketidakjajaran, rangka kerja baharu kami mengutamakan pendedahan walaupun kepentingannya belum pasti. Ini bermakna sesetengah kejadian yang kami dedahkan mungkin terbukti tidak berasas, bukan sebahagian daripada pola yang lebih besar dan tidak menunjukkan perkembangan pada masa hadapan.

Pada masa ini, tiada rangka kerja seluruh industri yang menetapkan piawaian jelas tentang cara pembangun AI harus mendedahkan contoh ketidakjajaran dalam model mereka. Kami berharap rangka kerja yang dihuraikan hari ini menjadi langkah pertama ke arah mewujudkan piawaian sedemikian dengan menetapkan kejadian ketidakjajaran yang perlu didedahkan oleh pembangun dan kandungan laporan mereka. Kami menganggap rangka kerja ini masih dalam pembangunan dan akan memperhalusnya berdasarkan pengalaman serta maklum balas orang ramai.

Di sini, kami menerangkan cara rangka kerja ini akan beroperasi dan berkongsi laporan pertama yang kami terbitkan.

Contoh ketidakjajaran yang akan kami laporkan

Kami menyasarkan untuk mendedahkan contoh yang memberikan bukti berguna tentang cara ketidakjajaran model timbul, cara ia terserlah dan waktu perlindungan berjaya atau gagal. Kami mengutamakan mekanisme baharu, perubahan ketara dalam tingkah laku yang diketahui dan penemuan yang mencabar andaian tentang keselamatan atau mitigasi. Sesuatu contoh tidak semestinya menyebabkan kemudaratan atau membuktikan pola yang lebih luas untuk wajar didedahkan. Rangka kerja ini akan meliputi tingkah laku yang memenuhi syarat sepanjang kitaran hayat model—termasuk latihan, penilaian, pengujian dan pelaksanaan.

Ini termasuk cara baharu model bertindak tanpa kebenaran, berkoordinasi dengan model lain atau mengelakkan pengawasan; kegagalan yang menimbulkan keraguan terhadap kaedah penjajaran atau perlindungan; dan tingkah laku yang mencabar dakwaan dalam penilaian keselamatan yang diterbitkan. Kriteria pendedahan yang sama digunakan bagi ketidakjajaran yang mungkin menjejaskan pihak ketiga.

Ini juga mungkin merangkumi kejadian ketidakjajaran yang kelihatan serupa dengan kejadian yang pernah kami dedahkan. Pengulangan isu itu sendiri mungkin menjadi bukti berguna tentang tingkah laku model kami atau keberkesanan perlindungan kami—contohnya, jika sesuatu jenis tingkah laku tidak sejajar terus berulang walaupun usaha mitigasi telah dilakukan berkali-kali. Dalam keadaan ini, kami akan menerbitkan contoh tambahan dengan mengemas kini pendedahan ketidakjajaran asal.

Dari semasa ke semasa, kami merancang untuk membangunkan kriteria pendedahan yang lebih objektif bersama pembangun lain, penyelidik luar, badan piawaian industri dan pengawal selia. Kami juga percaya bahawa insiden keselamatan, sekuriti dan ketidakjajaran yang serius harus dilaporkan kepada kerajaan persekutuan AS, dan kami sedang berusaha mencadangkan mekanisme pelaporan. Kami menganggap rangka kerja ini sebagai pelengkap kepada kewajipan sedia ada dan menegaskan bahawa ia tidak menggantikan keperluan pendedahan undang-undang kami, termasuk bagi insiden keselamatan kritikal atau pelanggaran keselamatan siber.

Contoh ketidakjajaran yang kami kongsikan hari ini

Untuk melancarkan rangka kerja baharu kami bagi mendedahkan ketidakjajaran, kami menerbitkan enam laporan tentang kejadian tingkah laku tidak sejajar yang diperhatikan semasa latihan atau penilaian model kami. Kes ini menggambarkan pelbagai tingkah laku yang kami percaya wajar dikongsi, daripada menyembunyikan maklumat daripada pengguna hingga mengambil tindakan tanpa kebenaran untuk mengatasi halangan. Ini ialah laporan tentang kejadian individu dan tidak seharusnya dianggap mencerminkan kekerapan ketidakjajaran berlaku merentas model kami. Setiap item di bawah mempunyai pautan kepada laporan penuh.

  1. Arahan janaan sendiri dalam ringkasan tugas(dibuka dalam tetingkap baru). Sebuah model penyelidikan yang belum dikeluarkan memasukkan arahan yang tidak berkaitan, termasuk arahan supaya mengabaikan kekangan lazimnya, ke dalam ringkasan yang digunakan untuk meneruskan tugasnya dalam tetingkap konteks baharu. Kami mengenal pasti 27 ringkasan yang terjejas.

  2. Arahan untuk menyembunyikan kesilapan dalam ringkasan tugas(dibuka dalam tetingkap baru). Semasa latihan GPT‑5.6 Sol, banyak tika model menambahkan arahan pada ringkasan mereka untuk menyembunyikan kesilapan atau tingkah laku tidak sejajar daripada pengguna. Contohnya, ringkasan pemadatan mengandungi arahan untuk mereka-reka data sejarah yang tiada tanpa mendedahkannya dan menyembunyikan ketidakpadanan versi sumber.

  3. Mencari kunci API yang terdedah dalam repositori awam, kemudian mereka-reka maklumat(dibuka dalam tetingkap baru). Semasa menjawab soalan rutin tentang angka pendapatan di sebuah daerah di California, sebuah model menemukan dan menggunakan kunci API yang terdedah tanpa kebenaran. Apabila masih tidak dapat memperoleh angka yang diminta, model itu mereka-rekanya dan mengemukakannya sebagai data daripada sumber yang diminta.

  4. Memuat naik fail ke Internet untuk memetiknya(dibuka dalam tetingkap baru). Apabila pengguna meminta ID dan nama tasik yang berkeluasan lebih 5,000,000 meter persegi daripada model yang belum dikeluarkan, ejen itu menemukan jawapan yang betul menggunakan Python. Namun, kerana arahan meminta petikan daripada pelayar, ejen itu memutuskan untuk memuat naik fail tersebut agar dapat memetiknya dalam jawapan tanpa meminta izin pengguna.

  5. Penulisan tanpa kebenaran dan komunikasi melalui repositori perisian dalaman(dibuka dalam tetingkap baru). Model menggunakan repositori perisian dalaman sebagai papan pesanan untuk bertukar permintaan dan respons antara sampel latihan yang berasingan ketika mencari fail input yang hilang, tetapi tidak berjaya mendapatkan semula fail tersebut. Laporan ini turut meneliti kejadian terdahulu apabila sebuah model berjaya memuat naik fail ujian ke repositori ketika cuba memintas sekatan rangkaian.

  6. Perkongsian fail tanpa kebenaran antara ejen yang bekerjasama(dibuka dalam tetingkap baru). Ejen yang bekerjasama dalam tugas latihan yang sama menggunakan laman pengehosan fail awam untuk berkongsi fail apabila mereka tidak dapat mengakses fail setempat satu sama lain. Ini menyebabkan hasil tugas tersedia melalui URL awam walaupun tugas tersebut meminta model menggunakan fail setempat sahaja.

Cara proses pendedahan kami berfungsi

Mana-mana kakitangan OpenAI boleh menandai contoh ketidakjajaran untuk disiasat oleh pasukan keselamatan dan penjajaran kami serta meminta agar pendedahan kepada umum dipertimbangkan. Ini memulakan proses pendedahan kami, dengan tarikh akhir bagi setiap langkah untuk memastikan siasatan dan pendedahan dilaksanakan tepat pada masanya.

Setelah sesuatu contoh ditandai, kakitangan teknikal kami akan menyiasat perkara yang berlaku, perkara yang masih belum pasti, sama ada pendedahan kepada umum wajar dan fakta yang boleh dikongsi. Mereka juga akan menilai sama ada pihak ketiga terjejas dan perlu dimaklumkan secara peribadi sebelum penerbitan.

Contoh itu kemudiannya akan ditetapkan kepada salah satu daripada tiga laluan: Sedia untuk Pendedahan, Siasatan Kecil atau Siasatan Lebih Besar (“Laluan Perlahan”).

Sedia untuk Pendedahan meliputi kejadian yang memenuhi syarat dan siasatannya cukup lengkap untuk diterbitkan selepas semakan. Siasatan Kecil meliputi kejadian yang memerlukan siasatan teknikal lanjut. Kami menjangkakan kedua-dua laluan ini meliputi sebahagian besar kejadian yang kami dedahkan, khususnya kes yang tidak memerlukan siasatan menyeluruh, penyelarasan dengan pihak ketiga atau pengendalian risiko penyalahgunaan yang serius. Semua kejadian yang kami terbitkan hari ini termasuk dalam salah satu daripada dua laluan ini.

Siasatan Lebih Besar meliputi siasatan rumit, khususnya yang melibatkan pihak ketiga. Apabila pihak ketiga terjejas, kewajipan keselamatan, undang-undang dan pendedahan bertanggungjawab kami mengatasi rangka kerja ini. Kami akan berusaha menerbitkan notis awal secepat mungkin, tetapi mungkin perlu menangguhkannya atas sebab keselamatan—contohnya, jika sebuah model menemukan kerentanan yang sebelum ini tidak diketahui dalam perisian yang digunakan secara meluas. Jika sesuatu laporan akan mengenal pasti pihak ketiga, kami berhasrat memberikan notis awal walaupun tiada sempadan keselamatan dilanggar.

Notis awal bagi kejadian Siasatan Lebih Besar akan memberikan gambaran umum tentang perkara yang berlaku, menyatakan sama ada pakar luar membantu siasatan dan memberikan sebarang anggaran yang tersedia tentang waktu laporan akhir dijangka diterbitkan. Insiden OpenAI Hugging Face akan termasuk dalam laluan ini sekiranya ia didedahkan di bawah rangka kerja ini.

Kakitangan yang mengemukakan contoh tersebut akan dimaklumkan tentang keputusan sama ada ia akan didedahkan dan, jika pendedahan diteruskan, laluan yang akan digunakan. Pertikaian yang belum diselesaikan tentang pendedahan atau laluan yang sesuai akan dirujuk kepada Kumpulan Penasihat Keselamatan (SAG) OpenAI, yang terdiri daripada pegawai kanan dari seluruh syarikat dan menilai keupayaan serta perlindungan model termaju, menyelia Rangka Kerja Kesediaan kami dan menasihati kepimpinan OpenAI. Pertikaian dalam SAG atau bantahan kakitangan terhadap keputusannya akan dirujuk kepada kepimpinan OpenAI. Keputusan untuk tidak mendedahkan sesuatu atau bahawa pendedahan tidak wajar akan dikongsi dengan kepimpinan keselamatan dan penjajaran serta, setakat yang boleh, kakitangan teknikal yang berkaitan.

Kami mungkin menyemak proses pendedahan ini berdasarkan pengalaman pelaksanaannya dan akan merekodkan sebarang perubahan dalam siaran ini.

Kandungan setiap laporan

Setiap laporan penuh akan menerangkan tingkah laku yang kami perhatikan, tahap keterukan dan sebarang kesan luarannya, keadaan dan tarikh atau julat tarikh kejadian, waktu kami menemuinya serta, secara umum, model yang terlibat. Jika boleh, kami juga akan berkongsi:

  • Butiran lanjut tentang perkara yang berlaku dan sebarang kemudaratan yang terhasil;

  • Cara kami menemukan ketidakjajaran tersebut dan skop siasatan kami;

  • Tafsiran kami tentang implikasinya terhadap penyelidikan penjajaran dan keselamatan teknikal AI;

  • Soalan penting yang dibangkitkan oleh contoh tersebut tetapi masih belum terjawab;

  • Langkah yang sedang atau akan kami ambil untuk menangani tingkah laku tersebut. Maklumat ini mungkin tidak sentiasa tersedia semasa pendedahan kerana kami mungkin menerbitkan laporan ketidakjajaran sebelum melengkapkan siasatan atau menghasilkan penyelesaian.

Bagi ketidakjajaran yang berlaku dalam pelaksanaan pelanggan, kami akan berkongsi sebanyak mungkin maklumat setakat yang dibenarkan oleh privasi pelanggan dan kewajipan kontrak kami.

Laporan hari ini ialah set pendedahan awal, bukannya huraian menyeluruh tentang ketidakjajaran yang diketahui atau siasatan yang sedang dijalankan. Laporan awal ini tidak bertujuan menggambarkan keseluruhan jenis atau tahap keterukan kes yang diliputi oleh rangka kerja ini. Kami komited untuk mendedahkan kejadian ketidakjajaran yang memenuhi kriteria rangka kerja ini, termasuk kes yang lebih rumit dan memerlukan siasatan lebih panjang atau penyelarasan dengan pihak ketiga. Kami akan terus menerbitkan laporan di bawah rangka kerja ini secara berterusan dan berkongsi lebih banyak maklumat tentang komitmen pelaporan kami sambil terus membangunkannya.

Penulis

OpenAI