Menuju argumentasi keselamatan untuk pelatihan AI terdepan
Kami meyakini bahwa kita sedang memasuki era baru ketika dokumentasi keselamatan terstruktur perlu diwajibkan sebelum melanjutkan setiap proses pelatihan reinforcement learning untuk model terdepan. Idealnya, dokumentasi tersebut memenuhi standar “argumentasi keselamatan”—argumen tentang risiko yang komprehensif, terstruktur, dan berbasis bukti, sebagaimana digunakan di industri lain yang sangat mengutamakan keselamatan. Kami menjadikan argumentasi keselamatan sebagai sasaran ideal yang terus kami upayakan. Namun, kami juga menyadari tantangan untuk menerapkannya pada model AI dengan ketelitian yang setara dengan industri penerbangan atau tenaga nuklir, karena kompleksitas yang muncul pada setiap tingkat kemampuan AI yang baru. Kami sedang menyusun kerangka kerja untuk membakukan praktik-praktik ini.
Berikut beberapa pedoman awal yang menurut kami perlu menjadi bagian dari argumentasi keselamatan untuk pelatihan AI terdepan. Praktik terbaik ini mencerminkan pembelajaran kami sejauh ini. Kami memperkirakan praktik ini akan berkembang seiring upaya kami menyempurnakan proses internal untuk pengembangan yang penuh kehati-hatian. Kami membagikannya sekarang untuk menyampaikan pemikiran kami saat ini secara transparan dan mengundang masukan dari komunitas. Perlu dicatat bahwa dokumen ini berfokus pada pelatihan reinforcement learning untuk model terdepan; penerapan internal dan eksternal memerlukan pertimbangan atas aspek keselarasan yang jauh lebih luas.
Argumentasi keselamatan perlu mencakup tiga aspek sistem teknis: pelatihan keselarasan, pembatasan, dan pemantauan. Langkah pengamanan ini membantu memastikan model tidak mencoba melakukan tindakan yang tidak selaras. Kalaupun model mencobanya, langkah ini akan mempersulit model menembus pembatasan dan memungkinkan pemantauan mendeteksinya sebelum menimbulkan bahaya.
Keselarasan model: Pertahanan pertama adalah melatih model agar selaras, yakni agar dapat diandalkan untuk bertindak sesuai dengan maksud kita. Ini dapat mencakup:
Lingkungan pelatihan dan penilaian: Kurangi risiko munculnya perilaku yang tidak selaras pada model dengan mencegah penguatan positif atas manipulasi imbalan selama pelatihan. Ini dapat mencakup:
Peninjauan otomatis set data: Gunakan agen untuk menemukan dan memperbaiki lingkungan RL yang bermasalah, yang dapat memungkinkan rangkaian tindakan tidak selaras memperoleh imbalan tinggi melalui eksploitasi celah, bukan perilaku yang dimaksudkan. Ini akan mengurangi peluang diperkuatnya ketidakselarasan selama pelatihan.
Peninjauan manual set data: Lengkapi red teaming otomatis dengan peninjauan manual dan pemeriksaan kualitas set data untuk mengidentifikasi tugas bermasalah yang tanpa sengaja dapat memperkuat perilaku yang tidak selaras.
Penyetelan sistem penilai: Setel sistem penilai agar memberi penalti atas upaya model mengeksploitasi celah atau meretas lingkungan RL selama pelatihan.
Analisis proses pelatihan sebelumnya: Jalankan pengklasifikasi pada rekaman aktivitas eksperimen sebelumnya untuk memastikan sistem penilai bekerja sebagaimana mestinya.
Pengukuran keselarasan: Jalankan evaluasi yang melacak kecenderungan ketidakselarasan model untuk mengukur efektivitas pelatihan keselarasan. Ini dapat mencakup:
Evaluasi keselarasan luring: Jalankan evaluasi keselarasan selama proses pelatihan model terdepan untuk menilai apakah pelatihan berjalan sebagaimana mestinya, dan selidiki setiap penurunan yang berarti.
Pengujian retrospektif: Uji evaluasi keselarasan terhadap insiden sebelumnya untuk memastikan evaluasi dapat mendeteksi model yang sebelumnya tidak selaras dan tidak terlalu disesuaikan dengan insiden tertentu.
Pelacakan manipulasi evaluasi: Lacak kesadaran evaluasi atau metagaming (model menyadari bahwa dirinya sedang diuji) yang dapat memicu perubahan perilaku, dengan ambang pemblokiran yang spesifik. Misalnya, aktifkan pemantau kesadaran evaluasi dan metagaming pada evaluasi keselarasan.
Uji stres skenario terburuk: Pancing perilaku buruk dalam skenario terburuk dan pastikan setidaknya satu evaluasi dapat mendeteksinya.
Cegah pelatihan berbasis rantai pemikiran: Jangan biarkan sistem penilai otomatis melihat rantai pemikiran dalam reinforcement learning agar model tidak berkembang menjadi mampu mengelabui pemantau rantai pemikiran.
Pembatasan: Jika model menjadi tidak selaras, pastikan isolasi sandbox dan keamanan cukup kuat untuk mencegah tindakan berbahaya. Ini dapat mencakup:
Keamanan infrastruktur berlapis: Curahkan sumber daya yang besar untuk memperkuat keamanan sandbox tempat model berjalan serta infrastruktur riset yang menampungnya, guna memastikan adanya lapisan perlindungan tambahan jika model berhasil keluar dari sandbox.
Red teaming pembatasan: Tingkatkan keamanan sandbox, infrastruktur riset, dan perimeter melalui red teaming berulang pada sistem-sistem ini menggunakan checkpoint dari proses pelatihan model terdepan, dengan tunduk pada analisis keselamatan, untuk menemukan dan menutup setiap celah. Lakukan juga red teaming pada semua layanan yang dapat diakses model selama pelatihan (misalnya, cache internet).
Komunikasi lintas sampel: Batasi komunikasi lintas sampel berbandwidth tinggi hanya pada jalur yang disetujui, seperti perangkat multiagen, dan tutup kanal samping infrastruktur yang berbandwidth tinggi serta mudah ditemukan oleh agen.
Transkrip yang tidak dapat diubah: Simpan transkrip agen dalam bentuk yang tidak dapat diubah selama jangka waktu yang wajar (misalnya, dalam akun penyimpanan sekali tulis) untuk semua pelatihan RL, evaluasi, dan penerapan internal, agar investigasi insiden dapat diandalkan dan penyuntingan yang tidak disengaja dapat dicegah.
Pemantauan: Jika model mulai melakukan tindakan yang tidak selaras, sediakan sistem pemantauan langsung untuk mendeteksi potensi ketidakselarasan dan segera menangani masalah prioritas sebelum terjadi insiden serius. Ini dapat mencakup:
Wajibkan keterpantauan: Pastikan model tetap dapat dipantau, yang diukur melalui evaluasi keterpantauan dan pengelakan pemantauan dengan ambang batas yang jelas, agar perilaku yang mengkhawatirkan dapat dideteksi sejak dini.
Recall tinggi pada masalah yang diketahui: Pastikan sistem pemantauan memiliki recall tinggi untuk insiden masa lalu dalam evaluasi menggunakan data yang disisihkan dari pelatihan.
Kemutakhiran evaluasi pemantau: Buat titik data evaluasi yang mewakili risiko yang benar-benar baru pada proses pelatihan baru, agar ukuran recall dan presisi pemantau tetap relevan.
Respons cepat: Terapkan peringatan prioritas yang memicu tindakan dalam batas waktu SLA yang ditetapkan, baik dengan menghubungi petugas siaga maupun menghentikan sementara proses pelatihan yang terdampak secara otomatis, sebelum model menimbulkan bahaya. Misalnya, hubungi petugas keamanan siaga dan penanggung jawab proses pelatihan jika insiden terjadi pada siang hari, dan hentikan sementara proses pelatihan secara otomatis jika peringatan tidak ditanggapi pada malam hari.
Selain rekomendasi tentang langkah pengamanan teknis, kami juga sedang menyusun praktik operasional terbaik untuk argumentasi keselamatan dalam suatu proses pelatihan AI terdepan. Praktik ini dapat mencakup:
Sanggahan (analisis pra-kegagalan): Setelah argumentasi keselamatan disusun, seorang anggota tim lain perlu menulis sanggahan untuk menemukan potensi kelemahan dan memberikan penilaian risiko yang proporsional. Tim pelatihan kemudian perlu menanggapinya agar argumentasi keselamatan menjadi lebih kuat.
Persetujuan: Argumentasi keselamatan perlu ditinjau oleh para pemimpin senior, yang masing-masing harus memiliki wewenang untuk memveto proses pelatihan guna memastikan adanya pemeriksaan internal berlapis (misalnya, kepala organisasi riset / VP, Kepala Keselamatan, dan Kepala Ilmuwan).
Akuntabilitas: Pemimpin senior yang bertanggung jawab atas suatu proses pelatihan (misalnya, kepala organisasi riset / VP riset) perlu dimintai pertanggungjawaban atas argumentasi keselamatan dan setiap respons insiden, termasuk dalam penilaian kinerja, agar tim pelatihan juga terdorong untuk mengutamakan keselamatan dan keselarasan.
Penghentian sementara: Jika ditemukan masalah yang dapat membuat argumentasi keselamatan tidak lagi valid (misalnya, masalah keamanan baru), pastikan tersedia panduan prosedur, kontrol teknis, dan SLA untuk menghentikan sementara semua proses pelatihan yang tercakup.
Transparansi internal: Argumentasi keselamatan perlu tersedia bagi kelompok pengawasan internal (misalnya, Komite Keamanan dan Keselamatan).
Audit: Auditor perlu diberi akses yang memadai untuk memverifikasi bahwa klaim dalam argumentasi keselamatan valid dan memiliki dasar yang kuat, serta untuk melaporkan kelemahan yang ditemukan.
Eskalasi: Perlu ada proses yang jelas untuk mengeskalasi masalah ketidakselarasan, tabel yang mendefinisikan tingkat keparahan ketidakselarasan, serta petugas siaga untuk masalah ketidakselarasan yang dapat menghubungi eksekutif (misalnya, CEO) ketika proses pelatihan mencapai tingkat keparahan tertentu.
Kontrol teknis: Memulai proses yang tidak sesuai dengan ketentuan harus dibuat sulit, baik bagi manusia maupun agen. Fitur keselamatan seperti pemantauan dan penghentian sementara otomatis harus memblokir operasi jika terjadi kegagalan. Misalnya, proses pelatihan tidak mungkin bisa dimulai tanpa pemantauan yang sesuai diaktifkan, dan pemantau tidak boleh bisa dinonaktifkan dari dalam pelatihan RL, evaluasi, atau penerapan internal.
Kemampuan pemulihan: Semua penggunaan lanjutan model yang tidak selaras dalam proses pelatihan (misalnya, pembuatan data atau penilaian) harus mudah diidentifikasi agar dampak keluaran yang tidak selaras dapat dibatalkan jika diperlukan.
Kelengkapan risiko residual: Argumentasi keselamatan perlu mencantumkan selengkap mungkin risiko residual yang belum tercakup oleh mitigasi yang telah diterapkan, agar keputusan penerimaan risiko dapat dibuat berdasarkan informasi yang memadai.
Inilah rekomendasi kami saat ini, yang sedang dalam proses penerapan di OpenAI. Kami memperkirakan praktik kami akan terus berkembang dalam beberapa minggu mendatang.
Kami juga sedang mengembangkan sejumlah praktik terbaik untuk menginvestigasi insiden ketidakselarasan AI yang parah. Laboratorium perlu berupaya untuk belajar sebanyak mungkin dari setiap insiden (serupa dengan praktik investigasi(terbuka di jendela baru) di industri lain yang berisiko tinggi) agar dapat mencegah kejadian serupa di masa mendatang. Beberapa contoh tindakan tersebut dapat mencakup:
Transparansi internal: Karena investigasi mungkin memerlukan waktu lama, perkembangan investigasi insiden perlu disampaikan secara berkala kepada pihak internal (misalnya, pembaruan harian untuk investigasi yang sedang berlangsung). Karyawan perlu memiliki jalur yang jelas untuk memperoleh akses lebih luas, termasuk ke transkrip mentah dan pengambilan sampel dari model yang tidak selaras, jika aman dan relevan dengan pekerjaan mereka.
Akar penyebab ketidakselarasan: Peneliti perlu menelusuri akar penyebab dalam dinamika pelatihan (misalnya, melalui ablasi terarah atau eksperimen pengambilan sampel ulang) untuk memahami bagaimana perilaku yang tidak selaras muncul. Hal ini akan memperdalam pemahaman ilmiah tentang ketidakselarasan dan meningkatkan pencegahannya di masa mendatang.
Analisis pascainsiden: Analisis pascainsiden terhadap aspek operasional dan budaya kerja perlu dilakukan untuk memahami semua faktor penyebab insiden, seperti mengapa masalah muncul dan tidak terdeteksi atau tidak dieskalasi sebelum insiden terjadi.
Deteksi: Kita perlu mengembangkan metode pengujian keselarasan yang mampu menemukan kecenderungan penyebab insiden, tanpa secara langsung melakukan optimasi berulang berdasarkan informasi dari insiden tersebut (misalnya, transkrip atau ringkasan insiden). Evaluasi berdasarkan insiden perlu dibuat sebagai “uji regresi” untuk memastikan model mendatang tidak menunjukkan kecenderungan ketidakselarasan pada insiden yang sangat mirip.
Pengungkapan kepada publik: Hasil investigasi, analisis pascainsiden, dan perubahan operasional perlu dibagikan kepada publik setelah investigasi selesai. Pihak ketiga yang terdampak perlu diberi tahu sesegera mungkin.


