Ke arah kes keselamatan untuk latihan AI perbatasan
Kami percaya bahawa kita sedang memasuki era baharu yang memerlukan dokumentasi keselamatan berstruktur sebelum mana-mana sesi latihan pembelajaran pengukuhan perbatasan diteruskan. Sebaik-baiknya, dokumentasi ini akan mencapai tahap “kes keselamatan”—iaitu penghujahan tentang risiko yang menyeluruh, berstruktur dan berasaskan bukti, seperti yang digunakan dalam industri lain yang amat mengutamakan keselamatan. Kami menjadikan kes keselamatan sebagai matlamat aspirasi yang memandu usaha kami. Namun, kami mengakui cabaran untuk menjadikannya seteguh kes keselamatan dalam penerbangan atau tenaga nuklear, kerana kerumitan baharu muncul pada setiap tahap keupayaan AI. Kami sedang membangunkan rangka kerja untuk memformalkan amalan ini.
Di bawah ialah beberapa garis panduan awal yang kami fikir patut menjadi sebahagian daripada kes keselamatan bagi latihan AI perbatasan. Amalan terbaik ini mencerminkan pengajaran yang kami peroleh setakat ini. Kami menjangkakan amalan ini akan berkembang apabila kami terus menambah baik proses dalaman untuk memastikan pembangunan yang berhati-hati. Kami berkongsinya sekarang untuk menjelaskan pemikiran semasa kami secara telus dan mengalu-alukan maklum balas daripada komuniti. Harap maklum bahawa dokumen ini memfokuskan latihan pembelajaran pengukuhan perbatasan; pelaksanaan dalaman dan luaran memerlukan pertimbangan terhadap ciri penjajaran yang jauh lebih luas.
Kes keselamatan patut meliputi tiga aspek susunan teknologi: latihan penjajaran, pembendungan dan pemantauan. Perlindungan ini membantu memastikan model tidak cuba mengambil tindakan yang tidak sejajar. Kalaupun model berbuat demikian, model akan sukar melepasi pembendungan dan pemantauan akan mengesannya sebelum kemudaratan berlaku.
Penjajaran model: Barisan pertahanan pertama patut berupa latihan untuk menjajarkan model, iaitu supaya model bertindak secara konsisten mengikut tujuan yang kita tetapkan. Ini boleh merangkumi:
Persekitaran latihan dan pemarkahan: Kurangkan risiko model membentuk tingkah laku yang tidak sejajar dengan mencegah pengukuhan positif bagi manipulasi ganjaran semasa latihan. Ini boleh merangkumi:
Semakan set data automatik: Gunakan ejen untuk mencari dan membaiki persekitaran RL yang rosak, yang boleh membolehkan trajektori tidak sejajar menerima ganjaran tinggi melalui eksploitasi dan bukannya tingkah laku yang dihasratkan. Ini mengurangkan peluang ketidakjajaran diperkukuh semasa latihan.
Semakan set data manual: Lengkapkan proses penyerang automatik dengan semakan manual dan pemeriksaan kualiti set data untuk mengenal pasti tugasan cacat yang mungkin secara tidak sengaja memperkukuh tingkah laku yang tidak sejajar.
Penalaan pemberi markah: Tala pemberi markah supaya mengenakan penalti apabila model cuba mengeksploitasi atau menggodam persekitaran RL semasa latihan.
Analisis sesi latihan terdahulu: Jalankan pengelas pada rekod jejak eksperimen terdahulu untuk memastikan pemberi markah berfungsi seperti yang dihasratkan.
Pengukuran penjajaran: Jalankan penilaian yang menjejak kecenderungan ketidakjajaran model untuk mengukur keberkesanan latihan penjajaran. Ini boleh merangkumi:
Penilaian penjajaran luar talian: Jalankan penilaian penjajaran semasa sesi latihan perbatasan untuk menilai sama ada latihan berjalan seperti yang dihasratkan, dan siasat sebarang kemerosotan yang ketara.
Pengujian retrospektif: Uji balik penjajaran menggunakan insiden terdahulu untuk mengesahkan bahawa penilaian dapat mengesan model yang sebelum ini tidak sejajar, dan tidak terlampau disesuaikan dengan insiden tertentu.
Penjejakan manipulasi penilaian: Jejak kesedaran penilaian atau manipulasi berasaskan konteks ujian (model menyedari bahawa ia sedang diuji) yang boleh mencetuskan perubahan tingkah laku. Contohnya, aktifkan pemantau bagi kedua-duanya dalam penilaian penjajaran, dengan ambang penyekatan yang khusus.
Ujian tekanan senario terburuk: Cetuskan salah laku paling buruk dan pastikan sekurang-kurangnya satu penilaian dapat mengesannya.
Pencegahan latihan berasaskan rentetan fikiran: Jangan benarkan pemberi markah automatik melihat rentetan fikiran dalam pembelajaran pengukuhan, untuk mencegah model daripada berkembang sehingga mampu mengelak pemantau rentetan fikiran.
Pembendungan: Jika model menjadi tidak sejajar, pastikan pengasingan dalam persekitaran medan ujian dan sekuriti cukup kukuh untuk mencegah tindakan yang memudaratkan. Ini boleh merangkumi:
Keselamatan infrastruktur berbilang lapisan: Laburkan sumber yang besar untuk memperkukuh kedua-dua medan ujian tempat model beroperasi dan infrastruktur penyelidikan yang mengehoskannya. Ini memastikan adanya lapisan perlindungan tambahan sekiranya model melepasi sekatan medan ujian.
Proses penyerang pembendungan: Tingkatkan keselamatan medan ujian, infrastruktur penyelidikan dan perimeter melalui proses penyerang berulang terhadap sistem ini menggunakan titik semak daripada sesi latihan perbatasan, tertakluk pada analisis keselamatan, untuk mencari dan menutup sebarang jurang. Uji juga semua perkhidmatan yang boleh diakses oleh model semasa latihan (contohnya, cache internet) melalui simulasi serangan.
Komunikasi antara sampel: Hadkan komunikasi antara sampel yang berlebar jalur tinggi kepada saluran yang diluluskan, seperti alat berbilang ejen. Tutup saluran sampingan infrastruktur yang berlebar jalur tinggi dan mudah ditemukan oleh ejen.
Transkrip yang tidak berubah: Simpan transkrip ejen dalam bentuk yang tidak boleh diubah untuk tempoh yang munasabah (contohnya, dalam akaun storan sekali tulis) bagi semua latihan RL, penilaian dan pelaksanaan dalaman. Ini membolehkan penyiasatan insiden yang boleh dipercayai dan mencegah edit yang tidak disengajakan.
Pemantauan: Sediakan sistem pemantauan langsung untuk mengesan kemungkinan ketidakjajaran sekiranya model mula mengambil tindakan yang tidak sejajar, serta menangani isu keutamaan dengan pantas sebelum insiden serius berlaku. Ini boleh merangkumi:
Penguatkuasaan kebolehpantauan: Pastikan model kekal boleh dipantau, sebagaimana diukur melalui penilaian kebolehpantauan dan pengelakan pemantau dengan ambang yang jelas, untuk mengesan tingkah laku yang membimbangkan lebih awal.
Kadar pengesanan tinggi bagi isu yang diketahui: Pastikan sistem pemantauan mempunyai kadar pengesanan yang tinggi bagi insiden lalu dalam penilaian menggunakan data yang diasingkan daripada latihan.
Penilaian terkini untuk pemantau: Cipta titik data penilaian yang mewakili risiko yang benar-benar baharu bagi sesi latihan baharu, supaya ukuran kadar pengesanan dan kejituan pemantau kekal relevan.
Respons pantas: Laksanakan amaran keutamaan yang membawa kepada tindakan dalam tempoh SLA yang ditetapkan, sama ada dengan memanggil petugas siap siaga atau menghentikan sementara sesi latihan yang terjejas secara automatik, sebelum model menyebabkan kemudaratan (contohnya, panggil petugas sekuriti siap siaga dan pemilik sesi latihan jika insiden berlaku pada waktu siang, dan hentikan sementara sesi latihan secara automatik jika amaran tidak diakui penerimaannya pada waktu malam).
Selain cadangan tentang perlindungan teknikal, kami sedang membangunkan amalan operasi terbaik bagi kes keselamatan untuk sesi latihan AI perbatasan. Ini boleh merangkumi:
Pandangan berbeza (pramortem): Selepas kes keselamatan dirangka, seorang ahli pasukan lain patut menulis pandangan berbeza untuk mengenal pasti kemungkinan kelemahan dalam kes tersebut dan memberikan penilaian risiko yang berimbang. Pasukan latihan kemudiannya patut menangani perkara yang dibangkitkan untuk memperkukuh kes keselamatan.
Kelulusan: Kes keselamatan patut disemak oleh anggota kepimpinan kanan, yang masing-masing patut mempunyai kuasa veto untuk menghalang sesi latihan. Ini memastikan adanya beberapa peringkat semakan dalaman terhadap sesi tersebut (contohnya, ketua organisasi penyelidikan / naib presiden, Ketua Keselamatan dan Ketua Saintis).
Kebertanggungjawaban: Pemimpin kanan yang bertanggungjawab untuk menjalankan latihan (contohnya, ketua organisasi penyelidikan / Naib Presiden penyelidikan) patut dipertanggungjawabkan atas kes keselamatan dan sebarang respons terhadap insiden, termasuk dalam penilaian prestasi. Dengan ini, pasukan latihan turut diberi insentif untuk mengutamakan keselamatan dan penjajaran.
Penghentian sementara: Jika ditemukan isu yang boleh membatalkan kesahihan kes keselamatan (contohnya, isu keselamatan baharu), pastikan adanya panduan prosedur operasi, kawalan teknikal dan perjanjian tahap perkhidmatan (SLA) untuk menghentikan sementara semua sesi latihan yang diliputi.
Ketelusan dalaman: Kes keselamatan patut disediakan untuk kumpulan pengawasan dalaman (contohnya, Jawatankuasa Keselamatan dan Sekuriti).
Audit: Juruaudit patut diberi akses yang mencukupi untuk mengesahkan bahawa dakwaan dalam kes keselamatan adalah sah dan kukuh, serta membangkitkan sebarang jurang yang ditemukan.
Peningkatan: Sepatutnya mempunyai proses yang jelas untuk meningkatkan isu ketidakjajaran, berserta jadual tahap keterukan ketidakjajaran yang ditetapkan dan petugas siap siaga bagi isu ketidakjajaran. Petugas ini boleh memanggil eksekutif (contohnya, CEO) apabila sesuatu sesi latihan mencapai tahap keterukan tertentu.
Kawalan teknikal: Manusia dan ejen patut berdepan halangan untuk memulakan sesi latihan yang tidak mematuhi peraturan. Ciri keselamatan seperti pemantauan dan penghentian sementara automatik patut menyekat operasi jika berlaku kegagalan. Contohnya, sesi latihan tidak boleh dimulakan tanpa pemantauan yang sesuai diaktifkan, dan pemantau tidak boleh dinyahaktifkan dari dalam latihan pembelajaran pengukuhan (RL), penilaian atau pelaksanaan dalaman.
Keupayaan untuk mengundur kembali: Semua penggunaan hiliran model yang tidak sejajar dalam proses latihan (contohnya, penjanaan data atau pemarkahan) patut mudah dikenal pasti supaya kesan output yang tidak sejajar dapat dibatalkan jika perlu.
Kelengkapan senarai risiko baki: Kes keselamatan patut menyenaraikan, selengkap mungkin, risiko baki yang tidak ditangani oleh langkah pemindahan sedia ada, supaya keputusan penerimaan risiko dapat dibuat berasaskan maklumat yang mencukupi.
Inilah cadangan semasa kami, yang sedang dilaksanakan di OpenAI. Kami menjangkakan amalan kami akan terus berkembang dalam beberapa minggu akan datang.
Kami juga sedang membangunkan beberapa amalan terbaik untuk menyiasat insiden ketidakjajaran AI yang teruk. Makmal patut berusaha mengambil sebanyak mungkin pengajaran daripada setiap insiden, (serupa dengan amalan penyiasatan(dibuka dalam tetingkap baru) dalam industri berisiko tinggi yang lain), untuk mencegah kejadian seumpamanya pada masa hadapan. Antara contoh tindakan tersebut ialah:
Ketelusan dalaman: Oleh sebab penyiasatan mungkin mengambil masa yang lama untuk diselesaikan, perkembangan siasatan insiden patut dibentangkan secara berkala kepada pihak dalaman (contohnya, kemas kini harian bagi siasatan yang sedang berjalan). Pekerja patut mempunyai saluran yang ditetapkan untuk mendapatkan akses tambahan, termasuk transkrip mentah dan pensampelan daripada model yang tidak sejajar, jika selamat dan relevan dengan kerja mereka.
Punca utama ketidakjajaran: Penyelidik patut mengenal pasti punca utama dalam dinamik latihan (contohnya, melalui eksperimen ablasi bersasar atau pensampelan semula) untuk memahami bagaimana tingkah laku yang tidak sejajar terbentuk. Ini akan memperdalam pemahaman saintifik tentang ketidakjajaran dan meningkatkan keupayaan mencegahnya pada masa hadapan.
Pascamortem: Analisis pascamortem terhadap operasi dan budaya patut dijalankan untuk memahami semua punca yang menyumbang kepada insiden, seperti sebab isu timbul dan tidak dikesan atau dieskalasi sebelum insiden berlaku.
Pengesanan: Kita patut membangunkan kaedah pengujian penjajaran yang mampu mengesan kecenderungan untuk menyebabkan insiden, tanpa membuat pengoptimuman berulang secara langsung berdasarkan maklumat daripada insiden tersebut (contohnya, transkrip atau ringkasan insiden). Penilaian berasaskan insiden patut diwujudkan sebagai “ujian regresi” untuk memastikan model masa hadapan tidak menunjukkan kecenderungan ketidakjajaran dalam insiden yang sangat serupa.
Pendedahan awam: Hasil siasatan, analisis pascamortem dan perubahan operasi patut dikongsi dengan orang ramai berikutan daripada kesimpulan siasatan. Pihak ketiga yang terjejas patut dimaklumkan secepat mungkin.


