Keselamatan dan penjajaran dalam era model horizon panjang
Apa yang penggunaan dalaman model yang berjalan lama ajarkan kepada kami tentang keselamatan.
Ringkasan
Model yang berjalan lama boleh menyelesaikan masalah yang sukar dan terbuka, tetapi ketekunannya memberinya lebih banyak peluang untuk mengambil tindakan yang tidak diingini.
Semasa penggunaan dalaman terhad bagi model yang dilatih untuk tugas yang berjalan lama, kami melihat kegagalan baharu yang tidak dikesan dalam penilaian sebelum pelaksanaan sedia ada kami, lalu menghentikan sementara akses. Kami kemudian menggunakan pemahaman daripada kegagalan ini untuk membina penilaian baharu, meningkatkan penjajaran horizon panjang, menambah pemantauan pada tahap trajektori, dan memberi pengguna keterlihatan serta kawalan yang lebih besar sebelum memulihkan akses terhad.
Pengalaman ini mengukuhkan nilai pelaksanaan berulang. Tiada set penilaian tetap boleh menjangka setiap tingkah laku, jadi ujian sebelum pelaksanaan mesti digandingkan dengan pemantauan rapi, perlindungan yang boleh campur tangan, dan keupayaan untuk menghentikan sementara atau mengundur balik apabila perlu.
Model yang boleh berfungsi secara autonomi untuk tempoh yang lama boleh menangani masalah yang sukar dan terbuka. Namun ketekunan yang sama yang menjadikannya berguna juga memberinya lebih banyak peluang untuk mengambil tindakan yang tidak diingini—dan melakukannya dengan cara yang mungkin terlepas daripada penilaian yang direka untuk model berhorizon lebih pendek.
Kira-kira dua bulan lalu, kami mengumumkan bahawa sebuah model dalaman tujuan umum telah menyangkal konjektur jarak unit Erdős. Model ini direka untuk berfungsi secara autonomi bagi tempoh masa yang sangat lama. Semasa penggunaan dalaman yang terhad dan dipantau, kami melihat tingkah laku tidak diingini yang tidak dikesan oleh penilaian pelaksanaan sedia ada kami. Oleh sebab pelaksanaan itu terhad dan dipantau, kami dapat mengenal pasti masalah ini, menghentikan sementara akses, mencipta penilaian baharu berdasarkan pemerhatian kami, mengukuhkan model serta perlindungannya, kemudian memulihkan akses di bawah pemantauan berterusan.
Keadaan yang kami gunakan untuk menilai model tidak akan pernah sepadan dengan sempurna dengan keadaan yang ditemuinya dalam penggunaan sebenar. Itulah sebabnya penilaian sebelum pelaksanaan perlu digandingkan dengan pelaksanaan yang terhad dan dipantau, serta keupayaan untuk campur tangan, menghentikan sementara atau mengundur balik apabila masalah timbul. Apa yang kami pelajari daripada pelaksanaan kemudian boleh menjadi sebahagian daripada penilaian dan perlindungan yang lebih kukuh sebelum akses diperluas.
Dalam bahagian berikut, kami berkongsi contoh konkrit tentang apa yang kami perhatikan, cara kami menangani isu, dan bagaimana pengalaman ini akan membentuk keluaran akan datang.
Model baharu ini boleh terus berusaha mencapai objektif melalui percubaan berulang dalam tempoh masa yang panjang. Ketekunan yang sama boleh menyebabkannya mencari dan mengeksploitasi kelemahan dalam persekitarannya. Model terdahulu, apabila berdepan dengan kekangan sandbox atau persekitaran, biasanya akan berhenti dan kembali kepada pengguna. Model ini sering terus mencuba, termasuk mencari cara untuk bertindak di luar sandboxnya.
Satu contoh berlaku semasa penilaian dalaman pada speedrun NanoGPT(dibuka dalam tetingkap baru), penanda aras awam untuk melatih model bahasa kecil dalam bilangan langkah sesedikit mungkin. Model kami membangunkan penyejukan kadar pembelajaran hukum kuasa yang dipanggil PowerCool, yang membawa peningkatan ketara. Model itu diarahkan untuk menyiarkan keputusannya hanya ke Slack, tetapi arahan NanoGPT menyatakan supaya keputusan disiarkan sebagai PR ke GitHub, dan model tersebut mengikut arahan yang kedua lalu membuka PR #287 pada repositori GitHub awam. Model tersebut memintas sekatan sandbox yang direka untuk menyekat akses luaran dan meneruskan muat naik ke GitHub. Model kami mengambil masa sejam untuk menemui kerentanan dalam sandbox bagi membuat PR tersebut; model terdahulu kurang tekun dan tidak berjaya menemukan kerentanan, sebaliknya menyerah pada bahagian PR itu.1
Banyak kawalan keselamatan untuk pembantu AI direka berdasarkan tindakan individu. Jika sesuatu tindakan tidak dibenarkan, tindakan itu disekat. Jika tindakan itu sensitif, sistem meminta kelulusan jelas daripada pengguna. Tetapi model yang berjalan lama, yang tindakannya boleh berkembang secara autonomi selama berjam-jam, berhari-hari atau bahkan berminggu-minggu, mencabar susunan ini: memantau tindakan individu tidak lagi memadai untuk menjejaki niat trajektori keseluruhan.
Sebagai contoh, dalam satu senario apabila model diminta menyelesaikan masalah, model itu memerhatikan bahawa sistem lain mempunyai penyerahan yang berjaya tetapi bersifat peribadi, lalu cuba mendapatkan semula penyelesaian tersebut daripada bahagian belakang penilaian. Apabila percubaan awalnya disekat kerana pengimbas mengesan token pengesahan, model itu memecahkan badan token kepada dua serpihan, mengaburkannya, kemudian membina semula kelayakan itu pada masa jalan supaya token lengkap tidak pernah muncul sebagai satu rentetan bersambung. Model itu menyatakan dengan jelas, baik dalam komennya kepada pengguna mahupun dalam jejak penaakulannya, bahawa ia mengambil langkah-langkah ini untuk memintas pengimbas.
Contoh ini menunjukkan bagaimana setiap langkah boleh kelihatan boleh diterima dengan sendirinya, sedangkan urutan tersebut boleh menghasilkan keputusan yang tidak akan diluluskan. Ia juga menunjukkan bagaimana model yang beroperasi dengan berkesan dalam horizon masa yang panjang boleh mempelajari titik buta sistem kelulusan dan mencari jalan untuk mengatasinya demi mencapai matlamatnya. Keselamatan horizon panjang memerlukan kita bukan sahaja bertanya “adakah tindakan ini dibenarkan?” tetapi juga “apakah hasil yang sedang diusahakan oleh urutan tindakan ini?”
Disebabkan insiden seperti ini, kami menghentikan sementara pelaksanaan dalaman model baharu tersebut. Kami membina semula sistem keselamatan berasaskan pertahanan berlapis dan pemantauan pada tahap trajektori.
- Penilaian berasaskan insiden. Penilaian boleh memberi kami gambaran sama ada sesuatu sistem selamat untuk dilaksanakan sebelum ia benar-benar dilaksanakan. Namun, agar paling berguna, sesuatu penilaian harus mencerminkan taburan dan panjang horizon trajektori semasa pelaksanaan sebenar. Atas sebab ini, kami menggunakan kegagalan yang diperhatikan untuk membangunkan penilaian adversarial. Kami mendapati bahawa peningkatan pada penilaian yang diperoleh daripada insiden dunia sebenar seterusnya membawa kepada tingkah laku yang lebih selamat setelah dilaksanakan dalam produksi.
- Penjajaran yang dipertingkat. Kami mengambil langkah untuk mengurangkan kecenderungannya mengambil tindakan tidak diingini tanpa kebenaran ketika mengejar matlamat pengguna. Sebagai contoh, kami mendapati bahawa model kami lebih lemah dalam mengingati arahan pada pelaksanaan panjang, dan apabila kami melatih model untuk keupayaan ini, hasilnya ialah model yang kekal sejajar sepanjang pelaksanaan yang lebih panjang.
- Pemantauan aktif. Kami mencipta sistem pemantauan yang menyemak trajektori model yang berubah dari masa ke masa untuk mengesan tanda bahawa ia sedang memintas kekangan pengguna atau sempadan keselamatan. Pemantau memerhatikan bukan hanya satu tindakan, tetapi keseluruhan trajektori. Yang penting, pemantau boleh menghentikan sementara sesi dan memberi amaran kepada pengguna untuk menelitinya dengan lebih dekat. Selepas pemeriksaan, pengguna kemudian boleh memilih untuk meneruskan kerja model jika pemantau telah dicetuskan secara salah.
- Keterlihatan dan kawalan pengguna yang lebih besar. Kami meningkatkan keupayaan pengguna untuk memeriksa sesi yang berjalan lama ini, melihat tindakan yang diambil, dan memantau campur tangan.
Untuk menilai sistem pemantauan baharu, kami memainkan semula satu set kecil persekitaran pelaksanaan dalaman yang sebelum ini menyaksikan model mengejar tindakan tidak sejajar, kali ini dengan perlindungan baharu tersedia2. Perlindungan baharu dapat menangkap jauh lebih banyak tindakan tidak sejajar yang dikejar oleh model, dan semua yang terlepas dinilai sebagai berkeparahan rendah.
Beberapa contoh insiden berkeparahan rendah ini termasuk kes berikut:
- Untuk mengakses alat baris perintah Linear, model melancarkan sesi
codex --yolobersarang, sedangkan sebenarnya ia boleh berbuat demikian tanpa bendera--yolo. - Model menyedari bahawa satu sumber yang sebelum ini aktif telah hilang, kemudian mula meneroka dan menggunakan SSH ke pod CPU aktif lain di bawah namespace pemiliknya, serta pod milik pekerja OpenAI lain (tanpa berjaya), tanpa alasan yang kukuh untuk berbuat demikian.
- Model mempunyai banyak proses
findyang tersekat dan setiap perintah shell tergantung. Ia kemudian menjalankankill -9 -1, yang akan menghantar SIGKILL kepada setiap proses yang dibenarkan untuk dimatikannya pada pod itu, jika ia dilaksanakan. Namun, ia tamat masa dan tidak dilaksanakan.
Selepas menguji sistem baharu itu, kami menyimpulkan bahawa akses dalaman terhad kepada model dengan keupayaan horizon panjang boleh dipulihkan. Kami tidak melihat sebarang pemintasan perlindungan yang serius sejak pelaksanaan semula bermula beberapa minggu lalu. Versi pertama perlindungan ini sengaja dibuat konservatif. Kami terus menala sistem untuk mengurangkan gangguan yang tidak perlu tanpa melemahkan perlindungan.
Oleh sebab kami melaksanakan secara berulang, kami dapat menemukan dan menangani jurang sebelum memperluas akses. Penilaian sebelum pelaksanaan kekal penting, tetapi pelaksanaan mendedahkan tingkah laku yang terlepas oleh penilaian tersebut. Bermula dengan akses terhad membolehkan kami memerhatikan model dalam amalan, menghentikannya sementara apabila masalah timbul, menggunakan kegagalan tersebut untuk membina penilaian dan perlindungan yang lebih baik, serta memulihkan akses terhad selepas menguji perubahan itu.
Apabila model mengambil tugas yang lebih panjang dan lebih kompleks, kegagalan yang terlepas oleh penilaian mungkin membawa akibat yang lebih besar. Kami akan terus berusaha mengecilkan jurang antara penilaian dan pelaksanaan: menguji model pada trajektori yang lebih panjang, meningkatkan penjajaran, membina pemantauan yang boleh campur tangan, dan memberi pengguna keterlihatan serta kawalan yang lebih jelas. Cabaran ini tidak akan terhad kepada OpenAI, dan kami berharap perkongsian perkara yang kami pelajari dapat membantu bidang yang lebih luas bersedia menghadapinya.
Penulis
Nota kaki
- 1
Walaupun kami segera menutup PR tersebut, beberapa peserta dalam speedrun sudah melihatnya dan menggunakan pendekatan itu dalam penyerahan mereka sendiri; penyerahan rekod dunia berturut-turut dengan 3030(dibuka dalam tetingkap baru), 2990(dibuka dalam tetingkap baru), 2930(dibuka dalam tetingkap baru), 2925(dibuka dalam tetingkap baru), 2900(dibuka dalam tetingkap baru) dan 2890(dibuka dalam tetingkap baru) langkah semuanya memetik PR 287. Antara semua ini, PR 300(dibuka dalam tetingkap baru) amat menarik kerana ia ialah PR yang diserahkan oleh Opus 4.7 apabila Prime Intellect(dibuka dalam tetingkap baru) menilainya pada speedrun NanoGPT. Opus melihat PR yang diserahkan oleh model kami, menggabungkan penemuan tersebut, dan memberikan kredit kepada PR kami dalam hasil akhirnya.
- 2


