Mengawal rentak pembangunan model dalam era keupayaan siber kritikal
Sejak beberapa minggu lalu, dua perkembangan telah menekankan peningkatan risiko yang berkaitan dengan sistem AI yang semakin berkeupayaan: insiden OpenAI-Hugging Face dan, secara berasingan, bukti awal bahawa salah satu model kami yang akan datang, Astra, mungkin mencapai ambang Keupayaan keselamatan siber kritikal di bawah Rangka Kerja Kesediaan kami. Secara keseluruhan, perkembangan ini serta kemajuan pesat dalam penyelidikan dalaman kami telah meningkatkan keperluan mendesak untuk memperkukuh perlindungan pemantauan, penjajaran dan pembendungan pada setiap peringkat proses latihan.
Apabila model menjadi semakin berkeupayaan, risiko yang berkaitan dengan pembangunan dan pengujian model secara dalaman turut meningkat. Piawaian pemantauan, penjajaran dan keselamatan kami mesti sentiasa mendahului risiko tersebut. Kami mahu mengambil masa yang diperlukan untuk memenuhi piawaian tersebut, jadi kami memperlahankan rentak penskalaan buat sementara waktu. Ini termasuk menghentikan latihan pembelajaran pengukuhan (RL) selama dua minggu bagi model terbaharu kami yang bertujuan untuk digunakan, sementara kami terus memperkukuh dan menjalankan ujian pasukan merah terhadap persekitaran penyelidikan serta memperluas liputan sistem pemantauan kami. Pelaksanaan RL perbatasan terbesar yang kami rancang masih ditangguhkan sementara kami menjalankan latihan dan penilaian berskala lebih kecil untuk menilai tingkah laku model, mengesahkan perlindungan kami dan mendapatkan lebih banyak bukti penjajaran sebelum meneruskannya.
Penjajaran—usaha memastikan sistem AI berkelakuan seperti yang dimaksudkan dan responsif terhadap pengawasan manusia—telah lama menjadi teras program penyelidikan kami. Kini kami memerlukan bukti yang lebih kukuh tentang tingkah laku yang sejajar sepanjang keseluruhan latihan, berasaskan penyelidikan dan penilaian yang sedang dijalankan. Memastikan sistem yang semakin berkeupayaan kekal sejajar ialah cabaran yang perlu ditangani oleh seluruh bidang ini. Petunjuk yang kami lihat daripada kemajuan model akan datang menjelaskan bahawa kami memerlukan pendekatan lebih luas—yang berasaskan Rangka Kerja Kesediaan semasa dan melangkauinya.
Kami berpendapat bahawa ketelusan tentang perubahan pendekatan kami adalah penting. Di bawah, kami menerangkan perubahan yang telah dibuat pada proses dan infrastruktur penyelidikan kami, serta usaha yang masih berjalan.
Pendekatan kami untuk membangunkan model yang lebih berkeupayaan berteraskan tiga perlindungan yang saling memperkukuh:
- Pemantauan, yang mengesan tingkah laku membimbangkan dan membolehkan kami menanganinya.
- Penjajaran, yang mengurangkan kemungkinan tindakan berbahaya atau tanpa kebenaran.
- Langkah keselamatan, yang mengehadkan perkara yang boleh diakses atau dipengaruhi oleh sistem AI.
Kami menjangkakan model akan menjalankan sebahagian besar kerja keselamatan tidak lama lagi, termasuk mempertahankan sistem daripada model lain. Ini akan membolehkan ketiga-tiga perlindungan berkembang seiring dengan keupayaan model, sesuatu yang kami anggap penting.
Kami menerapkan perlindungan ini dalam penyelidikan dan penggunaan, serta menyesuaikannya dengan keupayaan, persekitaran operasi dan tahap risiko setiap model.
Apabila model perbatasan memperoleh keupayaan keselamatan siber yang lebih kukuh, kami meningkatkan piawaian keselamatan bagi persekitaran tempat model tersebut dilatih dan dinilai. Pemenuhan piawaian ini memerlukan kerja kejuruteraan yang besar serta mengakibatkan kos tinggi dan kelewatan kepada penyelidikan perbatasan. Sejurus selepas insiden OpenAI-Hugging Face*, kami menghentikan inferens model perbatasan dalam kelompok penyelidikan bagi pelaksanaan yang boleh menjalankan kod atau menggunakan alat yang boleh mengakses internet. Kami memulihkan laluan pelaksanaan kod yang lebih terhad dan selamat dengan agak cepat, kemudian meneliti setiap beban kerja secara berasingan untuk menentukan sama ada ia boleh disambung semula dengan selamat. Sesetengah beban kerja penyelidikan disambung semula di bawah kawalan baharu ini, manakala yang lain memerlukan perubahan tambahan.
Sepanjang minggu-minggu berikutnya, kami telah menetapkan dan mula melaksanakan keperluan keselamatan yang lebih kukuh untuk beban kerja penyelidikan perbatasan. Contohnya:
- Pengasingan beban kerja: Kini kami mewajibkan pengasingan yang lebih kukuh (“kotak pasir”) bagi beban kerja yang menjalankan kod janaan model atau kod lain yang tidak dipercayai. Ini juga terpakai pada perisian yang boleh terjejas ketika memproses output model.
- Pengasingan rangkaian: Kami telah melaksanakan lebih banyak kawalan untuk mengasingkan beban kerja berisiko tinggi dan tidak dipercayai daripada internet. Kami mereka bentuk kawalan ini supaya satu insiden pencerobohan terhadap beban kerja atau perkhidmatan sokongan tidak dengan sendirinya membolehkan akses tanpa kebenaran kepada internet atau rangkaian dalaman lain.
- Ujian keselamatan berterusan: Kami telah mengkonfigurasi semula persekitaran kami untuk menghapuskan perkhidmatan dikongsi yang mungkin terdedah, mengurangkan keistimewaan kekal serta menambah baik sempadan keselamatan dan kepercayaan. Kami juga sedang meningkatkan keupayaan untuk mengumpulkan dan memantau log keselamatan. Akhir sekali, kami melabur dalam automasi yang menggunakan model kami untuk terus menguji sempadan ini terhadap serangan simulasi.
Secara keseluruhan, kawalan ini menyediakan pertahanan berlapis dan membantu melindungi persekitaran penyelidikan kami daripada serangan. Kini, kami mewajibkan perlindungan keselamatan pada tahap paling ketat untuk beban kerja yang melibatkan Astra atau model siber kerana kami telah menentukan bahawa model Astra mungkin mempunyai keupayaan siber pada tahap kritikal. Perlindungan ini turut terpakai pada semua beban kerja lain yang berkaitan dengan siber.
Walaupun sesetengah latihan dan penilaian Astra memenuhi keperluan tersebut, sejumlah besar beban kerja masih ditangguhkan sehingga dipindahkan sepenuhnya dan dipertingkatkan untuk memenuhi piawaian keselamatan baharu. Kami mengutamakan pemindahan beban kerja keselamatan dan penjajaran ke persekitaran baharu ini terlebih dahulu.
Pemantauan telah lama menjadi bahagian penting dalam proses pembangunan model kami, termasuk pemantauan untuk ejen pengekodan dalaman dan sesi yang berjalan lama. Usaha pemantauan kami tertumpu khususnya pada penggunaan dalaman model perbatasan dan pelaksanaan latihan RL perbatasan, yang kami anggap sebagai beban kerja berisiko paling tinggi kerana menggabungkan keupayaan model lanjutan dengan akses kepada alat, sistem sensitif serta rangkaian dalaman atau luaran. Pemantauan tersebut tidak diterapkan pada semua pelaksanaan inferens dan latihan yang menggunakan alat. Kami telah menyemak semula dan memperluas pendekatan kami melalui persediaan pemantauan baharu.
Persediaan pemantauan baharu ini terdiri daripada berbilang peringkat, bermula dengan pengelas pengaktifan (pengesan yang memeriksa aktiviti dalaman model) yang beroperasi pada setiap token yang disampel dan mengemukakan potensi kebimbangan kepada penyiasat automatik yang semakin canggih serta menggunakan pengkomputeran tinggi. Sistem tersebut memeriksa tindakan alat, penaakulan yang tersedia dan keseluruhan urutan aktiviti untuk mengesan akses tanpa kebenaran, kecurian data, tingkah laku merosakkan serta percubaan mengatasi perlindungan. Kami menyasarkan untuk mengeluarkan makluman dalam tempoh 30 minit selepas aktiviti membimbangkan dikesan oleh sistem pemantauan kami. Jika sistem pemantauan mengenal pasti kemungkinan pelanggaran sempadan keselamatan kritikal, sistem itu menjana makluman berkeutamaan tertinggi. Dalam pelaksanaan semasa kami, pasukan keselamatan, sekuriti dan penyelidikan akan dihubungi melalui sistem kelui. Jika mereka tidak dapat mengesahkan dalam tempoh 30 minit bahawa penandaan itu ialah positif palsu, pasukan tersebut perlu menghentikan aktiviti berkenaan.
Pemantauan ini diwajibkan untuk semua latihan dan penilaian RL yang melibatkan alat bagi model berkeupayaan Sol atau lebih tinggi. Selepas kami menentukan pada 7 Ogos bahawa Astra mungkin mempunyai keupayaan siber kritikal, kami menambah keperluan pemantauan bagi semua inferens Astra yang menggunakan alat (bukan sekadar latihan dan penilaian RL).
Perlindungan ini memerlukan sumber pengkomputeran yang besar. Anggaran semasa kami menunjukkan bahawa overhed pemantauan ialah kira-kira 20% daripada sumber pengkomputeran inferens yang dipantau, walaupun kosnya sangat berbeza mengikut beban kerja latihan dan penilaian. Kami akan berkongsi butiran lanjut tentang sistem ini dalam catatan blog akan datang.
Penyelidikan penjajaran merupakan teras misi kami. Misi kami adalah untuk memastikan kecerdasan am buatan memberi manfaat kepada seluruh umat manusia. Apabila model memperoleh keupayaan lanjutan seperti kebolehan melancarkan serangan siber dan beroperasi dalam persekitaran yang lebih kompleks, tingkah laku tidak sejajar seperti penggodaman ganjaran (mencari cara untuk menerima ganjaran tinggi semasa latihan tanpa benar-benar mencapai hasil yang dimaksudkan), penipuan atau akses tanpa kebenaran akan menimbulkan risiko yang semakin serius.
Bagi pelaksanaan RL pada model yang paling berkeupayaan, kini kami menerapkan teknik penjajaran teras kami pada lebih banyak peringkat proses latihan. Ini termasuk menambah baik model ganjaran agar lebih berkesan mengesan dan menghalang tingkah laku tidak selamat merentas tugas dan persekitaran; melatih model supaya lebih jujur tentang tindakan, keupayaan dan batasannya; serta mengurangkan tingkah laku yang mengeksploitasi kelemahan dalam ganjaran, penilai, alat atau pengawasan. Kami juga memperluas liputan latihan bagi tingkah laku yang boleh menyebabkan kemudaratan apabila model berinteraksi dengan sistem atau sumber luaran.
Kami terus melabur secara besar-besaran dalam penyelidikan penjajaran, memperluas liputan penilaian dan menggunakan hasil pembelajaran kami untuk memandu latihan serta perlindungan. Kami merancang untuk berkongsi lebih banyak maklumat tentang penyelidikan penjajaran kami dalam masa terdekat, termasuk pengetahuan yang kami peroleh tentang tingkah laku model dan sebarang cabaran baharu yang ditemukan.
Kami akan mengembangkan Rangka Kerja Kesediaan untuk menyatukan perlindungan ini merentas latihan dan penggunaan, serta mencerminkan keupayaan model masa hadapan dan persekitaran operasinya dengan lebih baik. Pembangunan kaedah yang dapat berkembang seiring dengan keupayaan tersebut memerlukan pelaburan berterusan dalam keselamatan berbantukan model, pemantauan yang lebih berkesan dan kemajuan berterusan dalam penyelidikan penjajaran. Kami berhasrat untuk melibatkan organisasi luar dan berkongsi lebih banyak pengetahuan yang diperoleh sambil pendekatan kami terus berkembang.
Keupayaan model perbatasan sedang berkembang dengan pesat. Keupayaan kami untuk memahami, menjajarkan dan melindungi model tersebut mesti sentiasa mendahului perkembangannya.
*Kami akan menerbitkan laporan teknikal tentang pengetahuan yang diperoleh dalam beberapa minggu akan datang.

