Laluan ke Astra: keupayaan kritikal dan perlindungan perbatasan
Sejak penilaian terdahulu kami bahawa Astra mungkin mencapai tahap keupayaan keselamatan siber Kritikal, kami telah mengumpulkan lebih banyak bukti dan menjalankan penilaian tambahan untuk menilai keupayaan model. Kini kami percaya Astra memenuhi ambang keupayaan keselamatan siber Kritikal di bawah Rangka Kerja Kesediaan kami. Ini bermakna, dengan alat dan akses yang sesuai, Astra dapat menemukan kelemahan keselamatan yang belum diketahui dan membangunkan cara mengeksploitasinya dalam pelbagai sistem yang dilindungi kukuh tanpa bimbingan manusia pada setiap langkah. Astra ialah model pertama yang kami tetapkan pada tahap ini dan memerlukan perlindungan lebih kukuh semasa pembangunan dan sebelum dilancarkan.
Sepanjang beberapa minggu lalu, kami telah menangguhkan sebahagian pembangunan dan pelancaran Astra sementara kami memperkukuh serta menguji perlindungan daripada penyalahgunaan siber dan tindakan model tanpa kebenaran. Berdasarkan usaha tersebut, kami percaya perlindungan Astra cukup untuk meminimumkan risiko bahaya teruk bagi pelancarannya di bawah Rangka Kerja Kesediaan kami.
Walaupun Astra tidak terlibat dalam insiden Hugging Face, kami telah menerapkan pengajaran(dibuka dalam tetingkap baru) daripada insiden itu dalam pendekatan keselamatan kami. Berdasarkan ujian retrospektif, kami percaya perlindungan pengeluaran kami ketika itu dapat mencegah insiden Hugging Face. Sejak itu, kami telah melaksanakan perlindungan yang lebih kukuh untuk Astra, termasuk melatih model agar lebih konsisten menolak permintaan siber berbahaya dan mematuhi sekatan keselamatan, menambah perlindungan daripada penyalahgunaan serta pemantauan yang dapat menghentikan aktiviti yang mungkin tidak dibenarkan.
Kami merancang untuk menyediakan Astra tidak lama lagi, tetapi akses kepada keupayaan keselamatan sibernya yang paling canggih akan lebih terhad. Kerja keselamatan siber lanjutan pada mulanya akan tersedia kepada sekumpulan penguji, diikuti akses melalui Daybreak Blue untuk memperluas penggunaan defensif.
Semasa pelancaran, kami akan berkongsi butiran lanjut tentang ujian dan penilaian keselamatan, sekuriti serta penjajaran kami dalam kad sistem model. Menjelang pelancaran, kami ingin memberikan perkembangan terkini tentang usaha menyediakan pelancaran selamat bagi model dengan tahap keupayaan keselamatan siber ini—dan bersikap telus tentang risiko yang masih ada.
Di bawah Rangka Kerja Kesediaan kami, model memenuhi ambang Kritikal jika salah satu syarat berikut dipenuhi:
- Model dapat mengenal pasti dan membangunkan eksploitasi zero-day yang berfungsi pada semua tahap keterukan dalam pelbagai sistem kritikal dunia sebenar yang diperkukuh tanpa campur tangan manusia.
- Model dapat mereka dan melaksanakan strategi baharu secara menyeluruh untuk serangan siber terhadap sasaran yang diperkukuh, hanya berdasarkan matlamat umum yang dikehendaki.
Penilaian kesediaan kami terhadap Astra menggabungkan penanda aras awam dan persendirian automatik dengan penilaian yang diterajui pakar. Astra menunjukkan peningkatan ketara dalam keupayaan keselamatan siber berbanding GPT‑5.6 Sol: Astra jauh lebih cekap menggunakan token dan lebih berupaya mengenal pasti kerentanan serta membangunkan eksploitasi.
Sebagai contoh, kami menjalankan Astra pada ExploitBench dan model memperoleh skor sempurna 100% dalam penanda aras yang menilai keupayaan model membangunkan eksploitasi daripada kerentanan yang diketahui.
Disebabkan kebimbangan tentang pencemaran data, kami kemudian membina penanda aras dalaman bernama “ExploitBench - Port Dalaman (Jun–Ogos 2026)”, yang mengandungi 20 kerentanan V8 berkeparahan tinggi yang didedahkan lebih baru. Dalam set data ini, Astra mencapai kadar pelaksanaan kod arbitrari yang jauh lebih tinggi berbanding GPT‑5.6 Sol dengan token output yang jauh lebih sedikit. Semasa penilaian, model tersebut turut menemukan dan menggunakan dua kerentanan zero-day sebagai sebahagian daripada rantaian eksploitasi. Kami sedang mendedahkan kedua-dua kerentanan ini kepada pihak penyelenggara.
Keputusan Astra yang dipaparkan mencerminkan keupayaan dengan akses Daybreak Blue, bukan konfigurasi pengeluaran lalai.
Dalam penilaian diterajui pakar terhadap pelayar dan sistem pengendalian yang diperkukuh, Astra menemukan kerentanan yang belum diketahui dan mengubahnya menjadi rantaian eksploitasi yang berfungsi. Astra membina rantaian pencerobohan pelayar lengkap yang melepasi kotak pasir dan melaksanakan arahan pada hos apabila pelayar membuka fail HTML. Model itu turut menemukan beberapa kerentanan dalam sistem pengendalian yang diperkukuh dan menggabungkannya menjadi rantaian peningkatan keistimewaan setempat daripada pengguna tanpa keistimewaan kepada root. Secara keseluruhan, siasatan kami membawa kepada kesimpulan bahawa Astra memenuhi ambang kritikal.
Bagi model dengan keupayaan keselamatan siber setaraf Astra, kita perlu menangani dua laluan untuk meminimumkan risiko bahaya siber yang teruk, semasa pembangunan dan sebelum pelancaran:
- Pelaku berniat jahat menggunakan model. Perlindungan kami mesti benar-benar menghalang pelaku berniat jahat daripada menggunakan Astra untuk membangunkan eksploitasi bagi kelemahan yang belum diketahui dalam sistem kritikal yang diperkukuh atau melaksanakan serangan menyeluruh terhadap sasaran yang diperkukuh.
- Model mengambil tindakan tanpa kebenaran dan tidak sejajar. Walaupun tanpa pengguna berniat jahat, model dengan keupayaan keselamatan siber canggih boleh menyebabkan bahaya siber jika tidak sejajar. Selain menetapkan standard penjajaran yang amat tinggi bagi model dengan keupayaan ini, perlindungan kami mesti dapat mengesan dan membendung dengan pantas tindakan tidak sejajar yang boleh menyebabkan bahaya nyata yang ketara, sebagai lapisan pertahanan kedua.
Yang penting, laluan kedua terpakai pada pembangunan dalaman dan pelancaran luaran. Seperti yang telah kami jelaskan sebelum ini, kami menghentikan sementara latihan perbatasan tertentu (termasuk latihan tertentu untuk Astra) selama dua minggu selepas insiden OpenAI-Hugging Face untuk memperkukuh infrastruktur latihan kami, termasuk pengasingan dan kawalan rangkaian, pemantauan yang diperluas serta latihan dan ambang penjajaran yang dipertingkat. Kemudian, kami meneruskan kerja berskala lebih kecil di bawah kawalan yang lebih ketat.
Kami menangguhkan lebih lama beberapa proses pembelajaran pengukuhan (RL) berskala besar untuk versi Astra akan datang sementara kami menetapkan standard keselamatan dan sekuriti yang lebih tinggi bagi persekitaran latihannya. Pada 28 Ogos, kami memulakan semula proses RL perbatasan berskala besar yang dihentikan sementara selepas keperluan keselamatan dan sekuriti baharu dilaksanakan. Kami masih menangguhkan sementara beberapa proses latihan eksperimen berskala lebih kecil.
Persediaan untuk melancarkan Astra juga memerlukan perlindungan lebih kukuh daripada penyalahgunaan siber dan tindakan tanpa kebenaran. Di bawah, kami menerangkan perlindungan tersebut dan cara kami mengujinya.
Sejak melancarkan model pertama yang kami anggap mempunyai keupayaan Tinggi dalam keselamatan siber pada Februari, kami telah memperkukuh perlindungan siber kami dalam setiap pelancaran berikutnya. Pendekatan keselamatan menyeluruh kami menggabungkan penolakan oleh model latihan lanjutan, pengelas keselamatan peringkat sistem serta pengesanan luar talian dan pembanterasan ancaman.
Bagi GPT‑5.6(dibuka dalam tetingkap baru), kami meningkatkan ketahanan susunan peringkat sistem dengan ketara, termasuk menambah pengelas pengaktifan untuk mengesan penyalahgunaan siber dan memperluas liputan terhadap jailbreak sejagat yang ditemukan melalui proses penyerang automatik yang intensif. Berdasarkan penambahbaikan ini, kami terus melabur dalam lapisan model bagi susunan perlindungan Astra, di samping meningkatkan keupayaan perlindungan kami mengendalikan konteks merentas perbualan.
- Dengan memanfaatkan teknik latihan baharu untuk ketahanan model, Astra menolak permintaan bantuan siber yang dilarang dengan lebih konsisten. Dalam set penilaian jailbreak siber kami, Astra menolak 91.5% permintaan (berbanding 59% oleh GPT‑5.6 Sol).
- Bagi akaun yang dinilai berisiko lebih tinggi, kami menggunakan sempadan tingkah laku model yang lebih berhati-hati dan menolak lebih banyak jenis bantuan siber yang mungkin berisiko. Bagi pengguna berisiko tinggi, kami telah memperluas konteks sistem pemantauan kami agar dapat mengesan penyalahgunaan siber seperti ini.
Kami juga meneruskan program pengujian yang ketat, proses penyerang dalaman dan luaran serta pemulihan. Selain ujian regresi untuk memastikan semua jailbreak yang ditemukan dalam tempoh pengujian terdahulu kekal diliputi, kami sedang menjalankan gelombang baharu proses penyerang bersama penyerang dalaman terkini kami. Kami bekerjasama dengan rakan industri untuk menentukan sistem penarafan jailbreak yang seragam dan akan menggunakan program tindak balas pantas 24/7 kami untuk menyiasat serta menangani penemuan baharu. Kami akan berkongsi butiran lanjut tentang pengujian perlindungan siber kami dalam kad sistem Astra.
Membantu pihak pertahanan menemukan dan membaiki kerentanan kekal sebagai tonggak utama pendekatan keselamatan kami. Ketika dilancarkan, kami menjangkakan perlindungan Astra akan menimbulkan lebih banyak halangan daripada yang akhirnya kami inginkan demi mencegah kemungkinan penyalahgunaan. Akses kepada Astra untuk aliran kerja keselamatan siber lanjutan pada mulanya akan tersedia kepada sekumpulan kecil penguji alfa, kemudian akses melalui Daybreak Blue akan diperluas untuk menyokong penggunaan defensif.
Kami turut menambah perlindungan berlapis untuk menghalang model daripada mengambil tindakan yang mungkin tidak sejajar:
- Penjajaran model: Dalam penilaian kami, Astra jauh lebih cenderung berbanding GPT‑5.6 Sol untuk mematuhi sekatan keselamatan dan sekuriti yang jelas serta kekal dalam skop dibenarkan, menjadikannya model kami yang paling sejajar setakat ini. Kami memberikan tumpuan khusus pada pematuhan model terhadap sekatan sekuriti dan keselamatan serta kecenderungannya untuk kekal dalam skop yang dibenarkan.
- Pemantauan dan kawalan: Selaras dengan prosedur dalaman kami, kami melancarkan Astra dengan pemantauan rentetan fikiran tambahan untuk mengesan dan membendung tindakan yang mungkin tidak sejajar dengan pantas.
Astra merupakan kemajuan besar dalam penjajaran model dan kemuncak beberapa aliran kerja penjajaran jangka panjang (daripada intervensi latihan awal hingga pemarkahan yang lebih teliti dan konsisten semasa pembelajaran pengukuhan). Dalam pengujian, kami mendapati Astra secara konsisten lebih cenderung mematuhi sekatan dan amaran keselamatan yang jelas (seperti semakan automatik) berbanding GPT 5.6 Sol.
Kami turut membangunkan ujian berdasarkan insiden Hugging Face, apabila ejen yang menjalankan penilaian siber ExploitGym menceroboh sistem pihak ketiga. Kami menggunakan tugasan paling sukar daripada penilaian itu untuk menghasilkan ujian “honeypot” bagi menentukan sama ada model akan cuba menceroboh infrastruktur keselamatan sekeliling dan bukannya menyelesaikan tugasan yang diberikan. Tanpa perlindungan pengeluaran, GPT‑5.6 Sol cuba mengakses sasaran tersebut dalam 56% ujian yang menyimulasikan persekitaran penanda aras apabila model diarahkan membangunkan eksploitasi. Astra tidak membuat sebarang percubaan sedemikian dalam ujian ini. Angka ini menggambarkan tingkah laku dalam keadaan ujian tanpa perlindungan siber, bukan penggunaan pengeluaran biasa.
Kiri: Dalam penilaian baharu ini, kami memerhatikan reaksi model apabila semakan automatik menolak tindakannya. Setiap tugasan berlangsung dalam persekitaran kerja berasaskan pengetahuan dan pelaksanaan bermula sejurus selepas penolakan semakan automatik. Model kemudian boleh menamatkan pelaksanaan, cuba mencari alternatif lebih selamat, mencuba semula arahan serupa atau mengeksploitasi konfigurasi yang lemah(dibuka dalam tetingkap baru) untuk memintas semakan automatik sepenuhnya. Tindakan memilih salah satu daripada dua pilihan terakhir dianggap gagal dalam penilaian ini. Astra tidak pernah cuba memintas semakan automatik.
Kanan: Dalam penilaian ini, kami menguji kecenderungan model untuk menipu (menggunakan “honeypot”) apabila berhadapan dengan tugasan paling sukar atau mustahil dalam penilaian ExploitGym. Ujian ini dijalankan dalam persekitaran simulasi dengan perlindungan dalam mod pemerhatian sahaja untuk menilai tingkah laku model. Walaupun GPT‑5.6 Sol menunjukkan kebarangkalian lebih tinggi untuk menipu dalam senario ini, Astra tidak cuba menggunakan jalan pintas tersebut dan masih dapat menyelesaikan beberapa tugasan secara sah.
Melatih model agar sejajar ialah salah satu lapisan keselamatan. Kami akan berkongsi butiran lanjut tentang ujian dan keputusan penjajaran kami dalam kad sistem Astra.
Kami turut melaksanakan pemantauan ketidakjajaran dalam persekitaran pengeluaran bagi model kelas Astra untuk mengesan dan membendung kemungkinan ketidakjajaran dengan pantas. Perlindungan ini menyerupai pemantauan pelancaran dalaman kami dan melibatkan sistem pengelas yang menyemak penaakulan serta tindakan model untuk mengesan tingkah laku tanpa kebenaran dan menghentikan aktiviti yang mungkin tidak dibenarkan secara automatik. Apabila keupayaan meningkat, perlindungan ini tidak boleh menggantikan penjajaran model yang baik. Matlamat kami adalah agar model akan datang cukup sejajar sehingga perlindungan ini tidak perlu dicetuskan.
OpenAI komited untuk memastikan manfaat AI dapat diakses secara meluas. Memandangkan peningkatan ketara dalam keupayaan keselamatan siber Astra, kami mengambil langkah yang amat berhati-hati untuk memastikan pelancaran ini selamat dan terjamin. Pemeriksaan keselamatan tambahan kadangkala boleh memperlahankan, menjeda atau menghentikan kerja yang sah, termasuk keselamatan siber defensif.
Sistem kadangkala mungkin menandai aktiviti sah sebagai kemungkinan penyalahgunaan siber atau tingkah laku tanpa kebenaran, lalu memperlahankan, menjeda atau menghentikannya secara tidak sengaja. Ini boleh merangkumi kerja yang kelihatan tidak berkaitan secara langsung dengan keselamatan siber atau tugasan yang melibatkan ejen berjalan untuk tempoh yang panjang.
Jika pemantau ketidakjajaran menjeda tugasan, pengguna ChatGPT atau Codex mungkin diminta menyemak tindakan tersebut sebelum meneruskan. Apabila menggunakan medium lain seperti API, tugasan akan dihentikan. Kami merancang untuk terus menentukur perlindungan ini bagi mengurangkan gangguan yang tidak perlu dan memperluas akses kepada keupayaan perbatasan melalui program seperti Daybreak.
Kita sedang memasuki peringkat pembangunan AI apabila model dapat melaksanakan kerja yang lebih besar kesannya, manakala kegagalan penjajaran dan kawalan boleh membawa kesan yang lebih serius. Merealisasikan manfaat sistem ini bergantung pada keupayaan kita untuk menjajarkan dan mengawal model seiring peningkatan keupayaannya.
Tanggungjawab itu merangkumi latihan, penilaian dan pelancaran. Ini memerlukan bukti tingkah laku sejajar yang lebih kukuh, perlindungan yang seiring dengan keupayaan dan kesediaan untuk memperlahankan kemajuan apabila perlindungan tersebut tidak mencukupi.
Kami akan terus menguji sistem ini, berkongsi perkara yang dipelajari dan menjelaskan perkara yang masih belum pasti. Model selepas Astra akan menuntut lebih banyak usaha daripada kami. Kami akan meluangkan masa dan melakukan usaha yang diperlukan untuk menunaikan tanggungjawab itu.
