Langkau ke kandungan utama
OpenAI

3 September 2026

Keselamatan

Gambaran keselamatan: GPT‑6 Astra

Memuat…

Hari ini, kami melancarkan GPT‑6 Astra, model paling berkeupayaan yang pernah kami gunakan secara meluas. Astra ialah model pertama kami yang mencapai tahap Kritikal bagi keupayaan keselamatan siber di bawah Rangka Kerja Kesediaan kami.

Perkara paling penting yang perlu diketahui tentang keselamatan pelancaran ini adalah seperti berikut:

  1. GPT‑6 Astra merupakan peningkatan besar dalam keupayaan siber dan memenuhi ambang Kritikal kami. Ini bermakna bahawa dengan alat dan akses yang sesuai, GPT‑6 Astra boleh menemukan kelemahan keselamatan yang sebelum ini tidak diketahui dan membangunkan cara baharu untuk mengeksploitasinya merentasi pelbagai sistem yang dilindungi dengan baik, tanpa memerlukan seseorang untuk membimbing setiap langkah. Oleh itu, kami telah memperkukuh dengan ketara perlindungan terhadap tindakan siber berbahaya oleh model, sama ada disebabkan penyalahgunaan atau ketidakjajaran. Kami juga mengambil langkah untuk melindungi pembangunan dan penggunaan dalaman Astra serta model serupa, termasuk pengasingan yang lebih ketat, penyulitan titik semak, pemantauan menyeluruh terhadap trajektori penuh termasuk rantaian pemikiran (CoT), serta proses penilaian penjajaran yang menyekat penggunaan dalaman terlebih dahulu.
  2. GPT‑6 Astra jauh lebih teguh berbanding pendahulunya. Dengan menerapkan teknik latihan keselamatan keteguhan yang baharu, GPT‑6 Astra jauh lebih tahan terhadap jailbreak berbanding GPT‑5.6 Sol, termasuk sepanjang trajektori yang lebih panjang. Kami mengetahui hal ini melalui ujian luar talian serta program pengujian dan pemulihan jailbreak dalaman dan luaran yang ketat. Bagi pengguna yang ditandai sebagai berpotensi berisiko tinggi, kami turut melatih keupayaan untuk melaraskan sempadan penolakan model supaya lebih berhati-hati dan merangkumi lebih banyak risiko dwiguna. Kami menggunakan ujian regresi untuk memastikan Astra tahan terhadap jailbreak yang ditemukan dalam tempoh pengujian terdahulu. Kami juga menjalankan pusingan baharu proses penyerang automatik menggunakan penyerang dalaman terkini kami untuk mengesahkan penambahbaikan tersebut.
  3. GPT‑6 Astra mempunyai penjajaran yang lebih baik berbanding GPT‑5.6 Sol. Astra merupakan kemajuan besar dalam penjajaran model, dengan penambahbaikan daripada komposisi data latihan awal kami hinggalah pemarkahan semasa pembelajaran pengukuhan. Kami melaporkan set penilaian penjajaran baharu(dibuka dalam tetingkap baru) dan mendapati bahawa GPT‑6 Astra lebih baik dalam mematuhi sempadan keselamatan dan kekal dalam skop yang dibenarkan. Dalam simulasi yang menggunakan lebih daripada 54,000 tugas Codex dalaman(dibuka dalam tetingkap baru), Astra juga menerima kira-kira separuh bilangan tanda bagi tingkah laku tidak sejajar berkeparahan tinggi berbanding Sol.
  4. Kami melaksanakan pemantauan ketidakjajaran secara meluas. Kami menganggap penjajaran model sebagai mekanisme utama untuk mencegah kemungkinan tingkah laku tidak sejajar daripada model kami. Namun, pemantauan memberikan gambaran luas tentang tingkah laku model perbatasan, sekali gus mendedahkan peluang untuk terus meningkatkan penjajaran dan keselamatan. Selain itu, pemantauan menyediakan lapisan perlindungan tambahan terhadap tingkah laku tidak sejajar yang dikesan. Atas sebab ini, kami turut menambahkan pemantauan ketidakjajaran pada semua inferens yang menggunakan alat dalam penggunaan luaran Astra, walaupun melibatkan kos pengkomputeran yang tinggi. Sistem ini serupa dengan persediaan dalaman kami.
  5. Kebolehpantauan GPT‑6 Astra telah menurun berbanding GPT‑5.6 Sol. Kami telah menjalankan penyiasatan menyeluruh terhadap kebolehpantauan(dibuka dalam tetingkap baru) dan kebolehkawalan(dibuka dalam tetingkap baru) GPT‑6 Astra. Kami mendapati bahawa GPT‑6 Astra lebih mampu mengawal CoT sendiri berbanding GPT‑5.6 Sol dan kurang berkemungkinan memasukkan maklumat yang membuktikan kesalahan dalam CoT. Dalam keadaan adversarial (apabila kami mendorong model untuk mengelak pemantau kami), kami mendapati bahawa model mampu kekal tidak dikesan apabila sengaja menunjukkan prestasi rendah dalam penilaian (medan ujian), dan kadangkala boleh mengelak pemantau dalaman kami apabila diminta melaksanakan tugas sabotaj tertentu(dibuka dalam tetingkap baru). Kami tidak menemukan bukti penaakulan CoT secara steganografi (contohnya, menyembunyikan penaakulan sulit dalam teks biasa yang kelihatan tidak berkaitan), yang menunjukkan bahawa risiko pengelakan mungkin sebahagian besarnya terbatas kepada tugas penaakulan peringkat rendah.
    • Penemuan ini menunjukkan bahawa model dalam kelas Astra boleh mengelak pemantau CoT kami dalam keadaan adversarial. Buat masa ini, penemuan ini sebahagian besarnya berdasarkan penilaian adversarial (iaitu apabila kami mengarahkan model supaya mengelak pemantauan). Secara keseluruhan, penilaian penjajaran kami menunjukkan bahawa Astra kurang berkemungkinan melanggar sekatan keselamatan berbanding GPT‑5.6 Sol.
    • Namun, kami memandang serius trend ini dan terus menyiasat penemuan tersebut serta implikasinya terhadap kebolehpantauan apabila model kami menjadi semakin berkeupayaan. OpenAI telah berusaha mengekalkan dan memanfaatkan pemantauan rantaian pemikiran, dan mengekalkan kebolehpantauan CoT ialah matlamat teras program penyelidikan ini. Namun, hasil ini turut menekankan pentingnya membangunkan teknik audit penjajaran yang tidak hanya memeriksa rantaian pemikiran model.
  6. GPT‑6 Astra mengendalikan pelayaran dan persekitaran tempat kerja dengan lebih bertanggungjawab: GPT‑6 Astra jauh lebih tahan terhadap suntikan prom berbanding GPT‑5.6 Sol. Kami turut menguji tingkah laku model dalam persekitaran pelayaran dan komputer profesional yang realistik. Kami mendapati bahawa model jauh kurang berkemungkinan melakukan tindakan yang tidak sejajar dan berpotensi merosakkan berbanding GPT‑5.6 Sol, seperti transaksi tanpa kebenaran, kehilangan data, akses berlebihan atau pemintasan kawalan. Model ini juga bertindak dengan lebih selamat apabila mengendalikan permintaan berbahaya dalam persekitaran berasaskan ejen, seperti permintaan untuk membantu merancang serangan ganas atau melakukan penipuan.
  7. GPT‑6 Astra jauh lebih selamat dalam senario berisiko tinggi. GPT‑6 Astra memberikan respons yang lebih selamat berbanding GPT‑5.6 Sol terhadap permintaan mencabar daripada penggunaan sebenar dan proses penyerang oleh manusia. Astra mencapai peningkatan Pareto dalam menyelesaikan permintaan tidak selamat dengan selamat sambil mengelakkan penolakan yang tidak perlu terhadap permintaan tidak berbahaya. Penambahbaikan ini turut merangkumi senario berkeparahan tinggi yang risiko bahayanya timbul daripada konteks lebih luas dan bukannya permintaan yang jelas. Astra juga menerapkan sempadan keselamatan yang sesuai dengan usia secara lebih konsisten bagi pengguna bawah 18 tahun.