GPT‑Red: Membuka Peningkatan kendiri untuk Keteguhan
Melatih proses penyerang keselamatan automatik yang kuat untuk meningkatkan keteguhan.
Ringkasan
Masalah
Proses penyerang penting untuk menemui kerentanan dan meningkatkan keteguhan model kami. Namun, pendekatan semasa tidak berskala, lalu mewujudkan kesesakan.
Penilaian keteguhan yang lazim digunakan sudah pun ditepukan oleh model terbaharu kami.
Kami perlu membangunkan kaedah yang membolehkan keselamatan dan penjajaran meningkat seiring dengan keupayaan model.
Apa yang kami lakukan
Kami melatih GPT‑Red, model proses penyerang automatik yang meningkatkan keupayaan kami mencari kerentanan supaya kami boleh membaikinya sebelum pelancaran yang lebih luas.
GPT‑Red ialah proses penyerang yang kuat dan model terdahulu kami sangat terdedah kepada serangan suntikan promnya.
Kami menggunakan GPT‑Red untuk melatih GPT‑5.6 secara adversarial, menjadikannya jauh lebih teguh terhadap suntikan prom.
Kami akan terus menskalakan pendekatan ini bersama proses penyerang manusia dan pihak ketiga, perlindungan berlapis, serta pemantauan masa nyata.
Sistem AI lazimnya menemui data pihak ketiga melalui pelayar, aplikasi bersambung, fail setempat dan alat lain. Keupayaan ini diperlukan untuk melaksanakan tugasan dunia sebenar, tetapi ia juga mewujudkan lebih banyak peluang untuk pelaku berniat jahat mempengaruhi tingkah laku model. Contohnya, pihak ketiga mungkin menyisipkan arahan yang direka dengan teliti—bertujuan memperdaya model supaya memuat naik data sensitif ke pelayan luaran—dalam e-mel, laman web, respons alat atau repositori kod.
Proses penyerang manusia ialah bahagian penting dalam kerja keselamatan kami, membantu kami menemukan kerentanan ini sebelum pelancaran dan menyediakan perlindungan yang betul. Namun, proses penyerang manusia sahaja sukar diskalakan. Mereka bentuk dan menjalankan latihan ini memakan banyak masa, lalu mengehadkan kepantasan kami mengenal pasti mod kegagalan baharu dan memasukkannya ke dalam perlindungan yang lebih kuat. Selain itu, walaupun latihan ini menghasilkan contoh berharga serangan yang berjaya, ia tidak dapat menjana jumlah dan kepelbagaian data adversarial yang diperlukan untuk meningkatkan keteguhan model melalui latihan.
Untuk mengimbangi model yang semakin berkeupayaan, proses penyerang juga perlu diskalakan. Bagi tujuan ini, kami telah melatih model proses penyerang automatik khusus dalaman yang menemukan kerentanan sebelum pelancaran dan menjana serangan semasa latihan model untuk meningkatkan keteguhan. Kami percaya proses penyerang automatik membuka bentuk peningkatan kendiri yang penting untuk keselamatan: menggunakan model hari ini untuk membantu secara langsung menjadikan model masa depan lebih selamat.
GPT‑Red ialah kemuncak usaha ini dan model proses penyerang keselamatan automatik terbaik kami setakat ini. Sama seperti proses penyerang manusia mereka serangan, model ini bergerak ke arah matlamat dengan menghantar prom, memerhati cara model GPT bertindak balas, lalu mengulang kaji. Kami melatih GPT‑Red pada skala pengiraan setanding beberapa pascalatihan terbesar kami yang dijalankan di OpenAI—jumlah pengiraan yang belum pernah berlaku, dikhususkan semata-mata untuk meningkatkan keselamatan.
Kami menggabungkan GPT‑Red secara langsung ke dalam proses latihan model produksi kami. Hasilnya, GPT‑5.6 Sol ialah model kami yang paling teguh terhadap suntikan prom setakat ini, dengan 6x kurang kegagalan pada penanda aras suntikan prom langsung kami yang paling sukar berbanding model produksi terbaik kami hanya empat bulan sebelumnya. Kebolehskalaan pendekatan kami membuat kami teruja menantikan hasil yang lebih kuat pada masa depan sambil kami terus melatih proses penyerang yang lebih kuat.
GPT‑Red dilatih menggunakan pembelajaran pengukuhan main sendiri, iaitu model dan sekumpulan LLM pertahanan yang pelbagai dilatih serentak pada pelbagai senario proses penyerang. GPT‑Red diberi ganjaran apabila mencetuskan kegagalan yang sah, seperti suntikan prom yang berjaya, manakala model pertahanan diberi ganjaran kerana menahan serangan dan menyiapkan tugasan asalnya. Apabila pertahanan menjadi lebih teguh, GPT‑Red terpaksa menemui serangan yang lebih kuat dan lebih pelbagai.
Untuk menyokong latihan main sendiri, kami membina set senario realistik yang luas, tempat suntikan prom mungkin disisipkan. Setiap persekitaran mempunyai model ancaman yang menentukan perkara yang boleh dikawal oleh GPT‑Red dan apa yang dikira sebagai serangan berjaya. Contohnya, GPT‑Red mungkin mengawal sebahagian fail setempat, sepanduk laman web, isi e-mel atau output alat.
Pada akhir latihannya, GPT‑Red menjadi penyerang yang sangat kuat: ia boleh menewaskan hampir semua model yang diuji dengannya, termasuk model dalaman dan produksi sehingga GPT‑5.5. Selepas GPT‑Red menamatkan latihan, kami menggunakannya untuk menjana suntikan prom bagi latihan GPT‑5.6, lalu menjadikan model itu sangat tahan terhadap serangan GPT‑Red.
Kami mengasingkan GPT‑Red daripada model yang kami gunakan. Ini memastikan keupayaan berniat jahat yang kami latih khusus dalam GPT‑Red tidak jatuh ke tangan pelaku yang bermusuhan, sambil menerapkan keteguhan dalam model produksi kami.
GPT‑Red amat berkesan terhadap populasi model pertahanan dan senario proses penyerang yang digunakan untuk melatihnya. Kami juga menilai sama ada model ini berguna sebagai ejen proses penyerang serba guna untuk memberi manfaat keselamatan secara lebih meluas di OpenAI. Untuk itu, kami menguji keberkesanan GPT‑Red dalam persekitaran keselamatan baharu dan model sasaran baharu.
Mula-mula kami menilai keupayaan GPT‑Red untuk membuat keputusan kepada senario proses penyerang baharu menggunakan versi replikasi arena suntikan prom tidak langsung daripada Dziemian et al. (2025)(dibuka dalam tetingkap baru). Dalam cabaran ini, proses penyerang manusia dan GPT‑Red masing-masing mencadangkan serangan terhadap GPT‑5.1 pada satu set persekitaran yang telah ditetapkan. Senario dan matlamat proses penyerang ini berbeza daripada yang digunakan untuk melatih GPT‑Red. GPT‑Red mencapai kadar kejayaan serangan yang jauh lebih tinggi, berjaya dalam 84% senario berbanding 13% untuk manusia.
GPT‑Red cemerlang sebagai proses penyerang automatik. GPT‑Red mampu menjana serangan yang berjaya terhadap GPT‑5.1 dalam jauh lebih banyak senario berbanding proses penyerang manusia di arena suntikan prom tidak langsung daripada Dziemian et al. (2025) menggunakan cerminan dalaman.
Ujian muktamad bagi seorang proses penyerang ialah keupayaan mencapai matlamat berniat jahat yang disasarkan terhadap sistem agentic dunia sebenar dengan pengetahuan yang tidak lengkap tentang model asas dan reka bentuk abah-abah sistem itu. Eksperimen pertama kami dalam tetapan ini mempertemukan GPT‑Red dengan mesin layan diri berkuasa AI di pejabat OpenAI (serupa dengan Project Vend(dibuka dalam tetingkap baru)) yang dihasilkan oleh Andon Labs. Kami memberikan GPT‑Red huraian sistem serta keupayaan menghantar serangan dan memerhati panggilan alat daripada ejen simulasi yang hampir mencerminkan penggunaan dunia sebenar. Selepas mengulang kaji serangan, GPT‑Red melancarkan serangannya terhadap ejen produksi dan mencapai ketiga-tiga objektif berniat jahatnya:
- Menukar harga item mahal yang ada dalam stok kepada harga minimum dibenarkan, iaitu $0.50;
- Memesan item baharu bernilai $100+ dan menawarkannya pada harga $0.50; dan
- Membatalkan pesanan pelanggan lain.
Kami telah mendedahkan kerentanan ini, dan perlindungan baharu sedang giat diuji.
GPT‑Red mampu menewaskan ejen autonomi langsung bernama Vendy yang mengurus mesin layan diri. GPT‑Red berjaya menyebabkan ejen produksi menukar item mahal menjadi murah dan membatalkan pesanan pelanggan lain, dengan menguji terlebih dahulu dalam simulasi lalu memindahkan serangan kepada ejen langsung.
Kami juga menggunakan GPT‑Red untuk menyerang ejen Codex CLI (berasaskan GPT‑5.4 mini) pada set 10 senario pengekstrakan data yang diasingkan. Kami membandingkan model ini dengan garis dasar GPT‑5.5 prom untuk mengkaji kesan prosedur latihan kami terhadap prestasi proses penyerang yang diasingkan. GPT‑Red lebih berkesan kerana ia berjaya membuat ejen mengekstrak data sensitif dalam lebih banyak senario, dan juga lebih cekap token.
GPT‑Red lebih berkesan dan cekap dalam menewaskan ejen codex langsung. Kami mengujinya terhadap ejen codex yang disokong oleh GPT‑5.4 Mini pada set tersuai 10 tugasan pengekstrakan data.
Matlamat utama GPT‑Red ialah meningkatkan keteguhan model kami. Dalam enam bulan lalu, kami telah melatih model proses penyerang yang semakin kuat (pendahulu GPT‑Red) dengan pengiraan yang semakin meningkat, dan menggunakan model ini dalam latihan setiap model produksi berturut-turut sejak GPT‑5.3. Dari semasa ke semasa, setiap keluaran GPT seterusnya menjadi lebih teguh.
Sebagai contoh, versi awal GPT‑Red menemukan kelas baharu serangan suntikan prom langsung yang dikenali sebagai serangan “Rentetan Fikiran Palsu”. Serangan ini mencapai kadar kejayaan melebihi 95% pada GPT‑5.1 tetapi kini di bawah 10% untuk GPT‑5.6 Sol. Begitu juga, beberapa penanda aras suntikan prom tidak langsung kami yang menyasarkan serangan dalam alat pembangun dan pelayaran telah ditepukan oleh model terbaharu kami (>97% ketepatan).
Keteguhan terhadap GPT‑Red sendiri juga telah meningkat dengan ketara. Dalam set persekitaran keteguhan yang luas, kadar kejayaan serangan GPT‑Red telah menurun secara ekanada dari semasa ke semasa. Dengan keluaran model terbaharu kami, GPT‑5.6 Sol gagal pada hanya 0.05% suntikan prom langsung GPT‑Red.
Apabila kami terus meningkatkan skala latihan main sendiri untuk suntikan prom, kami menemui ancaman baharu yang boleh menewaskan model yang sedia ada. Namun, penskalaan kami juga banyak membantu meningkatkan keteguhan terhadap serangan ini. Kadar kejayaan serangan dikira sebagai purata kejayaan percubaan merentas semua percubaan oleh GPT‑Red dalam persekitaran yang diasingkan.
Sesuatu model boleh kelihatan lebih selamat dengan menolak lebih banyak permintaan atau menjadi kurang berkeupayaan. Model yang melakukan lebih sedikit perkara sememangnya lebih sukar diserang, tetapi itu bukan keteguhan yang berguna.
Kami menilai secara menyeluruh kedua-dua keupayaan perbatasan umum serta tugasan penolakan berlebihan bersasar yang kami reka. Kami mendapati semua keupayaan biasa kekal tidak terjejas sambil keteguhan meningkat dengan ketara. Ini menunjukkan bahawa peningkatan keteguhan datang daripada rintangan yang lebih baik terhadap arahan berniat jahat, bukan penggunaan alat yang tidak wajar atau penolakan lalai terhadap permintaan yang sah.
Ejen AI sudah pun digunakan untuk meningkatkan keupayaan model generasi seterusnya kami. Kami percaya bahawa dengan GPT‑Red, kami telah mula membuka kitaran pengukuhan serupa untuk keselamatan, yang membolehkan model hari ini digunakan untuk menjadikan model esok lebih teguh, sejajar dan boleh dipercayai. Kami akan terus menskalakan pengiraan dan data sambil membuat penambahbaikan algoritma, untuk melatih versi GPT‑Red masa depan yang lebih kuat daripada model hari ini. Seterusnya, model ini akan membantu menjadikan keluaran GPT masa depan lebih selamat.
Kami akan mengeluarkan pracetak dengan butiran lanjut pada hujung minggu ini.


