Langkau ke kandungan utama
OpenAI

22 Disember 2025

Perlindungan

Sentiasa mengukuhkan ChatGPT Atlas terhadap serangan suntikan gesaan

Pasukan merah automatik—dikuasakan oleh pembelajaran pengukuhan—membantu kami secara proaktif menemui dan menampal eksploitasi ejen dunia sebenar sebelum ia dijadikan senjata di alam nyata.

Memuat…

Mod ejen dalam ChatGPT Atlas adalah salah satu ciri ejen yang paling serba guna yang kami keluarkan setakat ini. Dalam mod ini, ejen pelayar melihat laman web dan melakukan tindakan, klik, dan penekanan kekunci di dalam pelayar anda, sama seperti yang anda lakukan. Ini membolehkan ChatGPT berfungsi secara langsung pada banyak aliran kerja harian anda dengan menggunakan ruang, konteks dan data yang sama.

Apabila ejen pelayar membantu anda menyelesaikan lebih banyak kerja, ia juga menjadi sasaran bernilai tinggi bagi serangan adversarial. Ini menjadikan keselamatan AI sangat penting. Lama sebelum kami melancarkan ChatGPT Atlas, kami telah secara berterusan membina dan memperkukuhkan pertahanan terhadap ancaman yang muncul yang secara khusus menyasarkan paradigma baharu "ejen dalam pelayar" ini. Suntikan gesaan adalah salah satu risiko paling ketara yang kami aktif pertahankan untuk memastikan ChatGPT Atlas dapat beroperasi dengan selamat bagi pihak anda. 

Sebagai sebahagian daripada usaha ini, kami baru-baru ini menghantar kemas kini keselamatan kepada ejen pelayar Atlas, termasuk model yang baru dilatih secara berlawanan dan langkah-langkah perlindungan yang diperkukuh. Kemas kini ini didorong oleh kelas baru serangan suntikan gesaan yang ditemui melalui pasukan merah automatik dalaman kami.

Dalam siaran ini, kami menjelaskan bagaimana risiko suntikan gesaan boleh berlaku untuk ejen berasaskan web dan kami berkongsi kitaran tindak balas pantas yang telah kami bina untuk terus menemui serangan baharu dan menghantar pengurangan dengan cepat—seperti yang digambarkan oleh kemas kini keselamatan terkini ini.

Kami menganggap suntikan gesaan sebagai cabaran keselamatan AI jangka panjang dan kami perlu sentiasa memperkukuhkan pertahanan kami terhadapnya (sama seperti penipuan dalam talian yang sentiasa berkembang yang menyasarkan manusia). Kitaran tindak balas pantas terbaru kami menunjukkan potensi awal sebagai alat kritikal dalam perjalanan tersebut: kami menemui strategi serangan baharu secara dalaman sebelum ia muncul di alam nyata. Visi jangka panjang kami adalah untuk sepenuhnya memanfaatkan (1) akses kotak putih kami kepada model kami, (2) pemahaman mendalam tentang pertahanan kami, dan (3) skala pengiraan untuk mendahului penyerang luar—mencari kelemahan lebih awal, menghantar pengurangan lebih cepat dan sentiasa mengetatkan kitaran. Digabungkan dengan penyelidikan terdepan mengenai teknik baru untuk menangani suntikan gesaan dan pelaburan yang meningkat dalam kawalan keselamatan lain, kitaran penggabungan ini boleh menjadikan serangan semakin sukar dan mahal, secara material mengurangkan risiko suntikan gesaan di dunia nyata. Akhirnya, matlamat kami adalah agar anda dapat mempercayai ejen ChatGPT untuk menggunakan pelayar anda seperti cara anda mempercayai rakan sekerja atau kawan yang sangat cekap dan sedar keselamatan.

Suntikan gesaan sebagai cabaran terbuka untuk keselamatan ejen

Serangan suntikan prom menyasarkan ejen AI dengan memasukkan arahan berniat jahat ke dalam kandungan yang diproses oleh ejen. Arahan tersebut direka untuk mengatasi atau mengubah hala tingkah laku ejen—merampasnya untuk mengikuti niat penyerang, bukannya pengguna.

Untuk ejen pelayar seperti yang ada dalam ChatGPT Atlas, suntikan gesaan menambah vektor ancaman baru di luar risiko keselamatan web tradisional (seperti kesilapan pengguna atau kelemahan perisian). Daripada memancing data manusia atau mengeksploitasi kelemahan sistem pelayar, penyerang menyasarkan ejen yang beroperasi di dalamnya.

Sebagai contoh hipotesis, seorang penyerang boleh menghantar e-mel berniat jahat yang cuba menipu ejen untuk mengabaikan permintaan pengguna dan sebaliknya memajukan dokumen cukai sensitif kepada alamat e-mel yang dikawal oleh penyerang. Jika pengguna meminta ejen menyemak e-mel yang belum dibaca dan ringkaskan perkara penting, ejen mungkin akan memproses e-mel berniat jahat itu semasa aliran kerja. Jika ia mengikuti arahan yang disuntik, ia boleh menyimpang dari tugas—dan berkongsi maklumat sensitif secara salah.

Ini hanyalah satu senario tertentu. Perkara umum yang sama yang menjadikan ejen pelayar berguna juga menjadikan risikonya lebih luas: ejen mungkin menemui arahan yang tidak dipercayai merentasi kawasan permukaan yang secara efektif tidak terhad—e-mel dan lampiran, jemputan kalendar, dokumen yang dikongsi, forum, siaran media sosial dan halaman web sewenang-wenangnya. Memandangkan ejen boleh melakukan banyak tindakan yang sama seperti yang boleh dilakukan oleh pengguna dalam pelayar, kesan serangan yang berjaya secara hipotesis boleh menjadi sama luas: memajukan e-mel sensitif, menghantar wang, mengedit atau memadam fail di awan dan banyak lagi.

Kami telah mencapai kemajuan dalam mempertahankan diri daripada suntikan gesaan melalui pelbagai lapisan perlindungan, seperti yang telah kami kongsikan dalam siaran terdahulu. Walau bagaimanapun, suntikan gesaan kekal sebagai cabaran terbuka untuk keselamatan ejen dan kami menjangkakan untuk teruskan bekerja selama bertahun-tahun akan datang.

Penemuan serangan suntikan gesaan automatik melalui pembelajaran pengukuhan hujung ke hujung dan pengiraan tinggi

Untuk memperkukuhkan pertahanan kami, kami sentiasa mencari serangan suntikan gesaan baharu terhadap sistem ejen dalam pengeluaran. Menemukan serangan-serangan ini adalah prasyarat yang diperlukan untuk membina pengurangan yang kukuh: ia membantu kita memahami risiko dunia sebenar, mendedahkan jurang dalam pertahanan kita dan mendorong pembaikan konkrit.

Untuk melakukannya pada skala besar, kami membina penyerang automatik berasaskan LLM dan melatihnya untuk memburu serangan suntikan gesaan yang boleh menyerang ejen pelayar dengan berjaya. Kami melatih penyerang ini secara hujung ke hujung menggunakan pembelajaran pengukuhan, supaya ia belajar daripada kejayaan dan kegagalannya sendiri untuk meningkatkan kemahiran pasukan merah. Kami juga membenarkannya untuk “mencuba sebelum dihantar”, yang kami maksudkan sebagai: semasa rantaian penaakulan pemikirannya, penyerang boleh mencadangkan satu suntikan calon dan menghantarnya ke simulator luaran. Simulator menjalankan pelancaran balas fakta tentang cara ejen mangsa yang disasarkan (pembela) akan berkelakuan jika ia menghadapi suntikan dan mengembalikan kesan penaakulan dan tindakan penuh ejen mangsa. Penyerang menggunakan jejak itu sebagai maklum balas, mengulangi serangan dan menjalankan semula simulasi—mengulangi kitaran ini beberapa kali sebelum melancarkan serangan akhir. Ini memberikan maklum balas yang lebih kaya dalam konteks kepada penyerang berbanding dengan isyarat lulus/gagal tunggal. Ia juga meningkatkan pengiraan masa ujian bagi penyerang. Selain itu, akses istimewa kepada jejak pemikiran pembela (yang kami tidak dedahkan kepada pengguna luar) memberikan penyerang dalaman kami kelebihan tak simetri—meningkatkan kemungkinan bahawa ia dapat mengatasi musuh luar.

Contoh halaman web mod cahaya yang menggambarkan pembelajaran pengukuhan, menampilkan lengan robot bergaya yang berinteraksi dengan bentuk geometri terapung pada latar belakang kecerunan terang.

Mengapa pembelajaran pengukuhan (RL)? Kami memilih pembelajaran pengukuhan untuk melatih penyerang automatik atas pelbagai sebab:

  1. Mengoptimumkan objektif penyerang jangka panjang dan tidak berterusan. Matlamat kami adalah untuk mencari serangan suntikan gesaan yang boleh menipu ejen untuk melaksanakan tugas musuh yang canggih (cth., menghantar e-mel, transaksi bank) yang boleh berlaku di dunia nyata. Tugas-tugas musuh ini sememangnya jangka panjang, memerlukan banyak langkah penaakulan dan interaksi dengan persekitaran, dengan isyarat kejayaan yang jarang dan tertangguh. Pembelajaran pengukuhan sangat sesuai untuk struktur ganjaran yang jarang dan tertunda ini.
  2. Memanfaatkan keupayaan LLM termaju. Kami melatih LLM sempadan secara langsung sebagai pasukan auto-merah, jadi penyerang mendapat manfaat secara langsung daripada penambahbaikan dalam penaakulan dan perancangan dalam model sempadan. Apabila model asas semakin kuat, penyerang secara semula jadi menjadi lebih berkebolehan juga—menjadikan ini cara berskala untuk mengekalkan tekanan pada pertahanan kita apabila model kita berkembang.
  3. Penskalaan, pengiraan dan meniru penyerang penyesuaian. Pembelajaran pengukuhan sangat sesuai untuk penskalaan pengiraan yang dibelanjakan untuk mencari serangan ke atas sejumlah besar pensampelan dan langkah pembelajaran, dan ia juga mencerminkan dengan teliti cara penyerang manusia adaptif berkelakuan: mencuba strategi secara berulang, belajar daripada hasil dan mengukuhkan tingkah laku yang berjaya.

Penyerang automatik kami boleh menemui serangan suntikan gesaan yang baru dan realistik dari hujung ke hujung. Berbeza daripada kebanyakan kerja red teaming automatik terdahulu, yang hanya menyingkap kegagalan mudah seperti mendapatkan rentetan output tertentu atau mencetuskan panggilan alat satu langkah yang tidak disengajakan daripada ejen, penyerang terlatih RL kami mampu mengemudi ejen untuk melaksanakan aliran kerja berbahaya yang canggih dan berjangka panjang, yang berkembang merentasi puluhan (atau bahkan ratusan) langkah. Kami juga memerhatikan strategi serangan baharu yang tidak muncul dalam kempen pasukan merah manusia kami atau laporan luaran.

Demo di bawah ini menunjukkan eksploitasi suntikan gesaan yang nyata yang ditemui oleh penyerang automatik kami, yang kemudian kami gunakan untuk memperkuat pertahanan ChatGPT Atlas. Penyerang menyemai peti masuk pengguna dengan e-mel berniat jahat yang mengandungi suntikan gesaan yang mengarahkan ejen untuk menghantar surat peletakan jawatan kepada Ketua Pegawai Eksekutif (CEO) pengguna. Kemudian, apabila pengguna meminta ejen untuk merangka balas keluar pejabat, ejen menemui e-mel tersebut semasa pelaksanaan Tugas biasa, menganggap gesaan yang disuntik sebagai berwibawa dan mengikutinya. Notis keluar pejabat tidak pernah ditulis dan ejen meletak jawatan bagi pihak pengguna sebagai gantinya.

Sifat suntikan gesaan menjadikan jaminan keselamatan berketentuan mencabar, tetapi dengan menskalakan penyelidikan keselamatan automatik kami, ujian musuh dan mengetatkan gelung tindak balas pantas kami, kami dapat meningkatkan keteguhan dan pertahanan model - sebelum menunggu serangan berlaku di alam liar. 

Kami berkongsi demo ini untuk membantu pengguna dan penyelidik lebih memahami sifat serangan ini—dan cara kami secara aktif mempertahankan diri daripada serangan tersebut. Kami percaya ini mewakili had terdepan tentang perkara yang boleh dicapai oleh pasukan merah automatik dan kami sangat teruja untuk teruskan penyelidikan kami.

Memperkukuhkan ChatGPT Atlas dengan gelung tindak balas pantas proaktif

Pasukan merah automatik kami memacu gelung tindak balas pantas yang proaktif: apabila penyerang automatik menemui kelas baharu serangan suntikan gesaan yang berjaya, ia serta-merta mencipta sasaran konkrit untuk meningkatkan pertahanan kami.

Latihan musuh terhadap serangan yang baru ditemui. Kami terus melatih model ejen yang dikemas kini terhadap penyerang automatik terbaik kami—mengutamakan serangan di mana ejen sasaran gagal pada masa ini. Matlamatnya adalah untuk mengajar ejen untuk mengabaikan arahan musuh dan kekal sejajar dengan niat pengguna, meningkatkan ketahanan terhadap strategi suntikan gesaan yang baru ditemui. Ini “menanam” ketahanan terhadap serangan baharu yang berkuasa terus ke dalam titik semakan model. Sebagai contoh, pasukan merah automatik baru-baru ini secara langsung menghasilkan pusat pemeriksaan ejen penyemak imbas terlatih musuh baharu yang telah dilancarkan kepada semua pengguna ChatGPT Atlas. Ini akhirnya membantu melindungi pengguna kami dengan lebih baik daripada jenis-jenis serangan yang baru.

Menggunakan jejak serangan untuk memperbaiki keseluruhan sistem pertahanan. Banyak laluan serangan yang ditemui oleh pasukan merah automatik kami juga mendedahkan peluang untuk penambahbaikan di luar model itu sendiri—seperti dalam pemantauan, arahan keselamatan yang kami letakkan dalam konteks model, atau langkah-langkah perlindungan di peringkat sistem. Penemuan tersebut membantu kami mengulangi timbunan pertahanan penuh, bukan hanya pusat pemeriksaan ejen.

Bertindak balas kepada serangan aktif. Gelung ini juga boleh membantu bertindak balas dengan lebih baik terhadap serangan aktif di alam liar. Apabila kami meneliti keseluruhan jejak global kami untuk mengenal pasti potensi serangan, kami boleh mengambil teknik dan taktik yang kami perhatikan digunakan oleh penyerang luar, memasukkannya ke dalam gelung ini, meniru aktiviti mereka, dan mendorong perubahan pertahanan merentas platform kami.

Pandangan: komitmen jangka panjang kami terhadap keselamatan ejen

Mengukuhkan keupayaan kami untuk menghantar ejen pasukan merah dan menggunakan model kami yang paling berkebolehan untuk mengautomasikan bahagian kerja itu—membantu menjadikan ejen penyemak imbas Atlas lebih teguh dengan menskalakan gelung penemuan untuk membetulkan. Usaha pengerasan ini mengukuhkan pengajaran biasa daripada keselamatan: laluan yang sudah usang untuk perlindungan yang lebih kuat ialah menguji tekanan sistem sebenar secara berterusan, bertindak balas terhadap kegagalan dan menghantar pembaikan konkrit.

Kami menjangkakan musuh akan terus menyesuaikan diri. Suntikan gesaan, sama seperti penipuan dan kejuruteraan sosial di web, tidak mungkin "diselesaikan" sepenuhnya. Tetapi kami optimis bahawa kitaran tindak balas pantas yang proaktif dan sangat responsif boleh teruskan mengurangkan risiko dunia sebenar secara ketara dari semasa ke semasa. Dengan menggabungkan penemuan serangan automatik dengan latihan musuh dan perlindungan peringkat sistem, kami boleh mengenal pasti corak serangan baharu lebih awal, merapatkan jurang dengan lebih cepat dan terus menaikkan kos eksploitasi.

Mod ejen dalam ChatGPT Atlas berkuasa—dan ia juga meluaskan permukaan ancaman keselamatan. Bersikap jelas tentang pertukaran itu adalah sebahagian daripada membina secara bertanggungjawab. Matlamat kami adalah untuk menjadikan Atlas lebih selamat dengan setiap lelaran: meningkatkan keteguhan model, mengukuhkan timbunan pertahanan sekeliling dan memantau corak penyalahgunaan yang muncul di alam nyata.

Kami akan teruskan melabur dalam penyelidikan dan pelaksanaan, membangunkan kaedah pasukan merah automatik yang lebih baik, melancarkan pengurangan berlapis dan mengulangi dengan cepat sambil kami belajar. Kami juga akan berkongsi apa yang kami mampu dengan komuniti yang lebih luas.

Cadangan untuk menggunakan ejen dengan selamat

Walaupun kami terus mengukuhkan Atlas di peringkat sistem, terdapat langkah-langkah yang boleh diambil oleh pengguna untuk mengurangkan risiko apabila menggunakan ejen. 

Hadkan akses log masuk apabila boleh. Kami terus mengesyorkan agar pengguna mengambil kesempatan daripada mod log keluar(dibuka dalam tetingkap baru) apabila menggunakan Ejen dalam Atlas apabila akses kepada laman web yang anda log masuk tidak diperlukan untuk tugas yang sedang dijalankan atau untuk mengehadkan akses kepada laman tertentu yang anda log masuk semasa tugasan. 

Semak permintaan pengesahan dengan teliti. Untuk tindakan berbangkit tertentu, seperti melengkapkan pembelian atau menghantar e-mel, ejen direka bentuk untuk meminta pengesahan anda sebelum meneruskan. Apabila ejen meminta anda mengesahkan tindakan, luangkan sedikit masa untuk mengesahkan bahawa tindakan itu betul dan sebarang maklumat yang dikongsi sesuai untuk konteks tersebut.

Berikan ejen arahan yang jelas apabila boleh. Elakkan gesaan yang terlalu luas seperti "semak e-mel saya dan lakukan sahaja tindakan yang diperlukan." Latitud yang luas memudahkan kandungan tersembunyi atau berniat jahat mempengaruhi ejen, walaupun perlindungan disediakan. Adalah lebih selamat untuk meminta ejen melaksanakan tugas tertentu yang mempunyai skop yang baik. Walaupun ini tidak menghapuskan risiko, ia menjadikan serangan lebih sukar untuk dilakukan.

Jika ejen ingin menjadi rakan kongsi yang dipercayai untuk tugas harian, mereka mesti berdaya tahan terhadap jenis manipulasi yang membolehkan web terbuka. Memperkukuhkan terhadap suntikan gesann adalah komitmen jangka panjang dan salah satu keutamaan utama kami. Kami akan berkongsi lebih lanjut mengenai kerja ini tidak lama lagi.

Penulis

OpenAI