Menggagalkan kempen penyulingan model yang diselaraskan
Kami baru-baru ini mengenal pasti dan menggagalkan kempen yang diselaraskan untuk mengekstrak penaakulan terlindung daripada model kami. Aktiviti terawal yang dikesan berlaku pada minggu pertama bulan Julai. Aktiviti ini selaras dengan penyulingan berniat jahat: penggunaan output atau penaakulan satu model secara sistematik dan tanpa kebenaran untuk membantu melatih, menghasilkan semula atau menambah baik model lain. Penaakulan terlindung ialah rekod dalaman model tentang proses menyelesaikan sesuatu tugas. Pengekstrakannya boleh mendedahkan maklumat yang tidak disertakan dalam jawapan akhir dan membantu pihak lain menghasilkan semula keupayaan model tersebut.
Pengendali kempen ini tidak memecahkan penyulitan kami, menceroboh pangkalan data atau memperoleh akses langsung kepada perbualan pengguna yang disimpan. Sebaliknya, mereka memanipulasi interaksi dengan model supaya penaakulan terlindung dapat dihasilkan semula dalam bentuk yang boleh dilihat oleh pemohon. Ini dilakukan secara terselaras dan berskala besar, lalu melanggar syarat perkhidmatan kami. Manipulasi ini bukan kelemahan yang hanya wujud pada model OpenAI. Kami telah berkongsi maklumat tentangnya dengan rakan industri melalui Frontier Model Forum untuk memperkukuh pertahanan bersama terhadap penyulingan berniat jahat.
Sebelum menerbitkan maklumat ini, kami menyiasat skop dan potensi kesannya, melaksanakan langkah mitigasi kami sendiri, serta berkongsi maklumat dan mendapatkan maklum balas daripada penyelidik dan rakan industri untuk memastikan perlindungan terhadap serangan jenis ini tersedia. Usaha mitigasi dan siasatan lanjut masih diteruskan. Kami percaya bahawa perkongsian dapatan kami sekarang akan membantu ekosistem yang lebih luas memperkukuh pertahanannya.
Kami mengesan pengendali yang cuba mengekstrak penaakulan terlindung dengan cara baharu, termasuk menyalin penaakulan yang disulitkan daripada satu perbualan dan meminta model dalam perbualan lain menyahsulit serta mentranskripsikan kandungan penaakulan tersembunyi itu.
Penyelidik keselamatan bebas(dibuka dalam tetingkap baru) turut memaklumkan kepada kami tentang kelemahan berkaitan yang merentas model dan melibatkan pemadatan perbualan melalui pendedahan bertanggungjawab. Kami menyiasat dapatan mereka dan mengesahkan bahawa laluan serangan yang dikenal pasti itu memang wujud. Usaha mereka membantu kami memahami kategori serangan ini dengan lebih menyeluruh dan mempercepat pelaksanaan langkah mitigasi.
Aktiviti ini bermula pada 1 Julai, dengan jumlah yang rendah pada awalnya. Pada 24 dan 25 Julai, kami mengesan lonjakan besar yang melibatkan 16,000 permintaan1 menggunakan corak pengekstrakan berkaitan daripada lebih 4,000 pengguna. Siasatan lanjut mengenal pasti aktiviti dengan corak prom berkaitan dalam kelompok yang terdiri daripada lebih 15,000 pengguna. Kami telah menghentikan sepenuhnya aktiviti ini menjelang 28 Julai.
Aktiviti ini berubah dari semasa ke semasa, sekali gus menegaskan bahawa penyulingan berniat jahat ialah cabaran keselamatan yang lebih luas dan memerlukan pertahanan berlapis yang boleh disesuaikan.
Tidak jelas sama ada semua pengendali yang kami kesan sepanjang tempoh berkenaan bertindak bagi pihak yang sama. Walau bagaimanapun, kami menilai bahawa kelompok utama aktiviti ini dilakukan oleh individu yang mempunyai kaitan dengan Moonshot AI, pembangun Kimi.
Penyulingan berniat jahat menimbulkan risiko terhadap keselamatan, termasuk keselamatan negara. Penaakulan yang diekstrak boleh digunakan untuk melatih model lain tanpa mengekalkan langkah perlindungan yang diterapkan pada output model asal yang dipaparkan kepada pengguna. Apabila dilakukan pada skala besar, penyulingan juga boleh mempercepat pemindahan keupayaan termaju tanpa memerlukan pelaburan yang setara dalam aspek keselamatan. Kebimbangan ini semakin meningkat apabila model memperoleh keupayaan dalam bidang yang boleh digunakan untuk tujuan awam mahupun ketenteraan.
Risiko ini bukan hanya dihadapi oleh OpenAI. Seperti yang dinyatakan di atas, teknik serupa mungkin menjejaskan sistem AI termaju yang lain. Oleh itu, hal ini merupakan cabaran keselamatan bersama yang memerlukan penyelarasan merentas industri.
Kami menangani kempen penyulingan baru-baru ini melalui gabungan tindakan penguatkuasaan terhadap akaun, kawalan teknikal dan penyelarasan dengan rakan kerjasama. Kami menyekat atau mengehadkan akaun yang terlibat dalam penipuan, memperkukuh kawalan pendaftaran dan infrastruktur, serta memperluas pemantauan terhadap rangkaian berkaitan.
Kami juga memperkukuh perlindungan penaakulan tersembunyi merentas pengguna, ruang kerja, organisasi dan keluarga model. Kami menutup laluan yang membolehkan seseorang yang sudah memiliki penaakulan tersulit milik pengguna lain menghantarnya semula dan mendapatkan kandungannya. Kami turut menambah semakan untuk mengesan dan menahan output penstriman yang mungkin mendedahkan penaakulan. Apabila aktiviti berkaitan beralih ke perkhidmatan pihak ketiga, kami bekerjasama dengan penyedia tersebut untuk mengenal pasti dan menyekat akaun yang terlibat.
Akhir sekali, kami berkongsi dapatan berkaitan melalui Frontier Model Forum dan saluran perkongsian maklumat kerajaan yang sesuai supaya pembangun model perbatasan lain serta rakan sektor awam dapat mengesan aktiviti serupa dan memperkukuh pertahanan mereka sendiri. Sistem yang menyokong artifak penaakulan yang boleh dipindahkan atau dihantar semula mungkin menghadapi risiko berkaitan.
Kami menjangkakan percubaan penyulingan berniat jahat akan menjadi semakin canggih seiring dengan peningkatan model perbatasan dan usaha pihak terlibat mencari cara yang lebih murah untuk meniru keupayaan model tersebut. Pertahanan terhadap aktiviti ini memerlukan kawalan berlapis dan penyesuaian berterusan.
Usaha ini belum selesai. Pelaksanaan yang dihoskan oleh rakan kerjasama memerlukan perlindungan yang sama seperti perkhidmatan pihak pertama. Serangan melalui output alat pula memerlukan perlindungan yang meneliti lebih daripada sekadar teks biasa yang kelihatan. Kami terus menambah baik pertahanan alat, liputan pengelas dan keupayaan model menolak permintaan, serta meluaskan pelaksanaan kawalan berkaitan kepada semua rakan kerjasama awan.
Tindakan kami akan terus tertumpu pada tiga bidang: perlindungan teknikal yang lebih kukuh terhadap pengekstrakan, pengesanan dan penguatkuasaan yang lebih baik terhadap kempen yang diselaraskan, serta perkongsian maklumat ancaman yang lebih mendalam antara industri dengan kerajaan.

