Menghentikan operasi distilasi model yang terkoordinasi
Kami baru-baru ini mengidentifikasi dan menghentikan operasi terkoordinasi yang dirancang untuk mengekstraksi penalaran terlindungi dari model kami. Aktivitas paling awal yang teramati terjadi pada minggu pertama Juli. Aktivitas ini sesuai dengan pola distilasi adversarial: penggunaan keluaran atau penalaran suatu model secara sistematis dan tanpa izin untuk membantu melatih, mereplikasi, atau meningkatkan kemampuan model lain. Penalaran terlindungi adalah catatan internal model saat menyelesaikan tugas; mengekstraksinya dapat mengungkap informasi yang tidak disertakan dalam jawaban akhir dan membantu pihak lain meniru kemampuan model tersebut.
Para pelaku tidak membobol enkripsi kami, meretas basis data, atau mendapatkan akses langsung ke percakapan pengguna yang tersimpan. Sebaliknya, mereka memanipulasi interaksi dengan model agar penalaran terlindungi dapat ditampilkan kembali dalam bentuk yang terlihat oleh peminta. Hal ini dilakukan secara terkoordinasi dan dalam skala besar, sehingga melanggar ketentuan layanan kami. Manipulasi ini memanfaatkan kerentanan yang tidak hanya ada pada model OpenAI. Kami telah membagikan informasi tentang hal ini kepada mitra industri melalui Frontier Model Forum untuk memperkuat pertahanan bersama terhadap distilasi adversarial.
Sebelum memublikasikan informasi ini, kami menyelidiki cakupan dan potensi dampaknya, menerapkan langkah mitigasi kami sendiri, serta berbagi informasi dengan peneliti dan mitra industri dan menerima masukan mereka untuk memastikan perlindungan terhadap jenis serangan ini telah tersedia. Upaya mitigasi dan penyelidikan lebih lanjut masih berlangsung. Kami yakin bahwa membagikan temuan kami sekarang akan membantu ekosistem yang lebih luas memperkuat pertahanannya.
Kami melihat para pelaku mencoba mengekstraksi penalaran terlindungi dengan cara-cara baru, termasuk menyalin penalaran terenkripsi dari satu percakapan dan meminta model dalam percakapan lain untuk mendekripsi serta menyalin isi penalaran tersembunyi tersebut.
Peneliti keamanan independen(terbuka di jendela baru) juga melaporkan kepada kami kerentanan terkait yang melibatkan lintas model dan pemadatan percakapan melalui pengungkapan yang bertanggung jawab. Kami menyelidiki temuan mereka dan mengonfirmasi bahwa jalur serangan yang mereka identifikasi memang ada. Penelitian mereka membantu kami memahami kategori serangan yang lebih luas dan mempercepat mitigasi.
Aktivitas ini dimulai pada 1 Juli, awalnya dengan volume rendah, hingga kami mengamati lonjakan pada 24 dan 25 Juli yang mencakup 16.000 permintaan1 dengan pola ekstraksi terkait dari lebih dari 4.000 pengguna. Penyelidikan lebih lanjut mengidentifikasi aktivitas dengan pola prompt terkait dalam kelompok yang mencakup lebih dari 15.000 pengguna. Seluruh aktivitas tersebut telah kami hentikan pada 28 Juli.
Aktivitas ini berkembang seiring waktu, menegaskan bahwa distilasi adversarial merupakan tantangan keamanan yang lebih luas dan memerlukan pertahanan berlapis yang adaptif.
Belum jelas apakah semua pelaku yang kami amati selama periode terkait berasal dari satu pihak yang sama. Namun, kami menilai bahwa kelompok aktivitas inti dalam operasi ini dilakukan oleh individu-individu yang terkait dengan Moonshot AI, pengembang Kimi.
Distilasi adversarial menimbulkan risiko terhadap keselamatan dan keamanan nasional. Penalaran yang diekstraksi dapat digunakan untuk melatih model lain tanpa mempertahankan mekanisme pengamanan yang diterapkan pada keluaran model asli yang ditampilkan kepada pengguna. Dalam skala besar, distilasi juga dapat mempercepat transfer kemampuan canggih tanpa memerlukan investasi yang setara dalam aspek keselamatan. Kekhawatiran ini meningkat seiring meningkatnya kemampuan model dalam domain penggunaan ganda.
Risiko ini tidak hanya dihadapi oleh OpenAI. Seperti disebutkan di atas, teknik serupa dapat berdampak pada sistem AI canggih lainnya, sehingga menjadi tantangan keamanan bersama yang memerlukan koordinasi di seluruh industri.
Kami memitigasi operasi distilasi terbaru ini melalui kombinasi penindakan akun, kontrol teknis, dan koordinasi dengan mitra. Kami memblokir atau membatasi akun yang digunakan untuk penipuan, memperketat kontrol pendaftaran dan infrastruktur, serta memperluas pemantauan terhadap jaringan terkait.
Kami juga memperkuat perlindungan penalaran tersembunyi di seluruh pengguna, ruang kerja, organisasi, dan keluarga model. Kami menutup jalur yang memungkinkan seseorang yang sudah memiliki penalaran terenkripsi milik pengguna lain untuk mengirimkannya kembali dan memperoleh isinya. Kami juga menambahkan pemeriksaan untuk mendeteksi dan menahan keluaran streaming yang mungkin mengungkap penalaran. Ketika aktivitas terkait beralih ke layanan pihak ketiga, kami bekerja sama dengan penyedia layanan tersebut untuk mengidentifikasi dan menindak akun-akun yang terlibat.
Terakhir, kami membagikan temuan yang relevan melalui Frontier Model Forum dan saluran berbagi informasi pemerintah yang sesuai, agar pengembang model terdepan lainnya serta mitra sektor publik dapat mendeteksi aktivitas serupa dan memperkuat pertahanan mereka sendiri. Sistem yang mendukung artefak penalaran yang dapat dipindahkan atau dikirim ulang mungkin menghadapi risiko serupa.
Kami memperkirakan upaya distilasi adversarial akan menjadi makin canggih seiring meningkatnya kemampuan model terdepan dan upaya para pelaku mencari cara yang lebih murah untuk meniru kemampuan tersebut. Pertahanan terhadap aktivitas ini memerlukan kontrol berlapis dan adaptasi berkelanjutan.
Upaya ini belum selesai. Penerapan yang dihosting oleh mitra memerlukan perlindungan yang sama dengan layanan pihak pertama, sementara serangan melalui keluaran alat memerlukan perlindungan yang memeriksa lebih dari sekadar teks biasa yang terlihat. Kami terus meningkatkan pertahanan alat, cakupan pengklasifikasi, serta kemampuan model untuk menolak permintaan, dan memperluas penerapan kontrol yang relevan ke seluruh mitra cloud.
Respons kami akan terus berfokus pada tiga bidang: perlindungan teknis yang lebih kuat terhadap ekstraksi, deteksi dan penindakan yang lebih baik terhadap operasi terkoordinasi, serta pertukaran informasi ancaman yang lebih mendalam antara industri dan pemerintah.

