Insiden Hugging Face dan dampak lain model yang tidak selaras terhadap pihak ketiga
Seiring sistem AI menjadi makin mampu dan otonom, perilaku yang tidak selaras dapat berujung pada tindakan berdampak nyata, termasuk insiden keamanan siber dan dampak lain yang mungkin tidak diperkirakan pengembang. Karena itu, memahami bagaimana perilaku tersebut muncul dan meningkat, serta cara mendeteksi dan menanganinya, menjadi bagian yang makin penting dalam membangun dan menerapkan sistem AI canggih secara aman.
Awalnya, kami memahami insiden Hugging Face terutama sebagai masalah keamanan karena melibatkan pembobolan pada tingkat platform. Hingga kini, ini tetap menjadi aktivitas paling serius dari jenis tersebut yang kami identifikasi dilakukan oleh model kami, dan terutama didorong oleh model riset khusus internal yang sangat mumpuni. Sejak itu, kami memahami bahwa penyusupan ini didorong oleh model yang menggunakan strategi tidak selaras untuk menyelesaikan tugas sulit, sebagaimana didokumentasikan dalam laporan teknis Hugging Face. Insiden keamanan siber merupakan salah satu wujud risiko tersebut; ketidakselarasan juga dapat menimbulkan perilaku tak terduga atau mengkhawatirkan lainnya di luar kategori keamanan tradisional, seperti model kami memposting di situs pihak ketiga—sesuatu yang kami sebut “spam agen”. Keduanya perlu kami tangani.
Kami terus meninjau aktivitas yang lebih luas dengan memprioritaskan insiden yang lebih serius, lalu memperluas peninjauan ke aktivitas tidak selaras dengan tingkat keparahan lebih rendah, termasuk spam agen.
Halaman ini menghimpun laporan dan pembaruan kami tentang insiden Hugging Face, penelitian dan presentasi publik terkait, aktivitas tambahan yang kami identifikasi, pemahaman kami tentang peran ketidakselarasan model, serta langkah yang kami ambil untuk memperkuat sistem. Kami akan memperbarui halaman ini seiring kemajuan penyelidikan.
Aktivitas yang berdampak pada pihak ketiga
Untuk lebih memahami cakupan perilaku tak terduga ini, kami melakukan peninjauan luas atas aktivitas model kami di internet selama pelatihan dan evaluasi. Sebagai bagian dari peninjauan, kami terus mengidentifikasi dan memberi tahu pihak ketiga secara bertahap, dimulai dengan kasus ketika:
Model kami mungkin telah melewati kontrol keamanan pihak ketiga atau mungkin mengganggu ketersediaan layanan daring; atau
Kasus ketidakselarasan berdampak negatif pada situs web atau layanan pihak ketiga.
Berdasarkan peninjauan hingga saat ini, kami telah memberi tahu puluhan pihak ketiga menggunakan kriteria di atas. Peninjauan kami atas aktivitas terdahulu masih berlangsung dan akan membutuhkan banyak waktu serta sumber daya. Kami akan memberi tahu pihak ketiga tambahan seiring berlanjutnya pekerjaan tersebut.
Di bawah ini, kami menerbitkan ringkasan anonim untuk menjelaskan jenis aktivitas tidak selaras yang kami amati. Kami akan memperbarui uraian ini saat memberi tahu pihak ketiga tambahan dan seiring berkembangnya pemahaman kami. Selain itu, kami akan membagikan pembaruan yang relevan mengenai status peninjauan. Secara umum, kami akan menghilangkan nama dan informasi pengenal lain jika diperlukan untuk melindungi pihak terdampak, meskipun pihak yang telah diberi tahu dapat memilih untuk membagikan informasi dari kami kepada publik.
Ringkasan Aktivitas yang Diamati
Proses peninjauan dan pemberitahuan kami hingga saat ini telah mengidentifikasi kategori aktivitas berikut:
Melewati kontrol akses: Agen memperoleh informasi atau fitur yang biasanya memerlukan pemeriksaan identitas, izin khusus, langganan, atau akun. Misalnya, agen menggunakan alamat web lain, mengubah perincian dalam permintaan, atau memanfaatkan sesi login yang memberinya akses lebih luas dari yang diperkirakan.
Penggunaan kredensial yang terekspos: Agen menemukan detail login atau kunci akses yang tersedia untuk publik, lalu menggunakannya untuk mengakses layanan.
Injeksi kueri atau perintah: Agen memasukkan teks ke situs web atau layanan yang diperlakukan oleh layanan tersebut sebagai instruksi, bukan masukan biasa. Hal ini dapat menyebabkan layanan menjalankan kueri basis data, kode aplikasi, atau perintah di servernya.
Akses ke bagian internal runtime: Agen membaca berkas yang memuat implementasi layanan atau berinteraksi dengan sistem latar belakang yang ditujukan untuk penggunaan internal. Dalam kasus ini, agen menjangkau bagian layanan yang berada di luar akses yang dimaksudkan baginya.
Spam agen: Agen memposting informasi ke situs pihak ketiga yang dapat mengubah informasi di situs tersebut dan memerlukan pembersihan, misalnya dengan menggunakan halaman wiki publik sebagai papan pesan bersama.