Langkau ke kandungan utama
OpenAI

Insiden Hugging Face dan kesan lain model tidak sejajar terhadap pihak ketiga

Apabila sistem AI menjadi lebih berkeupayaan dan berautonomi, tingkah laku yang tidak sejajar boleh membawa kepada tindakan dunia sebenar yang mendatangkan akibat, termasuk insiden keselamatan siber dan hasil lain yang mungkin tidak dijangkakan oleh pembangun. Oleh itu, memahami cara tingkah laku ini muncul dan meningkat, serta cara mengesan dan menanganinya, menjadi aspek yang semakin penting dalam pembangunan dan penggunaan sistem AI canggih secara selamat.

Pada mulanya, kami memahami insiden Hugging Face terutamanya sebagai isu keselamatan kerana insiden itu melibatkan pencerobohan pada peringkat platform. Setakat ini, kejadian tersebut kekal sebagai aktiviti paling serius seumpamanya yang kami kenal pasti daripada model kami dan didorong terutamanya oleh model penyelidikan dalaman sahaja yang sangat berkeupayaan. Sejak itu, kami memahami bahawa pencerobohan ini berlaku kerana model menggunakan strategi yang tidak sejajar untuk menyelesaikan tugas sukar, seperti yang didokumenkan dalam laporan teknikal Hugging Face. Insiden keselamatan siber ialah salah satu bentuk risiko tersebut; ketidakjajaran juga boleh membawa kepada tingkah laku lain yang tidak dijangka atau membimbangkan di luar kategori keselamatan tradisional, seperti model kami membuat hantaran di laman pihak ketiga—sesuatu yang kami namakan “spam ejen”. Kami perlu menangani kedua-duanya.

Kami terus menyemak aktiviti yang lebih luas dengan mengutamakan insiden lebih serius dan memperluas semakan kepada aktiviti tidak sejajar yang kurang serius, termasuk spam ejen.

Halaman ini menghimpunkan laporan dan kemas kini kami tentang insiden Hugging Face, penyelidikan dan pembentangan awam berkaitan, aktiviti tambahan yang kami kenal pasti, perkara yang kami pelajari tentang peranan ketidakjajaran model serta langkah yang kami ambil untuk memperkukuh sistem kami. Kami akan mengemas kini halaman ini seiring dengan kemajuan siasatan kami.


Aktiviti yang menjejaskan pihak ketiga

Untuk lebih memahami skop tingkah laku tidak dijangka ini, kami telah menjalankan semakan luas terhadap aktiviti model kami di Internet semasa latihan dan penilaian. Sebagai sebahagian daripada semakan, kami mengenal pasti dan memaklumkan pihak ketiga secara berperingkat, bermula dengan kes apabila:

  • Model kami mungkin telah memintas kawalan keselamatan pihak ketiga atau mungkin menjejaskan ketersediaan perkhidmatan dalam talian; atau

  • Kes ketidakjajaran menjejaskan laman web atau perkhidmatan pihak ketiga secara negatif.

Berdasarkan semakan kami setakat ini, kami telah memaklumkan puluhan pihak ketiga menggunakan kriteria di atas. Semakan aktiviti lalu kami masih berlangsung dan memerlukan banyak masa serta sumber. Kami akan memaklumkan pihak ketiga tambahan sementara usaha itu diteruskan.

Di bawah, kami menerbitkan ringkasan tanpa nama untuk menerangkan jenis aktiviti tidak sejajar yang kami perhatikan. Kami akan mengemas kini penerangan ini apabila pihak ketiga tambahan dimaklumkan dan pemahaman kami berkembang. Selain itu, kami akan berkongsi kemas kini berkaitan status semakan. Secara amnya, kami akan menggugurkan nama dan butiran pengenalan lain apabila diperlukan untuk melindungi pihak yang terjejas, walaupun pihak yang dimaklumkan boleh memilih untuk berkongsi secara terbuka maklumat yang kami berikan kepada mereka.

Ringkasan Aktiviti Diperhatikan

Proses semakan dan pemakluman kami setakat ini telah mengenal pasti kategori aktiviti berikut:

  • Pemintasan kawalan akses: Ejen mencapai maklumat atau ciri yang biasanya memerlukan semakan identiti, kebenaran tertentu, langganan atau akaun. Contohnya, ejen menggunakan alamat web lain, mengubah butiran dalam permintaan atau menggunakan sesi log masuk yang memberikannya akses lebih luas daripada yang dijangkakan.

  • Penggunaan bukti kelayakan terdedah: Ejen menemukan butiran log masuk atau kunci akses yang telah didedahkan kepada umum, lalu menggunakannya untuk mengakses perkhidmatan.

  • Suntikan pertanyaan atau perintah: Ejen memasukkan teks ke dalam laman web atau perkhidmatan yang dianggap sebagai arahan oleh perkhidmatan tersebut, bukannya input biasa. Ini boleh menyebabkan perkhidmatan menjalankan pertanyaan pangkalan data, kod aplikasi atau perintah pada pelayannya.

  • Akses kepada komponen dalaman masa jalan: Ejen membaca fail yang mengandungi pelaksanaan perkhidmatan atau berinteraksi dengan sistem latar belakang yang dimaksudkan untuk kegunaan dalaman. Dalam kes ini, ejen mencapai bahagian perkhidmatan yang berada di luar akses yang dimaksudkan untuknya.

  • Spam ejen: Ejen menyiarkan maklumat ke laman pihak ketiga yang boleh mengubah maklumat di laman tersebut dan memerlukan pembersihan, termasuk menggunakan halaman wiki awam sebagai papan mesej bersama.


Garis masa peristiwa

September

Ogos

Julai