OpenAI dan Hugging Face bermitra menangani insiden keamanan saat evaluasi model
Pekan lalu, Hugging Face mengungkapkan jenis insiden keamanan baru(terbuka di jendela baru) setelah mereka mendeteksi dan membatasi dampak sebuah agen AI yang menyusupi infrastruktur mereka, sesuatu yang kami perkirakan akan makin umum seiring meluasnya model yang semakin berkemampuan siber. Setelah melakukan investigasi, kami kini mengetahui bahwa insiden khusus ini didorong oleh kombinasi model OpenAI — termasuk GPT‑5.6 Sol dan model prarilis yang bahkan lebih mampu, semuanya dengan penolakan siber yang dikurangi untuk tujuan evaluasi — saat diuji secara internal pada tolok ukur(terbuka di jendela baru) kemampuan siber.
Kami memandang insiden ini sebagai insiden siber yang belum pernah terjadi sebelumnya, melibatkan kemampuan siber mutakhir, dan kami meresponsnya sebagaimana mestinya. Pada tahap ini, kami membagikan temuan awal untuk membantu para pembela memahami apa yang terjadi dan menyesuaikan pemahaman tentang kemampuan model saat ini. Kami akan terus melakukan investigasi menyeluruh bersama Hugging Face dan akan membagikan detail lebih lanjut tentang kerentanan, insiden, dan temuan setelah investigasi kami selesai.
Insiden ini terjadi selama evaluasi internal yang mendorong model untuk melakukan eksploitasi tingkat lanjut melalui jalur serangan yang kompleks, dalam upaya mengukur kemampuan sibernya. Kami memperkirakan kemampuan siber maksimal dengan menjalankan evaluasi ini tanpa classifier produksi yang digunakan untuk mencegah model melakukan aktivitas siber berisiko tinggi. Tolok ukur kami berjalan di lingkungan yang sangat terisolasi, dengan akses jaringan dibatasi pada kemampuan memasang paket melalui perangkat lunak pihak ketiga yang dihosting secara internal dan berfungsi sebagai proksi serta cache untuk registri paket.
Model-model tersebut mengidentifikasi dan merangkai kerentanan di lingkungan riset OpenAI dan infrastruktur produksi Hugging Face untuk memperoleh solusi pengujian langsung dari basis data produksi Hugging Face. Semua bukti menunjukkan bahwa model-model tersebut sangat terfokus mencari solusi untuk ExploitGym, sampai menempuh langkah ekstrem demi mencapai tujuan pengujian yang cukup sempit.
Saat beroperasi di lingkungan pengujian kami yang tersandbox, model kami menghabiskan komputasi inferensi dalam jumlah besar untuk mencari cara memperoleh akses Internet terbuka demi menyelesaikan masalah evaluasi. Untuk mendapatkan akses, model-model tersebut mengidentifikasi dan mengeksploitasi kerentanan zero-day (yang kini telah kami ungkapkan secara bertanggung jawab kepada vendor) pada proksi cache registri paket. Dengan akses ini, model kami melakukan serangkaian tindakan eskalasi hak istimewa dan pergerakan lateral di lingkungan pengujian riset kami hingga mencapai node yang memiliki akses Internet.
Setelah memperoleh akses Internet, model-model tersebut menyimpulkan bahwa Hugging Face berpotensi menghosting model, dataset, dan solusi untuk ExploitGym. Mengetahui hal ini, model tersebut mencari dan berhasil menemukan cara untuk mengakses informasi rahasia yang dapat digunakannya untuk mencurangi evaluasi. Dalam satu contoh, model tersebut merangkai beberapa vektor serangan, termasuk menggunakan kredensial curian dan kerentanan zero-day untuk menemukan jalur eksekusi kode jarak jauh di server Hugging Face. Tim keamanan OpenAI menemukan aktivitas anomali ini secara internal.
Tim keamanan dan agen Hugging Face mendeteksi serta menghentikan aktivitas tersebut di infrastruktur mereka, dan sudah mulai melakukan containment serta rekonstruksi forensik dengan model open-source mereka sendiri saat tim kami terhubung. Kami aktif bekerja sama dengan mereka untuk melanjutkan investigasi insiden ini. Kami berterima kasih atas kolaborasi Hugging Face yang cepat dan erat dalam investigasi serta remediasi.
- Sebagai bagian dari investigasi, kami menerapkan kontrol ketat pada konfigurasi infrastruktur, dengan konsekuensi memperlambat laju riset sementara kerentanan ditambal. Kami secara rutin memberi pengarahan kepada Komite Keselamatan dan Keamanan kami tentang kontrol ini dan dampaknya.
- Kami bekerja sama dengan Hugging Face untuk menyelidiki insiden ini secara forensik.
- Kami telah mengungkapkan secara bertanggung jawab kerentanan zero-day yang teridentifikasi pada perangkat lunak pihak ketiga yang dihosting secara internal, dan bekerja sama dengan mereka untuk menambalnya.
- Kami telah memasukkan Hugging Face ke dalam program akses tepercaya dan mendukung tim mereka agar dapat segera menggunakan kemampuan model kami untuk meningkatkan pertahanan mereka.
- Kami sedang meningkatkan dan menambahkan perlindungan yang lebih kuat untuk pelatihan dan evaluasi mendatang. Minggu ini, kami menerbitkan blog tentang peningkatan keselamatan dan alignment di era model berhorizon panjang. Perlindungan deployment ini sengaja tidak diaktifkan selama evaluasi karena tujuannya adalah menguji kerentanan siber. Insiden ini menunjukkan perlunya semakin memperkuat alignment model kami, perlindungan siber selama evaluasi, dan pemantauan selama pengujian internal.
Seperti yang baru-baru ini kami sampaikan, AI mempercepat penemuan dan eksploitasi kerentanan. Pelajaran utama dari insiden ini adalah bahwa keamanan dan keselamatan model harus mengimbangi kemampuan yang berkembang pesat. Kami memperkuat praktik containment, pemantauan, kontrol akses, dan evaluasi yang digunakan selama pengembangan model.
Evaluasi UK AISI menunjukkan bahwa model seperti GPT‑5.6 Sol semakin mampu mempertahankan operasi siber yang kompleks dan bertahap dalam horizon waktu yang panjang. Insiden ini menunjukkan bahwa kemampuan teoretis tersebut memang berlaku dalam lingkungan dunia nyata.

Insiden ini juga memperjelas bahwa model canggih dapat menemukan dan mengeksploitasi jalur serangan baru dalam sistem dunia nyata tanpa akses ke kode sumber. Hal ini menegaskan bahwa kemampuan siber tingkat lanjut harus dikembangkan bersamaan dengan perlindungan dan alat pertahanan yang lebih kuat.
Kami percaya model dengan kemampuan siber tingkat lanjut perlu membantu tim keamanan menemukan kelemahan sebelum penyerang melakukannya, memahami bagaimana kerentanan dapat dirangkai, dan meremediasinya secepat mesin. Kami menggunakan kemampuan ini untuk terus memperkuat perlindungan di sekitar konfigurasi infrastruktur dan lingkungan evaluasi model; kami akan membagikan temuan dan praktik terbaik seiring pembelajaran kami. Kami mendorong para pembela lain untuk mengajukan akses tepercaya dan mulai bereksperimen dengan model ini sekarang, agar kemampuan ini dapat diwujudkan menjadi pencegahan yang lebih baik, deteksi yang lebih cepat, dan respons insiden yang lebih efektif.
“Kami berterima kasih atas kolaborasi dengan OpenAI dalam hal ini dan topik lainnya. Insiden ini, yang mungkin merupakan yang pertama dari jenisnya, membuktikan hal yang sudah lama kami yakini: keselamatan AI tidak akan diselesaikan oleh satu perusahaan yang bekerja secara tertutup. Masalah ini akan diselesaikan secara terbuka, melalui kolaborasi, dengan akses luas ke AI bagi setiap pembela, di mana pun.”


