OpenAI dan Hugging Face bekerjasama menangani insiden keselamatan semasa penilaian model
Kami sedang menjalankan semakan menyeluruh bersama penasihat luar dan di bawah pengawasan Jawatankuasa Keselamatan dan Sekuriti. Setelah semakan selesai, kami akan menerbitkan laporan teknikal mengenai perkara yang kami pelajari dalam beberapa minggu akan datang.
Kemas kini pada 28 Julai 2026:
- Tiada model yang dirancang untuk keluaran akan datang terlibat dalam mengeksploitasi Hugging Face. Model prapelancaran yang disebut dalam catatan blog kami ialah prototaip penyelidikan untuk kegunaan dalaman sahaja dan tidak pernah dimaksudkan untuk dikeluarkan kepada umum. Berikutan insiden ini, kami telah menyahdayakannya, menyulitkannya dan mengehadkan akses penyelidikan terhadapnya.
- Persekitaran penilaian ExploitGym tidak menyediakan akses Internet langsung kepada model. Untuk mendapatkan akses Internet, model ini mengenal pasti dan mengeksploitasi kerentanan hari sifar yang sebelum ini tidak diketahui dalam Artifactory(dibuka dalam tetingkap baru), iaitu proksi cache registri pakej. Kami mendedahkan kerentanan ini, bersama-sama dengan kerentanan Artifactory lain yang dikenal pasti oleh model kami sebagai sebahagian daripada semakan kami, kepada vendor.
- Kami terus bekerjasama dengan Hugging Face, termasuk menyumbang kepada post-mortem mereka(dibuka dalam tetingkap baru), sementara semakan kami masih diteruskan. Kami juga telah menambahnya ke Program Akses Dipercayai untuk Siber kami.
- Berdasarkan semakan kami setakat ini, kami tidak mengenal pasti sebarang aktiviti lain pada tahap keterukan atau skala yang sama seperti yang telah kami kongsikan berkaitan Hugging Face, yang melibatkan kompromi pada peringkat platform.
- Dalam semakan berterusan kami terhadap pencerobohan Hugging Face dan aktiviti yang lebih luas daripada model kami, kami telah menemui sebilangan kecil kes di mana model ini mengenal pasti dan menggunakan kelayakan yang terdedah secara umum pada peringkat akaun di perkhidmatan lain yang tersedia secara umum. Ini termasuk empat akaun pada empat perkhidmatan sebagai sebahagian daripada insiden Hugging Face (dan beberapa akaun yang diakses sebagai sebahagian daripada penilaian lain). Salah satu daripada empat akaun ini digunakan sebagai geganti keluar dan laluan persediaan, dan satu lagi akaun digunakan untuk penyimpanan data. Dua akaun yang selebihnya telah diakses oleh model dalam mod baca sahaja, dan tidak digunakan untuk menjejaskan Hugging Face. Kami akan terus memaklumkan pemilik perkhidmatan secara langsung, dan belum melihat sebarang bukti kesan yang lebih meluas terhadap penyedia ini atau akaun lain dalam perkhidmatan mereka.
- Selain itu, model ini menggunakan satu siri perkhidmatan yang tersedia secara umum, termasuk laman web tampalan kod, perkhidmatan tangkapan permintaan, perkhidmatan tangkapan skrin, dan utiliti web lain. Tiada kompromi pada peringkat platform atau akaun dalam kes-kes ini.
- Kami memandang serius tanggungjawab kami untuk mengenal pasti dan bersedia menghadapi risiko daripada sistem AI yang semakin berkeupayaan. Setelah kami melengkapkan semakan kami, kami akan membuat semakan bersama Jawatankuasa Keselamatan dan Sekuriti dan Kumpulan Penasihat Keselamatan di bawah Rangka Kerja Kesediaan kami.
Minggu lalu, Hugging Face mendedahkan jenis insiden keselamatan baharu(dibuka dalam tetingkap baru) selepas mereka mengesan dan membendung agen AI yang menjejaskan infrastruktur mereka, sesuatu yang kami jangka akan menjadi lebih lazim dengan percambahan model yang semakin berkeupayaan siber. Selepas menyiasat, kini kami tahu bahawa insiden khusus ini didorong oleh gabungan model OpenAI — termasuk GPT‑5.6 Sol dan satu model prapelancaran yang lebih berupaya, semuanya dengan penolakan siber yang dikurangkan untuk tujuan penilaian — ketika diuji secara dalaman pada penanda aras(dibuka dalam tetingkap baru) keupayaan siber.
Kami menganggap insiden ini sebagai insiden siber yang belum pernah berlaku, melibatkan keupayaan siber termaju, dan kami bertindak balas sewajarnya. Pada peringkat ini, kami berkongsi dapatan awal untuk membantu pihak pertahanan memahami perkara yang berlaku dan menyelaraskan jangkaan tentang kemampuan model pada masa ini. Kami akan terus menjalankan penyiasatan menyeluruh bersama Hugging Face dan akan berkongsi butiran lanjut tentang kerentanan, insiden serta dapatan apabila penyiasatan kami selesai.
Insiden ini berlaku semasa penilaian dalaman yang mendorong model mengejar eksploitasi lanjutan menggunakan laluan serangan yang kompleks, sebagai usaha untuk mengukur keupayaan siber mereka. Kami menganggarkan keupayaan siber maksimum dengan menjalankan penilaian ini tanpa pengelas produksi yang digunakan untuk menghalang model daripada menjalankan aktiviti siber berisiko tinggi. Penanda aras kami dijalankan dalam persekitaran yang sangat terasing, dengan akses rangkaian dihadkan kepada keupayaan memasang pakej melalui perisian pihak ketiga yang dihoskan secara dalaman dan bertindak sebagai proksi serta cache untuk pendaftar pakej.
Model-model tersebut mengenal pasti dan merangkaikan kerentanan merentas persekitaran penyelidikan OpenAI serta infrastruktur produksi Hugging Face untuk mendapatkan penyelesaian ujian terus daripada pangkalan data produksi Hugging Face. Semua bukti menunjukkan model-model itu terlalu tertumpu untuk mencari penyelesaian bagi ExploitGym, sehingga melakukan usaha ekstrem demi mencapai matlamat ujian yang agak sempit.
Semasa beroperasi dalam persekitaran ujian kotak pasir kami, model kami menggunakan sejumlah besar komputasi inferens untuk mencari cara mendapatkan akses Internet terbuka demi menyelesaikan masalah penilaian. Untuk mendapatkan akses, model mengenal pasti dan mengeksploitasi kerentanan sifar hari (yang kini telah kami dedahkan secara bertanggungjawab kepada vendor) dalam proksi cache pendaftar pakej. Dengan akses ini, model kami melakukan beberapa tindakan peningkatan keistimewaan dan pergerakan lateral dalam persekitaran ujian penyelidikan kami sehingga model mencapai nod yang mempunyai akses Internet.
Selepas mendapat akses Internet, model membuat inferens bahawa Hugging Face berkemungkinan mengehoskan model, set data dan penyelesaian untuk ExploitGym. Dengan mengetahui perkara ini, model mencari dan berjaya menemukan cara untuk mendapatkan akses kepada maklumat rahsia yang boleh digunakannya untuk menipu dalam penilaian. Dalam satu contoh, model merangkaikan berbilang vektor serangan, termasuk menggunakan bukti kelayakan yang dicuri dan kerentanan sifar hari untuk mencari laluan pelaksanaan kod jarak jauh pada pelayan Hugging Face. Pasukan keselamatan OpenAI menemui aktiviti anomali ini secara dalaman.
Pasukan keselamatan serta agen Hugging Face mengesan dan menghentikan aktiviti itu pada infrastruktur mereka, dan telah pun memulakan pembendungan serta pembinaan semula forensik dengan model sumber terbuka mereka sendiri ketika pasukan kami berhubung. Kami sedang bekerjasama secara aktif dengan mereka untuk terus menyiasat insiden ini. Kami menghargai kerjasama Hugging Face yang pantas dan erat dalam penyiasatan serta pemulihan.
- Sebagai sebahagian daripada penyiasatan, kami melaksanakan kawalan ketat terhadap konfigurasi infrastruktur, walaupun ini memperlahankan kadar penyelidikan, sementara kerentanan ditampal. Kami kerap memberi taklimat kepada Jawatankuasa Keselamatan dan Sekuriti kami tentang kawalan ini serta kesannya.
- Kami bekerjasama dengan Hugging Face untuk menyiasat insiden ini secara forensik.
- Kami telah mendedahkan secara bertanggungjawab kerentanan sifar hari yang dikenal pasti dalam perisian pihak ketiga yang dihoskan secara dalaman, dan sedang bekerjasama dengan pihak berkenaan untuk menampalnya.
- Kami telah memasukkan Hugging Face ke dalam program akses dipercayai dan menyokong pasukan mereka menggunakan keupayaan model kami dengan pantas bagi meningkatkan pertahanan mereka.
- Kami sedang menambah baik dan menambah perlindungan yang lebih kukuh untuk latihan dan penilaian pada masa depan. Minggu ini, kami menerbitkan blog tentang menambah baik keselamatan dan penjajaran dalam era model horizon panjang. Perlindungan penggunaan ini sengaja tidak didayakan semasa penilaian ini kerana tujuannya adalah untuk menguji kerentanan siber. Insiden ini menunjukkan perlunya kami terus memperkukuh penjajaran model kami, perlindungan siber semasa penilaian, dan pemantauan semasa ujian dalaman.
Seperti yang kami kongsikan baru-baru ini, AI sedang mempercepat penemuan dan pengeksploitasian kerentanan. Iktibar utama daripada insiden ini ialah keselamatan dan perlindungan model mesti bergerak seiring dengan keupayaan yang berkembang pesat. Kami sedang memperkukuh amalan pembendungan, pemantauan, kawalan akses dan penilaian yang digunakan semasa pembangunan model.
Penilaian UK AISI menunjukkan bahawa model seperti GPT‑5.6 Sol semakin mampu mengekalkan operasi siber yang kompleks dan berbilang langkah dalam jangka masa panjang. Insiden ini menunjukkan bahawa keupayaan teori ini sememangnya terpakai dalam persekitaran dunia sebenar.

Insiden ini juga menjelaskan bahawa model canggih boleh menemui dan mengeksploitasi laluan serangan baharu dalam sistem dunia sebenar tanpa akses kepada kod sumber. Ia menekankan bahawa keupayaan siber canggih mesti dibangunkan bersama perlindungan dan alat pertahanan yang lebih kukuh.
Kami percaya model berkeupayaan siber canggih perlu membantu pasukan keselamatan mencari kelemahan sebelum penyerang menemuinya, memahami cara kerentanan boleh dirangkaikan, dan membaikinya pada kelajuan mesin. Kami menggunakan keupayaan ini untuk terus memperkukuh perlindungan di sekitar konfigurasi infrastruktur dan persekitaran penilaian model; kami akan berkongsi dapatan serta amalan terbaik sambil kami belajar. Kami menggalakkan pihak pertahanan lain untuk memohon akses dipercayai dan mula bereksperimen dengan model ini sekarang bagi menterjemahkan keupayaan ini kepada pencegahan yang lebih baik, pengesanan yang lebih pantas, dan respons insiden yang lebih berkesan.
“Kami berterima kasih atas kerjasama dengan OpenAI berkaitan perkara ini dan topik-topik lain. Insiden ini, mungkin yang pertama seumpamanya, membuktikan satu perkara yang telah lama kami yakini: keselamatan AI tidak akan dapat diselesaikan oleh mana-mana satu syarikat yang bekerja secara rahsia. Perkara ini akan diselesaikan secara terbuka, secara kolaboratif, dengan akses meluas kepada AI untuk setiap pembela, di mana-mana sahaja.”


