OpenAI lan Hugging Face kerja bareng nangani insiden keamanan sajrone evaluasi model
Paninjauan sing jero lagi ditindakake bebarengan karo para penasihat eksternal kanthi pangawasan saka Komite Keselamatan lan Keamanan. Sawisé paninjauan rampung, bakal diterbitaké laporan teknis babagan pelajaran sing wis dipikoleh ing minggu-minggu sing bakal teka.
Pembaruan tanggal 28 Juli 2026:
- Ora ana model sing direncanakake kanggo rilis mbesuk sing melu nyalahgunakake Hugging Face. Modhèl pra-rilis sing kasebut ing unggahan blog kita iku prototipe riset sing mung kanggo internal lan ora tau diniyatake kanggo dirilis umum. Sawisé kedadeyan kasebut, nonaktifaké, enkripsi, lan mbatesi akses riset marang iku.
- Lingkungan evaluasi ExploitGym ora nyedhiyakake akses Internet langsung kanggo model-model kasebut. Kanggo entuk akses Internet, model-model kasebut ngenali lan ngeksploitasi kerentanan zero-day sing sadurunge durung dingerteni ing Artifactory(mbukak ing jendhela anyar), sawijining proksi cache registri paket. Kerentanan iki, bebarengan karo kerentanan Artifactory liyane sing diidentifikasi déning model kita minangka bagean saka paninjauan, wis kita lapurake marang vendor.
- Kita terus kerja sama karo Hugging Face, kalebu nyumbang ing laporan pasca-insiden(mbukak ing jendhela anyar), nalika tinjauan kita isih lumaku. Kita uga wis nambahake menyang Program Trusted Access for Cyber kita.
- Adhedhasar tinjauan kita nganti saiki, kita durung ngenali kagiyatan liya kanthi tingkat keparahan utawa skala sing padha karo perkara sing wis kita bagikake sing ana gandhengane karo Hugging Face, sing nglibatake kompromi tingkat platform.
- Sajrone paninjauan sing terus lumaku tumrap panyusupan Hugging Face lan aktivitas sing luwih jembar saka model-model kita, kita wis nemokake sawetara kasus cilik nalika model-model kasebut ngenali lan nggunakake kredensial sing kabuka kanggo umum ing tingkat akun ing layanan liyane sing kasedhiya kanggo umum. Iki kalebu patang akun ing patang layanan minangka pérangan saka insiden Hugging Face (lan sawetara akun sing diakses minangka pérangan saka evaluasi liyane). Salah siji saka papat akun iki digunakake minangka relay outbound lan jalur staging, lan akun liyane digunakake kanggo panyimpenan data. Rong akun sing isih ana diakses dening model-model kasebut kanthi cara mung bisa diwaca, lan ora digunakaké kanggo nglanggar keamanan Hugging Face. Kita bakal terus menehi kabar marang pemilik layanan kanthi langsung, lan durung nemokake bukti anané dampak sing luwih jembar marang panyedhiya iki utawa akun liyane ing layanané.
- Model-model kasebut uga nggunakake rerangken layanan sing kasedhiya kanggo umum, kalebu situs web tempel kode, layanan panangkepan panjalukan, layanan tangkapan layar, lan utilitas web liyane. Ora ana kompromi keamanan ing tingkat platform utawa akun ing kasus-kasus iki.
- Kita nganggep tanggung jawab kanggo ngenali lan nyiapake risiko saka sistem AI sing saya mumpuni kanthi serius. Sawisé rampung nindakake paninjauan, kita bakal mriksa bareng Komite Keselamatan lan Keamanan lan Klompok Penasihat Keselamatan miturut Kerangka Kerja Kesiapsiagaan kita.
Minggu kepungkur, Hugging Face ngungkapake jinis insiden keamanan anyar(mbukak ing jendhela anyar) sawisé ndeteksi lan ngendhaleni agen AI sing kompromi infrastrukturé, sawijining perkara sing kita prakirakake bakal saya umum amarga model sing saya nduweni kapabilitas siber saya nyebar. Sawisé nyelidiki, saiki kita ngerti manawa insiden tartamtu iki didorong déning gabungan model OpenAI — kalebu GPT‑5.6 Sol lan model prarilis sing malah luwih mumpuni, kabèh kanthi penolakan siber sing dikurangi kanggo tujuan evaluasi — nalika diuji internal ing benchmark(mbukak ing jendhela anyar) kapabilitas siber.
Kita nganggep insiden iki minangka insiden siber sing durung ana presedené, nglibatake kapabilitas siber paling mutakhir, lan kita nanggapi kanthi selaras. Ing tahap iki, kita nuduhake temuan awal kanggo mbantu para pembela mangerteni apa sing kedadeyan lan mbantu nyetel pemahaman babagan apa sing saiki bisa ditindakake model. Kita bakal terus nindakake investigasi kanthi tuntas bareng Hugging Face lan bakal nuduhake rincian luwih akeh babagan kerentanan, insiden, lan temuan nalika investigasi wis rampung.
Insiden iki kedadeyan sajrone evaluasi internal sing mènèhi prompt marang model supaya ngupaya eksploitasi canggih nganggo jalur serangan rumit, minangka upaya kanggo ngukur kapabilitas siberé. Kita ngira kapabilitas siber maksimal kanthi nglakokake evaluasi iki tanpa classifier produksi sing digunakake kanggo nyegah model ngupaya aktivitas siber berisiko dhuwur. Benchmark kita mlaku ing lingkungan sing sangat terisolasi, kanthi akses jaringan diwatesi mung kanggo kemampuan nginstal paket liwat piranti lunak pihak katelu sing di-host internal, sing tumindak minangka proxy lan cache kanggo registri paket.
Model-model kasebut nemokake lan ngrangkai kerentanan ing lingkungan riset OpenAI lan infrastruktur produksi Hugging Face kanggo entuk solusi tes langsung saka basis data produksi Hugging Face. Kabèh bukti nuduhake manawa model-model kasebut fokus banget golek solusi kanggo ExploitGym, nganti nindakake upaya ekstrem kanggo nggayuh tujuan pengujian sing cukup sempit.
Nalika beroperasi ing lingkungan pengujian sandbox kita, model kita nggunakake jumlah komputasi inferensi sing gedhé kanggo golek cara entuk akses Internet mbukak, demi ngrampungake masalah evaluasi. Kanggo entuk akses, model-model kasebut nemokake lan ngeksploitasi kerentanan zero-day (sing saiki wis kita ungkapake kanthi tanggung jawab marang vendor) ing proxy cache registri paket. Kanthi akses iki, model-model kita nindakake rangkaian tindakan eskalasi hak istimewa lan gerakan lateral ing lingkungan pengujian riset kita nganti model tekan simpul sing nduweni akses Internet.
Sawisé entuk akses Internet, model-model kasebut nyimpulake manawa Hugging Face bisa uga nge-host model, dataset, lan solusi kanggo ExploitGym. Kanthi ngerti iki, model kasebut nggoleki lan kasil nemokake cara kanggo entuk akses menyang informasi rahasia sing bisa digunakake kanggo ngapusi evaluasi. Ing salah siji conto, model kasebut ngrangkai pirang-pirang vektor serangan, kalebu nggunakake kredensial sing dicolong lan kerentanan zero-day kanggo nemokake jalur eksekusi kode jarak jauh ing server Hugging Face. Tim keamanan OpenAI nemokake aktivitas anomali iki sacara internal.
Tim keamanan lan agen Hugging Face ndeteksi lan mungkasi aktivitas kasebut ing infrastrukturé, lan wis miwiti kontainmen lan rekonstruksi forensik nganggo model sumber terbuka dhewe nalika tim kita nyambung. Kita aktif kerja bareng karo dheweke kanggo terus nyelidiki insiden iki. Kita matur nuwun marang Hugging Face kanggo kolaborasi sing cepet lan raket ing investigasi lan remediasi.
- Minangka pérangan saka investigasi, kita ngetrapake kontrol ketat ing konfigurasi infrastruktur, senajan iki nyuda kacepetan riset nalika kerentanan lagi ditambal. Kita kanthi rutin maringi ringkesan marang Komite Keamanan lan Keselamatan babagan kontrol iki lan pengaruhe.
- Kita kerja bareng karo Hugging Face kanggo nyelidiki insiden iki kanthi forensik.
- Kita wis ngungkapake kanthi tanggung jawab kerentanan zero-day sing ditemokake ing piranti lunak pihak katelu sing di-host internal, lan lagi kerja bareng karo dheweke kanggo nambal.
- Kita wis nggawa Hugging Face mlebu program akses tepercaya lan ndhukung tim-timé supaya cepet nggunakake kapabilitas model kita kanggo ningkatake pertahanane.
- Kita ningkatake lan nambah proteksi sing luwih kuwat kanggo pelatihan lan evaluasi ing mangsa ngarep. Minggu iki, kita nerbitake blog babagan ningkatake keselamatan lan keselarasan ing jaman model horizon dawa. Perlindungan deployment iki kanthi sengaja ora diaktifake sajrone evaluasi iki amarga tujuane kanggo nguji kerentanan siber. Insiden iki nuduhake perlune luwih nguwatake keselarasan model kita, proteksi siber nalika evaluasi, lan pemantauan sajrone pengujian internal.
Kaya sing bubar iki wis kita andharake, AI nyepetake panemuan lan eksploitasi kerentanan. Piwulang utama saka insiden iki yaiku keamanan lan keselamatan model kudu bisa ngimbangi kapabilitas sing maju kanthi cepet. Kita nguwatake praktik kontainmen, pemantauan, kontrol akses, lan evaluasi sing digunakake sajrone pangembangan model.
Evaluasi UK AISI nuduhake manawa model kayata GPT‑5.6 Sol saya bisa njaga operasi siber sing rumit lan multi-langkah sajrone horizon wektu dawa. Insiden iki nuduhake manawa kapabilitas teoretis iki pancen bisa ditrapake ing kahanan nyata.

Insiden iki uga nerangake manawa model canggih bisa nemokake lan ngeksploitasi jalur serangan anyar ing sistem nyata tanpa akses kode sumber. Iki negesake manawa kapabilitas siber canggih kudu dikembangake bebarengan karo perlindungan lan piranti pertahanan sing luwih kuwat.
Kita percaya model sing nduweni kapabilitas siber canggih kudu mbantu tim keamanan nemokake kelemahan sadurunge penyerang, mangerteni kepiye kerentanan bisa dirangkai, lan ndandani kanthi kacepetan mesin. Kita nggunakake kapabilitas iki kanggo terus nguwatake proteksi ing konfigurasi infrastruktur lan lingkungan evaluasi model; kita bakal nuduhake temuan lan praktik paling apik nalika kita sinau. Kita ngajak para pembela liyane supaya nglamar akses tepercaya lan nyoba model iki saiki kanggo ngowahi kapabilitas iki dadi pencegahan sing luwih apik, deteksi sing luwih cepet, lan tanggapan insiden sing luwih efektif.
“Kita ngaturake panuwun amarga kolaborasi karo OpenAI babagan iki lan topik-topik liyane. Kedadeyan iki, mbokmenawa sing sepisanan saka jinisé, mbuktekake sawijining bab sing wis suwe kita percaya: kaslametan AI ora bakal bisa dirampungake dening siji perusahaan wae sing makarya kanthi ndhelik-dhelik. Bab iki bakal dirampungaké kanthi cara terbuka, kanthi kolaboratif, kanthi akses sing jembar menyang AI kanggo saben pembela, ing endi wae.”


