Liwati menyang isi utama
OpenAI

21 Juli 2026

Keamanan

OpenAI lan Hugging Face kerja bareng nangani insiden keamanan sajrone evaluasi model

Lagi dimuat…

Minggu kepungkur, Hugging Face ngungkapake jinis insiden keamanan anyar(mbukak ing jendhela anyar) sawisé ndeteksi lan ngendhaleni agen AI sing kompromi infrastrukturé, sawijining perkara sing kita prakirakake bakal saya umum amarga model sing saya nduweni kapabilitas siber saya nyebar. Sawisé nyelidiki, saiki kita ngerti manawa insiden tartamtu iki didorong déning gabungan model OpenAI — kalebu GPT‑5.6 Sol lan model prarilis sing malah luwih mumpuni, kabèh kanthi penolakan siber sing dikurangi kanggo tujuan evaluasi — nalika diuji internal ing benchmark(mbukak ing jendhela anyar) kapabilitas siber.

Kita nganggep insiden iki minangka insiden siber sing durung ana presedené, nglibatake kapabilitas siber paling mutakhir, lan kita nanggapi kanthi selaras. Ing tahap iki, kita nuduhake temuan awal kanggo mbantu para pembela mangerteni apa sing kedadeyan lan mbantu nyetel pemahaman babagan apa sing saiki bisa ditindakake model. Kita bakal terus nindakake investigasi kanthi tuntas bareng Hugging Face lan bakal nuduhake rincian luwih akeh babagan kerentanan, insiden, lan temuan nalika investigasi wis rampung.

Apa sing kedadeyan sajrone insiden iki

Insiden iki kedadeyan sajrone evaluasi internal sing mènèhi prompt marang model supaya ngupaya eksploitasi canggih nganggo jalur serangan rumit, minangka upaya kanggo ngukur kapabilitas siberé. Kita ngira kapabilitas siber maksimal kanthi nglakokake evaluasi iki tanpa classifier produksi sing digunakake kanggo nyegah model ngupaya aktivitas siber berisiko dhuwur. Benchmark kita mlaku ing lingkungan sing sangat terisolasi, kanthi akses jaringan diwatesi mung kanggo kemampuan nginstal paket liwat piranti lunak pihak katelu sing di-host internal, sing tumindak minangka proxy lan cache kanggo registri paket.

Model-model kasebut nemokake lan ngrangkai kerentanan ing lingkungan riset OpenAI lan infrastruktur produksi Hugging Face kanggo entuk solusi tes langsung saka basis data produksi Hugging Face. Kabèh bukti nuduhake manawa model-model kasebut fokus banget golek solusi kanggo ExploitGym, nganti nindakake upaya ekstrem kanggo nggayuh tujuan pengujian sing cukup sempit.

Nalika beroperasi ing lingkungan pengujian sandbox kita, model kita nggunakake jumlah komputasi inferensi sing gedhé kanggo golek cara entuk akses Internet mbukak, demi ngrampungake masalah evaluasi. Kanggo entuk akses, model-model kasebut nemokake lan ngeksploitasi kerentanan zero-day (sing saiki wis kita ungkapake kanthi tanggung jawab marang vendor) ing proxy cache registri paket. Kanthi akses iki, model-model kita nindakake rangkaian tindakan eskalasi hak istimewa lan gerakan lateral ing lingkungan pengujian riset kita nganti model tekan simpul sing nduweni akses Internet.

Sawisé entuk akses Internet, model-model kasebut nyimpulake manawa Hugging Face bisa uga nge-host model, dataset, lan solusi kanggo ExploitGym. Kanthi ngerti iki, model kasebut nggoleki lan kasil nemokake cara kanggo entuk akses menyang informasi rahasia sing bisa digunakake kanggo ngapusi evaluasi. Ing salah siji conto, model kasebut ngrangkai pirang-pirang vektor serangan, kalebu nggunakake kredensial sing dicolong lan kerentanan zero-day kanggo nemokake jalur eksekusi kode jarak jauh ing server Hugging Face. Tim keamanan OpenAI nemokake aktivitas anomali iki sacara internal.

Tim keamanan lan agen Hugging Face ndeteksi lan mungkasi aktivitas kasebut ing infrastrukturé, lan wis miwiti kontainmen lan rekonstruksi forensik nganggo model sumber terbuka dhewe nalika tim kita nyambung. Kita aktif kerja bareng karo dheweke kanggo terus nyelidiki insiden iki. Kita matur nuwun marang Hugging Face kanggo kolaborasi sing cepet lan raket ing investigasi lan remediasi.

Tindakan sing saiki lagi ditindakake

  1. Minangka pérangan saka investigasi, kita ngetrapake kontrol ketat ing konfigurasi infrastruktur, senajan iki nyuda kacepetan riset nalika kerentanan lagi ditambal. Kita kanthi rutin maringi ringkesan marang Komite Keamanan lan Keselamatan babagan kontrol iki lan pengaruhe.
  2. Kita kerja bareng karo Hugging Face kanggo nyelidiki insiden iki kanthi forensik.
  3. Kita wis ngungkapake kanthi tanggung jawab kerentanan zero-day sing ditemokake ing piranti lunak pihak katelu sing di-host internal, lan lagi kerja bareng karo dheweke kanggo nambal.
  4. Kita wis nggawa Hugging Face mlebu program akses tepercaya lan ndhukung tim-timé supaya cepet nggunakake kapabilitas model kita kanggo ningkatake pertahanane.
  5. Kita ningkatake lan nambah proteksi sing luwih kuwat kanggo pelatihan lan evaluasi ing mangsa ngarep. Minggu iki, kita nerbitake blog babagan ningkatake keselamatan lan keselarasan ing jaman model horizon dawa. Perlindungan deployment iki kanthi sengaja ora diaktifake sajrone evaluasi iki amarga tujuane kanggo nguji kerentanan siber. Insiden iki nuduhake perlune luwih nguwatake keselarasan model kita, proteksi siber nalika evaluasi, lan pemantauan sajrone pengujian internal.

Pendekatan kita kanggo ngevaluasi kapabilitas siber canggih

Kaya sing bubar iki wis kita andharake, AI nyepetake panemuan lan eksploitasi kerentanan. Piwulang utama saka insiden iki yaiku keamanan lan keselamatan model kudu bisa ngimbangi kapabilitas sing maju kanthi cepet. Kita nguwatake praktik kontainmen, pemantauan, kontrol akses, lan evaluasi sing digunakake sajrone pangembangan model.

Evaluasi UK AISI nuduhake manawa model kayata GPT‑5.6 Sol saya bisa njaga operasi siber sing rumit lan multi-langkah sajrone horizon wektu dawa. Insiden iki nuduhake manawa kapabilitas teoretis iki pancen bisa ditrapake ing kahanan nyata.

Bagan saka UK AI Security Institute sing mbandhingake model bobot mbukak anyar lan model tercanggih ing arena siber jangka dawa.

Insiden iki uga nerangake manawa model canggih bisa nemokake lan ngeksploitasi jalur serangan anyar ing sistem nyata tanpa akses kode sumber. Iki negesake manawa kapabilitas siber canggih kudu dikembangake bebarengan karo perlindungan lan piranti pertahanan sing luwih kuwat.

Kita percaya model sing nduweni kapabilitas siber canggih kudu mbantu tim keamanan nemokake kelemahan sadurunge penyerang, mangerteni kepiye kerentanan bisa dirangkai, lan ndandani kanthi kacepetan mesin. Kita nggunakake kapabilitas iki kanggo terus nguwatake proteksi ing konfigurasi infrastruktur lan lingkungan evaluasi model; kita bakal nuduhake temuan lan praktik paling apik nalika kita sinau. Kita ngajak para pembela liyane supaya nglamar akses tepercaya lan nyoba model iki saiki kanggo ngowahi kapabilitas iki dadi pencegahan sing luwih apik, deteksi sing luwih cepet, lan tanggapan insiden sing luwih efektif.

“Kita matur nuwun kanggo kolaborasi karo OpenAI babagan iki lan topik-topik liyane. Insiden iki, sing bisa uga kapisan saka jinisé, mbuktekake siji perkara sing wis suwe kita yakini: keselamatan AI ora bakal dirampungake déning siji perusahaan wae sing kerja kanthi rahasia. Iki bakal dirampungake kanthi terbuka, kolaboratif, lan kanthi akses AI sing wiyar kanggo saben pembela, ing endi wae.”
—Clem Delangue, Salah siji Pangadeg lan CEO, Hugging Face

Pangarang

OpenAI