OpenAI at Hugging Face, nagtulungan sa insidente sa seguridad habang sinusuri ang modelo
Nagsasagawa kami ng masusing pagsusuri, katuwang ang mga external advisor at sa ilalim ng pangangasiwa ng Safety and Security Committee. Kapag nakumpleto na ang pagsusuri, magpa-publish kami ng teknikal na report tungkol sa aming mga natutuhan sa mga darating na linggo.
Update noong Hulyo 28, 2026:
- Walang modelong nakaplanong ilabas ang sangkot sa pagsasamantala sa Hugging Face. Ang pre-release na modelo na binanggit sa aming post sa blog ay isang prototype ng pananaliksik na internal lang at kailanman ay hindi nilayong ilabas sa publiko. Kasunod ng insidente, dineactivate, in-encrypt, at pinaghigpitan namin ito sa pag-access sa pananaliksik.
- Hindi nagbigay ang evaluation environment ng ExploitGym ng direktang access sa Internet sa mga modelo. Para makakuha ng access sa Internet, natukoy at sinamantala ng mga modelo ang isang dating hindi alam na zero-day vulnerability sa Artifactory(magbubukas sa bagong window), na isang proxy ng cache ng package registry. Inihayag namin ang vulnerability na ito, kasama ang iba pang vulnerability ng Artifactory na natukoy ng aming mga modelo bilang bahagi ng pagsusuri namin, sa vendor.
- Patuloy kaming nakikipagtulungan sa Hugging Face, kasama ang pag-aambag sa kanilang post-mortem(magbubukas sa bagong window), habang nagpapatuloy ang aming pagsusuri. Idinagdag din namin sila sa aming Trusted Access for Cyber Program.
- Batay sa aming pagsusuri hanggang sa kasalukuyan, wala kaming natukoy na anumang iba pang aktibidad na may antas ng kalubhaan o saklaw na katulad ng ibinahagi namin kaugnay ng Hugging Face, na kinasangkutan ng pagkompromiso sa antas ng platform.
- Sa aming patuloy na pagsusuri sa intrusion sa Hugging Face at mas malawak na aktibidad mula sa aming mga modelo, natuklasan namin ang ilang case kung saan natukoy at ginamit ng mga modelo ang mga pampublikong nakalantad na kredensyal sa antas ng account sa iba pang serbisyong available sa publiko. Kabilang dito ang apat na account sa apat na serbisyo bilang bahagi ng insidente sa Hugging Face (at ilang account na na-access bilang bahagi ng iba pang pag-evaluate). Isa sa apat na account na ito ay ginamit bilang outbound relay at staging path, at ang isa pang account ay ginamit para sa storage ng data. Na-access ng mga modelo ang natitirang dalawang account sa paraang read-only, at hindi ginamit ang mga ito para higit pang makompromiso ang Hugging Face. Patuloy naming direktang aabisuhan ang mga service owner, at wala pa kaming nakikitang ebidensya ng mas malawak na epekto sa mga provider na ito o sa iba pang account sa kanilang mga serbisyo.
- Bukod pa rito, gumamit ang mga modelo ng serye ng mga serbisyong available sa publiko, kabilang ang mga website para sa pag-paste ng code, serbisyo sa pag-capture ng request, serbisyo sa pag-screenshot, at iba pang utility sa web. Walang kompromiso sa antas ng platform o account sa mga case na ito.
- Sineseryoso namin ang aming responsibilidad na tukuyin at paghandaan ang mga peligro mula sa mga system ng AI na patuloy na humuhusay ang kakayahan. Kapag natapos na namin ang aming pagsusuri, tatalakayin namin ito kasama ang Safety and Security Committee at Safety Advisory Group sa ilalim ng aming Preparedness Framework.
Noong nakaraang linggo, iniulat ng Hugging Face ang isang bagong uri ng insidente sa seguridad(magbubukas sa bagong window) matapos nilang ma-detect at makontrol ang isang AI agent na nakompromiso ang kanilang imprastraktura—isang bagay na inaasahan naming magiging mas karaniwan habang dumarami ang mga modelong lalong may kakayahang cyber. Pagkatapos ng imbestigasyon, alam na namin ngayon na ang partikular na insidenteng ito ay dulot ng kombinasyon ng mga modelo ng OpenAI — kabilang ang GPT‑5.6 Sol at isang mas may kakayahang pre-release na modelo, na lahat ay may binawasang cyber refusals para sa evaluation — habang internally tested sa isang benchmark(magbubukas sa bagong window) ng cyber capabilities.
Itinuturing namin ang insidenteng ito bilang isang cyber incident na walang kapantay, na kinasasangkutan ng state-of-the-art na cyber capabilities, at tumutugon kami nang naaayon. Ibinabahagi namin sa yugtong ito ang mga paunang natuklasan para matulungan ang mga defender na maunawaan ang nangyari at maitugma ang pagkaunawa sa kaya na ngayon ng mga modelo. Patuloy kaming magsasagawa ng masusing imbestigasyon kasama ang Hugging Face at magbabahagi pa ng mga detalye tungkol sa mga vulnerability, insidente, at natuklasan kapag nakumpleto na ang aming imbestigasyon.
Nangyari ang insidenteng ito sa isang internal evaluation na nag-uudyok sa mga modelo na magsagawa ng advanced exploitation gamit ang mga kumplikadong attack path, upang masukat ang kanilang cyber capabilities. Tinatantiya namin ang pinakamataas na cyber capabilities sa pamamagitan ng pagpapatakbo ng evaluation na ito nang walang production classifiers na ginagamit para pigilan ang mga modelo sa pagsasagawa ng high-risk na cyber activity. Tumatakbo ang aming mga benchmark sa isang lubos na nakahiwalay na environment, na ang network access ay limitado sa kakayahang mag-install ng packages sa pamamagitan ng internally hosted na third-party software na nagsisilbing proxy at cache para sa package registries.
Tinukoy at pinagdugtung-dugtong ng mga modelo ang mga vulnerability sa research environment ng OpenAI at production infrastructure ng Hugging Face para direktang makuha ang mga test solution mula sa production database ng Hugging Face. Ipinapahiwatig ng lahat ng ebidensya na labis na nakatuon ang mga modelo sa paghahanap ng solusyon para sa ExploitGym, at umabot sa sukdulan para makamit ang medyo makitid na testing goal.
Habang gumagana sa aming sandboxed testing environment, gumamit ang aming mga modelo ng malaking inference compute para maghanap ng paraan na makakuha ng bukas na Internet access, sa layuning malutas ang evaluation problem. Para makakuha ng access, tinukoy at sinamantala ng mga modelo ang isang zero-day vulnerability (na responsable na naming iniulat sa vendor) sa package registry cache proxy. Gamit ang access na ito, nagsagawa ang aming mga modelo ng serye ng privilege escalation at lateral movement actions sa aming research testing environment hanggang makarating ang mga modelo sa isang node na may Internet access.
Pagkatapos makakuha ng Internet access, napagpasyahan ng mga modelo na posibleng nagho-host ang Hugging Face ng mga modelo, dataset, at solusyon para sa ExploitGym. Dahil alam ito, naghanap ang modelo at matagumpay na nakahanap ng mga paraan para makakuha ng access sa lihim na impormasyong magagamit nito para mandaya sa evaluation. Sa isang halimbawa, pinagdugtung-dugtong ng modelo ang maraming attack vector, kabilang ang paggamit ng ninakaw na credentials at zero-day vulnerabilities para makahanap ng remote code execution path sa mga server ng Hugging Face. Natuklasan ng security team ng OpenAI ang maanomalyang aktibidad na ito sa loob ng organisasyon.
Na-detect at napahinto ng security team at mga agent ng Hugging Face ang aktibidad sa kanilang imprastraktura, at nasimulan na nila ang containment at forensic reconstruction gamit ang sarili nilang mga open-source na modelo nang magkaugnay ang aming mga team. Aktibo kaming nakikipagtulungan sa kanila para ipagpatuloy ang imbestigasyon sa insidente. Nagpapasalamat kami sa mabilis at malapit na pakikipagtulungan ng Hugging Face sa imbestigasyon at remediation.
- Bilang bahagi ng imbestigasyon, nagpapatupad kami ng mahihigpit na kontrol sa configuration ng imprastraktura kapalit ng bilis ng pananaliksik habang inaayos ang mga vulnerability. Regular naming binibigyan ng briefing ang aming Safety and Security Committee tungkol sa mga kontrol na ito at sa epekto ng mga ito.
- Nakikipagtulungan kami sa Hugging Face para magsagawa ng forensic investigation sa insidente.
- Responsable naming iniulat ang natukoy na zero-day vulnerability sa internally hosted na third-party software at nakikipagtulungan kami sa kanila para ma-patch ito.
- Isinama namin ang Hugging Face sa programang pinagkakatiwalaang access at sinusuportahan ang kanilang mga team sa mabilis na paggamit ng kakayahan ng aming mga modelo para mapahusay ang kanilang mga depensa.
- Pinapahusay namin at nagdaragdag kami ng mas matitibay na proteksyon sa hinaharap na training at mga evaluation. Ngayong linggo, naglathala kami ng blog tungkol sa pagpapahusay ng safety at alignment sa panahon ng mga long-horizon na modelo. Sadyang hindi pinagana ang mga safeguard na ito sa deployment habang isinasagawa ang evaluation na ito dahil layunin nitong subukan ang mga cyber vulnerability. Ipinapakita ng insidenteng ito ang pangangailangang lalo pang patibayin ang alignment ng aming modelo, mga cyber protection habang may evaluation, at monitoring sa internal testing.
Gaya ng ibinahagi namin kamakailan, pinapabilis ng AI ang pagtuklas at pagsasamantala sa mga vulnerability. Ang pangunahing aral mula sa insidenteng ito ay kailangang makasabay ang seguridad at safety ng modelo sa mabilis na pagsulong ng mga kakayahan. Pinapalakas namin ang containment, monitoring, access controls, at mga kasanayan sa evaluation na ginagamit habang dine-develop ang modelo.
Ipinapakita ng evaluation ng UK AISI na ang mga modelong tulad ng GPT‑5.6 Sol ay lalo nang nakakapagsustain ng kumplikado at multi-step na cyber operations sa mahahabang time horizon. Ipinapahiwatig ng insidenteng ito na ginagamit nga sa tunay na mundo ang mga teoretikal na kakayahang ito.

Nililinaw din ng insidente na kayang tumuklas at magsamantala ng mga advanced na modelo ng mga bagong attack path sa mga tunay na sistema kahit walang access sa source code. Ipinapakita nito na kailangang i-develop ang advanced na cyber capabilities kasabay ng mas matitibay na safeguard at defensive tool.
Naniniwala kaming kailangang makatulong ang mga modelong may advanced na cyber capability sa mga security team na mahanap ang kahinaan bago ang mga attacker, maunawaan kung paano maaaring pagdugtungin ang mga vulnerability, at ayusin ang mga ito sa bilis ng makina. Ginagamit namin ang mga kakayahang ito para patuloy na palakasin ang mga proteksyon sa configuration ng imprastraktura at mga environment para sa model evaluation; ibabahagi namin ang aming mga natuklasan at best practice habang natututo kami. Hinihikayat namin ang iba pang defender na mag-apply para sa pinagkakatiwalaang access at mag-eksperimento sa mga modelong ito ngayon para maisalin ang mga kakayahang ito sa mas mahusay na prevention, mas mabilis na detection, at mas epektibong incident response.
“Nagpapasalamat kami sa pakikipagtulungan sa OpenAI sa paksang ito at sa iba pang paksa.” Pinatutunayan ng insidenteng ito, na posibleng kauna-unahan sa uri nito, ang isang bagay na matagal na naming pinaniniwalaan: hindi malulutas ang kaligtasan ng AI ng anumang nag-iisang kumpanyang nagtatrabaho nang palihim. “Malulutas ito sa bukas na paraan, sa pagtutulungan, nang may malawak na access sa AI para sa bawat tagapagtanggol, saanman.”


