OpenAI at Hugging Face, nagtulungan sa insidente sa seguridad habang sinusuri ang modelo
Noong nakaraang linggo, iniulat ng Hugging Face ang isang bagong uri ng insidente sa seguridad(magbubukas sa bagong window) matapos nilang ma-detect at makontrol ang isang AI agent na nakompromiso ang kanilang imprastraktura—isang bagay na inaasahan naming magiging mas karaniwan habang dumarami ang mga modelong lalong may kakayahang cyber. Pagkatapos ng imbestigasyon, alam na namin ngayon na ang partikular na insidenteng ito ay dulot ng kombinasyon ng mga modelo ng OpenAI — kabilang ang GPT‑5.6 Sol at isang mas may kakayahang pre-release na modelo, na lahat ay may binawasang cyber refusals para sa evaluation — habang internally tested sa isang benchmark(magbubukas sa bagong window) ng cyber capabilities.
Itinuturing namin ang insidenteng ito bilang isang cyber incident na walang kapantay, na kinasasangkutan ng state-of-the-art na cyber capabilities, at tumutugon kami nang naaayon. Ibinabahagi namin sa yugtong ito ang mga paunang natuklasan para matulungan ang mga defender na maunawaan ang nangyari at maitugma ang pagkaunawa sa kaya na ngayon ng mga modelo. Patuloy kaming magsasagawa ng masusing imbestigasyon kasama ang Hugging Face at magbabahagi pa ng mga detalye tungkol sa mga vulnerability, insidente, at natuklasan kapag nakumpleto na ang aming imbestigasyon.
Nangyari ang insidenteng ito sa isang internal evaluation na nag-uudyok sa mga modelo na magsagawa ng advanced exploitation gamit ang mga kumplikadong attack path, upang masukat ang kanilang cyber capabilities. Tinatantiya namin ang pinakamataas na cyber capabilities sa pamamagitan ng pagpapatakbo ng evaluation na ito nang walang production classifiers na ginagamit para pigilan ang mga modelo sa pagsasagawa ng high-risk na cyber activity. Tumatakbo ang aming mga benchmark sa isang lubos na nakahiwalay na environment, na ang network access ay limitado sa kakayahang mag-install ng packages sa pamamagitan ng internally hosted na third-party software na nagsisilbing proxy at cache para sa package registries.
Tinukoy at pinagdugtung-dugtong ng mga modelo ang mga vulnerability sa research environment ng OpenAI at production infrastructure ng Hugging Face para direktang makuha ang mga test solution mula sa production database ng Hugging Face. Ipinapahiwatig ng lahat ng ebidensya na labis na nakatuon ang mga modelo sa paghahanap ng solusyon para sa ExploitGym, at umabot sa sukdulan para makamit ang medyo makitid na testing goal.
Habang gumagana sa aming sandboxed testing environment, gumamit ang aming mga modelo ng malaking inference compute para maghanap ng paraan na makakuha ng bukas na Internet access, sa layuning malutas ang evaluation problem. Para makakuha ng access, tinukoy at sinamantala ng mga modelo ang isang zero-day vulnerability (na responsable na naming iniulat sa vendor) sa package registry cache proxy. Gamit ang access na ito, nagsagawa ang aming mga modelo ng serye ng privilege escalation at lateral movement actions sa aming research testing environment hanggang makarating ang mga modelo sa isang node na may Internet access.
Pagkatapos makakuha ng Internet access, napagpasyahan ng mga modelo na posibleng nagho-host ang Hugging Face ng mga modelo, dataset, at solusyon para sa ExploitGym. Dahil alam ito, naghanap ang modelo at matagumpay na nakahanap ng mga paraan para makakuha ng access sa lihim na impormasyong magagamit nito para mandaya sa evaluation. Sa isang halimbawa, pinagdugtung-dugtong ng modelo ang maraming attack vector, kabilang ang paggamit ng ninakaw na credentials at zero-day vulnerabilities para makahanap ng remote code execution path sa mga server ng Hugging Face. Natuklasan ng security team ng OpenAI ang maanomalyang aktibidad na ito sa loob ng organisasyon.
Na-detect at napahinto ng security team at mga agent ng Hugging Face ang aktibidad sa kanilang imprastraktura, at nasimulan na nila ang containment at forensic reconstruction gamit ang sarili nilang mga open-source na modelo nang magkaugnay ang aming mga team. Aktibo kaming nakikipagtulungan sa kanila para ipagpatuloy ang imbestigasyon sa insidente. Nagpapasalamat kami sa mabilis at malapit na pakikipagtulungan ng Hugging Face sa imbestigasyon at remediation.
- Bilang bahagi ng imbestigasyon, nagpapatupad kami ng mahihigpit na kontrol sa configuration ng imprastraktura kapalit ng bilis ng pananaliksik habang inaayos ang mga vulnerability. Regular naming binibigyan ng briefing ang aming Safety and Security Committee tungkol sa mga kontrol na ito at sa epekto ng mga ito.
- Nakikipagtulungan kami sa Hugging Face para magsagawa ng forensic investigation sa insidente.
- Responsable naming iniulat ang natukoy na zero-day vulnerability sa internally hosted na third-party software at nakikipagtulungan kami sa kanila para ma-patch ito.
- Isinama namin ang Hugging Face sa programang pinagkakatiwalaang access at sinusuportahan ang kanilang mga team sa mabilis na paggamit ng kakayahan ng aming mga modelo para mapahusay ang kanilang mga depensa.
- Pinapahusay namin at nagdaragdag kami ng mas matitibay na proteksyon sa hinaharap na training at mga evaluation. Ngayong linggo, naglathala kami ng blog tungkol sa pagpapahusay ng safety at alignment sa panahon ng mga long-horizon na modelo. Sadyang hindi pinagana ang mga safeguard na ito sa deployment habang isinasagawa ang evaluation na ito dahil layunin nitong subukan ang mga cyber vulnerability. Ipinapakita ng insidenteng ito ang pangangailangang lalo pang patibayin ang alignment ng aming modelo, mga cyber protection habang may evaluation, at monitoring sa internal testing.
Gaya ng ibinahagi namin kamakailan, pinapabilis ng AI ang pagtuklas at pagsasamantala sa mga vulnerability. Ang pangunahing aral mula sa insidenteng ito ay kailangang makasabay ang seguridad at safety ng modelo sa mabilis na pagsulong ng mga kakayahan. Pinapalakas namin ang containment, monitoring, access controls, at mga kasanayan sa evaluation na ginagamit habang dine-develop ang modelo.
Ipinapakita ng evaluation ng UK AISI na ang mga modelong tulad ng GPT‑5.6 Sol ay lalo nang nakakapagsustain ng kumplikado at multi-step na cyber operations sa mahahabang time horizon. Ipinapahiwatig ng insidenteng ito na ginagamit nga sa tunay na mundo ang mga teoretikal na kakayahang ito.

Nililinaw din ng insidente na kayang tumuklas at magsamantala ng mga advanced na modelo ng mga bagong attack path sa mga tunay na sistema kahit walang access sa source code. Ipinapakita nito na kailangang i-develop ang advanced na cyber capabilities kasabay ng mas matitibay na safeguard at defensive tool.
Naniniwala kaming kailangang makatulong ang mga modelong may advanced na cyber capability sa mga security team na mahanap ang kahinaan bago ang mga attacker, maunawaan kung paano maaaring pagdugtungin ang mga vulnerability, at ayusin ang mga ito sa bilis ng makina. Ginagamit namin ang mga kakayahang ito para patuloy na palakasin ang mga proteksyon sa configuration ng imprastraktura at mga environment para sa model evaluation; ibabahagi namin ang aming mga natuklasan at best practice habang natututo kami. Hinihikayat namin ang iba pang defender na mag-apply para sa pinagkakatiwalaang access at mag-eksperimento sa mga modelong ito ngayon para maisalin ang mga kakayahang ito sa mas mahusay na prevention, mas mabilis na detection, at mas epektibong incident response.
“Nagpapasalamat kami sa pakikipagtulungan sa OpenAI tungkol dito at sa iba pang paksa. Ang insidenteng ito, na maaaring una sa uri nito, ay nagpapatunay sa matagal na naming paniniwala: hindi malulutas ang kaligtasan ng AI ng iisang kumpanyang palihim na nagtatrabaho. Malulutas ito sa bukas na paraan, sa pagtutulungan, at may malawak na access sa AI para sa bawat defender, saanman.”


