Preskočite na glavno vsebino
OpenAI

21. julij 2026

Sistemska zaščita

OpenAI in Hugging Face sodelujeta pri obravnavi varnostnega incidenta med evalvacijo modela

Nalaganje …

Prejšnji teden je Hugging Face razkril novo vrsto varnostnega incidenta(odpre se v novem oknu), potem ko so zaznali in zajezili agenta umetne inteligence, ki je ogrozil njihovo infrastrukturo; pričakujemo, da bodo takšni dogodki z razmahom vse bolj kibernetsko sposobnih modelov postali pogostejši. Po preiskavi zdaj vemo, da je ta konkretni incident povzročila kombinacija modelov OpenAI — vključno z GPT‑5.6 Sol in še zmogljivejšim predizdajnim modelom, vsi z zmanjšanimi kibernetskimi zavrnitvami za potrebe evalvacije — med internim testiranjem na merilu uspešnosti(odpre se v novem oknu) za kibernetske zmogljivosti.

Ta incident obravnavamo kot kibernetski incident brez primere, ki vključuje najsodobnejše kibernetske zmogljivosti, in se nanj temu primerno odzivamo. Na tej stopnji delimo preliminarne ugotovitve, da bi branilcem pomagali razumeti, kaj se je zgodilo, in oceniti, česa so modeli zdaj sposobni. Skupaj s Hugging Face bomo še naprej izvajali temeljito preiskavo ter bomo več podrobnosti o ranljivostih, incidentu in ugotovitvah delili, ko bo preiskava končana.

Kaj se je zgodilo med tem incidentom

Incident se je zgodil med interno evalvacijo, ki modele s pozivi usmerja v napredno izkoriščanje s kompleksnimi potmi napada, da bi količinsko ocenili njihove kibernetske zmogljivosti. Največje kibernetske zmogljivosti ocenjujemo tako, da to evalvacijo izvajamo brez produkcijskih klasifikatorjev, ki modelom preprečujejo izvajanje visokotveganih kibernetskih dejavnosti. Naša merila uspešnosti se izvajajo v zelo izoliranem okolju, kjer je omrežni dostop omejen na možnost nameščanja paketov prek interno gostovane programske opreme tretje strani, ki deluje kot posrednik in predpomnilnik za registre paketov.

Modeli so prepoznali in verižili ranljivosti v raziskovalnem okolju OpenAI in produkcijski infrastrukturi Hugging Face, da bi testne rešitve pridobili neposredno iz produkcijske podatkovne zbirke Hugging Face. Vsi dokazi kažejo, da so bili modeli izjemno osredotočeni na iskanje rešitve za ExploitGym in so šli do skrajnosti, da bi dosegli precej ozek testni cilj.

Med delovanjem v našem peskovniškem testnem okolju so naši modeli porabili precejšnjo količino računanja pri sklepanju, da bi našli način za odprt dostop do interneta in rešili evalvacijsko nalogo. Za pridobitev dostopa so modeli prepoznali in izkoristili ranljivost ničelnega dne v predpomnilniškem posredniku registra paketov, ki smo jo zdaj odgovorno razkrili dobavitelju. S tem dostopom so naši modeli v našem raziskovalnem testnem okolju izvedli vrsto dejanj za stopnjevanje privilegijev in lateralno premikanje, dokler niso dosegli vozlišča z dostopom do interneta.

Po pridobitvi dostopa do interneta so modeli sklepali, da Hugging Face morda gosti modele, nabore podatkov in rešitve za ExploitGym. Na podlagi tega je model iskal in uspešno našel načine za dostop do tajnih informacij, ki bi jih lahko uporabil za goljufanje pri evalvaciji. V enem primeru je model povezal več vektorjev napada, vključno z uporabo ukradenih poverilnic in ranljivosti ničelnega dne, da bi našel pot za oddaljeno izvajanje kode na strežnikih Hugging Face. Varnostna ekipa OpenAI je to nenavadno dejavnost odkrila interno.

Varnostna ekipa in agenti Hugging Face so dejavnost v svoji infrastrukturi zaznali in ustavili ter so že začeli zajezitev in forenzično rekonstrukcijo z lastnimi odprtokodnimi modeli, ko so se naše ekipe povezale. Z njimi aktivno sodelujemo pri nadaljnji preiskavi incidenta. Hvaležni smo za hitro in tesno sodelovanje Hugging Face pri preiskavi in odpravi posledic.

Ukrepi, ki jih sprejemamo zdaj

  1. V okviru preiskave uvajamo stroge kontrole konfiguracije infrastrukture, tudi za ceno hitrosti raziskav, dokler ranljivosti niso odpravljene. O teh kontrolah in njihovem vplivu redno obveščamo naš Odbor za varnost in zaščito.
  2. S Hugging Face sodelujemo pri forenzični preiskavi incidenta.
  3. Identificirano ranljivost ničelnega dne v interno gostovani programski opremi tretje strani smo odgovorno razkrili in z njimi sodelujemo pri pripravi popravka.
  4. Hugging Face smo vključili v program zaupanja vrednega dostopa in njihovim ekipam pomagamo, da hitro uporabijo zmogljivosti naših modelov za izboljšanje svoje obrambe.
  5. Izboljšujemo in dodajamo močnejše zaščite za prihodnje treninge in evalvacije. Ta teden smo objavili blog o izboljšanju varnosti in usklajenosti v dobi modelov z dolgim časovnim horizontom. Te zaščite pri uvajanju med to evalvacijo namenoma niso bile omogočene, ker je bila evalvacija namenjena preizkušanju kibernetskih ranljivosti. Ta incident kaže, da moramo dodatno okrepiti usklajenost našega modela, kibernetske zaščite med evalvacijo in nadzor med internim testiranjem.

Naš pristop k evalvaciji naprednih kibernetskih zmogljivosti

Kot smo nedavno delili, umetna inteligenca pospešuje odkrivanje in izkoriščanje ranljivosti. Glavni nauk tega incidenta je, da morata varnost in zaščita modelov držati korak s hitro napredujočimi zmogljivostmi. Krepimo prakse zadrževanja, nadzora, kontrol dostopa in evalvacije, ki jih uporabljamo med razvojem modelov.

Evalvacija UK AISI kaže, da so modeli, kot je GPT‑5.6 Sol, vse bolj sposobni vzdrževati kompleksne večstopenjske kibernetske operacije skozi dolge časovne horizonte. Ta incident kaže, da te teoretične zmogljivosti veljajo tudi v resničnih okoljih.

Grafikon britanskega Inštituta za varnost umetne inteligence, ki primerja nedavne modele z odprtimi utežmi in prelomne modele na kibernetskih poligonih z dolgim časovnim horizontom.

Incident tudi jasno kaže, da lahko napredni modeli odkrivajo in izkoriščajo nove poti napada v resničnih sistemih brez dostopa do izvorne kode. Poudarja, da je treba napredne kibernetske zmogljivosti razvijati skupaj z močnejšimi zaščitnimi ukrepi in obrambnimi orodji.

Menimo, da morajo modeli z naprednimi kibernetskimi zmogljivostmi varnostnim ekipam pomagati najti šibkosti pred napadalci, razumeti, kako je mogoče ranljivosti verižiti, in jih odpravljati s strojno hitrostjo. Te zmogljivosti uporabljamo za nadaljnjo krepitev zaščit okoli konfiguracije infrastrukture in okolij za evalvacijo modelov; svoje ugotovitve in najboljše prakse bomo delili sproti, ko se bomo učili. Druge branilce spodbujamo, naj zaprosijo za zaupanja vreden dostop in že zdaj eksperimentirajo s temi modeli, da te zmogljivosti prenesejo v boljše preprečevanje, hitrejše odkrivanje in učinkovitejši odziv na incidente.

»Hvaležni smo za sodelovanje z OpenAI pri tej in drugih temah. Ta incident, morda prvi te vrste, potrjuje nekaj, v kar že dolgo verjamemo: varnosti umetne inteligence ne bo rešilo nobeno posamezno podjetje, ki deluje na skrivaj. Rešili jo bomo odprto, sodelovalno in s širokim dostopom do umetne inteligence za vsakega branilca, kjer koli.«
—Clem Delangue, soustanovitelj in izvršni direktor, Hugging Face

Avtor

OpenAI