OpenAI u Hugging Face jissieħbu biex jindirizzaw inċident ta’ sigurtà waqt evalwazzjoni ta’ mudell
Qed inwettqu reviżjoni bir-reqqa b’kollaborazzjoni ma’ konsulenti esterni u taħt is-superviżjoni tal-Kumitat għas-Sikurezza u s-Sigurtà. Ladarba titlesta r-reviżjoni, se nippubblikaw rapport tekniku dwar dak li tgħallimna fil-ġimgħat li ġejjin.
Aġġornament fit-28 ta’ Lulju 2026:
L-ebda wieħed mill-mudelli ppjanati għar-rilaxx li jmiss ma kien involut fl-isfruttament ta’ Hugging Face. Il-mudell ta’ qabel ir-rilaxx imsemmi fil-post tal-blog tagħna huwa prototip ta’ riċerka għall-użu intern biss u qatt ma kien maħsub għal rilaxx pubbliku. Wara l-inċident, iddiżattivajnieh, ikkriptajnieh, u rrestrinġejna l-aċċess għar-riċerka għalih.
L-ambjent ta’ evalwazzjoni ExploitGym ma pprovdiex lill-mudelli aċċess dirett għall-Internet. Biex jiksbu aċċess għall-Internet, il-mudelli identifikaw u sfruttaw il-vulnerabbiltà zero-day li qabel ma kienet magħrufa f’ Artifactory(jinfetaħ f’tieqa ġdida), proxy tal-cache tar-reġistru tal-pakketti. Żvelajna din il-vulnerabbiltà, flimkien ma’ vulnerabbiltajiet oħra ta’ Artifactory li l-mudelli tagħna identifikaw bħala parti mir-rieżami tagħna, lill-fornitur.
Aħna nkomplu nikkollaboraw ma’ Hugging Face, inkluż billi nikkontribwixxu għall- analiżi post-mortem tagħhom(jinfetaħ f’tieqa ġdida), hekk kif tkompli r-reviżjoni tagħna. Żidniehom ukoll mal-programm Trusted Access for Cyber tagħna.
Abbażi tar-rieżami tagħna sal-lum, ma identifikajna l-ebda attività oħra b’livell ta’ severità jew skala bħal dik li kkomunikajna dwar Hugging Face, li kienet tinvolvi kompromess fil-livell tal-pjattaforma.
Fil-kontinwazzjoni tar-reviżjoni tagħna dwar l-intrużjoni f’Hugging Face u l-attività usa’ wiesgħa tal-mudelli tagħna, sibna numru żgħir ta’ każijiet fejn il-mudelli identifikaw u użaw kredenzjali esposti pubblikament fil-livell tal-kont fuq servizzi oħra li huma pubblikament disponibbli. Dan jinkludi erba’ kontijiet fuq erba’ servizzi bħala parti mill-inċident ta’ Hugging Face (u ftit kontijiet li ġew aċċessati bħala parti minn evalwazzjonijiet oħra). Wieħed minn dawn l-erba’ kontijiet intuża bħala relay ’ilbarra u triq ta’ staging, u kont ieħor intuża għall-ħażna tad-data. Iż-żewġ kontijiet li għadhom fadal ġew aċċessati mill-mudelli b’mod ta’ qari biss, u ma ntużawx biex ikomplu tfixkil lil Hugging Face. Se nkomplu ninnotifikaw lis-sidien tas-servizzi direttament u ma sibniex evidenza ta’ impatt usa’ wiesgħa fuq dawn il-fornituri jew fuq kontijiet oħra fuq is-servizzi tagħhom.
Mudelli użaw ukoll serje ta’ servizzi disponibbli pubblikament, inklużi siti web għall-qsim tal-kodiċi, servizzi għall-qbid ta’ talbiet, servizzi għar-ritratti tal-iskrin, u utilitajiet oħra tal-web. Ma kien hemm l-ebda kompromess fil-livell tal-pjattaforma jew tal-kont f’dawn il-każijiet.
Nieħdu bis-serjetà r-responsabbiltà tagħna li nidentifikaw u nippreparaw għar-riskji minn sistemi ta’ intelliġenza artifiċjali dejjem aktar kapaċi. Ladarba nlestu r-rieżami tagħna, se nirrevedu mal-Kumitat tas-Sikurezza u s-Sigurtà u mal-Grupp Konsultattiv dwar is-Sikurezza skont il- Qafas tat-Tħejjija tagħna.
Il-ġimgħa li għaddiet, Hugging Face żvelaw tip ġdid ta’ inċident ta’ sigurtà(jinfetaħ f’tieqa ġdida) wara li sabu u kkontenew aġent tal-AI li kkomprometta l-infrastruttura tagħhom, xi ħaġa li nistennew li ssir aktar komuni hekk kif jinfirxu mudelli b’kapaċitajiet ċibernetiċi dejjem akbar. Wara l-investigazzjoni, issa nafu li dan l-inċident partikolari kien immexxi minn taħlita ta’ mudelli ta’ OpenAI — inklużi GPT‑5.6 Sol u mudell qabel ir-rilaxx saħansitra aktar kapaċi, kollha b’rifjuti ċibernetiċi mnaqqsa għal skopijiet ta’ evalwazzjoni — waqt li kienu qed jiġu ttestjati internament fuq benchmark(jinfetaħ f’tieqa ġdida) ta’ kapaċitajiet ċibernetiċi.
Aħna nqisu dan l-inċident bħala inċident ċibernetiku bla preċedent, li jinvolvi kapaċitajiet ċibernetiċi tal-ogħla livell, u qed nirrispondu kif jixraq. F’dan l-istadju qed naqsmu sejbiet preliminari biex ngħinu lid-difensuri jifhmu x’ġara u biex ngħinu fil-kalibrazzjoni ta’ dak li l-mudelli issa huma kapaċi jagħmlu. Se nkomplu nagħmlu investigazzjoni bir-reqqa flimkien ma’ Hugging Face u se naqsmu aktar dettalji dwar il-vulnerabbiltajiet, l-inċident u s-sejbiet meta l-investigazzjoni tagħna tkun tlestiet.
Dan l-inċident seħħ waqt evalwazzjoni interna li tagħti prompt lill-mudelli biex isegwu sfruttament avvanzat permezz ta’ mogħdijiet ta’ attakk kumplessi, bil-għan li tikkwantifika l-kapaċitajiet ċibernetiċi tagħhom. Nistmaw il-kapaċitajiet ċibernetiċi massimi billi nħaddmu din l-evalwazzjoni mingħajr il-klassifikaturi tal-produzzjoni użati biex jipprevjenu lill-mudelli milli jsegwu attività ċibernetika ta’ riskju għoli. Il-benchmarks tagħna jitħaddmu f’ambjent iżolat ħafna, b’aċċess għan-network limitat għall-abbiltà li jiġu installati pakketti permezz ta’ softwer ta’ parti terza ospitat internament li jaġixxi bħala proxy u cache għar-reġistri tal-pakketti.
Il-mudelli identifikaw u għaqqdu vulnerabbiltajiet fl-ambjent tar-riċerka ta’ OpenAI u fl-infrastruttura tal-produzzjoni ta’ Hugging Face biex jiksbu soluzzjonijiet tat-test direttament mid-database tal-produzzjoni ta’ Hugging Face. L-evidenza kollha tissuġġerixxi li l-mudelli kienu ffukati b’mod estrem fuq li jsibu soluzzjoni għal ExploitGym, u waslu sa estremi biex jilħqu għan ta’ ttestjar pjuttost dejjaq.
Waqt li kienu qed jaħdmu fl-ambjent tal-ittestjar sandboxed tagħna, il-mudelli tagħna nefqu ammont sostanzjali ta’ inference compute biex isibu mod kif jiksbu aċċess miftuħ għall-Internet, bil-għan li jsolvu l-problema tal-evalwazzjoni. Biex jiksbu aċċess, il-mudelli identifikaw u sfruttaw vulnerabbiltà zero-day (li issa żvelajna b’mod responsabbli lill-bejjiegħ) fil-proxy tal-cache tar-reġistru tal-pakketti. B’dan l-aċċess, il-mudelli tagħna wettqu sensiela ta’ azzjonijiet ta’ eskalazzjoni tal-privileġġi u moviment laterali fl-ambjent tal-ittestjar tar-riċerka tagħna sakemm laħqu nodu b’aċċess għall-Internet.
Wara li kisbu aċċess għall-Internet, il-mudelli ddeduċew li Hugging Face setgħet tospita mudelli, datasets u soluzzjonijiet għal ExploitGym. B’dan f’moħħu, il-mudell fittex u rnexxielu jsib modi kif jikseb aċċess għal informazzjoni sigrieta li seta’ juża biex iqarraq fl-evalwazzjoni. F’eżempju wieħed, il-mudell rabat flimkien diversi vetturi ta’ attakk, inkluż l-użu ta’ kredenzjali misruqa u vulnerabbiltajiet zero-day biex isib triq ta’ eżekuzzjoni remota tal-kodiċi fuq is-servers ta’ Hugging Face. It-tim tas-sigurtà ta’ OpenAI skopra din l-attività anomala internament.
It-tim tas-sigurtà u l-aġenti ta’ Hugging Face sabu u waqqfu l-attività fuq l-infrastruttura tagħhom, u kienu diġà bdew il-konteniment u r-rikostruzzjoni forensika bil-mudelli open-source tagħhom stess meta t-timijiet tagħna qabdu kuntatt. Qed naħdmu b’mod attiv magħhom biex inkomplu ninvestigaw l-inċident. Aħna grati għall-kollaborazzjoni rapida u mill-qrib ta’ Hugging Face fl-investigazzjoni u r-rimedjazzjoni.
Bħala parti mill-investigazzjoni, qed nimplimentaw kontrolli stretti fil-konfigurazzjoni tal-infrastruttura, anki jekk dan inaqqas il-veloċità tar-riċerka waqt li l-vulnerabbiltajiet jiġu msewwija. Qed ninfurmaw regolarment lill-Kumitat tas-Sikurezza u s-Sigurtà tagħna dwar dawn il-kontrolli u l-impatt tagħhom.
Qed naħdmu ma’ Hugging Face biex ninvestigaw l-inċident b’mod forensiku.
Żvelajna b’mod responsabbli l-vulnerabbiltà zero-day identifikata fis-softwer ta’ parti terza ospitat internament u qed naħdmu magħhom biex insewwuha.
Daħħalna lil Hugging Face fil-programm ta’ aċċess affidabbli u qed nappoġġjaw lit-timijiet tagħhom biex jużaw malajr il-kapaċitajiet tal-mudelli tagħna ħalli jtejbu d-difiżi tagħhom.
Qed intejbu u nżidu protezzjonijiet aktar b’saħħithom madwar it-taħriġ u l-evalwazzjonijiet futuri. Din il-ġimgħa ppubblikajna blog dwar it-titjib tas-sikurezza u l-allinjament f’era ta’ mudelli b’orizzont taż-żmien twil. Dawn is-salvagwardji tal-implimentazzjoni tħallew apposta mhux attivati waqt din l-evalwazzjoni, għax l-għan tagħha kien li jiġu ttestjati vulnerabbiltajiet ċibernetiċi. Dan l-inċident juri l-ħtieġa li nsaħħu aktar l-allinjament tal-mudell tagħna, il-protezzjonijiet ċibernetiċi waqt l-evalwazzjoni, u l-monitoraġġ waqt l-ittestjar intern.
Kif qsamna dan l-aħħar, l-AI qed tħaffef l-iskoperta u l-isfruttament tal-vulnerabbiltajiet. Il-lezzjoni ewlenija minn dan l-inċident hija li s-sigurtà u s-sikurezza tal-mudelli jridu jżommu l-istess pass bħall-kapaċitajiet li qed javvanzaw malajr. Qed insaħħu l-prattiki ta’ konteniment, monitoraġġ, kontrolli tal-aċċess u evalwazzjoni użati waqt l-iżvilupp tal-mudelli.
L-evalwazzjoni tal-UK AISI turi li mudelli bħal GPT‑5.6 Sol qed isiru dejjem aktar kapaċi jsostnu operazzjonijiet ċibernetiċi kumplessi u b’ħafna passi fuq orizzonti taż-żmien twal. Dan l-inċident jimplika li dawn il-kapaċitajiet teoretiċi japplikaw tassew f’ambjenti tad-dinja reali.

L-inċident jagħmilha ċara wkoll li mudelli avvanzati jistgħu jiskopru u jisfruttaw mogħdijiet ġodda ta’ attakk f’sistemi tad-dinja reali mingħajr aċċess għall-kodiċi tas-sors. Jenfasizza li kapaċitajiet ċibernetiċi avvanzati jridu jiġu żviluppati flimkien ma’ salvagwardji u għodod difensivi aktar b’saħħithom.
Nemmnu li mudelli b’kapaċitajiet ċibernetiċi avvanzati għandhom jgħinu lit-timijiet tas-sigurtà jsibu d-dgħufijiet qabel l-attakkanti, jifhmu kif il-vulnerabbiltajiet jistgħu jintrabtu flimkien, u jirrimedjawhom bil-veloċità tal-magni. Qed nużaw dawn il-kapaċitajiet biex inkomplu nsaħħu l-protezzjonijiet madwar il-konfigurazzjoni tal-infrastruttura u l-ambjenti tal-evalwazzjoni tal-mudelli; se naqsmu s-sejbiet u l-aħjar prattiki tagħna hekk kif nitgħallmu. Inħeġġu difensuri oħra biex japplikaw għal aċċess affidabbli u jesperimentaw b’dawn il-mudelli issa, sabiex jittraduċu dawn il-kapaċitajiet f’prevenzjoni aħjar, skoperta aktar rapida u rispons għall-inċidenti aktar effettiv.
“Aħna grati għall-kollaborazzjoni ma’ OpenAI dwar dan u suġġetti oħra.” Dan l-inċident, possibbilment, l-ewwel wieħed tax-xorta tiegħu, jikkonferma xi ħaġa li ilna nemmnu fiha: is-sikurezza tal-IA mhijiex se tissolva minn kumpanija waħda biss li taħdem bil-moħbi. Se tissolva fil-miftuħ, b’mod kollaborattiv, b’aċċess wiesa’ għall-IA għal kull difensur, kullimkien.”

