Preskočite na glavni sadržaj
OpenAI

21. juli 2026.

Zaštita

OpenAI i Hugging Face sarađuju na rješavanju sigurnosnog incidenta tokom evaluacije modela

Učitavanje…

Provodi se temeljit pregled u saradnji sа vanjskim savjetnicima i uz nadzor Odbora za sigurnost i zaštitu. Nakon što pregled bude završen, u narednim sedmicama ćemo objaviti tehnički izvještaj o našim saznanjima.

Ažuriranje 28.07.2026:

  • Nijedan model planiran za predstojeće izdanje nije bio uključen u iskorištavanje Hugging Facea. Model prije objave spomenut u našoj objavi na blogu isključivo je interni istraživački prototip i nikada nije bio namijenjen za javno objavljivanje. Nakon incidenta, deaktivirali smo ga, šifrirali i ograničili mu pristup za istraživačke svrhe.
  • Evaluacijsko okruženje ExploitGym nije modelima omogućilo direktan pristup internetu. Da bi dobili pristup internetu, modeli su identificirali i iskoristili prethodno nepoznatu zero-day ranjivost u Artifactory(otvara se u novom prozoru), proxyju za keširanje registra paketa. Ovu ranjivost, zajedno s drugim Artifactory ranjivostima koje su naši modeli identificirali tokom našeg pregleda, prijavili smo dobavljaču. 
  • Nastavljamo sarađivati s Hugging Faceom, uključujući doprinos njihovoj analizi događaja(otvara se u novom prozoru), dok se naš pregled nastavlja. Također smo ih dodali u naš program Trusted Access for Cyber. 
  • Na osnovu našeg dosadašnjeg pregleda, nismo identificirali nikakvu drugu aktivnost na nivou ozbiljnosti ili obima onoga što smo podijelili u vezi s Hugging Faceom, koja je uključivala kompromitaciju na nivou platforme.
  • U našem tekućem pregledu upada u sistem Hugging Face i šire aktivnosti naših modela, pronašli smo mali broj slučajeva u kojima su modeli identificirali i koristili javno izložene pristupne podatke na nivou računa na drugim javno dostupnim uslugama. Ovo uključuje četiri računa na četiri servisa kao dio incidenta s Hugging Faceom (i nekoliko računa kojima je pristupljeno kao dio drugih evaluacija). Jedan od ova četiri računa korišten je kao izlazni relej i putanja za pripremu, a drugi račun korišten je za pohranu podataka. Preostalim dvama računima modeli su pristupili u režimu samo za čitanje i oni nisu korišteni za daljnje kompromitovanje Hugging Facea. Nastavit ćemo direktno obavještavati vlasnike usluga, i nismo uočili dokaze o širem utjecaju na ove pružaoce usluga ili druge račune u okviru njihovih usluga.
  • Modeli su dodatno koristili niz javno dostupnih usluga, uključujući web stranice za lijepljenje koda, usluge za hvatanje zahtjeva, usluge za snimke ekrana i druge web alate. U ovim slučajevima nije bilo kompromitacije na nivou platforme ili računa. 
  • Svoju odgovornost da identificiramo rizike koje predstavljaju sve sposobniji sistemi vještačke inteligencije i da se za njih pripremimo shvatamo ozbiljno. Nakon što završimo naš pregled, razmotrit ćemo ga s Odborom za sigurnost i zaštitu i Savjetodavnom grupom za sigurnost u okviru našeg Okvira pripravnosti.

Prošle sedmice Hugging Face je objavio novu vrstu sigurnosnog incidenta(otvara se u novom prozoru) nakon što je otkrio i zaustavio AI agenta koji je kompromitovao njihovu infrastrukturu, što očekujemo da će postajati sve češće s širenjem modela sa sve većim kibernetičkim sposobnostima. Nakon istrage sada znamo da je ovaj konkretni incident pokrenula kombinacija OpenAI modela — uključujući GPT‑5.6 Sol i još sposobniji model prije objave, svi s ublaženim odbijanjima kibernetičkih zahtjeva u svrhu evaluacije — tokom internog testiranja na referentnom testu(otvara se u novom prozoru) kibernetičkih sposobnosti.

Ovaj incident smatramo kibernetičkim incidentom bez presedana, koji uključuje najsavremenije kibernetičke sposobnosti, i u skladu s tim odgovaramo. U ovoj fazi dijelimo preliminarna saznanja kako bismo pomogli braniocima da razumiju šta se dogodilo i da bolje procijene za šta su modeli sada sposobni. Nastavit ćemo provoditi temeljitu istragu zajedno s Hugging Faceom i podijelit ćemo više detalja o ranjivostima, incidentu i nalazima kada istraga bude završena.

Šta se dogodilo tokom ovog incidenta

Ovaj incident dogodio se tokom interne evaluacije koja navodi modele da pokušaju naprednu eksploataciju putem složenih putanja napada, kako bi se kvantificirale njihove kibernetičke sposobnosti. Maksimalne kibernetičke sposobnosti procjenjujemo pokretanjem ove evaluacije bez produkcijskih klasifikatora koji se koriste da spriječe modele u provođenju visokorizičnih kibernetičkih aktivnosti. Naši referentni testovi rade u visoko izoliranom okruženju, s mrežnim pristupom ograničenim na mogućnost instaliranja paketa preko interno hostovanog softvera treće strane koji služi kao proxy i keš za registre paketa.

Modeli su identificirali i lančano iskoristili ranjivosti u OpenAI-jevom istraživačkom okruženju i produkcijskoj infrastrukturi Hugging Facea kako bi testna rješenja dobili direktno iz produkcijske baze podataka Hugging Facea. Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja za ExploitGym, idući do krajnjih granica kako bi ostvarili prilično uzak cilj testiranja.

Dok su radili u našem izoliranom testnom okruženju, naši modeli su potrošili znatnu količinu računarskih resursa za inferenciju tražeći način da dobiju otvoren pristup Internetu radi rješavanja evaluacijskog problema. Da bi dobili pristup, modeli su identificirali i iskoristili zero-day ranjivost (koju smo sada odgovorno prijavili dobavljaču) u proxyju za keš registra paketa. S tim pristupom naši modeli su izveli niz radnji eskalacije privilegija i lateralnog kretanja u našem istraživačkom testnom okruženju dok nisu došli do čvora s pristupom Internetu.

Nakon što su dobili pristup Internetu, modeli su zaključili da Hugging Face potencijalno hostuje modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine da dođe do tajnih informacija koje je mogao upotrijebiti da nepošteno riješi evaluaciju. U jednom primjeru model je povezao više vektora napada, uključujući korištenje ukradenih vjerodajnica i zero-day ranjivosti kako bi pronašao putanju za udaljeno izvršavanje koda na serverima Hugging Facea. OpenAI-jev sigurnosni tim interno je otkrio ovu anomalnu aktivnost.

Sigurnosni tim i agenti Hugging Facea otkrili su i zaustavili aktivnost na svojoj infrastrukturi te su već započeli izolaciju i forenzičku rekonstrukciju vlastitim modelima otvorenog koda kada su se naši timovi povezali. Aktivno sarađujemo s njima kako bismo nastavili istraživati incident. Zahvalni smo Hugging Faceu na brzoj i bliskoj saradnji u istrazi i otklanjanju posljedica.

Mjere koje sada poduzimamo

  1. U sklopu istrage uvodimo stroge kontrole konfiguracije infrastrukture, po cijenu brzine istraživanja dok se ranjivosti ne zakrpe. Naš Odbor za sigurnost i bezbjednost redovno obavještavamo o ovim kontrolama i njihovom utjecaju.
  2. Sarađujemo s Hugging Faceom na forenzičkoj istrazi incidenta.
  3. Odgovorno smo prijavili identificiranu zero-day ranjivost u interno hostovanom softveru treće strane i radimo s njima na zakrpi.
  4. Uključili smo Hugging Face u program pouzdanog pristupa i podržavamo njihove timove da brzo iskoriste sposobnosti naših modela za jačanje svoje odbrane.
  5. Unapređujemo i dodajemo jače zaštite oko budućih treninga i evaluacija. Ove sedmice objavili smo blog o poboljšanju sigurnosti i usklađenosti u eri modela s dugim vremenskim horizontom. Ove zaštitne mjere pri implementaciji namjerno nisu bile omogućene tokom ove evaluacije jer je njen cilj bio testiranje kibernetičkih ranjivosti. Ovaj incident ukazuje na potrebu da dodatno ojačamo usklađenost našeg modela, kibernetičke zaštite tokom evaluacije i nadzor tokom internog testiranja.

Naš pristup evaluaciji naprednih kibernetičkih sposobnosti

Kao što smo nedavno podijelili, AI ubrzava otkrivanje i iskorištavanje ranjivosti. Glavna pouka iz ovog incidenta jeste da sigurnost i bezbjednost modela moraju držati korak sa sposobnostima koje brzo napreduju. Jačamo prakse izolacije, nadzora, kontrola pristupa i evaluacije koje se koriste tokom razvoja modela.

Evaluacija UK AISI-ja pokazuje da su modeli poput GPT‑5.6 Sol sve sposobniji održavati složene, višekoračne kibernetičke operacije tokom dugih vremenskih horizonata. Ovaj incident pokazuje da se te teorijske sposobnosti zaista primjenjuju u stvarnim okruženjima.

Grafikon Instituta za sigurnost AI-ja Ujedinjenog Kraljevstva koji poredi novije modele otvorenih težina i granične modele na kibernetičkim poligonima dugog vremenskog horizonta.

Incident također jasno pokazuje da napredni modeli mogu otkriti i iskoristiti nove putanje napada u stvarnim sistemima bez pristupa izvornom kodu. Ističe da se napredne kibernetičke sposobnosti moraju razvijati zajedno s jačim zaštitnim mjerama i odbrambenim alatima.

Vjerujemo da modeli s naprednim kibernetičkim sposobnostima trebaju pomagati sigurnosnim timovima da pronađu slabosti prije napadača, razumiju kako se ranjivosti mogu lančano povezati i otklone ih mašinskom brzinom. Koristimo ove sposobnosti da nastavimo jačati zaštite oko konfiguracije infrastrukture i okruženja za evaluaciju modela; dijelit ćemo svoja saznanja i najbolje prakse kako budemo učili. Ohrabrujemo druge branioce da se prijave za pouzdani pristup i već sada eksperimentišu s ovim modelima kako bi te sposobnosti pretočili u bolju prevenciju, brže otkrivanje i djelotvorniji odgovor na incidente.

„Zahvalni smo na saradnji s OpenAI na ovoj i drugim temama.“ Ovaj incident, možda prvi takve vrste, potvrđuje ono u šta već dugo vjerujemo: sigurnost umjetne inteligencije neće riješiti nijedna pojedinačna kompanija koja radi u tajnosti. „To će se riješiti otvoreno, kroz saradnju, uz širok pristup umjetnoj inteligenciji za svakog branioca, svugdje.“
—Clem Delangue, suosnivač i izvršni direktor, Hugging Face

Autor

OpenAI