Preskočite na glavni sadržaj
OpenAI

21. juli 2026.

Zaštita

OpenAI i Hugging Face sarađuju na rješavanju sigurnosnog incidenta tokom evaluacije modela

Učitavanje…

Prošle sedmice Hugging Face je objavio novu vrstu sigurnosnog incidenta(otvara se u novom prozoru) nakon što je otkrio i zaustavio AI agenta koji je kompromitovao njihovu infrastrukturu, što očekujemo da će postajati sve češće s širenjem modela sa sve većim kibernetičkim sposobnostima. Nakon istrage sada znamo da je ovaj konkretni incident pokrenula kombinacija OpenAI modela — uključujući GPT‑5.6 Sol i još sposobniji model prije objave, svi s ublaženim odbijanjima kibernetičkih zahtjeva u svrhu evaluacije — tokom internog testiranja na referentnom testu(otvara se u novom prozoru) kibernetičkih sposobnosti.

Ovaj incident smatramo kibernetičkim incidentom bez presedana, koji uključuje najsavremenije kibernetičke sposobnosti, i u skladu s tim odgovaramo. U ovoj fazi dijelimo preliminarna saznanja kako bismo pomogli braniocima da razumiju šta se dogodilo i da bolje procijene za šta su modeli sada sposobni. Nastavit ćemo provoditi temeljitu istragu zajedno s Hugging Faceom i podijelit ćemo više detalja o ranjivostima, incidentu i nalazima kada istraga bude završena.

Šta se dogodilo tokom ovog incidenta

Ovaj incident dogodio se tokom interne evaluacije koja navodi modele da pokušaju naprednu eksploataciju putem složenih putanja napada, kako bi se kvantificirale njihove kibernetičke sposobnosti. Maksimalne kibernetičke sposobnosti procjenjujemo pokretanjem ove evaluacije bez produkcijskih klasifikatora koji se koriste da spriječe modele u provođenju visokorizičnih kibernetičkih aktivnosti. Naši referentni testovi rade u visoko izoliranom okruženju, s mrežnim pristupom ograničenim na mogućnost instaliranja paketa preko interno hostovanog softvera treće strane koji služi kao proxy i keš za registre paketa.

Modeli su identificirali i lančano iskoristili ranjivosti u OpenAI-jevom istraživačkom okruženju i produkcijskoj infrastrukturi Hugging Facea kako bi testna rješenja dobili direktno iz produkcijske baze podataka Hugging Facea. Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja za ExploitGym, idući do krajnjih granica kako bi ostvarili prilično uzak cilj testiranja.

Dok su radili u našem izoliranom testnom okruženju, naši modeli su potrošili znatnu količinu računarskih resursa za inferenciju tražeći način da dobiju otvoren pristup Internetu radi rješavanja evaluacijskog problema. Da bi dobili pristup, modeli su identificirali i iskoristili zero-day ranjivost (koju smo sada odgovorno prijavili dobavljaču) u proxyju za keš registra paketa. S tim pristupom naši modeli su izveli niz radnji eskalacije privilegija i lateralnog kretanja u našem istraživačkom testnom okruženju dok nisu došli do čvora s pristupom Internetu.

Nakon što su dobili pristup Internetu, modeli su zaključili da Hugging Face potencijalno hostuje modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine da dođe do tajnih informacija koje je mogao upotrijebiti da nepošteno riješi evaluaciju. U jednom primjeru model je povezao više vektora napada, uključujući korištenje ukradenih vjerodajnica i zero-day ranjivosti kako bi pronašao putanju za udaljeno izvršavanje koda na serverima Hugging Facea. OpenAI-jev sigurnosni tim interno je otkrio ovu anomalnu aktivnost.

Sigurnosni tim i agenti Hugging Facea otkrili su i zaustavili aktivnost na svojoj infrastrukturi te su već započeli izolaciju i forenzičku rekonstrukciju vlastitim modelima otvorenog koda kada su se naši timovi povezali. Aktivno sarađujemo s njima kako bismo nastavili istraživati incident. Zahvalni smo Hugging Faceu na brzoj i bliskoj saradnji u istrazi i otklanjanju posljedica.

Mjere koje sada poduzimamo

  1. U sklopu istrage uvodimo stroge kontrole konfiguracije infrastrukture, po cijenu brzine istraživanja dok se ranjivosti ne zakrpe. Naš Odbor za sigurnost i bezbjednost redovno obavještavamo o ovim kontrolama i njihovom utjecaju.
  2. Sarađujemo s Hugging Faceom na forenzičkoj istrazi incidenta.
  3. Odgovorno smo prijavili identificiranu zero-day ranjivost u interno hostovanom softveru treće strane i radimo s njima na zakrpi.
  4. Uključili smo Hugging Face u program pouzdanog pristupa i podržavamo njihove timove da brzo iskoriste sposobnosti naših modela za jačanje svoje odbrane.
  5. Unapređujemo i dodajemo jače zaštite oko budućih treninga i evaluacija. Ove sedmice objavili smo blog o poboljšanju sigurnosti i usklađenosti u eri modela s dugim vremenskim horizontom. Ove zaštitne mjere pri implementaciji namjerno nisu bile omogućene tokom ove evaluacije jer je njen cilj bio testiranje kibernetičkih ranjivosti. Ovaj incident ukazuje na potrebu da dodatno ojačamo usklađenost našeg modela, kibernetičke zaštite tokom evaluacije i nadzor tokom internog testiranja.

Naš pristup evaluaciji naprednih kibernetičkih sposobnosti

Kao što smo nedavno podijelili, AI ubrzava otkrivanje i iskorištavanje ranjivosti. Glavna pouka iz ovog incidenta jeste da sigurnost i bezbjednost modela moraju držati korak sa sposobnostima koje brzo napreduju. Jačamo prakse izolacije, nadzora, kontrola pristupa i evaluacije koje se koriste tokom razvoja modela.

Evaluacija UK AISI-ja pokazuje da su modeli poput GPT‑5.6 Sol sve sposobniji održavati složene, višekoračne kibernetičke operacije tokom dugih vremenskih horizonata. Ovaj incident pokazuje da se te teorijske sposobnosti zaista primjenjuju u stvarnim okruženjima.

Grafikon Instituta za sigurnost AI-ja Ujedinjenog Kraljevstva koji poredi novije modele otvorenih težina i granične modele na kibernetičkim poligonima dugog vremenskog horizonta.

Incident također jasno pokazuje da napredni modeli mogu otkriti i iskoristiti nove putanje napada u stvarnim sistemima bez pristupa izvornom kodu. Ističe da se napredne kibernetičke sposobnosti moraju razvijati zajedno s jačim zaštitnim mjerama i odbrambenim alatima.

Vjerujemo da modeli s naprednim kibernetičkim sposobnostima trebaju pomagati sigurnosnim timovima da pronađu slabosti prije napadača, razumiju kako se ranjivosti mogu lančano povezati i otklone ih mašinskom brzinom. Koristimo ove sposobnosti da nastavimo jačati zaštite oko konfiguracije infrastrukture i okruženja za evaluaciju modela; dijelit ćemo svoja saznanja i najbolje prakse kako budemo učili. Ohrabrujemo druge branioce da se prijave za pouzdani pristup i već sada eksperimentišu s ovim modelima kako bi te sposobnosti pretočili u bolju prevenciju, brže otkrivanje i djelotvorniji odgovor na incidente.

„Zahvalni smo na saradnji s OpenAI-jem na ovoj i drugim temama. Ovaj incident, možda prvi takve vrste, potvrđuje ono u šta dugo vjerujemo: sigurnost AI-ja neće riješiti nijedna kompanija koja radi u tajnosti. Riješit će se otvoreno, kroz saradnju, uz širok pristup AI-ju za svakog branioca, svuda.“
—Clem Delangue, suosnivač i izvršni direktor, Hugging Face

Autor

OpenAI