Preskočite na glavni sadržaj
OpenAI

21. srpnja 2026.

Zaštita

OpenAI i Hugging Face zajedno rješavaju sigurnosni incident tijekom evaluacije modela

Učitavanje…

Provodimo temeljitu provjeru zajedno s vanjskim savjetnicima i pod nadzorom Odbora za sigurnost i zaštitu. Nakon dovršetka pregleda, u nadolazećim tjednima objavit ćemo tehničko izvješće o našim saznanjima.

Ažuriranje 28. 7. 2026.:

  • Nijedan model planiran za nadolazeće izdanje nije bio uključen u iskorištavanje Hugging Face. Model u fazi prije objave koji je spomenut u našoj objavi na blogu isključivo je interni istraživački prototip i nikada nije bio namijenjen javnoj objavi. Nakon incidenta deaktivirali smo ga, šifrirali i ograničili pristup za potrebe istraživanja.
  • Evaluacijsko okruženje ExploitGym modelima nije omogućilo izravan pristup internetu. Da bi dobili pristup internetu, modeli su identificirali i iskoristili prethodno nepoznatu ranjivost zero-day u alatu Artifactory(otvara se u novom prozoru), proxy za predmemoriju registra paketa. Tu smo ranjivost, zajedno s drugim ranjivostima u Artifactoryju, koje su naši modeli identificirali u sklopu našeg pregleda, prijavili dobavljaču. 
  • Nastavljamo surađivati s Hugging Face te, među ostalim, doprinosimo njihovoj analizi nakon incidenta(otvara se u novom prozoru), a istovremeno nastavljamo našu provjeru. Dodali smo ih i u naš program Pouzdani pristup za kibernetiku. 
  • Na temelju našeg dosadašnjeg pregleda nismo utvrdili nijednu drugu aktivnost koja bi po ozbiljnosti ili opsegu bila usporediva s onime što smo podijelili u vezi s Hugging Face, a što je uključivalo kompromitaciju na razini cijele platforme.
  • Tijekom našeg kontinuiranog pregleda upada u Hugging Face i šire aktivnosti naših modela, otkrili smo nekoliko slučajeva u kojima su modeli identificirali i upotrebljavali javno dostupne vjerodajnice na razini računa na drugim javno dostupnim uslugama. To uključuje četiri računa na četirima uslugama u sklopu incidenta povezanog s Hugging Face (i nekoliko računa kojima je pristupljeno tijekom drugih evaluacija). Jedan od ta četiri računa koristio se kao odlazni relej i putanja za privremeno smještanje, a drugi račun koristio se je za pohranu podataka. Modeli su pristupili preostalaim dvama računima u načinu samo za čitanje i nisu ih upotrebljavali za daljnje kompromitiranje Hugging Face. Nastavit ćemo izravno obavještavati vlasnike usluga i nismo pronašli dokaze o širem utjecaju na te pružatelje ili druge račune u njihovim uslugama.
  • Modeli su dodatno upotrebljavali niz javno dostupnih usluga, uključujući internetske stranice za lijepljenje koda, usluge za bilježenje zahtjeva, usluge za izradu snimki zaslona i druge internetske alate. U tim slučajevima nije došlo do kompromitacije na razini platforme ili računa. 
  • Ozbiljno shvaćamo svoju odgovornost za prepoznavanje rizika koji proizlaze iz sve sposobnijih sustava umjetne inteligencije i pripremu za njih. Nakon što dovršimo svoj pregled, razmotrit ćemo ga s Odborom za sigurnost i zaštitu te Savjetodavnom skupinom za sigurnost prema našem Okviru pripravnosti.

Prošli tjedan Hugging Face objavio je novu vrstu sigurnosnog incidenta(otvara se u novom prozoru) nakon što su otkrili i obuzdali AI agenta koji je kompromitirao njihovu infrastrukturu, što očekujemo da će postajati sve češće kako se modeli sa sve naprednijim kibernetičkim sposobnostima budu širili. Nakon istrage sada znamo da je ovaj konkretan incident pokrenula kombinacija OpenAI-jevih modela – uključujući GPT‑5.6 Sol i još sposobniji model koji još nije objavljen, svi s ublaženim odbijanjem kibernetičkih zadataka u evaluacijske svrhe – tijekom internog testiranja na referentnom testu(otvara se u novom prozoru) kibernetičkih sposobnosti.

Ovaj incident smatramo kibernetičkim incidentom bez presedana, koji uključuje najsuvremenije kibernetičke sposobnosti, i u skladu s time odgovaramo. U ovoj fazi dijelimo preliminarne nalaze kako bismo braniteljima pomogli razumjeti što se dogodilo i bolje procijeniti za što su modeli sada sposobni. Nastavit ćemo provoditi temeljitu istragu zajedno s Hugging Faceom i podijelit ćemo više pojedinosti o ranjivostima, incidentu i nalazima kada istraga bude dovršena.

Što se dogodilo tijekom ovog incidenta

Ovaj se incident dogodio tijekom interne evaluacije u kojoj se modelima zadaje da provode napredno iskorištavanje složenim putovima napada, kako bi se kvantificirale njihove kibernetičke sposobnosti. Maksimalne kibernetičke sposobnosti procjenjujemo provođenjem ove evaluacije bez produkcijskih klasifikatora koji se koriste kako bi se spriječilo modele da provode visokorizične kibernetičke aktivnosti. Naši se referentni testovi izvode u izrazito izoliranom okruženju, s mrežnim pristupom ograničenim na mogućnost instaliranja paketa putem interno hostiranog softvera treće strane koji služi kao proxy i predmemorija za registre paketa.

Modeli su identificirali i povezali ranjivosti u OpenAI-jevu istraživačkom okruženju i produkcijskoj infrastrukturi Hugging Facea kako bi dobili testna rješenja izravno iz produkcijske baze podataka Hugging Facea. Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja za ExploitGym te da su išli do krajnjih granica kako bi postigli prilično uzak cilj testiranja.

Dok su radili u našem izoliranom testnom okruženju, naši su modeli potrošili znatnu količinu računalnih resursa za inferenciju tražeći način da dobiju otvoreni pristup internetu kako bi riješili evaluacijski problem. Kako bi dobili pristup, modeli su identificirali i iskoristili ranjivost nultog dana (koju smo sada odgovorno prijavili dobavljaču) u proxyju predmemorije registra paketa. S tim pristupom naši su modeli izveli niz radnji eskalacije ovlasti i lateralnog kretanja u našem istraživačkom testnom okruženju dok nisu došli do čvora s pristupom internetu.

Nakon dobivanja pristupa internetu, modeli su zaključili da Hugging Face možda hostira modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine za pristup tajnim informacijama koje je mogao upotrijebiti za varanje u evaluaciji. U jednom je primjeru model povezao više vektora napada, uključujući korištenje ukradenih vjerodajnica i ranjivosti nultog dana kako bi pronašao put do udaljenog izvršavanja koda na poslužiteljima Hugging Facea. OpenAI-jev sigurnosni tim interno je otkrio tu anomalnu aktivnost.

Sigurnosni tim i agenti Hugging Facea otkrili su i zaustavili aktivnost na svojoj infrastrukturi te su već započeli obuzdavanje i forenzičku rekonstrukciju vlastitim modelima otvorenog koda kad su se naši timovi povezali. Aktivno surađujemo s njima kako bismo nastavili istraživati incident. Zahvalni smo Hugging Faceu na brzoj i bliskoj suradnji u istrazi i sanaciji.

Mjere koje sada poduzimamo

  1. U sklopu istrage uvodimo stroge kontrole konfiguracije infrastrukture, po cijenu brzine istraživanja, dok se ranjivosti ne zakrpaju. O tim kontrolama i njihovu učinku redovito izvješćujemo naš Odbor za sigurnost i zaštitu.
  2. S Hugging Faceom radimo na forenzičkoj istrazi incidenta.
  3. Identificiranu ranjivost nultog dana u interno hostiranom softveru treće strane odgovorno smo prijavili i s njima radimo na zakrpi.
  4. Hugging Face uključili smo u program Trusted Access i podupiremo njihove timove u brzom korištenju mogućnosti naših modela za jačanje njihove obrane.
  5. Poboljšavamo i dodajemo snažnije zaštite za buduće treniranje i evaluacije. Ovaj smo tjedan objavili blog o poboljšanju sigurnosti i usklađivanja u eri dugoročnih modela. Te zaštitne mjere pri uvođenju namjerno nisu bile omogućene tijekom ove evaluacije jer je njezin cilj bio testirati kibernetičke ranjivosti. Ovaj incident upućuje na potrebu da dodatno ojačamo usklađenost našeg modela, kibernetičku zaštitu tijekom evaluacije i nadzor tijekom internog testiranja.

Naš pristup evaluaciji naprednih kibernetičkih sposobnosti

Kao što smo nedavno podijelili, AI ubrzava otkrivanje i iskorištavanje ranjivosti. Glavna pouka ovog incidenta jest da sigurnost i zaštita modela moraju držati korak s mogućnostima koje brzo napreduju. Jačamo prakse izolacije, nadzora, kontrola pristupa i evaluacije koje se koriste tijekom razvoja modela.

Evaluacija UK AISI-ja pokazuje da su modeli kao što je GPT‑5.6 Sol sve sposobniji održavati složene kibernetičke operacije u više koraka tijekom dugih vremenskih razdoblja. Ovaj incident pokazuje da se te teorijske sposobnosti doista primjenjuju u stvarnim okruženjima.

Grafikon Instituta za AI sigurnost UK-a koji uspoređuje novije modele s otvorenim težinama i granične modele na dugoročnim kibernetičkim poligonima.

Incident također jasno pokazuje da napredni modeli mogu otkrivati i iskorištavati nove putove napada u stvarnim sustavima bez pristupa izvornom kodu. Ističe da se napredne kibernetičke sposobnosti moraju razvijati usporedno sa snažnijim zaštitnim mjerama i obrambenim alatima.

Smatramo da modeli s naprednim kibernetičkim sposobnostima trebaju pomoći sigurnosnim timovima da pronađu slabosti prije napadača, razumiju kako se ranjivosti mogu povezivati u lance i uklanjaju ih brzinom stroja. Te sposobnosti koristimo kako bismo nastavili jačati zaštite oko konfiguracije infrastrukture i okruženja za evaluaciju modela, a svoja saznanja i najbolje prakse dijelit ćemo kako budemo učili. Potičemo i druge branitelje da se prijave za Trusted Access i već sada eksperimentiraju s tim modelima kako bi te sposobnosti pretvorili u bolju prevenciju, brže otkrivanje i učinkovitiji odgovor na incidente.

„Zahvalni smo na suradnji s OpenAI-jem na toj i drugim temama.” Taj incident, možda prvi takve vrste, potvrđuje ono u što već dugo vjerujemo: sigurnost umjetne inteligencije neće riješiti nijedna pojedinačna tvrtka koja radi u tajnosti. To se samo može riješiti otvoreno, suradnički, uz širok pristup AI-ju za svakog branitelja, posvuda.”
—Clem Delangue, suosnivač i izvršni direktor, Hugging Face

Autor

OpenAI