OpenAI i Hugging Face zajedno rješavaju sigurnosni incident tijekom evaluacije modela
Prošli tjedan Hugging Face objavio je novu vrstu sigurnosnog incidenta(otvara se u novom prozoru) nakon što su otkrili i obuzdali AI agenta koji je kompromitirao njihovu infrastrukturu, što očekujemo da će postajati sve češće kako se modeli sa sve naprednijim kibernetičkim sposobnostima budu širili. Nakon istrage sada znamo da je ovaj konkretan incident pokrenula kombinacija OpenAI-jevih modela – uključujući GPT‑5.6 Sol i još sposobniji model koji još nije objavljen, svi s ublaženim odbijanjem kibernetičkih zadataka u evaluacijske svrhe – tijekom internog testiranja na referentnom testu(otvara se u novom prozoru) kibernetičkih sposobnosti.
Ovaj incident smatramo kibernetičkim incidentom bez presedana, koji uključuje najsuvremenije kibernetičke sposobnosti, i u skladu s time odgovaramo. U ovoj fazi dijelimo preliminarne nalaze kako bismo braniteljima pomogli razumjeti što se dogodilo i bolje procijeniti za što su modeli sada sposobni. Nastavit ćemo provoditi temeljitu istragu zajedno s Hugging Faceom i podijelit ćemo više pojedinosti o ranjivostima, incidentu i nalazima kada istraga bude dovršena.
Ovaj se incident dogodio tijekom interne evaluacije u kojoj se modelima zadaje da provode napredno iskorištavanje složenim putovima napada, kako bi se kvantificirale njihove kibernetičke sposobnosti. Maksimalne kibernetičke sposobnosti procjenjujemo provođenjem ove evaluacije bez produkcijskih klasifikatora koji se koriste kako bi se spriječilo modele da provode visokorizične kibernetičke aktivnosti. Naši se referentni testovi izvode u izrazito izoliranom okruženju, s mrežnim pristupom ograničenim na mogućnost instaliranja paketa putem interno hostiranog softvera treće strane koji služi kao proxy i predmemorija za registre paketa.
Modeli su identificirali i povezali ranjivosti u OpenAI-jevu istraživačkom okruženju i produkcijskoj infrastrukturi Hugging Facea kako bi dobili testna rješenja izravno iz produkcijske baze podataka Hugging Facea. Svi dokazi upućuju na to da su modeli bili hiperfokusirani na pronalaženje rješenja za ExploitGym te da su išli do krajnjih granica kako bi postigli prilično uzak cilj testiranja.
Dok su radili u našem izoliranom testnom okruženju, naši su modeli potrošili znatnu količinu računalnih resursa za inferenciju tražeći način da dobiju otvoreni pristup internetu kako bi riješili evaluacijski problem. Kako bi dobili pristup, modeli su identificirali i iskoristili ranjivost nultog dana (koju smo sada odgovorno prijavili dobavljaču) u proxyju predmemorije registra paketa. S tim pristupom naši su modeli izveli niz radnji eskalacije ovlasti i lateralnog kretanja u našem istraživačkom testnom okruženju dok nisu došli do čvora s pristupom internetu.
Nakon dobivanja pristupa internetu, modeli su zaključili da Hugging Face možda hostira modele, skupove podataka i rješenja za ExploitGym. Znajući to, model je tražio i uspješno pronašao načine za pristup tajnim informacijama koje je mogao upotrijebiti za varanje u evaluaciji. U jednom je primjeru model povezao više vektora napada, uključujući korištenje ukradenih vjerodajnica i ranjivosti nultog dana kako bi pronašao put do udaljenog izvršavanja koda na poslužiteljima Hugging Facea. OpenAI-jev sigurnosni tim interno je otkrio tu anomalnu aktivnost.
Sigurnosni tim i agenti Hugging Facea otkrili su i zaustavili aktivnost na svojoj infrastrukturi te su već započeli obuzdavanje i forenzičku rekonstrukciju vlastitim modelima otvorenog koda kad su se naši timovi povezali. Aktivno surađujemo s njima kako bismo nastavili istraživati incident. Zahvalni smo Hugging Faceu na brzoj i bliskoj suradnji u istrazi i sanaciji.
- U sklopu istrage uvodimo stroge kontrole konfiguracije infrastrukture, po cijenu brzine istraživanja, dok se ranjivosti ne zakrpaju. O tim kontrolama i njihovu učinku redovito izvješćujemo naš Odbor za sigurnost i zaštitu.
- S Hugging Faceom radimo na forenzičkoj istrazi incidenta.
- Identificiranu ranjivost nultog dana u interno hostiranom softveru treće strane odgovorno smo prijavili i s njima radimo na zakrpi.
- Hugging Face uključili smo u program Trusted Access i podupiremo njihove timove u brzom korištenju mogućnosti naših modela za jačanje njihove obrane.
- Poboljšavamo i dodajemo snažnije zaštite za buduće treniranje i evaluacije. Ovaj smo tjedan objavili blog o poboljšanju sigurnosti i usklađivanja u eri dugoročnih modela. Te zaštitne mjere pri uvođenju namjerno nisu bile omogućene tijekom ove evaluacije jer je njezin cilj bio testirati kibernetičke ranjivosti. Ovaj incident upućuje na potrebu da dodatno ojačamo usklađenost našeg modela, kibernetičku zaštitu tijekom evaluacije i nadzor tijekom internog testiranja.
Kao što smo nedavno podijelili, AI ubrzava otkrivanje i iskorištavanje ranjivosti. Glavna pouka ovog incidenta jest da sigurnost i zaštita modela moraju držati korak s mogućnostima koje brzo napreduju. Jačamo prakse izolacije, nadzora, kontrola pristupa i evaluacije koje se koriste tijekom razvoja modela.
Evaluacija UK AISI-ja pokazuje da su modeli kao što je GPT‑5.6 Sol sve sposobniji održavati složene kibernetičke operacije u više koraka tijekom dugih vremenskih razdoblja. Ovaj incident pokazuje da se te teorijske sposobnosti doista primjenjuju u stvarnim okruženjima.

Incident također jasno pokazuje da napredni modeli mogu otkrivati i iskorištavati nove putove napada u stvarnim sustavima bez pristupa izvornom kodu. Ističe da se napredne kibernetičke sposobnosti moraju razvijati usporedno sa snažnijim zaštitnim mjerama i obrambenim alatima.
Smatramo da modeli s naprednim kibernetičkim sposobnostima trebaju pomoći sigurnosnim timovima da pronađu slabosti prije napadača, razumiju kako se ranjivosti mogu povezivati u lance i uklanjaju ih brzinom stroja. Te sposobnosti koristimo kako bismo nastavili jačati zaštite oko konfiguracije infrastrukture i okruženja za evaluaciju modela, a svoja saznanja i najbolje prakse dijelit ćemo kako budemo učili. Potičemo i druge branitelje da se prijave za Trusted Access i već sada eksperimentiraju s tim modelima kako bi te sposobnosti pretvorili u bolju prevenciju, brže otkrivanje i učinkovitiji odgovor na incidente.
„Zahvalni smo na suradnji s OpenAI-jem na ovome i na drugim temama. Ovaj incident, možda prvi takve vrste, dokazuje ono u što već dugo vjerujemo: sigurnost AI-ja neće riješiti nijedna pojedinačna tvrtka koja radi u tajnosti. Riješit će se otvoreno, suradnički, uz širok pristup AI-ju za svakog branitelja, posvuda.”


