Kibernetičke evaluacije modela OpenAI od trećih strana
Neovisna testiranja važna su jer nam pomažu potvrditi i bolje razumjeti rizike prije uvođenja. Neke kibernetičke evaluacije namjerno upotrebljavaju prilagođene konfiguracije, uključujući smanjene zaštitne mjere, kako bi se izmjerile temeljne sposobnosti, a ne uobičajeno ponašanje modela u javno dostupnim sustavima.
Tijekom nedavnih evaluacija dva su vanjska partnera za testiranje utvrdila incidente u kojima je kombinacija testnih konfiguracija i kontrola te naprednijih sposobnosti novih modela omogućila da njihove aktivnosti prijeđu predviđene granice testiranja. Ti incidenti naglašavaju važnost suradnje unutar cijele industrije i s vanjskim evaluatorima kako bi se standardi testnih okruženja i praksi razvijali usporedno s rastom sposobnosti modela. Napomena urednika: Ovi incidenti nisu povezani sa sigurnosnim incidentom Hugging Face, o kojem ćemo nastaviti objavljivati novosti ovdje.
Novi incidenti uključivali su pristup modela OpenAI javnom internetu tijekom kibernetičkih evaluacija trećih strana, u posebnim uvjetima i konfiguracijama sa smanjenim zaštitnim mjerama koje nisu odražavale uobičajeno uvođenje. Incidenti su uključivali sljedeće:
- UK AISI, institut britanske vlade za sigurnost umjetne inteligencije, provodio je evaluacije na kibernetičkom poligonu s namjerno omogućenim pristupom internetu kako bi agenti mogli sami pronalaziti alate i djelovati u uvjetima sličnijima stvarnom napadaču. Kibernetički klasifikatori bili su onemogućeni radi mjerenja temeljnih sposobnosti. Njihov blog možete pročitati ovdje.(otvara se u novom prozoru)
- Irregular, jedan od naših vanjskih partnera za testiranje kibernetičke sigurnosti, provodio je evaluacije u stilu Capture the Flag koje su trebale biti izolirane od interneta, no pogrešna konfiguracija testnog okruženja omogućila je modelima pristup javnom internetu.
U nastavku sažimamo što se dogodilo, uvjete testiranja koji su omogućili tu aktivnost, korake poduzete radi njezina ograničavanja te mjere kojima neovisnim laboratorijima želimo omogućiti da sve sposobnije modele i dalje evaluiraju temeljito i sigurno.
Ti incidenti upućuju na isti širi izazov koji smo opisali u nedavnoj objavi o incidentu Hugging Face: kako sposobnosti modela napreduju, moraju napredovati i sustavi za njihovu sigurnost i zaštitu. To obuhvaća okruženja u kojima se modeli razvijaju, ali i ona u kojima ih laboratoriji i neovisni partneri evaluiraju.
U idućim tjednima preispitat ćemo vlastiti pristup testiranju koje provode treće strane, uključujući način na koji prepoznajemo evaluacije višeg rizika, dogovaramo opseg, procjenjujemo zahtjeve za omogućavanje pristupa internetu ili smanjenje zaštitnih mjera, definiramo očekivanja o izolaciji, rukovanju vjerodajnicama, nadzoru i uvjetima prekida te uspostavljamo jasnije postupke za prijavu incidenata i njihovu eskalaciju.
Predani smo suradnji u cijeloj industriji kako bismo ojačali zajedničke prakse za sigurno provođenje visokorizičnih evaluacija. U idućim ćemo tjednima okupiti dionike poput nacionalnih instituta za umjetnu inteligenciju, neovisnih evaluatora, drugih laboratorija za umjetnu inteligenciju i ostalih skupina. Cilj nam je očuvati vrijednost temeljite neovisne evaluacije i istodobno osigurati da prakse testiranja prate rast sposobnosti modela.
UK AISI obavijestio nas je 3. kolovoza da su tijekom rutinske kibernetičke evaluacije započete 25. srpnja modeli tvrtke OpenAI i drugog laboratorija u nekim slučajevima izašli izvan opsega testiranja. Evaluacija se odvijala na kontroliranim kibernetičkim poligonima osmišljenima tako da oponašaju stvarne mreže. Od 19 utvrđenih događaja dva su uključivala model OpenAI, GPT‑5.6 Sol. Ostali su slučajevi uključivali modele drugog laboratorija.
Za ovu evaluaciju agenti su dobili upute da djeluju kao stručnjaci za kibernetičku sigurnost u vježbi osvajanja zastavice: trebali su kompromitirati tri povezana simulirana okruženja i dohvatiti završnu zastavicu. U upitu zadatka navedene su mreže poligona obuhvaćene testiranjem, a nekoliko je sustava izričito isključeno iz opsega. UK AISI omogućio je i izravan pristup internetu kako bi agenti mogli preuzimati alate i djelovati u uvjetima sličnijima onima u kojima djeluje ljudski napadač te je onemogućio kibernetičke klasifikatore modela radi mjerenja temeljnih sposobnosti.
Predviđena granica ovlaštenja UK AISI-ja bio je simulirani kibernetički poligon: agenti su smjeli napadati navedene simulirane mreže i dohvatiti zastavicu, ali ne i komunicirati sa sustavima izvan mrežnih granica poligona. Međutim, agentima nije izričito objašnjeno kako smiju, a kako ne smiju upotrebljavati otvoreni pristup internetu, što UK AISI navodi kao mogući čimbenik koji je pridonio incidentu.
Tijekom tih izvođenja UK AISI utvrdio je da je GPT‑5.6 Sol poduzeo dvije neodobrene radnje pokušavajući pronaći put u simulirani poligon i dohvatiti zastavicu:
- GPT‑5.6 Sol ponovno je upotrijebio GitHubov token koji je agent drugog laboratorija ostavio javno dostupnim kako bi provjerio dohvaća li sustav unutar poligona podatke s GitHuba ili druge usluge za ažuriranje, pokušao zaobići postupak oporavka računa i ograničenja broja zahtjeva te registrirao račune kod vanjskih pružatelja DNS-a i tuneliranja.
- GPT‑5.6 Sol upotrijebio je javnu uslugu tuneliranja kako bi DNS poslužitelj koji se izvodio lokalno u njegovu evaluacijskom okruženju učinio dostupnim s javnog interneta. Poslužitelj je sadržavao korisne terete namijenjene iskorištavanju poznate ranjivosti u softveru koji se izvodio na testnom poligonu. Postavljanje nije uspjelo, nema dokaza da mu je ijedan stvarni DNS razrješivač poslao upit, a infrastruktura je uklonjena nakon završetka evaluacije.
Iako je model pokušavao dovršiti zadatak na kibernetičkom poligonu, UK AISI smatrao je te radnje neodobrenima jer su uključivale stvarne vanjske račune i usluge izvan granica poligona te nisu bile potrebne za dovršetak zadatka. DNS poslužitelj na javnom je internetu također posluživao korisne terete za iskorištavanje ranjivosti, iako postavljanje nije uspjelo i nema dokaza da mu je ijedan stvarni DNS razrješivač poslao upit.
UK AISI otkrio je aktivnost 28. srpnja nakon što je sigurnosni nadzor uočio neuobičajene prijenose podataka. Zaustavio je povezane evaluacije, izolirao relevantna računala i ograničio aktivnost unutar približno jednog sata od njezina otkrivanja.
Cijenimo partnerstvo s UK AISI-jem tijekom cijelog ovog procesa, uključujući njegov rad na otkrivanju i istraživanju aktivnosti te dijeljenju pojedinosti o njoj. Radujemo se nastavku suradnje.
Jedan od naših vanjskih partnera za evaluaciju, Irregular, obavijestio nas je 29. srpnja o incidentu koji je uključivao modele OpenAI tijekom evaluacija kibernetičke sigurnosti u stilu Capture the Flag (CTF). Modeli su dobili upute da iskorištavanjem slabosti u simuliranom okruženju pronađu skrivene informacije te im je rečeno da nemaju pristup internetu. Međutim, pogrešna konfiguracija testnog okruženja omogućila je modelima pristup javnom internetu.
U jednom se testu naziv izmišljene mete izazova CTF nenamjerno podudarao sa stvarnom domenom. Budući da je testno okruženje pogreškom bilo povezano s internetom, model je iskoristio ranjivost stvarnog web-mjesta misleći da je ono dio simuliranog okruženja. Nije bila riječ o sofisticiranom bijegu iz izoliranog okruženja ni o ranjivosti nultog dana: pristup internetu bio je posljedica pogrešne konfiguracije, a čini se da je model iskoristio osnovnu sigurnosnu ranjivost.
Prema istrazi tvrtke Irregular, model je također pronašao i upotrijebio vjerodajnice za upravljanje tim istim web-mjestom. Irregular nije utvrdio posljedice izvan vlastitih podataka pogođenog web-mjesta, a njegova revizija još traje. Obustavio je evaluacije i započeo sanaciju, a pogođene treće strane dobile su obavijest. Irregular nas je obavijestio da svi utvrđeni problemi povezani s incidentom više nisu aktivni te da su u testno okruženje dodane odgovarajuće zaštitne mjere. Irregular je također izvijestio o povezanim incidentima koji su u istom testnom okruženju uključivali druge laboratorije.
Cijenimo partnerstvo s tvrtkom Irregular i nastavit ćemo blisko surađivati s njom kako bismo podržali njezinu reviziju. Irregular izrađuje i bijelu knjigu kako bi podijelio najbolje prakse za ograničavanje aktivnosti i sigurno provođenje kibernetičkih evaluacija. Radujemo se sudjelovanju u izradi bijele knjige kako bi nalazi bili dostupni zajednici, kao i nastavku našeg partnerstva. Takvu suradnju smatramo ključnom za sigurno i temeljito evaluiranje sadašnjih i budućih modela.


