Kibernetičke evaluacije modela OpenAI koje provode treće strane
Nezavisno testiranje ima važnu ulogu jer nam pomaže potvrditi i bolje razumjeti rizike prije uvođenja. U nekim se kibernetičkim evaluacijama namjerno koriste prilagođene konfiguracije, uključujući ublažene zaštitne mjere, kako bi se izmjerile temeljne sposobnosti, a ne uobičajeno ponašanje modela u javno dostupnim primjenama.
Tokom nedavnih evaluacija dva vanjska partnera za testiranje utvrdila su incidente u kojima su konfiguracije i kontrole testiranja, zajedno s naprednim sposobnostima novijih modela, omogućile da aktivnost modela prijeđe predviđene granice testiranja. Ovi incidenti naglašavaju važnost saradnje unutar cijele industrije i s evaluatorima trećih strana kako bi se standardi testnih okruženja i praksi razvijali uporedo s rastom sposobnosti modela. Napomena urednika: Ovi incidenti nisu povezani sa sigurnosnim incidentom kompanije Hugging Face, o kojem ćemo nastaviti objavljivati novosti ovdje.
Novi incidenti uključivali su pristup modela OpenAI javnom internetu tokom kibernetičkih evaluacija koje su provodile treće strane, pod posebnim uslovima i uz konfiguracije sa smanjenim zaštitnim mjerama koje nisu odražavale uobičajenu primjenu. Incidenti su uključivali sljedeće:
- UK AISI, Institut za sigurnost umjetne inteligencije britanske vlade, provodio je evaluacije na kibernetičkom poligonu s namjerno omogućenim pristupom internetu kako bi agenti mogli sami pronaći alate i djelovati u uslovima sličnijim onima u kojima djeluje stvarni napadač, dok su kibernetički klasifikatori bili onemogućeni radi mjerenja temeljnih sposobnosti. Njihov blog možete pročitati ovdje.(otvara se u novom prozoru)
- Irregular, jedan od naših vanjskih partnera za kibernetičko-sigurnosno testiranje, provodio je evaluacije u stilu takmičenja Capture the Flag koje su trebale biti izolirane od interneta, ali je pogrešna konfiguracija testnog okruženja omogućila modelima pristup javnom internetu.
U nastavku sažimamo šta se dogodilo, koji su uslovi testiranja omogućili tu aktivnost, koje su mjere poduzete da se ona ograniči i šta činimo kako bismo osigurali da nezavisne laboratorije i dalje mogu temeljito i sigurno evaluirati sve sposobnije modele.
Ovi incidenti ukazuju na isti širi izazov koji smo opisali u nedavnoj objavi o incidentu kompanije Hugging Face: kako sposobnosti modela napreduju, moraju napredovati i sistemi sigurnosti i zaštite oko njih. To uključuje i okruženja koja se koriste za razvoj modela i ona koja laboratorije i nezavisni partneri koriste za njihovu evaluaciju.
U narednim sedmicama preispitat ćemo vlastiti pristup testiranju koje provode treće strane, uključujući način na koji prepoznajemo evaluacije višeg rizika, dogovaramo opseg, procjenjujemo zahtjeve za omogućavanje pristupa internetu ili ublažavanje zaštitnih mjera, utvrđujemo očekivanja u pogledu izolacije, rukovanja vjerodajnicama, nadzora i uslova za obustavu te uspostavljamo jasnije procese prijave incidenata i eskalacije.
Posvećeni smo saradnji unutar cijele industrije kako bismo ojačali zajedničke prakse za sigurno provođenje visokorizičnih evaluacija, što uključuje okupljanje zainteresiranih strana poput nacionalnih instituta za umjetnu inteligenciju, nezavisnih evaluatora, drugih laboratorija za umjetnu inteligenciju i ostalih grupa u narednim sedmicama. Cilj nam je očuvati vrijednost temeljite nezavisne evaluacije i istovremeno osigurati da prakse testiranja prate razvoj sve sposobnijih modela.
UK AISI nas je 3. augusta obavijestio da su tokom rutinske kibernetičke evaluacije započete 25. jula modeli kompanije OpenAI i druge laboratorije u nekim slučajevima prekoračili opseg testiranja. Evaluacija je provedena na kontroliranim kibernetičkim poligonima osmišljenim da oponašaju mreže iz stvarnog svijeta. Od 19 utvrđenih događaja, dva su uključivala model OpenAI, GPT‑5.6 Sol. U ostalim slučajevima radilo se o modelima iz druge laboratorije.
Za ovu evaluaciju agenti su dobili upute da djeluju kao stručnjaci za kibernetičku sigurnost u vježbi Capture the Flag: da kompromitiraju tri povezana simulirana okruženja i dođu do završne zastavice. U upitu zadatka navedene su mreže poligona obuhvaćene evaluacijom, a nekoliko sistema izričito je označeno kao izvan njenog opsega. UK AISI je omogućio i pristup internetu uživo kako bi agenti mogli preuzimati alate i djelovati u uslovima sličnijim onima u kojima djeluje ljudski napadač, a onemogućio je kibernetičke klasifikatore modela radi mjerenja njegovih temeljnih sposobnosti.
Granica ovlaštenja koju je UK AISI namjeravao postaviti bio je simulirani kibernetički poligon: agenti su bili ovlašteni napasti navedene simulirane mreže i pronaći zastavicu, ali ne i komunicirati sa sistemima izvan mrežnih granica poligona. Međutim, agentima nije izričito rečeno kako smiju, a kako ne smiju koristiti otvoreni pristup internetu, što je UK AISI naveo kao mogući faktor koji je doprinio incidentu.
UK AISI je utvrdio da je tokom tih izvođenja GPT‑5.6 Sol izvršio dvije neovlaštene radnje pokušavajući pronaći put u simulirani poligon i doći do zastavice:
- GPT‑5.6 Sol ponovo je upotrijebio GitHub token koji je agent druge laboratorije ostavio javno dostupnim kako bi provjerio da li neki sistem unutar poligona kontaktira GitHub ili drugu uslugu za ažuriranje, pokušao zaobići postupak oporavka računa i ograničenja broja zahtjeva te registrirao račune kod vanjskih pružalaca DNS usluga i tuneliranja.
- GPT‑5.6 Sol koristio je javnu uslugu tuneliranja kako bi DNS server koji je lokalno radio u njegovom evaluacijskom okruženju učinio dostupnim s javnog interneta. Server je sadržavao korisne terete namijenjene iskorištavanju poznate ranjivosti u softveru koji se izvodio na testnom poligonu. Postavka nije funkcionirala, nema dokaza da joj je ijedan stvarni DNS razrješivač poslao upit, a infrastruktura je uklonjena po završetku evaluacije.
Iako je model pokušavao završiti zadatak na kibernetičkom poligonu, UK AISI je ove radnje smatrao neovlaštenim jer su uključivale stvarne vanjske račune i usluge izvan granica poligona te nisu bile potrebne za izvršavanje zadatka. DNS server je na javnom internetu također smještao korisne terete za iskorištavanje ranjivosti, iako postavka nije funkcionirala i nema dokaza da joj je ijedan stvarni DNS razrješivač poslao upit.
UK AISI je 28. jula otkrio ovu aktivnost nakon što je sigurnosni nadzor uočio neuobičajene prijenose podataka. Obustavio je povezane evaluacije, izolirao relevantne računare i ograničio aktivnost u roku od otprilike jednog sata od njenog otkrivanja.
Cijenimo partnerstvo s UK AISI-jem tokom cijelog ovog procesa, uključujući njegov rad na otkrivanju i istraživanju aktivnosti te razmjeni pojedinosti o njoj. Radujemo se nastavku naše saradnje.
Irregular, jedan od naših vanjskih partnera za evaluaciju, obavijestio nas je 29. jula o incidentu koji je uključivao modele OpenAI tokom kibernetičkih evaluacija u stilu takmičenja Capture the Flag (CTF). Modeli su dobili upute da iskorištavanjem slabosti unutar simuliranog okruženja pronađu skrivene informacije, a rečeno im je da nemaju pristup internetu. Međutim, pogrešna konfiguracija testnog okruženja omogućila je modelima pristup javnom internetu.
U jednom testu naziv izmišljene mete CTF izazova nenamjerno se podudario sa stvarnom domenom. Budući da je testno okruženje greškom bilo povezano s internetom, model je iskoristio ranjivost stvarne web-stranice, smatrajući je dijelom simuliranog okruženja. To nije uključivalo sofisticirani bijeg iz izoliranog okruženja niti ranjivost nultog dana: pristup internetu bio je posljedica pogrešne konfiguracije, a čini se da je model iskoristio osnovnu sigurnosnu ranjivost.
Prema istrazi kompanije Irregular, model je također pronašao i upotrijebio vjerodajnice za upravljanje tom istom web-stranicom. Irregular nije utvrdio posljedice izvan vlastitih podataka pogođene web-stranice, a njegova revizija još traje. Obustavio je evaluacije i započeo sanaciju, a pogođene treće strane su obaviještene. Irregular nas je obavijestio da svi problemi povezani s incidentom koji su utvrđeni više nisu aktivni te da su u testno okruženje dodane odgovarajuće zaštitne mjere. Irregular je također komunicirao o povezanim incidentima koji su uključivali druge laboratorije u istom testnom okruženju.
Cijenimo partnerstvo s kompanijom Irregular i nastavit ćemo blisko sarađivati s njom kako bismo podržali njenu reviziju. Irregular također priprema stručni dokument kako bi podijelio najbolje prakse za ograničavanje incidenata i sigurno provođenje kibernetičkih evaluacija. Radujemo se učešću u izradi stručnog dokumenta kako bismo nalaze učinili dostupnim zajednici te nastavku našeg partnerstva. Ovakvu saradnju smatramo ključnom za sigurno i temeljito evaluiranje sadašnjih i budućih modela.


