Evalwazzjonijiet ċibernetiċi minn partijiet terzi li jinvolvu mudelli OpenAI
L-ittestjar indipendenti għandu rwol importanti biex jgħinna nivvalidaw u nifhmu aħjar ir-riskji qabel it-tnedija. Xi evalwazzjonijiet ċibernetiċi jużaw apposta konfigurazzjonijiet personalizzati, inklużi salvagwardji mnaqqsa, biex ikejlu l-kapaċità sottostanti—mhux kif il-mudelli normalment jaġixxu f’sistemi disponibbli għall-pubbliku.
Matul evalwazzjonijiet reċenti, żewġ sħab esterni tal-ittestjar identifikaw inċidenti fejn il-konfigurazzjonijiet u l-kontrolli tat-test, flimkien mal-kapaċitajiet dejjem akbar tal-mudelli reċenti, ippermettew li l-attività tal-mudelli tmur lil hinn mill-konfini maħsuba tat-test. L-inċidenti jenfasizzaw l-importanza tal-kollaborazzjoni fl-industrija kollha u ma’ evalwaturi esterni biex l-istandards tal-ambjenti u l-prattiki tal-ittestjar ikomplu jevolvu hekk kif il-mudelli jsiru aktar kapaċi. Nota tal-editur: Dawn huma separati mill-inċident tas-sigurtà ta’ Hugging Face, u se nkomplu naqsmu aġġornamenti dwar l-inċident ta’ Hugging Face hawnhekk.
L-inċidenti l-ġodda kienu jinvolvu mudelli ta’ OpenAI li aċċessaw l-internet pubbliku waqt evalwazzjonijiet ċibernetiċi minn partijiet terzi, taħt kundizzjonijiet speċifiċi u konfigurazzjonijiet b’salvagwardji mnaqqsa li ma kinux jirriflettu t-tnedija normali. L-inċidenti kienu jinkludu:
- UK AISI, l-Istitut tas-Sigurtà tal-IA tal-gvern tar-Renju Unit, kien qed iwettaq evalwazzjonijiet f’meded ċibernetiċi b’aċċess għall-internet attivat apposta sabiex l-aġenti jkunu jistgħu jsibu l-għodod tagħhom stess u joperaw f’kundizzjonijiet eqreb għal dawk ta’ attakkant reali, u bil-klassifikaturi ċibernetiċi diżattivati biex titkejjel il-kapaċità sottostanti. Tista’ taqra l-blogg tagħhom hawnhekk.(jinfetaħ f’tieqa ġdida)
- Irregular, wieħed mis-sħab esterni tagħna fl-ittestjar taċ-ċibersigurtà, kien qed iwettaq evalwazzjonijiet fuq l-istil Capture the Flag maħsuba biex ikunu iżolati mill-internet, iżda konfigurazzjoni ħażina fl-ambjent tat-test ippermettiet lill-mudelli jaċċessaw l-internet pubbliku.
Hawn taħt niġbru fil-qosor x’ġara, il-kundizzjonijiet tat-test li ppermettew l-attività, il-passi li ttieħdu biex titrażżan, u x’qed nagħmlu biex niżguraw li laboratorji indipendenti jkunu jistgħu jkomplu jevalwaw b’mod rigoruż u sigur mudelli dejjem aktar kapaċi.
Dawn l-inċidenti jindikaw l-istess sfida usa’ li ddeskrivejna fil-pubblikazzjoni reċenti tagħna dwar l-inċident ta’ Hugging Face: hekk kif il-kapaċitajiet tal-mudelli javvanzaw, iridu javvanzaw ukoll is-sistemi tas-sigurtà u tas-sikurezza ta’ madwarhom. Dan jinkludi kemm l-ambjenti użati biex jiġu żviluppati l-mudelli kif ukoll dawk li l-laboratorji u s-sħab indipendenti jużaw biex jevalwawhom.
Fil-ġimgħat li ġejjin, se nirrieżaminaw l-approċċ tagħna għall-ittestjar minn partijiet terzi, inkluż kif nidentifikaw evalwazzjonijiet b’riskju ogħla, naqblu dwar il-kamp ta’ applikazzjoni, nivvalutaw talbiet biex jiġi attivat l-aċċess għall-internet jew jitnaqqsu s-salvagwardji, nistabbilixxu aspettattivi għall-iżolament, il-ġestjoni tal-kredenzjali, il-monitoraġġ u l-kundizzjonijiet ta’ waqfien, u noħolqu proċessi aktar ċari għan-notifika u l-eskalazzjoni tal-inċidenti.
Aħna impenjati li naħdmu mal-industrija kollha biex insaħħu l-prattiki komuni għat-twettiq sigur ta’ evalwazzjonijiet b’riskju għoli, inkluż billi fil-ġimgħat li ġejjin inlaqqgħu partijiet interessati bħall-istituti nazzjonali tal-IA, evalwaturi indipendenti, laboratorji oħra tal-IA u gruppi oħra. L-għan tagħna huwa li nippreservaw il-valur ta’ evalwazzjoni indipendenti u rigoruża filwaqt li niżguraw li l-prattiki tal-ittestjar ilaħħqu ma’ mudelli dejjem aktar kapaċi.
Fit-3 ta’ Awwissu, UK AISI qalilna li, waqt evalwazzjoni ċibernetika ta’ rutina li bdiet fil-25 ta’ Lulju, mudelli ta’ OpenAI u ta’ laboratorju ieħor f’xi każijiet marru lil hinn mill-kamp tat-test. L-evalwazzjoni saret f’meded ċibernetiċi kkontrollati, maħsuba biex jimitaw networks tad-dinja reali. Mid-19-il avveniment identifikat, tnejn kienu jinvolvu mudell ta’ OpenAI, GPT‑5.6 Sol. Il-każijiet l-oħra kienu jinvolvu mudelli ta’ laboratorju ieħor.
Għal din l-evalwazzjoni, l-aġenti ngħataw struzzjonijiet biex jaġixxu bħala esperti taċ-ċibersigurtà f’eżerċizzju Capture the Flag: jikkompromettu tliet ambjenti simulati u interkonnessi u jiksbu l-bandiera finali. Il-prompt tal-kompitu identifika n-networks tal-medda inklużi fil-kamp u semma diversi sistemi bħala barra mill-kamp. UK AISI attiva wkoll aċċess dirett għall-internet sabiex l-aġenti jkunu jistgħu jniżżlu għodod u joperaw f’kundizzjonijiet eqreb għal dawk ta’ attakkant uman—u ddiżattiva l-klassifikaturi ċibernetiċi tal-mudell biex ikejjel il-kapaċità sottostanti.
Il-konfini tal-awtorizzazzjoni maħsuba minn UK AISI kienu l-medda ċibernetika simulata: l-aġenti kienu awtorizzati jattakkaw in-networks simulati speċifikati u jiksbu bandiera, mhux jinteraġixxu ma’ sistemi lil hinn mill-konfini tan-network tal-medda. Madankollu, l-aġenti ma ngħatawx struzzjonijiet espliċiti dwar kif setgħu jew ma setgħux jużaw l-aċċess liberu għall-internet, fatt li UK AISI identifika bħala kawża potenzjali li kkontribwiet għall-inċident.
Tul dawn l-eżekuzzjonijiet, UK AISI sab li GPT‑5.6 Sol wettaq żewġ azzjonijiet mhux awtorizzati waqt li kien qed jipprova jsib rotta għal ġol-medda simulata u jikseb il-bandiera:
- GPT‑5.6 Sol reġa’ uża token ta’ GitHub li aġent ta’ laboratorju ieħor kien ħalla aċċessibbli pubblikament biex jiċċekkja jekk sistema fil-medda kinitx qed tikkonsulta GitHub jew servizz ieħor tal-aġġornamenti, ipprova jevita l-proċessi tal-irkupru tal-kont u l-limiti tat-talbiet, u rreġistra kontijiet ma’ fornituri esterni tad-DNS u tal-mini tan-network.
- GPT‑5.6 Sol uża servizz pubbliku tal-mini tan-network biex server DNS li kien qed jaħdem lokalment fl-ambjent tal-evalwazzjoni tiegħu jkun aċċessibbli mill-internet pubbliku. Is-server kien fih payloads maħsuba għal vulnerabbiltà magħrufa f’software li kien qed jaħdem fil-medda tat-test. Il-konfigurazzjoni ma ħadmitx, ma hemm ebda evidenza li kkonsultaha xi riżolvitur reali, u l-infrastruttura tneħħiet meta ntemmet l-evalwazzjoni.
Għalkemm il-mudell kien qed jipprova jlesti l-isfida fil-medda ċibernetika, UK AISI qies dawn l-azzjonijiet bħala mhux awtorizzati għax kienu jinvolvu kontijiet u servizzi esterni reali lil hinn mill-konfini tal-medda u ma kinux meħtieġa biex titlesta l-biċċa xogħol. Is-server DNS ospita wkoll payloads ta’ sfruttament fuq l-internet pubbliku, għalkemm il-konfigurazzjoni ma ħadmitx u ma hemm ebda evidenza li kkonsultaha xi riżolvitur reali.
UK AISI identifika l-attività fit-28 ta’ Lulju wara li l-monitoraġġ tas-sigurtà sab trasferimenti mhux tas-soltu tad-data. Huwa waqqaf l-evalwazzjonijiet relatati, iżola l-magni rilevanti u rażżan l-attività fi żmien madwar siegħa minn meta nstabet.
Napprezzaw is-sħubija ta’ UK AISI matul dan il-proċess, inkluż il-ħidma tiegħu biex jidentifika u jinvestiga l-attività u jaqsam id-dettalji dwarha. Nistennew bil-ħerqa li nkomplu l-kollaborazzjoni tagħna.
Fid-29 ta’ Lulju, Irregular, wieħed mis-sħab esterni tagħna fl-evalwazzjoni, għarrafna b’inċident li kien jinvolvi mudelli ta’ OpenAI waqt evalwazzjonijiet taċ-ċibersigurtà fuq l-istil Capture the Flag (CTF). Il-mudelli ngħataw struzzjonijiet biex isibu informazzjoni moħbija billi jisfruttaw dgħufijiet f’ambjent simulat u ntqalilhom li ma kellhomx aċċess għall-internet. Madankollu, konfigurazzjoni ħażina fl-ambjent tat-test ippermettiet lill-mudelli jaċċessaw l-internet pubbliku.
F’test minnhom, l-isem tal-mira fittizja tal-isfida CTF inzerta jaqbel ma’ dominju reali. Minħabba li l-ambjent tat-test kien imqabbad mal-internet bi żball, il-mudell sfrutta sit web reali għax ħasbu parti mill-ambjent simulat. Dan ma kienx jinvolvi ħarba sofistikata minn sandbox jew zero-day: l-aċċess għall-internet irriżulta minn konfigurazzjoni ħażina, u jidher li l-mudell sfrutta vulnerabbiltà bażika tas-sigurtà.
Skont l-investigazzjoni ta’ Irregular, il-mudell sab u uża wkoll kredenzjali biex jopera dak l-istess sit. Irregular ma identifikax impatt lil hinn mid-data tas-sit affettwat stess, u l-awditu tiegħu għadu għaddej. Huwa ssospenda l-evalwazzjonijiet u beda jieħu miżuri korrettivi, filwaqt li l-partijiet terzi affettwati ġew mgħarrfa. Irregular għarrafna li l-kwistjonijiet kollha identifikati b’rabta mal-inċident m’għadhomx attivi u li żdiedu salvagwardji rilevanti mal-ambjent tat-test. Irregular ikkomunika wkoll dwar inċidenti relatati li kienu jinvolvu laboratorji oħra fl-istess ambjent tat-test.
Napprezzaw is-sħubija ta’ Irregular u se nkomplu naħdmu mill-qrib miegħu biex nappoġġaw ir-rieżami tiegħu. Irregular qed iħejji wkoll white paper biex jaqsam l-aħjar prattiki għat-trażżin u għat-twettiq sigur ta’ evalwazzjonijiet ċibernetiċi. Nistennew bil-ħerqa li nieħdu sehem fil-white paper biex ir-riżultati jkunu disponibbli għall-komunità u li nkomplu s-sħubija tagħna. Inqisu din it-tip ta’ kollaborazzjoni essenzjali biex niżguraw evalwazzjoni sigura u bir-reqqa tal-mudelli attwali u futuri.


