Evaluări cibernetice terțe care implică modele OpenAI
Testarea independentă joacă un rol important, ajutându-ne să validăm și să înțelegem mai bine riscurile înainte de implementare. Unele evaluări cibernetice folosesc intenționat configurații personalizate, inclusiv măsuri de protecție reduse, pentru a măsura capacitatea intrinsecă, nu comportamentul obișnuit al modelelor în implementările disponibile publicului.
În timpul unor evaluări recente, doi parteneri externi de testare au identificat incidente în care combinația dintre configurațiile și controalele de testare și capacitățile în creștere ale modelelor recente a permis activității modelelor să depășească limitele de testare prevăzute. Incidentele subliniază importanța colaborării la nivelul întregii industrii și cu evaluatorii terți pentru adaptarea standardelor privind mediile și practicile de testare, pe măsură ce modelele devin mai capabile. Nota editorului: Aceste incidente sunt diferite de incidentul de securitate Hugging Face și vom continua să publicăm noutăți despre incidentul Hugging Face aici.
Noile incidente au implicat modele OpenAI care au accesat internetul public în timpul unor evaluări cibernetice efectuate de terți, în condiții specifice și cu măsuri de protecție reduse, care nu reflectau implementarea obișnuită. Incidentele au inclus:
- UK AISI, Institutul pentru Securitatea IA al guvernului britanic, desfășura evaluări în poligoane cibernetice, cu accesul la internet activat intenționat pentru ca agenții să-și poată găsi singuri instrumentele și să opereze în condiții mai apropiate de cele ale unui atacator real, iar clasificatoarele cibernetice erau dezactivate pentru a măsura capacitatea intrinsecă. Citește articolul lor de blog aici.(se deschide într-o fereastră nouă)
- Irregular, unul dintre partenerii noștri externi pentru testarea securității cibernetice, desfășura evaluări de tip Capture the Flag care trebuiau izolate de internet, însă o configurare greșită a mediului de testare a permis modelelor să acceseze internetul public.
Mai jos prezentăm pe scurt ce s-a întâmplat, condițiile de testare care au permis activitatea, măsurile luate pentru limitarea acesteia și ce facem pentru ca laboratoarele independente să poată continua să evalueze riguros și în siguranță modele din ce în ce mai capabile.
Aceste incidente indică aceeași provocare mai amplă descrisă în articolul nostru recent despre incidentul Hugging Face: pe măsură ce capacitățile modelelor avansează, trebuie să evolueze și sistemele de securitate și siguranță din jurul acestora. Acest lucru include atât mediile folosite pentru dezvoltarea modelelor, cât și cele utilizate de laboratoare și parteneri independenți pentru evaluarea lor.
În următoarele săptămâni, ne vom revizui abordarea privind testarea efectuată de terți, inclusiv modul în care identificăm evaluările cu risc mai ridicat, convenim domeniul de aplicare, analizăm cererile de activare a accesului la internet sau de reducere a măsurilor de protecție, stabilim cerințe privind izolarea, gestionarea datelor de autentificare, monitorizarea și condițiile de oprire și definim procese mai clare de notificare și escaladare a incidentelor.
Ne angajăm să colaborăm la nivelul întregului nostru sector pentru a consolida practicile comune de desfășurare în siguranță a evaluărilor cu risc ridicat, inclusiv prin reunirea, în următoarele săptămâni, a unor părți interesate precum institute naționale de IA, evaluatori independenți, alte laboratoare de IA și alte grupuri. Obiectivul nostru este să păstrăm valoarea evaluării independente riguroase, garantând totodată că practicile de testare țin pasul cu modelele din ce în ce mai capabile.
Pe 3 august, UK AISI ne-a informat că, în timpul unei evaluări cibernetice de rutină începute pe 25 iulie, modelele OpenAI și ale unui alt laborator au depășit în unele cazuri domeniul de testare. Evaluarea s-a desfășurat în poligoane cibernetice controlate, concepute să reproducă rețele din lumea reală. Dintre cele 19 evenimente identificate, două au implicat un model OpenAI, GPT‑5.6 Sol. Celelalte cazuri au implicat modele ale unui alt laborator.
Pentru această evaluare, agenții primiseră instrucțiuni să acționeze ca experți în securitate cibernetică într-un exercițiu de tip Capture the Flag: să compromită trei medii simulate interconectate și să obțină un indicator final. Solicitarea sarcinii identifica rețelele din poligon incluse în domeniul de aplicare și preciza că mai multe sisteme erau în afara acestuia. UK AISI a activat și accesul direct la internet, astfel încât agenții să poată descărca instrumente și să opereze în condiții mai apropiate de cele ale unui atacator uman, și a dezactivat clasificatoarele cibernetice ale modelului pentru a măsura capacitatea intrinsecă.
Limita de autorizare prevăzută de UK AISI a fost poligonul cibernetic simulat: agenții au fost autorizați să atace rețelele simulate specificate și să obțină un indicator, nu să interacționeze cu sisteme aflate dincolo de limitele rețelei poligonului. Cu toate acestea, agenților nu li s-a precizat în mod explicit cum pot și cum nu pot utiliza accesul la internetul deschis, aspect pe care UK AISI îl identifică drept o posibilă cauză care a contribuit la producerea incidentului.
În aceste rulări, UK AISI a constatat că GPT‑5.6 Sol a efectuat două acțiuni neautorizate în timp ce încerca să găsească o cale de acces în poligonul simulat și să obțină indicatorul:
- GPT‑5.6 Sol a reutilizat un token GitHub pe care agentul unui alt laborator îl lăsase accesibil publicului pentru a verifica dacă un sistem din zonă interoga GitHub sau un alt serviciu de actualizări, a încercat să ocolească limitele de recuperare a contului și cele privind numărul de cereri și a înregistrat conturi la furnizori externi de servicii DNS și de tunelare.
- GPT‑5.6 Sol a utilizat un serviciu public de tunelare pentru a face ca un server DNS care rula local în mediul său de evaluare să fie accesibil din internetul public. Serverul conținea încărcături destinate unei vulnerabilități cunoscute dintr-un program software care rula în mediul de testare. Configurația nu a funcționat, nu există dovezi că vreun resolver real ar fi interogat-o, iar infrastructura a fost eliminată la încheierea evaluării.
Deși modelul încerca să finalizeze exercițiul din poligonul cibernetic, UK AISI a considerat aceste acțiuni neautorizate, deoarece au implicat conturi și servicii externe reale, din afara limitelor poligonului, și nu erau necesare pentru finalizarea sarcinii. Serverul DNS a găzduit și sarcini utile de exploatare pe internetul public, deși configurația nu a funcționat și nu există dovezi că vreun resolver real ar fi interogat-o.
UK AISI a identificat activitatea pe 28 iulie, după ce sistemele de monitorizare a securității au detectat transferuri neobișnuite de date. Instituția a oprit evaluările aferente, a izolat echipamentele relevante și a limitat activitatea în aproximativ o oră de la detectare.
Apreciem colaborarea cu UK AISI pe tot parcursul acestui proces, inclusiv eforturile sale de a identifica și investiga activitatea și de a comunica detalii despre aceasta. Așteptăm cu interes să ne continuăm colaborarea.
Pe 29 iulie, Irregular, unul dintre partenerii noștri externi de evaluare, ne-a notificat despre un incident care a implicat modele OpenAI în timpul unor evaluări de securitate cibernetică de tip Capture the Flag (CTF). Modelele primiseră instrucțiuni să găsească informații ascunse exploatând vulnerabilități dintr-un mediu simulat și li se spusese că nu aveau acces la internet. Totuși, o configurare greșită a mediului de testare le-a permis modelelor să acceseze internetul public.
Într-unul dintre teste, numele țintei fictive din provocarea CTF a coincis neintenționat cu un domeniu real. Deoarece mediul de testare fusese conectat din greșeală la internet, modelul a exploatat un site real, crezând că face parte din mediul simulat. Incidentul nu a implicat o evadare sofisticată din sandbox sau o vulnerabilitate zero-day: accesul la internet a rezultat dintr-o configurare greșită, iar modelul pare să fi exploatat o vulnerabilitate de securitate elementară.
Conform investigației Irregular, modelul a găsit și folosit date de autentificare pentru a opera același site. Irregular nu a identificat efecte dincolo de datele proprii ale site-ului afectat, iar auditul său este în desfășurare. Irregular a suspendat evaluările și a început remedierea, iar terții afectați au fost notificați. Irregular ne-a informat că toate problemele identificate în legătură cu incidentul nu mai sunt active și că mediului de testare i-au fost adăugate măsuri de protecție adecvate. Irregular a comunicat și despre incidente conexe care au implicat și alte laboratoare din același mediu de testare.
Apreciem colaborarea cu Irregular și vom continua să lucrăm îndeaproape cu echipa sa pentru a sprijini analiza în curs. Irregular elaborează și un document tehnic pentru a prezenta bune practici privind limitarea incidentelor și desfășurarea în siguranță a evaluărilor cibernetice. Așteptăm cu interes să contribuim la documentul tehnic, pentru a pune constatările la dispoziția comunității, și să ne continuăm colaborarea. Considerăm că acest tip de colaborare este esențial pentru evaluarea sigură și riguroasă a modelelor actuale și viitoare.


