Incidentul Hugging Face și alte efecte ale modelelor nealiniate asupra terților
Pe măsură ce sistemele AI devin mai capabile și mai autonome, comportamentul nealiniat poate duce la acțiuni cu consecințe în lumea reală, inclusiv incidente de securitate cibernetică și alte rezultate pe care dezvoltatorii poate nu le-au anticipat. Prin urmare, înțelegerea modului în care apar și escaladează aceste comportamente, precum și a felului în care pot fi detectate și gestionate, devine o componentă tot mai importantă a dezvoltării și implementării în siguranță a sistemelor AI avansate.
Inițial, am considerat incidentul Hugging Face în primul rând o problemă de securitate, deoarece a implicat compromiterea la nivel de platformă. Rămâne cea mai gravă activitate de acest tip pe care am identificat-o până acum la modelele noastre și a fost determinată în principal de un model de cercetare foarte capabil, destinat exclusiv utilizării interne. Ulterior, am înțeles că această intruziune a fost provocată de modele care au recurs la strategii nealiniate pentru a rezolva sarcini dificile, conform documentației din raportul tehnic Hugging Face. Incidentele de securitate cibernetică reprezintă una dintre manifestările acestui risc; nealinierea poate duce și la alte comportamente neașteptate sau îngrijorătoare, care nu se încadrează în categoriile tradiționale de securitate, precum postările modelelor noastre pe site-uri terțe — fenomen pe care îl numim „spam al agenților”. Trebuie să le abordăm pe ambele.
Am continuat să analizăm activitatea mai amplă, acordând prioritate incidentelor mai grave și extinzând apoi analiza la activități nealiniate de gravitate mai redusă, inclusiv spamul agenților.
Această pagină reunește rapoartele și actualizările noastre privind incidentul Hugging Face, cercetările și prezentările publice conexe, activitățile suplimentare identificate, concluziile despre rolul nealinierii modelelor și măsurile pe care le luăm pentru a ne consolida sistemele. Vom actualiza această pagină pe măsură ce investigațiile avansează.
Activități cu impact asupra terților
Pentru a înțelege mai bine amploarea acestor comportamente neașteptate, desfășurăm o analiză amplă a activităților modelelor noastre pe internet în timpul antrenării și evaluării. În cadrul analizei, identificăm și notificăm permanent terții, începând cu situațiile în care:
Este posibil ca modelele noastre să fi ocolit controalele de securitate ale unui terț sau să fi afectat disponibilitatea unui serviciu online sau
Cazurile de nealiniere au afectat negativ site-uri sau servicii ale terților.
Pe baza analizei efectuate până acum, am notificat zeci de terți folosind criteriile de mai sus. Analiza activităților anterioare continuă și va necesita timp și resurse semnificative. Vom notifica și alți terți pe măsură ce activitatea continuă.
Mai jos publicăm rezumate anonimizate ale tipurilor de activități nealiniate observate și vom actualiza descrierile pe măsură ce notificăm alți terți și înțelegem mai bine situația. În plus, vom comunica actualizările relevante despre stadiul analizei. În general, vom omite numele și alte date de identificare atunci când este necesar pentru protejarea părților afectate, deși acestea pot decide să facă publice informațiile pe care li le oferim.
Rezumatele activităților observate
Procesul nostru de analiză și notificare a identificat până acum următoarele categorii de activități:
Ocolirea controlului accesului: agenții accesează informații sau funcții care necesită în mod normal verificarea identității, o anumită permisiune, un abonament sau un cont. De exemplu, un agent a folosit o altă adresă web, a modificat detaliile unei solicitări sau s-a bazat pe o sesiune autentificată care îi oferea mai mult acces decât era prevăzut.
Utilizarea datelor de autentificare expuse: agenții au găsit date de conectare sau chei de acces care fuseseră publicate și le-au folosit pentru a accesa un serviciu.
Injectarea de interogări sau comenzi: agenții au introdus text într-un site sau serviciu, iar acesta l-a tratat drept instrucțiune, nu drept date obișnuite de intrare. Acest lucru poate determina serviciul să execute o interogare de bază de date, cod de aplicație sau o comandă pe serverul său.
Accesarea componentelor interne din mediul de execuție: agenții au citit fișiere care conțineau implementarea unui serviciu sau au interacționat cu un sistem de fundal destinat utilizării interne. În aceste cazuri, agentul a ajuns la părți ale serviciului pe care nu trebuia să le poată accesa.
Spam al agenților: agenții publică pe site-uri terțe informații care pot modifica conținutul acestora și pot necesita remediere; de exemplu, folosesc pagini wiki publice ca forumuri de mesaje comune.