Către dosare de siguranță pentru antrenarea IA de vârf
Credem că intrăm într-o nouă eră, în care documentația structurată de siguranță ar trebui să fie obligatorie înainte de continuarea oricărei sesiuni de antrenare a IA de vârf prin învățare prin consolidare. În mod ideal, această documentație ar atinge standardul unor „dosare de siguranță”: argumentații cuprinzătoare, structurate și bazate pe dovezi privind riscurile, utilizate în alte industrii în care siguranța este esențială. Considerăm dosarele de siguranță un reper către care ne îndreptăm, recunoscând totodată dificultatea de a le face la fel de riguroase pentru modelele IA ca în aviație sau în energia nucleară, din cauza complexității care apare la fiecare nou nivel de capabilitate al IA. Lucrăm la un cadru care să formalizeze aceste practici.
Mai jos prezentăm câteva recomandări inițiale care, în opinia noastră, ar trebui să facă parte din astfel de dosare de siguranță pentru antrenarea IA de vârf. Aceste bune practici reflectă ceea ce am învățat până acum și ne așteptăm să evolueze pe măsură ce continuăm să perfecționăm procesele interne pentru o dezvoltare prudentă. Le publicăm acum pentru a prezenta transparent perspectiva noastră actuală și pentru a invita comunitatea să ne ofere feedback. Rețineți că acest document se concentrează pe antrenarea IA de vârf prin învățare prin consolidare; utilizarea internă și externă necesită luarea în considerare a unui set mult mai larg de proprietăți ale alinierii.
Dosarele de siguranță ar trebui să acopere trei aspecte ale ansamblului tehnic: antrenarea pentru aliniere, izolarea și monitorizarea. Aceste măsuri de protecție contribuie la asigurarea faptului că modelul nu încearcă să întreprindă acțiuni nealiniate și că, chiar dacă ar încerca, i-ar fi greu să depășească limitele de izolare, iar monitorizarea ar detecta tentativa înainte de producerea unor prejudicii.
Alinierea modelelor: Prima linie de apărare ar trebui să fie antrenarea modelelor pentru a fi aliniate, adică pentru a acționa în mod fiabil conform intențiilor noastre. Aceasta ar putea include:
Medii de antrenare și notare: Reduceți riscul ca modelele să dezvolte comportamente nealiniate, împiedicând consolidarea pozitivă, în timpul antrenării, a exploatării mecanismelor de recompensă. Aceasta ar putea include:
Verificări automate ale seturilor de date: Folosiți agenți pentru a identifica și remedia mediile defectuoase de învățare prin consolidare care ar putea permite unor traiectorii nealiniate să obțină recompense mari prin exploatarea vulnerabilităților, nu prin comportamentul dorit. Astfel, reduceți posibilitățile de consolidare a nealinierii în timpul antrenării.
Verificări manuale ale seturilor de date: Completați procesul automatizat de red teaming cu verificări manuale și controale de calitate ale seturilor de date, pentru a identifica sarcinile defectuoase care ar putea consolida involuntar comportamentele nealiniate.
Ajustarea sistemelor de notare: Ajustați sistemele de notare pentru a penaliza tentativele modelului de a exploata vulnerabilitățile sau de a compromite mediile de învățare prin consolidare în timpul antrenării.
Analiza sesiunilor anterioare: Aplicați clasificatori înregistrărilor de execuție din experimentele anterioare, pentru a vă asigura că sistemele de notare funcționează conform intenției.
Măsurarea alinierii: Efectuați evaluări care urmăresc predispozițiile modelului spre nealiniere, pentru a măsura eficacitatea antrenării pentru aliniere. Aceasta ar putea include:
Evaluări offline ale alinierii: Efectuați evaluări ale alinierii în timpul sesiunilor de antrenare a modelelor de vârf, pentru a verifica dacă antrenarea funcționează conform intenției, și investigați orice regresie semnificativă.
Testare retrospectivă: Testați retrospectiv evaluările alinierii pe incidente anterioare, pentru a confirma că acestea detectează modelele care au manifestat nealiniere și că nu sunt ajustate excesiv la anumite incidente.
Urmărirea manipulării evaluărilor: Urmăriți conștientizarea evaluării sau metajocul (modelele recunosc faptul că sunt testate), care ar putea induce schimbări de comportament. De exemplu, activați mecanisme de monitorizare a conștientizării evaluării și a metajocului în evaluările alinierii, cu praguri clare de blocare.
Teste de stres pentru cele mai nefavorabile scenarii: Provocați cele mai grave comportamente nedorite și verificați dacă cel puțin o evaluare le-ar detecta.
Prevenirea antrenării pe baza lanțului de gândire: Nu permiteți sistemelor automate de notare să vadă lanțul de gândire în timpul învățării prin consolidare, pentru a împiedica modelele să evolueze astfel încât să eludeze mecanismele de monitorizare a lanțului de gândire.
Izolare: Asigurați mecanisme de izolare în medii sandbox și măsuri de securitate suficient de robuste pentru a preveni acțiunile dăunătoare în cazul în care un model devine nealiniat. Aceasta ar putea include:
Mai multe niveluri de securitate a infrastructurii: Investiți substanțial în consolidarea securității atât a mediului sandbox în care rulează modelul, cât și a infrastructurii de cercetare care îl găzduiește, pentru a asigura un nivel suplimentar de protecție în cazul ieșirii din sandbox.
Red teaming pentru izolare: Îmbunătățiți securitatea mediului sandbox, a infrastructurii de cercetare și a perimetrului prin testarea iterativă de tip red teaming a acestor sisteme, folosind versiuni intermediare ale modelelor din sesiuni de antrenare a IA de vârf, sub rezerva unei analize de siguranță, pentru a identifica și remedia eventualele lacune. Supuneți testării de tip red teaming și toate serviciile pe care modelul le-ar putea accesa în timpul antrenării (de exemplu, memoria cache pentru internet).
Comunicare între eșantioane: Limitați comunicarea cu lățime mare de bandă între eșantioane la căile aprobate, precum instrumentele multiagent, și închideți canalele laterale ale infrastructurii care au lățime mare de bandă și pot fi descoperite ușor de agenți.
Transcrieri imuabile: Salvați transcrierile agenților într-o formă care nu permite modificarea lor, pentru o perioadă rezonabilă (de exemplu, în conturi de stocare cu scriere unică), pentru toate procesele de antrenare prin învățare prin consolidare, evaluare și utilizare internă. Astfel, permiteți investigarea fiabilă a incidentelor și preveniți modificările accidentale.
Monitorizare: Dispuneți de un sistem de monitorizare în timp real care, dacă modelele încep să întreprindă acțiuni nealiniate, să detecteze orice posibilă nealiniere și să permită rezolvarea rapidă a problemelor prioritare înainte de producerea unui incident grav. Aceasta ar putea include:
Asigurarea posibilității de monitorizare: Asigurați-vă că modelele pot fi monitorizate în continuare, folosind evaluări ale posibilității de monitorizare și ale eludării monitorizării, cu praguri clare, pentru a detecta din timp comportamentele îngrijorătoare.
Rată mare de detectare a problemelor cunoscute: Asigurați-vă că sistemul de monitorizare detectează o proporție mare a incidentelor anterioare într-o evaluare pe date păstrate separat.
Evaluări actualizate pentru sistemele de monitorizare: Creați exemple de evaluare reprezentative pentru riscurile complet noi ale noilor sesiuni, astfel încât măsurătorile ratei de detectare și ale preciziei monitorizării să rămână relevante.
Reacție rapidă: Implementați alerte prioritare care să ducă la intervenții în termenul stabilit printr-un SLA, fie prin alertarea unei persoane de gardă, fie prin suspendarea automată a sesiunii afectate, înainte ca modelul să provoace prejudicii (de exemplu, alertați persoana de gardă din echipa de securitate și responsabilul sesiunii în cazul incidentelor din timpul zilei și suspendați automat sesiunile pentru alertele a căror primire nu este confirmată noaptea).
Pe lângă recomandările privind măsurile tehnice de protecție, am lucrat la bune practici operaționale pentru dosarele de siguranță aferente unei sesiuni de antrenare a IA de vârf. Acestea ar putea include:
Opinii divergente (analize pre-mortem): După redactarea unui dosar de siguranță, un membru al altei echipe ar trebui să formuleze în scris o opinie divergentă, pentru a identifica eventualele lacune și a oferi o perspectivă asupra riscurilor proporțională cu dovezile disponibile. Echipa de antrenare ar trebui apoi să răspundă acestor observații, contribuind astfel la consolidarea dosarului.
Aprobări: Dosarul de siguranță ar trebui examinat de membri ai conducerii superioare, fiecare având dreptul de a bloca sesiunea de antrenare, pentru a asigura mai multe niveluri de control intern asupra acesteia (de exemplu, conducătorul organizației de cercetare sau vicepreședintele responsabil, responsabilul pentru siguranță și directorul științific).
Răspundere: Membrul conducerii superioare responsabil de o sesiune de antrenare (de exemplu, conducătorul organizației de cercetare sau vicepreședintele pentru cercetare) ar trebui să răspundă pentru dosarul de siguranță și pentru gestionarea oricărui incident, inclusiv în cadrul evaluărilor de performanță. Astfel, și echipele de antrenare ar fi încurajate să promoveze siguranța și alinierea.
Suspendare: Dacă sunt identificate probleme care ar invalida un dosar de siguranță (de exemplu, o nouă problemă de securitate), trebuie să existe proceduri operaționale, controale tehnice și acorduri privind nivelul serviciilor (SLA) pentru suspendarea tuturor sesiunilor vizate.
Transparență internă: Dosarele de siguranță ar trebui puse la dispoziția grupurilor de supraveghere internă (de exemplu, Comitetul pentru siguranță și securitate).
Audituri: Auditorilor ar trebui să li se acorde acces suficient pentru a verifica validitatea și temeinicia afirmațiilor din dosarul de siguranță și pentru a semnala eventualele lacune.
Escaladări: Ar trebui să existe un proces clar de escaladare a problemelor de nealiniere, un tabel cu niveluri de gravitate definite și o persoană de gardă pentru nealiniere, care să poată alerta conducerea (de exemplu, directorul general) atunci când o sesiune atinge un anumit nivel de gravitate.
Controale tehnice: Inițierea unor sesiuni neconforme ar trebui să fie dificilă atât pentru oameni, cât și pentru agenți. Funcțiile de siguranță, precum monitorizarea și suspendarea automată, ar trebui să blocheze funcționarea în caz de defecțiune (de exemplu, nu ar trebui să fie posibilă pornirea sesiunilor fără monitorizarea corespunzătoare activată sau dezactivarea monitorizării din interiorul proceselor de antrenare prin învățare prin consolidare, de evaluare ori de utilizare internă).
Posibilitatea de revenire la o stare anterioară: Ar trebui să fie ușor de identificat toate utilizările ulterioare ale unui model nealiniat în procesul de antrenare (de exemplu, generarea datelor sau notarea), pentru a putea anula, dacă este necesar, efectele rezultatelor nealiniate.
Inventarierea completă a riscurilor reziduale: Dosarele de siguranță ar trebui să enumere cât mai complet riscurile reziduale neacoperite de măsurile de atenuare implementate în prezent, pentru a permite luarea unor decizii informate privind acceptarea riscurilor.
Acestea sunt recomandările noastre actuale și se află în curs de implementare la OpenAI. Ne așteptăm ca practicile noastre să continue să evolueze în următoarele săptămâni.
Am elaborat și câteva bune practici pentru investigarea incidentelor grave de nealiniere a IA. Laboratoarele ar trebui să urmărească să învețe cât mai mult din fiecare incident (similar practicilor de investigare(se deschide într-o fereastră nouă) din alte industrii cu mize mari), pentru a putea preveni astfel de situații pe viitor. Iată câteva exemple de măsuri posibile:
Transparență internă: Întrucât finalizarea unei investigații poate dura mult timp, ar trebui prezentate periodic informări interne despre investigarea incidentelor (de exemplu, informări zilnice pentru investigațiile în curs). Angajații ar trebui să aibă la dispoziție proceduri clare pentru a obține acces suplimentar, inclusiv la transcrieri brute și la eșantionarea rezultatelor modelelor nealiniate, dacă acest lucru este sigur și relevant pentru activitatea lor.
Cauza de bază a nealinierii: Cercetătorii ar trebui să identifice cauzele de bază din dinamica antrenării (de exemplu, prin experimente țintite de ablație sau reeșantionare), pentru a înțelege cum au apărut comportamentele nealiniate, a aprofunda înțelegerea științifică a nealinierii și a o preveni mai eficient pe viitor.
Analiză post-mortem: Ar trebui efectuată o analiză post-mortem a aspectelor operaționale și a culturii organizaționale, pentru a înțelege toate cauzele care au contribuit la incident, inclusiv motivele pentru care problemele au apărut și au rămas nedetectate sau nu au fost escaladate înainte de incident.
Detectare: Ar trebui să dezvoltăm metode de testare a alinierii capabile să descopere predispoziția de a provoca incidentul, fără a le optimiza iterativ direct pe baza informațiilor obținute din incident (de exemplu, transcrieri sau rezumate ale incidentului). Evaluările derivate din incidente ar trebui create ca „teste de regresie”, pentru a ne asigura că modelele viitoare nu manifestă o predispoziție spre nealiniere în situații foarte similare.
Informarea publicului: Rezultatele investigației, analizele post-mortem și modificările operaționale ar trebui făcute publice după încheierea investigației. Terții afectați ar trebui informați cât mai curând posibil.


