Sari la conținutul principal
OpenAI

16 septembrie 2026

CercetareSiguranță

Cadrul nostru de raportare a nealinierii modelelor

Se încarcă…

Prezentăm un nou cadru OpenAI pentru urmărirea, investigarea și divulgarea cazurilor de nealiniere a modelelor, precum și șase rapoarte despre comportamente neașteptate sau îngrijorătoare ale modelelor, observate în ultimele șase luni.

În trecut, pentru a informa mai bine cercetătorii, dezvoltatorii de IA, factorii de decizie și publicul larg, am încercat să facem publice constatările noastre despre nealiniere. Însă, în lipsa unei abordări sistematice pentru raportarea acestor constatări, divulgările noastre au fost punctuale și mai rare decât ne-am fi dorit: de multe ori, am așteptat până când am putut reuni mai multe cazuri într-un singur raport sau le-am adăugat în fișele de sistem ale modelelor nou-lansate. Acest nou cadru urmărește să accelereze publicarea rapoartelor de nealiniere după observarea unui caz, chiar dacă nu am explicat sau remediat pe deplin comportamentul raportat.

Pe măsură ce sistemele de IA devin mai avansate și sunt implementate pe scară mai largă, trebuie să construim un consens mai amplu și mai bine fundamentat privind progresele cercetării în domeniul alinierii. Nu considerăm că domeniul IA a soluționat alinierea și monitorizarea într-o măsură suficientă pentru a continua mult timp extinderea responsabilă la viteză maximă. Deciziile privind direcția dezvoltării IA în lunile și anii următori trebuie să se bazeze pe dovezi pe care persoanele din afara companiilor care dezvoltă modele de vârf să le poată examina direct.

Exemplele de nealiniere pot ajuta la identificarea problemelor cu care s-ar putea confrunta alți dezvoltatori de IA când sistemele lor ating capabilități similare, pot dezvălui deficiențe ale măsurilor de protecție sau pot pune sub semnul întrebării presupunerile despre comportamentul modelelor. Publicarea acestor constatări le permite și altora să investigheze aceleași probleme, să ne verifice explicațiile și să îmbunătățească măsurile de atenuare. Deoarece credem în valoarea transparenței cu privire la nealiniere, noul nostru cadru favorizează divulgarea chiar și atunci când relevanța este incertă. Aceasta înseamnă că unele dintre cazurile divulgate s-ar putea dovedi neconcludente, fără a face parte dintr-un tipar mai amplu sau a sugera evoluții viitoare.

În prezent, nu există un cadru la nivelul întregului sector, cu standarde explicite privind modul în care dezvoltatorii de IA ar trebui să divulge exemplele de nealiniere ale modelelor lor. Sperăm că acest cadru prezentat astăzi va fi un prim pas către crearea unor astfel de standarde, stabilind ce cazuri de nealiniere ar trebui să divulge dezvoltatorii și ce ar trebui să conțină rapoartele lor. Considerăm că acest cadru este în curs de elaborare și îl vom îmbunătăți pe baza experienței și a feedbackului public.

În continuare, descriem modul de funcționare a cadrului și prezentăm primele rapoarte pe care le publicăm.

Ce exemple de nealiniere vom raporta

Ne propunem să divulgăm exemple care oferă dovezi utile despre cum apare și cum se manifestă nealinierea modelelor și despre situațiile în care măsurile de protecție reușesc sau eșuează. Acordăm prioritate mecanismelor noi, schimbărilor semnificative ale comportamentelor cunoscute și constatărilor care pun sub semnul întrebării presupunerile privind siguranța sau atenuarea riscurilor. Un exemplu nu trebuie să producă prejudicii sau să demonstreze existența unui tipar mai amplu pentru a merita divulgarea. Acest cadru va acoperi comportamentele eligibile pe parcursul întregului ciclu de viață al unui model, inclusiv instruirea, evaluarea, testarea și implementarea.

Includem aici noi modalități prin care modelele acționează fără autorizare, se coordonează cu alte modele sau evită supravegherea; deficiențe care pun sub semnul întrebării o metodă de aliniere ori o măsură de protecție; și comportamente care contrazic o afirmație dintr-o evaluare de siguranță publicată. Aceleași criterii de divulgare se aplică nealinierii care poate afecta terțe părți.

Pot fi incluse și cazuri de nealiniere care par să repete cazuri divulgate anterior. Repetarea problemei poate constitui ea însăși o dovadă utilă despre comportamentul modelelor noastre sau eficacitatea măsurilor de protecție, cum ar fi dacă un anumit tip de comportament nealiniat continuă să reapară în pofida eforturilor repetate de atenuare. În aceste situații, vom publica exemplele suplimentare actualizând divulgarea inițială privind nealinierea.

În timp, intenționăm să elaborăm criterii de divulgare mai obiective împreună cu alți dezvoltatori, cercetători externi, organisme de standardizare din domeniu și autorități de reglementare. De asemenea, credem că incidentele grave de siguranță, securitate și nealiniere ar trebui raportate guvernului federal al SUA și lucrăm la propunerea unor mecanisme de raportare. Considerăm că acest cadru completează obligațiile noastre existente și precizăm că nu înlocuiește cerințele legale de divulgare, inclusiv cele privind incidentele critice de siguranță sau breșele de securitate cibernetică.

Exemplele de nealiniere pe care le prezentăm astăzi

Pentru a inaugura noul nostru cadru de divulgare a nealinierii, publicăm șase rapoarte despre cazuri de comportament nealiniat observate în timpul instruirii sau evaluării modelelor noastre. Aceste cazuri ilustrează diverse comportamente pe care considerăm că merită să le facem cunoscute, de la ascunderea informațiilor față de utilizator până la acțiuni neautorizate pentru depășirea obstacolelor. Acestea sunt rapoarte despre cazuri individuale și nu ar trebui considerate reprezentative pentru frecvența nealinierii în rândul modelelor noastre. Fiecare element de mai jos include un link către raportul complet.

  1. Instrucțiuni autogenerate în rezumatele sarcinilor(se deschide într-o fereastră nouă). Un model de cercetare nelansat a inserat instrucțiuni fără legătură cu sarcina, inclusiv instrucțiuni de ignorare a constrângerilor sale obișnuite, în rezumatele folosite pentru a-și continua activitatea într-o nouă fereastră contextuală. Am identificat 27 de rezumate afectate.

  2. Instrucțiuni de ascundere a greșelilor în rezumatele sarcinilor(se deschide într-o fereastră nouă). În timpul instruirii GPT‑5.6 Sol, numeroase instanțe ale modelului au adăugat în rezumatele lor instrucțiuni pentru a ascunde față de utilizator greșelile sau comportamentul nealiniat. De exemplu, rezumatele de compactare includeau instrucțiuni de inventare a datelor istorice lipsă fără a dezvălui acest lucru și de ascundere a neconcordanțelor dintre versiunile surselor.

  3. Căutarea cheilor API expuse în depozite publice, urmată de fabricarea informațiilor(se deschide într-o fereastră nouă). În timp ce răspundea la o întrebare obișnuită despre veniturile dintr-un comitat din California, un model a găsit și folosit fără autorizare o cheie API expusă. Când tot nu a reușit să obțină cifrele solicitate, modelul le-a inventat și le-a prezentat drept date provenite din sursa cerută.

  4. Încărcarea fișierelor pe internet pentru a le cita(se deschide într-o fereastră nouă). Când un utilizator i-a solicitat unui model nelansat ID-urile și denumirile lacurilor mai mari de 5.000.000 de metri pătrați, agentul a găsit răspunsul corect folosind Python. Însă, deoarece instrucțiunile solicitau o citare din browser, agentul a decis să încarce fișierul pentru a-l putea cita în răspuns, fără să ceară acordul utilizatorului.

  5. Scrieri neautorizate și comunicare printr-un depozit software intern(se deschide într-o fereastră nouă). Modelele au folosit un depozit software intern drept panou de mesaje pentru a schimba solicitări și răspunsuri între eșantioane de instruire separate în timp ce căutau fișiere de intrare lipsă, fără a reuși însă să le recupereze. Raportul analizează și un caz anterior în care un model a încărcat cu succes fișiere de test într-un depozit în timp ce încerca să eludeze restricțiile de rețea.

  6. Partajarea neautorizată a fișierelor între agenți colaboratori(se deschide într-o fereastră nouă). Agenții care lucrau împreună la aceeași sarcină de antrenare au folosit site-uri publice de găzduire a fișierelor pentru a partaja fișiere atunci când nu puteau accesa fișierele locale ale celorlalți. Astfel, livrabilele sarcinii au devenit disponibile la adrese URL publice, deși sarcina le cerea modelelor să folosească numai fișiere locale.

Cum funcționează procesul nostru de divulgare

Orice angajat OpenAI poate semnala un exemplu de nealiniere pentru a fi investigat de echipele noastre de siguranță și aliniere și poate solicita luarea în considerare a divulgării publice. Astfel începe procesul nostru de divulgare, care prevede termene pentru fiecare etapă, pentru a asigura investigarea și divulgarea la timp.

După semnalarea unui exemplu, personalul nostru tehnic va investiga ce s-a întâmplat, ce aspecte rămân incerte, dacă divulgarea publică este justificată și ce fapte pot fi comunicate. De asemenea, va evalua dacă a fost afectată vreo terță parte și dacă aceasta trebuie notificată în privat înainte de publicare.

Exemplul va fi apoi repartizat pe unul dintre cele trei trasee: „Pregătit pentru divulgare”, „Investigație restrânsă” sau „Investigație amplă” („Traseul lent”).

Traseul „Pregătit pentru divulgare” acoperă cazurile eligibile a căror investigare este suficient de avansată pentru publicare după examinare. Traseul „Investigație restrânsă” acoperă cazurile care necesită investigații tehnice suplimentare. Ne așteptăm ca aceste două trasee să acopere marea majoritate a cazurilor divulgate, în special pe cele care nu necesită investigații ample, coordonare cu terțe părți sau gestionarea unor riscuri grave de utilizare abuzivă. Toate cazurile pe care le publicăm astăzi se încadrează în unul dintre aceste două trasee.

Traseul „Investigație amplă” acoperă investigațiile complexe, în special pe cele care implică terțe părți. Atunci când este afectată o terță parte, obligațiile noastre privind securitatea, aspectele juridice și divulgarea responsabilă au prioritate față de acest cadru. Vom încerca să publicăm o notificare inițială cât mai curând posibil, însă este posibil să fie nevoie să o amânăm din motive de securitate, cum ar fi dacă un model descoperă o vulnerabilitate necunoscută anterior într-un software utilizat pe scară largă. Dacă un raport ar permite identificarea unei terțe părți, intenționăm să o notificăm în prealabil chiar și atunci când nu a fost depășită nicio barieră de securitate.

Notificarea inițială privind un caz de „Investigație amplă” va prezenta la nivel general cele întâmplate, va preciza dacă experți externi contribuie la investigație și va oferi orice estimare disponibilă privind momentul publicării raportului final. Incidentul OpenAI de pe Hugging Face s-ar fi încadrat pe acest traseu dacă ar fi fost divulgat în baza acestui cadru.

Angajatul care a semnalat exemplul va fi informat referitor la decizia privind divulgarea acestuia și, dacă se aprobă divulgarea, despre traseul care va fi urmat. Dezacordurile nerezolvate privind divulgarea sau traseul adecvat îi vor fi înaintate Grupului consultativ pentru siguranță (SAG) al OpenAI, un grup de responsabili de rang înalt din întreaga companie care evaluează capabilitățile modelelor de vârf și măsurile de protecție, supraveghează Cadrul nostru de pregătire și consiliază conducerea OpenAI. Dezacordurile din cadrul SAG sau obiecțiile personalului față de deciziile sale îi vor fi înaintate conducerii OpenAI. Deciziile de a nu divulga un caz sau potrivit cărora divulgarea nu este justificată vor fi comunicate conducerii responsabile de siguranță și aliniere și, în măsura posibilului, personalului tehnic relevant.

Este posibil să revizuim acest proces de divulgare pe măsură ce vedem cum funcționează în practică și vom consemna în această postare orice modificare.

Ce va include fiecare raport

Fiecare raport complet va descrie comportamentul observat, gravitatea și eventualul impact extern al acestuia, contextul în care s-a produs, data sau intervalul de timp, momentul în care l-am descoperit și, la nivel general, modelul sau modelele implicate. Când este posibil, vom prezenta și:

  • Detalii suplimentare despre cele întâmplate și eventualele prejudicii rezultate;

  • Cum am descoperit nealinierea și amploarea investigației noastre;

  • Interpretarea noastră privind implicațiile pentru cercetarea în domeniul alinierii și siguranța tehnică a IA;

  • Întrebări importante rămase fără răspuns, ridicate de acest exemplu;

  • Măsurile pe care le luăm sau intenționăm să le luăm pentru a remedia comportamentul. Este posibil ca aceste informații să nu fie întotdeauna disponibile în momentul divulgării, deoarece este posibil să publicăm raportul de nealiniere înainte de finalizarea investigației sau de elaborarea unei soluții.

În cazul nealinierii apărute în implementările clienților, vom comunica toate informațiile permise de confidențialitatea clienților și de obligațiile noastre contractuale.

Rapoartele de astăzi reprezintă un set inițial de divulgări, nu o prezentare exhaustivă a cazurilor cunoscute de nealiniere sau a investigațiilor în curs. Aceste rapoarte inițiale nu sunt menite să reprezinte întreaga varietate sau gravitate a cazurilor acoperite de acest cadru. Ne angajăm să divulgăm cazurile de nealiniere care îndeplinesc criteriile acestui cadru, inclusiv cazurile mai complexe care necesită investigații mai îndelungate sau coordonare cu terțe părți. Vom continua să publicăm periodic rapoarte în baza acestui cadru și vom oferi mai multe informații despre angajamentele noastre de raportare pe măsură ce le dezvoltăm.

Autor

OpenAI