Sari la conținutul principal
OpenAI

22 septembrie 2026

Siguranță

Priorități și principii pentru evaluări terțe eficiente

Se încarcă…

Laboratoarele de IA de vârf au o responsabilitate enormă de a antrena, evalua și implementa modelele în siguranță. Evaluările realizate de terți sunt esențiale pentru echilibrarea acestei responsabilități, extinderea posibilităților de contribuție la siguranța IA, informarea publicului și responsabilizarea laboratoarelor în raport cu afirmații clare privind siguranța, susținute independent.

Ca parte a eforturilor noastre de a ține pasul cu progresul tehnologic de vârf, OpenAI se angajează să sprijine evaluările independente printr-un acces aprofundat la procesele de antrenare, evaluare și implementare. Acest acces ar trebui să le permită evaluatorilor să ne conteste ipotezele, să identifice riscurile pe care este posibil să le fi omis și să formuleze propriile concluzii despre eficacitatea măsurilor noastre de protecție.

Colaborăm de mult timp cu evaluatori terți în diferite etape ale procesului de dezvoltare și implementare a modelelor. De asemenea, am integrat evaluările realizate de terți în practicile prevăzute de Cadrul de pregătire și am sprijinit organizații și acte legislative care promovează un proces mai riguros și mai responsabil. Pe parcursul acestor colaborări, am oferit forme aprofundate de acces, inclusiv la informații despre măsurile noastre tehnice de protecție, la lanțul de gândire vizibil, precum și niveluri fără precedent de acces confidențial la date și la implementări interne pentru răspunsul la incidente și red teaming al sistemelor de monitorizare. Prioritățile și principiile prezentate aici vizează colaborarea noastră cu organizații independente de evaluare din sectorul privat și nonprofit în privința evaluărilor tehnice de siguranță. Acestea completează colaborarea noastră cu guvernele în domeniul testării și evaluării, unde rolurile și responsabilitățile distincte pot impune abordări diferite.

Pentru ca aceste evaluări să fie eficiente, sunt necesare mecanisme solide de independență, rigoare științifică, practici robuste de securitate și responsabilități clare. Laboratoarele au responsabilitatea de a permite o examinare relevantă, protejând totodată informațiile sensibile. Laboratoarele și evaluatorii independenți împart responsabilitatea de a asigura buna desfășurare a acestui proces și ar trebui să opereze pe baza unor standarde internaționale comune pentru practicile de siguranță și securitate. Mai jos propunem patru domenii prioritare pentru evaluări aprofundate, alături de principii pentru o activitate riguroasă, sigură și independentă.

Domenii prioritare pentru evaluare

Evaluările realizate de terți sunt cele mai utile atunci când abordează întrebări concrete și importante: Susțin dovezile argumentul de siguranță și afirmațiile privind siguranța formulate de un laborator? Testează evaluările în mod adecvat riscurile pe care urmăresc să le măsoare? Funcționează măsurile de protecție în condiții realiste?

Evaluările descrise aici sunt menite să ia forme diferite, în funcție de problemele de siguranță examinate. Preconizăm că vom sprijini mai multe evaluări în paralel și pe perioade diferite, unele desfășurându-se pe parcursul câtorva săptămâni, iar altele timp de mai multe luni. Deși evaluările realizate de terți pot face parte și din activitățile premergătoare implementării și pot fundamenta deciziile de implementare, activitatea descrisă aici este, în general, pe termen mai lung și independentă de lansări, concentrându-se asupra examinării aprofundate în timp a anumitor afirmații privind siguranța.

În domeniile și principiile noastre prioritare, facem referire la afirmații privind siguranța și la argumente de siguranță. Prin acești termeni înțelegem următoarele:

Afirmație privind siguranța: O afirmație concretă despre capabilitățile, comportamentul sau măsurile de protecție ale unui model ori sistem, relevantă pentru siguranța acestuia și care poate fi evaluată pe baza dovezilor. O afirmație ar trebui să precizeze riscurile și condițiile pe care le vizează, precum și ipotezele și limitările relevante.

Argument de siguranță: Un argument structurat și susținut de dovezi, care explică de ce riscurile unui model sau sistem sunt gestionate adecvat pentru o anumită activitate, precum antrenarea, evaluarea sau implementarea. Un argument de siguranță corelează afirmațiile individuale privind siguranța cu dovezile care le susțin și prezintă explicit ipotezele, incertitudinile și riscurile rămase care i-ar putea influența concluziile.

Propunem patru domenii prioritare pentru evaluări aprofundate, alături de principii pentru o activitate riguroasă, sigură și independentă.

  1. Evaluarea independentă a argumentelor de siguranță pentru antrenare, evaluare, implementare internă și implementare externă.

    Evaluarea argumentelor de siguranță necesită expertiză în aliniere, metode de control precum monitorizarea, securitate cibernetică, utilizare abuzivă în domeniile biologic și chimic și red teaming. Argumentele de siguranță cuprind afirmații despre antrenare, evaluarea capabilităților și măsurile de protecție, care pot fi evaluate integral sau separat (consultați prioritățile 2 și 3 de mai jos). Probabil că va fi necesar ca mai mulți evaluatori să examineze părți diferite ale argumentelor, valorificându-și expertiza specifică. Împreună, evaluările lor ar trebui să răspundă unor întrebări precum:

    1. Sunt fundamentate dovezile argumentelor de siguranță pentru antrenare, evaluare și implementări? Au fost respectate condițiile argumentului de siguranță în timpul antrenării, evaluării și implementării?

    2. Acoperă argumentele noastre de siguranță cele mai urgente riscuri identificate în cursul unei evaluări? Susțin afirmațiile privind siguranța argumentul general de siguranță? Există deficiențe sau aspecte care pot fi îmbunătățite?

    3. Sunt utilizate metode eficiente pentru a identifica și reduce stimulentele din procesul de antrenare care ar putea recompensa înșelăciunea, exploatarea recompensei, acțiunile distructive sau eludarea restricțiilor?

  2. Evaluarea măsurilor de protecție esențiale în implementările interne și externe

    Ansamblul nostru de măsuri de protecție evoluează permanent pentru a ține pasul cu schimbările capabilităților și ale contextului. Măsurile noastre de protecție acoperă antrenarea, implementarea internă și implementarea externă. În prezent, acestea includ măsuri de protecție la nivel de model, măsuri pentru asigurarea respectării regulilor și măsuri de securitate, precum și sisteme de monitorizare a nealinierii, acoperind o gamă largă de riscuri, precum pierderea controlului și utilizarea abuzivă asociată riscurilor cibernetice, biologice și chimice. Parteneriatele tehnice pot identifica acum deficiențele măsurilor de protecție, îmbunătățind totodată metodele de evaluare și accelerând elaborarea standardelor. Astfel, ele oferă o bază tehnică mai solidă pentru viitoarele politici publice menite să țină pasul cu progresul tehnologic de vârf, în special în cazul implementărilor interne, unde standardele de siguranță și securitate sunt încă incipiente.

    Evaluările independente ar trebui să examineze cât de bine funcționează aceste măsuri de protecție și unde ar putea avea deficiențe, de exemplu:

    1. Atunci când se utilizează acces de tip „cutie gri”, sunt măsurile de protecție rezistente la testarea adversarială (jailbreakuri) și protejează ele suficient împotriva amplificării capabilităților în domenii cu risc ridicat (de exemplu, cibernetic și biologic)? Acoperă testarea noastră adversarială și activitățile de red teaming cele mai importante riscuri?

    2. În cadrul testării autorizate în condiții realiste de funcționare, cum interacționează agenții cu mecanismele cibernetice de apărare, precum controlul accesului, izolarea în medii sandbox și sistemele de detectare și răspuns? Ce mecanisme de apărare previn, detectează sau limitează acțiunile dăunătoare și unde eșuează acestea?

    3. Prezintă sistemele noastre de monitorizare a nealinierii deficiențe critice care ar putea duce la pierderea controlului sau la o nealiniere gravă, atât în implementările interne, cât și în cele externe? Cât de fiabilă este monitorizarea lanțului de gândire ca sursă de dovezi privind siguranța sau alinierea, pe măsură ce capabilitățile modelelor se îmbunătățesc?

    4. Este implementată o monitorizare adecvată în toate procesele relevante de antrenare, evaluare și implementare, astfel încât să nu poată fi dezactivată cu ușurință?

    5. Sunt implementate măsuri de protecție proporționale cu capabilitățile?

  3. Evaluarea capabilităților care acoperă categoriile de risc din cadrul Pregătirii (riscuri chimice și biologice, securitate cibernetică, autoîmbunătățirea IA), precum și evaluări ale alinierii pentru riscurile de nealiniere

    Cadrul nostru de pregătire impune evaluări ale principalelor domenii de risc de frontieră. Pe măsură ce pragurile sunt depășite și evaluările se saturează, este important să actualizăm constant și să asigurăm acoperirea și calitatea evaluărilor capabilităților din domeniile de risc ale Pregătirii, precum și ale evaluărilor de aliniere care urmăresc să măsoare riscurile de nealiniere gravă.

    Printre întrebările relevante se numără:

    1. Evaluările riscurilor din cadrul Pregătirii acoperă în mod adecvat definiția pragului de risc al Pregătirii? Sunt stabilite corect pragurile pentru aceste evaluări?

    2. Sunt actualizate evaluările atunci când modelele obțin constant cele mai mari scoruri și măsoară noile teste în mod relevant capabilități mai avansate?

    3. Acoperă evaluările noastre de aliniere în mod adecvat riscurile de nealiniere gravă și ce comportamente sau condiții importante ar putea omite?

  4. Investigarea independentă a incidentelor critice de nealiniere

    Investigațiile independente pot fi valoroase pentru o gamă largă de incidente critice privind siguranța IA. Aici ne concentrăm asupra nealinierii modelelor, inclusiv asupra situațiilor în care acestea acționează fără autorizare sau evită supravegherea, ceea ce poate dezvălui deficiențe ale metodelor de aliniere și ale măsurilor de protecție chiar și în absența utilizării abuzive intenționate.

    În anumite situații, precum incidentul OpenAI Hugging Face, poate fi utilă implicarea unui terț independent pentru investigarea independentă a incidentelor de nealiniere. Este esențial ca terții implicați în investigarea incidentelor să dispună de expertiza necesară, inclusiv, după caz, de expertiză în criminalistică cibernetică și aliniere, de capacitatea de a analiza la scară largă lanțuri de gândire și de personalul și resursele necesare pentru a desfășura investigația în timp util. Răspunsul la incidente poate presupune accesul la date interne sensibile și la date ale terților; prin urmare, publicarea sau accesarea anumitor detalii poate prezenta riscuri. Constatările investigațiilor independente pot contribui și la argumentul de siguranță al unui model, oferind dovezi pentru evaluarea afirmațiilor privind alinierea sa și eficacitatea măsurilor luate pentru remedierea nealinierii observate anterior.

    În contextul incidentelor de nealiniere, acordăm prioritate evaluărilor independente privind:

    1. Ce comportamente ale modelului sau probleme de nealiniere au apărut în cursul incidentului și care sunt principalii factori care au contribuit la acestea?

    2. Ar reduce eficient măsurile de protecție și remediere riscul unor incidente similare în viitor?

Principii pentru evaluări eficiente

  • Afirmații clar delimitate și convenite de comun acord pentru evaluare: Evaluările ar trebui să înceapă cu stabilirea de comun acord a domeniului de aplicare, urmată de definirea clară și înregistrarea prealabilă a afirmațiilor privind siguranța, înainte de începerea activităților de evaluare. Terții și laboratoarele ar trebui să clarifice dacă este vorba despre afirmații pe care compania evaluată dorește să le supună evaluării sau despre afirmații pe care evaluatorul terț urmărește să le evalueze independent și în raport cu care laboratorul acceptă să fie evaluat. Unele afirmații pot fi în afara domeniului de aplicare din numeroase motive, inclusiv imposibilitatea terților de a accesa datele, expertiza insuficientă a evaluatorului sau constrângeri de timp rezonabile atunci când evaluarea este urgentă. Laboratoarele și evaluatorii ar trebui să stabilească un proces pentru analizarea riscurilor semnificative identificate în afara domeniului inițial, inclusiv pentru a decide dacă se justifică investigații suplimentare. Concluziile ar trebui să precizeze clar ce a fost și ce nu a fost evaluat în raport cu domeniul convenit de comun acord.

  • Acces proporțional: Atunci când este posibil, evaluatorii ar trebui să beneficieze de un acces proporțional pentru evaluarea afirmațiilor convenite, în limitele impuse de cerințele juridice, de securitate și de proprietate intelectuală. Atunci când accesul direct nu este practic sau posibil, evaluatorii pot colabora cu un reprezentant desemnat al companiei ori pot analiza mecanisme de acces indirect sau care protejează confidențialitatea, pentru a proteja informațiile de bază.

  • Metodologie și standarde transparente: Evaluatorii ar trebui să își explice metodele, criteriile de evaluare și incertitudinile, folosind standardele consacrate acolo unde acestea există. Acolo unde încă nu există standarde, evaluatorii ar trebui să justifice clar criteriile utilizate. Rapoartele ar trebui să distingă constatările directe de interpretări, să explice incertitudinile și să indice clar ce concluzii sunt susținute de dovezi.

  • Expertiză și independență: Evaluatorii ar trebui să demonstreze că dețin expertiza tehnică relevantă și să identifice, să declare și să gestioneze conflictele de interese organizaționale și individuale, inclusiv stimulentele financiare, relațiile cu dezvoltatorii și implicarea anterioară în activitatea evaluată. Măsurile de protecție ar trebui concepute astfel încât presiunile comerciale și sistemele de remunerare să nu influențeze constatările și pot include recuzarea sau perioade adecvate de excludere.

  • Securitate și confidențialitate: Evaluatorii ar trebui să demonstreze că aplică practici de securitate a informațiilor și mecanisme executorii de protejare a confidențialității care acoperă personalul propriu și sunt proporționale cu caracterul sensibil al sistemelor și informațiilor accesate. Aceste măsuri de protecție ar trebui să acopere proprietatea intelectuală, informațiile sensibile și evidențele evaluărilor. Atunci când evaluatorii nu pot îndeplini cerințele de securitate în propriile medii sau când datele accesate sunt deosebit de sensibile, poate fi adecvat accesul prin dispozitive gestionate de companie sau în spațiile acesteia.

  • Constatări aplicabile și timp pentru remediere: Evaluările ar trebui să identifice deficiențe concrete și să ofere suficiente detalii pentru ca laboratoarele să le poată remedia. Atunci când este cazul, laboratoarele ar trebui să beneficieze de un interval rezonabil pentru remedierea problemelor înainte de publicare. Acolo unde este relevant, rapoartele ar trebui să prezinte și concluziile utile dezvoltatorilor, operatorilor și apărătorilor de agenți, împreună cu recomandări practice de implementare.

  • Practici responsabile de publicare: Rapoartele de evaluare ar trebui să se bazeze pe dovezi și să fie distribuite cât mai deschis posibil, protejând totodată informațiile sensibile și confidențiale. Atunci când divulgarea publică integrală nu este posibilă, raportarea confidențială către organismele de supraveghere competente, precum structurile de guvernanță sau consiliile de administrație ale companiilor, poate sprijini asumarea răspunderii. Pentru a păstra echilibrul dintre independență și confidențialitate, ar trebui să existe măsuri și politici fundamentate pentru ocultarea informațiilor, precum și așteptări clare privind feedbackul și corectarea inexactităților. Evaluatorii ar trebui să își păstreze independența editorială, asigurând totodată respectarea măsurilor de protejare a confidențialității și a proprietății intelectuale. Evaluatorii ar trebui să adopte politici clare de ocultare, care să le permită laboratoarelor să solicite eliminarea informațiilor sensibile, iar evaluatorilor să indice unde au fost făcute eliminări substanțiale și ce impact au acestea asupra raportului de evaluare.

Pașii următori

Ne angajăm să sprijinim evaluatorii independenți și să stabilim standarde internaționale comune mai clare, atât prin viitoare legi, cât și prin instituții private de guvernanță, pentru evaluări eficiente realizate de terți. Deși ecosistemul evaluării independente este încă în dezvoltare, vom contribui la creșterea sa sprijinind și colaborând cu o comunitate diversă de evaluatori independenți, cu expertiză aprofundată în problemele de siguranță ale sistemelor de vârf. Niciun terț nu poate și nu ar trebui să acopere exhaustiv problemele urgente privind siguranța sistemelor de vârf. Vom acționa chibzuit și deliberat pentru a ne dezvolta capacitatea și a ajuta ecosistemul terților, aflat în creștere, să se alinieze la cele mai bune practici și principii. Discutăm cu mai mulți terți despre propuneri aliniate domeniilor prioritare de mai sus.