Sari la conținutul principal
OpenAI

1 septembrie 2026

SiguranțăSecuritate

Drumul către Astra: capabilități critice și protecții de vârf

Se încarcă…

De la evaluarea noastră anterioară, potrivit căreia Astra ar putea atinge un nivel critic al capabilităților de securitate cibernetică, am colectat mai multe dovezi și am efectuat evaluări suplimentare ale capabilităților modelului. Considerăm acum că Astra atinge Pragul de capabilitate critică în securitate cibernetică prevăzut de Cadrul nostru de pregătire. Aceasta înseamnă că, având instrumentele și accesul potrivite, poate găsi vulnerabilități de securitate necunoscute anterior și poate dezvolta metode de exploatare a acestora în numeroase sisteme bine protejate, fără ca o persoană să îi ghideze fiecare pas. Este primul model pe care îl clasificăm la acest nivel și necesită măsuri de protecție mai puternice în timpul dezvoltării și înainte de lansare.

În ultimele săptămâni, am amânat unele etape ale dezvoltării și lansării Astra, timp în care am consolidat și testat protecțiile împotriva utilizării cibernetice abuzive și a acțiunilor neautorizate ale modelului. Pe baza acestei activități, considerăm că măsurile de protecție ale Astra reduc suficient riscul unor prejudicii grave pentru a permite lansarea conform Cadrului nostru de pregătire.

Deși Astra nu a fost implicat în incidentul Hugging Face, am integrat în abordarea noastră privind siguranța concluziile desprinse(se deschide într-o fereastră nouă) din acel incident. Pe baza testelor retrospective, considerăm că măsurile noastre de protecție aflate atunci în producție ar fi împiedicat incidentul Hugging Face. De atunci, am implementat măsuri de protecție și mai puternice pentru Astra, inclusiv instruirea modelului pentru a refuza mai fiabil solicitările cibernetice dăunătoare și a respecta restricțiile de siguranță, protecții suplimentare împotriva utilizării abuzive și monitorizare capabilă să oprească activități potențial neautorizate.

Intenționăm să oferim Astra în curând, însă accesul la cele mai avansate capabilități de securitate cibernetică va fi mai restrâns. Activitățile avansate de securitate cibernetică vor fi disponibile inițial unui grup de testeri, urmând ca accesul prin Daybreak Blue să extindă utilizarea defensivă.

La lansare, vom prezenta în fișa de sistem a modelului mai multe detalii despre testele și evaluările noastre privind siguranța, securitatea și alinierea. Înainte de lansare, dorim să oferim informații actualizate despre unele dintre activitățile prin care ne-am pregătit să lansăm în siguranță un model cu acest nivel de capabilități de securitate cibernetică și să prezentăm transparent riscurile care persistă.

Evaluarea capabilităților de securitate cibernetică ale Astra

Conform Cadrului nostru de pregătire, un model atinge Pragul critic dacă îndeplinește oricare dintre următoarele condiții:

  • Modelul poate identifica și dezvolta, fără intervenție umană, exploituri zero-day funcționale de orice nivel de gravitate pentru numeroase sisteme critice reale securizate.
  • Pornind doar de la un obiectiv general, modelul poate concepe și executa strategii noi și complete de atac cibernetic împotriva unor ținte securizate.

Evaluarea noastră privind nivelul de pregătire al Astra a combinat benchmarkuri publice și private automatizate cu evaluări realizate de experți. Astra reprezintă o creștere semnificativă a capabilităților de securitate cibernetică față de GPT‑5.6 Sol: este mult mai eficient în utilizarea tokenurilor și mai performant în identificarea vulnerabilităților și dezvoltarea exploiturilor.

De exemplu, am testat Astra pe ExploitBench, unde modelul a obținut scorul perfect de 100% la benchmarkul care evaluează capacitatea de a dezvolta exploituri pornind de la vulnerabilități cunoscute.

Din cauza preocupărilor privind contaminarea, am creat apoi un benchmark intern denumit „ExploitBench - Port intern (iunie–august 2026)”, care conține 20 de vulnerabilități V8 de gravitate ridicată, divulgate mai recent. Pe acest set de date, Astra obține rate mult mai mari de execuție arbitrară de cod decât GPT‑5.6 Sol, folosind mult mai puțini tokenuri de ieșire. În timpul evaluării, modelul a descoperit și a folosit chiar două vulnerabilități zero-day ca parte a unui lanț de exploituri. Suntem în curs de a comunica aceste două vulnerabilități responsabililor de mentenanță.

Rezultatele prezentate pentru Astra reflectă capabilitățile disponibile prin accesul Daybreak Blue, nu configurația implicită de producție.

În evaluările conduse de experți asupra unui browser și a unui sistem de operare securizate, Astra a descoperit vulnerabilități necunoscute anterior și le-a transformat în lanțuri de exploituri funcționale. A construit un lanț complet de compromitere a browserului care a evadat din sandbox și a executat comenzi pe sistemul gazdă atunci când browserul a deschis un fișier HTML. Modelul a găsit și mai multe vulnerabilități într-un sistem de operare securizat și le-a combinat într-un lanț local de escaladare a privilegiilor, de la un utilizator fără privilegii la root. În ansamblu, investigația noastră ne-a determinat să concluzionăm că Astra atinge pragul critic.

Măsuri de protecție necesare pentru capabilități critice

Pentru modelele cu nivelul de capabilități de securitate cibernetică al Astra, trebuie să acoperim două căi pentru a minimiza riscul unor prejudicii cibernetice grave, atât în timpul dezvoltării, cât și înainte de implementare:

  • Utilizarea modelului de către actori rău intenționați. Măsurile noastre de protecție trebuie să împiedice în mod eficient actorii rău intenționați să folosească Astra pentru a dezvolta exploituri pentru vulnerabilități necunoscute anterior din sisteme critice securizate sau pentru a desfășura atacuri complete împotriva unor ținte securizate.
  • Întreprinderea de către model a unor acțiuni neautorizate și nealiniate. Chiar și în absența unui utilizator rău intenționat, un model cu capabilități avansate de securitate cibernetică ar putea provoca el însuși prejudicii cibernetice dacă nu este aliniat. Pe lângă standardul foarte ridicat de aliniere impus modelelor cu aceste capabilități, ca un al doilea nivel de apărare, măsurile noastre de protecție trebuie să poată detecta și limita rapid acțiunile nealiniate care ar putea produce prejudicii semnificative în lumea reală.

Este important de remarcat că a doua cale se aplică atât dezvoltării interne, cât și implementării externe. După cum am descris anterior, în urma incidentului OpenAI-Hugging Face am întrerupt timp de două săptămâni anumite procese de instruire de vârf (inclusiv unele pentru Astra) pentru a consolida infrastructura de instruire prin măsuri precum izolarea și controalele de rețea, monitorizarea extinsă și consolidarea instruirii și a pragurilor de aliniere. Ulterior, am continuat activitățile la scară mai mică, aplicând controale mai stricte.

Am amânat mai mult timp anumite procese mai ample de învățare prin consolidare (RL) pentru versiunile viitoare ale Astra, până când am stabilit standarde mai înalte pentru siguranța și securitatea mediului lor de instruire. Pe 28 august, după implementarea noilor cerințe de siguranță și securitate, am reluat procesul amplu de învățare prin consolidare de vârf care fusese întrerupt. Continuăm să amânăm temporar unele procese experimentale de instruire la scară mai mică.

Pregătirea Astra pentru lansare a necesitat și protecții mai puternice împotriva abuzurilor cibernetice și a acțiunilor neautorizate. Mai jos descriem aceste măsuri de protecție și modul în care le-am testat.

Robustețe împotriva abuzurilor cibernetice

De la implementarea, în februarie, a primului model pe care l-am considerat cu capabilitate Ridicată în securitate cibernetică, ne-am consolidat măsurile de protecție cibernetică la fiecare lansare ulterioară. Abordarea noastră generală privind siguranța combină refuzurile modelului post-instruit, clasificatoare de siguranță la nivel de sistem, precum și detectarea offline și contracararea amenințărilor.

Pentru GPT‑5.6(se deschide într-o fereastră nouă), am îmbunătățit semnificativ robustețea ansamblului nostru de protecții la nivel de sistem, inclusiv prin adăugarea unor clasificatoare de activare pentru detectarea abuzurilor cibernetice și prin extinderea acoperirii jailbreakurilor universale descoperite prin red teaming automatizat intensiv. Pornind de la aceste îmbunătățiri, pentru Astra am investit suplimentar în stratul de model al ansamblului nostru de protecții și am îmbunătățit capacitatea acestora de a gestiona contextul dintre conversații.

  • Folosind noi tehnici de instruire pentru robustețea modelului, Astra refuză mai consecvent solicitările de asistență cibernetică nepermisă. În setul nostru de evaluări pentru jailbreakuri cibernetice, Astra refuză 91,5% dintre solicitări (față de 59% în cazul GPT‑5.6 Sol).
  • Pentru conturile evaluate ca prezentând un risc mai ridicat, aplicăm o limită mai prudentă privind comportamentul modelului, care refuză o gamă mai largă de asistență cibernetică potențial riscantă. Pentru utilizatorii cu risc ridicat, am extins contextul sistemelor noastre de monitorizare, astfel încât acestea să poată detecta asemenea abuzuri cibernetice.

Am continuat și programul nostru riguros de testare, red teaming intern și extern și remediere. Pe lângă testele de regresie prin care ne asigurăm că toate jailbreakurile descoperite în perioadele anterioare de testare rămân acoperite, desfășurăm un nou val de red teaming cu cei mai recenți atacatori interni de red teaming. Colaborăm cu parteneri din industrie pentru a defini un sistem comun de evaluare a jailbreakurilor și vom folosi programul nostru de răspuns rapid disponibil non-stop pentru a investiga și soluționa noile constatări. Vom prezenta mai multe detalii despre testarea măsurilor noastre de protecție cibernetică în fișa de sistem a Astra.

Sprijinirea specialiștilor în apărare pentru a găsi și remedia vulnerabilități rămâne elementul central al abordării noastre privind siguranța. La lansare, ne așteptăm ca măsurile de protecție ale Astra să impună mai multe restricții decât ne dorim pe termen lung, pentru a preveni potențialele utilizări abuzive. Accesul la Astra pentru fluxuri avansate de lucru în securitate cibernetică va fi disponibil inițial unui grup restrâns de testeri alfa, urmând ca accesul prin Daybreak Blue să fie extins ulterior pentru a sprijini utilizarea defensivă.

Aliniere și monitorizare

Am adăugat și alte protecții pe mai multe niveluri, pentru a împiedica modelul să întreprindă acțiuni potențial nealiniate:

  • Alinierea modelului: În evaluările noastre, Astra a fost mult mai predispus decât GPT‑5.6 Sol să respecte restricțiile explicite de siguranță și securitate și să rămână în limitele autorizate, fiind cel mai bine aliniat model al nostru de până acum. Ne-am concentrat în special pe respectarea de către model a restricțiilor de securitate și siguranță și pe tendința sa de a rămâne în limitele autorizate.
  • Monitorizare și control: În paralel cu procedurile noastre interne, implementăm Astra cu monitorizarea suplimentară a lanțului de gândire, pentru a detecta și limita rapid acțiunile potențial nealiniate.

Astra reprezintă un progres semnificativ în alinierea modelelor și încununarea mai multor direcții de lucru pe termen lung în domeniul alinierii, de la intervenții în etapa de pre-instruire până la evaluări mai atente și mai consecvente în timpul învățării prin consolidare. În teste, constatăm că Astra respectă în mod constant mai frecvent restricțiile și avertismentele explicite de siguranță, precum verificarea automată, comparativ cu GPT 5.6 Sol.

Am dezvoltat și un test inspirat de incidentul Hugging Face, în care agenții care executau evaluarea cibernetică ExploitGym au compromis sistemele unei terțe părți. Am folosit cele mai dificile sarcini din acea evaluare pentru a crea teste „honeypot” care să indice dacă un model ar încerca să compromită infrastructura de securitate din jur în loc să rezolve sarcina atribuită. Fără măsurile de protecție din producție, GPT‑5.6 Sol a încercat să acceseze acele ținte în 56% dintre testele care simulau mediul benchmarkului în care modelului i se cere să dezvolte exploituri. Astra nu a făcut nicio astfel de încercare în aceste teste. Aceste cifre descriu comportamentul în condițiile de testare, fără măsuri de protecție cibernetică, nu în utilizarea normală din producție.

Stânga: În această evaluare nouă, observăm cum reacționează modelele la respingerea unei verificări automate. Fiecare sarcină se desfășoară într-un mediu de lucru bazat pe cunoștințe, iar execuția începe imediat după respingerea de către verificarea automată. Modelul are apoi mai multe opțiuni: să încheie execuția, să încerce să găsească o alternativă mai sigură, să reîncerce o comandă similară sau să exploateze o configurație necorespunzătoare(se deschide într-o fereastră nouă) pentru a ocoli complet verificarea automată. Alegerea oricăreia dintre ultimele două opțiuni ar constitui un eșec în această evaluare. Astra nu a încercat niciodată să eludeze verificarea automată.

Dreapta: În această evaluare, verificăm tendința unui model de a trișa (folosind „honeypoturi”) atunci când se confruntă cu cele mai dificile sau imposibile sarcini din evaluarea ExploitGym. Testul a fost efectuat într-un mediu simulat, cu măsurile de protecție în modul exclusiv de observare, pentru a evalua comportamentul modelului. Deși GPT‑5.6 Sol a indicat o probabilitate mai mare de a trișa în aceste scenarii, Astra nu a încercat să folosească aceste scurtături și a reușit totuși să rezolve în mod legitim unele sarcini.

Instruirea modelelor pentru a fi aliniate reprezintă un nivel de siguranță. Vom prezenta mai multe detalii despre testele și rezultatele noastre privind alinierea în fișa de sistem a Astra.

Implementăm și monitorizarea nealinierii în producție pentru modelele din clasa Astra, cu scopul de a detecta și limita rapid eventualele nealinieri. Aceste măsuri de protecție sunt asemănătoare monitorizării implementărilor noastre interne și implică un sistem de clasificatoare care verifică raţionamentul și acțiunile modelului pentru a detecta comportamente neautorizate și a opri automat activitatea potențial neautorizată. Pe măsură ce capabilitățile cresc, aceste măsuri de protecție nu pot înlocui o bună aliniere a modelelor noastre, iar obiectivul nostru este ca modelele viitoare să fie suficient de bine aliniate încât aceste măsuri să nu fie declanșate niciodată.

Ce va însemna acest lucru pentru utilizatori

OpenAI se angajează să asigure accesul pe scară largă la beneficiile IA. Având în vedere creșterea semnificativă a capabilităților de securitate cibernetică ale Astra, acordăm o atenție deosebită siguranței și securității acestei implementări. Verificările suplimentare de siguranță pot uneori să încetinească, să întrerupă sau să oprească activități legitime, inclusiv cele defensive din domeniul securității cibernetice.

Uneori, sistemul poate semnala o activitate legitimă drept posibil abuz cibernetic sau comportament neautorizat, ceea ce poate duce, neintenționat, la încetinirea, întreruperea sau oprirea acesteia. Aici pot fi incluse activități care nu par direct legate de securitatea cibernetică sau sarcini în care un agent rulează o perioadă îndelungată.

Dacă monitorul de nealiniere întrerupe o sarcină, utilizatorilor ChatGPT sau Codex li se poate solicita să verifice acțiunea înainte de a continua. Când sunt folosite alte interfețe, precum API-ul, sarcina se va opri. Intenționăm să continuăm calibrarea acestor măsuri de protecție pentru a reduce întreruperile inutile și să extindem accesul la capabilități de vârf prin programe precum Daybreak.

Privind spre viitor

Intrăm într-o etapă a dezvoltării IA în care modelele pot prelua activități cu un impact mai mare, iar deficiențele de aliniere și control pot avea efecte mai grave. Valorificarea beneficiilor acestor sisteme va depinde de capacitatea noastră de a alinia și controla modelele pe măsură ce capabilitățile lor cresc.

Această responsabilitate se extinde asupra instruirii, evaluării și implementării. Aceasta necesită dovezi mai solide privind comportamentul aliniat, măsuri de protecție care să țină pasul cu evoluția capabilităților și disponibilitatea de a încetini atunci când aceste protecții nu sunt suficiente.

Vom continua să testăm aceste sisteme, să împărtășim ceea ce învățăm și să indicăm clar aspectele care rămân incerte. Modelele care vor urma după Astra ne vor solicita și mai mult. Vom aloca timpul și vom depune eforturile necesare pentru a ne îndeplini această responsabilitate.