Sari la conținutul principal
OpenAI

3 septembrie 2026

Siguranță

Prezentare generală a siguranței: GPT‑6 Astra

Se încarcă…

Astăzi lansăm GPT‑6 Astra, cel mai capabil model pe care l-am implementat vreodată pe scară largă. Astra este primul nostru model care atinge nivelul Critic al capabilității de securitate cibernetică, conform Cadrului de pregătire.

Cele mai importante aspecte privind siguranța acestei lansări sunt următoarele:

  1. GPT‑6 Astra reprezintă un progres semnificativ în privința capabilităților cibernetice și atinge pragul nostru Critic. Aceasta înseamnă că, având instrumentele și accesul potrivite, GPT‑6 Astra poate identifica vulnerabilități de securitate necunoscute anterior și poate dezvolta noi modalități de a le exploata în numeroase sisteme bine protejate, fără ca o persoană să îi ghideze fiecare pas. Prin urmare, ne-am consolidat semnificativ măsurile de protecție împotriva acțiunilor cibernetice dăunătoare întreprinse de model, indiferent dacă acestea sunt cauzate de utilizarea abuzivă sau de alinierea necorespunzătoare. De asemenea, am luat măsuri pentru a securiza dezvoltarea și implementarea internă a Astra și a modelelor similare, inclusiv prin izolare mai strictă, criptarea punctelor de control, monitorizarea universală a traiectoriilor complete, inclusiv a lanțurilor de raţionament (CoT), și un proces de evaluare a alinierii care poate bloca utilizarea internă.
  2. GPT‑6 Astra este semnificativ mai robust decât modelele sale predecesoare. Prin integrarea unor noi tehnici de instruire pentru siguranță axate pe robustețe, GPT‑6 Astra este semnificativ mai rezistent la jailbreakuri decât GPT‑5.6 Sol, inclusiv pe parcursul unor traiectorii mai lungi. Știm acest lucru din testele offline și din programul nostru riguros de testare internă și externă a jailbreakurilor și de remediere a vulnerabilităților identificate. Pentru utilizatorii semnalați ca prezentând un risc potențial ridicat, am instruit suplimentar modelul să își poată ajusta limita de refuz, astfel încât aceasta să fie mai prudentă și să acopere o gamă mai largă de riscuri asociate utilizării duale. Folosim teste de regresie pentru a ne asigura că Astra este rezistent la jailbreakurile descoperite în perioadele de testare anterioare și am efectuat noi runde automatizate de red teaming, utilizând cei mai recenți atacatori interni de red teaming, pentru a ne valida îmbunătățirile.
  3. GPT‑6 Astra este mai bine aliniat decât GPT‑5.6 Sol. Astra reprezintă un progres semnificativ în alinierea modelelor și include îmbunătățiri care acoperă întregul proces, de la alcătuirea datelor de pre-instruire până la evaluarea din timpul învățării prin consolidare. Prezentăm o nouă suită de evaluări ale alinierii(se deschide într-o fereastră nouă) și constatăm că GPT‑6 Astra respectă mai bine limitele de siguranță și securitate și rămâne în sfera sa autorizată. Într-o simulare care a folosit peste 54.000 de sarcini Codex interne(se deschide într-o fereastră nouă), Astra a primit, de asemenea, de aproximativ două ori mai puține semnalări decât Sol pentru comportamente nealiniate de gravitate mai mare.
  4. Implementăm pe scară largă monitorizarea alinierii necorespunzătoare. Considerăm alinierea modelelor principalul mijloc de prevenire a potențialelor comportamente nealiniate ale acestora. Totuși, monitorizarea oferă o perspectivă amplă asupra comportamentului modelelor de vârf, evidențiind oportunități de îmbunătățire suplimentară a alinierii și siguranței. În plus, monitorizarea constituie un nivel suplimentar de protecție împotriva comportamentelor nealiniate detectate. Din aceste motive, am adăugat monitorizarea alinierii necorespunzătoare pentru toate procesele de inferență care folosesc instrumente în cadrul implementării externe a Astra, ceea ce implică un cost de calcul semnificativ. Acest sistem este similar configurației noastre interne.
  5. Monitorizabilitatea GPT‑6 Astra a scăzut comparativ cu GPT‑5.6 Sol. Am desfășurat investigații ample privind monitorizabilitatea(se deschide într-o fereastră nouă) și controlabilitatea(se deschide într-o fereastră nouă) GPT‑6 Astra. Am constatat că GPT‑6 Astra își poate controla propriul CoT mai bine decât GPT‑5.6 Sol și este mai puțin predispus să includă în CoT informații care l-ar putea incrimina. În contexte adversariale, în care încercăm să determinăm modelul să evite sistemele noastre de monitorizare, constatăm că acesta poate rămâne nedetectat atunci când își ascunde strategic capabilitatea reală în evaluări (ascunderea capabilității reale) și că uneori poate evita sistemele noastre interne de monitorizare atunci când i se cere să execute anumite sarcini de sabotaj(se deschide într-o fereastră nouă). Nu am observat dovezi ale unui raționament CoT steganografic (de exemplu, ascunderea unui raționament secret într-un text obișnuit și aparent fără legătură), ceea ce indică faptul că riscul de evitare s-ar putea limita în mare măsură la sarcini care necesită un nivel mai redus de raționament.
    • Aceste constatări indică faptul că modelele din clasa Astra ar putea evita sistemele noastre de monitorizare a CoT în condiții adversariale. În prezent, aceste constatări se bazează în mare parte pe evaluări adversariale (adică situații în care instruim modelul să evite monitorizarea), iar evaluările noastre generale ale alinierii arată că Astra este, per ansamblu, mai puțin predispus decât GPT‑5.6 Sol să încalce restricțiile de securitate și siguranță.
    • Totuși, tratăm această tendință cu seriozitate și continuăm să investigăm constatările și implicațiile lor asupra monitorizabilității, pe măsură ce modelele noastre devin mai capabile. OpenAI a depus eforturi pentru a păstra și utiliza monitorizarea lanțului de raţionament, iar menținerea monitorizabilității CoT este un obiectiv central al programului de cercetare. Totuși, aceste rezultate subliniază și importanța dezvoltării unor tehnici de auditare a alinierii care să nu se limiteze la examinarea lanțului de raţionament al modelului.
  6. GPT‑6 Astra gestionează mai responsabil navigarea pe internet și mediile de lucru: GPT‑6 Astra este semnificativ mai rezistent la injecțiile de solicitări decât GPT‑5.6 Sol. Am testat suplimentar comportamentul modelului în medii realiste de navigare și în medii informatice profesionale și am constatat că, în comparație cu GPT‑5.6 Sol, modelul este semnificativ mai puțin predispus să întreprindă acțiuni nealiniate și potențial distructive, precum tranzacții neautorizate, pierderea datelor, accesul excesiv sau eludarea mecanismelor de control. De asemenea, acționează mai sigur atunci când gestionează solicitări dăunătoare în contexte agentice, cum ar fi cele de sprijinire a planificării unui atac violent sau de comitere a unei fraude.
  7. GPT‑6 Astra este semnificativ mai sigur în scenarii cu risc ridicat. GPT‑6 Astra răspunde mai sigur decât GPT‑5.6 Sol la solicitări dificile provenite din producție și din testări adversariale de red teaming efectuate de oameni. Astra obține o îmbunătățire Pareto în gestionarea sigură a solicitărilor periculoase și în evitarea refuzurilor inutile ale solicitărilor inofensive. Aceste îmbunătățiri se extind și la scenarii de gravitate ridicată, în care riscul de vătămare provine din contextul mai larg, nu dintr-o solicitare explicită. De asemenea, Astra aplică mai consecvent limite de siguranță adecvate vârstei pentru utilizatorii sub 18 ani.