O nouă generație de inteligență
Actualizare din 22 septembrie 2026: Ne extindem familia GPT‑6 cu GPT‑6 Sol și GPT‑6 Luna. Află mai multe.
Prezentăm GPT‑6 Astra, cel mai inteligent și aliniat model din lume.
GPT‑6 Astra reunește ani de cercetare și mize majore în pre-instruire, învățare prin consolidare și aliniere. Astra este un model de ultimă generație când vine vorba de utilizarea calculatorului, navigare pe web, inginerie software, securitate cibernetică, știință și activități profesionale. Astra saturează nivelul 4 al FrontierMath cu un scor de 98%, după ce a contribuit deja la rezolvarea unor probleme deschise de mult timp în matematică. Astra atinge, de asemenea, saturația pe ARC-AGI-3 cu un scor de 99,9% și pe ExploitBench cu un scor de 100%. În plus, stabilește o nouă frontieră în utilizarea calculatorului și a navigatoarelor, gestionând cele mai solicitante lucrări profesionale cu o viteză, precizie și o judecată de neegalat.
GPT‑6 Astra se lansează treptat astăzi pentru un număr limitat de organizații, iar în următoarele zile va deveni disponibil pentru toți utilizatorii ChatGPT Plus, Pro, Business și Enterprise, precum și prin API-ul OpenAI, Microsoft Azure și AWS Bedrock.
Astra este modelul nostru cel mai aliniat, cu îmbunătățiri substanțiale în înțelegerea intenției utilizatorului și a comportamentului modelului. Se pot delega sarcini cu mai multă încredere în judecata Astra. Ca una dintre modalitățile prin care testăm acest lucru, am construit o nouă evaluare bazată pe informațiile rezultate din incidentul Hugging Face, care evaluează dacă un model confruntat cu o sarcină dificilă sau imposibilă va depăși domeniul de aplicare prevăzut. Comparativ cu GPT‑5.6 Sol, care, fără măsurile de protecție din producție, a depășit ținta autorizată în 48% din cazuri, GPT‑6 Astra a făcut acest lucru în 0% din cazuri.
Cel mai bun model din lume pentru utilizarea calculatorului
GPT‑6 Astra marchează o nouă etapă de vârf în ceea ce privește viteza, precizia și siguranța utilizării calculatorului. Poate să se ocupe de sarcini repetitive și consumatoare de timp, precum completarea formularelor electronice, actualizarea înregistrărilor clienților într-un CRM și organizarea calendarului. Poate efectua cercetări online și redacta rezumate în e-mailul tău sau în editorul tău de documente. Poate analiza date științifice, genera grafice, crea o pagină web și rula verificări de asigurare a calității pentru interfața la nivel de client, pentru a se asigura că toate funcționalitățile de pe acea pagină funcționează. Te poate ajuta să instalezi și să testezi programe informatice în mod autonom și să depanezi problemele pe care le vezi pe ecran. Aceste îmbunătățiri se reflectă și în rezultatele noastre de evaluare de ultimă generație.
Aceste îmbunătățiri duc, de asemenea, la creșteri semnificative ale eficienței în sarcini reale de muncă bazată pe cunoștințe. În simulările de latență pe OSWorld 2.0, Astra obține performanțe mai ridicate în utilizarea calculatorului într-un timp cu aproximativ 47% mai scurt pe sarcină decât GPT‑5.6 Sol, obținând 72,6% în aproximativ 40 de minute pe sarcină, comparativ cu 65,7% în aproximativ 75 de minute.3
Capacitățile GPT‑6 Astra de utilizare a calculatorului pot fi observate în rezultatele din diverse domenii, inclusiv dezvoltarea de jocuri, ingineria electrică și activitățile intelectuale de zi cu zi:
Alături de Astra, actualizăm și cadrul de testare Codex pentru a îmbunătăți semnificativ viteza de utilizare a calculatorului. Împreună cu eficiența modelului Astra, acest lucru înseamnă că sarcinile sunt finalizate de 1,9 ori mai rapid față de experiența actuală cu GPT‑5.6 Sol, în testul de performanță Mind2Web. Îmbunătățirile aduse vitezei modelului înseamnă că poate prelua pentru tine multe sarcini consumatoare de timp din viața de zi cu zi, mai rapid decât ai putea tu.4
Un salt major în activitatea profesională
GPT‑6 Astra combină progresele în utilizarea calculatorului cu instruire specifică pentru medii profesionale, pentru a ajuta la abordarea sarcinilor de lucru complexe. Combină inteligența necesară pentru probleme complexe cu capacitatea de a realiza fluxuri de lucru în mai mulți pași și de a produce documente, foi de calcul și prezentări impecabile.
GPT‑6 Astra este cel mai bun model al nostru pentru respectarea șabloanelor existente și crearea de diapozitive bine aranjate, care transmit concis punctele-cheie printr-o narațiune structurată. Creează documente, prezentări, foi de calcul și analize clare, bine structurate, care urmează șabloanele tale și se potrivesc stilului tău de redactare și stilului vizual. Astra este, de asemenea, antrenată să includă în rezultate doar contextul relevant, în loc să repete informații inutile pentru sarcina curentă. Toate acestea înseamnă că poate genera artefacte mai ușor de utilizat imediat, care corespund contextului și standardelor tale de afaceri.
GPT‑6 Astra aduce, de asemenea, o judecată vizuală mai bună în ceea ce privește paginile web, jocurile, aplicațiile și randările pe care le creează. Cu Site-uri(se deschide într-o fereastră nouă) în ChatGPT, Astra poate crea, găzdui și distribui pagini web, aplicații web și jocuri direct dintr-o solicitare.
Atunci când instrucțiunile lasă loc de interpretare, GPT‑6 Astra este mai bun decât modelele anterioare la luarea deciziei corecte. Acesta folosește contextul pentru a completa lacunele obișnuite și pune întrebări punctuale atunci când răspunsul ar putea schimba rezultatul. În Codex, poate pune întrebări în mod asincron, continuând în același timp activitatea care nu depinde de răspunsul tău. Dacă nu răspunzi, continuă cu presupuneri rezonabile acolo unde este cazul, dar așteaptă intervenția ta pentru deciziile cu impact semnificativ.
Exemplele de mai jos arată cum colaborează Astra la sarcini cotidiene, în care informațiile lipsă pot schimba semnificativ răspunsul.
De asemenea, Astra reușește să își mențină mai bine orientarea pe măsură ce o sarcină evoluează. Modelele anterioare tratau uneori mesajele de ghidare ca pe un nou obiectiv, pierzând din vedere cererea inițială sau constrângerile anterioare. Astra integrează cerințe noi, își schimbă direcția atunci când i se cere și răspunde la întrebări secundare fără a pierde din vedere sarcina mai amplă.
Programare
GPT‑6 Astra este cel mai bun model de până acum pentru inginerie software.
„GPT‑6 Astra oferă performanțe de ultimă generație în teste noastre de performanță interne legate de programare și demonstrează un progres clar în evaluările intuiției de tranzacționare, comparativ cu GPT‑5.6 Sol. Atunci când este utilizat pentru codare agentică, GPT‑6 Astra comunică într-un mod mai ușor de urmărit de către dezvoltatori și produce cod care necesită mai puține iterații pentru a ajunge la calitatea necesară pentru producție.
„Am testat modelul Astra cu efort redus, mediu și ridicat pe una dintre evaluările noastre de primă generație, iar acesta a depășit semnificativ GPT 5.6 Sol. Un efort mai ridicat permite mai multe iterații pe o versiune nouă, mai multe verificări prin testare în navigator și o preferință pentru executarea codului în locul aplicării de corecții de securitate. Înțelegerea modului în care un model își folosește efortul este modul în care le oferim milioanelor de dezvoltatori o cale mai rapidă și mai fiabilă de la idee la o aplicație funcțională.”
Cu Astra, introducem o modalitate nouă prin care Codex poate păstra și recupera contextul atunci când fereastra contextuală se umple. În trecut, modelele au folosit compactarea pentru a rezuma activitatea din timpul sesiunilor lungi, cum ar fi atunci când depanează probleme complexe sau abordează refactorizări ample. Fiecare compactare poate omite detalii despre motivele pentru care o remediere a fost nereușită sau despre modul în care se comportă o componentă. În Codex, Astra poate păstra note în mai multe ferestre contextuale, păstrând detaliile acumulate fără a le comprima în mod repetat într-un singur rezumat. Ferestrele contextuale anterioare rămân căutabile, astfel încât Astra poate găsi cerințe sau rezultate ale testelor din mesaje și rezultate ale instrumentelor anterioare, chiar dacă informațiile respective nu au fost incluse în notițele sale. Această funcție experimentală poate activată în fișierul config.toml pentru Codex,(se deschide într-o fereastră nouă) iar aceasta va deveni opțiunea implicită pentru Astra în următoarele săptămâni.
Promovarea descoperirilor științifice
Astra poate ajuta la munca practică din spatele descoperirii științifice. Prin combinarea raționamentului științific cu utilizarea calculatorului, poate lucra direct în programe informatice specializate pentru a inspecta datele și a explora rezultatele, ajutând cercetătorii să evalueze dovezile și să decidă ce să investigheze în continuare.
Securitate cibernetică
După cum am discutat în actualizarea noastră privind siguranța, Astra reprezintă un salt semnificativ în materie de capabilități cibernetice și atinge pragul critic în securitate cibernetică, conform Cadrului nostru de pregătire. Capacitatea sa de a identifica și dezvolta exploatări de tip ziua zero poate ajuta echipele de apărare să identifice și să remedieze vulnerabilitățile, dar creează și nevoia unor măsuri de protecție mai solide. Pentru a înțelege cât de departe se extind aceste capacități, am testat Astra prin evaluări efectuate de experți interni și de terți.
Am testat mai întâi modelul fără măsuri de protecție pentru producție pe ExploitBench și ExploitGym, care evaluează dacă modelele pot transforma vulnerabilități informatice cunoscute în exploatări funcționale. Pe ExploitBench, Astra a obținut scorul perfect de 100%, comparativ cu 78,5% pentru GPT‑5.6 Sol, modelul nostru anterior de vârf cu capabilități de securitate cibernetică. Pe ExploitGym, Astra a atins o rată de reușită de 42,4%, comparativ cu 30,3% pentru GPT‑5.6 Sol, folosind în același timp substanțial mai puține tokenuri de ieșire.13
Având în vedere îngrijorările că expunerea la vulnerabilități informatice istorice ar fi putut afecta rezultatele testelor de performanță, am evaluat, de asemenea, Astra pe două teste de performanță noi. În primul rând, am dezvoltat o evaluare internă „ExploitBench (iunie-august 2026)” pentru a testa dezvoltarea de exploatări utilizând vulnerabilități din cele trei luni anterioare.14 Astra a obținut rate de execuție arbitrară de cod substanțial mai mari decât GPT‑5.6 Sol pe acest set de date, folosind totodată mult mai puține tokenuri de ieșire. În timpul evaluării, Astra a descoperit și a folosit chiar două vulnerabilități de tip ziua zero necunoscute anterior. Dezvăluim ambele vulnerabilități responsabililor de mentenanță ai acestora.
De asemenea, am testat Astra pe SRE-Bench15, un test de performanță care măsoară dacă modelele pot efectua ingineria inversă a fișierelor binare de program pentru a le înțelege logica de bază fără acces la codul sursă brut. Astra a rezolvat 88,0% dintre sarcini dintr-o singură încercare și 99,2% în decurs de patru încercări, comparativ cu 55,9% și, respectiv, 68,7% pentru GPT‑5.6 Sol.
Dincolo de teste de performanță, evaluările conduse de experți au constatat că Astra, atunci când era rulat fără mecanismele de protecție din producție, putea utiliza vulnerabilități necunoscute anterior pentru a obține execuție arbitrară de cod în navigatoare securizate și pentru a crea exploatări de escaladare a privilegiilor pentru sisteme de operare securizate.
După cum am discutat în Fereastra apărătorului, capabilitățile cibernetice de vârf îi pot ajuta pe apărători să găsească mai rapid vulnerabilitățile, dar fac și aceste vulnerabilități mai ușor de exploatat, sporind urgența cu care apărătorii trebuie să se adapteze. Cu versiunea Astra lansată astăzi, apărătorii o pot folosi pentru a îndeplini sarcini precum revizuirea securității codului și aplicarea corecțiilor de securitate.
Cu toate acestea, Astra va refuza să îndeplinească sarcini mai avansate de securitate cibernetică, cum ar fi crearea de exploatări de tip dovadă de concept pentru vulnerabilități. Prin intermediul OpenAI Daybreak, intenționăm să extindem accesul și să introducem treptat măsuri de protecție mai puțin restrictive în următoarele săptămâni. Acest lucru va permite mai multe fluxuri de lucru defensive, inclusiv validarea vulnerabilităților și a dovezilor de concept, analiza programelor rău-intenționate și ingineria detecției.
De asemenea, ne-am consolidat protecțiile împotriva potențialei utilizări abuzive în domeniul cibernetic, bazându-ne pe ansamblul nostru de măsuri de protecție pentru GPT‑5.6 Sol. Acestea includ o robustețe mai mare a modelului pentru a rezista mai bine la potențialele jailbreak-uri și mai mult context pentru sistemele noastre de monitorizare. Am continuat să efectuăm evaluări riguroase, atât interne, cât și externe, inclusiv evaluări automatizate cu echipa noastră internă de atacatori simulați. Mai multe detalii despre măsurile noastre de protecție cibernetică și testare sunt disponibile în prezentarea generală privind siguranța și fișa de sistem(se deschide într-o fereastră nouă) pentru Astra.
Alinierea și implementarea responsabilă a GPT‑6 Astra
Astra este modelul nostru cel mai bine aliniat. Astra excelează prin grija cu care acționează, prin respectarea limitelor sarcinilor și prin comunicarea transparentă. Această activitate este cel mai recent rezultat al programului nostru de cercetare de lungă durată, axat pe instruirea modelelor care rămân aliniate cu intenția umană de la început până la sfârșit.
În medii sensibile, Astra acționează cu o prudență proporțională cu nivelul de risc. Într-o evaluare a sarcinilor de utilizare a calculatorului selectate în mod adversarial pentru a provoca comportamente necorespunzătoare, Astra a avut mai mult succes în evitarea consecințelor neintenționate. Rularea cu măsurile de securitate suplimentare oferite implicit a dus la performanțe și mai bune.
Astra provoacă mai puține rezultate nealiniate decât oricare alt model de vârf testat. Pentru o comparație echitabilă, am folosit un cadru de testare generic pentru agentul de utilizare a calculatorului (bazat pe instrumentele native de utilizare a calculatorului disponibile atât în API-ul OpenAI Răspunsuri(se deschide într-o fereastră nouă), cât și în API-ul Mesaje Anthropic(se deschide într-o fereastră nouă)) și fără protecțiile suplimentare care sunt implementate în mod normal pentru utilizatorii Codex și ChatGPT Work (revizuire automată, politică de confirmare).
De asemenea, este mai probabil ca Astra să funcționeze în limitele stabilite de utilizator și deduse din mediul său. Într-o evaluare internă, Astra nu a încercat niciodată să eludeze un refuz al verificării automate Codex. Acest lucru a rămas valabil chiar și atunci când revizuirea automată a fost configurată în mod deliberat astfel încât să poată fi eludată, iar sarcina era imposibil de finalizat în alt mod. Acest respect pentru restricțiile de mediu este în concordanță cu rezultatele evaluării noastre a sarcinii cibernetice imposibile, pe care am împărtășit-o în introducerea acestui articol, precum și cu alte constatări documentate în fișa noastră de sistem(se deschide într-o fereastră nouă).
Astra stabilește, de asemenea, noi repere în comunicarea transparentă cu utilizatorii. Într-o evaluare, Astra are o probabilitate de trei ori mai mică decât GPT‑5.6 Sol să facă afirmații inexacte despre capabilitățile și funcționalitățile sale.
În evaluarea noastră privind halucinațiile legate de capabilități, Astra demonstrează o îmbunătățire substanțială față de GPT‑5.6 Sol, făcând mai puține afirmații înșelătoare despre propriile capabilități.
Evaluările noastre au arătat că raționamentul scris al Astra este mai greu de monitorizat decât cel al GPT‑5.6 Sol, pe baza unor teste care i-au cerut explicit să eludeze monitorizarea. Atribuim acest lucru controlului mai mare al Astra asupra raționamentului scris în sarcini mai simple și capacității sale de a rezolva probleme cu mai puțini pași scriși. Astra pare în continuare să întâmpine dificultăți în a ascunde raționamentul necesar pentru sarcini complexe, dar luăm declinul în serios. Îmbunătățirea monitorizabilității rămâne o prioritate de cercetare, iar fișa de sistem(se deschide într-o fereastră nouă) însoțitoare detaliază constatările noastre și activitatea în curs.
Antrenamentul de aliniere este esențial abordării noastre privind implementarea. Ca nivel suplimentar de apărare, creăm și măsuri de protecție la nivel de sistem, precum verificarea automată Codex(se deschide într-o fereastră nouă) și monitorizarea raționamentului și a acțiunilor agenților, pentru a ajuta la detectarea și limitarea comportamentului nesigur. După cum am descris în actualizarea noastră privind siguranța, implementăm și monitorizarea nealinierii în producție pentru modelele din clasa Astra, pentru a avea vizibilitate asupra nealinierii și a ajuta la limitarea celor mai grave cazuri ale acesteia. Aceste măsuri de protecție sunt asemănătoare monitorizării implementărilor noastre interne și implică un sistem de clasificatoare care verifică raționamentul și acțiunile modelului pentru a detecta comportamente neautorizate și a opri automat activitatea potențial neautorizată.
Având în vedere creșterea semnificativă a capacităților de securitate cibernetică ale Astra, suntem deosebit de atenți să facem această implementare sigură și securizată. Verificările suplimentare de siguranță pot uneori încetini, întrerupe temporar sau opri activități legitime, inclusiv activități de securitate cibernetică defensivă. Dacă o sarcină este întreruptă în ChatGPT sau Codex, ți se poate cere să verifici acțiunea înainte de a continua. În API, sarcina se va opri. Aceste verificări pot întrerupe uneori activitatea legitimă, iar noi continuăm să îmbunătățim acest sistem pentru a reduce întreruperile inutile. Monitorizarea nealinierii nu poate înlocui alinierea: obiectivul nostru este să construim modele care rămân în mod fiabil în domeniul lor de aplicare autorizat, astfel încât aceste măsuri de protecție să nu fie nevoite să intervină.
Disponibilitate
GPT‑6 Astra se lansează treptat astăzi pentru un număr limitat de organizații, iar în următoarele zile va deveni disponibil pentru toți utilizatorii ChatGPT Plus, Pro, Business și Enterprise, precum și prin API-ul OpenAI, Microsoft Azure și AWS Bedrock. Utilizarea Astra este inclusă în limitele existente ale abonamentelor. Utilizatorii și companiile vor putea, de asemenea, să achiziționeze credite pentru utilizare suplimentară. Utilizatorii planurilor Pro, Business și Enterprise vor avea, de asemenea, acces la GPT‑6 Astra Pro. Administratorii Enterprise pot activa Astra pentru spațiul lor de lucru; accesul este dezactivat implicit la lansare.
Astra acceptă funcția de zero date păstrate pentru clienții API eligibili și, așa cum am comunicat luna trecută, testăm Procesarea privată pentru siguranță pentru a consolida monitorizarea siguranței, păstrând în același timp confidențialitatea clienților.
Pentru dezvoltatori, GPT‑6 Astra va fi disponibil în API-ul OpenAI sub denumirea gpt-6-astra și prin Microsoft Azure și Amazon Bedrock.
Tarifele standard pentru API-ul OpenAI sunt de 10 $ pe milion de tokenuri de intrare și 50 $ pe milion de tokenuri de ieșire. Se aplică tarife separate pentru citirile și scrierile în cache. Modul rapid este disponibil pentru GPT‑6 Astra în API și oferă viteze de până la 2 ori mai mari decât procesarea Standard, la dublul prețului Standard.
Utilizarea computerului
Profesional
Profesional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% | - |
BenchCAD | 95,9% | 83,3% | 84,3% 5 | 67,5% 5 | 82,1% 5 | - |
BrowseComp | 91,5% | 90,4% | - | 87,4% | 90,8% | - |
Cvartete de coarde OpenScore (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Sarcini interne de proiectare | 50,0% | 47,4% | - | 35,8% | - | - |
Sarcini interne de știința datelor | 40,9% | 30,5% | - | 34,7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Programare
| Programare | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% | 73,8% |
| FrontierCode 1.1 Extended (scor) | 64,5% 8 | 60,6% | 63,6% | 64,9% | 63,6% | 56,3% |
| FrontierCode 1.1 Main (scor) | 53,3% 8 | 47,5% | 50,9% | 53,5% | 53,4% | 43,6% |
| Sarcini interne de migrare a bazei de date | 63,9% | 42,7% | 57,8% | 50,3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% | - |
FrontierMath Nivelul 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% | - |
GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% | 95,3% |
Humanity's Last Exam (cu instrumente) | 57,2% | - | 65,0% | 63,8% | 63,6% | - |
Știință și sănătate
Securitate cibernetică
Aliniere
Aliniere | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Test de performanță intern privind siguranța utilizării calculatorului (cu cât este mai mic, cu atât mai bine) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Test de performanță intern privind siguranța utilizării calculatorului, cu AutoReview (cu cât este mai mic, cu atât mai bine) | 1,8% | 4,3% | - | - | - | - |
Test de performanță intern privind eludarea (cu cât este mai mic, cu atât mai bine) | 0,00% | 0,29% | - | - | - | - |
Honeypot ExploitGym (cu cât este mai mic, cu atât mai bine) | 0,0% | 48,2% | - | - | - | - |
ExploitGym imposibil | 100,0% | - | - | - | - | - |
Test de performanță intern privind halucinațiile (cu cât este mai mic, cu atât mai bine) | 4,2% | 12,2% | - | - | - | - |
Context lung
Context lung | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Raționament abstract
| Raționament abstract | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% 1 | 7,8% | - | - | 30,2% | - |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% | - |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% | - |
Scorurile de evaluare sunt maxime la orice nivel de efort. Evaluările GPT au fost rulate în mediul nostru de cercetare sau prin API-ul nostru, ceea ce poate oferi rezultate ușor diferite față de versiunea ChatGPT de producție din cauza diferențelor dintre solicitările de sistem, instrumentele disponibile etc.
NOTE DE SUBSOL
- 1
Pe ARC-AGI-3, GPT-6 Astra a fost rulat cu cadrul nostru de testare pentru API-ul Răspunsuri, care modifică două setări pentru a reflecta mai bine performanța din lumea reală. Modificările nu vizează în mod specific ARC-AGI-3.
- 2
GPT-5.6 Sol se referă la versiunea disponibilă în API-ul nostru, ChatGPT Codex și ChatGPT Work. Versiunea din ChatGPT Chat este ușor diferită.
- 3
OSWorld V2-Offline este un subset al OSWorld V2 original care funcționează fără acces la internet. Performanța modelului Claude pe OSWorld-V2 Offline a fost reprodusă de autori în clasamentul oficial(se deschide într-o fereastră nouă). În OSWorld 2.0, pentru scorurile Claude sunt utilizate setările oficiale, nu sarcinile modificate și evaluarea modificată din fișa de sistem Fable 5.1.
- 4
- 5
Pe BenchCAD, scorurile lui Claude reflectă 3 modificări ale evaluării, detaliate în fișa de sistem Fable 5.1(se deschide într-o fereastră nouă).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon și Noah A. Smith. „LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(se deschide într-o fereastră nouă).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower și Peter Jonas. „The OpenScore String Quartet Corpus(se deschide într-o fereastră nouă).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49-57. ACM, 2023.
- 8
Pe FrontierCode, GPT-6 Astra a fost rulat cu un mesaj de dezvoltator similar cu o secțiune din mesajul său de dezvoltator în Codex(se deschide într-o fereastră nouă): „Evită crearea unui număr excesiv de fișiere de test. Creează un fișier de test nou doar atunci când este necesar conform convențiilor depozitului sau când niciun fișier existent nu este potrivit pentru acesta. Evită operațiunile de ordonare fără legătură și complexitatea inutilă. Reutilizează utilitarele existente adecvate. Citește instrucțiunile relevante pentru depozit și inspectează codul, testele, documentația și CI din apropiere. Respectă convențiile stabilite. Scopul este un cod ordonat, care poate fi îmbinat." Solicitarea nu a fost optimizată pentru evaluare.
- 9
Prima se referă la cât de aproape unele de altele pot apărea numerele prime, oricât de departe ai înainta pe axa numerelor. Timp de peste un deceniu, cel mai bun rezultat cunoscut a stabilit că există infinit de multe perechi de numere prime aflate la o distanță de cel mult 246. Julia Stadlmann(se deschide într-o fereastră nouă) a îmbunătățit recent acea limită la 240. Astra a contribuit la stabilirea unei limite mai strânsă de 186, arătând că infinit de multe perechi se află la cel mult această distanță mai mică. Distanțe mici între numere prime: demonstrație(se deschide într-o fereastră nouă) și cercetări conexe(se deschide într-o fereastră nouă).
- 10
Cea de-a doua se referă la diferențe neobișnuit de mari între numere prime. Astra a îmbunătățit un termen dintr-o limită pentru aceste distanțe, care rămăsese neschimbat de peste 80 de ani. Publicăm demonstrațiile, lanțul de gândire prescurtat și materialele de verificare pentru ambele rezultate. Intervale mari între numere prime: Demonstrație(se deschide într-o fereastră nouă) și cercetări conexe(se deschide într-o fereastră nouă).
- 11
- 12
- 13
- 14
ExploitBench (iunie-august 2026) conține 20 de vulnerabilități V8 de gravitate ridicată în 13 versiuni stabile de Chrome. Testul de performanță testează dacă agenții pot obține execuție de cod arbitrar în V8 și în versiunile oficiale de Chrome pentru Linux prin exploatarea fiecărei vulnerabilități specificate. Este posibil ca unele vulnerabilități incluse să nu permită execuție arbitrară de cod în cadrul constrângerilor evaluării, astfel încât este posibil să nu se poată atinge o rată de succes de 100%. Notă: scorul de 5,5% al GPT-5.6 Sol este un artefact al limitei de 300 de interacțiuni din testul de performanță, care nu este o limită pe care ar avea-o clienții reali care folosesc Max. Modelul, cu setări similare, a obținut un scor de 11,5% atunci când s-a lovit de mai puține limite.
- 15
Jeremy Spence et al. „The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(se deschide într-o fereastră nouă).” arXiv:2608.11469v1, 2026.
- 16
Când testăm pe modele terțe, folosim o configurație de cercetare mai simplă. Codex are o configurație de producție mai complexă, ceea ce poate duce la rate de eroare diferite ale modelului brut. Măsurile de protecție din partea furnizorului și implementările instrumentelor pentru calculator diferă în continuare. Utilizatorii nu se confruntă cu scenariul fără confirmare în Codex, deoarece este o configurație internă de cercetare.
- 17
