O nouă generație de inteligență
Prezentăm GPT‑6 Astra, cel mai inteligent și aliniat model din lume.
GPT‑6 Astra reunește ani de cercetare și mize majore în pre-instruire, învățare prin consolidare și aliniere. Astra este un model de ultimă generație când vine vorba de utilizarea calculatorului, navigare pe web, inginerie software, securitate cibernetică, știință și activități profesionale. Astra saturează nivelul 4 al FrontierMath cu un scor de 98%, după ce a contribuit deja la rezolvarea unor probleme deschise de mult timp în matematică. Astra atinge, de asemenea, saturația pe ARC-AGI-3 cu un scor de 99,9% și pe ExploitBench cu un scor de 100%. În plus, stabilește o nouă frontieră în utilizarea calculatorului și a navigatoarelor, gestionând cele mai solicitante lucrări profesionale cu o viteză, precizie și o judecată de neegalat.
GPT‑6 Astra se lansează treptat astăzi pentru un număr limitat de organizații, iar în următoarele zile va deveni disponibil pentru toți utilizatorii ChatGPT Plus, Pro, Business și Enterprise, precum și prin API-ul OpenAI, Microsoft Azure și AWS Bedrock.
Astra este modelul nostru cel mai aliniat, cu îmbunătățiri substanțiale în înțelegerea intenției utilizatorului și a comportamentului modelului. Se pot delega sarcini cu mai multă încredere în judecata Astra. Ca una dintre modalitățile prin care testăm acest lucru, am construit o nouă evaluare bazată pe informațiile rezultate din incidentul Hugging Face, care evaluează dacă un model confruntat cu o sarcină dificilă sau imposibilă va depăși domeniul de aplicare prevăzut. Comparativ cu GPT‑5.6 Sol, care, fără măsurile de protecție din producție, a depășit ținta autorizată în 48% din cazuri, GPT‑6 Astra a făcut acest lucru în 0% din cazuri.
Cel mai bun model din lume pentru utilizarea calculatorului
GPT‑6 Astra marchează o nouă etapă de vârf în ceea ce privește viteza, precizia și siguranța utilizării calculatorului. Poate să se ocupe de sarcini repetitive și consumatoare de timp, precum completarea formularelor electronice, actualizarea înregistrărilor clienților într-un CRM și organizarea calendarului. Poate efectua cercetări online și redacta rezumate în e-mailul tău sau în editorul tău de documente. Poate analiza date științifice, genera grafice, crea o pagină web și rula verificări de asigurare a calității pentru interfața la nivel de client, pentru a se asigura că toate funcționalitățile de pe acea pagină funcționează. Te poate ajuta să instalezi și să testezi programe informatice în mod autonom și să depanezi problemele pe care le vezi pe ecran. Aceste îmbunătățiri se reflectă și în rezultatele noastre de evaluare de ultimă generație.
Aceste îmbunătățiri duc, de asemenea, la creșteri semnificative ale eficienței în sarcini reale de muncă bazată pe cunoștințe. În simulările de latență pe OSWorld 2.0, Astra obține performanțe mai ridicate în utilizarea calculatorului într-un timp cu aproximativ 47% mai scurt pe sarcină decât GPT‑5.6 Sol, obținând 72,6% în aproximativ 40 de minute pe sarcină, comparativ cu 65,7% în aproximativ 75 de minute.3
Capacitățile GPT‑6 Astra de utilizare a calculatorului pot fi observate în rezultatele din diverse domenii, inclusiv dezvoltarea de jocuri, ingineria electrică și activitățile intelectuale de zi cu zi:
Alături de Astra, actualizăm și cadrul de testare Codex pentru a îmbunătăți semnificativ viteza de utilizare a calculatorului. Împreună cu eficiența modelului Astra, acest lucru înseamnă că sarcinile sunt finalizate de 1,9 ori mai rapid față de experiența actuală cu GPT‑5.6 Sol, în testul de performanță Mind2Web. Îmbunătățirile de viteză ale modelului înseamnă că poate prelua pentru tine multe sarcini consumatoare de timp din viața de zi cu zi, mai rapid decât ai putea tu.
Un salt major în activitatea profesională
GPT‑6 Astra combină progresele în utilizarea calculatorului cu instruire specifică pentru medii profesionale, pentru a ajuta la abordarea sarcinilor de lucru complexe. Combină inteligența necesară pentru probleme complexe cu capacitatea de a realiza fluxuri de lucru în mai mulți pași și de a produce documente, foi de calcul și prezentări impecabile.
GPT‑6 Astra este cel mai bun model al nostru pentru respectarea șabloanelor existente și crearea de diapozitive bine aranjate, care transmit concis punctele-cheie printr-o narațiune structurată. Creează documente, prezentări, foi de calcul și analize clare, bine structurate, care urmează șabloanele tale și se potrivesc stilului tău de redactare și stilului vizual. Astra este, de asemenea, antrenată să includă în rezultate doar contextul relevant, în loc să repete informații inutile pentru sarcina curentă. Toate acestea înseamnă că poate genera artefacte mai ușor de utilizat imediat, care corespund contextului și standardelor tale de afaceri.
GPT‑6 Astra aduce, de asemenea, o judecată vizuală mai bună în ceea ce privește paginile web, jocurile, aplicațiile și randările pe care le creează. Cu Site-uri(se deschide într-o fereastră nouă) în ChatGPT, Astra poate crea, găzdui și distribui pagini web, aplicații web și jocuri direct dintr-o solicitare.
Atunci când instrucțiunile lasă loc de interpretare, GPT‑6 Astra este mai bun decât modelele anterioare la luarea deciziei corecte. Acesta folosește contextul pentru a completa lacunele obișnuite și pune întrebări punctuale atunci când răspunsul ar putea schimba rezultatul. În Codex, poate pune întrebări în mod asincron, continuând în același timp activitatea care nu depinde de răspunsul tău. Dacă nu răspunzi, continuă cu presupuneri rezonabile acolo unde este cazul, dar așteaptă intervenția ta pentru deciziile cu impact semnificativ.
Exemplele de mai jos arată cum colaborează Astra la sarcini cotidiene, în care informațiile lipsă pot schimba semnificativ răspunsul.
De asemenea, Astra reușește să își mențină mai bine orientarea pe măsură ce o sarcină evoluează. Modelele anterioare tratau uneori mesajele de ghidare ca pe un nou obiectiv, pierzând din vedere cererea inițială sau constrângerile anterioare. Astra integrează cerințe noi, își schimbă direcția atunci când i se cere și răspunde la întrebări secundare fără a pierde din vedere sarcina mai amplă.
Programare
GPT‑6 Astra este cel mai bun model de până acum pentru inginerie software.
„GPT‑6 Astra oferă performanțe de ultimă generație în teste noastre de performanță interne legate de programare și demonstrează un progres clar în evaluările intuiției de tranzacționare, comparativ cu GPT‑5.6 Sol. Atunci când este utilizat pentru codare agentică, GPT‑6 Astra comunică într-un mod mai ușor de urmărit de către dezvoltatori și produce cod care necesită mai puține iterații pentru a ajunge la calitatea necesară pentru producție.
„Am testat modelul Astra cu efort redus, mediu și ridicat pe una dintre evaluările noastre de primă generație, iar acesta a depășit semnificativ GPT 5.6 Sol. Un efort mai ridicat permite mai multe iterații pe o versiune nouă, mai multe verificări prin testare în navigator și o preferință pentru executarea codului în locul aplicării de corecții de securitate. Înțelegerea modului în care un model își folosește efortul este modul în care le oferim milioanelor de dezvoltatori o cale mai rapidă și mai fiabilă de la idee la o aplicație funcțională.”
Cu Astra, introducem o modalitate nouă prin care Codex poate păstra și recupera contextul atunci când fereastra contextuală se umple. În trecut, modelele au folosit compactarea pentru a rezuma activitatea din timpul sesiunilor lungi, cum ar fi atunci când depanează probleme complexe sau abordează refactorizări ample. Fiecare compactare poate omite detalii despre motivele pentru care o remediere a fost nereușită sau despre modul în care se comportă o componentă. În Codex, Astra poate păstra note în mai multe ferestre contextuale, păstrând detaliile acumulate fără a le comprima în mod repetat într-un singur rezumat. Ferestrele contextuale anterioare rămân căutabile, astfel încât Astra poate găsi cerințe sau rezultate ale testelor din mesaje și rezultate ale instrumentelor anterioare, chiar dacă informațiile respective nu au fost incluse în notițele sale. Această funcție experimentală poate activată în fișierul config.toml pentru Codex,(se deschide într-o fereastră nouă) iar aceasta va deveni opțiunea implicită pentru Astra în următoarele săptămâni.
Promovarea descoperirilor științifice
GPT‑6 Astra reprezintă un progres major în domeniul descoperirilor științifice, al matematicii și al sănătății. Astăzi, prezentăm încă două rezultate privind distanțele dintre numerele prime [WITH LINK]. Astra stabilește, de asemenea, noi recorduri într-o suită de evaluări științifice:
Astra poate ajuta la munca practică din spatele descoperirii științifice. Prin combinarea raționamentului științific cu utilizarea calculatorului, poate lucra direct în programe informatice specializate pentru a inspecta datele și a explora rezultatele, ajutând cercetătorii să evalueze dovezile și să decidă ce să investigheze în continuare.
Securitate cibernetică
Astra reprezintă un salt semnificativ în materie de capabilități de securitate cibernetică. Capacitatea sa de a identifica și dezvolta exploatări de tip ziua zero poate ajuta echipele de apărare să remedieze vulnerabilitățile, dar creează și nevoia unor măsuri de protecție mai solide. Pentru a înțelege cât de departe se extind aceste capacități, am utilizat evaluări efectuate de experți interni și de terți.
Am testat mai întâi Astra pe ExploitBench și ExploitGym, care măsoară dacă modelele pot realiza execuție arbitrară de cod în baze de cod vulnerabile.
Având în vedere posibilele îngrijorări că expunerea la vulnerabilități informatice istorice ar fi putut afecta rezultatele testelor de performanță, am evaluat, de asemenea, Astra pe două teste de performanță noi. În primul rând, am dezvoltat o evaluare internă „ExploitBench (iunie-august 2026)” pentru a testa dezvoltarea de exploatări utilizând vulnerabilități din cele trei luni anterioare. 2 Astra a obținut pe acest set de date rate de execuție arbitrară a codului substanțial mai mari decât GPT‑5.6 Sol, folosind totodată mult mai puține tokenuri de ieșire. În timpul evaluării, Astra a descoperit și a folosit două tehnici necunoscute anterior de evadare din mediul de testare pentru memoria heap V8. Dezvăluim ambele vulnerabilități responsabililor de mentenanță ai acestora.
De asemenea, am testat Astra pe SRE-Bench, un test de performanță care măsoară dacă modelele pot efectua inginerie inversă a programului informatic binar pentru a-i înțelege logica de bază. Autorii testului de performanță au dezvoltat programul de la zero și au păstrat codul sursă privat. Astra a rezolvat 88,0% dintre sarcini dintr-o singură încercare și 99,2% în decurs de patru încercări, comparativ cu 55,9% și, respectiv, 68,7% pentru GPT‑5.6 Sol.
Dincolo de teste de performanță, evaluările conduse de experți au constatat că Astra putea utiliza vulnerabilități necunoscute anterior pentru a obține execuție arbitrară de cod în navigatoare securizate și pentru a crea exploatări de escaladare a privilegiilor pentru sisteme de operare securizate. Luate împreună, aceste rezultate au fundamentat decizia noastră că Astra a atins pragul critic în securitate cibernetică, în Cadrul de pregătire.
După cum am discutat în Fereastra apărătorului, capabilitățile cibernetice de vârf îi pot ajuta pe apărători să găsească mai rapid vulnerabilitățile, dar fac și aceste vulnerabilități mai ușor de exploatat, sporind urgența cu care apărătorii trebuie să se adapteze.
Pentru versiunea Astra lansată astăzi, sprijinim sarcini defensive importante, cum ar fi revizuirea securizată a codului, aplicarea corecțiilor de securitate și modelarea amenințărilor. Cu toate acestea, în mod implicit, Astra va refuza să îndeplinească sarcini avansate de securitate cibernetică, cum ar fi descoperirea de exploatări. Prin intermediul OpenAI Daybreak, introducem treptat un acces mai puțin restrictiv pentru un grup alfa de apărători de încredere din domeniul securității cibernetice, în cadrul programului OpenAI Daybreak. Acest lucru extinde accesul la fluxurile de lucru defensive, inclusiv triajul și validarea vulnerabilităților, analiza programelor rău-intenționate, ingineria detecției și validarea corecțiilor de securitate. Plănuim să extindem și mai mult accesul prin Daybreak Blue.
De asemenea, ne-am consolidat protecțiile împotriva potențialei utilizări abuzive în domeniul cibernetic, bazându-ne pe ansamblul nostru de măsuri de protecție pentru GPT‑5.6 Sol. Acestea includ instruire mai robustă a modelului pentru a rezista mai bine potențialelor jailbreak-uri și mai mult context pentru sistemele noastre de monitorizare. Am continuat să efectuăm teste riguroase, atât interne, cât și externe, inclusiv teste automatizate cu echipa noastră internă de atacatori simulați. Mai multe detalii despre măsurile noastre de protecție cibernetică și testare sunt disponibile în fișa de sistem Astra și pe blogul nostru.
Alinierea și implementarea responsabilă a GPT‑6 Astra
Astra este modelul nostru cel mai bine aliniat. Astra excelează prin grija cu care acționează, prin respectarea limitelor sarcinilor și prin comunicarea transparentă. Această activitate este cel mai recent rezultat al programului nostru de cercetare de lungă durată, axat pe instruirea modelelor care rămân aliniate cu intenția umană de la început până la sfârșit.
În medii sensibile, Astra acționează cu o prudență proporțională cu nivelul de risc. Într-o evaluare a sarcinilor de utilizare a calculatorului selectate în mod adversarial pentru a provoca comportamente necorespunzătoare, Astra a avut mai mult succes în evitarea consecințelor neintenționate. Rularea cu măsurile de securitate suplimentare oferite implicit a dus la performanțe și mai bune.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(se deschide într-o fereastră nouă) and Anthropic Messages API(se deschide într-o fereastră nouă)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
De asemenea, este mai probabil ca Astra să funcționeze în limitele stabilite de utilizator și deduse din mediul său. Într-o evaluare internă, Astra nu a încercat niciodată să eludeze un refuz al verificării automate Codex. Acest lucru a rămas valabil chiar și atunci când revizuirea automată a fost configurată în mod deliberat astfel încât să poată fi eludată, iar sarcina era imposibil de finalizat în alt mod. Acest respect pentru restricțiile de mediu este în concordanță cu rezultatele evaluării noastre a sarcinii cibernetice imposibile, pe care am împărtășit-o în introducerea acestui articol, precum și cu alte constatări documentate în fișa noastră de sistem(se deschide într-o fereastră nouă).
Astra prezintă, de asemenea, reduceri substanțiale ale comportamentului înșelător. Persoanele care deleagă activități au nevoie de o înțelegere clară a capacităților unui model și de o raportare onestă a progresului acestuia. Acest lucru măsoară un aspect al onestității; reducerea înșelării deliberate rămâne un obiectiv mai amplu al activității noastre de aliniere.
În evaluarea noastră privind halucinațiile legate de capabilități, Astra demonstrează o îmbunătățire substanțială față de GPT‑5.6 Sol, făcând mai puține afirmații înșelătoare despre propriile capabilități.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(se deschide într-o fereastră nouă) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(se deschide într-o fereastră nouă) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Disponibilitate
GPT‑6 Astra se lansează treptat astăzi pentru companiile și clienții din Programul Trusted Acces, iar disponibilitatea pe scară largă pentru persoanele care se abonează la ChatGPT Plus, Pro, Business și Enterprise va urma în următoarele câteva zile. Utilizarea Astra este inclusă în limita existentă de utilizare din planurile Pro de 100 $ și 200 $ și din planul Business de 100 $, fără limite de rată sau restricții suplimentare. Persoanele cu un abonament Plus de 20 $ și clienții cu planul Business standard pot accesa GPT‑6 Astra cu limite mai mici, având opțiunea de a achiziționa credite pentru acces suplimentar. Administratorii Enterprise pot activa Astra pentru spațiul lor de lucru; accesul este dezactivat implicit la lansare.
Utilizatorii Pro Lite, Pro, Business și Enterprise pot folosi și GPT‑6 Astra în Chat. Astra acceptă funcția de zero date păstrate pentru clienții API eligibili și, așa cum am comunicat luna trecută, testăm Procesarea privată pentru siguranță pentru a consolida monitorizarea siguranței, păstrând în același timp confidențialitatea clienților.
Pentru dezvoltatori, GPT‑6 Astra este disponibil în API-ul OpenAI sub denumirea gpt-6-astra și este disponibil în AWS Bedrock. Tarifele standard pentru API-ul OpenAI sunt de 10 $ pe milion de tokenuri de intrare și 50 $ pe milion de tokenuri de ieșire. Se aplică tarife separate pentru citirile și scrierile în cache. Modul rapid este disponibil pentru GPT‑6 Astra în API și oferă viteze de până la 2,5 ori mai mari decât procesarea Standard, la dublul prețului Standard.
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Coding
| Coding | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% 8 | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% 8 | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
Academic
Academic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 90.2% | 73.2% | - |
GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
Aliniere
Aliniere | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Test de performanță intern privind siguranța utilizării calculatorului (cu cât este mai mic, cu atât mai bine) | 2,4% | 22,0% | 9,5% | 18,3% | 11,5% | - |
Test de performanță intern privind siguranța utilizării calculatorului, cu AutoReview (cu cât este mai mic, cu atât mai bine) | 1,8% | 4,3% | - | - | - | - |
Test de performanță intern privind eludarea (cu cât este mai mic, cu atât mai bine) | 0,00% | 0,29% | - | - | - | - |
Honeypot ExploitGym (cu cât este mai mic, cu atât mai bine) | 0,0% | 48,2% | - | - | - | - |
ExploitGym imposibil | 100,0% | - | - | - | - | - |
Test de performanță intern privind halucinațiile (cu cât este mai mic, cu atât mai bine) | 4,2% | 12,2% | - | - | - | - |
Context lung
Context lung | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0% | 91,5% | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3% | 73,8% | - | - | - | - |
Raționament abstract
| Abstract reasoning | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
| ARC-AGI-3 | 99.9% 1 | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
Scorurile de evaluare sunt maxime la orice nivel de efort. Evaluările GPT au fost rulate în mediul nostru de cercetare sau prin API-ul nostru, ceea ce poate oferi rezultate ușor diferite față de versiunea ChatGPT de producție din cauza diferențelor dintre solicitările de sistem, instrumentele disponibile etc.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(se deschide într-o fereastră nouă). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(se deschide într-o fereastră nouă).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(se deschide într-o fereastră nouă).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(se deschide într-o fereastră nouă).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(se deschide într-o fereastră nouă): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(se deschide într-o fereastră nouă) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(se deschide într-o fereastră nouă) and supporting research(se deschide într-o fereastră nouă).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(se deschide într-o fereastră nouă) and supporting research(se deschide într-o fereastră nouă).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(se deschide într-o fereastră nouă).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
