Una nova generació d'intel·ligència
Et presentem GPT‑6 Astra, el model més intel·ligent i alineat del món.
GPT‑6 Astra aplega anys de recerca i grans apostes en preentrenament, aprenentatge per reforç i alineació. Astra és d’avantguarda en l’ús de l’ordinador, la navegació web, l’enginyeria del programari, la ciberseguretat, la ciència i la feina professional. Astra assoleix el sostre del nivell 4 de FrontierMath amb una puntuació del 98 %, després d’haver ajudat ja a resoldre problemes oberts des de fa temps en matemàtiques. Astra també satura ARC-AGI-3 amb una puntuació del 99,9 % i ExploitBench amb una puntuació del 100 %. També estableix una nova d'avantguarda en l'ús d'ordinadors i navegadors, i gestiona la feina professional més exigent amb una velocitat, precisió i criteri inigualables.
GPT‑6 Astra comença a desplegar-se avui per a un conjunt limitat d'organitzacions i, durant els pròxims dies, estarà disponible per a tots els usuaris de ChatGPT Plus, Pro, Business i Enterprise, així com a través de l'API d'OpenAI, Microsoft Azure i AWS Bedrock.
Astra és el nostre model més alineat, amb millores substancials en la comprensió de la intenció de l’usuari i del comportament del model; pots delegar tasques amb més confiança en el criteri d’Astra. Com a manera de provar-ho, vam crear una nova avaluació basada en l’incident de Hugging Face que avalua si un model que s’enfronta a una tasca difícil o impossible va més enllà del seu àmbit previst. En comparació amb GPT‑5.6 Sol, que, sense les proteccions de producció, va anar més enllà de l’objectiu autoritzat el 48 % de les vegades, GPT‑6 Astra ho va fer en el 0 % dels casos.
El millor model d’ús de l’ordinador del món
GPT‑6 Astra marca una nova d'avantguarda en la velocitat, la precisió i la seguretat en l’ús de l’ordinador. Pot encarregar-se de tasques tedioses com ara emplenar formularis en línia, actualitzar registres de clients en un CRM i organitzar el teu calendari. Pot fer recerca en línia i redactar resums al teu correu electrònic o a l’editor de documents. Pot analitzar dades científiques, generar gràfics, crear un lloc web i executar proves de control de qualitat del front-end per assegurar-se que totes les funcionalitats d’aquest lloc funcionin. Pot ajudar-te a instal·lar i provar programari de manera autònoma i a resoldre problemes que vegis a la pantalla. Aquestes millores també es reflecteixen en els nostres resultats d’avaluació d’avantguarda.
Aquestes millores també comporten guanys significatius d’eficiència en tasques reals de treball del coneixement. En simulacions de latència a OSWorld 2.0, Astra aconsegueix un rendiment més alt en l’ús de l’ordinador en aproximadament un 47 % menys de temps per tasca que GPT‑5.6 Sol, amb una puntuació del 72,6 % en aproximadament 40 minuts per tasca, en comparació amb el 65,7 % en aproximadament 75 minuts.3
Les capacitats d’ús de l’ordinador de GPT‑6 Astra es poden observar en resultats de diversos àmbits, com ara el desenvolupament de videojocs, l’enginyeria elèctrica i el treball quotidià del coneixement:
Juntament amb Astra, també estem actualitzant l'entorn d'execució de Codex per millorar significativament la velocitat de l'ús de l'ordinador. Combinat amb l'eficiència d'Astra, això es tradueix en una finalització de tasques 1,9 vegades més ràpida en comparació amb l'experiència actual amb GPT‑5.6 Sol, en el banc de proves Mind2Web. Les millores de velocitat del model fan que pugui assumir per tu moltes tasques quotidianes que requereixen molt de temps, més ràpidament del que tu pots.
Un salt qualitatiu en el treball professional
GPT‑6 Astra combina els avenços en l’ús de l’ordinador amb una formació específica per a entorns professionals, per ajudar a abordar tasques laborals complexes. Combina la intel·ligència necessària per a problemes complexos amb la capacitat de dur a terme fluxos de treball de diversos passos i produir documents, fulls de càlcul i presentacions professionals.
GPT‑6 Astra és el nostre millor model per ajustar-se a les plantilles existents i produir diapositives ben maquetades que transmeten de manera concisa els punts clau mitjançant una narrativa estructurada. Crea documents, presentacions, fulls de càlcul i anàlisis clars i ben estructurats que segueixen les teves plantilles i s’ajusten al teu estil d’escriptura i estil visual. Astra també s’ha entrenat específicament per incorporar als resultats només el context que importa, en lloc de repetir informació innecessària per a la tasca en qüestió. Tot això vol dir que pot generar artefactes més immediatament utilitzables que s’ajusten al teu context empresarial i als teus estàndards.
GPT‑6 Astra també aporta un criteri visual més sòlid als llocs web, jocs, aplicacions i renderitzacions que crea. Amb Sites(s'obre en una finestra nova) a ChatGPT, Astra pot crear, allotjar i compartir llocs web, aplicacions web i jocs directament a partir d'una indicació.
Quan les instruccions deixen marge per a la interpretació, GPT‑6 Astra és millor que els models anteriors a l’hora de prendre la decisió correcta. Utilitza el context per omplir els buits habituals i fa preguntes concretes quan la resposta podria canviar el resultat. A Codex, pot fer preguntes de manera asíncrona mentre continua treballant en tasques que no depenen de la teva resposta. Si no respons, continua fent suposicions raonables quan escau, però espera les teves indicacions per a les decisions importants.
Els exemples següents mostren com Astra col·labora en tasques quotidianes en què la informació que falta pot canviar substancialment la resposta.
Astra també manté millor el rumb a mesura que evoluciona una tasca. De vegades, els models anteriors tractaven els missatges d’orientació com un objectiu nou i perdien de vista la sol·licitud original o les restriccions anteriors. Astra incorpora nous requisits, canvia de rumb quan se li demana i respon preguntes secundàries sense perdre de vista la tasca més àmplia.
Programació
GPT‑6 Astra és el millor model per a l'enginyeria de programari fins ara.
"GPT‑6 Astra ofereix un rendiment capdavanter en les nostres proves internes de programació i mostra un clar pas endavant en les avaluacions de la intuïció de negociació en comparació amb GPT‑5.6 Sol. Quan s’utilitza per a la programació agentiva, GPT‑6 Astra es comunica d’una manera més fàcil de seguir per als desenvolupadors i produeix codi que requereix menys iteracions per assolir qualitat de producció".
"Vam provar Astra amb esforç baix, mitjà i alt en una de les nostres avaluacions de primera generació, i va quedar significativament per davant de GPT 5.6 Sol. Un esforç més alt permet més iteracions en una compilació nova, més verificació mitjançant proves al navegador i una preferència per l’execució de codi en lloc d’aplicar pegats. Entendre com un model dedica el seu esforç és la manera com oferim a milions de creadors una via més ràpida i fiable des de la idea fins a una aplicació funcional".
Amb Astra, presentem una manera nova perquè Codex conservi i recuperi el context quan s’omple la finestra de context. Històricament, els models han utilitzat la condensació de context per resumir la feina durant sessions llargues, com ara quan es depuren problemes complexos o s’aborden refactoritzacions grans. Cada condensació de context pot ometre detalls sobre per què ha fallat una correcció o com es comporta un component. A Codex, Astra pot conservar notes entre finestres de context i preservar els detalls acumulats sense comprimir-los repetidament en un únic resum. Les finestres de context anteriors es poden continuar cercant, de manera que Astra pot trobar requisits o resultats de proves de missatges anteriors i sortides d’eines, fins i tot si aquesta informació no s’havia recollit a les seves notes. Pots activar aquesta funció experimental al teu config.toml de Codex(s'obre en una finestra nova) i es convertirà en l’opció predeterminada per a Astra en les properes setmanes.
Fer avançar els descobriments científics
GPT‑6 Astra és un gran avenç per al descobriment científic, les matemàtiques i la salut. Avui compartim dos resultats més sobre les distàncies entre nombres primers [WITH LINK]. Astra també estableix nous rècords en un conjunt d’avaluacions científiques:
Astra pot ajudar en la feina pràctica que hi ha darrere de la descoberta científica. En combinar el raonament científic amb l’ús de l’ordinador, pot treballar directament amb programari especialitzat per examinar dades i explorar resultats, ajudant els investigadors a avaluar l’evidència i decidir què investigar a continuació.
Ciberseguretat
Astra representa un salt qualitatiu en les capacitats de ciberseguretat. La seva capacitat per identificar i desenvolupar exploits de dia zero pot ajudar els defensors a corregir punts febles, però també crea la necessitat de mesures de protecció més robustes. Per entendre l’abast d’aquestes capacitats, vam utilitzar avaluacions fetes per experts interns i de tercers.
Primer vam provar Astra a ExploitBench i ExploitGym, que mesuren si els models poden aconseguir l’execució de codi arbitrari en bases de codi vulnerables.
Ateses les possibles preocupacions que l’exposició a vulnerabilitats històriques de programari pogués haver afectat els resultats dels bancs de proves, també vam avaluar Astra en dos bancs de proves nous. D’una banda, vam crear una avaluació interna, "ExploitBench (juny–agost de 2026)", per provar el desenvolupament d’explotacions utilitzant vulnerabilitats dels tres mesos anteriors. 2 Astra va assolir taxes d'execució de codi arbitrari substancialment més altes que GPT‑5.6 Sol en aquest conjunt de dades, tot fent servir molts menys segments de sortida. Durant l’avaluació, Astra va descobrir i utilitzar dues tècniques d’escapament de l’entorn aïllat del munt de V8 de Chrome desconegudes fins aleshores. Estem comunicant totes dues vulnerabilitats als seus mantenidors.
També vam provar Astra amb SRE-Bench, un banc de proves que mesura si els models poden fer enginyeria inversa de programari binari per entendre'n la lògica principal. Els autors del benchmark van crear el programari des de zero i en van mantenir el codi font privat. Astra va resoldre el 88,0 % de les tasques en un sol intent i el 99,2 % en un màxim de quatre intents, en comparació amb el 55,9 % i el 68,7 % de GPT‑5.6 Sol, respectivament.
Més enllà de les proves de referència, les avaluacions dirigides per experts van constatar que Astra podia utilitzar vulnerabilitats desconegudes fins aleshores per aconseguir l’execució de codi arbitrari en navegadors reforçats i crear explotacions d’escalada de privilegis per a sistemes operatius reforçats. En conjunt, aquests resultats van fonamentar la nostra decisió que Astra ha assolit el llindar crític en ciberseguretat segons el nostre entorn de treball de preparació.
Com vam comentar a The Defender’s Window, les capacitats cibernètiques d’avantguarda poden ajudar els defensors a trobar punts febles més ràpidament, però també fan que aquests punts febles siguin més fàcils d’explotar, fet que fa més urgent que els defensors s’hi adaptin.
Per a la versió d’Astra que es llança avui, admetem tasques defensives importants, com ara la revisió segura del codi, l’aplicació de pegats i el modelatge d’amenaces. No obstant això, de manera predeterminada, Astra es negarà a dur a terme tasques avançades de ciberseguretat, com ara el descobriment d’exploits. Mitjançant OpenAI Daybreak, estem desplegant, estem desplegant un accés menys restrictiu per a un grup alfa de defensors de ciberseguretat de confiança dins del programa OpenAI Daybreak. Això amplia l’accés als fluxos de treball de seguretat defensiva, incloent-hi el triatge i la validació de vulnerabilitats, l’anàlisi de programari maliciós, l’enginyeria de detecció i la validació de pegats. Tenim previst ampliar encara més l’accés a través de Daybreak Blue.
També hem reforçat les nostres proteccions contra possibles usos cibernètics indeguts, partint del nostre conjunt de proteccions per a GPT‑5.6 Sol. Aquestes inclouen un entrenament més sòlid de la robustesa del model per resistir millor possibles evasions de proteccions de seguretat i més context per als nostres sistemes de supervisió. Hem continuat fent proves rigoroses internes i externes, incloses proves automatitzades amb els nostres atacants interns d'equip vermell. Hi ha més detalls sobre les nostres proteccions i proves cibernètiques disponibles a la fitxa del model d'Astra i al nostre blog.
Alinear i desplegar GPT‑6 Astra de manera responsable
Astra és el nostre model més alineat. Astra destaca per actuar amb cura, respectar els límits de les tasques i comunicar-se amb transparència. Aquest treball és el producte més recent del nostre programa de recerca de llarga durada, centrat a entrenar models que es mantinguin alineats amb la intenció humana de principi a fi.
En entorns sensibles, Astra actua amb una cautela proporcional al risc associat. En una avaluació de tasques d’ús de l’ordinador seleccionades expressament per provocar comportaments inadequats, Astra va obtenir millors resultats a l’hora d’evitar conseqüències no desitjades. L’execució amb mesures de seguretat addicionals proporcionades per defecte va oferir un rendiment encara superior.
Astra causes fewer misaligned outcomes than any other frontier models tested. For a fair comparison, we used a generic computer-using-agent harness (based on the native computer use tools available in both the OpenAI Responses API(s'obre en una finestra nova) and Anthropic Messages API(s'obre en una finestra nova)) and without additional protections that are normally deployed to Codex and ChatGPT Work users (auto-review, confirmation policy). 16
Astra també és més probable que operi dins dels límits establerts per l’usuari i implícits en el seu entorn. En una avaluació interna, Astra no va intentar mai eludir una denegació de la revisió automàtica de Codex. Això continuava sent cert fins i tot quan la revisió automàtica s’havia configurat deliberadament perquè es pogués eludir i la tasca fos impossible de completar altrament. Aquest respecte per les restriccions de l'entorn és coherent amb els resultats de la nostra avaluació de tasques cibernètiques impossibles, que vam compartir a la introducció d'aquesta publicació, i amb altres troballes documentades a la nostra fitxa del model(s'obre en una finestra nova).
Astra també mostra reduccions substancials del comportament enganyós. Les persones que deleguen feina necessiten una comprensió clara de les capacitats d’un model i informació honesta sobre el seu progrés. Això mesura un aspecte de l’honestedat; reduir l’engany deliberat continua sent un àmbit d’atenció més ampli del nostre treball d’alineament.
En la nostra avaluació d’al·lucinacions sobre capacitats, Astra mostra una millora substancial respecte de GPT‑5.6 Sol, ja que fa menys afirmacions enganyoses sobre les seves capacitats.
Our evaluations found Astra’s written reasoning harder to monitor than GPT‑5.6 Sol’s, based on tests that explicitly asked it to evade monitoring. We attribute this to Astra’s greater control over written reasoning on simpler tasks and ability to solve problems with fewer written steps. Astra still appears to struggle to conceal the reasoning needed for complex tasks, but we take the decline seriously. Improving monitorability remains a research priority, and the accompanying system card(s'obre en una finestra nova) details our findings and ongoing work.
Alignment training is core to our approach to deployment. As an additional layer of defenses, we also build system safeguards like Codex Auto-review(s'obre en una finestra nova) and monitoring agents’ reasoning and actions to help detect and contain unsafe behavior. As described in our safety update, we are also deploying misalignment monitoring in production for Astra-class models in order to have visibility into misalignment, and help contain its worst instances. These safeguards resemble our monitoring for internal deployments and involve a system of classifiers which check the model’s reasoning and actions for unauthorized behavior and automatically stop potentially unauthorized activity.
Given the significant increase in Astra’s cybersecurity capabilities, we are being especially careful to make this deployment safe and secure. Extra safety checks can sometimes slow, pause, or stop legitimate work, including defensive cybersecurity. If a task is paused in ChatGPT or Codex, you may be asked to review the action before continuing. In the API, the task will stop. These checks can sometimes interrupt legitimate work, and we are continuing to iterate on this system to reduce unnecessary interruptions. Misalignment monitoring cannot replace alignment: our goal is to build models that reliably stay within their authorized scope, so these protections do not need to intervene.
Disponibilitat
GPT‑6 Astra comença a desplegar-se avui per a empreses i clients del nostre programa d'accés de confiança, i estarà disponible de manera generalitzada per a les persones subscrites a ChatGPT Plus, Pro, Business i Enterprise durant els pròxims dies. . L'ús d'Astra està inclòs en el límit d'ús existent dels plans Pro de 100 $ i 200 $ i del pla Business de 100 $, sense límits de peticions ni restriccions addicionals. Les persones amb una subscripció Plus de 20 $ i els clients amb el pla Business estàndard poden accedir a GPT‑6 Astra amb límits més baixos, amb l'opció de comprar crèdits per obtenir accés addicional. Els administradors d'Enterprise poden activar Astra per al seu espai de treball; l'accés està desactivat per defecte en el llançament.
Els usuaris de Pro Lite, Pro, Business i Enterprise també poden utilitzar GPT‑6 Astra al Chat. Astra és compatible amb la retenció de dades nul·la per als clients d'API elegibles i, tal com vam compartir el mes passat, estem provant el processament privat de seguretat per reforçar la supervisió de la seguretat alhora que preservem la privadesa dels clients.
Per als desenvolupadors, GPT‑6 Astra està disponible a l'API d'OpenAI com a gpt-6-astra i també està disponible a AWS Bedrock. Els preus estàndard de l'API d'OpenAI són de $10 per milió de segments d'entrada i de $50 per milió de segments de sortida. S'apliquen tarifes diferents per a les lectures i les escriptures de la memòria cau. El mode ràpid està disponible per a GPT‑6 Astra a l'API i ofereix fins a 2,5 vegades la velocitat del processament estàndard al doble del preu estàndard.
Ús de l'ordinador
| Ús de l'ordinador | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| OSWorld 2.0 (versió d’agost, puntuació parcial) | - | - | - | 66,1 % | 70,6 % | - |
| OSWorld 2.0 (versió d’agost, subconjunt fora de línia, puntuació parcial) | - | - | - | - | - | - |
| ScreenSpot Pro | 92,6 % | 76,8 % | - | - | - | - |
| BrowseComp | 92,1 % | 90,4 % | - | 87,4 % | 90,8 % | - |
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
BenchCAD | 95.9% | 83.3% | 84.3% 5 | 67.5% 5 | 82.1% 5 | - |
BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
Programació
| Programació | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| Artificial Analysis Coding Agent Index v1.1 | - | Puntuació de l’índex: 80 | - | Puntuació de l’índex 77,2 | - | - |
| Artificial Analysis Coding Agent Index v1.4 | - | - | - | - | - | - |
| Expert-SWE (intern, actualitzat) | - | 83,1 % | - | - | - | - |
| DeepSWE v1.1 | 74,1 % | 70,8 % | 67,4 % | 69,9 % | 68,8 % | 65,3 % |
| Terminal-Bench 2.1 | 86,7 % | 88,8 % | 91,4 % | 83,1 % | 89,1 % | 85,8 % |
| Unicorn Voyager Front-end | - | 38,3 % | - | - | - | - |
| FrontierCode 1.1 Principal (puntuació) | - | - | 50,9 % | 51,6 % | 53,4 % | 43,6 % |
| Terminal-Bench 4.0 | 57,7 % | 37,3 % | 55,8 % | 42,0 % | 52,3 % | - |
| BenchCAD | 88,7 % | 70,6 % | 43,7% | 37,6 % | 36,6 % | - |
| BenchCAD (eina de Python) | 95,9 % | 83,3 % | 84,3 % | 67,5 % | 82,1 % | - |
Acadèmic
| Acadèmic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,2 % | 94,5 % |
| Informàtica teòrica | - | 75,4 % | - | - | - | - |
| FrontierMath nivell 1-3 (v2) | - | 89,0 % | 90,2 % | 87,0 % | 85,6 % | 71,6 % |
| FrontierMath nivell 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 87,8 % | 73,2% | 36,6 % |
| Humanity's Last Exam (eines) | - | - | 65,0 % | 63,8 % | 63,6 % | - |
| Humanity's Last Exam (sense eines) | - | - | 59,1 % | 55,5 % | 54,9 % | 47,9 % |
Ciència i salut
| Ciència i salut | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| GeneBench Pro | 37,1 % | 32,3 % | - | - | - | - |
| MedChemBench (intern) | 49,7 % | 47,4 % | - | - | - | - |
| LifeSci Bench | 60,8 % | 59,9 % | - | - | - | - |
| HealthBench Professional (ajustat per longitud) | 63,4 % | 60,5 % | 62,1 % | 60,9 % | 59,8 % | 48,7 % |
Ciberseguretat
| Ciberseguretat | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| CVE-Bench | - | 94,1 % | - | - | - | - |
| Reptes Capture-the-Flag | - | 96,7 % | - | - | - | - |
| SEC-Bench Pro | 85,4 % | 79,1 % | - | - | - | - |
| CyberGym | - | 84,5 % | - | - | - | - |
| ExploitBench | 100,0 % | 78,5 % | - | - | 70,0 % | - |
| ExploitGym (2 hores) | - | 33,7 %? | - | - | 171 | - |
| ExploitGym (6 hores) | - | 33,7 %? | - | - | 191 | - |
Alineació
Alineació | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Punt de referència intern de seguretat en l’ús de l’ordinador (com més baix, millor) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Prova comparativa interna de seguretat d’ús de l’ordinador, amb autorevisió (com més baix, millor) | 1,8 % | 4,3 % | - | - | - | - |
Índex de referència intern d’elusió (com més baix, millor) | 0,00 % | 0,29 % | - | - | - | - |
Esquer d’ExploitGym (com més baix, millor) | 0,0 % | 48,2 % | - | - | - | - |
ExploitGym impossible | 100,0 % | - | - | - | - | - |
Prova de referència interna d’al·lucinació (com més baixa, millor) | 4,2 % | 12,2 % | - | - | - | - |
Context llarg
Context llarg | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3 % | 73,8 % | - | - | - | - |
Raonament abstracte
| Raonament abstracte | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
| ARC-AGI-3 | 99,9 % | 7,8 % | - | - | 30,2 % | - |
| ARC-AGI-2 | 95,0 % | 92,5 % | 90,0 % | 89,2 % | 90,4 % | 84,6 % |
| ARC-AGI-1 | 98,5 % | 97,5 % | 97,5 % | 98,5 % | 97,5 % | 95,5 % |
Les puntuacions d’avaluació són les màximes en qualsevol nivell d’esforç. Les avaluacions de GPT es van executar al nostre entorn de recerca o mitjançant la nostra API, cosa que pot proporcionar una sortida lleugerament diferent de la de ChatGPT en producció a causa de diferències en les indicacions del sistema, les eines disponibles, etc.
FOOTNOTES
- 1
On ARC-AGI-3, GPT-6 Astra was run with our responses API harness, which changes two settings to better match real-world performance. The changes do not specifically target ARC-AGI-3.
- 2
GPT-5.6 Sol refers to the version available in our API, ChatGPT Codex, and ChatGPT Work. The version in ChatGPT Chat is slightly different.
- 3
OSWorld V2-Offline is a subset of the original OSWorld V2 that works without internet access. Claude model performance on OSWorld-V2 Offline was reproduced by the authors on the official leaderboard(s'obre en una finestra nova). On OSWorld 2.0, the scores for Claude use the official settings, and not the modified tasks and modified grading from the Fable 5.1 System Card.
- 4
- 5
On BenchCAD, Claude's scores reflect 3 modifications to the eval, detailed in the Fable 5.1 System Card(s'obre en una finestra nova).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon, and Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(s'obre en una finestra nova).” arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower, and Peter Jonas. “The OpenScore String Quartet Corpus(s'obre en una finestra nova).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, pp. 49–57. ACM, 2023.
- 8
On FrontierCode, GPT-6 Astra was run with a developer message similar to a section of its developer message in Codex(s'obre en una finestra nova): "Avoid creating excessive test files. Create a new test file only when required by repository conventions or when no existing file is a suitable home. Avoid unrelated cleanup and unnecessary complexity. Reuse suitable existing utilities. Read relevant repository instructions and inspect nearby code, tests, documentation, and CI. Follow established conventions. The goal is clean, mergeable code." The prompt was not optimized for the eval.
- 9
The first concerns how close together prime numbers can occur, however far along the number line you go. For more than a decade, the best known result established that infinitely many pairs of primes are at most 246 apart. Julia Stadlmann(s'obre en una finestra nova) recently improved that bound to 240. Astra helped establish a stronger bound of 186, showing that infinitely many pairs occur within this smaller distance. Short prime gaps: Proof(s'obre en una finestra nova) and supporting research(s'obre en una finestra nova).
- 10
The second concerns unusually large gaps between primes. Astra improved a term in a bound on these gaps that had remained unchanged for more than 80 years. We’re sharing the proofs and abridged chain of thought and verification materials for both results. Large prime gaps: Proof(s'obre en una finestra nova) and supporting research(s'obre en una finestra nova).
- 11
- 12
- 13
- 14
ExploitBench (June–August 2026) contains 20 high-severity V8 vulnerabilities across 13 stable Chrome releases. The benchmark tests whether agents can achieve arbitrary code execution in V8 and official Chrome releases for Linux by exploiting each specified vulnerability. Some included vulnerabilities may not permit arbitrary code execution under the evaluation’s constraints, so a 100% success rate may not be achievable. Note: the 5.5% score of GPT-5.6 Sol is an artifact of the 300-turn limit in the benchmark, which is not a limit that real customers using max would have. The model at similar settings achieved an 11.5% score when hitting fewer limits.
- 15
Jeremy Spence et al. “The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(s'obre en una finestra nova).” arXiv:2608.11469v1, 2026.
- 16
When we test across third-party models, we use a simpler research setup. Codex has a more complex production configuration, which can result in different raw-model error rates. Provider-side safeguards and computer-tool implementations still differ. Users do not experience the no-confirmation scenario in Codex, as it's an internal research configuration.
- 17
