Una nova generació d'intel·ligència
Actualització del 22 de setembre del 2026: estem ampliant la nostra família GPT‑6 amb GPT‑6 Sol i GPT‑6 Luna. Obtén més informació.
Et presentem GPT‑6 Astra, el model més intel·ligent i alineat del món.
GPT‑6 Astra aplega anys de recerca i grans apostes en preentrenament, aprenentatge per reforç i alineació. Astra és d’avantguarda en l’ús de l’ordinador, la navegació web, l’enginyeria del programari, la ciberseguretat, la ciència i la feina professional. Astra assoleix el sostre del nivell 4 de FrontierMath amb una puntuació del 98 %, després d’haver ajudat ja a resoldre problemes oberts des de fa temps en matemàtiques. Astra també satura ARC-AGI-3 amb una puntuació del 99,9 % i ExploitBench amb una puntuació del 100 %. També estableix una nova d'avantguarda en l'ús d'ordinadors i navegadors, i gestiona la feina professional més exigent amb una velocitat, precisió i criteri inigualables.
GPT‑6 Astra comença a desplegar-se avui per a un conjunt limitat d'organitzacions i, durant els pròxims dies, estarà disponible per a tots els usuaris de ChatGPT Plus, Pro, Business i Enterprise, així com a través de l'API d'OpenAI, Microsoft Azure i AWS Bedrock.
Astra és el nostre model més alineat, amb millores substancials en la comprensió de la intenció de l’usuari i del comportament del model; pots delegar tasques amb més confiança en el criteri d’Astra. Com a manera de provar-ho, vam crear una nova avaluació basada en l’incident de Hugging Face que avalua si un model que s’enfronta a una tasca difícil o impossible va més enllà del seu àmbit previst. En comparació amb GPT‑5.6 Sol, que, sense les proteccions de producció, va anar més enllà de l’objectiu autoritzat el 48 % de les vegades, GPT‑6 Astra ho va fer en el 0 % dels casos.
El millor model d’ús de l’ordinador del món
GPT‑6 Astra marca una nova d'avantguarda en la velocitat, la precisió i la seguretat en l’ús de l’ordinador. Pot encarregar-se de tasques tedioses com ara emplenar formularis en línia, actualitzar registres de clients en un CRM i organitzar el teu calendari. Pot fer recerca en línia i redactar resums al teu correu electrònic o a l’editor de documents. Pot analitzar dades científiques, generar gràfics, crear un lloc web i executar proves de control de qualitat del front-end per assegurar-se que totes les funcionalitats d’aquest lloc funcionin. Pot ajudar-te a instal·lar i provar programari de manera autònoma i a resoldre problemes que vegis a la pantalla. Aquestes millores també es reflecteixen en els nostres resultats d’avaluació d’avantguarda.
Aquestes millores també comporten guanys significatius d’eficiència en tasques reals de treball del coneixement. En simulacions de latència a OSWorld 2.0, Astra aconsegueix un rendiment més alt en l’ús de l’ordinador en aproximadament un 47 % menys de temps per tasca que GPT‑5.6 Sol, amb una puntuació del 72,6 % en aproximadament 40 minuts per tasca, en comparació amb el 65,7 % en aproximadament 75 minuts.3
Les capacitats d’ús de l’ordinador de GPT‑6 Astra es poden observar en resultats de diversos àmbits, com ara el desenvolupament de videojocs, l’enginyeria elèctrica i el treball quotidià del coneixement:
Juntament amb Astra, també estem actualitzant l'entorn d'execució de Codex per millorar significativament la velocitat de l'ús de l'ordinador. Combinat amb l'eficiència d'Astra, això es tradueix en una finalització de tasques 1,9 vegades més ràpida en comparació amb l'experiència actual amb GPT‑5.6 Sol, en el banc de proves Mind2Web. Les millores del model en velocitat fan que pugui encarregar-se de moltes tasques de la vida que requereixen molt de temps per a tu, més ràpid que tu.4
Un salt qualitatiu en el treball professional
GPT‑6 Astra combina els avenços en l’ús de l’ordinador amb una formació específica per a entorns professionals, per ajudar a abordar tasques laborals complexes. Combina la intel·ligència necessària per a problemes complexos amb la capacitat de dur a terme fluxos de treball de diversos passos i produir documents, fulls de càlcul i presentacions professionals.
GPT‑6 Astra és el nostre millor model per ajustar-se a les plantilles existents i produir diapositives ben maquetades que transmeten de manera concisa els punts clau mitjançant una narrativa estructurada. Crea documents, presentacions, fulls de càlcul i anàlisis clars i ben estructurats que segueixen les teves plantilles i s’ajusten al teu estil d’escriptura i estil visual. Astra també s’ha entrenat específicament per incorporar als resultats només el context que importa, en lloc de repetir informació innecessària per a la tasca en qüestió. Tot això vol dir que pot generar artefactes més immediatament utilitzables que s’ajusten al teu context empresarial i als teus estàndards.
GPT‑6 Astra també aporta un criteri visual més sòlid als llocs web, jocs, aplicacions i renderitzacions que crea. Amb Sites(s'obre en una finestra nova) a ChatGPT, Astra pot crear, allotjar i compartir llocs web, aplicacions web i jocs directament a partir d'una indicació.
Quan les instruccions deixen marge per a la interpretació, GPT‑6 Astra és millor que els models anteriors a l’hora de prendre la decisió correcta. Utilitza el context per omplir els buits habituals i fa preguntes concretes quan la resposta podria canviar el resultat. A Codex, pot fer preguntes de manera asíncrona mentre continua treballant en tasques que no depenen de la teva resposta. Si no respons, continua fent suposicions raonables quan escau, però espera les teves indicacions per a les decisions importants.
Els exemples següents mostren com Astra col·labora en tasques quotidianes en què la informació que falta pot canviar substancialment la resposta.
Astra també manté millor el rumb a mesura que evoluciona una tasca. De vegades, els models anteriors tractaven els missatges d’orientació com un objectiu nou i perdien de vista la sol·licitud original o les restriccions anteriors. Astra incorpora nous requisits, canvia de rumb quan se li demana i respon preguntes secundàries sense perdre de vista la tasca més àmplia.
Programació
GPT‑6 Astra és el millor model per a l'enginyeria de programari fins ara.
"GPT‑6 Astra ofereix un rendiment capdavanter en les nostres proves internes de programació i mostra un clar pas endavant en les avaluacions de la intuïció de negociació en comparació amb GPT‑5.6 Sol. Quan s’utilitza per a la programació agentiva, GPT‑6 Astra es comunica d’una manera més fàcil de seguir per als desenvolupadors i produeix codi que requereix menys iteracions per assolir qualitat de producció".
"Vam provar Astra amb esforç baix, mitjà i alt en una de les nostres avaluacions de primera generació, i va quedar significativament per davant de GPT 5.6 Sol. Un esforç més alt permet més iteracions en una compilació nova, més verificació mitjançant proves al navegador i una preferència per l’execució de codi en lloc d’aplicar pegats. Entendre com un model dedica el seu esforç és la manera com oferim a milions de creadors una via més ràpida i fiable des de la idea fins a una aplicació funcional".
Amb Astra, presentem una manera nova perquè Codex conservi i recuperi el context quan s’omple la finestra de context. Històricament, els models han utilitzat la condensació de context per resumir la feina durant sessions llargues, com ara quan es depuren problemes complexos o s’aborden refactoritzacions grans. Cada condensació de context pot ometre detalls sobre per què ha fallat una correcció o com es comporta un component. A Codex, Astra pot conservar notes entre finestres de context i preservar els detalls acumulats sense comprimir-los repetidament en un únic resum. Les finestres de context anteriors es poden continuar cercant, de manera que Astra pot trobar requisits o resultats de proves de missatges anteriors i sortides d’eines, fins i tot si aquesta informació no s’havia recollit a les seves notes. Pots activar aquesta funció experimental al teu config.toml de Codex(s'obre en una finestra nova) i es convertirà en l’opció predeterminada per a Astra en les properes setmanes.
Fer avançar els descobriments científics
Astra pot ajudar en la feina pràctica que hi ha darrere de la descoberta científica. En combinar el raonament científic amb l’ús de l’ordinador, pot treballar directament amb programari especialitzat per examinar dades i explorar resultats, ajudant els investigadors a avaluar l’evidència i decidir què investigar a continuació.
Ciberseguretat
Com vam comentar a la nostra actualització de seguretat, Astra representa un salt important en les capacitats cibernètiques i assoleix el llindar crític en ciberseguretat segons el nostre entorn de treball de preparació. La seva capacitat per identificar i desenvolupar exploits de dia zero pot ajudar els defensors a trobar i corregir punts febles, però també crea la necessitat de mesures de protecció més robustes. Per entendre l’abast d’aquestes capacitats, vam sotmetre Astra a avaluacions fetes per experts interns i de tercers.
Primer vam provar el model sense proteccions de producció a ExploitBench i ExploitGym, que avaluen si els models poden convertir vulnerabilitats de programari conegudes en explotacions funcionals. A ExploitBench, Astra va obtenir una puntuació perfecta del 100 %, en comparació amb el 78,5 % de GPT‑5.6 Sol, el nostre model anterior d’avantguarda amb capacitats de ciberseguretat. A ExploitGym, Astra va assolir una taxa d’èxit del 42,4 %, en comparació amb el 30,3 % de GPT‑5.6 Sol, tot fent servir substancialment menys segments de sortida.13
Ateses les preocupacions que l’exposició a vulnerabilitats històriques de programari pogués haver afectat els resultats dels bancs de proves, també vam avaluar Astra en dos bancs de proves nous. D’una banda, vam crear una avaluació interna, "ExploitBench (juny–agost de 2026)", per provar el desenvolupament d’explotacions utilitzant vulnerabilitats dels tres mesos anteriors.14 Astra va assolir taxes d'execució de codi arbitrari substancialment més altes que GPT‑5.6 Sol en aquest conjunt de dades, tot fent servir molts menys segments de sortida. Durant l’avaluació, Astra fins i tot va descobrir i utilitzar dues vulnerabilitats de dia zero desconegudes fins aleshores. Estem comunicant totes dues vulnerabilitats als seus mantenidors.
També vam provar Astra amb SRE-Bench15, un banc de proves que mesura si els models poden fer enginyeria inversa de binaris de programari per entendre'n la lògica principal sense accés al codi font original. Astra va resoldre el 88,0 % de les tasques en un sol intent i el 99,2 % en un màxim de quatre intents, en comparació amb el 55,9 % i el 68,7 % de GPT‑5.6 Sol, respectivament.
Més enllà de les proves de referència, les avaluacions dirigides per experts van constatar que Astra, quan s’executava sense les salvaguardes de producció, podia utilitzar vulnerabilitats desconegudes fins aleshores per aconseguir l’execució de codi arbitrari en navegadors reforçats i crear explotacions d’escalada de privilegis per a sistemes operatius reforçats.
Com vam comentar a The Defender’s Window, les capacitats cibernètiques d’avantguarda poden ajudar els defensors a trobar punts febles més ràpidament, però també fan que aquests punts febles siguin més fàcils d’explotar, fet que fa més urgent que els defensors s’hi adaptin. Amb la versió d’Astra que es llança avui, els defensors poden fer-la servir per dur a terme tasques com ara la revisió de seguretat del codi i l’aplicació de pegats.
No obstant això, Astra es negarà a dur a terme tasques de ciberseguretat més avançades, com ara la creació d’explotacions de prova de concepte per a vulnerabilitats. Mitjançant OpenAI Daybreak, tenim previst ampliar l’accés i desplegar mesures de protecció menys restrictives durant les pròximes setmanes. Això permetrà més fluxos de treball de seguretat defensiva, incloent-hi la validació de vulnerabilitats i de proves de concepte, l’anàlisi de programari maliciós i l’enginyeria de detecció.
També hem reforçat les nostres proteccions contra possibles usos cibernètics indeguts, partint del nostre conjunt de proteccions per a GPT‑5.6 Sol. Aquestes inclouen una major robustesa del model per resistir millor possibles evasions de proteccions de seguretat i més context per als nostres sistemes de supervisió. Hem continuat fent proves rigoroses internes i externes, incloses avaluacions automatitzades amb els nostres atacants interns d'equip vermell. Hi ha més detalls sobre les nostres proteccions cibernètiques i proves disponibles al resum de seguretat i a la fitxa del model(s'obre en una finestra nova) d'Astra.
Alinear i desplegar GPT‑6 Astra de manera responsable
Astra és el nostre model més alineat. Astra destaca per actuar amb cura, respectar els límits de les tasques i comunicar-se amb transparència. Aquest treball és el producte més recent del nostre programa de recerca de llarga durada, centrat a entrenar models que es mantinguin alineats amb la intenció humana de principi a fi.
En entorns sensibles, Astra actua amb una cautela proporcional al risc associat. En una avaluació de tasques d’ús de l’ordinador seleccionades expressament per provocar comportaments inadequats, Astra va obtenir millors resultats a l’hora d’evitar conseqüències no desitjades. L’execució amb mesures de seguretat addicionals proporcionades per defecte va oferir un rendiment encara superior.
Astra provoca menys resultats desalineats que qualsevol altre model d’avantguarda provat. Per a una comparació justa, hem utilitzat un entorn d'execució genèric per a agents informàtics (basat en les eines natives d'ús de l'ordinador disponibles tant a l' OpenAI Responses API(s'obre en una finestra nova) com a l' Anthropic Messages API(s'obre en una finestra nova)) i sense les proteccions addicionals que normalment s'apliquen als usuaris de Codex i ChatGPT Work (revisió automàtica, política de confirmació).
Astra també és més probable que operi dins dels límits establerts per l’usuari i implícits en el seu entorn. En una avaluació interna, Astra no va intentar mai eludir una denegació de la revisió automàtica de Codex. Això continuava sent cert fins i tot quan la revisió automàtica s’havia configurat deliberadament perquè es pogués eludir i la tasca fos impossible de completar altrament. Aquest respecte per les restriccions de l'entorn és coherent amb els resultats de la nostra avaluació de tasques cibernètiques impossibles, que vam compartir a la introducció d'aquesta publicació, i amb altres troballes documentades a la nostra fitxa del model(s'obre en una finestra nova).
Astra també marca noves fites en la comunicació transparent amb els usuaris. En una avaluació, Astra té una probabilitat tres vegades menor que GPT‑5.6 Sol de fer afirmacions inexactes sobre les seves capacitats i possibilitats d’ús.
En la nostra avaluació d’al·lucinacions sobre capacitats, Astra mostra una millora substancial respecte de GPT‑5.6 Sol, ja que fa menys afirmacions enganyoses sobre les seves capacitats.
Les nostres avaluacions van trobar que el raonament escrit d'Astra era més difícil de supervisar que el de GPT‑5.6 Sol, segons proves que li demanaven explícitament que evités la supervisió. Ho atribuïm al major control d’Astra sobre el raonament escrit en tasques més senzilles i a la seva capacitat de resoldre problemes amb menys passos escrits. Astra encara sembla tenir dificultats per ocultar el raonament necessari per a tasques complexes, però ens prenem seriosament aquest descens. Millorar la monitorabilitat continua sent una prioritat de recerca, i la fitxa del model(s'obre en una finestra nova) adjunta detalla les nostres conclusions i el treball en curs.
L’entrenament d’alineació és fonamental per al nostre enfocament del desplegament. Com a capa addicional de defensa, també desenvolupem proteccions del sistema, com ara la revisió automàtica(s'obre en una finestra nova) de Codex i la supervisió del raonament i les accions dels agents per ajudar a detectar i contenir comportaments insegurs. Tal com es descriu a la nostra actualització de seguretat, també estem desplegant en producció la supervisió de la desalineació per als models de la classe d'Astra, a fi de tenir visibilitat sobre la desalineació i ajudar a contenir-ne els casos més greus. Aquestes proteccions s'assemblen a la supervisió dels nostres desplegaments interns i inclouen un sistema de classificadors que comproven si el raonament i les accions del model mostren comportaments no autoritzats i aturen automàticament les activitats potencialment no autoritzades.
Atès l’augment significatiu de les capacitats de ciberseguretat d’Astra, estem extremant les precaucions per garantir que aquest desplegament sigui segur i protegit. Els controls de seguretat addicionals de vegades poden alentir, posar en pausa o aturar tasques legítimes, inclosa la ciberseguretat defensiva. Si es posa una tasca en pausa a ChatGPT o Codex, és possible que se't demani que revisis l'acció abans de continuar. A l’API, la tasca s’aturarà. Aquestes comprovacions de vegades poden interrompre feina legítima, i continuem perfeccionant aquest sistema per reduir les interrupcions innecessàries. La supervisió de desalineacions no pot substituir l'alineació: el nostre objectiu és crear models que es mantinguin de manera fiable dins del seu àmbit autoritzat, perquè aquestes proteccions no hagin d'intervenir.
Disponibilitat
GPT‑6 Astra comença a desplegar-se avui per a un conjunt limitat d'organitzacions i, durant els pròxims dies, estarà disponible per a tots els usuaris de ChatGPT Plus, Pro, Business i Enterprise, així com a través de l'API d'OpenAI, Microsoft Azure i AWS Bedrock. L'ús d'Astra està inclòs dins dels límits de les subscripcions existents; els usuaris i les empreses també podran comprar crèdits per a un ús addicional. Els usuaris dels plans Pro, Business i Enterprise també tindran accés a GPT‑6 Astra Pro. Els administradors d'Enterprise poden activar Astra per al seu espai de treball; l'accés està desactivat per defecte en el llançament.
Astra és compatible amb la retenció de dades nul·la per als clients d'API elegibles i, tal com vam compartir el mes passat, estem provant el processament privat de seguretat per reforçar la supervisió de la seguretat alhora que preservem la privadesa dels clients.
Per als desenvolupadors, GPT‑6 Astra estarà disponible a l'API d'OpenAI com a gpt-6-astra i a través de Microsoft Azure i Amazon Bedrock.
Els preus estàndard de l'API d'OpenAI són de 10 $ per milió de segments d'entrada i de 50 $ per milió de segments de sortida. S'apliquen tarifes diferents per a les lectures i les escriptures de la memòria cau. El mode ràpid està disponible per a GPT‑6 Astra a l'API i ofereix fins a dues vegades la velocitat del processament estàndard al doble del preu estàndard.
Ús de l'ordinador
| Ús de l'ordinador | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| OSWorld 2.0 (versió d’agost, puntuació parcial) | - | - | - | 66,1 % | 70,6 % | - |
| OSWorld 2.0 (versió d’agost, subconjunt fora de línia, puntuació parcial) | - | - | - | - | - | - |
| ScreenSpot Pro | 92,6 % | 76,8 % | - | - | - | - |
| BrowseComp | 92,1 % | 90,4 % | - | 87,4 % | 90,8 % | - |
Professional
Professional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Tasques internes de disseny | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Tasques internes de ciència de dades | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,77 |
Programació
| Programació | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 44,5 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 69,9 % | 73,7 % | 73,8 % |
| FrontierCode 1.1 Extended (puntuació) | 64,5 % 8 | 60,6 % | 63,6 % | 64,9 % | 63,6 % | 56,3 % |
| FrontierCode 1.1 Principal (puntuació) | 53,3 % 8 | 47,5 % | 50,9 % | 53,5 % | 53,4 % | 43,6 % |
| Tasques de migració de la base de dades interna | 63,9 % | 42,7 % | 57,8 % | 50,3 % | - | - |
| Índex d’agents de programació d’Artificial Analysis v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Acadèmic
| Acadèmic | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,2 % | 94,5 % |
| Informàtica teòrica | - | 75,4 % | - | - | - | - |
| FrontierMath nivell 1-3 (v2) | - | 89,0 % | 90,2 % | 87,0 % | 85,6 % | 71,6 % |
| FrontierMath nivell 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 87,8 % | 73,2% | 36,6 % |
| Humanity's Last Exam (eines) | - | - | 65,0 % | 63,8 % | 63,6 % | - |
| Humanity's Last Exam (sense eines) | - | - | 59,1 % | 55,5 % | 54,9 % | 47,9 % |
Ciència i salut
Alineació
Alineació | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Punt de referència intern de seguretat en l’ús de l’ordinador (com més baix, millor) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Prova comparativa interna de seguretat d’ús de l’ordinador, amb autorevisió (com més baix, millor) | 1,8 % | 4,3 % | - | - | - | - |
Índex de referència intern d’elusió (com més baix, millor) | 0,00 % | 0,29 % | - | - | - | - |
Esquer d’ExploitGym (com més baix, millor) | 0,0 % | 48,2 % | - | - | - | - |
ExploitGym impossible | 100,0 % | - | - | - | - | - |
Prova de referència interna d’al·lucinació (com més baixa, millor) | 4,2 % | 12,2 % | - | - | - | - |
Context llarg
Context llarg | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3 % | 73,8 % | - | - | - | - |
Raonament abstracte
| Raonament abstracte | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9 % 1 | 7,8 % | - | - | 30,2 % | - |
| ARC-AGI-2 | 95,0 % | 92,5 % | 90,0 % | 89,2 % | 90,4 % | - |
| ARC-AGI-1 | 98,5 % | 97,5 % | 97,5 % | 98,5 % | 97,5 % | - |
Les puntuacions d’avaluació són les màximes en qualsevol nivell d’esforç. Les avaluacions de GPT es van executar al nostre entorn de recerca o mitjançant la nostra API, cosa que pot proporcionar una sortida lleugerament diferent de la de ChatGPT en producció a causa de diferències en les indicacions del sistema, les eines disponibles, etc.
NOTES AL PEU
- 1
A l'ARC-AGI-3, GPT-6 Astra es va executar amb el nostre entorn d'execució de l'API de respostes, que modifica dos paràmetres per adaptar-se millor al rendiment en el món real. Els canvis no s'adrecen específicament a ARC-AGI-3.
- 2
GPT-5.6 Sol fa referència a la versió disponible a la nostra API, ChatGPT Codex i ChatGPT Work. La versió de ChatGPT Chat és lleugerament diferent.
- 3
OSWorld V2-Offline és un subconjunt de l’OSWorld V2 original que funciona sense accés a Internet. El rendiment del model Claude a OSWorld-V2 Offline va ser reproduït pels autors a la classificació oficial(s'obre en una finestra nova). A OSWorld 2.0, les puntuacions de Claude utilitzen la configuració oficial i no les tasques modificades ni el sistema de puntuació modificat de la fitxa del model Fable 5.1.
- 4
- 5
A BenchCAD, les puntuacions de Claude reflecteixen tres modificacions de l’avaluació, detallades a la fitxa del model Fable 5.1(s'obre en una finestra nova).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon i Noah A. Smith. "LEGATO: un enfocament generalitzable de gran escala de principi a fi per a l'OMR tipogràfic(s'obre en una finestra nova)". arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower i Peter Jonas. "The OpenScore String Quartet Corpus(s'obre en una finestra nova)." Actes de la 10a Conferència Internacional sobre Biblioteques Digitals per a la Musicologia, pàgs. 49–57. ACM, 2023.
- 8
A FrontierCode, GPT-6 Astra es va executar amb un missatge de desenvolupador semblant a una secció del seu missatge de desenvolupador a Codex(s'obre en una finestra nova): "Evita crear un nombre excessiu de fitxers de prova. Crea un fitxer de prova nou només quan ho requereixin les convencions del repositori o quan no hi hagi cap fitxer existent que sigui adequat. Evita les tasques de neteja no relacionades i la complexitat innecessària. Reutilitza les utilitats existents que siguin adequades. Llegeix les instruccions rellevants del repositori i inspecciona el codi, les proves, la documentació i la CI que hi ha al voltant. Segueix les convencions establertes. L’objectiu és un codi net i integrable". La indicació no s’ha optimitzat per a l’avaluació.
- 9
La primera tracta de com de prop poden aparèixer els nombres primers entre si, per molt que avancis al llarg de la recta numèrica. Durant més d’una dècada, el millor resultat conegut establia que hi ha infinites parelles de nombres primers separades per 246 com a màxim. Julia Stadlmann(s'obre en una finestra nova) recentment ha millorat aquesta cota fins a 240. Astra va ajudar a establir una cota més forta de 186, demostrant que infinites parelles es troben dins d’aquesta distància més petita. Intervals curts entre nombres primers: demostració(s'obre en una finestra nova) i recerca de suport(s'obre en una finestra nova).
- 10
El segon fa referència a intervals inusualment grans entre nombres primers. Astra va millorar un terme en una cota per a aquestes separacions que havia romàs sense canvis durant més de 80 anys. Compartim les demostracions, la cadena de pensament abreujada i els materials de verificació dels dos resultats. Grans intervals entre nombres primers: demostració(s'obre en una finestra nova) i recerca de suport(s'obre en una finestra nova).
- 11
Vam avaluar de manera independent tots els models Claude seguint el procediment previst de HealthBench Professional, utilitzant GPT-5.4 per a la qualificació i les puntuacions ajustades per longitud, sense limitar. Per a Fable 5.1, vam utilitzar Opus 5 com a alternativa en cas de rebuig del proveïdor.
- 12
- 13
- 14
ExploitBench (juny-agost de 2026) conté 20 vulnerabilitats V8 d'alta gravetat en 13 versions estables de Chrome. La prova de referència comprova si els agents poden aconseguir l’execució de codi arbitrari a V8 i a les versions oficials de Chrome per a Linux mitjançant l’explotació de cada vulnerabilitat especificada. És possible que algunes de les vulnerabilitats incloses no permetin l’execució de codi arbitrari amb les restriccions de l’avaluació, de manera que pot ser que no es pugui assolir una taxa d’èxit del 100 %. Nota: La puntuació del 5,5 % de GPT-5.6 Sol és un artefacte del límit de 300 torns de la prova de referència, un límit que els clients reals que utilitzen Max no tindrien. El model, amb paràmetres similars, va obtenir una puntuació de l’11,5 % en topar amb menys límits.
- 15
Jeremy Spence et al. "El proper repte per a la ciberseguretat agentiva: un banc de proves realista d’enginyeria inversa lliure de contaminació(s'obre en una finestra nova)." arXiv:2608.11469v1, 2026.
- 16
Quan fem proves amb models de tercers, utilitzem una configuració de recerca més senzilla. Codex té una configuració de producció més complexa, que pot donar lloc a taxes d’error del model en brut diferents. Les mesures de protecció del proveïdor i les implementacions d’eines informàtiques també difereixen. Els usuaris no experimenten l’escenari sense confirmació a Codex, ja que és una configuració de recerca interna.
- 17
