Una nueva generación de inteligencia
Actualización del 22 de septiembre de 2026: Estamos ampliando nuestra familia de GPT‑6 con GPT‑6 Sol y GPT‑6 Luna. Obtén más información.
Presentamos GPT‑6 Astra, el modelo más inteligente y alineado del mundo.
GPT‑6 Astra es el resultado de años de investigación y grandes apuestas en los ámbitos del preentrenamiento, el aprendizaje por refuerzo y la coherencia. Astra está a la vanguardia en el uso del equipo, la navegación web, la ingeniería de software, la ciberseguridad, la ciencia y el trabajo profesional. Astra alcanza la saturación en FrontierMath Nivel 4 con una puntuación del 98 %, tras haber ayudado ya a resolver problemas abiertos desde hace mucho tiempo en matemáticas. Astra también alcanza la saturación en ARC-IAG-3 con una puntuación del 99,9 % y en ExploitBench con una puntuación del 100 %. También establece un nuevo hito de vanguardia en cuanto al uso del equipo y los navegadores, y gestiona el trabajo profesional más exigente con una velocidad, precisión y criterio inigualables.
GPT‑6 Astra se va a desplegar hoy mismo para un conjunto limitado de organizaciones y, en los próximos días, estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a través de la API de OpenAI, Microsoft Azure y AWS Bedrock.
Astra es nuestro modelo más coherente, con mejoras sustanciales en la comprensión de la intención del usuario y en el comportamiento del modelo: puedes delegar tareas y confiar más en el criterio de Astra. Para comprobarlo, creamos una nueva prueba inspirada en el incidente de Hugging Face, que evalúa si un modelo, al enfrentarse a una tarea difícil o imposible, va más allá de lo previsto. En comparación con GPT‑5.6 Sol, que sin medidas de protección de producción sobrepasó el límite autorizado el 48 % de las veces, GPT‑6 Astra lo hizo en el 0 % de los casos.
El mejor modelo de uso del ordenador del mundo
GPT‑6 Astra marca un nuevo hito de vanguardia en cuanto a velocidad, precisión y seguridad en el uso del equipo. Puede encargarse de tareas tediosas como rellenar formularios en línea, actualizar los registros de clientes en un CRM y organizar el calendario. Puede hacer búsquedas en internet y redactar resúmenes en el correo electrónico o en el editor de documentos. Puede analizar datos científicos, generar gráficos, crear un sitio web y ejecutar comprobaciones de control de calidad del frontend para asegurarse de que todas las prestaciones de ese sitio funcionan. Puede ayudarte a instalar y probar software de forma autónoma, así como a solucionar los problemas que veas en la pantalla. Estas mejoras también se reflejan en los resultados de nuestra evaluación de vanguardia.
Estas mejoras también se traducen en importantes mejoras de eficiencia en tareas reales de trabajo basado en el conocimiento. En simulaciones de latencia en OSWorld 2.0, Astra logra un mayor rendimiento en el uso del equipo en aproximadamente un 47 % menos de tiempo por tarea que GPT‑5.6 Sol, con una puntuación del 72,6 % en aproximadamente 40 minutos por tarea, frente al 65,7 % en aproximadamente 75 minutos.3
Las capacidades de uso del ordenador de GPT‑6 Astra pueden apreciarse en resultados en distintos ámbitos, como el desarrollo de videojuegos, la ingeniería eléctrica y el trabajo intelectual cotidiano:
Junto con Astra, también estamos actualizando el arnés de Codex para mejorar significativamente la velocidad de uso del equipo. Si a esto le sumamos la eficiencia de Astra, el resultado es que las tareas se completan 1,9 veces más rápido que con la versión actual de GPT‑5.6 Sol, en la prueba de referencia Mind2Web. Las mejoras en la velocidad de este modelo hacen que pueda encargarse de muchas tareas cotidianas que te llevan mucho tiempo, y hacerlo más rápido que tú.4
Un cambio radical en el trabajo profesional
GPT‑6 Astra combina avances en el uso del equipo con entrenamiento específico para entornos profesionales, con el fin de ayudar a abordar tareas laborales complejas. Combina la inteligencia necesaria para problemas complejos con la capacidad de llevar a cabo flujos de trabajo de varios pasos y crear documentos, hojas de cálculo y presentaciones impecables.
GPT‑6 Astra es nuestro mejor modelo para ajustarse a plantillas existentes y producir diapositivas bien maquetadas que transmiten de forma sucinta los puntos clave con una narrativa estructurada. Crea documentos, presentaciones, hojas de cálculo y análisis claros y bien estructurados que siguen tus plantillas y se ajustan a tu estilo visual y de redacción. Astra también está entrenado específicamente para incorporar en los resultados solo el contexto relevante, en lugar de repetir información innecesaria para la tarea en cuestión. Todo esto significa que puede generar artefactos que se pueden usar de forma más inmediata y que se ajustan a tu contexto empresarial y tus estándares.
GPT‑6 Astra también aporta un criterio visual más sólido a los sitios web, juegos, aplicaciones y renderizados que crea. Con Sitios(se abre en una ventana nueva) en ChatGPT, Astra puede crear, alojar y compartir sitios web, aplicaciones web y juegos directamente a partir de un prompt.
Cuando las instrucciones dejan margen para la interpretación, GPT‑6 Astra es mejor que los modelos anteriores a la hora de tomar la decisión acertada. Utiliza el contexto para completar lagunas habituales y plantea preguntas concretas cuando la respuesta podría cambiar el resultado. En Codex, puede hacer preguntas de forma asíncrona mientras continúa trabajando en tareas que no dependen de tu respuesta. Si no respondes, continuará aplicando supuestos razonables cuando corresponda, pero esperará tus indicaciones para las decisiones importantes.
Los ejemplos siguientes muestran cómo Astra colabora en tareas cotidianas en las que la falta de información puede cambiar sustancialmente la respuesta.
Astra también se orienta mejor a medida que evoluciona una tarea. Los modelos anteriores a veces trataban los mensajes de orientación como un objetivo nuevo y perdían de vista la solicitud original o las restricciones anteriores. Astra incorpora nuevos requisitos, cambia de rumbo cuando se le pide y responde a preguntas secundarias sin perder de vista la tarea general.
Codificación
GPT‑6 Astra es el mejor modelo de ingeniería de software hasta la fecha.
«GPT‑6 Astra ofrece un rendimiento de vanguardia en nuestras pruebas de referencia internas de programación y muestra un claro avance en las evaluaciones de intuición para los sistemas de trading en comparación con GPT‑5.6 Sol. Cuando se utiliza para la programación con agentes, GPT‑6 Astra se comunica de una forma más fácil de seguir para los desarrolladores y genera código que requiere menos iteraciones para alcanzar una calidad apta para producción».
«Probamos Astra con niveles de esfuerzo bajo, medio y alto en una de nuestras evaluaciones de primera generación, y obtuvo resultados significativamente mejores que GPT 5.6 Sol. Un mayor nivel de esfuerzo permite más iteraciones en una compilación nueva, más verificación mediante pruebas en el navegador y favorece la ejecución de código frente a apply-patch. Entender cómo un modelo emplea su esfuerzo es lo que nos permite ofrecer a millones de desarrolladores un camino más rápido y fiable desde una idea hasta una aplicación funcional».
Con Astra, presentamos una nueva forma de que Codex conserve y recupere el contexto cuando se llena la ventana de contexto. Históricamente, los modelos han utilizado la compactación para resumir el trabajo durante sesiones largas, como al depurar problemas complejos o abordar grandes refactorizaciones. Cada compactación puede omitir detalles sobre por qué falló una corrección o cómo se comporta un componente. En Codex, Astra puede conservar notas entre ventanas de contexto, conservando los detalles acumulados sin tener que comprimirlos repetidamente en un único resumen. Las ventanas de contexto anteriores siguen permitiendo realizar búsquedas, por lo que Astra puede encontrar requisitos o resultados de pruebas de mensajes anteriores y salidas de las herramientas, incluso si esa información no se incluyó en sus notas. Puedes activar esta función experimental en el archivo config.toml de Codex(se abre en una ventana nueva) y pasará a ser la opción predeterminada para Astra en las próximas semanas.
Impulsar el descubrimiento científico
Astra puede ayudar con el trabajo práctico que hay detrás de los descubrimientos científicos. Al combinar el razonamiento científico con el uso del equipo, puede trabajar directamente en software especializado para examinar datos y explorar resultados, lo que ayuda a los investigadores a evaluar las pruebas y decidir qué investigar después.
Ciberseguridad
Como comentamos en nuestra actualización de seguridad, Astra supone un avance significativo en capacidades cibernéticas y alcanza el umbral crítico en ciberseguridad según nuestro Marco de preparación. Su capacidad para identificar y desarrollar exploits de día cero puede ayudar a los defensores a encontrar y corregir vulnerabilidades, pero también hace necesarias unas salvaguardas más sólidas. Para entender hasta dónde llegan estas capacidades, sometimos Astra a evaluaciones internas y de terceros realizadas por expertos.
Primero probamos el modelo sin medidas de protección para producción en ExploitBench y ExploitGym, que evalúan si los modelos pueden convertir vulnerabilidades de software conocidas en exploits funcionales. En ExploitBench, Astra obtuvo una puntuación perfecta del 100 %, frente al 78,5 % de GPT‑5.6 Sol, nuestro anterior modelo cibercapaz de vanguardia. En ExploitGym, Astra alcanzó una tasa de éxito del 42,4 %, frente al 30,3 % de GPT‑5.6 Sol, utilizando una cantidad sustancialmente menor de tokens de salida.13
Ante la preocupación de que la exposición a vulnerabilidades históricas de software pudiera haber afectado a los resultados de la prueba de referencia, también evaluamos Astra en dos pruebas de referencia nuevas. Para una de ellas, creamos una evaluación interna «ExploitBench (junio-agosto de 2026)» para probar el desarrollo de exploits utilizando vulnerabilidades de los tres meses anteriores.14 Astra logró tasas de ejecución de código arbitrario sustancialmente más altas que GPT‑5.6 Sol en este conjunto de datos utilizando muchos menos tokens de salida. Durante la evaluación, Astra llegó incluso a detectar y utilizar dos vulnerabilidades de día cero hasta entonces desconocidas. Vamos a divulgar ambas vulnerabilidades a los respectivos responsables del mantenimiento.
También probamos Astra en SRE-Bench15, una prueba de referencia que mide si los modelos pueden aplicar ingeniería inversa a binarios de software para comprender su lógica principal sin acceder al código fuente original. Astra resolvió el 88,0 % de las tareas en un solo intento y el 99,2 % en un máximo de cuatro intentos, frente al 55,9 % y el 68,7 % de GPT‑5.6 Sol, respectivamente.
Más allá de las pruebas de referencia, las evaluaciones dirigidas por expertos determinaron que Astra, cuando se ejecutaba sin las medidas de producción, podía usar vulnerabilidades desconocidas hasta entonces para lograr la ejecución de código arbitrario en navegadores protegidos y crear exploits de escalada de privilegios para sistemas operativos protegidos.
Como comentamos en La ventana de oportunidad para los defensores, las capacidades cibernéticas de vanguardia pueden ayudar a los defensores a encontrar vulnerabilidades con mayor rapidez, pero también hacen que esas vulnerabilidades sean más fáciles de explotar, lo que aumenta la urgencia de que los defensores se adapten. Con la versión de Astra que se lanza hoy, los defensores pueden usar Astra para completar tareas como la revisión de seguridad del código y la corrección.
Sin embargo, Astra se negará a realizar tareas de ciberseguridad más avanzadas, como crear exploits de prueba de concepto para vulnerabilidades. A través de OpenAI Daybreak, tenemos previsto ampliar el acceso y desplegar medidas de protección menos restrictivas en las próximas semanas. Esto permitirá flujos de trabajo más defensivos, incluidos la validación de vulnerabilidades y de pruebas de concepto, el análisis de malware y la ingeniería de detección.
También hemos reforzado nuestras protecciones frente a posibles usos indebidos en el ámbito cibernético, ampliando nuestro conjunto de salvaguardas para GPT‑5.6 Sol. Estas incluyen una mayor solidez del modelo para resistir mejor posibles jailbreaks y más contexto para nuestros sistemas de supervisión. Hemos continuado realizando rigurosas pruebas internas y externas, incluidas evaluaciones automatizadas con nuestros agentes atacantes internos de red teaming. Encontrarás más detalles sobre nuestras salvaguardas y pruebas de ciberseguridad en el resumen de seguridad y en la tarjeta del sistema(se abre en una ventana nueva) de Astra.
Alinear e implementar GPT‑6 Astra de forma responsable
Astra es nuestro modelo más coherente. Astra destaca por actuar con cuidado, respetar el alcance de las tareas y comunicarse con transparencia. Este trabajo es el resultado más reciente de nuestro programa de investigación de larga duración centrado en entrenar modelos que mantienen su coherencia con la intención humana de principio a fin.
En entornos sensibles, Astra actúa con una cautela acorde con el riesgo que entraña. En una evaluación de tareas de uso del equipo seleccionadas de forma adversa para provocar comportamientos indebidos, Astra tuvo más éxito a la hora de evitar consecuencias no deseadas. Al ejecutarse con medidas de seguridad adicionales activadas de forma predeterminada, ofreció un rendimiento aún mayor.
Astra provoca menos resultados incoherentes que cualquier otro modelo de vanguardia probado. Para garantizar una comparación justa, usamos un arnés genérico de agente informático (basado en las herramientas nativas de uso del equipo disponibles tanto en la API de respuestas de OpenAI(se abre en una ventana nueva) como en la API de mensajes de Anthropic(se abre en una ventana nueva)) y sin las protecciones adicionales que normalmente se implementan para los usuarios de Codex y ChatGPT Work (revisión automática, política de confirmación).
Además, es más probable que Astra actúe dentro de los límites establecidos por el usuario y los implícitos en su entorno. En una evaluación interna, Astra nunca intentó eludir un rechazo de la revisión automática de Codex. Esto se mantuvo incluso cuando la revisión automática se configuró deliberadamente para que pudiera eludirse y, de otro modo, fuera imposible completar la tarea. Este respeto por las restricciones del entorno coincide con los resultados de nuestra evaluación de tarea imposible de ciberseguridad, que compartimos en la introducción de esta publicación, y con otros hallazgos documentados en nuestra tarjeta del sistema(se abre en una ventana nueva).
Además, Astra marca nuevos hitos en la comunicación transparente con los usuarios. En una evaluación, Astra tiene tres veces menos probabilidades que GPT‑5.6 Sol de hacer afirmaciones inexactas sobre sus capacidades y posibilidades de uso.
En nuestra evaluación de alucinaciones sobre capacidades, Astra muestra una mejora sustancial con respecto a GPT‑5.6 Sol, al realizar menos afirmaciones engañosas sobre sus capacidades.
Nuestras evaluaciones concluyeron que el razonamiento escrito de Astra era más difícil de supervisar que el de GPT‑5.6 Sol, según unas pruebas en las que se le pedía explícitamente que eludiera la supervisión. Lo atribuimos al mayor control de Astra sobre el razonamiento escrito en tareas más sencillas y a su capacidad para resolver problemas con menos pasos escritos. Astra todavía parece tener dificultades para ocultar el razonamiento necesario para tareas complejas, pero nos tomamos en serio este retroceso. Mejorar la capacidad de supervisión sigue siendo una prioridad de investigación y la tarjeta del sistema(se abre en una ventana nueva) incluida detalla nuestros hallazgos y el trabajo en curso.
El entrenamiento de alineación es un elemento fundamental de nuestro enfoque de despliegue. Como capa de defensa adicional, también desarrollamos salvaguardas del sistema, como la revisión automática(se abre en una ventana nueva) de Codex y la supervisión del razonamiento y las acciones de los agentes, que ayudan a detectar y contener comportamientos inseguros. Tal y como se describe en nuestra actualización de seguridad, también estamos implementando en producción sistemas de supervisión de la desalineación para los modelos de la clase Astra, con el fin de detectar casos de desalineación y ayudar a contener los más graves. Estas medidas de protección son similares a las que usamos para supervisar los despliegues internos e incluyen un sistema de clasificadores que comprueba si el razonamiento y las acciones del modelo muestran comportamientos no autorizados y detiene automáticamente cualquier actividad potencialmente no autorizada.
Dado el importante aumento de las capacidades de ciberseguridad de Astra, estamos actuando con especial cautela para garantizar que esta implementación sea segura. Las comprobaciones de seguridad adicionales pueden ralentizar, pausar o detener en ocasiones trabajos legítimos, incluidos los de ciberseguridad defensiva. Si una tarea se pone en pausa en ChatGPT o Codex, es posible que se te pida que revises la acción antes de continuar. En la API, la tarea se detendrá. Estas comprobaciones a veces pueden interrumpir el trabajo legítimo y seguimos ajustando este sistema para reducir las interrupciones innecesarias. La supervisión de la incoherencia no puede sustituir a la coherencia: nuestro objetivo es crear modelos que se mantengan de forma fiable dentro de su ámbito autorizado, para que estas medidas de protección no tengan que activarse.
Disponibilidad
GPT‑6 Astra se va a desplegar hoy mismo para un conjunto limitado de organizaciones y, en los próximos días, estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a través de la API de OpenAI, Microsoft Azure y AWS Bedrock. El uso de Astra está incluido en las asignaciones de las suscripciones existentes; los usuarios y las empresas también podrán comprar créditos para ampliar su uso. Los usuarios de los planes Pro, Business y Enterprise también tendrán acceso a GPT‑6 Astra Pro. Los administradores del plan Enterprise pueden habilitar Astra para su área de trabajo; el acceso estará desactivado de forma predeterminada en el momento del lanzamiento.
Astra admite el modo sin retención de datos para clientes de API que cumplan los requisitos y, como compartimos el mes pasado, estamos probando el Procesamiento privado de seguridad para reforzar la supervisión de la seguridad a la vez que se protege la privacidad de los clientes.
Para los desarrolladores, GPT‑6 Astra estará disponible en la API de OpenAI como gpt-6-astra y a través de Microsoft Azure y Amazon Bedrock.
El precio estándar de la API de OpenAI es de 10 $ por millón de tokens de entrada y 50 $ por millón de tokens de salida. Se aplican tarifas distintas a las lecturas y escrituras en caché. El modo Rápido está disponible para GPT‑6 Astra en la API y ofrece hasta el doble de velocidad que el procesamiento estándar por el doble del precio estándar.
Uso del ordenador
Uso del ordenador | GPT‑6 Astra | GPT‑5.6 Sol2 | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
El último examen de los agentes | 59,3 % | 53,6 % | - | 48,7 % | 55,5 % | - |
OSWorld 2.0 (v2026.08.08, conjunto sin conexión, puntuación parcial) | 72,6 % | 65,7 % | - | - | 70,2 %3 | - |
ScreenSpot-Pro (sin herramientas) | 92,7 % | 76,9 % | - | 87,3 %17 | - | - |
Profesional
Profesional | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
AutomationBench | 41,4 % | 18,1 % | 31,4 % | 17,4 % | 26,9 % | - |
BenchCAD | 95,9 % | 83,3 % | 84,3 % 5 | 67,5 % 5 | 82,1 % 5 | - |
BrowseComp | 91,5 % | 90,4 % | - | 87,4 % | 90,8 % | - |
OpenScore String Quartets (1 - OMR-NED) | 0,84 | 0,19 | - | - | - | - |
Tareas internas de diseño | 50,0 % | 47,4 % | - | 35,8 % | - | - |
Tareas internas de ciencia de datos | 40,9 % | 30,5 % | - | 34,7 % | - | - |
Índice de inteligencia de Artificial Analysis v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 | 58,7 |
Codificación
| Programación | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 44,5 % | 52,6 % | 19,1 % |
| DeepSWE v1.1 | 74,1 % | 72,7 % | 67,4 % | 69,9 % | 73,7 % | 73,8 % |
| FrontierCode 1.1 Extended (puntuación) | 64,5 % 8 | 60,6 % | 63,6 % | 64,9 % | 63,6 % | 56,3 % |
| FrontierCode 1.1 Main (puntuación) | 53,3 % 8 | 47,5 % | 50,9 % | 53,5 % | 53,4 % | 43,6 % |
| Tareas internas de migración de bases de datos | 63,9 % | 42,7 % | 57,8 % | 50,3 % | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | - | 67,2 | 68,1 | 61,2 |
Académico
Académico | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 21,4 % | 30,0 % | - |
FrontierMath Nivel 4 (v2) | 97,6 % | 83,0 % | 87,8 % | 90,2 % | 73,2 % | - |
GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 92,6 % | 93,7 % | 95,3% |
Humanity's Last Exam (con herramientas) | 57,2 % | - | 65,0 % | 63,8 % | 63,6 % | - |
Ciberseguridad
Alineación
Alineación | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
Prueba de referencia interna de seguridad del uso del equipo (cuanto más bajo, mejor) | 2,4 % | 22,0 % | 9,5 % | 18,3 % | 11,5 % | - |
Prueba de referencia interna de seguridad del uso del equipo, con AutoReview (cuanto más bajo, mejor) | 1,8 % | 4,3 % | - | - | - | - |
Prueba de referencia interna de elusión (cuanto más bajo, mejor) | 0,00 % | 0,29 % | - | - | - | - |
Señuelo de ExploitGym (cuanto más bajo, mejor) | 0,0 % | 48,2 % | - | - | - | - |
Impossible ExploitGym | 100,0 % | - | - | - | - | - |
Prueba de referencia interna de alucinaciones (cuanto más bajo, mejor) | 4,2 % | 12,2 % | - | - | - | - |
Contexto largo
Contexto largo | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
OpenAI MRCR v2 8-needle 256K-512K | 100,0 % | 91,5 % | - | - | - | - |
OpenAI MRCR v2 8-needle 512K-1M | 96,3 % | 73,8 % | - | - | - | - |
Razonamiento abstracto
| Razonamiento abstracto | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9 % 1 | 7,8 % | - | - | 30,2 % | - |
| ARC-AGI-2 | 95,0 % | 92,5 % | 90,0 % | 89,2 % | 90,4 % | - |
| ARC-AGI-1 | 98,5 % | 97,5 % | 97,5 % | 98,5 % | 97,5 % | - |
Las puntuaciones de evaluación alcanzan el máximo con cualquier nivel de esfuerzo. Las evaluaciones del GPT se realizaron en nuestro entorno de investigación o a través de nuestra API, por lo que los resultados pueden diferir ligeramente de los que se obtienen en ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, etc.
NOTAS AL PIE
- 1
En ARC-IAG-3, GPT-6 Astra se ejecutó con nuestro arnés de la API de respuestas, que modifica dos ajustes para aproximarse mejor al rendimiento real. Los cambios no se dirigen específicamente a ARC-IAG-3.
- 2
GPT-5.6 Sol hace referencia a la versión disponible en nuestra API, ChatGPT Codex y ChatGPT Work. La versión en ChatGPT Chat es ligeramente diferente.
- 3
OSWorld V2-Offline es un subconjunto del OSWorld V2 original que funciona sin acceso a internet. El rendimiento del modelo Claude en OSWorld-V2 Offline fue reproducido por los autores en la clasificación oficial(se abre en una ventana nueva). En OSWorld 2.0, las puntuaciones de Claude utilizan la configuración oficial y no las tareas modificadas ni la evaluación modificada de la tarjeta del sistema de Fable 5.1.
- 4
- 5
En BenchCAD, las puntuaciones de Claude reflejan 3 modificaciones en la evaluación, que se detallan en la tarjeta del sistema de Fable 5.1(se abre en una ventana nueva).
- 6
Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon y Noah A. Smith. «LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR(se abre en una ventana nueva)» (disponible en inglés). arXiv:2506.19065, 2025.
- 7
Mark R. H. Gotham, Maureen Redbond, Bruno Bower y Peter Jonas. «The OpenScore String Quartet Corpus(se abre en una ventana nueva)» (disponible en inglés). Actas de la 10.ª Conferencia Internacional sobre Bibliotecas Digitales para la Musicología, págs. 49–57. ACM, 2023.
- 8
En FrontierCode, GPT-6 Astra se ejecutó con un mensaje de desarrollador similar a una sección de su mensaje de desarrollador en Codex(se abre en una ventana nueva): «Evita crear demasiados archivos de prueba. Crea un nuevo archivo de prueba solo cuando lo exijan las convenciones del repositorio o cuando ningún archivo existente sea adecuado. Evita las tareas de limpieza no relacionadas y la complejidad innecesaria. Reutiliza las utilidades existentes que sean adecuadas. Lee las instrucciones relevantes del repositorio e inspecciona el código cercano, las pruebas, la documentación y la integración continua. Sigue las convenciones establecidas. El objetivo es lograr un código limpio y fácil de integrar». El prompt no se optimizó para la evaluación.
- 9
El primero tiene que ver con lo cerca que pueden estar los números primos entre sí, por muy lejos que se vaya en la secuencia numérica. Durante más de una década, el mejor resultado conocido establecía que infinitos pares de números primos distan a lo sumo 246 entre sí. Julia Stadlmann(se abre en una ventana nueva) mejoró recientemente esa cota hasta 240. Astra ayudó a establecer una cota más estricta de 186, demostrando que existen infinitos pares dentro de esta distancia menor. Intervalos pequeños entre números primos: pruebas(se abre en una ventana nueva) e investigación complementaria(se abre en una ventana nueva).
- 10
El segundo tiene que ver con los intervalos inusualmente grandes entre números primos. Astra mejoró un término de una cota para estos intervalos que había permanecido sin cambios durante más de 80 años. Compartimos las pruebas, la cadena de pensamiento abreviada y los materiales de verificación de ambos resultados. Intervalos grandes entre números primos: pruebas(se abre en una ventana nueva) e investigación complementaria(se abre en una ventana nueva).
- 11
Evaluamos de forma independiente todos los modelos Claude siguiendo el procedimiento previsto de HealthBench Professional, utilizando la evaluación de GPT‑5.4 y puntuaciones ajustadas por longitud, sin recortar. Para Fable 5.1, utilizamos Opus 5 como opción de respaldo para los rechazos del proveedor.
- 12
- 13
- 14
ExploitBench (de junio a agosto de 2026) contiene 20 vulnerabilidades V8 de gravedad alta en 13 versiones estables de Chrome. La prueba de referencia comprueba si los agentes pueden lograr la ejecución de código arbitrario en V8 y en las versiones oficiales de Chrome para Linux mediante la explotación de cada vulnerabilidad especificada. Es posible que algunas vulnerabilidades incluidas no permitan la ejecución de código arbitrario con las restricciones de la evaluación, por lo que quizá no sea posible alcanzar una tasa de éxito del 100 %. Nota: la puntuación del 5,5 % de GPT‑5.6 Sol se debe al límite de 300 turnos de la prueba de referencia, un límite al que no se enfrentarían los clientes reales que usan el nivel máximo. El modelo, con una configuración similar, obtuvo una puntuación del 11,5 % cuando estuvo sujeto a menos límites.
- 15
Jeremy Spence et al. «The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark(se abre en una ventana nueva)» (disponible en inglés). arXiv:2608.11469v1, 2026.
- 16
Cuando hacemos pruebas con modelos de terceros, usamos una configuración de investigación más sencilla. Codex tiene una configuración de producción más compleja, lo que puede dar lugar a diferentes tasas de error del modelo sin procesar. Las medidas de protección del lado del proveedor y las implementaciones de herramientas informáticas siguen siendo distintas. Los usuarios no se encuentran con el escenario «sin confirmación» en Codex, ya que se trata de una configuración interna de investigación.
- 17
