OpenAI

GPT-6 Astra: A new generation of intelligence

Una nueva generación de inteligencia

Actualización del 22 de septiembre de 2026: Estamos ampliando nuestra familia GPT‑6 con GPT‑6 Sol y GPT‑6 Luna. Más información.

Presentamos GPT‑6 Astra, el modelo más inteligente y alineado del mundo.

GPT‑6 Astra reúne años de investigación y grandes apuestas en preentrenamiento, aprendizaje por refuerzo y alineación. Astra está a la vanguardia en el uso de computadoras, la navegación web, la ingeniería de software, la ciberseguridad, la ciencia y el trabajo profesional. Astra satura FrontierMath Nivel 4 con una puntuación del 98 %, tras haber ayudado ya a solucionar problemas que llevaban mucho tiempo sin resolverse⁠ en matemáticas. Astra también satura ARC-AGI-3 con una puntuación del 99.9 % y ExploitBench con una puntuación del 100 %. También establece un nuevo estándar en el uso de computadoras y navegadores, y realiza el trabajo profesional más exigente con una velocidad, precisión y criterio inigualables.

GPT‑6 Astra comienza a implementarse hoy para un grupo limitado de organizaciones y, en los próximos días, estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a través de la API de OpenAI, Microsoft Azure y AWS Bedrock.

"En ARC-AGI-3, Astra superó nuestra referencia de eficiencia de acciones humanas en el 96 % de los niveles, alcanzando de hecho la paridad humana en la prueba de referencia. No solo es el mejor modelo que hemos probado, sino que también representa un salto significativo en el rendimiento de los modelos de vanguardia, no solo por su capacidad para desenvolverse y resolver problemas en entornos novedosos, sino también por la eficiencia con la que aprende a hacerlo."
Greg Kamradt, ARC Prize Foundation

Astra es nuestro modelo más alineado, con mejoras sustanciales en la comprensión de la intención del usuario y en el comportamiento del modelo; puedes delegar tareas con mayor confianza en el criterio de Astra. Como una forma de evaluar esto, creamos una nueva evaluación basada en el incidente de Hugging Face para determinar si un modelo que enfrenta una tarea difícil o imposible irá más allá de su alcance previsto. En comparación con GPT‑5.6 Sol, que, sin medidas de protección en producción, superó el objetivo autorizado el 48 % de las veces, GPT‑6 Astra lo hizo en el 0 % de los casos.

El mejor modelo del mundo para usar computadoras

GPT‑6 Astra marca un nuevo hito en la velocidad, la precisión y la seguridad del uso de computadoras. Puede encargarse de tareas tediosas como completar formularios en línea, actualizar registros de clientes en un CRM y organizar tu calendario. Puede realizar investigaciones en línea y redactar resúmenes en tu correo electrónico o en tu editor de documentos. Puede analizar datos científicos, generar gráficos, crear un sitio web y ejecutar pruebas de QA del frontend para asegurarse de que todas las funciones de ese sitio funcionen. Puede ayudarte a instalar y probar software de forma autónoma, y a solucionar problemas que veas en la pantalla. Estas mejoras también se ven reflejadas en nuestros resultados de evaluación de última generación.

Esto también se traduce en aumentos significativos de la eficiencia en tareas reales de trabajo intelectual. En simulaciones de latencia en OSWorld 2.0, Astra logra un mayor rendimiento en el uso de computadoras con aproximadamente un 47 % menos de tiempo por tarea que GPT‑5.6 Sol, con una puntuación de 72.6 % en aproximadamente 40 minutos por tarea, en comparación con 65.7 % en aproximadamente 75 minutos.3

Las capacidades de GPT‑6 Astra para usar computadoras pueden observarse en resultados de distintos ámbitos, como el desarrollo de videojuegos, la ingeniería eléctrica y el trabajo cotidiano basado en el conocimiento:

Junto con Astra, también estamos actualizando la infraestructura de ejecución de Codex para mejorar significativamente la velocidad de uso de la computadora. Combinado con la eficiencia de Astra, esto permite completar las tareas 1.9 veces más rápido que con la experiencia actual de GPT‑5.6 Sol en el benchmark Mind2Web. Las mejoras de velocidad del modelo le permiten encargarse por ti de muchas tareas cotidianas que llevan mucho tiempo, más rápido de lo que tú puedes hacerlo.4

“Estamos integrando GPT‑6 Astra en el arnés de ejecución de Devin el día del lanzamiento, donde alcanza un rendimiento de vanguardia en nuestra prueba de referencia interna. Sus excelentes capacidades de uso de computadoras, redacción y comprensión de la base de código mejoraron las pruebas desde el primer momento: los videos son notablemente más fáciles de seguir, y los informes son más claros y concisos”.
Silas Alberti, vicepresidente sénior de investigación, Cognition

Un cambio radical en el trabajo profesional

GPT‑6 Astra combina avances en el uso de computadoras con entrenamiento específico para entornos profesionales, a fin de ayudar a abordar tareas laborales complejas. Combina la inteligencia necesaria para resolver problemas complejos con la capacidad de llevar a cabo flujos de trabajo de varios pasos y crear documentos, hojas de cálculo y presentaciones pulidos.

GPT‑6 Astra es nuestro mejor modelo para ceñirse a plantillas existentes y producir diapositivas bien organizadas que transmiten de forma concisa los puntos clave con una narrativa estructurada. Crea documentos, presentaciones, hojas de cálculo y análisis claros y bien estructurados que siguen tus plantillas y se ajustan a tus estilos visual y de redacción. Astra también recibió entrenamiento para incorporar específicamente en sus resultados solo el contexto que importa, en lugar de repetir información innecesaria para la tarea en cuestión. Todo esto significa que puede generar artefactos más utilizables de inmediato que se ajustan a tu contexto empresarial y a tus estándares.

GPT‑6 Astra también aporta un criterio visual más sólido a los sitios web, juegos, aplicaciones y renderizados que crea. Con Sites⁠(se abre en una nueva ventana) en ChatGPT, Astra puede crear, alojar y compartir sitios web, aplicaciones web y juegos directamente a partir de un prompt.

"Astra nos da una ventaja significativa tanto en capacidad como en eficiencia. Ejecuta con éxito nuestros flujos de trabajo creativos más complejos y usa hasta un 20 % menos de tokens que otros modelos que hemos probado. Lo más importante es que, para nuestros clientes, esto se traduce en resultados de más alta calidad."
Alex Mashrabov, CEO y cofundador de Higgsfield AI

Cuando las instrucciones dejan margen para la interpretación, GPT‑6 Astra toma mejores decisiones que los modelos anteriores. Utiliza el contexto para completar vacíos habituales y hace preguntas específicas cuando la respuesta podría cambiar el resultado. En Codex, puede hacer preguntas de forma asincrónica mientras continúa con tareas que no dependen de tu respuesta. Si no respondes, procede con supuestos sensatos cuando corresponde, pero espera tu respuesta para las decisiones de gran impacto.

Los ejemplos a continuación muestran cómo Astra colabora en tareas cotidianas en las que la información faltante puede cambiar de forma significativa la respuesta.

Astra también logra mantener mejor el rumbo a medida que evoluciona una tarea. A veces, los modelos anteriores trataban los mensajes de orientación como un objetivo nuevo y perdían de vista la solicitud original o las restricciones previas. Astra incorpora nuevos requisitos, ajusta el rumbo cuando se le solicita y responde preguntas secundarias sin perder de vista la tarea más amplia.

“Astra representa una mejora significativa de calidad con respecto a GPT‑5.6 Sol en tareas legales complejas. En nuestras primeras pruebas, Astra destacó por abordar el trabajo jurídico como lo haría un abogado perspicaz: distingue los documentos de los registros establecidos, detecta supuestos sin sustento y convierte las brechas en posturas concretas de redacción.
Niko Grupen, jefe de investigación aplicada, Harvey

Codificación

GPT‑6 Astra es el mejor modelo para ingeniería de software hasta la fecha.

1 de 2
"GPT‑6 Astra ofrece un rendimiento de vanguardia en nuestras evaluaciones internas de programación y muestra un claro avance en las evaluaciones de intuición para el trading en comparación con GPT‑5.6 Sol. Cuando se usa para codificación con agentes, GPT‑6 Astra se comunica de una forma que resulta más fácil de seguir para los desarrolladores y produce código que requiere menos iteraciones para alcanzar calidad de producción."
John Crepezzi, AI Assistants, Jane Street

Con Astra, presentamos una nueva forma para que Codex conserve y recupere contexto cuando se llena la ventana de contexto. Históricamente, los modelos han usado la compactación para resumir el trabajo durante sesiones largas, como al depurar problemas complejos o abordar grandes refactorizaciones. Cada compactación puede omitir detalles sobre por qué falló una corrección o cómo se comporta un componente. En Codex, Astra puede conservar notas entre ventanas de contexto, preservando los detalles acumulados sin tener que comprimirlos repetidamente en un solo resumen. Las ventanas de contexto anteriores siguen siendo consultables, por lo que Astra puede encontrar requisitos o resultados de pruebas de mensajes anteriores y resultados de herramientas, incluso si esa información no quedó registrada en sus notas. Puedes habilitar esta función experimental en tu config.toml de Codex,⁠(se abre en una nueva ventana) y se convertirá en la opción predeterminada para Astra en las próximas semanas.

Impulsar el descubrimiento científico

"La historia es: el fin de una era, el comienzo de otra."
Greg Burnham, EpochAI

GPT‑6 Astra es un gran avance para el descubrimiento científico, las matemáticas y la salud. Hoy compartimos dos resultados adicionales sobre las brechas entre números primos.9 y 10

Astra también establece nuevos récords en un conjunto de evaluaciones de matemáticas y ciencias.

Astra puede ayudar con el trabajo práctico que sustenta los descubrimientos científicos. Al combinar el razonamiento científico con el uso de computadoras, puede trabajar directamente en software especializado para examinar datos y explorar resultados, lo que ayuda a los investigadores a evaluar la evidencia y decidir qué investigar después.

Ciberseguridad

Como mencionamos en nuestra actualización de seguridad⁠, Astra representa un avance significativo en capacidades cibernéticas y cumple con el Umbral crítico en ciberseguridad conforme a nuestro Marco de preparación. Su capacidad para identificar y desarrollar exploits de día cero puede ayudar a los defensores a encontrar y corregir vulnerabilidades, pero también crea la necesidad de contar con medidas de protección más sólidas. Para entender hasta dónde llegan estas capacidades, sometimos Astra a evaluaciones internas y de expertos externos.

Primero probamos el modelo sin salvaguardas de producción en ExploitBench y ExploitGym, que evalúan si los modelos pueden convertir vulnerabilidades conocidas de software en exploits funcionales. En ExploitBench, Astra obtuvo una puntuación perfecta del 100 %, en comparación con el 78.5 % obtenido por GPT‑5.6 Sol, nuestro anterior modelo de vanguardia con capacidades de ciberseguridad. En ExploitGym, Astra alcanzó una tasa de éxito del 42.4 %, frente al 30.3 % de GPT‑5.6 Sol, mientras utilizaba una cantidad sustancialmente menor de tokens de salida.13

Dadas las preocupaciones de que la exposición a vulnerabilidades históricas de software pudiera haber afectado los resultados de las pruebas de referencia, también evaluamos Astra en dos nuevas pruebas de referencia. Por un lado, creamos una evaluación interna "ExploitBench (junio-agosto de 2026)" para probar el desarrollo de exploits utilizando vulnerabilidades de los tres meses anteriores.14 Astra alcanzó tasas de ejecución de código arbitrario considerablemente más altas que GPT‑5.6 Sol en este conjunto de datos, usando muchos menos tokens de salida. Durante la evaluación, Astra incluso descubrió y utilizó dos vulnerabilidades de día cero previamente desconocidas. Estamos notificando ambas vulnerabilidades a sus responsables de mantenimiento.

También evaluamos Astra en SRE-Bench15, una prueba de referencia que mide si los modelos pueden aplicar ingeniería inversa a binarios de software para comprender su lógica central sin acceso al código fuente sin procesar. Astra resolvió el 88.0 % de las tareas en un solo intento y el 99.2 % en cuatro intentos o menos, en comparación con el 55.9 % y el 68.7 % de GPT‑5.6 Sol, respectivamente.

Más allá de las pruebas comparativas, las evaluaciones dirigidas por expertos determinaron que Astra, al ejecutarse sin salvaguardas de producción, podía usar vulnerabilidades previamente desconocidas para lograr la ejecución de código arbitrario en navegadores reforzados y crear exploits de escalamiento de privilegios para sistemas operativos reforzados.

Como analizamos en La ventana del defensor, las capacidades cibernéticas de vanguardia pueden ayudar a los defensores a encontrar vulnerabilidades más rápido, pero también hacen que esas vulnerabilidades sean más fáciles de explotar, lo que aumenta la urgencia de que los defensores se adapten. Con la versión de Astra que se lanza hoy, los defensores pueden usarla para completar tareas como la revisión segura de código y la aplicación de parches.

Sin embargo, Astra se negará a realizar tareas de ciberseguridad más avanzadas, como crear exploits de prueba de concepto para vulnerabilidades. A través de OpenAI Daybreak⁠, planeamos ampliar el acceso e implementar medidas de seguridad menos restrictivas en las próximas semanas. Esto permitirá flujos de trabajo más defensivos, incluida la validación de vulnerabilidades y de pruebas de concepto, el análisis de malware y la ingeniería de detección.

También reforzamos nuestras protecciones contra el posible uso indebido en el ámbito cibernético, basándonos en nuestro conjunto de medidas de seguridad para GPT‑5.6 Sol. Estas incluyen una mayor robustez del modelo para resistir mejor posibles jailbreaks y más contexto para nuestros sistemas de monitoreo. Continuamos con pruebas rigurosas internas y externas, incluidas evaluaciones automatizadas con nuestros atacantes internos de red teaming. Hay más detalles sobre nuestras protecciones cibernéticas y pruebas disponibles en la descripción general de seguridad⁠ y la tarjeta del sistema⁠(se abre en una nueva ventana) de Astra.

Alineación e implementación responsable de GPT‑6 Astra

Astra es nuestro modelo más alineado. Astra se destaca por actuar con cuidado, respetar los límites de las tareas y comunicarse con transparencia. Este trabajo es el resultado más reciente de nuestro programa de investigación de larga trayectoria, centrado en entrenar modelos que se mantengan alineados con la intención humana de principio a fin.

En entornos sensibles, Astra actúa con un nivel de precaución proporcional al riesgo. En una evaluación de tareas de uso de computadoras seleccionadas de forma adversarial para provocar comportamientos indebidos, Astra tuvo más éxito al evitar las consecuencias no deseadas. La ejecución con medidas de seguridad adicionales ofrecidas de forma predeterminada produjo un rendimiento aún mejor.

Astra provoca menos resultados desalineados que cualquier otro modelo de vanguardia probado. Para una comparación justa, usamos un arnés de ejecución genérico para agentes informáticos (basado en las herramientas nativas de uso de computadoras disponibles tanto en la API de OpenAI Responses⁠(se abre en una nueva ventana) como en la API de Anthropic Messages⁠(se abre en una nueva ventana)) sin las medidas de protección adicionales que normalmente se implementan para los usuarios de Codex y ChatGPT Work (revisión automática, política de confirmación).

También es más probable que Astra opere dentro de los límites establecidos por el usuario e implícitos en su entorno. En una evaluación interna, Astra nunca intentó eludir una denegación de la revisión automática de Codex. Esto siguió siendo cierto incluso cuando la revisión automática se configuró deliberadamente para que pudiera eludirse y, de otro modo, la tarea fuera imposible de completar. Este respeto por las restricciones del entorno es coherente con los resultados de nuestra evaluación de tareas cibernéticas imposibles, que compartimos en la introducción de esta publicación, y con otros hallazgos documentados en nuestra tarjeta del sistema⁠(se abre en una nueva ventana).

Además, Astra establece nuevos estándares en la comunicación transparente con los usuarios. En una evaluación, Astra tiene tres veces menos probabilidades que GPT‑5.6 Sol de hacer afirmaciones inexactas sobre sus capacidades y funcionalidades.

En nuestra evaluación de alucinaciones sobre capacidades, Astra muestra una mejora sustancial frente a GPT‑5.6 Sol, ya que hace menos afirmaciones engañosas sobre sus capacidades.

Nuestras evaluaciones determinaron que el razonamiento escrito de Astra era más difícil de monitorear que el de GPT‑5.6 Sol, según pruebas que le pedían explícitamente que eludiera el monitoreo. Atribuimos esto al mayor control de Astra sobre el razonamiento escrito en tareas más simples y a su capacidad para resolver problemas con menos pasos escritos. Astra aún parece tener dificultades para ocultar el razonamiento necesario para tareas complejas, pero nos tomamos esta disminución en serio. Mejorar la capacidad de monitoreo sigue siendo una prioridad de investigación, y la tarjeta del sistema⁠(se abre en una nueva ventana) correspondiente detalla nuestros hallazgos y el trabajo en curso.

El entrenamiento de alineación es fundamental para nuestro enfoque de despliegue. Como capa de defensa adicional, también desarrollamos salvaguardas del sistema, como la revisión automática⁠(se abre en una nueva ventana) de Codex y el monitoreo del razonamiento y las acciones de los agentes para ayudar a detectar y contener comportamientos inseguros. Como se describe en nuestra actualización de seguridad⁠, también estamos implementando el monitoreo de desalineación en producción para los modelos de clase Astra, con el fin de tener visibilidad sobre la desalineación y ayudar a contener sus casos más graves. Estas salvaguardas se asemejan al monitoreo de nuestros despliegues internos e incluyen un sistema de clasificadores que examina el razonamiento y las acciones del modelo para detectar comportamientos no autorizados y detener automáticamente cualquier actividad potencialmente no autorizada.

Dado el aumento significativo de las capacidades de ciberseguridad de Astra, estamos extremando las precauciones para garantizar la seguridad de esta implementación. Las verificaciones de seguridad adicionales a veces pueden ralentizar, pausar o detener el trabajo legítimo, incluida la ciberseguridad defensiva. Si una tarea se pausa en ChatGPT o Codex, es posible que se te pida revisar la acción antes de continuar. En la API, la tarea se detendrá. Estas verificaciones a veces pueden interrumpir el trabajo legítimo, y seguimos mejorando este sistema para reducir las interrupciones innecesarias. El monitoreo de desalineación no puede reemplazar la alineación: nuestro objetivo es crear modelos que se mantengan de forma confiable dentro de su ámbito autorizado, para que estas protecciones no tengan que intervenir.

Disponibilidad

GPT‑6 Astra comienza a implementarse hoy para un grupo limitado de organizaciones y, en los próximos días, estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a través de la API de OpenAI, Microsoft Azure y AWS Bedrock. El uso de Astra está incluido en los límites de uso de las suscripciones actuales; los usuarios y las empresas también podrán comprar créditos para uso adicional. Los usuarios de los planes Pro, Business y Enterprise también tendrán acceso a GPT‑6 Astra Pro. Los administradores empresariales pueden habilitar Astra en su espacio de trabajo; el acceso está desactivado de forma predeterminada en el lanzamiento.

Astra admite la retención cero de datos para clientes elegibles de la API y, como anunciamos el mes pasado, estamos probando Procesamiento privado de seguridad para fortalecer el monitoreo de seguridad sin comprometer la privacidad de los clientes.

Para desarrolladores, GPT‑6 Astra estará disponible en la API de OpenAI como gpt-6-astra y a través de Microsoft Azure y Amazon Bedrock.

El precio estándar de la API de OpenAI es de USD 10 por millón de tokens de entrada y USD 50 por millón de tokens de salida. Se aplican tarifas separadas a las lecturas y escrituras de caché. El modo Rápido está disponible para GPT‑6 Astra en la API y ofrece hasta el doble de la velocidad del procesamiento estándar por el doble del precio estándar.

Uso de la computadora

Uso de la computadora

GPT‑6 Astra

GPT‑5.6 Sol2

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Último examen de los agentes

59.3 %

53.6 %

-

48.7 %

55.5 %

-

OSWorld 2.0 (v2026.08.08, conjunto sin conexión, puntuación parcial)

72.6 %

65.7 %

-

-

70.2 %3

-

ScreenSpot-Pro (sin herramientas)

92.7 %

76,9 %

-

87.3 %17

-

-

Profesional

Profesional

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

AutomationBench

41,4 %

18,1 %

31.4 %

17.4 %

26.9 %

-

BenchCAD

95.9 %

83.3 %

84.3 % 5

67.5 % 5

82.1 % 5

-

BrowseComp

91.5 %

90.4 %

-

87.4 %

90.8 %

-

OpenScore String Quartets (1 - OMR-NED)

0.84

0.19

-

-

-

-

Tareas internas de diseño

50.0 %

47.4 %

-

35.8 %

-

-

Tareas internas de ciencia de datos

40.9 %

30.5 %

-

34.7 %

-

-

Índice de inteligencia de Artificial Analysis v4.1.1

61.2

60.9

65.7

62.1

63.1

58.7

Codificación

ProgramaciónGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057.9 %37.3 %55.8 %44.5 %52.6 %19.1 %
DeepSWE v1.174.1 %72.7 %67.4 %69.9 %73.7 %73.8 %
FrontierCode 1.1 Extendido (puntaje)64.5 % 860.6 %63.6 %64.9 %63.6 %56.3 %
FrontierCode 1.1 Principal (puntaje)53.3 % 847.5 %50.9 %53.5 %53.4 %43.6 %
Tareas internas de migración de bases de datos63.9 %42.7 %57.8 %50.3 %--
Índice de agentes de codificación de Artificial Analysis v1.467.065.1-67.268.161.2

Académico

Académico

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Terminal-Bench Science 0.1

64.6 %

22.4 %

52.6 %

21.4 %

30.0 %

-

FrontierMath Nivel 4 (v2)

97.6 %

83.0 %

87.8 %

90.2 %

73.2 %

-

GPQA Diamond

96.0 %

94.6 %

93.7 %

92.6%

93.7 %

95.3 %

Humanity's Last Exam (con herramientas)

57.2 %

-

65.0 %

63.8 %

63.6 %

-

Ciencia y salud

Ciencia y saludGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
GeneBench Pro37.1 %32.3 %----
MedChemBench (interno)49.3 %47.4 %----
LifeSciBench60.3 %59.9 %----
HealthBench Professional (ajustado por longitud)63.4 %60.5 %58.1 % 1160.9 % 1156.4 % 1152.1 %

Ciberseguridad

CiberseguridadGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ExploitBench100.0 %78.5 %--70 %-
ExploitGym42.4 % 1330.3 % 1330.4 % 1728.4 %1722.0 %-
ExploitBench (junio-agosto de 2026)39.0 %5.5 %----
SRE-Bench88.0 %55.9 %--12.5 %-
SEC-Bench Pro85.4 %79.1 %----

Alineación

Alineación

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

Benchmark interno de seguridad en el uso de computadoras (cuanto más bajo, mejor)

2.4 %

22.0 %

9.5 %

18.3 %

11.5 %

-

Benchmark interno de seguridad para el uso de computadoras, con AutoReview (cuanto más bajo, mejor)

1.8 %

4.3 %

-

-

-

-

Benchmark interno de elusión (cuanto más bajo, mejor)

0.00 %

0.29 %

-

-

-

-

Honeypot de ExploitGym (cuanto más bajo, mejor)

0.0 %

48.2 %

-

-

-

-

ExploitGym imposible

100.0 %

-

-

-

-

-

Benchmark interno de alucinaciones (cuanto más bajo, mejor)

4.2 %

12.2 %

-

-

-

-

Contexto largo

Contexto largo

GPT‑6 Astra

GPT‑5.6 Sol

Claude Fable 5.1

Claude Fable 5

Claude Opus 5

Gemini 3.8 Flash

OpenAI MRCR v2 8-agujas 256 mil-512 mil

100.0 %

91.5 %

-

-

-

-

OpenAI MRCR v2 8-agujas 512 mil-1 millón

96.3 %

73.8 %

-

-

-

-

Razonamiento abstracto

Razonamiento abstractoGPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash
ARC-IAG-399.9 % 17.8 %--30.2 %-
ARC-IAG-295.0 %92.5 %90.0 %89.2 %90.4 %-
ARC-IAG-198.5 %97.5 %97.5 %98. 5%97.5 %-

Se muestra la puntuación máxima obtenida con cualquiera de los niveles de esfuerzo. Las evaluaciones de GPT se realizaron en nuestro entorno de investigación o mediante nuestra API, por lo que los resultados pueden diferir ligeramente de los de ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, etc.

NOTAS AL PIE

  1. 1

    En ARC-AGI-3, GPT-6 Astra se ejecutó con nuestro arnés de ejecución de la API de Responses⁠, que cambia dos ajustes para reflejar mejor el rendimiento en situaciones reales. Los cambios no se dirigen específicamente a ARC-AGI-3.

  2. 2

    GPT-5.6 Sol hace referencia a la versión disponible en nuestra API, ChatGPT Codex y ChatGPT Work. La versión en ChatGPT Chat es ligeramente diferente.⁠

  3. 3

    OSWorld V2-Offline es un subconjunto del OSWorld V2 original que funciona sin acceso a internet. El rendimiento del modelo Claude en OSWorld-V2 Offline fue reproducido por los autores en la tabla de clasificación oficial⁠(se abre en una nueva ventana). En OSWorld 2.0, las puntuaciones de Claude usan la configuración oficial, y no las tareas modificadas ni la evaluación modificada de la tarjeta del sistema de Fable 5.1.

  4. 4

    Los tiempos de los modelos son los tiempos transcurridos reportados para las ejecuciones de demostración correspondientes. Los clips que se muestran son extractos editados.

  5. 5

    En BenchCAD, las puntuaciones de Claude reflejan 3 modificaciones en la evaluación, detalladas en la tarjeta del sistema de Fable 5.1⁠(se abre en una nueva ventana).

  6. 6

    Guang Yang, Victoria Ebert, Nazif Tamer, Brian Siyuan Zheng, Luiza Pozzobon y Noah A. Smith. “LEGATO: Large-scale End-to-end Generalizable Approach to Typeset OMR⁠(se abre en una nueva ventana).” arXiv:2506.19065, 2025.

  7. 7

    Mark R. H. Gotham, Maureen Redbond, Bruno Bower y Peter Jonas. “The OpenScore String Quartet Corpus⁠(se abre en una nueva ventana).” Proceedings of the 10th International Conference on Digital Libraries for Musicology, págs. 49–57. ACM, 2023.

  8. 8

    En FrontierCode, GPT-6 Astra se ejecutó con un mensaje de desarrollador similar a una sección de su mensaje de desarrollador en Codex⁠(se abre en una nueva ventana): "Evita crear demasiados archivos de prueba. Crea un archivo de prueba nuevo solo cuando lo requieran las convenciones del repositorio o cuando no haya ningún archivo existente adecuado para alojarlo. Evita la limpieza no relacionada y la complejidad innecesaria. Reutiliza las utilidades existentes que sean adecuadas. Lee las instrucciones relevantes del repositorio e inspecciona el código, las pruebas, la documentación y la CI cercanos. Sigue las convenciones establecidas. El objetivo es producir código limpio y listo para fusionarse." El prompt no se optimizó para la evaluación.

  9. 9

    El primero se refiere a cuán cerca pueden aparecer entre sí los números primos, por muy lejos que se avance en la recta numérica. Durante más de una década, el mejor resultado conocido establecía que existen infinitos pares de números primos cuya diferencia es como máximo 246. Julia Stadlmann⁠(se abre en una nueva ventana) mejoró recientemente esa cota a 240. Astra ayudó a establecer una cota más estricta de 186, lo que demuestra que existen infinitos pares dentro de esta distancia menor. Brechas cortas entre primos: Demostración⁠(se abre en una nueva ventana) e investigación de respaldo⁠(se abre en una nueva ventana).

  10. 10

    El segundo se refiere a brechas inusualmente grandes entre números primos. Astra mejoró un término en una cota sobre estas brechas que había permanecido sin cambios durante más de 80 años. Compartimos las demostraciones, versiones abreviadas de la cadena de pensamiento y materiales de verificación de ambos resultados. Grandes brechas entre números primos: Demostración⁠(se abre en una nueva ventana) e investigación complementaria⁠(se abre en una nueva ventana).

  11. 11

    Evaluamos de forma independiente todos los modelos Claude siguiendo el procedimiento previsto de HealthBench Professional, usando GPT‑5.4 para la calificación y puntuaciones ajustadas por longitud y sin recortar. Para Fable 5.1, usamos Opus 5 como alternativa ante rechazos del proveedor.

  12. 12

    Claude Fable 5 y 5.1 no están incluidos en LifeSciBench Gold v1, GeneBench Pro v13 y MedChemBench porque se niegan a responder la mayoría de las preguntas en estas evaluaciones.

  13. 13

    En ExploitGym, probamos Astra y Sol sin el límite de tiempo de 6 horas para evaluar mejor todas sus capacidades cibernéticas. Son lo suficientemente rápidos como para que el impacto sea mínimo.

  14. 14

    ExploitBench (junio-agosto de 2026) contiene 20 vulnerabilidades de V8 de alta gravedad en 13 versiones estables de Chrome. La prueba de referencia evalúa si los agentes pueden lograr la ejecución de código arbitrario en V8 y en las versiones oficiales de Chrome para Linux mediante la explotación de cada vulnerabilidad especificada. Es posible que algunas vulnerabilidades incluidas no permitan la ejecución de código arbitrario bajo las restricciones de la evaluación, por lo que quizá no sea posible alcanzar una tasa de éxito del 100 %. Nota: el puntaje del 5.5 % de GPT-5.6 Sol es consecuencia del límite de 300 turnos de la prueba de referencia, un límite que no tendrían clientes reales que usan Max. El modelo con una configuración similar obtuvo un puntaje del 11.5 % al encontrarse con menos límites.

  15. 15
  16. 16

    Cuando realizamos pruebas con modelos de terceros, usamos una configuración de investigación más sencilla. Codex tiene una configuración de producción más compleja, lo que puede generar distintas tasas de error del modelo base. Las medidas de protección del proveedor y las implementaciones de herramientas informáticas también siguen siendo diferentes. Los usuarios no experimentan el escenario sin confirmación en Codex, ya que se trata de una configuración de investigación interna.

  17. 17

    Para ScreenSpot-Pro y ExploitGym, los puntajes de Fable que reportamos provienen de Mythos, que es Fable con menos salvaguardas.