GPT-6.1Sol
Inteligencia cercana a Astra a una quinta parte del precio, con un rendimiento de vanguardia sostenido
Presentamos GPT‑6.1 Sol, una actualización de GPT‑6 Sol con un rendimiento excepcional en codificación con agentes, así como en el uso de la computadora y el trabajo profesional. Acerca a Sol al nivel de GPT‑6 Astra en tareas exigentes, a una quinta parte de los precios estándar de Astra por tokens de entrada y salida. Así, los desarrolladores tienen más margen para crear y ejecutar agentes capaces con el mismo presupuesto.
GPT‑6.1 Sol ofrece un rendimiento cercano al de Astra al precio de Sol, lo que lo convierte en el modelo con la mejor relación entre costo y rendimiento disponible hoy. La entrada en caché cuesta solo $0,10 por millón de tokens, un descuento del 95 % sobre el precio de entrada estándar. Esto lo hace más económico para cargas de trabajo con agentes que necesitan reutilizar el contexto en solicitudes repetidas.
GPT‑6 Astra sigue siendo nuestro modelo de vanguardia con mayor capacidad general. GPT‑6.1 Sol ofrece un nuevo equilibrio entre capacidad y costo para el trabajo importante que los usuarios quieren realizar con mayor frecuencia y para los clientes de la API que crean y ejecutan aplicaciones a escala.

GPT‑6.1 Sol ofrece mejoras sustanciales respecto de GPT‑6 Sol en trabajos profesionales complejos, desde escribir y depurar código hasta comprender documentos y ejecutar flujos de trabajo empresariales de varios pasos. En varias de estas evaluaciones, se acerca al rendimiento de GPT‑6 Astra a un costo considerablemente menor.
En DeepSWE v1.1, que evalúa tareas complejas de ingeniería de software en bases de código reales, GPT‑6.1 Sol iguala a GPT‑6 Astra a aproximadamente una quinta parte del costo, y supera la mejor puntuación de GPT‑6 Sol por 6,4 puntos porcentuales con menor esfuerzo de razonamiento y costo.
En DeepSWE 1.1(se abre en una nueva ventana), los agentes de IA resuelven tareas originales de ingeniería de software que requieren trabajo prolongado.
En GDP.pdf, que mide la precisión con la que los modelos responden preguntas profesionales a partir de documentos PDF complejos con tablas, gráficos, diagramas y detalles en letra pequeña, GPT‑6.1 Sol supera la puntuación de Opus 5.5 con modelos de respaldo a menos de la mitad del costo por tarea en las configuraciones de razonamiento evaluadas. También se acerca al rendimiento líder de GPT‑6 Astra a aproximadamente una quinta parte del costo por tarea.
En GDP.pdf(se abre en una nueva ventana), los modelos deben responder a prompts reales sobre archivos PDF complejos provenientes de flujos de trabajo profesionales de finanzas, salud, derecho y otros siete ámbitos.
En AutomationBench, que mide si los agentes completan correctamente flujos de trabajo empresariales de varios pasos, GPT‑6.1 Sol supera a Opus 5.5 por 2,2 puntos porcentuales con un esfuerzo de razonamiento medio, a aproximadamente un tercio del costo. Esa puntuación también supera por 4,8 puntos porcentuales la de GPT‑6 Sol con la misma configuración.
In AutomationBench 1.0.6(se abre en una nueva ventana), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol también logra avances sustanciales en tareas que requieren interactuar con aplicaciones de computadora. En el conjunto sin conexión de OSWorld 2.0, que evalúa a los agentes en flujos de trabajo exigentes con uso de la computadora, GPT‑6.1 Sol supera a GPT‑6 Sol por siete puntos porcentuales con el máximo esfuerzo de razonamiento, a menos de la mitad del costo. Queda a solo 2,1 puntos porcentuales de la puntuación de Astra con el máximo esfuerzo de razonamiento, a aproximadamente una séptima parte del costo por tarea.
In OSWorld 2.0(se abre en una nueva ventana), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
En Terminal-Bench Science 0.1, que evalúa flujos de trabajo científicos como el análisis de datos, la simulación y la demostración de teoremas, GPT‑6.1 Sol obtiene más del doble de la puntuación de GPT‑6 Sol con el máximo esfuerzo de razonamiento, a menos de la mitad del costo por tarea. Con el esfuerzo al máximo, GPT‑6.1 Sol cuesta en promedio $5,47 por tarea, frente a $23,21 de Opus 5.5 y $23,80 de Astra, y ofrece una capacidad científica considerable a un costo más de un 75 % menor que el de cualquiera de los dos modelos.
GPT‑6 Astra sigue obteniendo la puntuación más alta entre los modelos evaluados, con un 68,1 %, y es el que se debe usar para las tareas de investigación científica más difíciles.
En Terminal-Bench Science 0.1(se abre en una nueva ventana), los agentes completan flujos de trabajo de investigación científica mediante código y herramientas de terminal, lo que incluye analizar datos, ejecutar simulaciones y ajustar modelos.
GPT‑6.1 Sol también mejora la precisión factual en prompts difíciles. Con un esfuerzo de razonamiento muy alto, su tasa de errores factuales es del 4,1 %, inferior al 4,5 % de GPT‑6 Sol y más cercana al 4,0 % de Astra con la misma configuración, a un costo por tarea aproximadamente un 83 % menor que el de Astra.
Esta evaluación mide la proporción de respuestas que contienen al menos un error factual en conversaciones sin datos identificables en las que los usuarios señalaron un error de un modelo anterior. Estos prompts deliberadamente difíciles no son representativos del uso habitual.
Evaluamos la precisión factual en conversaciones de ChatGPT sin datos identificables en las que los usuarios habían señalado un error factual de un modelo anterior. Estas conversaciones que propician errores no son representativas del uso habitual, en el que los errores factuales son menos frecuentes.
GPT‑6.1 Sol muestra mejoras sustanciales respecto de GPT‑6 Sol en nuestras evaluaciones de alineación, lo que lo acerca a GPT‑6 Astra.
GPT‑6.1 Sol es más transparente sobre sus limitaciones y más confiable al respetar la intención del usuario y las restricciones de seguridad. En evaluaciones exigentes, muestra tasas de fallas más bajas que GPT‑6 Sol al informar sobre herramientas de búsqueda que no funcionan, respetar restricciones explícitas y evitar resultados no autorizados en tareas con agentes. No observamos intentos de evadir a un revisor de seguridad automatizado, al igual que con GPT‑6 Astra y GPT‑6 Sol.
Las siguientes evaluaciones ponen a prueba deliberadamente situaciones difíciles y no miden las tasas de fallas en el uso habitual.
GPT‑6.1 Sol está disponible desde hoy para todos los usuarios de Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex. Estos modelos aún no están disponibles en Chat. Los desarrolladores también pueden acceder a él a través de la API de OpenAI como gpt-6.1-sol. Sus precios estándar en la API son de $2 por millón de tokens de entrada, $0,10 por millón de tokens de entrada en caché y $10 por millón de tokens de salida.
Además, lanzamos GPT‑6 Astra Ultrafast, el modelo de vanguardia más rápido del mundo, con hasta 8 veces la velocidad de GPT‑6 Astra, junto con GPT‑6.1 Sol Ultrafast. Están disponibles en la API y también en ChatGPT Work y Codex para los usuarios de nuestro nuevo nivel Pro, que ofrece los mayores límites de uso por $500 al mes. Con GPT‑6.1 Sol Ultrafast, los desarrolladores pueden obtener una inteligencia cercana a Astra con hasta 8 veces la velocidad, por aproximadamente el mismo gasto en la API que antes requería GPT‑6 Astra.
Autor
Las evaluaciones de GPT se realizaron en nuestro entorno de investigación o a través de nuestra API, que pueden generar respuestas ligeramente distintas a las de ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, los niveles de esfuerzo, etc. Las evaluaciones de los modelos de la competencia se tomaron de informes públicos.

