Presentamos GPT‑6 Sol y Luna
Más formas de incorporar inteligencia de vanguardia a tu trabajo diario.
A principios de este mes, presentamos GPT‑6 Astra, el modelo más inteligente y alineado del mundo. Aunque los proyectos más exigentes e importantes siguen requiriendo toda la profundidad de Astra, el trabajo se realiza a distintas escalas, ritmos y presupuestos.
Por eso, ampliamos el universo de GPT‑6 con GPT‑6 Sol y GPT‑6 Luna. GPT‑6 Astra presentó una nueva generación de inteligencia; estos modelos ayudan a extender sus beneficios al impulsar la vanguardia de la eficiencia en costos. Entrenamos GPT‑6 Sol y Luna con métodos similares a los de GPT‑6 Astra, para llevar los avances que sustentan el rendimiento de vanguardia de Astra en el trabajo profesional, la precisión factual, la programación, el uso de computadoras y el alineamiento a modelos más rápidos y económicos.
Los modelos GPT‑6 lideran toda la curva de costo e inteligencia, al combinar capacidades excepcionales en cada nivel con una infraestructura que permite ofrecerlas de manera eficiente y a gran escala. Las mejoras en el almacenamiento en caché y la inferencia nos permiten ofrecer estos modelos a un menor costo, y trasladamos esos ahorros directamente a usuarios y clientes al reducir los precios de la API de Sol y Luna en un 50 % frente a sus precios promocionales de GPT‑5.6. En conjunto, estas mejoras hacen que la IA avanzada sea práctica para más tareas cotidianas y aplicaciones a gran escala.
Modelo | Entrada | Salida | Reducción de precio |
GPT‑6 Sol | USD 4 → USD 2 | USD 20 → USD 10 | 50 % más barato |
GPT‑6 Luna | USD 0,20 → USD 0,10 | USD 1,20 → USD 0,50 | 50 % más barato |
Los precios son por 1 millón de tokens.
GPT‑6 Astra sigue siendo nuestro mejor modelo en todos los aspectos. Elígelo cuando quieras los mejores resultados y una experiencia sin concesiones.
GPT‑6 Sol y Luna aportan mejoras de inteligencia y eficiencia en costos a los modelos que ya conoces y usas, en las capacidades más útiles para completar trabajos complejos.
GPT‑6 Sol puede abordar tareas difíciles y darte más margen para iterar gracias a límites de uso más altos y un menor costo, con más inteligencia y mejores resultados que los modelos de la competencia con precios similares.
En AutomationBench, una prueba de flujos de trabajo empresariales entre aplicaciones, GPT‑6 Sol con esfuerzo extra alto supera a Claude Opus 5 con esfuerzo máximo por tan solo el 9 % del costo por tarea de Opus 5. Con esfuerzo alto, GPT‑6 Luna supera a su predecesor por 5,4 puntos porcentuales, con un costo por tarea un 58 % menor.
En AutomationBench 1.0.6(se abre en una nueva ventana), se prueba a los agentes de IA en flujos de trabajo integrales que usan 47 herramientas de ventas, marketing, operaciones, soporte, finanzas y RR. HH. El dato de Claude Fable 5.1 subestima su costo real porque omite el costo de recurrir a Opus 5, algo que ocurrió en aproximadamente el 40 % de las tareas.
GPT‑6 Sol también supera a Claude Fable 5.1 a un costo mucho menor e incluso vence a GPT‑6 Astra con esfuerzo bajo.
Modelo (y esfuerzo) | Puntuación | Costo por tarea |
|---|---|---|
GPT‑6 Sol (extra alto) | 33,2 % | USD 0,27 |
GPT‑6 Astra (bajo) | 30,3 % | 3,9 veces GPT‑6 Sol |
Claude Opus 5 (máximo) | 26,9 % | 11,1 veces GPT‑6 Sol |
Claude Fable 5.1 con respaldo de Opus 5 (máximo) | 31,4 % | >8,9 veces GPT‑6 Sol (no se informó el costo del respaldo) |
En Agents’ Last Exam, que evalúa a agentes en flujos de trabajo profesionales complejos, GPT‑6 Sol con esfuerzo máximo obtiene un 56,4 %, por encima de la mejor puntuación de Claude Opus 5 en la evaluación, con un costo por tarea un 60 % menor.
En Agents’ Last Exam V1(se abre en una nueva ventana), se evalúa a los agentes de IA en tareas de larga duración y valor económico que abarcan 55 subindustrias y cubren la mayoría de las principales áreas de trabajo profesional realizado en una computadora.
La utilidad de una respuesta depende de que los datos sean correctos, y seguimos avanzando en la confiabilidad factual. En nuestra evaluación interna de precisión factual, basada en conversaciones reales desidentificadas en las que los usuarios marcaron errores de nuestros modelos, GPT‑6 Sol comete cerca de la mitad de los errores que su predecesor y se acerca a la confiabilidad de Astra a un costo mucho menor. GPT‑6 Luna también mejora considerablemente; con niveles de esfuerzo más altos, iguala a GPT‑5.6 Sol por cerca de una centésima parte de su costo.
Aquí evaluamos la precisión factual en conversaciones desidentificadas de ChatGPT en las que los usuarios habían marcado un error factual de un modelo anterior. Estas conversaciones propensas a generar errores no representan el uso habitual, donde los errores factuales son menos frecuentes. Las puntuaciones no se controlan por longitud; sin embargo, nuestros análisis de distintos niveles de extensión mostraron una dependencia casi nula de la longitud de la respuesta.
Este año, los agentes de programación comenzaron a abordar tareas de mayor complejidad, alcance y duración que nunca. En OpenAI, nuestro uso interno ha crecido exponencialmente. A precios de API, el uso diario de tokens ha superado los USD 600 para el investigador situado en la mediana de uso y los USD 7000 para los investigadores del percentil 90 (Acelerar la investigación: una mirada al interior de OpenAI). A medida que los agentes de programación asumen tareas más largas y exigentes, el costo del uso sostenido cobra mayor importancia. GPT‑6 Sol y Luna combinan un sólido rendimiento en programación con precios de API más bajos, lo que da a los desarrolladores más margen para iterar y a los equipos la confianza para ser más ambiciosos con las tareas que encargan a Codex.
En FrontierCode, que evalúa si los agentes de programación producen cambios listos para integrarse en bases de código reales, GPT‑6 Sol mejora considerablemente frente a GPT‑5.6 Sol e iguala a Claude Fable 5.1 con esfuerzo extra alto por un costo mucho menor.
En FrontierCode 1.1 Main(se abre en una nueva ventana), los agentes de IA escriben código que se evalúa no solo por su corrección, sino también por su “capacidad de integración”: por ejemplo, la calidad de las pruebas, el control del alcance, el estilo del código y el cumplimiento de los estándares de la base de código.
En DeepSWE v1.1, que prueba el rendimiento en tareas complejas de ingeniería de software en bases de código reales, GPT‑6 Sol con esfuerzo máximo obtiene un 68,8 %, a 1,1 puntos porcentuales de la mejor puntuación de Claude Fable 5 en la evaluación, 69,9 % con esfuerzo extra alto, con un costo por tarea aproximadamente un 80 % menor.
GPT‑6 Luna con esfuerzo máximo obtiene un 66,6 %, comparable con Claude Opus 5 y Fable 5 con esfuerzo medio. En estas comparaciones, Luna cuesta un 93 % menos por tarea que Opus 5 y un 96 % menos que Fable 5.
En DeepSWE 1.1(se abre en una nueva ventana), los agentes de IA resuelven tareas originales de ingeniería de software de larga duración.
Aunque GPT‑6 Astra sigue siendo el mejor modelo del mundo para usar computadoras, GPT‑6 Sol y Luna ofrecen un rendimiento más eficiente en costos que sus predecesores. En OSWorld 2.0 sin conexión, GPT‑6 Sol con esfuerzo extra alto logra una puntuación similar a la de Claude Opus 5 con esfuerzo medio, 60,5 % frente a 60,3 %, con un costo por tarea aproximadamente un 80 % menor. GPT‑6 Luna (máximo) supera a GPT‑5.6 Sol (medio) a una décima parte de su costo.
En OSWorld 2.0(se abre en una nueva ventana), los agentes de IA intentan completar flujos de trabajo de larga duración en una computadora, que abarcan tareas cotidianas y profesionales. Informamos la recompensa parcial del conjunto sin conexión de la versión v2026.08.08.
También incorporamos a Sol y Luna el estilo de comunicación mejorado de GPT‑6 Astra, que creemos que se notará especialmente en conversaciones técnicas y de programación. Puedes esperar más claridad, menos jerga, menos expresiones extrañas, menos detalles de poco valor y respuestas algo más breves en general, sin perder contenido sustancial.
Aunque el estilo es subjetivo, aquí preferimos la respuesta de GPT‑6 Sol. No se apresura tanto a sacar conclusiones, dedica menos tiempo a repetir detalles que podrían ser obvios para quien pregunta (por ejemplo, que el sitio web tiene cuatro páginas), usa menos expresiones vagas (por ejemplo, "estética bento" o "reorganizar… en torno a ese sistema"), explica con mayor transparencia qué verificó y qué no, y no comparte sin necesidad detalles de implementación, como el prompt de su herramienta de imágenes.
Además de reducir los precios de los tokens, ayudamos a los desarrolladores que crean soluciones con GPT‑6 a ahorrar más en el contexto que reutilizan sus aplicaciones. Mejoramos el almacenamiento en caché de prompts para GPT‑6 con el fin de ofrecer de forma predeterminada tasas más altas de aciertos de caché, lo que ayuda a los agentes a reutilizar más contexto, responder más rápido y obtener descuentos del 90 % en las lecturas de tokens de entrada almacenados en caché.
Los desarrolladores también tienen más formas de medir y optimizar el rendimiento del almacenamiento en caché:
Supervisar y diagnosticar. El panel de almacenamiento en caché de prompts(se abre en una nueva ventana) muestra cuánta entrada se almacena en caché y cómo cambia con el tiempo. La herramienta de diagnóstico(se abre en una nueva ventana) ayuda a explicar las oportunidades de almacenamiento en caché desaprovechadas y qué debes corregir.
Ajustar el esfuerzo de razonamiento y la disponibilidad de herramientas sin invalidar la caché. Aumenta el esfuerzo de razonamiento(se abre en una nueva ventana) para tareas más difíciles o redúcelo para seguimientos más sencillos, y activa o desactiva herramientas(se abre en una nueva ventana) según cambien las necesidades de tu agente. Ahora ambos controles conservan el contexto anterior para reutilizarlo desde la caché.
Optimizar qué prefijos se almacenan en caché. Los puntos de interrupción explícitos permiten a los desarrolladores elegir dónde terminan los prefijos de prompts almacenados en caché. Esto brinda a los desarrolladores más control sobre la reutilización de la caché y puede mejorar el rendimiento.
GitHub informa que, durante los últimos meses, estas mejoras redujeron en más del 50 % la proporción de tokens de prompts que requieren procesamiento nuevo en miles de millones de solicitudes a modelos de OpenAI, lo que ayuda a Copilot a responder más rápido.
GPT‑6 Sol y Luna aprovechan el trabajo de alineamiento presentado con Astra, nuestro modelo más alineado hasta la fecha. En nuestras evaluaciones de alineamiento, tanto Sol como Luna muestran mejoras frente a sus equivalentes GPT‑5.6, incluidas tasas más bajas de afirmaciones engañosas sobre su trabajo de programación.
Las siguientes evaluaciones prueban deliberadamente situaciones difíciles y no miden las tasas de falla en el uso habitual. Consulta la tarjeta del sistema(se abre en una nueva ventana) para conocer los resultados completos.
GPT‑6 Sol y GPT‑6 Luna están disponibles desde hoy en ChatGPT Work y Codex para todos los usuarios de Plus, Pro, Business, Enterprise y Edu. Los usuarios de Free y Go pueden acceder a GPT‑6 Luna en la aplicación de escritorio. Estos modelos aún no están disponibles en Chat. En la API de OpenAI, están disponibles como gpt-6-sol y gpt-6-luna.
Para mantener la estabilidad del servicio para todos, planeamos implementar estos modelos gradualmente en ChatGPT a lo largo del día. Si no ves los nuevos modelos en ChatGPT Work o Codex, inténtalo de nuevo más tarde.
Las evaluaciones de GPT se realizaron en nuestro entorno de investigación o mediante nuestra API, que puede generar resultados ligeramente distintos a los de ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, etc. Las evaluaciones de los modelos de la competencia se obtuvieron de informes públicos. Se usaron las puntuaciones de Claude Fable 5 cuando no había puntuaciones disponibles de Claude Fable 5.1.


