Ir al contenido principal
OpenAI

Presentamos GPT‑6 Sol y Luna

Más formas de incorporar inteligencia de vanguardia a tu trabajo diario.

Cargando…

A principios de este mes presentamos GPT‑6 Astra, el modelo más inteligente y alineado del mundo. Aunque los proyectos más exigentes e importantes siguen necesitando toda la profundidad de Astra, el trabajo se desarrolla a distintas escalas, ritmos y presupuestos.

Por eso ampliamos el universo GPT‑6 con GPT‑6 Sol y GPT‑6 Luna. GPT‑6 Astra inauguró una nueva generación de inteligencia; estos modelos ayudan a extender sus beneficios al impulsar la vanguardia de la eficiencia de costes. Entrenamos GPT‑6 Sol y Luna con métodos similares a los de GPT‑6 Astra, trasladando a modelos más rápidos y asequibles los avances que sustentan el rendimiento de vanguardia de Astra en trabajo profesional, precisión factual, programación, uso del ordenador y alineación.

Los modelos GPT‑6 lideran toda la curva de coste e inteligencia, al combinar capacidades excepcionales en cada nivel con una infraestructura que las ofrece de manera eficiente y a gran escala. Las mejoras en el almacenamiento en caché y la inferencia nos permiten ofrecer estos modelos a menor coste, y trasladamos ese ahorro directamente a usuarios y clientes al reducir un 50 % los precios de la API de Sol y Luna frente a sus precios promocionales de GPT‑5.6. En conjunto, estas mejoras hacen que la IA avanzada resulte práctica para más tareas cotidianas y aplicaciones a gran escala.

Precios de la API de GPT‑6

Modelo

Entrada

Salida

Reducción de precio

GPT‑6 Sol
frente a GPT‑5.6 Sol

4 USD → 2 USD

20 USD → 10 USD

Un 50 % más barato

GPT‑6 Luna
frente a GPT‑5.6 Luna

0,20 USD → 0,10 USD

1,20 USD → 0,50 USD

Un 50 % más barato

Los precios son por millón de tokens.

GPT‑6 Astra sigue siendo nuestro mejor modelo en todos los aspectos. Elígelo cuando quieras los mejores resultados y una experiencia sin concesiones.

Un salto adelante en toda la familia de modelos

GPT‑6 Sol y Luna aportan mejoras de inteligencia y eficiencia de costes a los modelos que ya conoces y utilizas, sobre todo en las capacidades más útiles para completar trabajos complejos.

Trabajo profesional

GPT‑6 Sol puede encargarse de tareas difíciles y darte más margen para iterar gracias a unos límites de uso más altos y un coste menor, con más inteligencia y mejores resultados que los modelos de la competencia con precios similares.

En AutomationBench, una prueba de flujos de trabajo empresariales entre aplicaciones, GPT‑6 Sol con esfuerzo muy alto supera a Claude Opus 5 con esfuerzo máximo y cuesta solo un 9 % de lo que cuesta Opus 5 por tarea. Con esfuerzo alto, GPT‑6 Luna mejora a su predecesor en 5,4 puntos porcentuales con un coste por tarea un 58 % menor.

En AutomationBench 1.0.6⁠(se abre en una ventana nueva), los agentes de IA se someten a pruebas con flujos de trabajo integrales que utilizan 47 herramientas de ventas, marketing, operaciones, soporte, finanzas y RR. HH. El dato de Claude Fable 5.1 infravalora su coste real, ya que omite el coste de recurrir a Opus 5 como alternativa, algo que ocurrió en aproximadamente el 40 % de las tareas.

GPT‑6 Sol también supera a Claude Fable 5.1 con un coste muy inferior e incluso aventaja a GPT‑6 Astra con esfuerzo bajo.

Modelo (y esfuerzo)

Puntuación

Coste por tarea

GPT‑6 Sol (muy alto)

33,2 %

0,27 USD

GPT‑6 Astra (bajo)

30,3 %

3,9 veces GPT‑6 Sol

Claude Opus 5 (máximo)

26,9 %

11,1 veces GPT‑6 Sol

Claude Fable 5.1 con Opus 5 como alternativa (máximo)

31,4 %

>8,9 veces GPT‑6 Sol

(no se indicó el coste de la opción alternativa)

En Agents’ Last Exam, que evalúa a agentes en flujos de trabajo profesionales complejos, GPT‑6 Sol con esfuerzo máximo obtiene un 56,4 %, por encima de la mejor puntuación de Claude Opus 5 en la evaluación, con un coste por tarea un 60 % menor.

En Agents’ Last Exam V1⁠(se abre en una ventana nueva), los agentes de IA se evalúan en tareas de larga duración y valor económico que abarcan 55 subsectores y cubren la mayoría de las principales áreas del trabajo profesional realizado con ordenador.

Precisión factual

La utilidad de una respuesta depende de que los datos sean correctos, y seguimos avanzando en fiabilidad factual. En nuestra evaluación interna de precisión factual, basada en conversaciones reales anonimizadas en las que los usuarios señalaron errores de nuestros modelos, GPT‑6 Sol comete aproximadamente la mitad de errores que su predecesor y se acerca a la fiabilidad de Astra con un coste muy inferior. GPT‑6 Luna también mejora considerablemente; con niveles de esfuerzo más altos, iguala a GPT‑5.6 Sol por cerca de una centésima parte de su coste.

Aquí evaluamos la precisión factual en conversaciones anonimizadas de ChatGPT en las que los usuarios habían señalado un error factual de un modelo anterior. Estas conversaciones, propensas a generar errores, no representan el uso habitual, donde los errores factuales son menos frecuentes. Las puntuaciones no se han ajustado por longitud; sin embargo, nuestras pruebas con distintos niveles de detalle apenas mostraron relación con la longitud de la respuesta.

Programación

Este año, los agentes de programación han empezado a abordar tareas de una complejidad, alcance y duración sin precedentes. En OpenAI, nuestro uso interno ha crecido exponencialmente. Valorado según los precios de la API, el uso diario de tokens por investigador ha superado los 600 USD en la mediana y los 7000 USD en el percentil 90 (Aceleración de la investigación: una mirada al interior de OpenAI⁠). A medida que los agentes de programación asumen tareas más largas y exigentes, el coste del uso continuado cobra más importancia. GPT‑6 Sol y Luna combinan un sólido rendimiento en programación con precios de API más bajos, lo que da a los desarrolladores más margen para iterar y a los equipos la confianza necesaria para ser más ambiciosos con las tareas que encargan a Codex.

En FrontierCode, que evalúa si los agentes de programación producen cambios listos para integrarse en bases de código reales, GPT‑6 Sol mejora considerablemente respecto a GPT‑5.6 Sol e iguala a Claude Fable 5.1 con esfuerzo muy alto por un coste muy inferior.

En FrontierCode 1.1 Main⁠(se abre en una ventana nueva), los agentes de IA escriben código que no solo se evalúa por su corrección, sino también por su «capacidad de integración»: por ejemplo, la calidad de las pruebas, el control del alcance, el estilo del código y el cumplimiento de los estándares de la base de código.

En DeepSWE v1.1, que mide el rendimiento en tareas complejas de ingeniería de software sobre bases de código reales, GPT‑6 Sol con esfuerzo máximo obtiene un 68,8 %, a 1,1 puntos porcentuales de la mejor puntuación de Claude Fable 5 en la evaluación —un 69,9 % con esfuerzo muy alto—, con un coste por tarea aproximadamente un 80 % menor.

GPT‑6 Luna con esfuerzo máximo obtiene un 66,6 %, comparable a Claude Opus 5 y Fable 5 con esfuerzo medio. En estas comparaciones, Luna cuesta por tarea un 93 % menos que Opus 5 y un 96 % menos que Fable 5.

En DeepSWE 1.1⁠(se abre en una ventana nueva), los agentes de IA resuelven tareas originales de ingeniería de software de larga duración.

Uso del equipo

Aunque GPT‑6 Astra sigue siendo el mejor modelo del mundo para usar el ordenador, GPT‑6 Sol y Luna ofrecen un rendimiento más rentable que sus predecesores. En OSWorld 2.0 sin conexión, GPT‑6 Sol con esfuerzo muy alto logra una puntuación similar a la de Claude Opus 5 con esfuerzo medio —60,5 % frente al 60,3 %—, con un coste por tarea aproximadamente un 80 % menor. GPT‑6 Luna (máximo) supera a GPT‑5.6 Sol (medio) por una décima parte de su coste.

En OSWorld 2.0⁠(se abre en una ventana nueva), los agentes de IA intentan completar flujos de trabajo de larga duración con el ordenador que abarcan tareas cotidianas y profesionales. Indicamos la recompensa parcial del conjunto sin conexión de la versión v2026.08.08.

Estilo de colaboración

También hemos incorporado a Sol y Luna el estilo de comunicación mejorado de GPT‑6 Astra, algo que creemos que se notará especialmente en conversaciones técnicas y de programación. Verás más claridad, menos jerga, menos giros extraños, menos detalles de escaso valor y, en general, respuestas algo más breves sin perder contenido.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Aunque el estilo es subjetivo, aquí preferimos la respuesta de GPT‑6 Sol. No se precipita tanto al sacar conclusiones, dedica menos tiempo a repetir detalles que podrían resultar obvios para quien pregunta (por ejemplo, que el sitio web tiene cuatro páginas), usa menos expresiones vagas (como «estética bento» o «reorganizar… en torno a ese sistema»), explica con más claridad qué comprobó y qué no, y evita compartir detalles de implementación innecesarios, como el prompt de su herramienta de imágenes.

Mejorar el almacenamiento en caché para agentes y conversaciones largas

Además de reducir los precios de los tokens, ayudamos a quienes desarrollan con GPT‑6 a ahorrar más en el contexto que reutilizan sus aplicaciones. Hemos mejorado el almacenamiento en caché de prompts de GPT‑6 para aumentar de forma predeterminada la tasa de aciertos, de modo que los agentes puedan reutilizar más contexto, responder más rápido y beneficiarse de descuentos del 90 % en las lecturas de tokens de entrada almacenados en caché.

Los desarrolladores también disponen de más opciones para medir y optimizar el rendimiento de la caché:

GitHub informa de que, durante los últimos meses, estas mejoras han reducido en más de un 50 % la proporción de tokens de prompts que necesitan procesarse de nuevo en miles de millones de solicitudes a modelos de OpenAI, lo que ayuda a Copilot a responder más rápido.

Seguir mejorando la alineación

GPT‑6 Sol y Luna aprovechan el trabajo de alineación presentado con Astra, nuestro modelo más alineado hasta la fecha. En nuestras evaluaciones de alineación, tanto Sol como Luna mejoran respecto a sus equivalentes GPT‑5.6, entre otras cosas al reducir la tasa de afirmaciones engañosas sobre su trabajo de programación.

Las evaluaciones siguientes ponen a prueba deliberadamente situaciones difíciles y no miden las tasas de fallos durante el uso habitual. Consulta la tarjeta del sistema⁠(se abre en una ventana nueva) para ver los resultados completos.

Disponibilidad

GPT‑6 Sol y GPT‑6 Luna están disponibles desde hoy en ChatGPT Work y Codex para todos los usuarios de los planes Plus, Pro, Business, Enterprise y Edu. Los usuarios de los planes Gratis y Go pueden acceder a GPT‑6 Luna en la aplicación de escritorio. Estos modelos aún no están disponibles en Chat. En la API de OpenAI, están disponibles como gpt-6-sol y gpt-6-luna.

Para mantener la estabilidad del servicio para todos, tenemos previsto desplegar estos modelos gradualmente en ChatGPT a lo largo del día. Si no ves los nuevos modelos en ChatGPT Work o Codex, vuelve a intentarlo más tarde.


Las evaluaciones de GPT se realizaron en nuestro entorno de investigación o mediante nuestra API, que pueden generar resultados ligeramente distintos a los de ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, etc. Las evaluaciones de los modelos de la competencia proceden de informes públicos. Se utilizaron las puntuaciones de Claude Fable 5 cuando no estaban disponibles las de Claude Fable 5.1.

Autor

OpenAI