Pasar al contenido principal
OpenAI

Presentamos GPT‑6 Sol y Luna

Más formas de incorporar inteligencia de vanguardia a tu trabajo diario.

Cargando...

A principios de este mes, presentamos GPT‑6 Astra, el modelo más inteligente y alineado del mundo. Aunque los proyectos más exigentes e importantes siguen requiriendo toda la profundidad de Astra, el trabajo se realiza a distintas escalas, ritmos y presupuestos.

Por eso, ampliamos el universo de GPT‑6 con GPT‑6 Sol y GPT‑6 Luna. GPT‑6 Astra presentó una nueva generación de inteligencia; estos modelos ayudan a extender sus beneficios al impulsar la vanguardia de la eficiencia en costos. Entrenamos GPT‑6 Sol y Luna con métodos similares a los de GPT‑6 Astra, para llevar los avances que sustentan el rendimiento de vanguardia de Astra en el trabajo profesional, la precisión factual, la programación, el uso de computadoras y el alineamiento a modelos más rápidos y económicos.

Los modelos GPT‑6 lideran toda la curva de costo e inteligencia, al combinar capacidades excepcionales en cada nivel con una infraestructura que permite ofrecerlas de manera eficiente y a gran escala. Las mejoras en el almacenamiento en caché y la inferencia nos permiten ofrecer estos modelos a un menor costo, y trasladamos esos ahorros directamente a usuarios y clientes al reducir los precios de la API de Sol y Luna en un 50 % frente a sus precios promocionales de GPT‑5.6. En conjunto, estas mejoras hacen que la IA avanzada sea práctica para más tareas cotidianas y aplicaciones a gran escala.

Precios de la API de GPT‑6

Modelo

Entrada

Salida

Reducción de precio

GPT‑6 Sol
frente a GPT‑5.6 Sol

USD 4 → USD 2

USD 20 → USD 10

50 % más barato

GPT‑6 Luna
frente a GPT‑5.6 Luna

USD 0,20 → USD 0,10

USD 1,20 → USD 0,50

50 % más barato

Los precios son por 1 millón de tokens.

GPT‑6 Astra sigue siendo nuestro mejor modelo en todos los aspectos. Elígelo cuando quieras los mejores resultados y una experiencia sin concesiones.

Un avance para toda la familia de modelos

GPT‑6 Sol y Luna aportan mejoras de inteligencia y eficiencia en costos a los modelos que ya conoces y usas, en las capacidades más útiles para completar trabajos complejos.

Trabajo profesional

GPT‑6 Sol puede abordar tareas difíciles y darte más margen para iterar gracias a límites de uso más altos y un menor costo, con más inteligencia y mejores resultados que los modelos de la competencia con precios similares.

En AutomationBench, una prueba de flujos de trabajo empresariales entre aplicaciones, GPT‑6 Sol con esfuerzo extra alto supera a Claude Opus 5 con esfuerzo máximo por tan solo el 9 % del costo por tarea de Opus 5. Con esfuerzo alto, GPT‑6 Luna supera a su predecesor por 5,4 puntos porcentuales, con un costo por tarea un 58 % menor.

En AutomationBench 1.0.6⁠(se abre en una nueva ventana), se prueba a los agentes de IA en flujos de trabajo integrales que usan 47 herramientas de ventas, marketing, operaciones, soporte, finanzas y RR. HH. El dato de Claude Fable 5.1 subestima su costo real porque omite el costo de recurrir a Opus 5, algo que ocurrió en aproximadamente el 40 % de las tareas.

GPT‑6 Sol también supera a Claude Fable 5.1 a un costo mucho menor e incluso vence a GPT‑6 Astra con esfuerzo bajo.

Modelo (y esfuerzo)

Puntuación

Costo por tarea

GPT‑6 Sol (extra alto)

33,2 %

USD 0,27

GPT‑6 Astra (bajo)

30,3 %

3,9 veces GPT‑6 Sol

Claude Opus 5 (máximo)

26,9 %

11,1 veces GPT‑6 Sol

Claude Fable 5.1 con respaldo de Opus 5 (máximo)

31,4 %

>8,9 veces GPT‑6 Sol

(no se informó el costo del respaldo)

En Agents’ Last Exam, que evalúa a agentes en flujos de trabajo profesionales complejos, GPT‑6 Sol con esfuerzo máximo obtiene un 56,4 %, por encima de la mejor puntuación de Claude Opus 5 en la evaluación, con un costo por tarea un 60 % menor.

En Agents’ Last Exam V1⁠(se abre en una nueva ventana), se evalúa a los agentes de IA en tareas de larga duración y valor económico que abarcan 55 subindustrias y cubren la mayoría de las principales áreas de trabajo profesional realizado en una computadora.

Precisión factual

La utilidad de una respuesta depende de que los datos sean correctos, y seguimos avanzando en la confiabilidad factual. En nuestra evaluación interna de precisión factual, basada en conversaciones reales desidentificadas en las que los usuarios marcaron errores de nuestros modelos, GPT‑6 Sol comete cerca de la mitad de los errores que su predecesor y se acerca a la confiabilidad de Astra a un costo mucho menor. GPT‑6 Luna también mejora considerablemente; con niveles de esfuerzo más altos, iguala a GPT‑5.6 Sol por cerca de una centésima parte de su costo.

Aquí evaluamos la precisión factual en conversaciones desidentificadas de ChatGPT en las que los usuarios habían marcado un error factual de un modelo anterior. Estas conversaciones propensas a generar errores no representan el uso habitual, donde los errores factuales son menos frecuentes. Las puntuaciones no se controlan por longitud; sin embargo, nuestros análisis de distintos niveles de extensión mostraron una dependencia casi nula de la longitud de la respuesta.

Programación

Este año, los agentes de programación comenzaron a abordar tareas de mayor complejidad, alcance y duración que nunca. En OpenAI, nuestro uso interno ha crecido exponencialmente. A precios de API, el uso diario de tokens ha superado los USD 600 para el investigador situado en la mediana de uso y los USD 7000 para los investigadores del percentil 90 (Acelerar la investigación: una mirada al interior de OpenAI⁠). A medida que los agentes de programación asumen tareas más largas y exigentes, el costo del uso sostenido cobra mayor importancia. GPT‑6 Sol y Luna combinan un sólido rendimiento en programación con precios de API más bajos, lo que da a los desarrolladores más margen para iterar y a los equipos la confianza para ser más ambiciosos con las tareas que encargan a Codex.

En FrontierCode, que evalúa si los agentes de programación producen cambios listos para integrarse en bases de código reales, GPT‑6 Sol mejora considerablemente frente a GPT‑5.6 Sol e iguala a Claude Fable 5.1 con esfuerzo extra alto por un costo mucho menor.

En FrontierCode 1.1 Main⁠(se abre en una nueva ventana), los agentes de IA escriben código que se evalúa no solo por su corrección, sino también por su “capacidad de integración”: por ejemplo, la calidad de las pruebas, el control del alcance, el estilo del código y el cumplimiento de los estándares de la base de código.

En DeepSWE v1.1, que prueba el rendimiento en tareas complejas de ingeniería de software en bases de código reales, GPT‑6 Sol con esfuerzo máximo obtiene un 68,8 %, a 1,1 puntos porcentuales de la mejor puntuación de Claude Fable 5 en la evaluación, 69,9 % con esfuerzo extra alto, con un costo por tarea aproximadamente un 80 % menor.

GPT‑6 Luna con esfuerzo máximo obtiene un 66,6 %, comparable con Claude Opus 5 y Fable 5 con esfuerzo medio. En estas comparaciones, Luna cuesta un 93 % menos por tarea que Opus 5 y un 96 % menos que Fable 5.

En DeepSWE 1.1⁠(se abre en una nueva ventana), los agentes de IA resuelven tareas originales de ingeniería de software de larga duración.

Uso de computadoras

Aunque GPT‑6 Astra sigue siendo el mejor modelo del mundo para usar computadoras, GPT‑6 Sol y Luna ofrecen un rendimiento más eficiente en costos que sus predecesores. En OSWorld 2.0 sin conexión, GPT‑6 Sol con esfuerzo extra alto logra una puntuación similar a la de Claude Opus 5 con esfuerzo medio, 60,5 % frente a 60,3 %, con un costo por tarea aproximadamente un 80 % menor. GPT‑6 Luna (máximo) supera a GPT‑5.6 Sol (medio) a una décima parte de su costo.

En OSWorld 2.0⁠(se abre en una nueva ventana), los agentes de IA intentan completar flujos de trabajo de larga duración en una computadora, que abarcan tareas cotidianas y profesionales. Informamos la recompensa parcial del conjunto sin conexión de la versión v2026.08.08.

Estilo de colaboración

También incorporamos a Sol y Luna el estilo de comunicación mejorado de GPT‑6 Astra, que creemos que se notará especialmente en conversaciones técnicas y de programación. Puedes esperar más claridad, menos jerga, menos expresiones extrañas, menos detalles de poco valor y respuestas algo más breves en general, sin perder contenido sustancial.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Aunque el estilo es subjetivo, aquí preferimos la respuesta de GPT‑6 Sol. No se apresura tanto a sacar conclusiones, dedica menos tiempo a repetir detalles que podrían ser obvios para quien pregunta (por ejemplo, que el sitio web tiene cuatro páginas), usa menos expresiones vagas (por ejemplo, "estética bento" o "reorganizar… en torno a ese sistema"), explica con mayor transparencia qué verificó y qué no, y no comparte sin necesidad detalles de implementación, como el prompt de su herramienta de imágenes.

Mejorar el almacenamiento en caché para agentes y conversaciones largas

Además de reducir los precios de los tokens, ayudamos a los desarrolladores que crean soluciones con GPT‑6 a ahorrar más en el contexto que reutilizan sus aplicaciones. Mejoramos el almacenamiento en caché de prompts para GPT‑6 con el fin de ofrecer de forma predeterminada tasas más altas de aciertos de caché, lo que ayuda a los agentes a reutilizar más contexto, responder más rápido y obtener descuentos del 90 % en las lecturas de tokens de entrada almacenados en caché.

Los desarrolladores también tienen más formas de medir y optimizar el rendimiento del almacenamiento en caché:

GitHub informa que, durante los últimos meses, estas mejoras redujeron en más del 50 % la proporción de tokens de prompts que requieren procesamiento nuevo en miles de millones de solicitudes a modelos de OpenAI, lo que ayuda a Copilot a responder más rápido.

Seguir mejorando el alineamiento

GPT‑6 Sol y Luna aprovechan el trabajo de alineamiento presentado con Astra, nuestro modelo más alineado hasta la fecha. En nuestras evaluaciones de alineamiento, tanto Sol como Luna muestran mejoras frente a sus equivalentes GPT‑5.6, incluidas tasas más bajas de afirmaciones engañosas sobre su trabajo de programación.

Las siguientes evaluaciones prueban deliberadamente situaciones difíciles y no miden las tasas de falla en el uso habitual. Consulta la tarjeta del sistema⁠(se abre en una nueva ventana) para conocer los resultados completos.

Disponibilidad

GPT‑6 Sol y GPT‑6 Luna están disponibles desde hoy en ChatGPT Work y Codex para todos los usuarios de Plus, Pro, Business, Enterprise y Edu. Los usuarios de Free y Go pueden acceder a GPT‑6 Luna en la aplicación de escritorio. Estos modelos aún no están disponibles en Chat. En la API de OpenAI, están disponibles como gpt-6-sol y gpt-6-luna.

Para mantener la estabilidad del servicio para todos, planeamos implementar estos modelos gradualmente en ChatGPT a lo largo del día. Si no ves los nuevos modelos en ChatGPT Work o Codex, inténtalo de nuevo más tarde.


Las evaluaciones de GPT se realizaron en nuestro entorno de investigación o mediante nuestra API, que puede generar resultados ligeramente distintos a los de ChatGPT en producción debido a diferencias en los prompts del sistema, las herramientas disponibles, etc. Las evaluaciones de los modelos de la competencia se obtuvieron de informes públicos. Se usaron las puntuaciones de Claude Fable 5 cuando no había puntuaciones disponibles de Claude Fable 5.1.

Autor

OpenAI