Salta al contingut principal
OpenAI

Presentem GPT‑6 Sol i Luna

Més maneres d'incorporar la intel·ligència d'avantguarda a la feina de cada dia.

S'està carregant…

A principis d'aquest mes vam presentar GPT‑6 Astra, el model més intel·ligent i alineat del món. Tot i que els projectes més exigents i importants encara requereixen tota la profunditat d'Astra, la feina es desenvolupa a escales, ritmes i pressupostos diferents.

Per això ampliem l'univers de GPT‑6 amb GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra va inaugurar una nova generació d'intel·ligència; aquests models ajuden a estendre'n els beneficis fent avançar l'avantguarda de l'eficiència de costos. Hem entrenat GPT‑6 Sol i Luna amb mètodes semblants als de GPT‑6 Astra, de manera que els avenços que impulsen el rendiment capdavanter d'Astra en la feina professional, la veracitat, la programació, l'ús d'ordinadors i l'alineament arriben a models més ràpids i assequibles.

Els models GPT‑6 lideren tota la corba de cost-intel·ligència: combinen capacitats excepcionals en cada nivell amb una infraestructura que les ofereix de manera eficient i a gran escala. Les millores en la memòria cau i la inferència ens permeten oferir aquests models a un cost inferior, i traslladem aquest estalvi directament als usuaris i clients reduint un 50 % els preus de l'API de Sol i Luna respecte als preus promocionals de GPT‑5.6. En conjunt, aquestes millores fan que la IA avançada sigui viable per a més tasques quotidianes i aplicacions a gran escala.

Preus de l'API de GPT‑6

Model

Entrada

Sortida

Reducció del preu

GPT‑6 Sol
enfront de GPT‑5.6 Sol

4 $ → 2 $

20 $ → 10 $

Un 50 % més barat

GPT‑6 Luna
enfront de GPT‑5.6 Luna

0,20 $ → 0,10 $

1,20 $ → 0,50 $

Un 50 % més barat

Els preus són per milió de segments.

GPT‑6 Astra continua sent el nostre millor model en tots els àmbits. Tria'l si vols els millors resultats i una experiència sense concessions.

Un salt endavant en tota la família de models

GPT‑6 Sol i Luna aporten millores d'intel·ligència i eficiència de costos als models que ja coneixes i utilitzes, sobretot en les capacitats més útils per dur a terme feines complexes.

Feina professional

GPT‑6 Sol pot assumir tasques laborals difícils i, alhora, donar-te més marge per iterar gràcies a uns límits d'ús més alts i un cost inferior. També ofereix més intel·ligència i millors resultats que els models de la competència amb preus semblants.

A AutomationBench, una prova de fluxos de treball empresarials entre aplicacions, GPT‑6 Sol amb esforç extraalt supera Claude Opus 5 amb esforç màxim amb només el 9 % del cost per tasca d'Opus 5. Amb esforç alt, GPT‑6 Luna millora el seu predecessor en 5,4 punts percentuals amb un cost per tasca un 58 % inferior.

A AutomationBench 1.0.6⁠(s'obre en una finestra nova), es posen a prova agents d'IA en fluxos de treball d'extrem a extrem que fan servir 47 eines en els àmbits de vendes, màrqueting, operacions, assistència, finances i recursos humans. La dada de Claude Fable 5.1 subestima el cost real, ja que omet el cost de les activacions d'Opus 5 de reserva, que es van produir en aproximadament el 40 % de les tasques.

GPT‑6 Sol també supera Claude Fable 5.1 amb un cost molt inferior, i fins i tot obté millors resultats que GPT‑6 Astra amb esforç baix.

Model (i esforç)

Puntuació

Cost per tasca

GPT‑6 Sol (extraalt)

33,2 %

0,27 $

GPT‑6 Astra (baix)

30,3 %

3,9× GPT‑6 Sol

Claude Opus 5 (màxim)

26,9 %

11,1× GPT‑6 Sol

Claude Fable 5.1 amb Opus 5 de reserva (màxim)

31,4 %

>8,9× GPT‑6 Sol

(cost de la reserva no comunicat)

A Agents’ Last Exam, que avalua agents en fluxos de treball professionals complexos, GPT‑6 Sol amb esforç màxim obté un 56,4 %, per sobre de la puntuació màxima de Claude Opus 5 en l'avaluació, amb un cost per tasca un 60 % inferior.

A Agents’ Last Exam V1⁠(s'obre en una finestra nova), els agents d'IA s'avaluen en tasques de llarga durada i valor econòmic de 55 subindústries, que cobreixen la majoria dels principals àmbits de la feina professional feta amb ordinador.

Veracitat

La utilitat d'una resposta depèn de l'exactitud dels fets, i continuem avançant en fiabilitat factual. En la nostra avaluació interna de veracitat, basada en converses reals desidentificades en què els usuaris havien assenyalat errors dels nostres models, GPT‑6 Sol comet aproximadament la meitat d'errors que el seu predecessor i s'acosta a la fiabilitat d'Astra amb un cost molt inferior. GPT‑6 Luna també millora substancialment; amb nivells d'esforç més alts, iguala GPT‑5.6 Sol a aproximadament una centèsima part del cost.

Aquí avaluem la veracitat en converses desidentificades de ChatGPT en què els usuaris havien assenyalat un error factual d'un model anterior. Aquestes converses, dissenyades per induir errors, no representen l'ús habitual, en què els errors factuals són menys freqüents. Les puntuacions no estan controlades segons la longitud; tanmateix, les nostres proves de variació de la verbositat gairebé no van mostrar cap dependència de la longitud de la resposta.

Programació

Aquest any, els agents de programació han començat a abordar tasques més complexes, àmplies i llargues que mai. A OpenAI, el nostre ús intern ha crescut exponencialment. Valorat segons els preus de l'API, l'ús diari de segments ha superat els 600 $ per a l'investigador mitjà i els 7.000 $ per als investigadors del percentil 90 (Acceleració de la recerca: una mirada a l'interior d'OpenAI⁠). A mesura que els agents de programació assumeixen tasques més llargues i exigents, el cost de l'ús sostingut adquireix més importància. GPT‑6 Sol i Luna combinen un bon rendiment en programació amb preus d'API més baixos, cosa que dona als desenvolupadors més marge per iterar i als equips la confiança per ser més ambiciosos amb les tasques que encarreguen a Codex.

A FrontierCode, que avalua si els agents de programació generen canvis preparats per integrar-se en bases de codi reals, GPT‑6 Sol millora substancialment respecte a GPT‑5.6 Sol i iguala Claude Fable 5.1 amb esforç extraalt a un cost molt inferior.

A FrontierCode 1.1 Main⁠(s'obre en una finestra nova), els agents d'IA escriuen codi que s'avalua no només per la correcció, sinó també per la «capacitat d'integració»: per exemple, la qualitat de les proves, el respecte de l'abast, l'estil del codi i el compliment dels estàndards de la base de codi.

A DeepSWE v1.1, que prova el rendiment en tasques complexes d'enginyeria de programari en bases de codi reals, GPT‑6 Sol amb esforç màxim obté un 68,8 %, a 1,1 punts percentuals de la puntuació màxima de Claude Fable 5 en l'avaluació —un 69,9 % amb esforç extraalt— i amb un cost per tasca aproximadament un 80 % inferior.

GPT‑6 Luna amb esforç màxim obté un 66,6 %, comparable a Claude Opus 5 i Fable 5 amb esforç mitjà. En aquestes comparacions, Luna costa un 93 % menys per tasca que Opus 5 i un 96 % menys que Fable 5.

A DeepSWE 1.1⁠(s'obre en una finestra nova), els agents d'IA resolen tasques originals d'enginyeria de programari de llarga durada.

Ús d'ordinadors

Tot i que GPT‑6 Astra continua sent el millor model del món per a l'ús d'ordinadors, GPT‑6 Sol i Luna ofereixen un rendiment més eficient en costos que els seus predecessors. A OSWorld 2.0 offline, GPT‑6 Sol amb esforç extraalt obté una puntuació semblant a Claude Opus 5 amb esforç mitjà —60,5 % enfront de 60,3 %— i amb un cost per tasca aproximadament un 80 % inferior. GPT‑6 Luna (màxim) supera GPT‑5.6 Sol (mitjà) amb una desena part del cost.

A OSWorld 2.0⁠(s'obre en una finestra nova), els agents d'IA intenten completar fluxos de treball llargs d'ús d'ordinadors que inclouen tasques quotidianes i professionals. Presentem la recompensa parcial del conjunt fora de línia de la versió v2026.08.08.

Estil de col·laboració

També hem incorporat a Sol i Luna l'estil de comunicació millorat de GPT‑6 Astra, que creiem que es notarà especialment en converses tècniques i de programació. Hi trobaràs més claredat, menys argot, menys girs estranys, menys detalls de poc valor i respostes en general una mica més curtes, sense perdre substància.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Tot i que l'estil és subjectiu, aquí preferim la resposta de GPT‑6 Sol. No treu conclusions tan de pressa, dedica menys temps a repetir detalls que poden ser obvis per a qui pregunta (per exemple, que el lloc web té quatre pàgines), fa servir menys expressions vagues (com ara «aspecte bento» o «reorganitzar... al voltant d'aquest sistema»), explica amb més claredat què ha comprovat i què no, i no comparteix innecessàriament detalls d'implementació com la indicació de la seva eina d'imatges.

Millores de la memòria cau per als agents i les converses llargues

A més d'abaixar els preus dels segments, ajudem els desenvolupadors que creen amb GPT‑6 a estalviar més en el context que reutilitzen les seves aplicacions. Hem millorat l'emmagatzematge en memòria cau d'indicacions de GPT‑6 perquè, per defecte, ofereixi taxes d'encert més altes. Això ajuda els agents a reutilitzar més context, respondre més de pressa i beneficiar-se d'un descompte del 90 % en la lectura de segments d'entrada des de la memòria cau.

Els desenvolupadors també disposen de més opcions per mesurar i optimitzar el rendiment de la memòria cau:

GitHub informa que, durant els darrers mesos, aquestes millores han reduït més d'un 50 % la proporció de segments d'indicacions que requereixen un processament nou en milers de milions de sol·licituds als models d'OpenAI, fet que ajuda Copilot a respondre més de pressa.

Millores contínues en l'alineament

GPT‑6 Sol i Luna parteixen del treball d'alineament introduït amb Astra, el nostre model més alineat fins ara. En les nostres avaluacions d'alineament, tant Sol com Luna milloren respecte als seus equivalents GPT‑5.6, entre altres aspectes amb taxes més baixes d'afirmacions enganyoses sobre la feina de programació que han dut a terme.

Les avaluacions següents posen a prova deliberadament situacions difícils i no mesuren les taxes d'error en l'ús habitual. Consulta la fitxa del model⁠(s'obre en una finestra nova) per veure tots els resultats.

Disponibilitat

GPT‑6 Sol i GPT‑6 Luna estan disponibles des d'avui a ChatGPT Work i Codex per a tots els usuaris de Plus, Pro, Business, Enterprise i Edu. Els usuaris de Free i Go poden accedir a GPT‑6 Luna des de l'aplicació d'escriptori. Aquests models encara no estan disponibles a Chat. A l'API d'OpenAI, estan disponibles com a gpt-6-sol i gpt-6-luna.

Per mantenir el servei estable per a tothom, tenim previst desplegar gradualment aquests models a ChatGPT al llarg del dia. Si no veus els models nous a ChatGPT Work o Codex, torna-ho a provar més tard.


Les avaluacions de GPT es van dur a terme al nostre entorn de recerca o mitjançant la nostra API, que pot generar resultats lleugerament diferents dels de ChatGPT en producció a causa de diferències en les indicacions del sistema, les eines disponibles, etc. Les avaluacions dels models de la competència provenen d'informes disponibles públicament. Quan no hi havia puntuacions de Claude Fable 5.1, es van utilitzar les de Claude Fable 5.

Autor

OpenAI