Presentem GPT‑6 Sol i Luna
Més maneres d'incorporar la intel·ligència d'avantguarda a la feina de cada dia.
A principis d'aquest mes vam presentar GPT‑6 Astra, el model més intel·ligent i alineat del món. Tot i que els projectes més exigents i importants encara requereixen tota la profunditat d'Astra, la feina es desenvolupa a escales, ritmes i pressupostos diferents.
Per això ampliem l'univers de GPT‑6 amb GPT‑6 Sol i GPT‑6 Luna. GPT‑6 Astra va inaugurar una nova generació d'intel·ligència; aquests models ajuden a estendre'n els beneficis fent avançar l'avantguarda de l'eficiència de costos. Hem entrenat GPT‑6 Sol i Luna amb mètodes semblants als de GPT‑6 Astra, de manera que els avenços que impulsen el rendiment capdavanter d'Astra en la feina professional, la veracitat, la programació, l'ús d'ordinadors i l'alineament arriben a models més ràpids i assequibles.
Els models GPT‑6 lideren tota la corba de cost-intel·ligència: combinen capacitats excepcionals en cada nivell amb una infraestructura que les ofereix de manera eficient i a gran escala. Les millores en la memòria cau i la inferència ens permeten oferir aquests models a un cost inferior, i traslladem aquest estalvi directament als usuaris i clients reduint un 50 % els preus de l'API de Sol i Luna respecte als preus promocionals de GPT‑5.6. En conjunt, aquestes millores fan que la IA avançada sigui viable per a més tasques quotidianes i aplicacions a gran escala.
Model | Entrada | Sortida | Reducció del preu |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | Un 50 % més barat |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | Un 50 % més barat |
Els preus són per milió de segments.
GPT‑6 Astra continua sent el nostre millor model en tots els àmbits. Tria'l si vols els millors resultats i una experiència sense concessions.
GPT‑6 Sol i Luna aporten millores d'intel·ligència i eficiència de costos als models que ja coneixes i utilitzes, sobretot en les capacitats més útils per dur a terme feines complexes.
GPT‑6 Sol pot assumir tasques laborals difícils i, alhora, donar-te més marge per iterar gràcies a uns límits d'ús més alts i un cost inferior. També ofereix més intel·ligència i millors resultats que els models de la competència amb preus semblants.
A AutomationBench, una prova de fluxos de treball empresarials entre aplicacions, GPT‑6 Sol amb esforç extraalt supera Claude Opus 5 amb esforç màxim amb només el 9 % del cost per tasca d'Opus 5. Amb esforç alt, GPT‑6 Luna millora el seu predecessor en 5,4 punts percentuals amb un cost per tasca un 58 % inferior.
A AutomationBench 1.0.6(s'obre en una finestra nova), es posen a prova agents d'IA en fluxos de treball d'extrem a extrem que fan servir 47 eines en els àmbits de vendes, màrqueting, operacions, assistència, finances i recursos humans. La dada de Claude Fable 5.1 subestima el cost real, ja que omet el cost de les activacions d'Opus 5 de reserva, que es van produir en aproximadament el 40 % de les tasques.
GPT‑6 Sol també supera Claude Fable 5.1 amb un cost molt inferior, i fins i tot obté millors resultats que GPT‑6 Astra amb esforç baix.
Model (i esforç) | Puntuació | Cost per tasca |
|---|---|---|
GPT‑6 Sol (extraalt) | 33,2 % | 0,27 $ |
GPT‑6 Astra (baix) | 30,3 % | 3,9× GPT‑6 Sol |
Claude Opus 5 (màxim) | 26,9 % | 11,1× GPT‑6 Sol |
Claude Fable 5.1 amb Opus 5 de reserva (màxim) | 31,4 % | >8,9× GPT‑6 Sol (cost de la reserva no comunicat) |
A Agents’ Last Exam, que avalua agents en fluxos de treball professionals complexos, GPT‑6 Sol amb esforç màxim obté un 56,4 %, per sobre de la puntuació màxima de Claude Opus 5 en l'avaluació, amb un cost per tasca un 60 % inferior.
A Agents’ Last Exam V1(s'obre en una finestra nova), els agents d'IA s'avaluen en tasques de llarga durada i valor econòmic de 55 subindústries, que cobreixen la majoria dels principals àmbits de la feina professional feta amb ordinador.
La utilitat d'una resposta depèn de l'exactitud dels fets, i continuem avançant en fiabilitat factual. En la nostra avaluació interna de veracitat, basada en converses reals desidentificades en què els usuaris havien assenyalat errors dels nostres models, GPT‑6 Sol comet aproximadament la meitat d'errors que el seu predecessor i s'acosta a la fiabilitat d'Astra amb un cost molt inferior. GPT‑6 Luna també millora substancialment; amb nivells d'esforç més alts, iguala GPT‑5.6 Sol a aproximadament una centèsima part del cost.
Aquí avaluem la veracitat en converses desidentificades de ChatGPT en què els usuaris havien assenyalat un error factual d'un model anterior. Aquestes converses, dissenyades per induir errors, no representen l'ús habitual, en què els errors factuals són menys freqüents. Les puntuacions no estan controlades segons la longitud; tanmateix, les nostres proves de variació de la verbositat gairebé no van mostrar cap dependència de la longitud de la resposta.
Aquest any, els agents de programació han començat a abordar tasques més complexes, àmplies i llargues que mai. A OpenAI, el nostre ús intern ha crescut exponencialment. Valorat segons els preus de l'API, l'ús diari de segments ha superat els 600 $ per a l'investigador mitjà i els 7.000 $ per als investigadors del percentil 90 (Acceleració de la recerca: una mirada a l'interior d'OpenAI). A mesura que els agents de programació assumeixen tasques més llargues i exigents, el cost de l'ús sostingut adquireix més importància. GPT‑6 Sol i Luna combinen un bon rendiment en programació amb preus d'API més baixos, cosa que dona als desenvolupadors més marge per iterar i als equips la confiança per ser més ambiciosos amb les tasques que encarreguen a Codex.
A FrontierCode, que avalua si els agents de programació generen canvis preparats per integrar-se en bases de codi reals, GPT‑6 Sol millora substancialment respecte a GPT‑5.6 Sol i iguala Claude Fable 5.1 amb esforç extraalt a un cost molt inferior.
A FrontierCode 1.1 Main(s'obre en una finestra nova), els agents d'IA escriuen codi que s'avalua no només per la correcció, sinó també per la «capacitat d'integració»: per exemple, la qualitat de les proves, el respecte de l'abast, l'estil del codi i el compliment dels estàndards de la base de codi.
A DeepSWE v1.1, que prova el rendiment en tasques complexes d'enginyeria de programari en bases de codi reals, GPT‑6 Sol amb esforç màxim obté un 68,8 %, a 1,1 punts percentuals de la puntuació màxima de Claude Fable 5 en l'avaluació —un 69,9 % amb esforç extraalt— i amb un cost per tasca aproximadament un 80 % inferior.
GPT‑6 Luna amb esforç màxim obté un 66,6 %, comparable a Claude Opus 5 i Fable 5 amb esforç mitjà. En aquestes comparacions, Luna costa un 93 % menys per tasca que Opus 5 i un 96 % menys que Fable 5.
A DeepSWE 1.1(s'obre en una finestra nova), els agents d'IA resolen tasques originals d'enginyeria de programari de llarga durada.
Tot i que GPT‑6 Astra continua sent el millor model del món per a l'ús d'ordinadors, GPT‑6 Sol i Luna ofereixen un rendiment més eficient en costos que els seus predecessors. A OSWorld 2.0 offline, GPT‑6 Sol amb esforç extraalt obté una puntuació semblant a Claude Opus 5 amb esforç mitjà —60,5 % enfront de 60,3 %— i amb un cost per tasca aproximadament un 80 % inferior. GPT‑6 Luna (màxim) supera GPT‑5.6 Sol (mitjà) amb una desena part del cost.
A OSWorld 2.0(s'obre en una finestra nova), els agents d'IA intenten completar fluxos de treball llargs d'ús d'ordinadors que inclouen tasques quotidianes i professionals. Presentem la recompensa parcial del conjunt fora de línia de la versió v2026.08.08.
També hem incorporat a Sol i Luna l'estil de comunicació millorat de GPT‑6 Astra, que creiem que es notarà especialment en converses tècniques i de programació. Hi trobaràs més claredat, menys argot, menys girs estranys, menys detalls de poc valor i respostes en general una mica més curtes, sense perdre substància.
Tot i que l'estil és subjectiu, aquí preferim la resposta de GPT‑6 Sol. No treu conclusions tan de pressa, dedica menys temps a repetir detalls que poden ser obvis per a qui pregunta (per exemple, que el lloc web té quatre pàgines), fa servir menys expressions vagues (com ara «aspecte bento» o «reorganitzar... al voltant d'aquest sistema»), explica amb més claredat què ha comprovat i què no, i no comparteix innecessàriament detalls d'implementació com la indicació de la seva eina d'imatges.
A més d'abaixar els preus dels segments, ajudem els desenvolupadors que creen amb GPT‑6 a estalviar més en el context que reutilitzen les seves aplicacions. Hem millorat l'emmagatzematge en memòria cau d'indicacions de GPT‑6 perquè, per defecte, ofereixi taxes d'encert més altes. Això ajuda els agents a reutilitzar més context, respondre més de pressa i beneficiar-se d'un descompte del 90 % en la lectura de segments d'entrada des de la memòria cau.
Els desenvolupadors també disposen de més opcions per mesurar i optimitzar el rendiment de la memòria cau:
Supervisa i diagnostica. El tauler d'emmagatzematge en memòria cau d'indicacions(s'obre en una finestra nova) mostra quina quantitat de l'entrada s'emmagatzema en memòria cau i com evoluciona amb el temps. L'eina de diagnòstic(s'obre en una finestra nova) ajuda a explicar les oportunitats d'emmagatzematge en memòria cau desaprofitades i què cal corregir.
Ajusta l'esforç de raonament i la disponibilitat de les eines sense invalidar la memòria cau. Augmenta l'esforç de raonament(s'obre en una finestra nova) per a les tasques més difícils o redueix-lo per a seguiments més senzills, i activa o desactiva eines(s'obre en una finestra nova) a mesura que canviïn les necessitats del teu agent. Ara tots dos controls conserven el context anterior perquè es pugui reutilitzar des de la memòria cau.
Optimitza quins prefixos s'emmagatzemen en memòria cau. Els punts de tall explícits permeten als desenvolupadors triar on acaben els prefixos de les indicacions emmagatzemats en memòria cau. Això dona als desenvolupadors més control sobre la reutilització de la memòria cau i pot millorar el rendiment.
GitHub informa que, durant els darrers mesos, aquestes millores han reduït més d'un 50 % la proporció de segments d'indicacions que requereixen un processament nou en milers de milions de sol·licituds als models d'OpenAI, fet que ajuda Copilot a respondre més de pressa.
GPT‑6 Sol i Luna parteixen del treball d'alineament introduït amb Astra, el nostre model més alineat fins ara. En les nostres avaluacions d'alineament, tant Sol com Luna milloren respecte als seus equivalents GPT‑5.6, entre altres aspectes amb taxes més baixes d'afirmacions enganyoses sobre la feina de programació que han dut a terme.
Les avaluacions següents posen a prova deliberadament situacions difícils i no mesuren les taxes d'error en l'ús habitual. Consulta la fitxa del model(s'obre en una finestra nova) per veure tots els resultats.
GPT‑6 Sol i GPT‑6 Luna estan disponibles des d'avui a ChatGPT Work i Codex per a tots els usuaris de Plus, Pro, Business, Enterprise i Edu. Els usuaris de Free i Go poden accedir a GPT‑6 Luna des de l'aplicació d'escriptori. Aquests models encara no estan disponibles a Chat. A l'API d'OpenAI, estan disponibles com a gpt-6-sol i gpt-6-luna.
Per mantenir el servei estable per a tothom, tenim previst desplegar gradualment aquests models a ChatGPT al llarg del dia. Si no veus els models nous a ChatGPT Work o Codex, torna-ho a provar més tard.
Les avaluacions de GPT es van dur a terme al nostre entorn de recerca o mitjançant la nostra API, que pot generar resultats lleugerament diferents dels de ChatGPT en producció a causa de diferències en les indicacions del sistema, les eines disponibles, etc. Les avaluacions dels models de la competència provenen d'informes disponibles públicament. Quan no hi havia puntuacions de Claude Fable 5.1, es van utilitzar les de Claude Fable 5.


