GPT-6.1Sol
Intel·ligència pròxima a Astra per una cinquena part del preu, amb un rendiment sostingut d'avantguarda
Presentem GPT‑6.1 Sol, una millora de GPT‑6 Sol amb un rendiment excepcional en programació agentiva, així com en l'ús de l'ordinador i el treball professional. Acosta Sol a GPT‑6 Astra en tasques exigents, per una cinquena part dels preus estàndard dels segments d'entrada i sortida d'Astra, cosa que dona als desenvolupadors més marge per crear i executar agents capaços amb el mateix pressupost.
GPT‑6.1 Sol ofereix un rendiment pròxim al d'Astra al preu de Sol, fet que el converteix en el model amb la millor relació entre rendiment i cost disponible avui. L'entrada en memòria cau costa només 0,10 $ per milió de segments —un descompte del 95 % sobre el preu d'entrada estàndard—, cosa que el fa més assequible per a càrregues de treball agentives que han de reutilitzar el context en peticions repetides.
GPT‑6 Astra continua sent el nostre model d'avantguarda més capaç en conjunt. GPT‑6.1 Sol ofereix un nou equilibri entre capacitat i cost per a les tasques importants que els usuaris volen fer més sovint i per als clients de l'API que creen i executen aplicacions a gran escala.

GPT‑6.1 Sol aporta millores substancials respecte de GPT‑6 Sol en tasques professionals complexes, des d'escriure i depurar codi fins a comprendre documents i executar fluxos de treball empresarials de diversos passos. En diverses d'aquestes avaluacions, s'acosta al rendiment de GPT‑6 Astra amb un cost substancialment inferior.
A DeepSWE v1.1, que avalua tasques complexes d'enginyeria de programari en bases de codi reals, GPT‑6.1 Sol iguala GPT‑6 Astra per aproximadament una cinquena part del cost, alhora que supera en 6,4 punts percentuals la millor puntuació de GPT‑6 Sol amb menys esforç de raonament i menys cost.
A DeepSWE 1.1(s'obre en una finestra nova), els agents d'IA resolen tasques originals d'enginyeria de programari de llarga durada.
A GDP.pdf, que mesura amb quina precisió els models responen preguntes professionals a partir de documents PDF complexos, amb taules, gràfics, diagrames i detalls en lletra petita, GPT‑6.1 Sol obté una puntuació superior a la d'Opus 5.5 amb models de reserva per menys de la meitat del cost per tasca en totes les configuracions de raonament provades. També s'acosta al rendiment capdavanter de GPT‑6 Astra per aproximadament una cinquena part del cost per tasca.
A GDP.pdf(s'obre en una finestra nova), els models han de respondre a peticions reals sobre documents PDF complexos extrets de fluxos de treball professionals dels àmbits financer, sanitari, jurídic i de set àmbits professionals més.
A AutomationBench, que mesura si els agents completen correctament fluxos de treball empresarials de diversos passos, GPT‑6.1 Sol supera Opus 5.5 en 2,2 punts percentuals amb un esforç de raonament mitjà, per aproximadament un terç del cost. Aquesta puntuació també supera en 4,8 punts percentuals la de GPT‑6 Sol amb la mateixa configuració.
In AutomationBench 1.0.6(s'obre en una finestra nova), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
GPT‑6.1 Sol també avança substancialment en tasques que requereixen interactuar amb aplicacions informàtiques. En el conjunt fora de línia d'OSWorld 2.0, que avalua els agents en fluxos de treball exigents que requereixen fer servir l'ordinador, GPT‑6.1 Sol supera GPT‑6 Sol en set punts percentuals amb l'esforç de raonament màxim i per menys de la meitat del cost. Es queda a només 2,1 punts percentuals de la puntuació d'Astra amb l'esforç de raonament màxim, per aproximadament una setena part del cost per tasca.
In OSWorld 2.0(s'obre en una finestra nova), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
A Terminal-Bench Science 0.1, que avalua fluxos de treball científics com l'anàlisi de dades, la simulació i la demostració de teoremes, GPT‑6.1 Sol més que duplica la puntuació de GPT‑6 Sol amb l'esforç de raonament màxim, per menys de la meitat del cost per tasca. Amb l'esforç màxim, GPT‑6.1 Sol costa de mitjana 5,47 $ per tasca, en comparació amb els 23,21 $ d'Opus 5.5 i els 23,80 $ d'Astra, i ofereix una capacitat científica notable amb un cost més d'un 75 % inferior al de qualsevol dels altres dos models.
GPT‑6 Astra continua obtenint la puntuació més alta entre els models provats, amb un 68,1 %, i és el que cal fer servir per a les tasques de recerca científica més difícils.
A Terminal-Bench Science 0.1(s'obre en una finestra nova), els agents completen fluxos de treball de recerca científica mitjançant codi i eines de terminal, amb tasques com ara analitzar dades, executar simulacions i ajustar models.
GPT‑6.1 Sol també millora l'exactitud factual amb indicacions difícils. Amb un esforç de raonament extraalt, la seva taxa d'errors factuals és del 4,1 %, inferior al 4,5 % de GPT‑6 Sol i més pròxima al 4,0 % d'Astra amb la mateixa configuració, amb un cost per tasca aproximadament un 83 % inferior al d'Astra.
Aquesta avaluació mesura la proporció de respostes que contenen almenys un error factual en converses desidentificades en què els usuaris havien assenyalat un error d'un model anterior. Aquestes indicacions, deliberadament difícils, no són representatives de l'ús habitual.
Avaluem la veracitat amb converses de ChatGPT desidentificades en què els usuaris havien assenyalat un error factual d'un model anterior. Aquestes converses que indueixen a errors no són representatives de l'ús habitual, en què els errors factuals són menys freqüents.
GPT‑6.1 Sol mostra millores substancials respecte de GPT‑6 Sol en les nostres avaluacions d'alineament i s'acosta a GPT‑6 Astra.
GPT‑6.1 Sol és més transparent sobre les seves limitacions i més fiable a l'hora de respectar la intenció de l'usuari i les restriccions de seguretat. En avaluacions exigents, mostra taxes de fallades inferiors a les de GPT‑6 Sol pel que fa a informar amb transparència sobre eines de cerca que no funcionen, respectar restriccions explícites i evitar resultats no autoritzats durant tasques agentives. No hem observat cap intent d'eludir un revisor de seguretat automatitzat, igual que amb GPT‑6 Astra i GPT‑6 Sol.
Les avaluacions següents posen a prova deliberadament situacions difícils i no mesuren les taxes de fallades en l'ús habitual.
GPT‑6.1 Sol està disponible a partir d'avui per a tots els usuaris de Plus, Pro, Business, Enterprise i Edu a ChatGPT Work i Codex. Aquests models encara no estan disponibles a Chat. Els desenvolupadors també hi poden accedir a través de l'API d'OpenAI amb el nom gpt-6.1-sol. Els seus preus estàndard a l'API són de 2 $ per milió de segments d'entrada, 0,10 $ per milió de segments d'entrada en memòria cau i 10 $ per milió de segments de sortida.
Alhora, llancem GPT‑6 Astra Ultrafast, el model d'avantguarda més ràpid del món, fins a 8 vegades més ràpid que GPT‑6 Astra, així com GPT‑6.1 Sol Ultrafast. Estan disponibles a l'API, així com a ChatGPT Work i Codex per als usuaris de la nostra nova modalitat Pro amb els límits d'ús més alts, per 500 $ al mes. Amb GPT‑6.1 Sol Ultrafast, els desenvolupadors poden obtenir una intel·ligència pròxima a Astra amb una velocitat fins a 8 vegades superior, per una despesa a l'API semblant a la que abans tenia GPT‑6 Astra.
Autor
Les avaluacions de GPT s'han fet en el nostre entorn de recerca o a través de la nostra API, que poden generar respostes lleugerament diferents de les de ChatGPT en producció a causa de diferències en les indicacions del sistema, les eines disponibles, els nivells d'esforç, etc. Les avaluacions dels models de la competència s'han extret d'informes públics.

