Apresentamos o GPT‑6 Sol e o Luna
Mais formas de integrar inteligência de fronteira no trabalho que faz todos os dias.
No início deste mês, apresentámos o GPT‑6 Astra, o modelo mais inteligente e alinhado do mundo. Embora os projetos mais exigentes e importantes continuem a precisar de toda a capacidade do Astra, o trabalho faz-se a diferentes escalas, ritmos e orçamentos.
É por isso que estamos a expandir o universo GPT‑6 com o GPT‑6 Sol e o GPT‑6 Luna. O GPT‑6 Astra introduziu uma nova geração de inteligência — estes modelos ajudam a alargar os benefícios dessa inteligência ao fazer avançar a fronteira da eficiência de custos. Treinámos o GPT‑6 Sol e o Luna com métodos semelhantes aos do GPT‑6 Astra, levando os avanços subjacentes ao desempenho de ponta do Astra no trabalho profissional, na exatidão factual, na programação, na utilização de computadores e no alinhamento a modelos mais rápidos e económicos.
Os modelos GPT‑6 lideram toda a curva de custo–inteligência, combinando capacidades excecionais em todos os níveis com uma infraestrutura que as disponibiliza eficientemente e em grande escala. As melhorias na cache e na inferência permitem-nos disponibilizar estes modelos a um custo inferior, e estamos a transferir diretamente essa poupança para utilizadores e clientes, reduzindo em 50% os preços da API do Sol e do Luna face aos preços promocionais do GPT‑5.6. Em conjunto, estas melhorias tornam a IA avançada viável para mais tarefas quotidianas e aplicações em grande escala.
Modelo | Entrada | Saída | Redução do preço |
GPT‑6 Sol | $4 → $2 | $20 → $10 | 50% mais barato |
GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% mais barato |
Os preços são por 1 milhão de tokens.
O GPT‑6 Astra continua a ser o nosso melhor modelo em todos os aspetos. Escolha-o quando quiser os melhores resultados e uma experiência sem compromissos.
O GPT‑6 Sol e o Luna trazem melhorias de inteligência e eficiência de custos aos modelos que já conhece e utiliza, nas capacidades mais úteis para realizar trabalhos complexos.
O GPT‑6 Sol consegue assumir tarefas profissionais difíceis, dando-lhe mais margem para iterar graças a limites de utilização superiores e custos inferiores, além de oferecer mais inteligência e melhores resultados do que modelos concorrentes com preços semelhantes.
No AutomationBench, um teste de fluxos de trabalho empresariais em várias aplicações, o GPT‑6 Sol com esforço xhigh supera o Claude Opus 5 com esforço Max, por apenas 9% do custo por tarefa do Opus 5. Com esforço elevado, o GPT‑6 Luna melhora o resultado do antecessor em 5,4 pontos percentuais, com um custo por tarefa 58% inferior.
No AutomationBench 1.0.6(abre numa nova janela), os agentes de IA são testados em fluxos de trabalho completos que utilizam 47 ferramentas nas áreas de vendas, marketing, operações, apoio ao cliente, finanças e recursos humanos. O ponto de dados do Claude Fable 5.1 subestima o seu custo real, pois omite o custo dos recursos ao Opus 5, que ocorreram em cerca de 40% das tarefas.
O GPT‑6 Sol também supera o Claude Fable 5.1 a um custo muito inferior e chega mesmo a superar o GPT‑6 Astra com esforço baixo.
Modelo (e esforço) | Pontuação | Custo por tarefa |
|---|---|---|
GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
GPT‑6 Astra (baixo) | 30.3% | 3.9x GPT‑6 Sol |
Claude Opus 5 (Max) | 26.9% | 11.1x GPT‑6 Sol |
Claude Fable 5.1 c/ recurso ao Opus 5 (Max) | 31.4% | >8.9x GPT‑6 Sol (custo do recurso não comunicado) |
No Agents’ Last Exam, que avalia agentes em fluxos de trabalho profissionais complexos, o GPT‑6 Sol com esforço Max obtém 56,4%, acima da pontuação máxima do Claude Opus 5 na avaliação, com um custo por tarefa 60% inferior.
No Agents’ Last Exam V1(abre numa nova janela), os agentes de IA são avaliados em tarefas prolongadas e com valor económico, abrangendo 55 subsetores e a maioria das principais áreas de trabalho profissional realizado num computador.
A utilidade de uma resposta depende da exatidão dos factos, e continuamos a progredir na fiabilidade factual. Na nossa avaliação interna de exatidão factual, baseada em conversas reais anonimizadas nas quais os utilizadores assinalaram erros dos nossos modelos, o GPT‑6 Sol comete cerca de metade dos erros do antecessor, aproximando-se da fiabilidade do Astra a um custo muito inferior. O GPT‑6 Luna também melhora substancialmente; com níveis de esforço superiores, iguala o GPT‑5.6 Sol por cerca de um centésimo do custo.
Aqui, avaliamos a exatidão factual em conversas anonimizadas do ChatGPT nas quais os utilizadores assinalaram um erro factual de um modelo anterior. Estas conversas, propensas a induzir erros, não representam a utilização habitual, em que os erros factuais são mais raros. As pontuações não são ajustadas em função do comprimento; contudo, os nossos testes de variação da verbosidade revelaram uma dependência quase nula do comprimento da resposta.
Este ano, os agentes de programação começaram a realizar tarefas com mais complexidade, âmbito e duração do que nunca. Na OpenAI, a nossa utilização interna cresceu exponencialmente. Calculada aos preços da API, a utilização diária de tokens ultrapassou os 600 $ para o investigador mediano e os 7000 $ para os investigadores no percentil 90 (Aceleração da investigação: uma perspetiva interna da OpenAI). À medida que os agentes de programação assumem tarefas mais longas e exigentes, o custo da utilização contínua ganha importância. O GPT‑6 Sol e o Luna combinam um sólido desempenho na programação com preços de API inferiores, dando aos programadores mais margem para iterar e às equipas a confiança necessária para serem mais ambiciosas nas tarefas que atribuem ao Codex.
No FrontierCode, que avalia se os agentes de programação produzem alterações prontas a integrar em bases de código reais, o GPT‑6 Sol melhora substancialmente face ao GPT‑5.6 Sol e consegue igualar o Claude Fable 5.1 com esforço xhigh a um custo muito inferior.
No FrontierCode 1.1 Main(abre numa nova janela), os agentes de IA escrevem código avaliado não só pela correção, mas também pela «capacidade de integração»: por exemplo, a qualidade dos testes, o rigor do âmbito, o estilo do código e o cumprimento das normas da base de código.
No DeepSWE v1.1, que testa o desempenho em tarefas complexas de engenharia de software em bases de código reais, o GPT‑6 Sol com esforço Max obtém 68,8%, a 1,1 pontos percentuais da melhor pontuação do Claude Fable 5 na avaliação — 69,9% com esforço xhigh —, com um custo por tarefa cerca de 80% inferior.
O GPT‑6 Luna com esforço Max obtém 66,6%, um resultado comparável ao do Claude Opus 5 e do Fable 5 com esforço médio. Nestas comparações, o Luna custa menos 93% por tarefa do que o Opus 5 e menos 96% do que o Fable 5.
No DeepSWE 1.1(abre numa nova janela), os agentes de IA resolvem tarefas originais e prolongadas de engenharia de software.
Embora o GPT‑6 Astra continue a ser o melhor modelo do mundo para utilização de computadores, o GPT‑6 Sol e o Luna oferecem um desempenho mais económico do que os antecessores. No OSWorld 2.0 offline, o GPT‑6 Sol com esforço xhigh alcança uma pontuação semelhante à do Claude Opus 5 com esforço médio — 60,5% contra 60,3% —, com um custo por tarefa cerca de 80% inferior. O GPT‑6 Luna (Max) consegue superar o GPT‑5.6 Sol (médio) por um décimo do custo.
No OSWorld 2.0(abre numa nova janela), os agentes de IA tentam executar fluxos de trabalho prolongados de utilização de computadores, abrangendo tarefas quotidianas e profissionais. Apresentamos a recompensa parcial do conjunto offline da versão v2026.08.08.
Também levámos o estilo de comunicação melhorado do GPT‑6 Astra ao Sol e ao Luna, o que acreditamos ser especialmente percetível em conversas técnicas e de programação. Conte com mais clareza, menos jargão, menos formulações estranhas, menos pormenores de pouco valor e respostas globalmente um pouco mais curtas, sem perda de substância.
Embora o estilo seja subjetivo, preferimos aqui a resposta do GPT‑6 Sol. Não tira conclusões tão precipitadamente, dedica menos tempo a repetir pormenores que podem ser óbvios para quem perguntou (por exemplo, que o site tem quatro páginas), usa menos linguagem vaga (por exemplo, «aspeto de bento» e «reformular... em torno desse sistema»), é mais transparente quanto ao que verificou ou não e não partilha desnecessariamente pormenores de implementação, como o prompt da ferramenta de imagens.
Além dos preços mais baixos dos tokens, estamos a ajudar os programadores que desenvolvem com o GPT‑6 a poupar mais no contexto reutilizado pelas suas aplicações. Melhorámos a cache de prompts do GPT‑6 para oferecer, por predefinição, taxas mais elevadas de acertos na cache, ajudando os agentes a reutilizar mais contexto, responder mais depressa e beneficiar de descontos de 90% nas leituras de tokens de entrada em cache.
Os programadores também têm mais formas de medir e otimizar o desempenho da cache:
Monitorizar e diagnosticar. O Painel da cache de prompts(abre numa nova janela) mostra quanto conteúdo de entrada está em cache e como esse valor evolui ao longo do tempo. A ferramenta de diagnóstico(abre numa nova janela) ajuda a explicar oportunidades perdidas de utilização da cache e o que deve ser corrigido.
Ajustar o esforço de raciocínio e a disponibilidade das ferramentas sem invalidar a cache. Aumente o esforço de raciocínio(abre numa nova janela) para tarefas mais difíceis ou reduza-o em perguntas subsequentes mais simples, e ative ou desative ferramentas(abre numa nova janela) à medida que as necessidades do seu agente mudam. Agora, ambos os controlos preservam o contexto anterior para reutilização na cache.
Otimizar os prefixos colocados em cache. Os pontos de interrupção explícitos permitem aos programadores escolher onde terminam os prefixos de prompts colocados em cache. Isto dá aos programadores mais controlo sobre a reutilização da cache e pode melhorar o desempenho.
O GitHub indica que, nos últimos meses, estas melhorias reduziram em mais de 50% a proporção de tokens de prompts que exigem novo processamento, em milhares de milhões de pedidos aos modelos da OpenAI, ajudando o Copilot a responder mais depressa.
O GPT‑6 Sol e o Luna partem do trabalho de alinhamento introduzido com o Astra, o nosso modelo mais alinhado até à data. Nas nossas avaliações de alinhamento, tanto o Sol como o Luna apresentam melhorias face aos equivalentes GPT‑5.6, incluindo taxas mais baixas de afirmações enganosas sobre o seu trabalho de programação.
As avaliações abaixo testam deliberadamente situações difíceis e não medem as taxas de falha na utilização habitual. Consulte o system card(abre numa nova janela) para ver os resultados completos.
O GPT‑6 Sol e o GPT‑6 Luna estão disponíveis a partir de hoje no ChatGPT Work e no Codex para todos os utilizadores Plus, Pro, Business, Enterprise e Edu. Os utilizadores Free e Go podem aceder ao GPT‑6 Luna na aplicação para computador. Estes modelos ainda não estão disponíveis no Chat. Na API da OpenAI, estão disponíveis como gpt-6-sol e gpt-6-luna.
Para manter o serviço estável para todos, planeamos disponibilizar estes modelos gradualmente no ChatGPT ao longo do dia. Se não vir os novos modelos no ChatGPT Work ou no Codex, tente novamente mais tarde.
As avaliações do GPT foram realizadas no nosso ambiente de investigação ou através da nossa API, que pode produzir resultados ligeiramente diferentes dos do ChatGPT em produção devido a diferenças nos prompts do sistema, nas ferramentas disponíveis, etc. As avaliações dos modelos concorrentes foram retiradas de relatórios públicos. Foram utilizadas as pontuações do Claude Fable 5 quando as do Claude Fable 5.1 não estavam disponíveis.


