Pular para o conteúdo principal
OpenAI

Apresentamos o GPT‑6 Sol e o Luna

Mais maneiras de levar Inteligência de ponta ao trabalho que você realiza todos os dias.

Carregando…

No início deste mês, apresentamos o GPT‑6 Astra, o modelo mais inteligente e alinhado do mundo. Embora os projetos mais exigentes e importantes ainda precisem de toda a capacidade do Astra, o trabalho acontece em diferentes escalas, ritmos e orçamentos.

Por isso, estamos expandindo o universo do GPT‑6 com o GPT‑6 Sol e o GPT‑6 Luna. O GPT‑6 Astra apresentou uma nova geração de inteligência — esses modelos ajudam a ampliar os benefícios dessa inteligência ao avançar a fronteira da eficiência de custos. Treinamos o GPT‑6 Sol e o Luna com métodos semelhantes aos do GPT‑6 Astra, levando os avanços por trás do desempenho de última geração do Astra em trabalho profissional, factualidade, programação, uso do computador e alinhamento a modelos mais rápidos e acessíveis.

Os modelos GPT‑6 lideram em toda a curva de custo e inteligência, combinando recursos excepcionais em cada nível com uma infraestrutura que os disponibiliza de forma eficiente e em escala. As melhorias em cache e inferência permitem oferecer esses modelos a um custo menor, e estamos repassando essa economia diretamente aos usuários e clientes ao reduzir em 50% os preços de API do Sol e do Luna em comparação com os preços promocionais do GPT‑5.6. Juntas, essas melhorias tornam a IA avançada viável para mais tarefas cotidianas e aplicações em escala.

Preços da API do GPT‑6

Modelo

Entrada

Saída

Redução de preço

GPT‑6 Sol
vs. GPT‑5.6 Sol

US$ 4 → US$ 2

US$ 20 → US$ 10

50% mais barato

GPT‑6 Luna
vs. GPT‑5.6 Luna

US$ 0,20 → US$ 0,10

US$ 1,20 → US$ 0,50

50% mais barato

Os preços são por 1 milhão de tokens.

O GPT‑6 Astra continua sendo nosso melhor modelo em todos os aspectos. Escolha-o quando quiser os melhores resultados e uma experiência sem concessões.

Um avanço em toda a família de modelos

O GPT‑6 Sol e o Luna levam mais inteligência e eficiência de custos aos modelos que você já conhece e usa, aprimorando os recursos mais úteis para realizar trabalhos complexos.

Trabalho profissional

O GPT‑6 Sol consegue realizar tarefas profissionais difíceis e oferece mais espaço para iteração, com limites de uso maiores e custo menor, além de mais inteligência e melhores resultados que modelos concorrentes de preço semelhante.

No AutomationBench, um teste de fluxos de trabalho empresariais entre aplicativos, o GPT‑6 Sol com esforço muito alto supera o Claude Opus 5 com esforço máximo, custando apenas 9% do custo por tarefa do Opus 5. Com esforço alto, o GPT‑6 Luna supera seu antecessor em 5,4 pontos percentuais, com um custo por tarefa 58% menor.

No AutomationBench 1.0.6⁠(abre em uma nova janela), agentes de IA são testados em fluxos de trabalho completos usando 47 ferramentas nas áreas de vendas, marketing, operações, suporte, finanças e RH. O ponto de dados do Claude Fable 5.1 subestima seu custo real, pois não inclui o custo dos fallbacks para o Opus 5, que ocorreram em cerca de 40% das tarefas.

O GPT‑6 Sol também supera o Claude Fable 5.1 por um custo muito menor e até mesmo vence o GPT‑6 Astra com esforço baixo.

Modelo (e esforço)

Pontuação

Custo por tarefa

GPT‑6 Sol (muito alto)

33,2%

US$ 0,27

GPT‑6 Astra (baixo)

30,3%

3,9x o GPT‑6 Sol

Claude Opus 5 (máximo)

26,9%

11,1x o GPT‑6 Sol

Claude Fable 5.1 com fallback para Opus 5 (máximo)

31,4%

>8,9x o GPT‑6 Sol

(custo do fallback não informado)

No Agents’ Last Exam, que avalia agentes em fluxos de trabalho profissionais complexos, o GPT‑6 Sol com esforço máximo alcança 56,4%, acima da maior pontuação do Claude Opus 5 na avaliação, com custo por tarefa 60% menor.

No Agents’ Last Exam V1⁠(abre em uma nova janela), agentes de IA são avaliados em tarefas de longa duração e valor econômico que abrangem 55 subsetores e cobrem a maioria das principais áreas de trabalho profissional realizado em um computador.

Factualidade

A utilidade de uma resposta depende da exatidão dos fatos, e seguimos avançando na confiabilidade factual. Em nossa avaliação interna de factualidade, baseada em conversas reais desidentificadas nas quais usuários sinalizaram erros dos nossos modelos, o GPT‑6 Sol comete cerca de metade dos erros de seu antecessor, aproximando-se da confiabilidade do Astra por um custo muito menor. O GPT‑6 Luna também melhora substancialmente; em níveis de esforço mais altos, iguala o GPT‑5.6 Sol por cerca de um centésimo do custo.

Aqui, avaliamos a factualidade em conversas desidentificadas do ChatGPT nas quais usuários haviam sinalizado um erro factual de um modelo anterior. Essas conversas que induzem a erros não representam o uso típico, no qual erros factuais são mais raros. As pontuações não são controladas por extensão; no entanto, nossas varreduras de verbosidade mostraram dependência quase nula da extensão da resposta.

Programação

Neste ano, agentes de programação começaram a realizar tarefas com mais complexidade, abrangência e duração do que nunca. Na OpenAI, nosso uso interno cresceu exponencialmente. Calculado com base nos preços da API, o uso diário de tokens ultrapassou US$ 600 para o pesquisador mediano e US$ 7.000 para os pesquisadores no 90º percentil (Aceleração da pesquisa: uma visão de dentro da OpenAI⁠). À medida que os agentes de programação assumem tarefas mais longas e exigentes, o custo do uso contínuo ganha importância. O GPT‑6 Sol e o Luna combinam alto desempenho em programação com preços de API menores, dando aos desenvolvedores mais espaço para iterar e às equipes a confiança necessária para serem mais ambiciosas nas tarefas que atribuem ao Codex.

No FrontierCode, que avalia se agentes de programação produzem alterações prontas para integração em bases de código reais, o GPT‑6 Sol melhora substancialmente em relação ao GPT‑5.6 Sol e consegue igualar o Claude Fable 5.1 com esforço muito alto por um custo bem menor.

No FrontierCode 1.1 Main⁠(abre em uma nova janela), agentes de IA escrevem código avaliado não apenas pela correção, mas também pela possibilidade de integração: por exemplo, qualidade dos testes, controle de escopo, estilo de código e conformidade com os padrões da base de código.

No DeepSWE v1.1, que testa o desempenho em tarefas complexas de engenharia de software em bases de código reais, o GPT‑6 Sol com esforço máximo alcança 68,8%, ficando a 1,1 ponto percentual da maior pontuação do Claude Fable 5 na avaliação — 69,9% com esforço muito alto — e com custo por tarefa aproximadamente 80% menor.

O GPT‑6 Luna com esforço máximo alcança 66,6%, resultado comparável ao Claude Opus 5 e ao Fable 5 com esforço médio. Nessas comparações, o custo por tarefa do Luna é 93% menor que o do Opus 5 e 96% menor que o do Fable 5.

No DeepSWE 1.1⁠(abre em uma nova janela), agentes de IA resolvem tarefas originais e de longa duração de engenharia de software.

Uso do computador

Embora o GPT‑6 Astra continue sendo o melhor modelo do mundo para uso do computador, o GPT‑6 Sol e o Luna oferecem desempenho mais econômico que seus antecessores. No OSWorld 2.0 offline, o GPT‑6 Sol com esforço muito alto alcança pontuação semelhante à do Claude Opus 5 com esforço médio — 60,5% contra 60,3% — com um custo por tarefa aproximadamente 80% menor. O GPT‑6 Luna (máximo) supera o GPT‑5.6 Sol (médio) por um décimo do custo.

No OSWorld 2.0⁠(abre em uma nova janela), agentes de IA tentam executar fluxos de trabalho de longa duração no computador, abrangendo tarefas cotidianas e profissionais. Informamos a recompensa parcial no conjunto offline da versão v2026.08.08.

Estilo de colaboração

Também levamos ao Sol e ao Luna o estilo de comunicação aprimorado do GPT‑6 Astra, que acreditamos ser especialmente perceptível em conversas técnicas e sobre programação. Você verá mais clareza, menos jargão, menos construções estranhas, menos detalhes de pouco valor e respostas um pouco mais curtas no geral, sem perda de conteúdo.

Prompt
Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..
GPT-5.6 Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now.


Done — open the live site.

It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth.

The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6 Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup.


The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Embora o estilo seja subjetivo, preferimos a resposta do GPT‑6 Sol neste caso. Ela não tira conclusões tão rapidamente, passa menos tempo repetindo detalhes que podem ser óbvios para quem perguntou (por exemplo, que o site tem quatro páginas), usa menos linguagem vaga (como "estética bento" e "reformular... em torno desse sistema"), é mais transparente sobre o que verificou ou não e não compartilha desnecessariamente detalhes de implementação, como o prompt usado na ferramenta de imagens.

Melhorias no cache para agentes e conversas longas

Além de reduzir os preços dos tokens, estamos ajudando desenvolvedores que criam com o GPT‑6 a economizar ainda mais no contexto reutilizado por seus aplicativos. Aprimoramos o cache de prompts do GPT‑6 para oferecer, por padrão, taxas maiores de acerto no cache, ajudando agentes a reutilizar mais contexto, responder mais rápido e obter descontos de 90% na leitura de tokens de entrada armazenados em cache.

Os desenvolvedores também têm mais maneiras de medir e otimizar o desempenho do cache:

O GitHub informa que, nos últimos meses, essas melhorias reduziram em mais de 50% a parcela de tokens de prompts que exigem novo processamento, considerando bilhões de solicitações aos modelos da OpenAI, o que ajuda o Copilot a responder mais rápido.

Avanços contínuos no alinhamento

O GPT‑6 Sol e o Luna aproveitam o trabalho de alinhamento apresentado com o Astra, nosso modelo mais alinhado até hoje. Em nossas avaliações de alinhamento, tanto o Sol quanto o Luna apresentam melhorias em relação aos equivalentes GPT‑5.6, incluindo taxas menores de alegações enganosas sobre o trabalho de programação realizado.

As avaliações abaixo testam deliberadamente situações desafiadoras e não medem as taxas de falha no uso típico. Consulte o system card⁠(abre em uma nova janela) para ver os resultados completos.

Disponibilidade

O GPT‑6 Sol e o GPT‑6 Luna estão disponíveis a partir de hoje no ChatGPT Work e no Codex para todos os usuários Plus, Pro, Business, Enterprise e Edu. Usuários dos planos Free e Go podem acessar o GPT‑6 Luna no aplicativo para desktop. Esses modelos ainda não estão disponíveis no Chat. Na API da OpenAI, eles estão disponíveis como gpt-6-sol e gpt-6-luna.

Para manter o serviço estável para todos, planejamos disponibilizar esses modelos gradualmente no ChatGPT ao longo do dia. Se você não vir os novos modelos no ChatGPT Work ou no Codex, tente novamente mais tarde.


As avaliações do GPT foram realizadas em nosso ambiente de pesquisa ou por meio de nossa API, que pode gerar resultados ligeiramente diferentes dos do ChatGPT em produção devido a diferenças nos prompts do sistema, nas ferramentas disponíveis etc. As avaliações dos modelos concorrentes foram obtidas de relatórios públicos. As pontuações do Claude Fable 5 foram informadas quando as do Claude Fable 5.1 não estavam disponíveis.

Autor

OpenAI