Pular para o conteúdo principal
OpenAI

30 de julho de 2026

Produto

Avançando a fronteira de preço-desempenho com o GPT‑5.6

Ao tornar cada camada mais eficiente, a OpenAI oferece mais desempenho por dólar em um número maior de cargas de trabalho empresariais.

Carregando…

Ontem, mostramos como o GPT‑5.6 ajudou a tornar sua própria execução mais eficiente. Hoje, estamos repassando esses ganhos aos clientes, com preços menores para o GPT‑5.6 Luna(abre em uma nova janela) e o Terra(abre em uma nova janela), além de maior velocidade com o GPT‑5.6 Sol na API. Juntas, essas atualizações ajudam os clientes a obter mais de cada dólar investido em IA e a avançar mais rapidamente quando o tempo é decisivo.

A partir de hoje, o GPT‑5.6 Luna, nosso modelo mais rápido e acessível, custará 80% menos, enquanto o GPT‑5.6 Terra, nosso modelo equilibrado para o trabalho cotidiano, custará 20% menos. Os preços menores do Luna e do Terra também se refletem na contabilização do uso nas assinaturas pagas ao usar o Codex e o ChatGPT Work. O Luna oferece às empresas uma forma muito mais econômica de realizar trabalhos de alto volume com níveis altíssimos de qualidade. Ele pode usar ferramentas e concluir fluxos de trabalho de várias etapas, viabilizando a execução em escala de uma variedade maior de aplicações de IA.

Tornar a inteligência avançada mais abundante e acessível é essencial para a missão da OpenAI de garantir que a AGI beneficie toda a humanidade. Essas mudanças colocam esse compromisso em prática. Elas refletem anos de melhorias na forma como nossos modelos são criados, disponibilizados e colocados em ação.

Também estamos lançando o modo Fast na API, que substitui nossa oferta Priority Processing. Para o GPT‑5.6 Sol, o modo Fast agora oferece velocidades até 2,5 vezes maiores que o processamento Standard pelo dobro do preço, sem nenhuma mudança na inteligência. O modo Fast é retrocompatível: as solicitações marcadas como priority usarão automaticamente o modo Fast.

1 de 6
O GPT‑5.6 Luna é o mais perto que chegamos de uma inteligência tão barata que nem vale a pena medir. Nunca vi um modelo tão acessível ser tão poderoso — ele está viabilizando casos de uso para a Replit que não esperávamos desenvolver tão cedo.
Michele Catasta, presidente e líder de IA da Replit

Adequação da inteligência ao resultado

O uso eficiente da IA começa pelo resultado. O impacto, o custo dos erros, a urgência e a escala determinam o equilíbrio ideal entre inteligência, velocidade, confiabilidade e custo. Esse equilíbrio pode mudar de uma etapa do fluxo de trabalho para outra.

O GPT‑5.6 oferece às empresas muito mais espaço para otimizar essa equação. O Luna oferece desempenho comparável ao de modelos considerados de fronteira há um ano por cerca de 6 centavos por dólar por tarefa e com uma velocidade quase nove vezes maior. Em trabalhos profissionais, conforme medido pelo Agents’ Last Exam, o Luna supera o Fable 5 com um custo estimado por tarefa quase 99% menor.

Na prática, as empresas podem definir o resultado e o padrão de qualidade necessários e então usar avaliações para determinar onde a inteligência adicional melhora substancialmente o resultado e onde um processamento mais rápido e econômico pode oferecer a mesma qualidade. Um fluxo de trabalho de programação, por exemplo, pode usar o Sol para eliminar incertezas e definir o plano e depois usar o Luna para implementar mudanças bem especificadas, escrever e executar testes e avaliar os resultados. Outro fluxo de trabalho pode exigir um equilíbrio diferente.

A família GPT‑5.6 amplia o leque dessas escolhas. As empresas podem aplicar o máximo de inteligência útil em cada etapa e pagar o preço adequado ao valor gerado.

Oferecer essa flexibilidade começa por tornar mais eficiente cada camada por trás dos modelos.

Como ampliamos a fronteira da eficiência

Nossa vantagem em eficiência vem do aprimoramento dos modelos, dos sistemas de inferência que os executam e do harness com agentes de IA que os conecta a ferramentas e contexto. Os modelos GPT‑5.6 seguem um caminho mais direto na execução do trabalho. Um roteamento melhor mantém o hardware produtivo, softwares de produção otimizados geram tokens com mais eficiência e uma gestão de contexto mais inteligente ajuda os agentes a não repetir trabalhos já concluídos. Juntas, essas melhorias permitem concluir mais trabalhos úteis com a mesma capacidade computacional, reduzindo o tempo, os tokens e o custo necessários para cada resultado.

O GPT‑5.6 Sol nos ajuda cada vez mais a descobrir e implementar a próxima rodada de ganhos. Em um processo conduzido por humanos, o Sol reescreveu e otimizou kernels de produção de forma autônoma, projetou e executou centenas de experimentos para melhorar a geração de tokens e monitorou o treinamento, intervindo quando surgiram problemas. O trabalho nos kernels ajudou a reduzir em 20% o custo total de disponibilização do modelo, enquanto os experimentos aumentaram em mais de 15% a eficiência da geração de tokens. Esse trabalho continua, criando um ciclo de feedback mais estreito: à medida que nossos modelos melhoram e conseguem trabalhar com mais autonomia, nossa capacidade de aumentar a eficiência se acelera. Saiba mais sobre a engenharia por trás do GPT‑5.6.

Uma estratégia de computação criada para operar em escala

Atender à demanda por inteligência abundante exige mais capacidade computacional e também um uso mais produtivo dessa capacidade. Estamos criando um portfólio de infraestrutura resiliente e direcionando cada carga de trabalho aos sistemas mais adequados para executá-la. Essa abordagem contempla as duas extremidades da curva de preço-desempenho. Na faixa de menor custo, os novos preços do Luna e do Terra tornam trabalhos de alto volume economicamente viáveis em uma escala muito maior. Na faixa de fronteira, o modo Fast oferece aos clientes da API acesso mais rápido ao Sol quando o tempo de resposta é importante.

As empresas podem incorporar mais IA às operações cotidianas sem abrir mão da velocidade nos trabalhos de maior impacto. A análise de documentos em larga escala, a classificação de interações com clientes e implementações rotineiras podem se tornar economicamente viáveis para uso amplo, enquanto cargas de trabalho complexas do Sol podem avançar mais rápido quando o custo adicional se justifica.

Os ganhos podem se acumular. Em um processo conduzido por humanos, modelos mais avançados ajudam nossa equipe técnica a descobrir a próxima geração de melhorias, encurtando o caminho para um desempenho melhor e custos menores. Nossa estratégia continua focada em ampliar tanto a capacidade quanto a eficiência para que cada geração de inteligência possa realizar mais trabalho a um custo menor.

Disponibilidade e preços

O GPT‑5.6 Terra e o Luna continuam disponíveis no ChatGPT Work, no Codex e na API da OpenAI. No ChatGPT Work e no Codex, usuários dos planos Free e ChatGPT Go podem acessar o Terra, enquanto usuários dos planos ChatGPT Plus, ChatGPT Pro, Business e Enterprise podem escolher entre o Terra e o Luna.

A partir de 30 de julho, os preços da API serão de US$ 2 por milhão de tokens de entrada e US$ 12 por milhão de tokens de saída para o Terra, e de US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída para o Luna. O preço do Sol permanece inalterado. Os preços das assinaturas e os limites de cotas do ChatGPT e do Codex permanecem inalterados, enquanto o uso do Terra e do Luna agora consome menos créditos. As mudanças de preço começarão a ser implementadas na AWS ainda hoje.

O modo Fast do GPT‑5.6 Sol substitui o Priority Processing na API e corresponde ao /fast no Codex. As solicitações existentes da API marcadas como priority continuarão funcionando. Confira todos os detalhes de preços da API.

Autoria

OpenAI