Avançando a fronteira de preço-desempenho com o GPT‑5.6
Ao tornar cada camada mais eficiente, a OpenAI oferece mais desempenho por dólar em um número maior de cargas de trabalho empresariais.
Ontem, mostramos como o GPT‑5.6 ajudou a tornar sua própria execução mais eficiente. Hoje, estamos repassando esses ganhos aos clientes, com preços menores para o GPT‑5.6 Luna(abre em uma nova janela) e o Terra(abre em uma nova janela), além de maior velocidade com o GPT‑5.6 Sol na API. Juntas, essas atualizações ajudam os clientes a obter mais de cada dólar investido em IA e a avançar mais rapidamente quando o tempo é decisivo.
A partir de hoje, o GPT‑5.6 Luna, nosso modelo mais rápido e acessível, custará 80% menos, enquanto o GPT‑5.6 Terra, nosso modelo equilibrado para o trabalho cotidiano, custará 20% menos. Os preços menores do Luna e do Terra também se refletem na contabilização do uso nas assinaturas pagas ao usar o Codex e o ChatGPT Work. O Luna oferece às empresas uma forma muito mais econômica de realizar trabalhos de alto volume com níveis altíssimos de qualidade. Ele pode usar ferramentas e concluir fluxos de trabalho de várias etapas, viabilizando a execução em escala de uma variedade maior de aplicações de IA.
Tornar a inteligência avançada mais abundante e acessível é essencial para a missão da OpenAI de garantir que a AGI beneficie toda a humanidade. Essas mudanças colocam esse compromisso em prática. Elas refletem anos de melhorias na forma como nossos modelos são criados, disponibilizados e colocados em ação.
Também estamos lançando o modo Fast na API, que substitui nossa oferta Priority Processing. Para o GPT‑5.6 Sol, o modo Fast agora oferece velocidades até 2,5 vezes maiores que o processamento Standard pelo dobro do preço, sem nenhuma mudança na inteligência. O modo Fast é retrocompatível: as solicitações marcadas como priority usarão automaticamente o modo Fast.
O uso eficiente da IA começa pelo resultado. O impacto, o custo dos erros, a urgência e a escala determinam o equilíbrio ideal entre inteligência, velocidade, confiabilidade e custo. Esse equilíbrio pode mudar de uma etapa do fluxo de trabalho para outra.
O GPT‑5.6 oferece às empresas muito mais espaço para otimizar essa equação. O Luna oferece desempenho comparável ao de modelos considerados de fronteira há um ano por cerca de 6 centavos por dólar por tarefa e com uma velocidade quase nove vezes maior. Em trabalhos profissionais, conforme medido pelo Agents’ Last Exam, o Luna supera o Fable 5 com um custo estimado por tarefa quase 99% menor.
Na prática, as empresas podem definir o resultado e o padrão de qualidade necessários e então usar avaliações para determinar onde a inteligência adicional melhora substancialmente o resultado e onde um processamento mais rápido e econômico pode oferecer a mesma qualidade. Um fluxo de trabalho de programação, por exemplo, pode usar o Sol para eliminar incertezas e definir o plano e depois usar o Luna para implementar mudanças bem especificadas, escrever e executar testes e avaliar os resultados. Outro fluxo de trabalho pode exigir um equilíbrio diferente.
A família GPT‑5.6 amplia o leque dessas escolhas. As empresas podem aplicar o máximo de inteligência útil em cada etapa e pagar o preço adequado ao valor gerado.
Oferecer essa flexibilidade começa por tornar mais eficiente cada camada por trás dos modelos.
Nossa vantagem em eficiência vem do aprimoramento dos modelos, dos sistemas de inferência que os executam e do harness com agentes de IA que os conecta a ferramentas e contexto. Os modelos GPT‑5.6 seguem um caminho mais direto na execução do trabalho. Um roteamento melhor mantém o hardware produtivo, softwares de produção otimizados geram tokens com mais eficiência e uma gestão de contexto mais inteligente ajuda os agentes a não repetir trabalhos já concluídos. Juntas, essas melhorias permitem concluir mais trabalhos úteis com a mesma capacidade computacional, reduzindo o tempo, os tokens e o custo necessários para cada resultado.
O GPT‑5.6 Sol nos ajuda cada vez mais a descobrir e implementar a próxima rodada de ganhos. Em um processo conduzido por humanos, o Sol reescreveu e otimizou kernels de produção de forma autônoma, projetou e executou centenas de experimentos para melhorar a geração de tokens e monitorou o treinamento, intervindo quando surgiram problemas. O trabalho nos kernels ajudou a reduzir em 20% o custo total de disponibilização do modelo, enquanto os experimentos aumentaram em mais de 15% a eficiência da geração de tokens. Esse trabalho continua, criando um ciclo de feedback mais estreito: à medida que nossos modelos melhoram e conseguem trabalhar com mais autonomia, nossa capacidade de aumentar a eficiência se acelera. Saiba mais sobre a engenharia por trás do GPT‑5.6.
Atender à demanda por inteligência abundante exige mais capacidade computacional e também um uso mais produtivo dessa capacidade. Estamos criando um portfólio de infraestrutura resiliente e direcionando cada carga de trabalho aos sistemas mais adequados para executá-la. Essa abordagem contempla as duas extremidades da curva de preço-desempenho. Na faixa de menor custo, os novos preços do Luna e do Terra tornam trabalhos de alto volume economicamente viáveis em uma escala muito maior. Na faixa de fronteira, o modo Fast oferece aos clientes da API acesso mais rápido ao Sol quando o tempo de resposta é importante.
As empresas podem incorporar mais IA às operações cotidianas sem abrir mão da velocidade nos trabalhos de maior impacto. A análise de documentos em larga escala, a classificação de interações com clientes e implementações rotineiras podem se tornar economicamente viáveis para uso amplo, enquanto cargas de trabalho complexas do Sol podem avançar mais rápido quando o custo adicional se justifica.
Os ganhos podem se acumular. Em um processo conduzido por humanos, modelos mais avançados ajudam nossa equipe técnica a descobrir a próxima geração de melhorias, encurtando o caminho para um desempenho melhor e custos menores. Nossa estratégia continua focada em ampliar tanto a capacidade quanto a eficiência para que cada geração de inteligência possa realizar mais trabalho a um custo menor.
O GPT‑5.6 Terra e o Luna continuam disponíveis no ChatGPT Work, no Codex e na API da OpenAI. No ChatGPT Work e no Codex, usuários dos planos Free e ChatGPT Go podem acessar o Terra, enquanto usuários dos planos ChatGPT Plus, ChatGPT Pro, Business e Enterprise podem escolher entre o Terra e o Luna.
A partir de 30 de julho, os preços da API serão de US$ 2 por milhão de tokens de entrada e US$ 12 por milhão de tokens de saída para o Terra, e de US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída para o Luna. O preço do Sol permanece inalterado. Os preços das assinaturas e os limites de cotas do ChatGPT e do Codex permanecem inalterados, enquanto o uso do Terra e do Luna agora consome menos créditos. As mudanças de preço começarão a ser implementadas na AWS ainda hoje.
O modo Fast do GPT‑5.6 Sol substitui o Priority Processing na API e corresponde ao /fast no Codex. As solicitações existentes da API marcadas como priority continuarão funcionando. Confira todos os detalhes de preços da API.


