Pular para o conteúdo principal
OpenAI

13 de agosto de 2026

AI aplicada

Guia do desenvolvedor para o GPT‑5.6

Lições técnicas de startups em produção

Carregando…

O GPT‑5.6 estabelece um novo padrão de custo-benefício

A família de modelos GPT‑5.6 torna o desempenho de agentes de fronteira muito mais acessível e, ao mesmo tempo, amplia os limites do que é possível.

Neste guia, mostramos como startups usam uma seleção de modelos mais inteligente e novos controles de API para manter a continuidade do raciocínio, orquestrar vários agentes e realizar chamadas programáticas de ferramentas, criando agentes mais rápidos e capazes por uma fração do custo.

Uma experiência inicial melhor

Desde o GPT‑5, cada geração de modelos busca realizar tarefas de horizonte mais longo com menos tokens. O GPT‑5.6 mantém essa trajetória: melhor desempenho dos agentes e custos menores, com mudanças mínimas no harness subjacente.

Os ganhos gerais de eficiência de custos são ampliados pelo aumento da precisão com esforços de raciocínio menores. Por exemplo, no Agents’ Last Exam, o GPT‑5.6 Sol com esforço de raciocínio "Leve" superou o GPT‑5.5 com esforço de raciocínio "Alto" quando o harness foi mantido constante. Vimos resultados semelhantes em testes de produção, nos quais startups relataram reduções significativas de custos em vários fluxos de trabalho ao diminuir o esforço de raciocínio em relação aos padrões anteriores.

Colocamos o GPT‑5.6 no nosso harness, e o esforço de raciocínio leve produziu nossos melhores resultados. Ele sabia quando os dados simplesmente não existiam, não seguia pistas falsas e chegava à resposta certa com menos tokens.
— Izzy Miller, líder de pesquisa em IA, Hex(abre em uma nova janela)

Seleção de modelos

Historicamente, adotar um modelo principal com o nível mais alto de raciocínio disponível era a melhor opção para casos de uso de horizonte longo. Isso se devia, em grande parte, à capacidade muito superior desses modelos de lidar com contextos mais longos e chamadas de ferramentas, em comparação com modelos otimizados para custo. Isso mudou com a família 5.6: com mais computação durante o teste, Luna e Terra muitas vezes alcançam desempenho semelhante ao GPT‑5.4 e ao 5.5, mas com custo muito menor.

1 de 3
Luna mantém 98% da precisão de extração do GPT‑5.5 por um décimo oitavo do custo. Assim, nossos agentes obtêm compreensão de documentos de alta qualidade a um preço viável para muitos outros fluxos de trabalho.
— Serhii Shchoholiev, líder de engenharia de agentes, Hypha(abre em uma nova janela)

Considere as tarefas do BrowseComp, um benchmark baseado em pesquisa que testa a capacidade de um modelo encontrar fatos pouco conhecidos. Há três meses, o GPT‑5.5 (Extra alto) alcançou 84,36% nesse benchmark, a um custo total de US$ 33,27. No lançamento, o GPT‑5.6 Luna (Extra alto) oferece praticamente o mesmo desempenho: 84,04% a um custo de US$ 1,33. Desde então, reduzimos ainda mais os preços. Saiba mais sobre nossas últimas reduções de preços.

Os modelos menores da família 5.6 são ideais para cargas de trabalho de alto volume, interações sensíveis à latência e etapas repetidas em fluxos de trabalho com agentes de IA. Por exemplo, se você administra uma startup de tecnologia jurídica que processa memorandos manuscritos antes da análise com agentes de IA, agora pode usar Terra ou Luna para a extração, em vez de aplicar um modelo de fronteira a todo o caso de uso, e obter uma economia significativa.

Evolução da API Responses para projetar agentes mais eficientes

Além de melhorar o desempenho inicial do GPT‑5.6, também lançamos novos componentes básicos na API Responses para possibilitar ganhos adicionais. Treinamos o GPT‑5.6 de ponta a ponta com três intervenções arquitetônicas complementares que permitem aos agentes operar com mais eficiência:

  1. Reutilizar o trabalho já realizado: ao permitir que o raciocínio seja mantido(abre em uma nova janela) entre os turnos do modelo e usar a compactação nativa(abre em uma nova janela) para comprimir conversas longas, o modelo mantém a coerência do trabalho em tarefas de horizonte mais longo, sem se confundir nem precisar reconstruir o contexto anterior.
  2. Decompor em paralelo quando apropriado: usar a orquestração nativa de vários agentes(abre em uma nova janela) permite coordenar diversos agentes em frentes de trabalho paralelas para concluir tarefas complexas mais rapidamente.
  3. Transferir o trabalho determinístico para o código: usar a chamada programática de ferramentas(abre em uma nova janela) para filtrar, agregar e orquestrar as saídas das ferramentas fora da janela de contexto do modelo, reservando os tokens do modelo para decisões e reduzindo custos, latência e degradação do contexto.

Quando usados em conjunto, os resultados podem ser impressionantes. Por exemplo, no ARC-AGI-3, o GPT‑5.6 Sol alcançou 13,3% com o harness padrão. Depois de habilitar a retenção do raciocínio e a compactação, porém, a pontuação saltou para 38,3%, usando cerca de seis vezes menos tokens de saída. Nenhuma mudança no modelo, mas um desempenho quase três vezes maior. Você pode saber mais em nossa investigação do harness do ARC-AGI-3.

Chamada programática de ferramentas

Fluxos de trabalho com agentes de IA costumam envolver dois tipos de trabalho:

  1. Tarefas que exigem discernimento
  2. Trabalho que exige principalmente mover, filtrar e combinar dados

Quando um agente recupera 100 documentos regulatórios, filtra-os por data e identifica transações relevantes, o modelo não deve precisar raciocinar sobre cada resultado intermediário em sua janela de contexto. A chamada programática de ferramentas permite que o GPT‑5.6 escreva JavaScript para orquestrar ferramentas, executar chamadas independentes em paralelo e processar as saídas fora da janela de contexto. Assim, o modelo pode se concentrar no que exige inteligência: aplicar discernimento.

Na pesquisa financeira, o difícil é obter documentos regulatórios com confiabilidade, coordenar ferramentas e analisar os números. Em nossas avaliações, o GPT‑5.6 com chamada programática de ferramentas atingiu o nível de qualidade dos nossos critérios usando 21% menos tokens de entrada. Essa é a diferença entre um agente capaz de discutir pesquisa financeira e outro capaz de realmente executá-la.
— Alex Wang, IA aplicada, Rogo(abre em uma nova janela)

Vários agentes

Em tarefas complexas e paralelizáveis, distribuir ações e raciocínio entre várias frentes de trabalho de agentes permite concluir tarefas mais rapidamente e com maior inteligência. Nessas configurações, o agente principal é responsável por orquestrar os subagentes e delegar tarefas a eles. Os subagentes buscam seus objetivos em paralelo e, por fim, enviam suas saídas ao agente principal para a síntese final. As equipes podem começar a usar vários agentes de forma nativa ao habilitar o recurso multiagente(abre em uma nova janela) na API Responses. É também assim que funciona a configuração de capacidade Ultra no ChatGPT.

1 de 2
A Qualia coordena equipes de agentes em problemas de pesquisa em aberto, e o GPT‑5.6 Sol simplesmente encaixou. Ele apresentou uma melhora significativa em relação ao GPT‑5.5, concluiu as tarefas mais rápido do que quase todos os outros modelos que testamos e logo se tornou nosso modelo preferido da OpenAI.
— E Chi, fundador, Quadrillion(abre em uma nova janela)

Embora o GPT‑5.6 tenha uma boa noção do número adequado de subagentes e de quando criá-los, o comportamento multiagente é altamente ajustável. Orientar o modelo sobre quando acionar subagentes pode aumentar a probabilidade de criar agentes apenas quando o gasto adicional de tokens resultar em melhor desempenho.

Cache de prompts

Em toda a família de modelos, o TTL do cache de prompts foi ampliado para no mínimo 30 minutos, e agora é possível definir pontos de interrupção de cache de forma determinística na janela de contexto do modelo. Isso permitiu que startups aumentassem significativamente a taxa de acertos do cache.

Adicionamos pontos de interrupção de cache e chaves específicas de cada espaço de trabalho a um prompt compartilhado de 29.000 tokens e reduzimos em 28% a entrada sem cache. A janela de cache de 30 minutos também trouxe um grande avanço: nossos agentes puderam reutilizar o mesmo contexto entre execuções, em vez de começar do zero.
— Lorenzo Gentile, engenheiro de IA, Ploy(abre em uma nova janela)

Além de definir pontos de interrupção de cache, continuar usando uma prompt_cache_key(abre em uma nova janela) apropriada aumenta a probabilidade de as solicitações chegarem ao mesmo mecanismo de inferência que já processou o mesmo prefixo, reduzindo a latência.

Conclusão

O que mais chama a atenção nesses exemplos é o quanto a viabilidade econômica de criar agentes mudou.

Casos de uso que antes exigiam um modelo de fronteira em todas as etapas agora podem alcançar resultados comparáveis ou melhores por uma fração do custo, usando modelos menores, ajustando o esforço de raciocínio e fazendo escolhas arquitetônicas eficientes.

Mal podemos esperar para ver o que vocês vão criar!

  • 2026
  • Plataforma de API

Sobre os autores

Este guia foi elaborado por Samarth Madduru(abre em uma nova janela), Prashant Mital(abre em uma nova janela), Dave Leo(abre em uma nova janela) e Julien Reiman(abre em uma nova janela), com base na experiência de trabalho próximo a startups que desenvolvem com o GPT‑5.6, dos primeiros testes até a produção.