Um guia de modelos da família GPT‑6
Dicas práticas para obter os melhores resultados com os modelos GPT‑6, gerenciando tempo e custo
O GPT‑6 é nosso conjunto de modelos mais avançado até hoje e oferece opções de modelos para diferentes tipos de trabalho.
Seja para transformar uma ideia em um protótipo funcional, criar e testar um recurso ou orquestrar fluxos de trabalho de várias etapas entre repositórios de código, bancos de dados e APIs externas, este guia explica como escolher um modelo GPT‑6, dar instruções eficazes, gerenciar trabalhos de longa duração e se preparar para a produção.

Opere com eficiência em produção. Use cache(abre em uma nova janela) e compactação(abre em uma nova janela) para gerenciar contexto e custo. Meça o sucesso das tarefas e a latência, e planeje o monitoramento e os controles de dados.
Escolha o modelo adequado à sua carga de trabalho. Equilibre capacidade, custo e latência escolhendo o modelo, o esforço de raciocínio(abre em uma nova janela) e a velocidade adequados à tarefa.
Ajuste seus prompts e habilidades. Mantenha a coerência entre prompts, habilidades e instruções do repositório sobre o que o modelo deve entregar, o que pode fazer sozinho e quando o trabalho está concluído.
Mantenha os trabalhos de longa duração no rumo certo. Use direcionamento(abre em uma nova janela), ferramentas assíncronas(abre em uma nova janela) e delegação(abre em uma nova janela) para lidar com atualizações e trabalhos independentes. Defina limites claros para quando o modelo deve pedir orientação.
Antes da implantação, é importante adotar algumas verificações e boas práticas.
Tenha a eficiência em mente. (abre em uma nova janela)Remova o contexto desnecessário para a tarefa(abre em uma nova janela), mas preserve as evidências necessárias. Se sua aplicação permitir, execute tarefas independentes em paralelo(abre em uma nova janela) para que uma etapa lenta não atrase trabalhos sem relação com ela.
Reutilize o contexto compartilhado com o cache de prompts(abre em uma nova janela) em trabalhos recorrentes. Tokens de entrada em cache custam até 95% menos(abre em uma nova janela) que tokens de entrada sem cache, dependendo do modelo. Coloque instruções estáveis e materiais de referência antes dos detalhes variáveis da tarefa e mantenha as definições de ferramentas consistentes. O painel de cache(abre em uma nova janela) e o guia de diagnóstico(abre em uma nova janela) ajudam a identificar onde essa reutilização falha. Inclua as gravações em cache e eventuais tarifas de contexto longo ao estimar o custo de um fluxo de trabalho completo.
Para conversas mais longas, a compactação(abre em uma nova janela) reduz o tamanho do contexto, preservando o estado necessário para continuar.
Decida como você vai monitorar o comportamento(abre em uma nova janela) e revise os controles de dados(abre em uma nova janela) da sua aplicação.
Teste antes da implantação: execute tarefas representativas e meça o sucesso, a latência e o custo por tarefa bem-sucedida. Confira nossa lista de verificação para implantação da API(abre em uma nova janela).
Pense na escolha do modelo e do nível de raciocínio como um equilíbrio entre inteligência e preço.
Modelo:
GPT‑6 Astra(abre em uma nova janela) para as tarefas de raciocínio mais difíceis, que exigem o máximo de inteligência.
GPT‑6.1 Sol(abre em uma nova janela) para tarefas complexas de programação, pesquisa e uso do computador.
GPT‑6 Luna(abre em uma nova janela) para tarefas específicas em escala e trabalhos rotineiros e repetitivos com objetivo claro, como extrair campos de faturas, classificar solicitações ou produzir resumos estruturados.
Ao avaliar o melhor modelo para a tarefa, compare os preços(abre em uma nova janela) de cada um.
Nível de raciocínio: na API, escolha quanto esforço o modelo dedica à tarefa.
Baixo: tarefas rotineiras, como extrair fatos ou fazer pequenas edições.
Médio: trabalhos que exigem discernimento, como planejar um recurso ou comparar opções.
Alto: depuração difícil, análise aprofundada ou revisão cuidadosa.
Extra alto / Max: teste essas opções, quando disponíveis, se o nível Alto não for suficiente. Mantenha-as apenas se a melhoria justificar o tempo e o custo adicionais.
Na API, você pode alterar o esforço de raciocínio durante a conversa(abre em uma nova janela) sem invalidar o cache.
No Codex, comece com o nível de raciocínio padrão do modelo. Depois, reduza-o para tarefas mais simples ou aumente-o para análises mais profundas.
Velocidade:
Na API, use o modo Fast(abre em uma nova janela) quando o tempo de resposta for importante, como em aplicativos de chat ou ferramentas de programação. Ele oferece tempos de resposta menores e mais consistentes, com custo por token maior que o processamento padrão.
No Codex e na API, use o Ultrafast(abre em uma nova janela) quando respostas mais rápidas valerem o custo extra, como em iterações rápidas de programação. Ele acelera a geração de tokens independentemente do esforço de raciocínio. Disponível para o GPT‑6 Astra(abre em uma nova janela).

—Eric Provencher, Experiência do Desenvolvedor na OpenAI
Comece com uma tarefa clara: o resultado desejado, o público, o contexto e as restrições relevantes e os critérios de conclusão. Depois, revise estas quatro áreas, resumidas de Repensando habilidades e prompts para o GPT‑6 Astra(abre em uma nova janela), para se aprofundar na atualização das suas instruções:
Crie habilidades melhores: use descrições curtas e explícitas sobre quando executar cada habilidade, carregue detalhes de apoio só quando necessário e substitua receitas rígidas por orientações adequadas aos modelos da sua equipe.
Atualize seu AGENTS.md: explique quando documentos e testes específicos são relevantes e autorize explicitamente fluxos rotineiros seguros, como executar testes locais com dados descartáveis e sem acesso à produção.
Defina limites de decisão: indique quais ações podem ser realizadas de forma independente e quais exigem aprovação, substituindo regras genéricas de "sempre perguntar" por limites claros.
Especifique como persistir até a conclusão: defina o que significa "concluído" — implementar a mudança, executá-la, inspecionar o resultado e corrigir falhas — e identifique as decisões que exigem sua revisão.
Para mais orientações, consulte as boas práticas de raciocínio(abre em uma nova janela).
Seja trabalhando no Codex ou desenvolvendo com a API, especifique quais decisões o modelo pode tomar, quando deve pedir orientação e o que caracteriza uma resposta útil.
Dê ao modelo orientação suficiente para avançar sem fazer suposições sobre decisões importantes. (abre em uma nova janela)Diga quais escolhas ele pode fazer e quando deve pedir sua orientação(abre em uma nova janela). Por exemplo, ele pode escolher como organizar um resumo, mas deve consultar você antes de mudar o escopo do projeto. (abre em uma nova janela)Descreva o que caracteriza uma resposta útil(abre em uma nova janela): por exemplo, linguagem simples, detalhes técnicos adequados ao público e um breve resumo de entrega com o que mudou, o que foi verificado e o que ainda precisa de atenção.
Com a família de modelos GPT‑6, agora você pode realizar tarefas que duram horas ou dias. Use os recursos a seguir para gerenciar melhor os agentes em tarefas de longa duração.
Na API, use direcionamento, ferramentas assíncronas e trabalho em paralelo para manter as tarefas de longa duração em andamento.
Atualize instruções durante a execução: o direcionamento durante o turno(abre em uma nova janela) permite enviar uma correção pela API WebSocket de Responses(abre em uma nova janela) enquanto o modelo trabalha. As atualizações entram em uma fila; elas não cancelam ferramentas em execução nem desfazem ações concluídas.
Continue trabalhando enquanto uma ferramenta é executada: a chamada assíncrona de ferramentas(abre em uma nova janela) permite que o modelo prossiga com trabalhos independentes enquanto seu aplicativo executa uma tarefa mais lenta, como testes. Seu aplicativo retorna o resultado quando ele estiver pronto. Aguarde esse resultado antes de iniciar trabalhos que dependam dele.
Delegue subtarefas independentes: o GPT‑6.1 Sol oferece suporte a fluxos de trabalho multiagente na API Responses(abre em uma nova janela). Ele pode atribuir trabalhos independentes a subagentes, como investigar diferentes partes de uma base de código, e reunir suas conclusões em uma resposta final. O recurso multiagente está em versão beta.
Tarefas de longa duração podem revelar decisões que você não teria necessariamente previsto no prompt inicial. Use esclarecimentos e direcionamento para manter o trabalho no rumo certo.
Responda a perguntas conforme o trabalho avança: com o GPT‑6 Astra, o Codex pode pedir esclarecimentos enquanto trabalha(abre em uma nova janela). Resolva as dúvidas que afetam a próxima etapa e especifique quais trabalhos independentes podem continuar enquanto você decide. Se for se ausentar, diga ao Codex quais tarefas podem continuar e quando ele deve pausar para aguardar sua resposta.
Redirecione o trabalho quando os requisitos mudarem: oriente a tarefa em andamento(abre em uma nova janela) com novas informações, explicando o que deve mudar e o que deve permanecer igual. Isso ajuda a evitar que se gaste mais tempo em uma abordagem que já não atende às suas necessidades.

O uso do computador(abre em uma nova janela) permite que o GPT‑6 Astra, o GPT‑6.1 Sol e o GPT‑6 Luna interajam diretamente com sites e aplicativos de desktop, mesmo aqueles sem uma API. Por exemplo, você pode pedir ao modelo que investigue um bug, corrija o código e abra seu produto em um navegador para verificar se a correção funciona.
Escolha a forma mais simples e confiável de realizar cada etapa:
Use uma API ou ferramenta conectada quando ela puder realizar o trabalho diretamente.
Recorra ao uso do computador quando o modelo precisar ler uma tela, clicar em botões ou preencher um formulário para você.
Se estiver integrando o uso do computador ao seu aplicativo, forneça ao modelo uma ferramenta que execute código para controlar um navegador ou desktop. O Playwright funciona com navegadores(abre em uma nova janela); o PyAutoGUI, com aplicativos de desktop.



