Pular para o conteúdo principal
OpenAI

22 de setembro de 2026

Produto

Cache de prompts aprimorado para o GPT‑6

Mais acertos no cache e novas ferramentas para que agentes persistentes sejam mais rápidos e econômicos.

Carregando…

O GPT‑6 permite que agentes persistentes trabalhem por horas em tarefas complexas, desde a refatoração de bases de código até a produção de documentos e apresentações bem fundamentados. Os aplicativos por trás desses agentes fazem uma série de solicitações de API que se complementam, muitas vezes reutilizando as mesmas instruções, definições de ferramentas e o contexto de interações anteriores. A OpenAI armazena esse contexto compartilhado em cache para reutilizar o processamento entre solicitações, reduzindo o tempo de resposta e oferecendo aos desenvolvedores descontos de até 90% nos tokens de entrada em cache.

Com a família GPT‑6, lançamos um sistema aprimorado de cache de prompts que oferece taxas de acerto do cache mais altas por padrão. Agora oferecemos descontos de cache para prefixos compartilhados qualificados e reutilizados em um intervalo de 30 minutos. Também estamos lançando novas ferramentas para ajudar os desenvolvedores a monitorar o desempenho do cache, diagnosticar falhas e escolher quanto de um prompt armazenar em cache.

O cache de prompts da OpenAI é fundamental para que o GitHub Copilot ofereça experiências rápidas e eficientes em grande escala. Nos últimos meses, reduzimos em mais de 50% a parcela de tokens de prompt que exigem novo processamento em bilhões de solicitações aos modelos da OpenAI, em comparação com nossa referência anterior. O resultado é uma pilha de inferência mais eficiente e uma primeira resposta mais rápida para os desenvolvedores.
—Mario Rodriguez, diretor de produtos

Monitore o cache e diagnostique falhas

O novo Painel de cache de prompts(abre em uma nova janela) mostra quanto da entrada do seu aplicativo é fornecido pelo cache. Acompanhe as taxas de acerto ao longo do tempo e use o gráfico de composição da entrada para comparar tokens armazenados e não armazenados em cache. Essas visualizações ajudam a identificar quedas nos acertos do cache e avaliar como as alterações no aplicativo afetam o desempenho do cache.

Painel de cache de prompts mostrando a taxa de acerto do cache, o desempenho do cache ao longo do tempo e a composição dos tokens de entrada.

Ao se deparar com uma falha inesperada de cache, use a ferramenta de diagnóstico do cache de prompts(abre em uma nova janela) para entender o que aconteceu. Compare uma solicitação com uma resposta recente para identificar alterações no modelo, nas ferramentas, nas configurações ou na entrada que impediram a reutilização. O número estimado de tokens afetados ajuda a avaliar a dimensão do impacto e decidir como otimizar sua integração para maximizar as taxas de acerto do cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Otimize o cache para seu aplicativo

Escolha o que armazenar em cache. Os pontos de interrupção explícitos do cache permitem escolher quais prefixos do prompt reutilizar. O guia atualizado de cache de prompts(abre em uma nova janela) explica como usá-los, por quanto tempo os prefixos em cache permanecem qualificados e como as alterações em ferramentas e entradas afetam a reutilização.

Ajuste o esforço de raciocínio sem invalidar o cache. Nos modelos GPT‑6, agora você pode alterar o esforço de raciocínio(abre em uma nova janela) entre respostas sem invalidar o cache. Aumente o esforço para uma tarefa mais difícil ou reduza-o para um acompanhamento rotineiro adicionando um configuration_update, sem alterar o esforço de raciocínio no nível da solicitação. Assim, você pode ajustar quanto raciocínio uma tarefa exige e preservar o contexto reutilizável.

Preserve o cache quando ferramentas e instruções mudarem. À medida que as necessidades de uso de ferramentas do seu agente mudarem, mantenha estáveis as definições, os esquemas e a ordem das ferramentas para que o contexto anterior continue reutilizável. Use allowed_tools para permitir chamadas somente às ferramentas relevantes ou defina tool_choice como none quando nenhuma ferramenta for necessária, em vez de remover as definições. Use novas mensagens de desenvolvedor para adicionar instruções ao fim do contexto e substituir as anteriores. Consulte nossas orientações para gerenciar alterações nas ferramentas(abre em uma nova janela).

Pré-aqueça o cache para reduzir a latência. O pré-aquecimento(abre em uma nova janela) prepara antecipadamente o contexto conhecido para que o modelo comece a responder mais rápido quando uma solicitação chegar. Por exemplo, um aplicativo pode pré-aquecer instruções compartilhadas, definições de ferramentas ou material de referência durante a inicialização, antes que o usuário faça a primeira pergunta. Isso retira o processamento do tempo de espera do usuário.

Esses controles opcionais complementam o desempenho padrão do mecanismo e ajudam a adaptar o cache à sua carga de trabalho.

1 de 3
Os diagnósticos e o painel de cache de prompts da OpenAI nos ajudaram a elevar as taxas de acerto do cache em alguns pontos percentuais, reduzindo os custos em 20%. Agora recebemos alertas quando o cache deixa de funcionar inesperadamente e usamos agentes do Codex para diagnosticar a causa raiz. Os pontos de interrupção explícitos também nos permitem armazenar em cache o contexto estável e manter no fim do prompt o conteúdo que muda com frequência. Com isso, tornou-se economicamente viável fazer fork de conversas para tarefas em segundo plano e, ao mesmo tempo, reutilizar quase todo o contexto compartilhado.
—Arian Hanifi, diretor de tecnologia

Comece agora

Autor

OpenAI