Cache de prompts aprimorado para o GPT‑6
Mais acertos no cache e novas ferramentas para que agentes persistentes sejam mais rápidos e econômicos.
O GPT‑6 permite que agentes persistentes trabalhem por horas em tarefas complexas, desde a refatoração de bases de código até a produção de documentos e apresentações bem fundamentados. Os aplicativos por trás desses agentes fazem uma série de solicitações de API que se complementam, muitas vezes reutilizando as mesmas instruções, definições de ferramentas e o contexto de interações anteriores. A OpenAI armazena esse contexto compartilhado em cache para reutilizar o processamento entre solicitações, reduzindo o tempo de resposta e oferecendo aos desenvolvedores descontos de até 90% nos tokens de entrada em cache.
Com a família GPT‑6, lançamos um sistema aprimorado de cache de prompts que oferece taxas de acerto do cache mais altas por padrão. Agora oferecemos descontos de cache para prefixos compartilhados qualificados e reutilizados em um intervalo de 30 minutos. Também estamos lançando novas ferramentas para ajudar os desenvolvedores a monitorar o desempenho do cache, diagnosticar falhas e escolher quanto de um prompt armazenar em cache.
O novo Painel de cache de prompts(abre em uma nova janela) mostra quanto da entrada do seu aplicativo é fornecido pelo cache. Acompanhe as taxas de acerto ao longo do tempo e use o gráfico de composição da entrada para comparar tokens armazenados e não armazenados em cache. Essas visualizações ajudam a identificar quedas nos acertos do cache e avaliar como as alterações no aplicativo afetam o desempenho do cache.

Ao se deparar com uma falha inesperada de cache, use a ferramenta de diagnóstico do cache de prompts(abre em uma nova janela) para entender o que aconteceu. Compare uma solicitação com uma resposta recente para identificar alterações no modelo, nas ferramentas, nas configurações ou na entrada que impediram a reutilização. O número estimado de tokens afetados ajuda a avaliar a dimensão do impacto e decidir como otimizar sua integração para maximizar as taxas de acerto do cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Escolha o que armazenar em cache. Os pontos de interrupção explícitos do cache permitem escolher quais prefixos do prompt reutilizar. O guia atualizado de cache de prompts(abre em uma nova janela) explica como usá-los, por quanto tempo os prefixos em cache permanecem qualificados e como as alterações em ferramentas e entradas afetam a reutilização.
Ajuste o esforço de raciocínio sem invalidar o cache. Nos modelos GPT‑6, agora você pode alterar o esforço de raciocínio(abre em uma nova janela) entre respostas sem invalidar o cache. Aumente o esforço para uma tarefa mais difícil ou reduza-o para um acompanhamento rotineiro adicionando um configuration_update, sem alterar o esforço de raciocínio no nível da solicitação. Assim, você pode ajustar quanto raciocínio uma tarefa exige e preservar o contexto reutilizável.
Preserve o cache quando ferramentas e instruções mudarem. À medida que as necessidades de uso de ferramentas do seu agente mudarem, mantenha estáveis as definições, os esquemas e a ordem das ferramentas para que o contexto anterior continue reutilizável. Use allowed_tools para permitir chamadas somente às ferramentas relevantes ou defina tool_choice como none quando nenhuma ferramenta for necessária, em vez de remover as definições. Use novas mensagens de desenvolvedor para adicionar instruções ao fim do contexto e substituir as anteriores. Consulte nossas orientações para gerenciar alterações nas ferramentas(abre em uma nova janela).
Pré-aqueça o cache para reduzir a latência. O pré-aquecimento(abre em uma nova janela) prepara antecipadamente o contexto conhecido para que o modelo comece a responder mais rápido quando uma solicitação chegar. Por exemplo, um aplicativo pode pré-aquecer instruções compartilhadas, definições de ferramentas ou material de referência durante a inicialização, antes que o usuário faça a primeira pergunta. Isso retira o processamento do tempo de espera do usuário.
Esses controles opcionais complementam o desempenho padrão do mecanismo e ajudam a adaptar o cache à sua carga de trabalho.
Monitore as taxas de acerto do cache no Painel de cache de prompts(abre em uma nova janela).
Investigue falhas inesperadas com a ferramenta de diagnóstico(abre em uma nova janela).
Siga o guia de cache de prompts(abre em uma nova janela) para aprimorar sua configuração ou use o Codex(abre em uma nova janela) para revisar seu código, aplicar melhorias e medir os resultados.


