Melhor cache de prompts para o GPT‑6
Mais acertos da cache e novas ferramentas para tornar os agentes persistentes mais rápidos e económicos.
O GPT‑6 permite que agentes persistentes trabalhem durante horas em tarefas complexas, desde a refatoração de bases de código até à criação de documentos e apresentações bem fundamentados. As aplicações por detrás destes agentes fazem uma série de pedidos à API que se baseiam uns nos outros, mantendo muitas vezes as mesmas instruções, definições de ferramentas e contexto de interações anteriores. A OpenAI coloca esse contexto partilhado em cache para reutilizar a computação entre pedidos, reduzindo os tempos de resposta e oferecendo aos programadores descontos até 90% nos tokens de entrada em cache.
Com a família GPT‑6, lançámos um sistema melhorado de cache de prompts que proporciona, por predefinição, taxas de acertos da cache mais elevadas. Agora aplicamos descontos de cache a prefixos partilhados elegíveis que sejam reutilizados num intervalo de 30 minutos. Estamos também a apresentar novas ferramentas para ajudar os programadores a monitorizar o desempenho da cache, diagnosticar falhas e escolher quanto do prompt colocar em cache.
O novo Painel da cache de prompts(abre numa nova janela) mostra que parte da entrada da sua aplicação é fornecida a partir da cache. Acompanhe as taxas de acertos ao longo do tempo e use o gráfico de composição da entrada para comparar tokens em cache e sem cache. Estas vistas ajudam a detetar quebras nos acertos da cache e a avaliar como as alterações à aplicação afetam o desempenho da cache.

Quando ocorrer uma falha inesperada da cache, use a ferramenta de diagnóstico da cache de prompts(abre numa nova janela) para perceber o que aconteceu. Compare um pedido com uma resposta recente para identificar alterações ao modelo, às ferramentas, às definições ou à entrada que impediram a reutilização. O número estimado de tokens afetados ajuda a avaliar a dimensão do impacto e a decidir como otimizar a integração para maximizar as taxas de acertos da cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Escolha o que colocar em cache. Os pontos de interrupção explícitos da cache permitem escolher os prefixos do prompt a reutilizar. O guia atualizado da cache de prompts(abre numa nova janela) explica como utilizá-los, durante quanto tempo os prefixos em cache permanecem elegíveis e como as alterações às ferramentas e entradas afetam a reutilização.
Ajuste o esforço de raciocínio sem invalidar a cache. Nos modelos GPT‑6, agora pode alterar o esforço de raciocínio(abre numa nova janela) entre respostas sem invalidar a cache. Aumente o esforço para uma tarefa mais difícil ou reduza-o para um seguimento rotineiro, acrescentando um configuration_update e mantendo inalterado o esforço de raciocínio ao nível do pedido. Isto permite ajustar o raciocínio necessário para uma tarefa, preservando o contexto reutilizável.
Preserve a cache quando as ferramentas e instruções mudarem. À medida que mudam as necessidades de utilização de ferramentas do seu agente, mantenha estáveis as definições, os esquemas e a ordem das ferramentas para que o contexto anterior continue reutilizável. Use allowed_tools para permitir a chamada apenas das ferramentas relevantes ou defina tool_choice como none quando não forem necessárias ferramentas, em vez de remover as definições. Use novas mensagens de programador para acrescentar instruções no fim do contexto e substituir as anteriores. Consulte as nossas orientações sobre a gestão de alterações às ferramentas(abre numa nova janela).
Pré-aqueça a cache para reduzir a latência. O pré-aquecimento(abre numa nova janela) prepara antecipadamente o contexto conhecido para que o modelo possa começar a responder mais cedo quando chegar um pedido. Por exemplo, uma aplicação pode pré-aquecer instruções partilhadas, definições de ferramentas ou material de referência durante o arranque, antes de o utilizador fazer a primeira pergunta. Assim, o processamento deixa de fazer parte do tempo de espera do utilizador.
Estes controlos opcionais complementam o desempenho predefinido do motor e ajudam a adaptar a cache à sua carga de trabalho.
Monitorize as taxas de acertos da cache no Painel da cache de prompts(abre numa nova janela).
Investigue falhas inesperadas com a ferramenta de diagnóstico(abre numa nova janela).
Siga o guia da cache de prompts(abre numa nova janela) para melhorar a sua configuração ou use o Codex(abre numa nova janela) para rever o código, aplicar melhorias e medir os resultados.


