Saltar para o conteúdo principal
OpenAI

22 de setembro de 2026

Produto

Melhor cache de prompts para o GPT‑6

Mais acertos da cache e novas ferramentas para tornar os agentes persistentes mais rápidos e económicos.

A carregar…

O GPT‑6 permite que agentes persistentes trabalhem durante horas em tarefas complexas, desde a refatoração de bases de código até à criação de documentos e apresentações bem fundamentados. As aplicações por detrás destes agentes fazem uma série de pedidos à API que se baseiam uns nos outros, mantendo muitas vezes as mesmas instruções, definições de ferramentas e contexto de interações anteriores. A OpenAI coloca esse contexto partilhado em cache para reutilizar a computação entre pedidos, reduzindo os tempos de resposta e oferecendo aos programadores descontos até 90% nos tokens de entrada em cache.

Com a família GPT‑6, lançámos um sistema melhorado de cache de prompts que proporciona, por predefinição, taxas de acertos da cache mais elevadas. Agora aplicamos descontos de cache a prefixos partilhados elegíveis que sejam reutilizados num intervalo de 30 minutos. Estamos também a apresentar novas ferramentas para ajudar os programadores a monitorizar o desempenho da cache, diagnosticar falhas e escolher quanto do prompt colocar em cache.

A cache de prompts da OpenAI é essencial para ajudar o GitHub Copilot a proporcionar experiências rápidas e eficientes em grande escala. Nos últimos meses, reduzimos em mais de 50% a proporção de tokens de prompts que exigem novo processamento em milhares de milhões de pedidos aos modelos da OpenAI, face ao nosso valor de referência anterior. O resultado é uma infraestrutura de inferência mais eficiente e um menor tempo até à primeira resposta para os programadores.
—Mario Rodriguez, Diretor de Produto

Monitorizar a cache e diagnosticar falhas

O novo Painel da cache de prompts(abre numa nova janela) mostra que parte da entrada da sua aplicação é fornecida a partir da cache. Acompanhe as taxas de acertos ao longo do tempo e use o gráfico de composição da entrada para comparar tokens em cache e sem cache. Estas vistas ajudam a detetar quebras nos acertos da cache e a avaliar como as alterações à aplicação afetam o desempenho da cache.

Painel da cache de prompts que mostra a taxa de acertos da cache, o desempenho da cache ao longo do tempo e a composição dos tokens de entrada.

Quando ocorrer uma falha inesperada da cache, use a ferramenta de diagnóstico da cache de prompts(abre numa nova janela) para perceber o que aconteceu. Compare um pedido com uma resposta recente para identificar alterações ao modelo, às ferramentas, às definições ou à entrada que impediram a reutilização. O número estimado de tokens afetados ajuda a avaliar a dimensão do impacto e a decidir como otimizar a integração para maximizar as taxas de acertos da cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Otimizar a cache para a sua aplicação

Escolha o que colocar em cache. Os pontos de interrupção explícitos da cache permitem escolher os prefixos do prompt a reutilizar. O guia atualizado da cache de prompts(abre numa nova janela) explica como utilizá-los, durante quanto tempo os prefixos em cache permanecem elegíveis e como as alterações às ferramentas e entradas afetam a reutilização.

Ajuste o esforço de raciocínio sem invalidar a cache. Nos modelos GPT‑6, agora pode alterar o esforço de raciocínio(abre numa nova janela) entre respostas sem invalidar a cache. Aumente o esforço para uma tarefa mais difícil ou reduza-o para um seguimento rotineiro, acrescentando um configuration_update e mantendo inalterado o esforço de raciocínio ao nível do pedido. Isto permite ajustar o raciocínio necessário para uma tarefa, preservando o contexto reutilizável.

Preserve a cache quando as ferramentas e instruções mudarem. À medida que mudam as necessidades de utilização de ferramentas do seu agente, mantenha estáveis as definições, os esquemas e a ordem das ferramentas para que o contexto anterior continue reutilizável. Use allowed_tools para permitir a chamada apenas das ferramentas relevantes ou defina tool_choice como none quando não forem necessárias ferramentas, em vez de remover as definições. Use novas mensagens de programador para acrescentar instruções no fim do contexto e substituir as anteriores. Consulte as nossas orientações sobre a gestão de alterações às ferramentas(abre numa nova janela).

Pré-aqueça a cache para reduzir a latência. O pré-aquecimento(abre numa nova janela) prepara antecipadamente o contexto conhecido para que o modelo possa começar a responder mais cedo quando chegar um pedido. Por exemplo, uma aplicação pode pré-aquecer instruções partilhadas, definições de ferramentas ou material de referência durante o arranque, antes de o utilizador fazer a primeira pergunta. Assim, o processamento deixa de fazer parte do tempo de espera do utilizador.

Estes controlos opcionais complementam o desempenho predefinido do motor e ajudam a adaptar a cache à sua carga de trabalho.

1 de 3
Os diagnósticos e o painel da cache de prompts da OpenAI ajudaram-nos a aumentar em alguns pontos percentuais as taxas de acertos da cache, reduzindo os custos em 20%. Agora recebemos alertas quando a cache deixa inesperadamente de funcionar e usamos agentes Codex para diagnosticar a causa principal. Os pontos de interrupção explícitos também nos permitem colocar em cache o contexto estável, mantendo no fim do prompt o conteúdo que muda frequentemente. Assim, tornou-se economicamente viável fazer fork de conversas para tarefas em segundo plano, reutilizando quase todo o contexto partilhado.
—Arian Hanifi, Diretor de Tecnologia

Começar

Autor

OpenAI