Meilleure mise en cache des prompts pour GPT‑6
Des taux de succès du cache plus élevés et de nouveaux outils pour accélérer les agents persistants tout en réduisant leurs coûts.
GPT‑6 permet aux agents persistants de travailler pendant des heures sur des tâches complexes, de la refactorisation de bases de code à la production de documents et de présentations rigoureusement documentés. Les applications qui sous-tendent ces agents envoient une série de requêtes API qui s’appuient les unes sur les autres, en reprenant souvent les mêmes instructions, définitions d’outils et éléments de contexte des échanges précédents. OpenAI met ce contexte partagé en cache afin de réutiliser les calculs entre les requêtes, réduisant ainsi les temps de réponse et accordant aux développeurs jusqu’à 90 % de remise sur les tokens d’entrée mis en cache.
Avec la famille GPT‑6, nous avons lancé un système amélioré de mise en cache des prompts qui offre par défaut des taux de succès du cache plus élevés. Nous accordons désormais des remises pour les préfixes partagés admissibles réutilisés dans un délai de 30 minutes. Nous lançons également de nouveaux outils pour aider les développeurs à surveiller les performances du cache, à diagnostiquer les échecs et à choisir la part d’un prompt à mettre en cache.
Le nouveau tableau de bord de mise en cache des prompts(ouverture dans une nouvelle fenêtre) indique la part des entrées de votre application qui provient du cache. Suivez les taux de succès au fil du temps et utilisez le graphique de composition des entrées pour comparer les tokens mis en cache et ceux qui ne le sont pas. Ces vues vous aident à repérer les baisses du taux de succès et à évaluer l’incidence des modifications apportées à votre application sur les performances de la mise en cache.

En cas d’échec inattendu du cache, utilisez l’outil de diagnostic de la mise en cache des prompts(ouverture dans une nouvelle fenêtre) pour comprendre ce qui s’est passé. Comparez une requête à une réponse récente afin d’identifier les modifications apportées au modèle, aux outils, aux paramètres ou à l’entrée qui ont empêché leur réutilisation. Le nombre estimé de tokens concernés vous aide à évaluer l’ampleur de l’impact et à déterminer comment optimiser votre intégration afin de maximiser le taux de succès du cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Choisissez ce qu’il faut mettre en cache. Les points de rupture explicites du cache vous permettent de choisir les préfixes de prompt à réutiliser. Le guide actualisé de la mise en cache des prompts(ouverture dans une nouvelle fenêtre) explique comment les utiliser, combien de temps les préfixes mis en cache restent admissibles et comment les modifications des outils et des entrées influent sur leur réutilisation.
Ajustez l’effort de raisonnement sans invalider le cache. Sur les modèles GPT‑6, vous pouvez désormais modifier l’effort de raisonnement(ouverture dans une nouvelle fenêtre) entre les réponses sans invalider le cache. Augmentez l’effort pour une tâche plus difficile ou réduisez-le pour un suivi courant en ajoutant un configuration_update, sans modifier l’effort de raisonnement au niveau de la requête. Vous pouvez ainsi adapter le niveau de raisonnement requis par une tâche tout en préservant le contexte réutilisable.
Préservez le cache lorsque les outils et les instructions changent. Lorsque les besoins de votre agent en matière d’utilisation des outils évoluent, conservez des définitions, des schémas et un ordre stables afin que le contexte antérieur reste réutilisable. Utilisez allowed_tools pour ne rendre appelables que les outils pertinents, ou définissez tool_choice sur none lorsqu’aucun outil n’est nécessaire, au lieu de supprimer les définitions. Utilisez de nouveaux messages développeur pour ajouter de nouvelles instructions vers la fin du contexte afin de remplacer les précédentes. Consultez nos recommandations sur la gestion des modifications d’outils(ouverture dans une nouvelle fenêtre).
Préchauffez le cache pour réduire la latence. Le préchauffage(ouverture dans une nouvelle fenêtre) prépare à l’avance le contexte connu afin que le modèle puisse commencer à répondre plus rapidement à l’arrivée d’une requête. Par exemple, une application peut préchauffer les instructions partagées, les définitions d’outils ou les documents de référence au démarrage, avant que l’utilisateur ne pose sa première question. Le traitement est ainsi effectué en dehors du temps d’attente de l’utilisateur.
Ces contrôles facultatifs complètent les performances par défaut du moteur et vous aident à adapter la mise en cache à votre charge de travail.
Surveillez le taux de succès du cache dans le tableau de bord de mise en cache des prompts(ouverture dans une nouvelle fenêtre).
Analysez les échecs inattendus à l’aide de l’outil de diagnostic(ouverture dans une nouvelle fenêtre).
Suivez le guide de la mise en cache des prompts(ouverture dans une nouvelle fenêtre) pour améliorer votre configuration, ou utilisez Codex(ouverture dans une nouvelle fenêtre) pour examiner votre code, apporter des améliorations et mesurer les résultats.


