Meilleure mise en cache des invites pour GPT‑6
Un taux de succès du cache accru et de nouveaux outils pour rendre les agents persistants plus rapides et moins coûteux.
GPT‑6 permet aux agents persistants de travailler pendant des heures sur des tâches complexes, de la refactorisation de bases de code à la production de documents et de présentations bien documentés. Les applications derrière ces agents effectuent une série de requêtes API qui s’appuient les unes sur les autres et reprennent souvent les mêmes instructions, définitions d’outils et éléments de contexte des échanges précédents. OpenAI met ce contexte partagé en cache afin de réutiliser les calculs entre les requêtes, ce qui réduit les délais de réponse et accorde aux développeurs des rabais pouvant atteindre 90 % sur les tokens d’entrée mis en cache.
Avec la famille GPT‑6, nous avons lancé un système amélioré de mise en cache des invites qui offre par défaut un taux de succès du cache plus élevé. Nous accordons maintenant des rabais de mise en cache pour les préfixes partagés admissibles qui sont réutilisés dans une fenêtre de 30 minutes. Nous lançons également de nouveaux outils pour aider les développeurs à surveiller le rendement du cache, à diagnostiquer les échecs et à choisir la portion d’une invite à mettre en cache.
Le nouveau tableau de bord de mise en cache des invites(s'ouvre dans une nouvelle fenêtre) indique quelle proportion des entrées de votre application est fournie depuis le cache. Suivez le taux de succès au fil du temps et utilisez le graphique de composition des entrées pour comparer les tokens mis en cache et ceux qui ne le sont pas. Ces vues vous aident à repérer les baisses du taux de succès du cache et à évaluer l’incidence des changements apportés à votre application sur le rendement de la mise en cache.

Lorsque vous constatez un échec de cache inattendu, utilisez l’outil de diagnostic de la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) pour comprendre ce qui s’est passé. Comparez une requête à une réponse récente pour repérer les changements apportés au modèle, aux outils, aux paramètres ou à l’entrée qui ont empêché la réutilisation. Le nombre estimé de tokens touchés vous aide à évaluer l’ampleur de l’incidence et à déterminer comment optimiser votre intégration afin de maximiser le taux de succès du cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Choisissez les éléments à mettre en cache. Les points d’arrêt explicites du cache vous permettent de choisir les préfixes d’invite à réutiliser. Le guide actualisé sur la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) explique comment les utiliser, combien de temps les préfixes mis en cache restent admissibles et comment les changements apportés aux outils et aux entrées influent sur leur réutilisation.
Réglez l’effort de raisonnement sans invalider le cache. Sur les modèles GPT‑6, vous pouvez maintenant modifier l’effort de raisonnement(s'ouvre dans une nouvelle fenêtre) entre les réponses sans invalider le cache. Augmentez l’effort pour une tâche plus difficile ou réduisez-le pour un suivi courant en ajoutant un configuration_update, sans modifier l’effort de raisonnement au niveau de la requête. Vous pouvez ainsi ajuster le raisonnement nécessaire à une tâche tout en préservant le contexte réutilisable.
Préservez le cache lorsque les outils et les instructions changent. Lorsque les besoins de votre agent en matière d’outils changent, maintenez les définitions, les schémas et l’ordre des outils pour que le contexte antérieur reste réutilisable. Utilisez allowed_tools pour que seuls les outils pertinents puissent être appelés, ou définissez tool_choice sur none lorsqu’aucun outil n’est requis, plutôt que de supprimer les définitions. Utilisez de nouveaux messages de développeur pour ajouter de nouvelles instructions vers la fin du contexte afin de remplacer les anciennes. Consultez nos conseils sur la gestion des changements d’outils(s'ouvre dans une nouvelle fenêtre).
Préchauffez le cache pour réduire la latence. Le préchauffage(s'ouvre dans une nouvelle fenêtre) prépare à l’avance le contexte connu afin que le modèle puisse commencer à répondre plus rapidement à l’arrivée d’une requête. Par exemple, une application peut préchauffer les instructions partagées, les définitions d’outils ou les documents de référence au démarrage, avant que l’utilisateur pose sa première question. Le traitement est ainsi retiré du temps d’attente de l’utilisateur.
Ces contrôles facultatifs s’ajoutent au rendement par défaut du moteur et vous aident à adapter la mise en cache à votre charge de travail.
Surveillez le taux de succès du cache dans le tableau de bord de mise en cache des invites(s'ouvre dans une nouvelle fenêtre).
Analysez les échecs inattendus avec l’outil de diagnostic(s'ouvre dans une nouvelle fenêtre).
Suivez le guide sur la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) pour améliorer votre configuration, ou utilisez Codex(s'ouvre dans une nouvelle fenêtre) pour examiner votre code, apporter des améliorations et mesurer les résultats.


