Passer au contenu principal
OpenAI

22 septembre 2026

Produit

Meilleure mise en cache des invites pour GPT‑6

Un taux de succès du cache accru et de nouveaux outils pour rendre les agents persistants plus rapides et moins coûteux.

Chargement…

GPT‑6 permet aux agents persistants de travailler pendant des heures sur des tâches complexes, de la refactorisation de bases de code à la production de documents et de présentations bien documentés. Les applications derrière ces agents effectuent une série de requêtes API qui s’appuient les unes sur les autres et reprennent souvent les mêmes instructions, définitions d’outils et éléments de contexte des échanges précédents. OpenAI met ce contexte partagé en cache afin de réutiliser les calculs entre les requêtes, ce qui réduit les délais de réponse et accorde aux développeurs des rabais pouvant atteindre 90 % sur les tokens d’entrée mis en cache.

Avec la famille GPT‑6, nous avons lancé un système amélioré de mise en cache des invites qui offre par défaut un taux de succès du cache plus élevé. Nous accordons maintenant des rabais de mise en cache pour les préfixes partagés admissibles qui sont réutilisés dans une fenêtre de 30 minutes. Nous lançons également de nouveaux outils pour aider les développeurs à surveiller le rendement du cache, à diagnostiquer les échecs et à choisir la portion d’une invite à mettre en cache.

La mise en cache des invites d’OpenAI joue un rôle essentiel pour aider GitHub Copilot à offrir rapidement et à grande échelle des expériences efficaces. Au cours des derniers mois, nous avons réduit de plus de 50 %, par rapport à notre référence précédente, la proportion de tokens d’invite nécessitant un nouveau traitement parmi des milliards de requêtes aux modèles OpenAI. Il en résulte une pile d’inférence plus efficace et un délai plus court avant la première réponse pour les développeurs.
—Mario Rodriguez, directeur des produits

Surveiller la mise en cache et diagnostiquer les échecs de cache

Le nouveau tableau de bord de mise en cache des invites(s'ouvre dans une nouvelle fenêtre) indique quelle proportion des entrées de votre application est fournie depuis le cache. Suivez le taux de succès au fil du temps et utilisez le graphique de composition des entrées pour comparer les tokens mis en cache et ceux qui ne le sont pas. Ces vues vous aident à repérer les baisses du taux de succès du cache et à évaluer l’incidence des changements apportés à votre application sur le rendement de la mise en cache.

Tableau de bord de mise en cache des invites affichant le taux de succès du cache, son rendement au fil du temps et la composition des tokens d’entrée.

Lorsque vous constatez un échec de cache inattendu, utilisez l’outil de diagnostic de la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) pour comprendre ce qui s’est passé. Comparez une requête à une réponse récente pour repérer les changements apportés au modèle, aux outils, aux paramètres ou à l’entrée qui ont empêché la réutilisation. Le nombre estimé de tokens touchés vous aide à évaluer l’ampleur de l’incidence et à déterminer comment optimiser votre intégration afin de maximiser le taux de succès du cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimiser la mise en cache pour votre application

Choisissez les éléments à mettre en cache. Les points d’arrêt explicites du cache vous permettent de choisir les préfixes d’invite à réutiliser. Le guide actualisé sur la mise en cache des invites(s'ouvre dans une nouvelle fenêtre) explique comment les utiliser, combien de temps les préfixes mis en cache restent admissibles et comment les changements apportés aux outils et aux entrées influent sur leur réutilisation.

Réglez l’effort de raisonnement sans invalider le cache. Sur les modèles GPT‑6, vous pouvez maintenant modifier l’effort de raisonnement(s'ouvre dans une nouvelle fenêtre) entre les réponses sans invalider le cache. Augmentez l’effort pour une tâche plus difficile ou réduisez-le pour un suivi courant en ajoutant un configuration_update, sans modifier l’effort de raisonnement au niveau de la requête. Vous pouvez ainsi ajuster le raisonnement nécessaire à une tâche tout en préservant le contexte réutilisable.

Préservez le cache lorsque les outils et les instructions changent. Lorsque les besoins de votre agent en matière d’outils changent, maintenez les définitions, les schémas et l’ordre des outils pour que le contexte antérieur reste réutilisable. Utilisez allowed_tools pour que seuls les outils pertinents puissent être appelés, ou définissez tool_choice sur none lorsqu’aucun outil n’est requis, plutôt que de supprimer les définitions. Utilisez de nouveaux messages de développeur pour ajouter de nouvelles instructions vers la fin du contexte afin de remplacer les anciennes. Consultez nos conseils sur la gestion des changements d’outils(s'ouvre dans une nouvelle fenêtre).

Préchauffez le cache pour réduire la latence. Le préchauffage(s'ouvre dans une nouvelle fenêtre) prépare à l’avance le contexte connu afin que le modèle puisse commencer à répondre plus rapidement à l’arrivée d’une requête. Par exemple, une application peut préchauffer les instructions partagées, les définitions d’outils ou les documents de référence au démarrage, avant que l’utilisateur pose sa première question. Le traitement est ainsi retiré du temps d’attente de l’utilisateur.

Ces contrôles facultatifs s’ajoutent au rendement par défaut du moteur et vous aident à adapter la mise en cache à votre charge de travail.

1 sur 3
Les diagnostics et le tableau de bord de mise en cache des invites d’OpenAI nous ont aidés à augmenter de quelques points le taux de succès du cache, réduisant ainsi les coûts de 20 %. Nous recevons maintenant des alertes lorsque la mise en cache cesse inopinément de fonctionner et utilisons des agents Codex pour diagnostiquer la cause fondamentale. Les points d’arrêt explicites nous permettent aussi de mettre en cache le contexte stable tout en plaçant à la fin de l’invite le contenu qui change souvent. Il est ainsi devenu économiquement viable de forker des conversations pour des tâches en arrière-plan tout en réutilisant presque tout le contexte partagé.
—Arian Hanifi, directeur de la technologie

Commencer

Auteur

OpenAI