Passer au contenu principal
OpenAI

22 septembre 2026

Produit

Meilleure mise en cache des prompts pour GPT‑6

Des taux de succès du cache plus élevés et de nouveaux outils pour accélérer les agents persistants tout en réduisant leurs coûts.

Chargement...

GPT‑6 permet aux agents persistants de travailler pendant des heures sur des tâches complexes, de la refactorisation de bases de code à la production de documents et de présentations rigoureusement documentés. Les applications qui sous-tendent ces agents envoient une série de requêtes API qui s’appuient les unes sur les autres, en reprenant souvent les mêmes instructions, définitions d’outils et éléments de contexte des échanges précédents. OpenAI met ce contexte partagé en cache afin de réutiliser les calculs entre les requêtes, réduisant ainsi les temps de réponse et accordant aux développeurs jusqu’à 90 % de remise sur les tokens d’entrée mis en cache.

Avec la famille GPT‑6, nous avons lancé un système amélioré de mise en cache des prompts qui offre par défaut des taux de succès du cache plus élevés. Nous accordons désormais des remises pour les préfixes partagés admissibles réutilisés dans un délai de 30 minutes. Nous lançons également de nouveaux outils pour aider les développeurs à surveiller les performances du cache, à diagnostiquer les échecs et à choisir la part d’un prompt à mettre en cache.

La mise en cache des prompts d’OpenAI joue un rôle essentiel pour aider GitHub Copilot à proposer rapidement des expériences efficaces à grande échelle. Au cours des derniers mois, nous avons réduit de plus de 50 %, par rapport à notre niveau de référence précédent, la part des tokens de prompt nécessitant un nouveau traitement sur des milliards de requêtes adressées aux modèles OpenAI. Il en résulte une pile d’inférence plus efficace et un délai plus court avant la première réponse pour les développeurs.
—Mario Rodriguez, directeur des produits

Surveiller la mise en cache et diagnostiquer les échecs du cache

Le nouveau tableau de bord de mise en cache des prompts(ouverture dans une nouvelle fenêtre) indique la part des entrées de votre application qui provient du cache. Suivez les taux de succès au fil du temps et utilisez le graphique de composition des entrées pour comparer les tokens mis en cache et ceux qui ne le sont pas. Ces vues vous aident à repérer les baisses du taux de succès et à évaluer l’incidence des modifications apportées à votre application sur les performances de la mise en cache.

Tableau de bord de mise en cache des prompts affichant le taux de succès du cache, ses performances dans le temps et la composition des tokens d’entrée.

En cas d’échec inattendu du cache, utilisez l’outil de diagnostic de la mise en cache des prompts(ouverture dans une nouvelle fenêtre) pour comprendre ce qui s’est passé. Comparez une requête à une réponse récente afin d’identifier les modifications apportées au modèle, aux outils, aux paramètres ou à l’entrée qui ont empêché leur réutilisation. Le nombre estimé de tokens concernés vous aide à évaluer l’ampleur de l’impact et à déterminer comment optimiser votre intégration afin de maximiser le taux de succès du cache.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimiser la mise en cache pour votre application

Choisissez ce qu’il faut mettre en cache. Les points de rupture explicites du cache vous permettent de choisir les préfixes de prompt à réutiliser. Le guide actualisé de la mise en cache des prompts(ouverture dans une nouvelle fenêtre) explique comment les utiliser, combien de temps les préfixes mis en cache restent admissibles et comment les modifications des outils et des entrées influent sur leur réutilisation.

Ajustez l’effort de raisonnement sans invalider le cache. Sur les modèles GPT‑6, vous pouvez désormais modifier l’effort de raisonnement(ouverture dans une nouvelle fenêtre) entre les réponses sans invalider le cache. Augmentez l’effort pour une tâche plus difficile ou réduisez-le pour un suivi courant en ajoutant un configuration_update, sans modifier l’effort de raisonnement au niveau de la requête. Vous pouvez ainsi adapter le niveau de raisonnement requis par une tâche tout en préservant le contexte réutilisable.

Préservez le cache lorsque les outils et les instructions changent. Lorsque les besoins de votre agent en matière d’utilisation des outils évoluent, conservez des définitions, des schémas et un ordre stables afin que le contexte antérieur reste réutilisable. Utilisez allowed_tools pour ne rendre appelables que les outils pertinents, ou définissez tool_choice sur none lorsqu’aucun outil n’est nécessaire, au lieu de supprimer les définitions. Utilisez de nouveaux messages développeur pour ajouter de nouvelles instructions vers la fin du contexte afin de remplacer les précédentes. Consultez nos recommandations sur la gestion des modifications d’outils(ouverture dans une nouvelle fenêtre).

Préchauffez le cache pour réduire la latence. Le préchauffage(ouverture dans une nouvelle fenêtre) prépare à l’avance le contexte connu afin que le modèle puisse commencer à répondre plus rapidement à l’arrivée d’une requête. Par exemple, une application peut préchauffer les instructions partagées, les définitions d’outils ou les documents de référence au démarrage, avant que l’utilisateur ne pose sa première question. Le traitement est ainsi effectué en dehors du temps d’attente de l’utilisateur.

Ces contrôles facultatifs complètent les performances par défaut du moteur et vous aident à adapter la mise en cache à votre charge de travail.

1 sur 3
Les diagnostics et le tableau de bord de mise en cache des prompts d’OpenAI nous ont aidés à améliorer de quelques points le taux de succès du cache, réduisant ainsi les coûts de 20 %. Nous recevons désormais des alertes lorsque la mise en cache cesse inopinément de fonctionner et utilisons des agents Codex pour diagnostiquer la cause première. Les points de rupture explicites nous permettent également de mettre en cache le contexte stable tout en conservant le contenu fréquemment modifié à la fin du prompt. Cela a rendu économiquement viable le fait de forker des conversations pour des tâches en arrière-plan tout en réutilisant la quasi-totalité du contexte partagé.
—Arian Hanifi, directeur de la technologie

Premiers pas

Auteur

OpenAI