Zum Hauptinhalt springen
OpenAI

22. September 2026

Produkt

Besseres Prompt-Caching für GPT‑6

Höhere Cache-Trefferraten und neue Tools, damit dauerhaft aktive Agenten schneller und kostengünstiger arbeiten.

Laden …

GPT‑6 ermöglicht dauerhaft aktiven Agenten, stundenlang komplexe Aufgaben zu bearbeiten, von der Umstrukturierung von Codebasen bis zur Erstellung fundiert recherchierter Dokumente und Präsentationen. Die Anwendungen hinter diesen Agenten stellen eine Reihe aufeinander aufbauender API-Anfragen und übernehmen dabei häufig dieselben Anweisungen, Tooldefinitionen und Kontextinformationen aus vorherigen Interaktionen. OpenAI speichert diesen gemeinsamen Kontext im Cache, um Rechenarbeit anfrageübergreifend wiederzuverwenden. Das verkürzt die Antwortzeiten und gewährt Entwicklerinnen und Entwicklern Rabatte von bis zu 90 % auf zwischengespeicherte Eingabe-Token.

Mit der GPT‑6‑Familie haben wir ein verbessertes Prompt-Caching-System eingeführt, das standardmäßig höhere Cache-Trefferraten erzielt. Für geeignete gemeinsame Präfixe, die innerhalb von 30 Minuten wiederverwendet werden, gewähren wir jetzt Cache-Rabatte. Außerdem führen wir neue Tools ein, mit denen Entwicklerinnen und Entwickler die Cache-Leistung überwachen, Fehlschläge diagnostizieren und festlegen können, wie viel eines Prompts im Cache gespeichert wird.

Das Prompt-Caching von OpenAI trägt entscheidend dazu bei, dass GitHub Copilot auch in großem Maßstab schnell und effizient funktioniert. In den vergangenen Monaten haben wir bei Milliarden von Anfragen an OpenAI-Modelle den Anteil der Prompt-Token, die neu verarbeitet werden müssen, gegenüber unserem bisherigen Ausgangswert um mehr als 50 % gesenkt. Das Ergebnis ist ein effizienterer Inferenz-Stack und eine kürzere Zeit bis zur ersten Antwort für Entwicklerinnen und Entwickler.
– Mario Rodriguez, Chief Product Officer

Caching überwachen und Cache-Fehlschläge diagnostizieren

Das neue Prompt-Caching-Dashboard(wird in einem neuen Fenster geöffnet) zeigt, welcher Anteil der Eingaben deiner Anwendung aus dem Cache bereitgestellt wird. Verfolge die Trefferraten im Zeitverlauf und vergleiche im Diagramm zur Eingabezusammensetzung zwischengespeicherte und nicht zwischengespeicherte Token. Diese Ansichten helfen dir, Rückgänge bei Cache-Treffern zu erkennen und zu beurteilen, wie sich Änderungen an deiner Anwendung auf die Cache-Leistung auswirken.

Prompt-Caching-Dashboard mit Cache-Trefferrate, zeitlichem Verlauf der Cache-Leistung und Zusammensetzung der Eingabe-Token.

Wenn ein unerwarteter Cache-Fehlschlag auftritt, kannst du mit dem Diagnosetool für Prompt-Caching(wird in einem neuen Fenster geöffnet) nachvollziehen, was geschehen ist. Vergleiche eine Anfrage mit einer aktuellen Antwort, um Änderungen am Modell, an Tools, Einstellungen oder Eingaben zu erkennen, die eine Wiederverwendung verhindert haben. Anhand der geschätzten Zahl betroffener Token kannst du das Ausmaß beurteilen und entscheiden, wie sich deine Integration für möglichst hohe Cache-Trefferraten optimieren lässt.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Caching für deine Anwendung optimieren

Lege fest, was im Cache gespeichert wird. Mit expliziten Cache-Haltepunkten kannst du festlegen, welche Prompt-Präfixe wiederverwendet werden. Der aktualisierte Leitfaden zum Prompt-Caching(wird in einem neuen Fenster geöffnet) erklärt, wie du sie verwendest, wie lange zwischengespeicherte Präfixe genutzt werden können und wie sich Änderungen an Tools und Eingaben auf die Wiederverwendung auswirken.

Passe den Reasoning-Aufwand an, ohne den Cache ungültig zu machen. Bei GPT‑6‑Modellen kannst du jetzt den Reasoning-Aufwand zwischen Antworten ändern(wird in einem neuen Fenster geöffnet), ohne den Cache ungültig zu machen. Erhöhe den Aufwand für eine schwierigere Aufgabe oder senke ihn für eine routinemäßige Folgeanfrage, indem du ein configuration_update anhängst und den Reasoning-Aufwand auf Anfrageebene unverändert lässt. So kannst du den für eine Aufgabe erforderlichen Reasoning-Aufwand anpassen und wiederverwendbaren Kontext erhalten.

Erhalte den Cache, wenn sich Tools und Anweisungen ändern. Wenn sich die Anforderungen an die Toolnutzung deines Agenten ändern, solltest du Tooldefinitionen, Schemas und Reihenfolge stabil halten, damit früherer Kontext wiederverwendbar bleibt. Verwende allowed_tools, damit nur relevante Tools aufgerufen werden können, oder setze tool_choice auf none, wenn keine Tools benötigt werden, statt Definitionen zu entfernen. Hänge neue Anweisungen mit neuen Entwicklermeldungen am Ende des Kontexts an, um ältere Anweisungen zu überschreiben. Weitere Informationen findest du in unseren Hinweisen zum Verwalten von Tooländerungen(wird in einem neuen Fenster geöffnet).

Wärme den Cache vor, um die Latenz zu verringern. Beim Vorwärmen(wird in einem neuen Fenster geöffnet) wird bekannter Kontext im Voraus vorbereitet, damit das Modell bei Eingang einer Anfrage schneller mit der Antwort beginnen kann. Eine Anwendung kann beispielsweise beim Start gemeinsame Anweisungen, Tooldefinitionen oder Referenzmaterial vorwärmen, bevor die erste Frage gestellt wird. Dadurch findet die Verarbeitung nicht während der Wartezeit statt.

Diese optionalen Steuerelemente ergänzen die Standardleistung der Engine und helfen dir, das Caching auf deine Arbeitslast abzustimmen.

1 von 3
Die Prompt-Caching-Diagnose und das Dashboard von OpenAI haben uns geholfen, die Cache-Trefferraten um einige Prozentpunkte zu erhöhen und die Kosten um 20 % zu senken. Wir erhalten jetzt Warnmeldungen, wenn das Caching unerwartet fehlschlägt, und diagnostizieren die Ursache mit Codex-Agenten. Mit expliziten Haltepunkten können wir außerdem stabilen Kontext im Cache speichern und häufig wechselnde Inhalte am Ende des Prompts belassen. Dadurch ist es wirtschaftlich rentabel, Konversationen für Hintergrundaufgaben zu forken und dabei fast den gesamten gemeinsamen Kontext wiederzuverwenden.
– Arian Hanifi, Chief Technology Officer

Erste Schritte

Autor:in

OpenAI