Un caching dei prompt migliore per GPT‑6
Più riscontri nella cache e nuovi strumenti per rendere gli agenti persistenti più veloci ed economici.
GPT‑6 consente agli agenti persistenti di lavorare per ore su attività complesse, dal refactoring delle basi di codice alla creazione di documenti e presentazioni frutto di ricerche approfondite. Le applicazioni alla base di questi agenti effettuano una serie di richieste API concatenate, spesso riutilizzando le stesse istruzioni, definizioni degli strumenti e il contesto dei turni precedenti. OpenAI memorizza nella cache il contesto condiviso per riutilizzare i calcoli tra le richieste, riducendo i tempi di risposta e offrendo agli sviluppatori sconti fino al 90% sui token di input memorizzati nella cache.
Con la famiglia GPT‑6 abbiamo lanciato un sistema di caching dei prompt migliorato, che offre tassi di riscontri nella cache più elevati per impostazione predefinita. Ora applichiamo sconti per la cache ai prefissi condivisi idonei riutilizzati entro un intervallo di 30 minuti. Stiamo inoltre introducendo nuovi strumenti per aiutare gli sviluppatori a monitorare le prestazioni della cache, diagnosticare i mancati riscontri nella cache e scegliere quanta parte di un prompt memorizzare nella cache.
La nuova Dashboard del caching dei prompt(si apre in una nuova finestra) mostra quanta parte dell’input dell’applicazione viene recuperata dalla cache. Monitora nel tempo il tasso di riscontri e usa il grafico della composizione dell’input per confrontare i token memorizzati e non memorizzati nella cache. Queste visualizzazioni aiutano a individuare i cali nei riscontri della cache e a valutare l’impatto delle modifiche all’applicazione sulle prestazioni del caching.

Quando si verifica un mancato riscontro imprevisto nella cache, usa lo strumento diagnostico del caching dei prompt(si apre in una nuova finestra) per capire che cosa è successo. Confronta una richiesta con una risposta recente per individuare le modifiche al modello, agli strumenti, alle impostazioni o all’input che ne hanno impedito il riutilizzo. Il numero stimato di token interessati aiuta a valutare l’entità dell’impatto e a stabilire come ottimizzare l’integrazione per massimizzare il tasso di riscontri nella cache.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Scegli cosa memorizzare nella cache. I punti di interruzione espliciti della cache consentono di scegliere quali prefissi dei prompt riutilizzare. La guida aggiornata al caching dei prompt(si apre in una nuova finestra) spiega come usarli, per quanto tempo i prefissi memorizzati restano idonei e in che modo le modifiche agli strumenti e agli input influiscono sul riutilizzo.
Regola l’intensità del ragionamento senza invalidare la cache. Nei modelli GPT‑6 ora puoi modificare l’intensità del ragionamento(si apre in una nuova finestra) tra una risposta e l’altra senza invalidare la cache. Aumenta l’intensità per un’attività più difficile o riducila per una richiesta di routine successiva, aggiungendo un configuration_update senza modificare l’intensità del ragionamento a livello di richiesta. In questo modo puoi regolare il livello di ragionamento richiesto da un’attività, preservando il contesto riutilizzabile.
Preserva la cache quando cambiano strumenti e istruzioni. Quando cambiano le esigenze dell’agente nell’uso degli strumenti, mantieni stabili definizioni, schemi e ordine degli strumenti, così il contesto precedente resta riutilizzabile. Usa allowed_tools per rendere richiamabili solo gli strumenti pertinenti oppure, quando non ne occorre nessuno, imposta tool_choice su none anziché rimuovere le definizioni. Usa nuovi messaggi dello sviluppatore per aggiungere verso la fine del contesto nuove istruzioni che sostituiscano quelle precedenti. Consulta le nostre indicazioni per gestire le modifiche agli strumenti(si apre in una nuova finestra).
Preriscalda la cache per ridurre la latenza. Il preriscaldamento(si apre in una nuova finestra) prepara in anticipo il contesto noto, così il modello può iniziare a rispondere più rapidamente quando arriva una richiesta. Ad esempio, durante l’avvio un’applicazione può preriscaldare istruzioni condivise, definizioni degli strumenti o materiale di riferimento, prima che l’utente ponga la prima domanda. In questo modo l’elaborazione avviene prima del tempo di attesa dell’utente.
Questi controlli facoltativi si aggiungono alle prestazioni predefinite del motore e aiutano ad adattare il caching al carico di lavoro.
Monitora il tasso di riscontri nella cache nella Dashboard del caching dei prompt(si apre in una nuova finestra).
Analizza i mancati riscontri imprevisti nella cache con lo strumento diagnostico(si apre in una nuova finestra).
Segui la guida al caching dei prompt(si apre in una nuova finestra) per migliorare la configurazione oppure usa Codex(si apre in una nuova finestra) per esaminare il codice, applicare i miglioramenti e misurare i risultati.


