Mejor almacenamiento en caché de prompts para GPT‑6
Más aciertos de caché y nuevas herramientas para que los agentes persistentes funcionen más rápido y cuesten menos.
GPT‑6 permite que los agentes persistentes trabajen durante horas en tareas complejas, desde refactorizar bases de código hasta elaborar documentos y presentaciones bien documentados. Las aplicaciones que sustentan estos agentes realizan una serie de solicitudes a la API que se apoyan unas en otras y suelen reutilizar las mismas instrucciones, definiciones de herramientas y contexto de turnos anteriores. OpenAI almacena en caché ese contexto compartido para reutilizar el procesamiento entre solicitudes, reducir los tiempos de respuesta y ofrecer a los desarrolladores descuentos de hasta el 90 % en los tokens de entrada almacenados en caché.
Con la familia GPT‑6, lanzamos un sistema mejorado de almacenamiento en caché de prompts que ofrece de forma predeterminada mayores tasas de aciertos de caché. Ahora ofrecemos descuentos de caché para los prefijos compartidos aptos que se reutilicen en un intervalo de 30 minutos. También presentamos nuevas herramientas que ayudan a los desarrolladores a supervisar el rendimiento de la caché, diagnosticar fallos y elegir qué parte de un prompt almacenar en caché.
El nuevo Panel de almacenamiento en caché de prompts(se abre en una ventana nueva) muestra qué proporción de la entrada de tu aplicación se sirve desde la caché. Consulta la evolución de las tasas de aciertos y usa el gráfico de composición de la entrada para comparar los tokens almacenados y no almacenados en caché. Estas vistas te ayudan a detectar descensos en los aciertos de caché y evaluar cómo afectan los cambios de tu aplicación al rendimiento del almacenamiento en caché.

Cuando detectes un fallo de caché inesperado, usa la herramienta de diagnóstico del almacenamiento en caché de prompts(se abre en una ventana nueva) para entender qué ha ocurrido. Compara una solicitud con una respuesta reciente para identificar los cambios en el modelo, las herramientas, la configuración o la entrada que impidieron la reutilización. El número estimado de tokens afectados te ayuda a valorar la magnitud del impacto y decidir cómo optimizar tu integración para maximizar las tasas de aciertos de caché.
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
Elige qué almacenar en caché. Los puntos de interrupción de caché explícitos te permiten elegir qué prefijos del prompt reutilizar. La guía actualizada sobre almacenamiento en caché de prompts(se abre en una ventana nueva) explica cómo usarlos, cuánto tiempo siguen siendo aptos los prefijos almacenados en caché y cómo afectan a su reutilización los cambios en las herramientas y las entradas.
Ajusta el esfuerzo de razonamiento sin invalidar la caché. En los modelos GPT‑6, ahora puedes cambiar el esfuerzo de razonamiento(se abre en una ventana nueva) entre respuestas sin invalidar la caché. Aumenta el esfuerzo para una tarea más difícil o redúcelo para un seguimiento rutinario añadiendo un configuration_update y manteniendo sin cambios el esfuerzo de razonamiento de la solicitud. Así puedes ajustar cuánto razonamiento requiere una tarea sin perder el contexto reutilizable.
Conserva la caché aunque cambien las herramientas y las instrucciones. A medida que cambien las herramientas que necesita tu agente, mantén estables sus definiciones, esquemas y orden para que el contexto anterior siga siendo reutilizable. Usa allowed_tools para que solo se puedan invocar las herramientas pertinentes, o establece tool_choice en none cuando no se necesiten herramientas, en lugar de eliminar las definiciones. Usa nuevos mensajes de desarrollador para añadir instrucciones nuevas al final del contexto y sustituir las anteriores. Consulta nuestras recomendaciones para gestionar los cambios en las herramientas(se abre en una ventana nueva).
Precarga la caché para reducir la latencia. La precarga(se abre en una ventana nueva) prepara con antelación el contexto conocido para que el modelo pueda empezar a responder antes cuando llegue una solicitud. Por ejemplo, una aplicación puede precargar instrucciones compartidas, definiciones de herramientas o material de referencia durante el inicio, antes de que el usuario formule su primera pregunta. Así, el procesamiento se realiza antes y no durante el tiempo de espera del usuario.
Estos controles opcionales complementan el rendimiento predeterminado del motor y te ayudan a adaptar el almacenamiento en caché a tu carga de trabajo.
Supervisa las tasas de aciertos de caché en el Panel de almacenamiento en caché de prompts(se abre en una ventana nueva).
Investiga los fallos inesperados con la herramienta de diagnóstico(se abre en una ventana nueva).
Sigue la guía sobre almacenamiento en caché de prompts(se abre en una ventana nueva) para mejorar tu configuración, o usa Codex(se abre en una ventana nueva) para revisar tu código, aplicar mejoras y medir los resultados.


