Ir al contenido principal
OpenAI

22 de septiembre de 2026

Producto

Mejor almacenamiento en caché de prompts para GPT‑6

Más aciertos de caché y nuevas herramientas para que los agentes persistentes funcionen más rápido y cuesten menos.

Cargando…

GPT‑6 permite que los agentes persistentes trabajen durante horas en tareas complejas, desde refactorizar bases de código hasta elaborar documentos y presentaciones bien documentados. Las aplicaciones que sustentan estos agentes realizan una serie de solicitudes a la API que se apoyan unas en otras y suelen reutilizar las mismas instrucciones, definiciones de herramientas y contexto de turnos anteriores. OpenAI almacena en caché ese contexto compartido para reutilizar el procesamiento entre solicitudes, reducir los tiempos de respuesta y ofrecer a los desarrolladores descuentos de hasta el 90 % en los tokens de entrada almacenados en caché.

Con la familia GPT‑6, lanzamos un sistema mejorado de almacenamiento en caché de prompts que ofrece de forma predeterminada mayores tasas de aciertos de caché. Ahora ofrecemos descuentos de caché para los prefijos compartidos aptos que se reutilicen en un intervalo de 30 minutos. También presentamos nuevas herramientas que ayudan a los desarrolladores a supervisar el rendimiento de la caché, diagnosticar fallos y elegir qué parte de un prompt almacenar en caché.

El almacenamiento en caché de prompts de OpenAI desempeña un papel fundamental para que GitHub Copilot ofrezca experiencias rápidas y eficientes a gran escala. Durante los últimos meses, hemos reducido en más de un 50 % la proporción de tokens de prompts que requieren un nuevo procesamiento en miles de millones de solicitudes a modelos de OpenAI, respecto a nuestro valor de referencia anterior. El resultado es una infraestructura de inferencia más eficiente y una primera respuesta más rápida para los desarrolladores.
—Mario Rodriguez, director de producto

Supervisar el almacenamiento en caché y diagnosticar fallos de caché

El nuevo Panel de almacenamiento en caché de prompts(se abre en una ventana nueva) muestra qué proporción de la entrada de tu aplicación se sirve desde la caché. Consulta la evolución de las tasas de aciertos y usa el gráfico de composición de la entrada para comparar los tokens almacenados y no almacenados en caché. Estas vistas te ayudan a detectar descensos en los aciertos de caché y evaluar cómo afectan los cambios de tu aplicación al rendimiento del almacenamiento en caché.

Panel de almacenamiento en caché de prompts que muestra la tasa de aciertos de caché, el rendimiento de la caché a lo largo del tiempo y la composición de los tokens de entrada.

Cuando detectes un fallo de caché inesperado, usa la herramienta de diagnóstico del almacenamiento en caché de prompts(se abre en una ventana nueva) para entender qué ha ocurrido. Compara una solicitud con una respuesta reciente para identificar los cambios en el modelo, las herramientas, la configuración o la entrada que impidieron la reutilización. El número estimado de tokens afectados te ayuda a valorar la magnitud del impacto y decidir cómo optimizar tu integración para maximizar las tasas de aciertos de caché.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimizar el almacenamiento en caché para tu aplicación

Elige qué almacenar en caché. Los puntos de interrupción de caché explícitos te permiten elegir qué prefijos del prompt reutilizar. La guía actualizada sobre almacenamiento en caché de prompts(se abre en una ventana nueva) explica cómo usarlos, cuánto tiempo siguen siendo aptos los prefijos almacenados en caché y cómo afectan a su reutilización los cambios en las herramientas y las entradas.

Ajusta el esfuerzo de razonamiento sin invalidar la caché. En los modelos GPT‑6, ahora puedes cambiar el esfuerzo de razonamiento(se abre en una ventana nueva) entre respuestas sin invalidar la caché. Aumenta el esfuerzo para una tarea más difícil o redúcelo para un seguimiento rutinario añadiendo un configuration_update y manteniendo sin cambios el esfuerzo de razonamiento de la solicitud. Así puedes ajustar cuánto razonamiento requiere una tarea sin perder el contexto reutilizable.

Conserva la caché aunque cambien las herramientas y las instrucciones. A medida que cambien las herramientas que necesita tu agente, mantén estables sus definiciones, esquemas y orden para que el contexto anterior siga siendo reutilizable. Usa allowed_tools para que solo se puedan invocar las herramientas pertinentes, o establece tool_choice en none cuando no se necesiten herramientas, en lugar de eliminar las definiciones. Usa nuevos mensajes de desarrollador para añadir instrucciones nuevas al final del contexto y sustituir las anteriores. Consulta nuestras recomendaciones para gestionar los cambios en las herramientas(se abre en una ventana nueva).

Precarga la caché para reducir la latencia. La precarga(se abre en una ventana nueva) prepara con antelación el contexto conocido para que el modelo pueda empezar a responder antes cuando llegue una solicitud. Por ejemplo, una aplicación puede precargar instrucciones compartidas, definiciones de herramientas o material de referencia durante el inicio, antes de que el usuario formule su primera pregunta. Así, el procesamiento se realiza antes y no durante el tiempo de espera del usuario.

Estos controles opcionales complementan el rendimiento predeterminado del motor y te ayudan a adaptar el almacenamiento en caché a tu carga de trabajo.

1 de 3
Los diagnósticos y el panel de almacenamiento en caché de prompts de OpenAI nos ayudaron a mejorar en varios puntos porcentuales las tasas de aciertos de caché, lo que redujo los costes un 20 %. Ahora recibimos alertas cuando el almacenamiento en caché deja de funcionar de forma inesperada y usamos agentes de Codex para diagnosticar la causa raíz. Los puntos de interrupción explícitos también nos permiten almacenar en caché el contexto estable y mantener al final del prompt el contenido que cambia con frecuencia. Así, resulta económicamente viable hacer fork de conversaciones para tareas en segundo plano y reutilizar casi todo el contexto compartido.
—Arian Hanifi, director de tecnología

Primeros pasos

Autor

OpenAI