Pasar al contenido principal
OpenAI

22 de septiembre de 2026

Producto

Mejor almacenamiento en caché de prompts para GPT‑6

Mayores tasas de aciertos de caché y nuevas herramientas para que los agentes persistentes funcionen más rápido y cuesten menos.

Cargando...

GPT‑6 permite que los agentes persistentes trabajen durante horas en tareas complejas, desde refactorizar bases de código hasta crear documentos y presentaciones con una investigación exhaustiva. Las aplicaciones que respaldan a estos agentes realizan una serie de solicitudes a la API que se basan unas en otras y suelen conservar las mismas instrucciones, definiciones de herramientas y contexto de turnos anteriores. OpenAI almacena ese contexto compartido en caché para reutilizar el procesamiento entre solicitudes, reducir los tiempos de respuesta y ofrecer a los desarrolladores descuentos de hasta el 90 % en los tokens de entrada almacenados en caché.

Con la familia GPT‑6, lanzamos un sistema mejorado de almacenamiento en caché de prompts que ofrece mayores tasas de aciertos de forma predeterminada. Ahora ofrecemos descuentos de caché para los prefijos compartidos aptos que se reutilicen dentro de un periodo de 30 minutos. También presentamos nuevas herramientas para ayudar a los desarrolladores a supervisar el rendimiento de la caché, diagnosticar fallos y elegir qué parte de un prompt almacenar en caché.

El almacenamiento en caché de prompts de OpenAI es fundamental para que GitHub Copilot ofrezca experiencias rápidas y eficientes a gran escala. En los últimos meses, redujimos en más del 50 % la proporción de tokens de prompts que requieren procesamiento nuevo en miles de millones de solicitudes a modelos de OpenAI, respecto de nuestro valor de referencia anterior. El resultado es una infraestructura de inferencia más eficiente y un menor tiempo hasta la primera respuesta para los desarrolladores.
—Mario Rodriguez, director de producto

Supervisar el almacenamiento en caché y diagnosticar fallos de caché

El nuevo Panel de almacenamiento en caché de prompts(se abre en una nueva ventana) muestra qué proporción de la entrada de tu aplicación se obtiene de la caché. Consulta las tasas de aciertos a lo largo del tiempo y usa el gráfico de composición de la entrada para comparar los tokens almacenados y no almacenados en caché. Estas vistas te ayudan a detectar caídas en los aciertos de caché y evaluar cómo afectan los cambios en tu aplicación al rendimiento del almacenamiento en caché.

Panel de almacenamiento en caché de prompts que muestra la tasa de aciertos de caché, el rendimiento de la caché a lo largo del tiempo y la composición de los tokens de entrada.

Cuando detectes un fallo inesperado de caché, usa la herramienta de diagnóstico del almacenamiento en caché de prompts(se abre en una nueva ventana) para entender qué ocurrió. Compara una solicitud con una respuesta reciente para identificar los cambios en el modelo, las herramientas, la configuración o la entrada que impidieron su reutilización. La cantidad estimada de tokens afectados te ayuda a evaluar la magnitud del impacto y decidir cómo optimizar tu integración para maximizar las tasas de aciertos de caché.

{
  "prompt_cache_diagnostics": {
    "type": "cache_miss",
    "reason": "tools_changed",
    "comparison_reusable_tokens": 5629,
    "cache_missed_tokens": 5629
  }
}

Optimizar el almacenamiento en caché para tu aplicación

Elige qué almacenar en caché. Los puntos de interrupción explícitos de caché te permiten elegir qué prefijos de prompts reutilizar. La guía actualizada sobre almacenamiento en caché de prompts(se abre en una nueva ventana) explica cómo usarlos, cuánto tiempo siguen siendo aptos los prefijos almacenados en caché y cómo afectan los cambios en las herramientas y las entradas a la reutilización.

Ajusta el esfuerzo de razonamiento sin invalidar la caché. En los modelos GPT‑6, ahora puedes cambiar el esfuerzo de razonamiento(se abre en una nueva ventana) entre respuestas sin invalidar la caché. Aumenta el esfuerzo para una tarea más difícil o redúcelo para un seguimiento rutinario agregando un configuration_update, sin modificar el esfuerzo de razonamiento en el nivel de la solicitud. Esto te permite ajustar cuánto razonamiento necesita una tarea sin perder el contexto reutilizable.

Conserva la caché cuando cambien las herramientas y las instrucciones. A medida que cambien las necesidades de uso de herramientas de tu agente, mantén estables sus definiciones, esquemas y orden para que el contexto anterior siga siendo reutilizable. Usa allowed_tools para que solo se puedan invocar las herramientas pertinentes o configura tool_choice como none cuando no se necesiten herramientas, en lugar de eliminar las definiciones. Usa nuevos mensajes de desarrollador para agregar instrucciones nuevas hacia el final del contexto y reemplazar las anteriores. Consulta nuestra guía para administrar los cambios en las herramientas(se abre en una nueva ventana).

Precalienta la caché para reducir la latencia. El precalentamiento(se abre en una nueva ventana) prepara de antemano el contexto conocido para que el modelo pueda comenzar a responder antes cuando llegue una solicitud. Por ejemplo, una aplicación puede precalentar las instrucciones compartidas, las definiciones de herramientas o el material de referencia durante el inicio, antes de que el usuario haga su primera pregunta. Así, el procesamiento se realiza fuera del tiempo de espera del usuario.

Estos controles opcionales complementan el rendimiento predeterminado del motor y te ayudan a adaptar el almacenamiento en caché a tu carga de trabajo.

1 de 3
Los diagnósticos y el panel de almacenamiento en caché de prompts de OpenAI nos ayudaron a aumentar unos puntos porcentuales las tasas de aciertos de caché y a reducir los costos un 20 %. Ahora recibimos alertas cuando el almacenamiento en caché falla de forma inesperada y usamos agentes de Codex para diagnosticar la causa raíz. Los puntos de interrupción explícitos también nos permiten almacenar en caché el contexto estable y mantener al final del prompt el contenido que cambia con frecuencia. Gracias a esto, ahora es económicamente viable hacer fork de conversaciones para tareas en segundo plano y reutilizar casi todo el contexto compartido.
—Arian Hanifi, director de tecnología

Comenzar

Autor

OpenAI