Guía de modelos de la familia GPT‑6
Consejos prácticos para sacar el máximo partido a los modelos GPT‑6 y gestionar el tiempo y el coste
GPT‑6 es nuestro conjunto de modelos más avanzado hasta la fecha y te permite elegir entre varios modelos para distintos tipos de trabajo.
Tanto si conviertes una idea en un prototipo funcional como si desarrollas y pruebas una función u orquestas flujos de trabajo de varios pasos entre repositorios de código, bases de datos y API externas, esta guía explica cómo elegir un modelo GPT‑6, darle instrucciones eficaces, gestionar tareas de larga duración y preparar el paso a producción.

Trabaja con eficacia en producción. Usa el almacenamiento en caché(se abre en una ventana nueva) y la compactación(se abre en una ventana nueva) para gestionar el contexto y el coste. Mide el éxito de las tareas y la latencia, y planifica la supervisión y los controles de datos.
Elige el modelo según tu carga de trabajo. Equilibra capacidad, coste y latencia eligiendo el modelo, el esfuerzo de razonamiento(se abre en una ventana nueva) y la velocidad adecuados para la tarea.
Ajusta tus prompts y habilidades. Mantén la coherencia entre los prompts, las habilidades y las instrucciones del repositorio sobre qué debe entregar el modelo, qué puede hacer por su cuenta y cuándo se considera terminada la tarea.
Mantén el rumbo en las tareas de larga duración. Usa la orientación(se abre en una ventana nueva), las herramientas asíncronas(se abre en una ventana nueva) y la delegación(se abre en una ventana nueva) para gestionar cambios y tareas independientes. Define claramente cuándo debe pedirte indicaciones el modelo.
Antes del despliegue, conviene aplicar varias comprobaciones y buenas prácticas.
Ten presente la eficiencia. (se abre en una ventana nueva)Elimina el contexto que la tarea no necesite(se abre en una ventana nueva) y conserva las evidencias necesarias. Si tu aplicación lo permite, ejecuta tareas independientes en paralelo(se abre en una ventana nueva) para que un paso lento no bloquee tareas no relacionadas.
Reutiliza el contexto compartido mediante el almacenamiento en caché de prompts(se abre en una ventana nueva) para tareas recurrentes. Los tokens de entrada en caché cuestan hasta un 95 % menos(se abre en una ventana nueva) que los que no están en caché, según el modelo. Coloca las instrucciones estables y el material de referencia antes de los detalles variables de la tarea, y mantén coherentes las definiciones de las herramientas. El panel de caché(se abre en una ventana nueva) y la guía de diagnóstico(se abre en una ventana nueva) te ayudan a detectar dónde falla esa reutilización. Incluye las escrituras en caché y las tarifas por contextos largos al estimar el coste de un flujo de trabajo completo.
En conversaciones más largas, la compactación(se abre en una ventana nueva) reduce el tamaño del contexto y conserva el estado necesario para continuar.
Decide cómo vas a supervisar el comportamiento(se abre en una ventana nueva) y revisa los controles de datos(se abre en una ventana nueva) de tu aplicación.
Haz pruebas antes del despliegue: ejecuta tareas representativas y mide el éxito, la latencia y el coste por tarea completada con éxito. Consulta nuestra lista de comprobación para el despliegue con la API(se abre en una ventana nueva).
Al elegir el modelo y el nivel de razonamiento, busca un equilibrio entre inteligencia y precio.
Modelo:
GPT‑6 Astra(se abre en una ventana nueva) para las tareas de razonamiento más difíciles, que requieren la máxima inteligencia.
GPT‑6.1 Sol(se abre en una ventana nueva) para tareas complejas de programación, investigación y uso del ordenador.
GPT‑6 Luna(se abre en una ventana nueva) para tareas específicas a gran escala y trabajo cotidiano y repetitivo con un objetivo claro, como extraer campos de facturas, clasificar solicitudes o generar resúmenes estructurados.
Al evaluar qué modelo es el mejor para la tarea, compara los precios(se abre en una ventana nueva) de cada uno.
Nivel de razonamiento: en la API, elige cuánto esfuerzo dedica el modelo a la tarea.
Baja: tareas rutinarias, como extraer datos o hacer pequeños cambios.
Media: tareas que requieren criterio, como planificar una función o comparar opciones.
Alta: depuración difícil, análisis más profundos o revisiones minuciosas.
Muy alta / Max: prueba estas opciones, si están disponibles, cuando Alta no baste, y consérvalas solo si la mejora justifica el tiempo y el coste adicionales.
En la API, puedes cambiar el esfuerzo de razonamiento durante la conversación(se abre en una ventana nueva) sin invalidar la caché.
En Codex, empieza con el nivel de razonamiento predeterminado del modelo; después, redúcelo para tareas más sencillas o auméntalo para análisis más profundos.
Velocidad:
En la API, usa el Modo rápido(se abre en una ventana nueva) cuando importe el tiempo de respuesta, por ejemplo, en aplicaciones de chat o herramientas de programación. Ofrece tiempos de respuesta más rápidos y constantes, con un coste por token mayor que el procesamiento estándar.
En Codex y la API, usa el modo Ultrarrápido(se abre en una ventana nueva) cuando la rapidez de respuesta compense el coste adicional, como en iteraciones rápidas de programación. Acelera la generación de tokens con independencia del esfuerzo de razonamiento. Disponible para GPT‑6 Astra(se abre en una ventana nueva).

—Eric Provencher, Experiencia de Desarrolladores en OpenAI
Empieza con un encargo claro: qué resultado quieres, a quién va dirigido, el contexto y las restricciones pertinentes, y cuándo se considera terminado. Después, revisa estas cuatro áreas, resumidas a partir de Replantear las habilidades y los prompts para GPT‑6 Astra(se abre en una ventana nueva), para profundizar en cómo actualizar tus instrucciones:
Crea mejores habilidades: describe de forma breve y explícita cuándo debe ejecutarse cada habilidad, carga los detalles de apoyo solo cuando hagan falta y sustituye las recetas rígidas por pautas adaptadas a los modelos que usa tu equipo.
Actualiza tu AGENTS.md: explica cuándo son pertinentes determinados documentos y pruebas, y autoriza explícitamente los flujos rutinarios seguros, como ejecutar pruebas locales con datos desechables y sin acceso a producción.
Fija los límites de decisión: indica qué acciones pueden realizarse de forma autónoma y cuáles requieren aprobación, sustituyendo reglas generales como «pregunta siempre» por límites claros.
Especifica hasta dónde debe continuar: define qué implica «terminado» —implementar el cambio, ejecutarlo, inspeccionar el resultado y corregir fallos— e identifica las decisiones que requieren tu revisión.
Para más orientación, consulta las buenas prácticas de razonamiento(se abre en una ventana nueva).
Tanto si trabajas en Codex como si desarrollas con la API, especifica qué decisiones puede tomar el modelo, cuándo debe pedirte indicaciones y cómo debe ser una respuesta útil.
Dale al modelo suficientes indicaciones para avanzar sin tener que adivinar qué hacer ante decisiones importantes. (se abre en una ventana nueva)Dile qué decisiones puede tomar y cuándo debe consultarte(se abre en una ventana nueva); por ejemplo, puede elegir cómo organizar un resumen, pero debe preguntarte antes de cambiar el alcance del proyecto. (se abre en una ventana nueva)Describe cómo debe ser una respuesta útil(se abre en una ventana nueva); por ejemplo, un lenguaje sencillo, un nivel de detalle técnico adaptado al público y un breve resumen final de los cambios, las comprobaciones y lo que queda pendiente.
Con la familia de modelos GPT‑6, ahora puedes abordar tareas que duran horas o días. Usa las siguientes funciones para gestionar mejor los agentes en tareas de larga duración.
En la API, usa la orientación, las herramientas asíncronas y el trabajo en paralelo para que las tareas de larga duración sigan avanzando.
Actualiza las instrucciones durante la ejecución: la orientación durante el turno(se abre en una ventana nueva) te permite enviar una corrección a través de la API WebSocket de Responses(se abre en una ventana nueva) mientras el modelo trabaja. Las actualizaciones se ponen en cola; no cancelan las herramientas en ejecución ni deshacen las acciones completadas.
Sigue trabajando mientras se ejecuta una herramienta: las llamadas asíncronas a herramientas(se abre en una ventana nueva) permiten al modelo continuar con tareas independientes mientras tu aplicación ejecuta una tarea más lenta, como unas pruebas. Tu aplicación devuelve el resultado cuando está listo. Espera a recibir ese resultado antes de iniciar tareas que dependan de él.
Delega subtareas independientes: GPT‑6.1 Sol admite flujos de trabajo multiagente en la API Responses(se abre en una ventana nueva). Puede asignar tareas independientes a subagentes (como investigar distintas partes de una base de código) y combinar sus conclusiones en una respuesta final. La función multiagente está actualmente en fase beta.
Las tareas de larga duración pueden plantear decisiones que no habías previsto en el prompt inicial. Usa las aclaraciones y la orientación para mantener el trabajo bien encaminado.
Responde a las preguntas a medida que avanza el trabajo: con GPT‑6 Astra, Codex puede pedir aclaraciones mientras trabaja(se abre en una ventana nueva). Resuelve las dudas que afecten al siguiente paso y especifica qué tareas independientes pueden continuar mientras decides. Si vas a ausentarte, dile a Codex qué tareas pueden continuar y cuándo debe detenerse a esperar tu respuesta.
Reorienta el trabajo cuando cambien los requisitos: Guía la tarea activa(se abre en una ventana nueva) con nueva información, explicando qué debe cambiar y qué debe seguir igual. Así evitarás dedicar más tiempo a un enfoque que ya no responde a tus necesidades.

El uso del ordenador(se abre en una ventana nueva) permite a GPT‑6 Astra, GPT‑6.1 Sol y GPT‑6 Luna interactuar directamente con sitios web y aplicaciones de escritorio, incluso si no tienen una API. Por ejemplo, puedes pedir al modelo que investigue un fallo, corrija el código y abra tu producto en un navegador para comprobar que la solución funciona.
Elige la forma más sencilla y fiable de realizar cada paso:
Usa una API o una herramienta conectada si puede realizar la tarea directamente.
Recurre al uso del ordenador cuando el modelo necesite leer una pantalla, hacer clic en botones o rellenar un formulario por ti.
Si integras el uso del ordenador en tu propia aplicación, dale al modelo una herramienta capaz de ejecutar código para controlar un navegador o un escritorio. Playwright funciona con navegadores(se abre en una ventana nueva); PyAutoGUI, con aplicaciones de escritorio.



