Guía de modelos de la familia GPT‑6
Consejos prácticos para obtener los mejores resultados con los modelos GPT‑6 y gestionar el tiempo y los costos
GPT‑6 es nuestro conjunto de modelos más avanzado hasta ahora y te ofrece modelos para distintos tipos de trabajo.
Ya sea que conviertas una idea en un prototipo funcional, desarrolles y pruebes una función u orquestes flujos de trabajo de varios pasos entre repositorios de código, bases de datos y API externas, esta guía explica cómo elegir un modelo GPT‑6, darle instrucciones eficaces, gestionar tareas de larga duración y prepararte para la producción.

Opera con eficacia en producción. Usa el almacenamiento en caché(se abre en una nueva ventana) y la compactación(se abre en una nueva ventana) para gestionar el contexto y los costos. Mide el éxito de las tareas y la latencia, y planifica el monitoreo y los controles de datos.
Elige el modelo según tu carga de trabajo. Equilibra capacidad, costo y latencia al elegir el modelo, el esfuerzo de razonamiento(se abre en una nueva ventana) y la velocidad adecuados para la tarea.
Ajusta tus prompts y habilidades. Asegúrate de que los prompts, las habilidades y las instrucciones del repositorio coincidan en qué debe entregar el modelo, qué puede hacer de forma independiente y cuándo se considera terminado el trabajo.
Mantén el rumbo en las tareas de larga duración. Usa la orientación(se abre en una nueva ventana), las herramientas asíncronas(se abre en una nueva ventana) y la delegación(se abre en una nueva ventana) para gestionar actualizaciones y tareas independientes. Define con claridad cuándo el modelo debe pedirte indicaciones.
Antes de implementar, conviene establecer varias comprobaciones y buenas prácticas.
Ten en cuenta la eficiencia. Elimina el contexto innecesario para la tarea(se abre en una nueva ventana), pero conserva la evidencia que sí necesita. Si tu aplicación lo permite, ejecuta tareas independientes a la vez(se abre en una nueva ventana) para que un paso lento no retrase tareas no relacionadas.
Reutiliza el contexto compartido mediante el almacenamiento en caché de prompts(se abre en una nueva ventana) para tareas recurrentes. Los tokens de entrada en caché cuestan hasta un 95 % menos(se abre en una nueva ventana) que los que no están en caché, según el modelo. Coloca las instrucciones estables y el material de referencia antes de los detalles variables de la tarea, y mantén consistentes las definiciones de las herramientas. El panel de almacenamiento en caché(se abre en una nueva ventana) y la guía de diagnóstico(se abre en una nueva ventana) te ayudan a identificar dónde falla esa reutilización. Incluye las escrituras en caché y las tarifas por contexto largo al estimar el costo de un flujo de trabajo completo.
Para conversaciones más largas, la compactación(se abre en una nueva ventana) reduce el tamaño del contexto y conserva el estado necesario para continuar.
Decide cómo vas a monitorear el comportamiento(se abre en una nueva ventana) y revisa los controles de datos(se abre en una nueva ventana) de tu aplicación.
Prueba antes de implementar: ejecuta tareas representativas y mide el éxito, la latencia y el costo por tarea exitosa. Consulta nuestra lista de verificación para implementar la API(se abre en una nueva ventana).
Al elegir el modelo y el nivel de razonamiento, busca un equilibrio entre inteligencia y precio.
Modelo:
GPT‑6 Astra(se abre en una nueva ventana) para las tareas de razonamiento más difíciles que requieren la máxima inteligencia.
GPT‑6.1 Sol(se abre en una nueva ventana) para tareas complejas de programación, investigación y uso de computadora.
GPT‑6 Luna(se abre en una nueva ventana) para tareas específicas a gran escala y trabajo cotidiano repetitivo con un objetivo claro, como extraer campos de facturas, clasificar solicitudes o generar resúmenes estructurados.
Al evaluar qué modelo es mejor para la tarea, compara los precios(se abre en una nueva ventana) de cada uno.
Nivel de razonamiento: en la API, elige cuánto esfuerzo dedica el modelo a la tarea.
Bajo: tareas rutinarias, como extraer datos o hacer pequeñas ediciones.
Medio: tareas que requieren criterio, como planificar una función o comparar opciones.
Alto: depuración difícil, análisis más profundo o revisión minuciosa.
Muy alto/Máx.: pruébalos si están disponibles cuando Alto no sea suficiente, y consérvalos solo si la mejora justifica el tiempo y el costo adicionales.
En la API, puedes cambiar el esfuerzo de razonamiento durante la conversación(se abre en una nueva ventana) sin invalidar la caché.
En Codex, comienza con el nivel de razonamiento predeterminado del modelo; luego, redúcelo para tareas más simples o auméntalo para análisis más profundos.
Velocidad:
En la API, usa el Modo rápido(se abre en una nueva ventana) cuando el tiempo de respuesta sea importante, como en apps de chat o herramientas de programación. Ofrece tiempos de respuesta más rápidos y consistentes, con un costo por token mayor que el procesamiento estándar.
En Codex y la API, usa Ultrarrápido(se abre en una nueva ventana) cuando la rapidez de respuesta justifique el costo adicional, como en iteraciones rápidas de código. Acelera la generación de tokens independientemente del esfuerzo de razonamiento. Disponible para GPT‑6 Astra(se abre en una nueva ventana).

Comienza con una tarea clara: el resultado que buscas, para quién es, el contexto y las restricciones pertinentes, y cuándo se considera terminada. Luego revisa estas cuatro áreas, resumidas de Replantear las habilidades y los prompts para GPT‑6 Astra(se abre en una nueva ventana), para profundizar en cómo actualizar tus instrucciones:
Crea mejores habilidades: usa descripciones breves y explícitas sobre cuándo debe ejecutarse cada habilidad, carga detalles de apoyo solo cuando hagan falta y reemplaza las recetas rígidas por pautas adecuadas para los modelos de tu equipo.
Actualiza tu AGENTS.md: explica cuándo son pertinentes ciertos documentos y pruebas, y autoriza explícitamente flujos de trabajo rutinarios seguros, como ejecutar pruebas locales con datos desechables y sin acceso a producción.
Define límites para las decisiones: indica qué acciones pueden realizarse de forma independiente y cuáles requieren aprobación; reemplaza las reglas generales de "preguntar siempre" por límites claros.
Especifica hasta dónde debe continuar: define qué significa "terminado" —implementar el cambio, ejecutarlo, revisar el resultado y corregir fallas— e identifica las decisiones que requieren tu revisión.
Para obtener más orientación, consulta las buenas prácticas de razonamiento(se abre en una nueva ventana).
Ya sea que trabajes en Codex o desarrolles con la API, especifica qué decisiones puede tomar el modelo, cuándo debe pedirte indicaciones y cómo debe ser una respuesta útil.
Dale al modelo orientación suficiente para que el trabajo avance sin tener que adivinar en decisiones importantes. Dile qué decisiones puede tomar y cuándo debe consultarte(se abre en una nueva ventana); por ejemplo, puede elegir cómo organizar un resumen, pero debe consultarte antes de cambiar el alcance del proyecto. Describe cómo debe ser una respuesta útil(se abre en una nueva ventana): por ejemplo, lenguaje sencillo, detalles técnicos adecuados para tu audiencia y un breve informe final sobre qué cambió, qué se comprobó y qué sigue pendiente.
Con la familia de modelos GPT‑6, ahora puedes abordar tareas que duran horas o días. Usa las siguientes funciones para gestionar mejor los agentes en tareas de larga duración.
En la API, usa la orientación, las herramientas asíncronas y el trabajo en paralelo para mantener el avance de las tareas de larga duración.
Actualiza las instrucciones durante la ejecución: la orientación a mitad de turno(se abre en una nueva ventana) te permite enviar una corrección mediante la API WebSocket de Responses(se abre en una nueva ventana) mientras el modelo trabaja. Las actualizaciones se ponen en cola; no cancelan las herramientas en ejecución ni deshacen acciones completadas.
Sigue trabajando mientras se ejecuta una herramienta: las llamadas asíncronas a herramientas(se abre en una nueva ventana) permiten que el modelo continúe con tareas independientes mientras tu app ejecuta una tarea más lenta, como las pruebas. Tu app devuelve el resultado cuando está listo. Espera ese resultado antes de iniciar tareas que dependan de él.
Delega subtareas independientes: GPT‑6.1 Sol admite flujos de trabajo multiagente en la API de Responses(se abre en una nueva ventana). Puede asignar tareas independientes a subagentes (como investigar distintas partes de una base de código) y combinar sus hallazgos en una respuesta final. La función multiagente está actualmente en fase beta.
Las tareas de larga duración pueden plantear decisiones que no necesariamente anticiparías en el prompt inicial. Usa las aclaraciones y la orientación para mantener el trabajo en el rumbo previsto.
Responde preguntas a medida que avanza el trabajo: con GPT‑6 Astra, Codex puede pedir aclaraciones mientras trabaja(se abre en una nueva ventana). Resuelve las dudas que afecten el siguiente paso y especifica qué tareas independientes pueden continuar mientras decides. Si no vas a estar disponible, dile a Codex qué tareas pueden continuar y cuándo debe detenerse a esperar tu respuesta.
Reorienta el trabajo cuando cambien los requisitos: orienta la tarea en curso(se abre en una nueva ventana) con información nueva y explica qué debe cambiar y qué debe mantenerse igual. Esto ayuda a evitar que se dedique más tiempo a un enfoque que ya no satisface tus necesidades.

El uso de computadora(se abre en una nueva ventana) permite que GPT‑6 Astra, GPT‑6.1 Sol y GPT‑6 Luna interactúen directamente con sitios web y apps de escritorio, incluso con aplicaciones sin API. Por ejemplo, puedes pedirle al modelo que investigue un error, corrija el código y abra tu producto en un navegador para comprobar que la corrección funciona.
Elige la forma más sencilla y confiable de realizar cada paso:
Usa una API o una herramienta conectada cuando pueda realizar la tarea directamente.
Recurre al uso de computadora cuando el modelo necesite leer una pantalla, hacer clic en botones o completar un formulario por ti.
Si integras el uso de computadora en tu propia app, dale al modelo una herramienta capaz de ejecutar código para controlar un navegador o un escritorio. Playwright funciona con navegadores(se abre en una nueva ventana); PyAutoGUI, con apps de escritorio.



