Pasar al contenido principal
OpenAI

10 de septiembre de 2026

ProductoLanzamiento

Crea experiencias de voz más naturales con GPT‑Live‑1 en la API

GPT‑Live‑1 lleva a la API las conversaciones naturales y en full duplex de ChatGPT con más control sobre cómo los agentes de voz hablan y actúan.

Cargando...

Lanzamos GPT‑Live‑1 en la API para ofrecer a los desarrolladores un potente modelo de voz natural con el que pueden crear aplicaciones de voz y flujos de trabajo empresariales. Presentado por primera vez en ChatGPT, GPT‑Live‑1 puede escuchar y hablar al mismo tiempo y, como se vio con Codex y ChatGPT Work⁠(se abre en una nueva ventana), puede delegar razonamientos más profundos y acciones a los modelos y las herramientas con los que se combina.

Para el lanzamiento de GPT‑Live‑1 en la API, nos enfocamos en nuevas capacidades que permiten a los desarrolladores controlar y personalizar las experiencias de voz según sus usuarios, flujos de trabajo y objetivos. Una fortaleza clave de GPT‑Live‑1, la gestión fluida de interrupciones, ya está generando impacto empresarial: en las primeras evaluaciones, Speak descubrió que GPT‑Live‑1 dio a los estudiantes más tiempo para pensar antes de que respondiera el tutor de idiomas, lo que redujo las interrupciones casi un 80 % frente a los sistemas anteriores basados en turnos.

Principales ventajas de GPT‑Live‑1 en la API:

  • Gestión de interrupciones: mejora la gestión de interrupciones mediante un solo modelo que razona conjuntamente sobre el audio entrante y saliente, lo que evita la latencia y las frágiles transferencias de las arquitecturas encadenadas STT–LLM–TTS.

  • Delegación de razonamiento y llamadas a herramientas: GPT‑Live‑1 puede delegar el razonamiento y las llamadas a herramientas a un modelo de texto de backend como GPT‑6 Astra o un modelo de terceros.

  • Tono, ritmo y estilo: permite a los desarrolladores definir el tono, el ritmo y el estilo conversacional de un agente mediante el prompt del sistema.

  • Gestión silenciosa del contexto y ruido de fondo: gestiona mejor el ruido de fondo y el silencio sin interrumpir la conversación ni narrar cada paso en voz alta.

  • Fiabilidad en sesiones largas: mejora la retención del contexto y la calidad de la conversación durante interacciones prolongadas.

  • Compatibilidad con telefonía: permite implementar agentes de voz full-duplex para llamadas telefónicas, desde reservaciones en restaurantes hasta atención al cliente.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Esta demostración es por tiempo limitado. Al usarla, aceptas los Términos de OpenAI y nuestra Política de privacidad.

Simplifica la arquitectura de tu agente de voz y reduce la latencia en las interacciones de voz

Los agentes de voz tradicionales conectan un sistema de voz a texto, un modelo de razonamiento y un sistema de texto a voz. Cada transferencia añade latencia y aumenta las posibilidades de perder la sincronización, el contexto o el ritmo natural de una conversación. A menudo, los desarrolladores deben coordinar esas etapas, incluso qué sucede cuando alguien interrumpe, hace una pausa o cambia de rumbo.

GPT‑Live‑1 gestiona la escucha y el habla en un solo modelo, lo que simplifica la capa de voz. Puede responder a las interrupciones y respuestas de asentimiento a medida que ocurren, mientras delega razonamientos más profundos al backend. Esto permite que la conversación continúe mientras el trabajo se realiza en segundo plano.

“En comparación con nuestra implementación en cascada, GPT‑Live‑1 simplificó nuestra base de código en un 80 % y eliminó 23 mil líneas de código. Esto hizo posibles conversaciones naturales con pacientes en tiempo real y permitió que nuestro equipo se concentrara en mejorar la experiencia, desde agendar una cita hasta orientarlos durante su atención.”
—Tony Stoyanov, cofundador y director de Tecnología

Los desarrolladores eligen los modelos, las herramientas y el arnés de ejecución del agente que respaldan la conversación. Por ejemplo, pueden combinar GPT‑Live‑1 con un modelo como Luna para tareas de gran volumen, como agendar citas o actualizar pedidos, y usar un modelo como Astra para problemas complejos de clientes que requieren razonamiento. Esa flexibilidad permite a los desarrolladores adaptar a cada tarea la profundidad del razonamiento, la velocidad y el costo.

GPT‑Live‑1 proporciona de forma nativa transcripciones de ASR y el texto de las respuestas. También ofrece una sólida comprensión alfanumérica y permite priorizar palabras clave. Aunque GPT‑Live‑1 no es un modelo basado en turnos, admite de forma nativa la detección de turnos, por lo que los desarrolladores pueden seguir desarrollando en torno a límites de turno explícitos.

Medir la ventaja del full-duplex

En nuestras evaluaciones, GPT‑Live‑1 mejora el rendimiento en Full Duplex Bench en 30 puntos porcentuales frente a GPT‑Realtime‑2.1, con grandes mejoras en la latencia en la alternancia de turnos y el comportamiento interactivo. Combinado con GPT‑6 Astra con un esfuerzo de razonamiento medio, también ocupa el puesto n.º 1 en Tau3, que mide la inteligencia de vanguardia de los agentes de voz en tareas de extremo a extremo.

Evalúa tareas de atención al cliente por voz en los dominios de aerolíneas, comercio minorista y telecomunicaciones. Pass@1 mide el éxito de las tareas; el resultado general asigna el mismo peso a cada dominio.


* Backend de GPT Live: Astra (medio).

Evalúa la asistencia bancaria por voz con recuperación de conocimiento y herramientas de cuentas. Pass@1 es la proporción de 97 tareas de banking_knowledge completadas correctamente.


* Backend de GPT Live: Astra (medio).

Evalúa la gestión de las pausas, los turnos de palabra, las interrupciones y las señales de escucha activa.

Prueba las reacciones al habla de fondo, al habla dirigida a otra persona, a las señales de escucha y a las interrupciones.

Mide qué tan rápido el agente comienza a responder después de que la persona usuaria termina un turno.

Evalúa el uso de herramientas a partir de solicitudes habladas con pausas naturales, vacilaciones y autocorrecciones. Pass@1 evalúa la secuencia de llamadas a herramientas.


* Backend de GPT Live: Terra (bajo).

Evalúa la respuesta hablada a solicitudes que usan herramientas y contienen pausas, vacilaciones y autocorrecciones. Califica qué tan bien coincide la respuesta con la intención de la respuesta de referencia.


* Backend de GPT Live: Terra (bajo).

Lo que dicen los clientes

1 de 4
“Incorporar GPT‑Live‑1 en Yelp Host y Hatch mejoró la alternancia de turnos y la precisión en comparación con nuestra arquitectura de voz tradicional. Cuando Yelp Host usa GPT‑Live‑1 para atender llamadas relacionadas con reservaciones y pedidos de comida, observamos mejoras significativas en las tasas de gestión de llamadas. Quienes llaman también hablan con frases más completas y naturales, lo que nos indica que la experiencia al otro lado del teléfono se siente realmente distinta.”
—Alex Levy, director de Tecnología

Nuevas opciones de voz

Los desarrolladores necesitan voces que se adapten a su producto y suenen naturales para quienes lo usan. Con GPT‑Live‑1, pasamos de un pequeño conjunto de voces en tiempo real a una selección más amplia de acentos, dialectos e idiomas, para que los desarrolladores tengan más opciones sobre cómo suenan sus asistentes.

Escucha las nuevas voces

Seguiremos ampliando las opciones de voz y la disponibilidad de idiomas durante los próximos meses.

Precios y disponibilidad

GPT‑Live‑1 ya está disponible hoy en la API⁠(se abre en una nueva ventana) a USD 0.05 por minuto para la capa de voz del frontend. Combínalo con el modelo de backend y la infraestructura de agentes que mejor se adapten a tu producto. Luego, crea una experiencia de voz que pueda escalar según el trabajo que deba realizar.

Conectar GPT-Live-1 con Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Conectar GPT-Live-1 con Codex. Este extracto muestra cómo una aplicación pasa el contexto de la conversación a Codex y devuelve su respuesta a GPT-Live-1. Se omiten la configuración de la conexión y la gestión de la delegación.

Para acceder a voces personalizadas, comunícate con el equipo de ventas y obtén más información sobre los requisitos y el proceso de solicitud.

Otra forma de crear flujos de trabajo de voz basados en GPT‑Live‑1 es con OpenAI Presence, que usa el modelo para impulsar interacciones de voz en tiempo real. Presence ayuda a las empresas a implementar agentes de IA confiables capaces de responder preguntas, resolver problemas, usar los sistemas de la empresa, ejecutar acciones aprobadas y derivar la conversación a una persona cuando sea necesario. Comunícate con tu director de cuenta de OpenAI para obtener más información.

Autor

OpenAI