Ir al contenido principal
OpenAI

10 de septiembre de 2026

ProductoLanzamiento

Crear experiencias de voz más naturales con GPT‑Live‑1 en la API

GPT‑Live‑1 lleva a la API las conversaciones naturales y en full-duplex de ChatGPT con más control sobre cómo los agentes de voz hablan y actúan.

Cargando…

Lanzamos GPT‑Live‑1 en la API para ofrecer a los desarrolladores un modelo de voz potente y natural con el que crear aplicaciones con funciones de voz y flujos de trabajo empresariales. GPT‑Live‑1, que se presentó primero en ChatGPT, puede escuchar y hablar al mismo tiempo y, como se ha visto con Codex y ChatGPT Work⁠(se abre en una ventana nueva), puede delegar razonamientos y acciones más profundos en los modelos y las herramientas con los que se combina.

Para el lanzamiento de GPT‑Live‑1 en la API, nos hemos centrado en nuevas prestaciones que permiten a los desarrolladores orientar y personalizar las experiencias de voz en torno a sus usuarios, flujos de trabajo y objetivos. Una ventaja clave de GPT‑Live‑1, la gestión fluida de las interrupciones, ya está generando impacto empresarial: en sus primeras evaluaciones, Speak comprobó que GPT‑Live‑1 daba a los alumnos más tiempo para pensar antes de que respondiera el tutor de idiomas, reduciendo casi un 80 % las interrupciones respecto a los sistemas anteriores basados en turnos.

Puntos fuertes principales de GPT‑Live‑1 en la API:

  • Gestión de interrupciones: mejora la gestión de interrupciones mediante un solo modelo que razona conjuntamente sobre el audio entrante y saliente, lo que evita la latencia y las frágiles transferencias de las arquitecturas encadenadas STT–LLM–TTS.

  • Delegación de razonamiento y llamadas a herramientas: GPT‑Live‑1 puede delegar el razonamiento y las llamadas a herramientas en un modelo de texto de backend como GPT‑6 Astra o un modelo de terceros.

  • Tono, ritmo y estilo: permite a los desarrolladores definir el tono, el ritmo y el estilo conversacional de un agente mediante el prompt del sistema.

  • Gestión silenciosa del contexto y ruido de fondo: gestiona mejor el ruido de fondo y los silencios sin interrumpir la conversación ni narrar cada paso en voz alta.

  • Fiabilidad en sesiones largas: mejora la conservación del contexto y la calidad de la conversación durante interacciones prolongadas.

  • Compatibilidad con telefonía: permite implementar agentes de voz full-duplex para llamadas telefónicas, desde reservas en restaurantes hasta atención al cliente.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Esta demostración tiene una duración limitada. Al usarla, aceptas los Términos de OpenAI y nuestra Política de privacidad.

Simplificar la arquitectura de tu agente de voz y reducir la latencia de voz

Los agentes de voz tradicionales combinan la conversión de voz a texto, un modelo de razonamiento y la conversión de texto a voz. Cada transición añade latencia y aumenta el riesgo de perder la coordinación, el contexto o el ritmo natural de una conversación. A menudo, los desarrolladores deben coordinar esas etapas, incluido lo que ocurre cuando alguien interrumpe, hace una pausa o cambia de dirección.

GPT‑Live‑1 gestiona la escucha y el habla en un solo modelo, lo que simplifica la capa de voz. Puede responder a las interrupciones y respuestas de asentimiento a medida que ocurren, mientras delega razonamientos más profundos al backend. Esto permite que la conversación continúe mientras el trabajo se realiza en segundo plano.

“En comparación con nuestra implementación en cascada, GPT‑Live‑1 simplificó nuestra base de código en un 80 % y eliminó 23 000 líneas de código. Esto permitió mantener conversaciones naturales y en tiempo real con los pacientes y liberó a nuestro equipo para mejorar la experiencia, desde reservar una cita hasta orientarse en la atención sanitaria.”
—Tony Stoyanov, cofundador y director de Tecnología

Los desarrolladores eligen los modelos, las herramientas y el arnés de agente que hay detrás de la conversación. Por ejemplo, pueden combinar GPT‑Live‑1 con un modelo como Luna para tareas de gran volumen, como la programación de citas o las actualizaciones de pedidos, y usar un modelo como Astra para problemas complejos de clientes que requieran razonamiento. Esta flexibilidad permite a los desarrolladores ajustar la profundidad del razonamiento, la velocidad y el coste a cada tarea.

GPT‑Live‑1 proporciona de forma nativa transcripciones ASR y el texto de las respuestas. También ofrece una sólida comprensión alfanumérica y admite la priorización de palabras clave. Aunque GPT‑Live‑1 no es un modelo basado en turnos, admite de forma nativa la detección de turnos, por lo que los desarrolladores pueden seguir creando experiencias en torno a límites de turno explícitos.

Medir la ventaja del full-duplex

En nuestras evaluaciones, GPT‑Live‑1 mejora el rendimiento en Full Duplex Bench en 30 puntos porcentuales frente a GPT‑Realtime‑2.1, con grandes mejoras en la latencia en la alternancia de turnos y el comportamiento interactivo. Combinado con GPT‑6 Astra con un esfuerzo de razonamiento medio, también ocupa el puesto n.º 1 en Tau3, que mide la inteligencia de vanguardia de los agentes de voz en tareas de extremo a extremo.

Evalúa tareas de atención al cliente mediante voz en los sectores de las aerolíneas, el comercio minorista y las telecomunicaciones. Pass@1 mide el éxito de las tareas; el resultado global asigna el mismo peso a cada ámbito.


* Backend de GPT Live: Astra (medio).

Evalúa la asistencia bancaria mediante voz con recuperación de conocimiento y herramientas de cuenta. Pass@1 es la proporción de las 97 tareas banking_knowledge que se completan con éxito.


* Backend de GPT Live: Astra (medio).

Evalúa la gestión de las pausas, los turnos de conversación, las interrupciones y las señales de seguimiento.

Prueba las reacciones al habla de fondo, al habla dirigida a otra persona, a las señales de escucha y a las interrupciones.

Mide la rapidez con la que el agente empieza a responder después de que el usuario termine su turno.

Evalúa el uso de herramientas a partir de solicitudes mediante voz que contienen pausas naturales, vacilaciones y autocorrecciones. Pass@1 puntúa la secuencia de llamadas a herramientas.


* Backend de GPT Live: Terra (bajo).

Evalúa la respuesta mediante voz a solicitudes que usan herramientas y que contienen pausas, vacilaciones y autocorrecciones. Puntúa en qué medida la respuesta coincide con la intención de referencia.


* Backend de GPT Live: Terra (bajo).

Qué dicen los clientes

1 de 4
“Incorporar GPT‑Live‑1 en Yelp Host y Hatch mejoró la alternancia de turnos y la precisión en comparación con nuestra arquitectura de voz tradicional. Cuando Yelp Host usa GPT‑Live‑1 para atender llamadas relacionadas con reservaciones y pedidos de comida, observamos mejoras significativas en las tasas de gestión de llamadas. Quienes llaman también hablan con frases más completas y naturales, lo que nos indica que la experiencia al otro lado del teléfono se percibe como realmente diferente.”
—Alex Levy, director de Tecnología

Nuevas opciones de voz

Los desarrolladores necesitan voces que encajen con su producto y suenen naturales para quienes lo usan. Con GPT‑Live‑1, pasamos de un pequeño conjunto de voces en tiempo real a una selección más amplia de acentos, dialectos e idiomas, para que los desarrolladores puedan elegir mejor cómo suenan sus asistentes.

Escuchar las nuevas voces

Durante los próximos meses, seguiremos ampliando las opciones de voz y la disponibilidad de idiomas.

Precios y disponibilidad

GPT‑Live‑1 ya está disponible en la API⁠(se abre en una ventana nueva) por 0,05 USD por minuto para la capa de voz del frontend. Combínalo con el modelo de backend y el arnés de agente que mejor se adapten a tu producto y crea una experiencia de voz que pueda crecer con el trabajo que deba realizar.

Conectar GPT-Live-1 con Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Conectar GPT-Live-1 con Codex. Este extracto muestra cómo una aplicación pasa el contexto de la conversación a Codex y devuelve su respuesta a GPT-Live-1. Se omiten la configuración de la conexión y la gestión de la delegación.

Para acceder a voces personalizadas, contacta con Ventas y obtén más información sobre los requisitos y el proceso de solicitud.

Otra forma de crear flujos de trabajo de voz basados en GPT‑Live‑1 es con OpenAI Presence, que usa el modelo para facilitar interacciones de voz en tiempo real. Presence ayuda a las empresas a implementar agentes de IA fiables capaces de responder preguntas, resolver problemas, usar los sistemas de la empresa, ejecutar acciones aprobadas y derivarlos a una persona cuando sea necesario. Ponte en contacto con tu director de cuenta de OpenAI para obtener más información.

Autor

OpenAI