OpenAI

8 de julio de 2026

ProductoLanzamiento

Presentamos GPT‑Live

Una nueva generación de modelos de voz para una interacción natural entre humanos e IA, que ahora impulsa ChatGPT Voz.

Cargando...

Actualización del 31 de julio de 2026: El audio compatible generado con GPT‑Live a través de ChatGPT Voz y la API de OpenAI ahora incluye marcas de agua SynthID. Nuestra herramienta pública de verificación ahora puede detectar señales de procedencia de OpenAI en archivos de audio compatibles, y también incorporamos acceso a la API para la verificación, de modo que los desarrolladores y las organizaciones puedan incorporar comprobaciones de procedencia en sus propios flujos de trabajo. Estas actualizaciones se basan en el enfoque de seguridad que se describe a continuación y en nuestro trabajo más amplio para que el contenido generado por OpenAI sea más fácil de identificar.

Estamos lanzando GPT‑Live, una nueva generación de modelos de voz que hacen que hablar con la IA se sienta mucho más como tener una conversación real.

GPT‑Live está construido sobre una arquitectura full-duplex, lo que significa que puede escuchar y hablar al mismo tiempo. Durante las conversaciones, GPT‑Live puede demostrar que está prestando atención con frases como "mmm" o "sí", participar en intercambios rápidos, o simplemente quedarse en silencio cuando necesitas un momento para pensar. El resultado es una experiencia de voz con la que es sorprendentemente fácil conversar.

GPT‑Live también es nuestro modelo de voz más inteligente hasta ahora. Para preguntas que requieren búsqueda web, razonamiento más profundo o trabajo más complejo, delega en segundo plano a nuestro modelo de vanguardia más reciente y trae el resultado de vuelta a la conversación cuando está listo. Mientras trabaja, GPT‑Live puede seguir hablando contigo y mantener el flujo de la conversación. En el lanzamiento, GPT‑Live usará GPT‑5.5 en segundo plano. A medida que lancemos nuevos modelos de vanguardia, actualizaremos continuamente el modelo que usa GPT‑Live.

Estos avances impulsan una nueva experiencia de ChatGPT Voz, más inteligente y natural de usar. Con el tiempo, creemos que esta investigación también abrirá la posibilidad de usar la voz para trabajos cada vez más complejos, de mayor duración y con mayor capacidad de acción como agente.

Hoy comenzamos a implementar dos versiones de GPT‑Live — GPT‑Live‑1 y GPT‑Live‑1 mini — para usuarios de ChatGPT en todo el mundo. También planeamos llevarlas pronto a la API, y desarrolladores y empresas pueden registrarse para recibir una notificación mediante este formulario.

Entrar en una nueva era de interacción entre humanos e IA

Nuestra visión es hacer posible una interacción humano-IA verdaderamente natural: un mundo donde colaborar con la IA se sienta tan fluido y receptivo como trabajar con otra persona, mientras el razonamiento y la ejecución de tareas complejas ocurren sin interrupciones en segundo plano.

Enfoques anteriores

Las generaciones anteriores de sistemas de IA de voz nos acercaron a esa visión, pero con concesiones importantes.

Sistemas de voz en cascada

Los sistemas de voz en cascada dependen de una serie de modelos que actúan uno tras otro para procesar cada turno. La experiencia original de ChatGPT Voz encadenaba tres modelos: un modelo de voz a texto para transcribir tu habla, un modelo de lenguaje grande para producir una respuesta y un modelo de texto a voz para convertirla de nuevo en habla. Este enfoque nos permitió hablar con modelos de IA de vanguardia por primera vez, pero la complejidad tuvo un costo: podía perderse información entre modelos, y las respuestas eran lentas y rígidas.

Sistema de voz en cascada

Respuestas lentas y poco naturales, pausas largas

Transcripción
Conversación de ejemplo con el modo de voz estándar, usando GPT-5.5 Instant

Modelos de voz por turnos

Los modelos de voz por turnos, como el modo de voz avanzado de ChatGPT, procesaban y generaban audio dentro de un solo modelo, lo que reducía la latencia y hacía las conversaciones más fluidas, pero seguían funcionando mediante turnos discretos. El modelo tenía que esperar a que el usuario dejara de hablar antes de responder, lo que producía un intercambio rígido. Además, como la detección de turnos se basa en el silencio, incluso una pausa breve o ruido de fondo podía confundirse con el final del turno, haciendo que el modelo interrumpiera en momentos poco naturales.

Modelo de voz por turnos

Respuestas ligeramente más rápidas y fluidas, pero la interacción con el modelo aún se siente rígida

Transcripción
Conversación de ejemplo con el modo de voz avanzado de ChatGPT

Nuestro nuevo enfoque

GPT‑Live aborda estas limitaciones mediante dos cambios de arquitectura.

Interacción continua

Primero, creamos GPT‑Live para la interacción continua usando una arquitectura full-duplex. En lugar de procesar una secuencia de mensajes separados, GPT‑Live procesa continuamente la entrada mientras genera salida. Por eso, el modelo puede tomar decisiones de interacción muchas veces por segundo: hablar, seguir escuchando, pausar, interrumpir o invocar una herramienta.

Esto permite que el modelo participe en intercambios más naturales, mantenga una mejor percepción del tiempo e incluso realice traducción en vivo.

Interacción continua

Respuestas rápidas, naturales y expresivas, con mejor seguimiento de la conversación

Transcripción
Conversación de ejemplo con GPT-Live-1, usando GPT-5.5 Instant

Delegación para trabajo más profundo

En segundo lugar, separamos GPT‑Live, que gestiona la interacción continua, del trabajo más profundo. Cuando una pregunta requiere búsqueda, razonamiento o capacidades más propias de un agente, GPT‑Live puede delegar la tarea a otro modelo, como GPT‑5.5. Esto le permite mantener la conversación, incluso mientras gestiona varias tareas en segundo plano.

Este cambio de arquitectura también permite que GPT‑Live use continuamente los modelos y agentes más recientes, combinando inteligencia de vanguardia con una interacción natural.

Delegación para trabajo más profundo

GPT-Live ofrece respuestas rápidas y naturales, mientras GPT-5.5 se encarga de las búsquedas en segundo plano

Transcripción
Conversación de ejemplo con GPT-Live-1, usando GPT-5.5 Instant

Evaluaciones

Creamos nuevas evaluaciones humanas para medir qué tan agradable es la experiencia y el flujo de la conversación. En estas comparaciones directas, GPT‑Live‑1 y GPT‑Live‑1 mini son claramente preferidos frente al modo de voz avanzado en conversaciones equivalentes de 5 a 10 minutos que miden la preferencia general, la toma de turnos, las interrupciones, el flujo conversacional y qué tan natural se sintió cada interacción.

  • GPQA: GPT‑Live‑1 supera ampliamente al modo de voz avanzado en GPQA, que evalúa el razonamiento científico de nivel experto en biología, química y física.
  • BrowseComp: GPT‑Live‑1 muestra avances importantes frente al modo de voz avanzado en BrowseComp, que evalúa la búsqueda web con capacidades de agente y la capacidad de encontrar información difícil de localizar.
  • τ³-Voice Telecom (variante interna)**: GPT‑Live‑1 supera al modo de voz avanzado en τ³-Voice Telecom, que evalúa agentes de voz en tareas realistas de soporte de telecomunicaciones de varios turnos.

* GPT‑Live‑1 (Instant) y GPT‑Live‑1 mini usan el modelo GPT‑5.5 Instant en segundo plano, mientras que GPT‑Live‑1 Medium y GPT‑Live‑1 High usan el modelo GPT‑5.5 Thinking con esfuerzo de razonamiento medio y alto.

** Para esta evaluación, usamos un modelo de usuario personalizado, basado en nuestros modelos de razonamiento más recientes.

Una nueva experiencia de ChatGPT Voz

Cada semana, más de 150 millones de personas hablan con ChatGPT usando funciones como Voz y Dictado. Lo usan para recibir ayuda cotidiana sin usar las manos, practicar idiomas, contar cuentos antes de dormir o simplemente conversar durante sus traslados.

Desde hoy, cuando toques el botón de Voz para hablar con ChatGPT, tendrás una experiencia mejorada impulsada por GPT‑Live, con conversaciones más naturales, respuestas más inteligentes, mejor escucha y respuestas visuales.

Conversaciones más naturales

Hablar con ChatGPT ahora debería sentirse mucho más como una conversación real. Puedes interrumpir con una pregunta, hacer una pausa para ordenar tus ideas o pedirle a ChatGPT que hable más despacio. Reconoce de forma natural lo que dices con frases como "ajá" o "entendido", para que sepas que te está siguiendo. También remasterizamos las nueve voces distintivas de ChatGPT para GPT‑Live.

Respuestas más inteligentes

ChatGPT Voz ahora puede aprovechar nuestros modelos de vanguardia más recientes para darte respuestas más inteligentes cuando las necesitas. También puedes elegir el nivel de razonamiento que se ajuste a tus necesidades: Instant para respuestas rápidas, o Medium y High cuando quieres que ChatGPT dedique más tiempo a pensar.

Escuchar mejor

Si te tomas un momento para pensar, ChatGPT Voz ahora espera en lugar de adelantarse e interrumpir. Si le pides que guarde silencio y escuche, lo hará. Y cuando hay ruido de fondo, como tráfico o conversaciones cercanas, ChatGPT se enfoca mejor en tu voz en lugar de distraerse.

Respuestas visuales de un vistazo

Algunas respuestas son más útiles cuando puedes verlas. Mientras hablas, ChatGPT ahora puede mostrar tarjetas visuales enriquecidas sobre temas como clima, acciones, deportes y más. Voz también sigue admitiendo búsqueda, memoria, imágenes y carga de archivos.

El resultado es una experiencia de ChatGPT Voz que se siente más natural, más capaz y más útil en la vida cotidiana.

Seguridad diseñada para voz

GPT‑Live fue diseñado para ser seguro de forma predeterminada. Se basa en los avances de seguridad de nuestros modelos más recientes, y agrega entrenamiento de seguridad específico en áreas clave de riesgo y nuevas salvaguardas diseñadas especialmente para voz.

Pruebas de seguridad ampliadas

Para reflejar mejor cómo las personas usan la voz en contextos reales, comenzamos por ampliar nuestras pruebas de seguridad para incluir nuevas evaluaciones nativas de audio. También creamos evaluaciones sintéticas que usan audio generado para enfocarse con más intensidad en áreas clave de seguridad, a partir de lo que aprendimos del modo de voz avanzado. Esas áreas incluyen autolesión, psicosis y manía, dependencia emocional de la IA, violencia y contenido sexual. Expertos internos también hicieron red teaming del modelo para detectar riesgos exclusivos de la voz.

En nuestras pruebas, GPT‑Live tuvo un desempeño comparable o superior al modo de voz avanzado en casi todas las áreas que evaluamos. Puedes leer más sobre nuestras pruebas y salvaguardas en la tarjeta del sistema(se abre en una nueva ventana) de GPT‑Live.

Salvaguardas integradas

Como las conversaciones de voz ocurren en tiempo real, también incorporamos salvaguardas que pueden actuar mientras el modelo habla. Cuando el sistema detecta una salida potencialmente insegura, puede orientar al modelo hacia una respuesta más segura, mostrar mensajes o recursos adicionales de seguridad, o terminar la conversación de voz en casos de mayor riesgo. Para conversaciones relacionadas con autolesión, adaptamos los flujos de apoyo de ChatGPT para voz, incluida la posibilidad de ofrecer apoyo de líneas de ayuda en crisis revisadas por expertos.

Diseñamos protecciones adicionales para apoyar a usuarios adolescentes y entrenamos directamente en el modelo un comportamiento adecuado para su edad, a fin de reducir el riesgo de respuestas inapropiadas. Los padres pueden elegir si su adolescente puede usar ChatGPT Voz mediante Controles parentales, y los padres vinculados pueden recibir notificaciones en situaciones de mayor riesgo que involucren señales de posible autolesión o intención suicida.

Aprender del uso en el mundo real

También estamos implementando mediciones de más largo plazo y monitoreo posterior al lanzamiento centrados en la dependencia emocional, para seguir mejorando nuestra comprensión y refinando las salvaguardas. A partir de nuestra investigación previa sobre uso afectivo y bienestar emocional, esto nos ayudará a identificar patrones emergentes y mejorar la forma en que el sistema responde en interacciones emocionalmente sensibles.

Por último, GPT‑Live está diseñado para conversar, no para imitar voces. Usa un conjunto de voces predefinidas en ChatGPT, con salvaguardas para impedir que imite la voz de una persona real.

Estamos comprometidos con apoyar la seguridad y el bienestar, y seguiremos fortaleciendo estas protecciones a medida que aprendamos del uso en el mundo real.

Disponibilidad y limitaciones

GPT‑Live ya se está implementando para usuarios de ChatGPT en todo el mundo en iOS, Android y ChatGPT.com(se abre en una nueva ventana). GPT‑Live‑1 pasará a ser el modelo predeterminado que impulsa ChatGPT Voz para usuarios de Go, Plus y Pro, y GPT‑Live‑1 mini será el predeterminado para usuarios Free. Encontrarás más detalles sobre la disponibilidad en nuestro Centro de ayuda(se abre en una nueva ventana).

Optimizamos GPT‑Live para algunos de los idiomas más populares en ChatGPT. En ciertos idiomas, el modelo puede tener un acento no nativo o lagunas de fluidez. Estamos trabajando activamente para mejorar la experiencia en todos los idiomas.

En el lanzamiento, GPT‑Live no admitirá voz con video ni pantalla compartida en ChatGPT, pero estamos trabajando para incorporar pronto estas capacidades. Aún puedes acceder a versiones anteriores de ChatGPT Voz, incluidas el modo de voz estándar y el modo de voz avanzado, donde estas funciones estén disponibles.

Autor

OpenAI