Ir al contenido principal
OpenAI

20 de marzo de 2025

LanzamientoProducto

Presentación de modelos de audio de última generación en la API

Un nuevo conjunto de modelos de audio para potenciar agentes de voz, ahora disponible para desarrolladores de todo el mundo.

Imagen principal del blog de OpenAI sobre modelos de audio de última generación
Cargando…

Actualización del 28 de agosto de 2025: Anunciamos la disponibilidad general de la API Realtime. Más información aquí.


En los últimos meses, hemos invertido en mejorar la inteligencia, las capacidades y la utilidad de los agentes basados en texto (o sistemas que realizan tareas de forma autónoma en nombre de los usuarios) con lanzamientos como Operador, Investigación Avanzada, Agentes Informáticos y la API Responses con herramientas integradas. Sin embargo, para que los agentes sean realmente útiles, las personas deben tener la posibilidad de tener interacciones más profundas e intuitivas con los agentes más allá del texto, utilizando un lenguaje hablado natural para comunicarse con eficacia.

Hoy, lanzamos nuevos modelos de audio de voz a texto y de texto a voz en la API, lo que nos permite crear agentes de voz más potentes, personalizables e inteligentes para ofrecer un valor real. Nuestros últimos modelos de conversión de voz a texto establecen un novedoso estándar de referencia, superando a las soluciones existentes en precisión y fiabilidad, especialmente en escenarios desafiantes que abarcan varios acentos, entornos ruidosos y diferentes velocidades de habla. Estas mejoras aumentan la fiabilidad de la transcripción, lo que hace que los modelos sean especialmente adecuados para casos de uso como centros de llamadas de atención al cliente, transcripción de notas de reuniones y mucho más.

Por primera vez, los desarrolladores también pueden ordenar al modelo de texto a voz para que hable de una manera específica, por ejemplo, «habla como un agente de atención al cliente empático», accediendo de esta forma a un nuevo nivel de personalización para los agentes de voz. Esta función permite una amplia gama de aplicaciones personalizadas, desde voces de atención al cliente más empáticas y dinámicas hasta una narración expresiva para experiencias de narraciones creativas.

Lanzamos nuestro primer modelo de audio en 2022 y, desde entonces, nos hemos comprometido a mejorar la inteligencia, la precisión y la fiabilidad de estos modelos. Con estos nuevos modelos de audio, los desarrolladores pueden crear sistemas de reconocimiento de voz a texto más precisos y robustos, así como voces de texto a voz más expresivas y con carácter, todo desde la API.

Tranquila
Surfista
Profesional
Caballero medieval
Aficionado a casos de crímenes reales
Cuento para dormir

Más sobre nuestros últimos modelos de audio

Nuevos modelos de reconocimiento de voz a texto

Presentamos nuevos modelos gpt-4o-transcribe y gpt-4o-mini-transcribe con mejoras en la tasa de error de palabras, así como un mejor reconocimiento y precisión del idioma, en comparación con los modelos originales de Whisper.

gpt-4o-transcribe muestra un mejor rendimiento en la tasa de error de palabras (WER) en comparación con otros modelos Whisper existentes en múltiples evaluaciones de referencia establecidas, lo que refleja un progreso significativo en nuestra tecnología de conversión de voz a texto. Estos avances provienen directamente de innovaciones específicas en el aprendizaje por refuerzo y de un extenso entrenamiento intermedio con conjuntos de datos de audio variados y de alta calidad.

Como resultado, estos nuevos modelos de reconocimiento de voz a texto son capaces de captar mejor los matices del habla, reducir los errores de reconocimiento y aumentar la fiabilidad de la transcripción, especialmente en situaciones difíciles que implican acentos, entornos ruidosos y diferentes velocidades del habla. Estos modelos ya están disponibles en la API de reconocimiento de voz a texto(se abre en una ventana nueva).

La tasa de error de palabras (WER) mide la precisión de los modelos de reconocimiento de voz calculando el porcentaje de palabras que se han transcrito de manera incorrecta en comparación con una transcripción de referencia, de manera que cuanto más baja sea la WER, mejor, pues indicará que hay menos errores. Nuestros últimos modelos de conversión de voz a texto obtienen una WER más baja frente a evaluaciones de referencia, donde se incluye FLEURS (Evaluación de Aprendizaje de Pocos Ejemplos de Representaciones Universales del Habla), un indicador de referencia del habla que abarca más de 100 idiomas y que utiliza muestras de audio transcritas manualmente. Estos resultados demuestran una mayor precisión en la transcripción y una mayor cobertura de idiomas. Como se muestra aquí, nuestros modelos superan de manera uniforme a Whisper v2 y Whisper v3 en todas las evaluaciones lingüísticas.

En FLEURS, nuestros modelos ofrecen una WER más baja y un rendimiento multilingüe sólido. Contar con una WER baja es bueno, pues significa que hay menos errores. Como se muestra aquí, nuestros modelos igualan o superan a otros modelos líderes en la mayoría de los idiomas principales.

Nuevo modelo de texto a voz

También lanzamos un nuevo modelo gpt-4o-mini-tts con mejor capacidad de control. Por primera vez, los desarrolladores pueden «ordenar» al modelo no solo sobre qué decir, sino cómo decirlo, lo que favorece experiencias más personalizadas para casos de uso que van desde la atención al cliente hasta la narración creativa. El modelo está disponible en la API de texto a voz(se abre en una ventana nueva). Ten en cuenta que estos modelos de texto a voz se limitan a voces artificiales y predefinidas, las cuales supervisamos para asegurar que encajen de forma consistente con los ajustes sintéticos preestablecidos.

Innovaciones técnicas detrás de los modelos

Preentrenamiento con conjuntos de datos de audio auténticos

Nuestros nuevos modelos de audio se basan en las arquitecturas GPT‑4o y GPT‑4o‑mini y han sido ampliamente preentrenados con conjuntos de datos de audio especializados, los cuales han tenido un papel crucial en la optimización del rendimiento del modelo. Este enfoque específico ofrece una comprensión más profunda de los matices del habla y permite un rendimiento excepcional en tareas relacionadas con el audio.

Metodologías avanzadas de destilación

Hemos mejorado nuestras técnicas de destilación, permitiendo la transferencia de conocimientos desde nuestros modelos de audio más grandes a modelos más pequeños y eficientes. Aprovechando metodologías avanzadas de autoaprendizaje, nuestros conjuntos de datos de destilación capturan de manera efectiva dinámicas conversacionales realistas, replicando interacciones auténticas entre usuarios y asistentes. Esto ayuda a que nuestros modelos más pequeños puedan ofrecer una excelente calidad conversacional y capacidad de respuesta.

Paradigma de aprendizaje por refuerzo

Para nuestros modelos de conversión de voz a texto, hemos integrado un paradigma con un fuerte énfasis en el aprendizaje por refuerzo (RL), llevando la precisión de la transcripción a niveles de vanguardia. Esta metodología mejora notablemente la precisión y reduce las alucinaciones, consiguiendo que nuestras soluciones de voz a texto sean excepcionalmente competitivas en situaciones complejas para el reconocimiento de voz.

Estos desarrollos suponen un avance en el campo del modelado de audio, donde se combinan metodologías innovadoras con mejoras prácticas para ofrecer un mejor rendimiento en aplicaciones de voz.

Disponibilidad de la API

Estos nuevos modelos de audio ya están disponibles para todos los desarrolladores. Aquí(se abre en una ventana nueva) obtendrá más información sobre cómo crear con audio. Para aquellos desarrolladores que ya están creando experiencias conversacionales con modelos basados en texto, la manera más sencilla de crear un agente de voz es añadiendo nuestros modelos de reconocimiento de voz a texto y de texto a voz. Estamos lanzando una integración con Agents SDK(se abre en una ventana nueva), que simplifica este proceso de desarrollo. Para los desarrolladores que buscan crear experiencias de voz a voz de baja latencia, recomendamos usar nuestros modelos de voz a voz en la API Realtime.

Próximos pasos

De cara al futuro, tenemos previsto seguir invirtiendo en mejorar la inteligencia y la precisión de nuestros modelos de audio y explorar maneras para que los desarrolladores puedan integrar sus propias voces y crear experiencias aún más personalizadas, ajustándose a nuestros estándares de seguridad. Además, seguimos participando en conversaciones con responsables de políticas, investigadores, desarrolladores y creativos en torno a los desafíos y oportunidades que pueden presentar las voces sintéticas. Estamos deseando conocer las aplicaciones innovadoras y creativas que crearán los desarrolladores gracias a estas capacidades de audio mejoradas. También invertiremos en otras modalidades, incluido el video, para que los desarrolladores puedan diseñar experiencias de agentes multimodales.

Repetición del directo

Autores

OpenAI

Responsables de la investigación

Christina Kim, Junhua Mao, Yi Shen y Yu Zhang

Contribuidores

Investigación

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen y Ye Jia

Ingeniería

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang y Yilei Qian

Producto

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara y Xiaolin Hao

Patrocinadores principales

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu y Sulman Choudhry