Presentamos modelos de audio de última generación en la API
Una nueva suite de modelos de audio para potenciar agentes de voz, ahora disponible para desarrolladores de todo el mundo.

Actualización del 28 de agosto de 2025: Anunciamos la disponibilidad general de la API Realtime. Más información aquí.
En los últimos meses, hemos invertido en mejorar la inteligencia, las capacidades y la utilidad de los agentes basados en texto (o sistemas que hacen tareas de forma autónoma en nombre de los usuarios) con lanzamientos como operador, investigación profunda, Agentes informáticos y la API de Respuestas con herramientas integradas. Sin embargo, para que los agentes sean realmente útiles, las personas necesitan poder tener interacciones más profundas e intuitivas con los agentes más allá del texto, usando un lenguaje hablado natural para comunicarse eficazmente.
Hoy estamos lanzando nuevos modelos de audio de voz a texto y de texto a voz en la API, lo que hace posible construir agentes de voz más potentes, personalizables e inteligentes que ofrecen un valor real. Nuestros últimos modelos de transcripción de voz a texto establecen un nuevo estándar de vanguardia, superando a las soluciones actuales en términos de precisión y fiabilidad, especialmente en situaciones desafiantes que incluyen acentos, entornos ruidosos y diferentes velocidades de habla. Estas mejoras aumentan la fiabilidad de la transcripción, haciendo que los modelos sean especialmente adecuados para casos de uso como centros de atención al cliente, transcripción de actas de reuniones y más.
Por primera vez, los desarrolladores también pueden instruir al modelo de texto a voz para que hable de una manera específica, por ejemplo, “habla como un agente de atención al cliente empático”, accediendo a un nuevo nivel de personalización para los agentes de voz. Esto permite una amplia gama de aplicaciones personalizadas, desde voces de atención al cliente más empáticas y dinámicas hasta narraciones expresivas para experiencias creativas de contar historias.
Lanzamos nuestro primer modelo de audio en 2022 y desde entonces, nos hemos comprometido a mejorar la inteligencia, la precisión y la fiabilidad de estos modelos. Con estos nuevos modelos de audio, los desarrolladores pueden crear sistemas de reconocimiento de voz a texto más precisos y robustos, y voces de texto a voz expresivas y con carácter, todo dentro de la API.
Estamos presentando nuevos modelos gpt-4o-transcribe y gpt-4o-mini-transcribe con mejoras en la tasa de error de palabras, así como un mejor reconocimiento y precisión del idioma, en comparación con los modelos Whisper originales.
gpt-4o-transcribe muestra un rendimiento mejorado en la tasa de error de palabras (WER) en comparación con los modelos Whisper actuales en diversas pruebas de referencia establecidas, reflejando un progreso significativo en nuestra tecnología de conversión de voz a texto. Estos avances provienen directamente de innovaciones dirigidas en el aprendizaje por refuerzo y de un extenso entrenamiento intermedio con conjuntos de datos de audio diversos y de alta calidad.
Como resultado, estos nuevos modelos de transcripción de voz a texto pueden captar mejor los matices del habla, reducir los errores de reconocimiento y aumentar la fiabilidad de la transcripción, especialmente en situaciones desafiantes que incluyen acentos, entornos ruidosos y diferentes velocidades de habla. Estos modelos ya están disponibles en la API de reconocimiento de voz(se abre en una nueva ventana).
La tasa de error de palabras (en inglés, WER) mide la precisión de los modelos de reconocimiento de voz calculando el porcentaje de palabras transcritas incorrectamente en comparación con una transcripción de referencia; una WER más baja es mejor y significa menos errores. Nuestros últimos modelos de reconocimiento de voz a texto logran una menor WER en varios puntos de referencia, incluido FLEURS (Evaluación de Aprendizaje de Pocos Ejemplos de Representaciones Universales del Habla), un punto de referencia multilingüe que abarca más de 100 idiomas y utiliza muestras de audio transcritas manualmente. Estos resultados demuestran una mayor precisión en la transcripción y una cobertura de idiomas más amplia. Como se muestra aquí, nuestros modelos consistentemente superan a Whisper v2 y Whisper v3 en las evaluaciones de todos los idiomas.
En FLEURS, nuestros modelos logran una WER más baja y un rendimiento multilingüe sólido. Una WER más baja es mejor y significa menos errores. Como se muestra aquí, nuestros modelos igualan o superan a otros modelos líderes en la mayoría de los idiomas principales.
También estamos lanzando un nuevo modelo gpt-4o-mini-tts con mejor capacidad de dirección. Por primera vez, los desarrolladores pueden “instruir” al modelo no solo sobre qué decir, sino cómo decirlo, lo que permite experiencias más personalizadas para casos de uso que van desde la atención al cliente hasta la narración creativa. El modelo está disponible en la API de texto a voz(se abre en una nueva ventana). Ten en cuenta que estos modelos de texto a voz se limitan a voces artificiales y predefinidas, las cuales supervisamos para asegurar que coincidan consistentemente con los preajustes sintéticos.
Nuestros nuevos modelos de audio se basan en las arquitecturas GPT‑4o y GPT‑4o‑mini y han sido preentrenados extensamente con conjuntos de datos especializados en audio, los cuales han sido cruciales para optimizar el rendimiento del modelo. Este enfoque dirigido ofrece una comprensión más profunda de los matices del habla y permite un rendimiento excepcional en tareas relacionadas con el audio.
Hemos mejorado nuestras técnicas de destilación, lo que permite transferir conocimiento de nuestros modelos de audio más grandes a modelos más pequeños y eficientes. Al utilizar metodologías avanzadas de autoaprendizaje, nuestros conjuntos de datos de destilación capturan de manera efectiva dinámicas conversacionales realistas, replicando interacciones genuinas entre usuarios y asistentes. Esto permite que nuestros modelos más pequeños brinden una excelente calidad conversacional y capacidad de respuesta.
Para nuestros modelos de conversión de voz a texto, hemos integrado un paradigma con un fuerte énfasis en el aprendizaje por refuerzo (RL), llevando la precisión de la transcripción a niveles de vanguardia. Esta metodología mejora drásticamente la precisión y reduce las alucinaciones, lo que hace que nuestras soluciones de reconocimiento de voz sean excepcionalmente competitivas en situaciones complejas.
Estos desarrollos representan un avance en el campo del modelado de audio, combinando metodologías innovadoras con mejoras prácticas para mejorar el rendimiento en aplicaciones de voz.
Estos nuevos modelos de audio ya están disponibles para todos los desarrolladores; más sobre cómo construir con audio aquí(se abre en una nueva ventana). Para los desarrolladores que ya están creando experiencias conversacionales con modelos basados en texto, añadir nuestros modelos de reconocimiento de voz a texto y de texto a voz es la manera más sencilla de construir un agente de voz. Estamos lanzando una integración con el Agents SDK(se abre en una nueva ventana) que simplifica este proceso de desarrollo. Para los desarrolladores que buscan crear experiencias de voz a voz de baja latencia, recomendamos usar nuestros modelos de voz a voz en la API Realtime.
De cara al futuro, tenemos previsto seguir invirtiendo en mejorar la inteligencia y la precisión de nuestros modelos de audio y explorar maneras de permitir que los desarrolladores integren sus propias voces personalizadas para crear experiencias aún más personalizadas de formas que se alineen con nuestros estándares de seguridad. Además, seguimos participando en conversaciones con responsables de políticas, investigadores, desarrolladores y creativos sobre los desafíos y oportunidades que las voces sintéticas pueden presentar. Nos entusiasma ver las aplicaciones innovadoras y creativas que los desarrolladores construirán utilizando estas capacidades de audio mejoradas. También invertiremos en otras modalidades, incluido el video, para permitir que los desarrolladores creen experiencias multimodales con capacidad agéntica.
Autores
Investigar líderes
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Contribuidores
Investigación
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Ingeniería
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Producto
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Patrocinadores del liderazgo
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry