Passer au contenu principal
OpenAI

20 mars 2025

VersionsProduit

Présentation des modèles audio nouvelle génération dans l'API

Une nouvelle suite de modèles audio destinés à optimiser les agents vocaux est désormais accessible aux développeurs du monde entier.

Image principale du blog sur les modèles audio de nouvelle génération d'OpenAI
Chargement...

Mise à jour du 28 août 2025 : nous avons annoncé la disponibilité générale de l'API Realtime. En savoir plus ici.


Au cours des derniers mois, nous avons investi dans le développement de l'intelligence, des capacités et de l'utilité des agents textuels, c'est-à-dire des systèmes qui accomplissent de manière autonome des tâches pour le compte des utilisateurs, avec des lancements tels que Operator, Deep Research, les agents capables d'utiliser un ordinateur et l'API Responses avec des outils intégrés. Cependant, pour que les agents soient véritablement utiles, les utilisateurs doivent pouvoir interagir avec eux de manière plus approfondie et intuitive, au-delà du simple texte, en utilisant le langage naturel parlé pour communiquer efficacement.

Aujourd'hui, nous lançons de nouveaux modèles audio de synthèse vocale et de reconnaissance vocale dans l'API, ce qui permet de créer des agents vocaux plus puissants, personnalisables et intelligents qui offrent une réelle valeur ajoutée. Nos derniers modèles de reconnaissance vocale établissent une nouvelle référence en matière de technologie de pointe, surpassant les solutions existantes en termes de précision et de fiabilité, en particulier dans les situations difficiles impliquant des accents, des environnements bruyants et des vitesses d'élocution variables. Ces améliorations augmentent la fiabilité de la transcription, rendant les modèles particulièrement adaptés à des cas d'utilisation tels que les centres d'appels clients, la transcription de notes de réunion, etc.

Pour la première fois, les développeurs peuvent également demander au modèle de synthèse vocale de parler d'une manière spécifique, par exemple « parler comme un agent du service client sympathique », ce qui ouvre de nouvelles possibilités de personnalisation pour les agents vocaux. Cela permet une large gamme d'applications sur mesure, allant de voix plus empathiques et dynamiques pour le service client à des narrations expressives pour des expériences narratives créatives.

Nous avons lancé notre premier modèle audio en 2022 et depuis, nous nous sommes engagés à améliorer l'intelligence, la précision et la fiabilité de ces modèles. Grâce à ces nouveaux modèles audio, les développeurs peuvent créer des systèmes de reconnaissance vocale plus précis et plus performants, ainsi que des voix de synthèse vocale expressives et caractéristiques, le tout au sein de l'API.

Calme
Surfeur
Professionnel
Chevalier médiéval
Passionné de faits divers criminels
Histoire du soir

En savoir plus sur nos derniers modèles audio

Nouveaux modèles de reconnaissance vocale

Nous introduisons de nouveaux modèles gpt-4o-transcribe et gpt-4o-mini-transcribe avec des améliorations du taux d'erreur lexicale, ainsi qu'une meilleure reconnaissance et précision linguistiques, par rapport aux modèles Whisper d'origine.

gpt-4o-transcribe démontre des performances améliorées en termes de taux d'erreur lexicale (WER) par rapport aux modèles Whisper existants sur plusieurs benchmarks établis, reflétant les progrès significatifs réalisés dans notre technologie de conversion de la parole en texte. Ces avancées découlent directement d'innovations ciblées dans l'apprentissage par renforcement et d'un entraînement intermédiaire approfondi avec des jeux de données audio diversifiés et de haute qualité.

En conséquence, ces nouveaux modèles de reconnaissance vocale peuvent mieux saisir les nuances de la parole, réduire les erreurs de reconnaissance et améliorer la fiabilité de la transcription, en particulier dans des situations complexes impliquant des accents, des environnements bruyants et des vitesses d'élocution variables. Ces modèles sont disponibles dès à présent dans l'API de reconnaissance vocale(ouverture dans une nouvelle fenêtre).

Le taux d'erreur lexicale (WER) mesure la précision des modèles de reconnaissance vocale en calculant le pourcentage de mots incorrectement transcrits par rapport à une transcription de référence. Un WER faible est préférable et implique moins d'erreurs. Nos derniers modèles de conversion de la parole en texte obtiennent un WER plus faible dans tous les benchmarks, y compris FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), un benchmark multilingue couvrant plus de 100 langues à partir d'échantillons audio transcrits manuellement. Ces résultats démontrent une plus grande précision de transcription et une couverture linguistique plus étendue. Comme le montre le tableau ci-dessous, nos modèles surpassent systématiquement Whisper v2 et Whisper v3 pour toutes les évaluations linguistiques.

Sur FLEURS, nos modèles offrent un taux d'erreur global (WER) plus faible et d'excellentes performances multilingues. Un WER plus faible est préférable et signifie moins d'erreurs. Comme indiqué ici, nos modèles égalent ou surpassent les autres modèles de pointe dans la plupart des langues courantes.

Nouveau modèle de synthèse vocale

Nous lançons également un nouveau modèle gpt-4o-mini-tts avec une meilleure maniabilité. Pour la première fois, les développeurs peuvent « indiquer » au modèle non seulement ce qu'il doit dire, mais également comment le dire, ce qui permet d'offrir des expériences plus personnalisées pour des cas d'utilisation allant du service client à la narration créative. Le modèle est disponible dans l'API de synthèse vocale(ouverture dans une nouvelle fenêtre). Notez que ces modèles de synthèse vocale sont limités à des voix artificielles prédéfinies, que nous surveillons afin de nous assurer qu'elles correspondent toujours aux préréglages synthétiques.

Les innovations techniques derrière les modèles

Pré-entraînement avec des jeux de données audio authentiques

Nos nouveaux modèles audio s'appuient sur les architectures GPT‑4o et GPT‑4o‑mini et ont fait l'objet d'un pré-entraînement approfondi sur des jeux de données spécialisés axés sur l'audio, qui ont joué un rôle essentiel dans l'optimisation des performances des modèles. Cette approche ciblée offre un aperçu plus approfondi des nuances de la parole et permet d'obtenir des performances exceptionnelles dans toutes les tâches liées à l'audio.

Méthodes de distillation avancées

Nous avons amélioré nos techniques de distillation, ce qui nous a permis de transférer les connaissances acquises grâce à nos modèles audio les plus volumineux vers des modèles plus petits et plus efficaces. Grâce à des méthodologies avancées d'auto-apprentissage, nos jeux de données sur la distillation capturent efficacement la dynamique réaliste des conversations, reproduisant ainsi les interactions authentiques entre les utilisateurs et les assistants. Cela permet à nos modèles plus petits d'offrir une excellente qualité conversationnelle et une grande réactivité.

Paradigme de l'apprentissage par renforcement

Pour nos modèles de reconnaissance vocale, nous avons intégré un paradigme axé sur l'apprentissage par renforcement (RL), ce qui nous a permis d'atteindre des niveaux de précision de transcription inégalés. Cette méthodologie améliore considérablement la précision et réduit les hallucinations, rendant nos solutions de reconnaissance vocale exceptionnellement compétitives en cas de scénarios complexes.

Ces avancées constituent un progrès dans le domaine de la modélisation audio, combinant des méthodologies innovantes et des améliorations pratiques pour des performances accrues dans les applications vocales.

Disponibilité de l'API

Ces nouveaux modèles audio sont désormais disponibles pour tous les développeurs, plus d'informations sur la création avec l'audio ici(ouverture dans une nouvelle fenêtre). Pour les développeurs qui créent déjà des expériences conversationnelles avec des modèles textuels, l'ajout de nos modèles de synthèse vocale et de reconnaissance vocale constitue le moyen le plus simple de créer un agent vocal. Nous lançons une intégration avec les Agents SDK(ouverture dans une nouvelle fenêtre) qui simplifie ce processus de développement. Pour les développeurs qui souhaitent créer des expériences de synthèse vocale à faible latence, nous recommandons d'utiliser nos modèles de synthèse vocale dans l'API Realtime.

Évolutions prévues

À l'avenir, nous prévoyons de continuer à investir dans l'amélioration de l'intelligence et de la précision de nos modèles audio et d'explorer des moyens permettant aux développeurs d'utiliser leurs propres voix personnalisées afin de créer des expériences encore plus personnalisées, tout en respectant nos normes de sécurité. De plus, nous poursuivons nos discussions avec les décideurs politiques, les chercheurs, les développeurs et les créatifs sur les défis et les opportunités que peuvent présenter les voix synthétiques. Nous sommes impatients de découvrir les applications innovantes et créatives que les développeurs construiront grâce à ces capacités audio améliorées. Nous investirons également dans d'autres modalités, y compris la vidéo, pour permettre aux développeurs de créer des expériences agentiques multimodales.

Revoir l’événement vidéo

Auteurs

OpenAI

Pistes de recherche

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Contributeurs

Recherches

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Ingénierie

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produit

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponsors principaux

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry