Passer au contenu principal
OpenAI

20 mars 2025

VersionsProduit

Présentation des modèles audio nouvelle génération dans l'API

Une nouvelle suite de modèles audio pour alimenter des agents vocaux, maintenant disponible pour les développeurs du monde entier.

Image principale du blogue sur les modèles audio de nouvelle génération d’OpenAI
Chargement…

Mise à jour du 28 août 2025 : Nous avons annoncé la disponibilité générale de l'API Realtime. En savoir plus.


Au cours des derniers mois, nous avons investi pour faire progresser l’intelligence, les capacités et l’utilité des agents textuels — ou des systèmes qui accomplissent de manière autonome des tâches au nom des utilisateurs — avec des lancements tels qu'opérateur, recherche approfondie, les agents capables d’utiliser un ordinateur et l’API Responses avec des outils intégrés. Cependant, pour que les agents soient vraiment utiles, les gens doivent pouvoir interagir avec eux de manière plus approfondie et intuitive, au-delà du simple texte, en utilisant le langage parlé naturel pour communiquer efficacement.

Aujourd'hui, nous lançons de nouveaux modèles parole-texte et de texte-parole dans l'API, ce qui permet de créer des agents vocaux plus puissants, personnalisables et intelligents qui offrent une réelle valeur ajoutée. Nos plus récents modèles parole-texte établissent une nouvelle référence de pointe, surpassant les solutions existantes en matière de précision et de fiabilité, surtout dans des scénarios difficiles impliquant des accents, des environnements bruyants et des vitesses d'élocution variables. Ces améliorations augmentent la fiabilité de la transcription, rendant les modèles particulièrement bien adaptés à des cas d’utilisation tels que les centres d’appels du service à la clientèle, la transcription de notes de réunion et d'autres.

Pour la première fois, les développeurs peuvent également demander au modèle texte-parole de parler d'une manière spécifique, par exemple « parler comme un agent du service à la clientèle sympathique », ce qui ouvre la voie à un nouveau niveau de personnalisation pour les agents vocaux. Cela permet un large éventail d’applications sur mesure, allant de voix de service à la clientèle plus empathiques et dynamiques à une narration expressive pour des expériences de narration créative.

Nous avons lancé notre premier modèle audio en 2022 et depuis, nous nous sommes engagés à améliorer l’intelligence, la précision et la fiabilité de ces modèles. Grâce à ces nouveaux modèles audio, les développeurs peuvent créer des systèmes parole-texte plus précis et plus robustes, ainsi que des voix texte-parole expressives et pleines de personnalité, le tout au sein de l'API.

Calme
Surfeur
Professionnel
Chevalier médiéval
Amateur d'histoires de crimes réels
Histoire pour le coucher

En savoir plus sur nos derniers modèles audio

Nouveaux modèles parole-texte

Nous introduisons de nouveaux modèles gpt-4o-transcribe et gpt-4o-mini-transcribe avec des améliorations du taux d'erreur sur les mots, ainsi qu'une meilleure reconnaissance et précision linguistiques, par rapport aux modèles Whisper d'origine.

gpt-4o-transcribe affiche des performances améliorées en termes de taux d'erreur sur les mots (WER) par rapport aux modèles Whisper existants sur plusieurs référentiels établis, ce qui reflète les progrès significatifs réalisés dans notre technologie de parole-texte. Ces avancées découlent directement d’innovations ciblées en apprentissage par renforcement et d’un entraînement intermédiaire approfondi sur des ensembles de données audio variés et de haute qualité.

En conséquence, ces nouveaux modèles parole-texte permettent de mieux saisir les nuances de la parole, de réduire les erreurs de reconnaissance et d'améliorer la fiabilité de la transcription, en particulier dans les situations difficiles impliquant des accents, des environnements bruyants et des vitesses de parole variables. Ces modèles sont maintenant disponibles dans l’API parole-texte(s'ouvre dans une nouvelle fenêtre).

Le taux d'erreur sur les mots (WER) évalue la précision des modèles de reconnaissance vocale en calculant le pourcentage de mots mal transcrits par rapport à une transcription de référence — un WER plus bas est préférable et indique moins d'erreurs. Nos derniers modèles de parole-texte obtiennent un WER inférieur dans tous les référentiels, y compris FLEURS (Évaluation de l'apprentissage à peu d'exemples (few-shot) des représentations universelles de la parole), un référentiel multilingue couvrant plus de 100 langues à partir d'échantillons audio transcrits manuellement. Ces résultats démontrent une précision de transcription plus élevée et une couverture linguistique plus étendue. Comme indiqué ici, nos modèles surpassent systématiquement Whisper v2 et Whisper v3 dans toutes les évaluations linguistiques.

Sur FLEURS, nos modèles offrent un WER plus faible et de solides performances multilingues. Un WER plus bas est préférable et signifie moins d'erreurs. Comme indiqué ici, nos modèles égalent ou surpassent d'autres modèles de premier plan dans la plupart des langues majeures.

Nouveau modèle texte-parole

Nous lançons également un nouveau modèle gpt-4o-mini-tts avec une meilleure capacité de direction. Pour la première fois, les développeurs peuvent « instruire » le modèle non seulement sur ce qu’il doit dire, mais comment le dire, ce qui permet des expériences plus personnalisées pour des cas d’utilisation allant du service à la clientèle à la narration créative. Le modèle est disponible dans l’ API texte-parole(s'ouvre dans une nouvelle fenêtre). Veuillez noter que ces modèles texte-parole sont limités à des voix artificielles et prédéfinies, que nous surveillons pour nous assurer qu'elles correspondent systématiquement aux préréglages synthétiques.

Les innovations techniques au service des modèles

Pré-entraînement avec des ensembles de données audio authentiques

Nos nouveaux modèles audio s’appuient sur les architectures GPT‑4o et GPT‑4o‑mini et sont largement pré-entraînés sur des ensembles de données spécialisés axés sur l’audio, qui ont été essentiels pour optimiser les performances des modèles. Cette approche ciblée offre une compréhension plus approfondie des nuances de la parole et permet d’atteindre des performances exceptionnelles dans les tâches liées à l’audio.

Méthodologies avancées de distillation

Nous avons amélioré nos techniques de distillation, permettant ainsi le transfert de connaissances de nos plus grands modèles audio vers des modèles plus petits et plus efficaces. En tirant parti de méthodologies avancées d’auto-apprentissage, nos ensembles de données de distillation capturent efficacement des dynamiques conversationnelles réalistes, reproduisant de véritables interactions entre utilisateur et assistant. Cela aide nos modèles plus petits à fournir une excellente qualité de conversation et une grande réactivité.

Paradigme de l'apprentissage par renforcement

Pour nos modèles parole-texte, nous avons intégré un paradigme fortement axé sur l'apprentissage par renforcement (RL), ce qui a permis d'atteindre une précision de transcription à des niveaux inégalés. Cette méthodologie améliore considérablement la précision et réduit les hallucinations, rendant nos solutions parole-texte exceptionnellement compétitives dans les scénarios complexes de reconnaissance vocale.

Ces développements représentent des progrès dans le domaine de la modélisation audio, combinant des méthodologies innovantes à des améliorations pratiques pour améliorer les performances dans les applications vocales.

Disponibilité de l’API

Ces nouveaux modèles audio sont maintenant disponibles pour tous les développeurs – plus d’informations sur la création avec l’audio(s'ouvre dans une nouvelle fenêtre). Pour les développeurs qui créent déjà des expériences conversationnelles à l'aide de modèles textuels, l'ajout de nos modèles parole-texte et texte-parole est le moyen le plus simple de créer un agent vocal. Nous lançons une intégration avec le SDK Agents(s'ouvre dans une nouvelle fenêtre) qui simplifie ce processus de développement. Pour les développeurs souhaitant créer des expériences de parole à parole à faible latence, nous vous recommandons d'utiliser nos modèles de parole à parole dans l'API Realtime.

Évolutions prévues

À l’avenir, nous prévoyons de continuer à investir dans l’amélioration de l’intelligence et de la précision de nos modèles audio et d’explorer des moyens permettant aux développeurs d’intégrer leurs propres voix personnalisées pour créer des expériences encore plus personnalisées, tout en respectant nos normes de sécurité. De plus, nous continuons à engager des conversations avec des décideurs, des chercheurs, des développeurs et des créateurs sur les défis et les opportunités que peuvent présenter les voix synthétiques. Nous sommes impatients de voir les applications innovantes et créatives que les développeurs construiront en utilisant ces capacités audio améliorées. Nous investirons également dans d’autres modalités, y compris la vidéo, pour permettre aux développeurs de créer des expériences multimodales agentiques.

Retransmission en direct

Auteurs

OpenAI

Pistes de recherche

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Contributeurs

Recherche

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Ingénierie

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produit

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Commanditaires de la direction

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry