Overslaan naar hoofdinhoud
OpenAI

20 maart 2025

ReleaseProduct

Maak kennis met de volgende generatie audiomodellen in de API

Een nieuwe reeks audiomodellen om spraakagents aan te sturen is nu wereldwijd beschikbaar voor ontwikkelaars.

OpenAI blog-heroafbeelding voor next-generation audiomodellen
Bezig met laden...

Update van 28 augustus 2025: We hebben de algemene beschikbaarheid van de Realtime-API aangekondigd. Lees hier meer.


De afgelopen maanden hebben we geïnvesteerd in het verbeteren van de intelligentie, capaciteiten en bruikbaarheid van op tekst gebaseerde agents: systemen die zelfstandig taken uitvoeren namens gebruikers. Denk hierbij aan releases zoals Operator, Deep Research, Computer-Using Agents en de Responses API met ingebouwde tools. Om agents echter écht nuttig te maken, moeten mensen diepere, intuïtievere interacties kunnen aangaan die verder gaan dan alleen tekst. Het gebruik van natuurlijke spreektaal is essentieel voor effectieve communicatie.

Vandaag lanceren we nieuwe spraak-naar-tekst- en tekst-naar-spraakaudiomodellen in de API. Hiermee wordt het mogelijk om krachtigere, beter aanpasbare en intelligentere spraakagents te bouwen die echte waarde bieden. Onze nieuwste modellen zetten een nieuwe standaard en overtreffen bestaande oplossingen in nauwkeurigheid en betrouwbaarheid, vooral in lastige situaties zoals bij accenten of achtergrondgeluid. Dit maakt de modellen bij uitstek geschikt voor toepassingen zoals callcenters, het transcriberen van vergadernotities en meer.

Voor het eerst kunnen developers het tekst-naar-spraak-model instrueren om op een specifieke manier te spreken. Bijvoorbeeld: 'praat als een empathische klantenservicemedewerker'. Dit ontgrendelt een nieuw niveau van personalisatie voor spraak agents. Dit maakt een breed scala aan toepassingen mogelijk, van dynamische klantenservicestemmen tot expressieve vertelstemmen voor creatieve ervaringen.

Sinds de lancering van ons eerste audiomodel in 2022 hebben we ons toegelegd op het verbeteren van de intelligentie en betrouwbaarheid van deze modellen. Met deze nieuwe audiomodellen kunnen ontwikkelaars binnen de API robuustere spraakherkenningssystemen en karaktervolle stemmen bouwen.

Rustig
Surfer
Professioneel
Middeleeuwse ridder
True crime-liefhebber
Een verhaaltje voor het slapengaan

Meer over onze nieuwste audiomodellen

Nieuwe spraak-naar-tekst-modellen

We introduceren de nieuwe modellen gpt-4o-transcribe en gpt-4o-mini-transcribe. Vergeleken met de originele Whisper-modellen bieden deze verbeteringen op het gebied van Word Error Rate, taalherkenning en nauwkeurigheid.

gpt-4o-transcribe laat in meerdere gevestigde benchmarks betere WER-prestaties zien dan bestaande Whisper-modellen, wat een aanzienlijke vooruitgang in onze spraak-naar-tekst-technologie markeert. Deze verbeteringen komen rechtstreeks voort uit gerichte innovaties in reinforcement learning en uitgebreide 'midtraining' met diverse audiodatasets van hoge kwaliteit.

Hierdoor kunnen de nieuwe modellen spraaknuances beter oppikken, herkenningsfouten verminderen en de betrouwbaarheid van transcripties verhogen. Dit geldt vooral voor uitdagende situaties met accenten, rumoerige omgevingen en wisselende spreeksnelheden. Deze modellen zijn nu beschikbaar in de spraak-naar-tekst-API(opent in een nieuw venster).

Word Error Rate (WER) meet de nauwkeurigheid van spraakherkenningsmodellen door het percentage fout getranscribeerde woorden te berekenen ten opzichte van een referentietranscript. Een lagere WER is beter en betekent minder fouten. Onze nieuwste spraak-naar-tekst-modellen behalen een lagere WER in diverse benchmarks, waaronder FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), een meertalige benchmark met handmatig getranscribeerde audiofragmenten in meer dan 100 talen. Deze resultaten tonen een hogere transcriptienauwkeurigheid en een robuustere taaldekking aan. Zoals te zien is in de data, presteren onze modellen consequent beter dan Whisper v2 en Whisper v3 in alle taalevaluaties.

Onze modellen leveren een lagere WER (Word Error Rate) en sterke meertalige prestaties op de FLEURS-benchmark. Een lagere WER is beter en betekent minder fouten. Zoals hier te zien is, evenaren of overtreffen onze modellen andere toonaangevende modellen in de meeste grote talen.

Nieuw tekst-naar-spraakmodel

We lanceren ook een nieuw gpt-4o-mini-tts-model met verbeterde aanstuurbaarheid. Voor het eerst kunnen ontwikkelaars het model niet alleen instructies geven over wat het moet zeggen, maar ook hoe het dit moet zeggen. Dit maakt vergaand gepersonaliseerde ervaringen mogelijk voor uiteenlopende toepassingen, van klantenservice tot creatieve storytelling. Het model is per direct beschikbaar in de tekst(opent in een nieuw venster)-naar-spraak-API. Let op: Deze tekst-naar-spraak-modellen zijn beperkt tot kunstmatige, vooraf ingestelde stemmen. We monitoren de output om er zeker van te zijn dat deze consistent overeenkomt met deze synthetische presets.

Technische innovaties achter de modellen

Pretraining met authentieke audiodatasets

Onze nieuwe audiomodellen bouwen voort op de GPT‑4o‑ en GPT‑4o‑mini‑architecturen. Ze zijn uitgebreid getraind op gespecialiseerde audiodatasets, wat cruciaal is geweest voor het optimaliseren van de prestaties. Deze gerichte aanpak zorgt voor een dieper inzicht in spraaknuances en maakt uitzonderlijke prestaties mogelijk bij diverse audiotaken.

Geavanceerde distillatiemethodes

We hebben onze distillatietechnieken verbeterd, waardoor kennisoverdracht van onze grootste audiomodellen naar kleinere, efficiëntere modellen mogelijk is. Door gebruik te maken van geavanceerde self-play-methodologieën, leggen onze distillatie-datasets realistische gespreksdynamiek vast en bootsen ze authentieke interacties tussen gebruiker en assistent na. Dit zorgt ervoor dat ook onze kleinere modellen een uitstekende gesprekskwaliteit en responsiviteit leveren.

Reinforcement learning

Voor onze spraak-naar-tekst-modellen hebben we een aanpak geïntegreerd waarin reinforcement learning (RL) centraal staat, waarmee we de transcriptienauwkeurigheid naar een state-of-the-art-niveau tillen. Deze methodologie verbetert de precisie aanzienlijk en vermindert hallucinaties, waardoor onze oplossingen uitzonderlijk competitief zijn in complexe spraakherkenningsscenario's.

Deze ontwikkelingen vertegenwoordigen een stap vooruit op het gebied van audiomodellering, waarbij innovatieve methodologieën worden gecombineerd met praktische verbeteringen voor betere prestaties in spraaktoepassingen.

API-beschikbaarheid

Deze nieuwe audiomodellen zijn nu beschikbaar voor alle ontwikkelaars. Lees hier(opent in een nieuw venster) meer over bouwen met audio. Voor developers die al conversatie-ervaringen bouwen met tekstmodellen, is het toevoegen van onze speech-to-text- en text-to-speech-modellen de eenvoudigste manier om een spraakagent te maken. We brengen een integratie uit met de Agents SDK(opent in een nieuw venster) die dit ontwikkelingsproces vereenvoudigt. Voor developers die snelle spraak-naar-spraakervaringen willen bouwen, raden we aan gebruik te maken van onze spraak-naar-spraak-modellen in de Realtime API.

Wat volgt er?

Vooruitkijkend blijven we investeren in het verbeteren van de intelligentie en nauwkeurigheid van onze audiomodellen. Ook onderzoeken we manieren waarop developers hun eigen aangepaste stemmen kunnen inbrengen voor nog persoonlijkere ervaringen, uiteraard op een manier die in lijn is met onze veiligheidsstandaarden. Daarnaast blijven we in gesprek met beleidsmakers, onderzoekers, developers en creatieve professionals over de uitdagingen én kansen die synthetische stemmen met zich meebrengen. We kijken ernaar uit om de innovatieve en creatieve toepassingen te zien die developers zullen bouwen met deze verbeterde audiomogelijkheden. Ook zullen we blijven investeren in andere modaliteiten (waaronder video) om ontwikkelaars in staat te stellen complete, multimodale agent-ervaringen te ontwikkelen.

Herhaling van livestream

Auteurs

OpenAI

Onderzoeksleiders

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Deelnemers

Onderzoek

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Engineering

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Product

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Leiderschapssponsors

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry