Præsentation af den næste generation af lydmodeller i API'en
En ny suite af lydmodeller til at drive stemmeagenter, nu tilgængelig for udviklere over hele verden.

Opdatering den 28. august 2025: Vi annoncerede den generelle tilgængelighed af Realtime API. Læs mere her.
I løbet af de seneste måneder har vi investeret i at forbedre intelligensen, kapaciteten og nytteværdien af tekstbaserede agenter – eller systemer, der uafhængigt udfører opgaver på vegne af brugerne – med udgivelser som Operator, Deep Research, Computer-Using Agents og Responses API med indbyggede værktøjer. For at agenter skal være virkelig nyttige, skal folk imidlertid kunne have dybere og mere intuitive interaktioner med agenterne, der går ud over blot tekst – ved at bruge naturligt talesprog til at kommunikere effektivt.
I dag lancerer vi nye tale-til-tekst- og tekst-til-tale-lydmodeller i API'en, hvilket gør det muligt at udvikle mere kraftfulde, tilpassede og intelligente stemmeagenter, der tilbyder reel værdi. Vores nyeste tale-til-tekst-modeller sætter en ny standard for det nyeste inden for området og overgår eksisterende løsninger i nøjagtighed og pålidelighed – især i udfordrende scenarier med accenter, støjende omgivelser og varierende talhastigheder. Disse forbedringer øger transskriptionens pålidelighed, hvilket gør modellerne særligt velegnede til brugssituationer som kundecentre, transskription af mødenotater og meget mere.
For første gang kan udviklere også instruere tekst-til-tale-modellen i at tale på en bestemt måde – for eksempel “tal som en sympatisk kundeservicemedarbejder” – hvilket åbner op for et nyt niveau af tilpasning for stemmeagenter. Dette muliggør en bred vifte af skræddersyede applikationer, fra mere empatiske og dynamiske kundeservicestemmer til udtryksfuld fortælling for kreative historiefortællingsoplevelser.
Vi lancerede vores første lydmodel i 2022, og siden da har vi forpligtet os til at forbedre intelligensen, nøjagtigheden og pålideligheden af disse modeller. Med disse nye lydmodeller kan udviklere bygge mere præcise og robuste tale-til-tekst-systemer og udtryksfulde, karakterfulde tekst-til-tale-stemmer – alt sammen inden for API'en.
Vi introducerer nye gpt-4o-transcribe- og gpt-4o-mini-transcribe-modeller med forbedringer i ordfejlrate samt bedre sproggenkendelse og nøjagtighed sammenlignet med de oprindelige Whisper-modeller.
gpt-4o-transcribe viser forbedret Word Error Rate (WER)-ydeevne i forhold til eksisterende Whisper-modeller på tværs af flere etablerede benchmarks, hvilket afspejler betydelige fremskridt inden for vores tale-til-tekst-teknologi. Disse fremskridt stammer direkte fra målrettede innovationer inden for forstærkende læring og omfattende midttræning med mangfoldige, høj-kvalitets lyddata.
Som et resultat kan disse nye tale-til-tekst-modeller bedre fange nuancer i tale, reducere fejlgenkendelser og øge transskriptionspålideligheden, især i udfordrende scenarier med accenter, støjende omgivelser og varierende taletempo. Disse modeller er nu tilgængelige i tale-til-tekst API(åbner i et nyt vindue).
Word Error Rate (WER – ordfejlrate) måler nøjagtigheden af talegenkendelsesmodeller ved at beregne procentdelen af forkert transskriberede ord i forhold til en referencetransskription – jo lavere WER, desto bedre og færre fejl. Vores nyeste tale-til-tekst-modeller opnår lavere WER på tværs af benchmarks, herunder FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) – et flersproget tale-benchmark, der omfatter over 100 sprog ved hjælp af manuelt transskriberede lydprøver. Disse resultater viser en stærkere transskriptionsnøjagtighed og en mere robust sprogunderstøttelse. Som vist her overgår vores modeller konsekvent Whisper v2 og Whisper v3 i alle sprogevalueringer.
På FLEURS leverer vores modeller lavere WER og stærk flersproget præstation. Lavere WER er bedre og betyder færre fejl. Som vist her matcher eller overgår vores modeller andre førende modeller på tværs af de fleste store sprog.
Vi lancerer også en ny gpt-4o-mini-tts-model med bedre styrbarhed. For første gang kan udviklere “instruere” modellen ikke kun i, hvad den skal sige, men hvordan den skal sige det – hvilket muliggør mere skræddersyede oplevelser til anvendelser, der spænder fra kundeservice til kreativ historiefortælling. Modellen er tilgængelig i tekst-til-tale-API(åbner i et nyt vindue). Bemærk, at disse tekst-til-tale-modeller er begrænset til kunstige, forudindstillede stemmer, som vi overvåger for at sikre, at de konsekvent matcher de syntetiske forudindstillinger.
Vores nye lydmodeller bygger videre på GPT‑4o‑ og GPT‑4o‑mini‑arkitekturerne og er i vid udstrækning fortrænet på specialiserede, lydcentrerede datasæt, som har været afgørende for at optimere modellens ydeevne. Denne målrettede tilgang giver dybere indsigt i nuancer i tale og muliggør enestående præstationer på tværs af lydrelaterede opgaver.
Vi har forbedret vores destillationsteknikker, hvilket muliggør videnoverførsel fra vores største lydmodeller til mindre, mere effektive modeller. Ved hjælp af avancerede selvspilmetoder fanger vores destillationsdatasæt effektivt realistiske samtaledynamikker og replikerer ægte interaktioner mellem brugere og assistenter. Dette hjælper vores mindre modeller med at levere fremragende samtalekvalitet og hurtig responsivitet.
Til vores tale-til-tekst-modeller har vi integreret et paradigme med stor vægt på forstærkende læring (RL), hvilket har løftet transskriptionsnøjagtigheden til banebrydende niveauer. Denne metode forbedrer præcisionen dramatisk og reducerer hallucination, hvilket gør vores tale-til-tekst-løsninger ekstremt konkurrencedygtige i komplekse talegenkendelsesscenarier.
Disse udviklinger repræsenterer fremskridt inden for audiomodellering, hvor innovative metoder kombineres med praktiske forbedringer for at forbedre ydeevnen i taleapplikationer.
Disse nye lydmodeller er nu tilgængelige for alle udviklere – læs mere om at bygge med lyd her(åbner i et nyt vindue). For udviklere, der allerede bygger samtaleoplevelser med tekstbaserede modeller, er det den enkleste måde at bygge en agent på ved at tilføje vores tale-til-tekst- og tekst-til-tale-modeller. Vi lancerer en integration med Agents SDK(åbner i et nyt vindue), som forenkler denne udviklingsproces. For udviklere, der ønsker at skabe tale-til-tale-oplevelser med lav latenstid, anbefaler vi at bruge vores tale-til-tale-modeller i Realtime API.
Når vi ser fremad, planlægger vi at fortsætte med at investere i at forbedre intelligensen og nøjagtigheden af vores lydmodeller og udforske måder, hvorpå udviklere kan bringe deres egne brugerdefinerede stemmer for at skabe endnu mere personlige oplevelser, der stemmer overens med vores sikkerhedsstandarder. Derudover fortsætter vi med at indgå i samtaler med beslutningstagere, forskere, udviklere og kreative om de udfordringer og muligheder, som syntetiske stemmer kan præsentere. Vi er spændte på at se de innovative og kreative applikationer, som udviklere vil bygge ved hjælp af disse forbedrede lydfunktioner. Vi vil også investere i andre modaliteter – herunder video – for at gøre det muligt for udviklere at skabe multimodale agentoplevelser.
Forfattere
Forskningsledere
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Bidragsydere
Research
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Ingeniørarbejde
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produkt
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Sponsorater fra ledelsen
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry