Hopp til hovedinnhold
OpenAI

20. mars 2025

UtgivelseProdukt

Vi presenterer neste generasjons lydmodeller i API-en

En ny serie med lydmodeller for å drive taleagenter er nå tilgjengelig for utviklere over hele verden.

Heltebilde av OpenAIs neste generasjons lydmodeller
Laster inn …

Oppdatering 28. august 2025: Vi kunngjorde den generelle tilgjengeligheten av Realtime API. Finn ut mer her.


I løpet av de siste månedene har vi investert i å videreutvikle intelligensen, kapasitetene og nytteverdien til tekstbaserte agenter–eller systemer som uavhengig utfører oppgaver på vegne av brukere–med lanseringer som Operator, dyp forskning, datamaskinbrukende agenter og Responses API med innebygde verktøy. Men for at agenter skal være virkelig nyttige, må folk kunne ha dypere, mer intuitive interaksjoner med agenter utover bare tekst–ved å bruke naturlig talespråk for å kommunisere effektivt.

I dag lanserer vi nye tale-til-tekst- og tekst-til-tale-lydmodeller i API–noe som gjør det mulig å bygge kraftigere, tilpassbare og intelligente taleagenter som gir ekte verdi. Våre nyeste tale-til-tekst-modeller setter en ny banebrytende standard, og overgår eksisterende løsninger i nøyaktighet og pålitelighet–spesielt i utfordrende scenarier med aksenter, støyende omgivelser og varierende talehastigheter. Disse forbedringene øker påliteligheten til transkripsjoner, noe som gjør modellene spesielt godt egnet for bruksområder som kundesentre, transkripsjon av møtenotater og mer.

For første gang kan utviklere også instruere tekst-til-tale-modellen til å snakke på en bestemt måte–for eksempel «snakk som en sympatisk kundeservicemedarbeider»–og dermed åpne for et nytt nivå av tilpasning for taleagenter. Dette muliggjør et bredt spekter av skreddersydde applikasjoner, fra mer empatiske og dynamiske kundeservicestemmer til uttrykksfull fortellerstemme for kreative, opplevelsesbaserte historiefortellinger.

Vi lanserte vår første lydmodell i 2022, og siden den gang har vi forpliktet oss til å forbedre intelligensen, nøyaktigheten og påliteligheten til disse modellene. Med disse nye lydmodellene kan utviklere utvikle mer nøyaktige og robuste tale-til-tekst-systemer og uttrykksfulle, karaktersterke tekst-til-tale-stemmer–alt innenfor API.

Beroligende
Surfer
Profesjonellt
Middelalderridder
True crime-entusiast
Godnatthistorie

Mer om våre nyeste lydmodeller

Nye tale-til-tekst-modeller

Vi introduserer de nye modellene gpt-4o-transcribe og gpt-4o-mini-transcribe med forbedringer i ordfeilrate og bedre språkgjenkjenning og nøyaktighet, sammenlignet med de opprinnelige Whisper-modellene.

gpt-4o-transcribe viser forbedret ytelse i forhold til Word Error Rate (WER) sammenlignet med eksisterende Whisper-modeller på tvers av flere etablerte referansemålinger, noe som gjenspeiler betydelig fremgang i vår tale-til-tekst-teknologi. Disse fremskrittene stammer direkte fra målrettede innovasjoner innenfor forsterkende læring og omfattende mellomtrening med mangfoldige, høykvalitets lyddata.

Som et resultat av dette, kan disse nye tale-til-tekst-modellene bedre fange opp talenyanser, redusere feilgjenkjenninger og øke transkripsjonspåliteligheten, spesielt i utfordrende scenarier som involverer aksenter, støyende miljøer og varierende talehastigheter. Disse modellene er nå tilgjengelige i tale-til-tekst-API(åpnes i et nytt vindu).

Word Error Rate (WER) måler nøyaktigheten til talegjenkjenningsmodeller ved å beregne prosentandelen av feilaktig transkriberte ord sammenlignet med en referansetranskript–lavere WER er bedre og betyr færre feil. Våre nyeste tale-til-tekst-modeller oppnår lavere WER på tvers av referansepunkter, inkludert FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech)–en flerspråklig referansemåling for tale som dekker over 100 språk ved bruk av manuelt transkriberte lydprøver. Disse resultatene viser sterkere transkripsjonsnøyaktighet og mer robust språkdekning. Som vist her, overgår modellene våre konsekvent Whisper v2 og Whisper v3 i alle språkevalueringer.

På FLEURS gir modellene våre lavere WER og sterk flerspråklig ytelse. Lavere WER er bedre og betyr færre feil. Som vist her, stemmer modellene overens eller overgår våre andre ledende modeller på tvers av de fleste hovedspråk.

Ny tekst-til-tale-modell

Vi lanserer også en ny gpt-4o-mini-tts -modell med bedre styrbarhet. For første gang kan utviklere «instruere» modellen, og ikke bare hva den skal si, men hvordan den skal si det–noe som muliggjør mer tilpassede opplevelser for bruksområder som fra kundeservice til kreativ historiefortelling. Modellen er tilgjengelig i tekst-til-tale-API(åpnes i et nytt vindu). Merk at disse tekst-til-tale-modellene er begrenset til kunstige, forhåndsinnstilte stemmer, som vi overvåker for å sikre at de konsekvent samsvarer med syntetiske forhåndsinnstillinger.

Tekniske innovasjoner bak modellene

Forhåndstrening med autentiske lyddatasett

Våre nye lydmodeller bygger på GPT‑4o‑ og GPT‑4o‑mini‑arkitekturene, og er omfattende forhåndstrent på spesialiserte, lydsentrerte datasett, som har vært avgjørende for å optimalisere ytelsen til modellene. Denne målrettede tilnærmingen gir dypere innsikt i talenyanser, og muliggjør enestående ytelse på tvers av lydrelaterte oppgaver.

Avanserte destilleringsmetoder

Vi har forbedret destilleringsteknikkene våre, slik at vi kan overføre kunnskap fra våre største lydmodeller til mindre, mer effektive modeller. Ved å utnytte avanserte selvspillsmetoder fanger destilleringsdatasettene våre effektivt realistiske samtaledynamikker og gjenskaper ekte interaksjoner mellom brukere og assistenter. Dette hjelper de mindre modellene våre med å levere utmerket samtalekvalitet og respons.

Paradigme for forsterkende læring

For våre tale-til-tekst-modeller har vi integrert et paradigme med tung vekt på forsterkende læring (RL), som har presset transkripsjonsnøyaktigheten til toppmoderne nivåer. Denne metoden forbedrer presisjonen dramatisk og reduserer feilgjenkjenning, noe som gjør våre tale-til-tekst-løsninger eksepsjonelt konkurransedyktige i komplekse talegjenkjenningsscenarier.

Disse utviklingene representerer fremskritt innen lydmodellering, og kombinerer innovative metoder med praktiske forbedringer for bedre ytelse i taleapplikasjoner.

API-tilgjengelighet

Disse nye lydmodellene er nå tilgjengelige for alle utviklere – mer om utvikling basert på lyd her(åpnes i et nytt vindu). For utviklere som allerede utvikler samtaleopplevelser med tekstbaserte modeller, er det enkleste å legge til våre tale-til-tekst- og tekst-til-tale-modeller for å utvikle en stemmeagent. Vi lanserer en integrasjon med Agents SDK(åpnes i et nytt vindu) som forenkler denne utviklingsprosessen. For utviklere som ønsker å lage tale-til-tale-opplevelser med lav ventetid, anbefaler vi å bruke tale-til-tale-modellene våre i Realtime API.

Hva skjer videre?

I fremtiden planlegger vi fortsatt å investere i å forbedre intelligensen og nøyaktigheten til lydmodellene våre, samt utforske måter som gjør det mulig for utviklere å bruke sine egne tilpassede stemmer for å skape enda mer personlig tilpassede opplevelser, på måter som samsvarer med våre sikkerhetsstandarder. I tillegg fortsetter vi å delta i samtaler med beslutningstakere, forskere, utviklere og kreative om utfordringene og mulighetene syntetiske stemmer kan innebære. Vi gleder oss til å se de innovative og kreative applikasjonene utviklere vil bygge ved hjelp av disse forbedrede lydfunksjonene. Vi vil også investere i andre modaliteter–inkludert video–for å gjøre det mulig for utviklere å bygge multimodale agentopplevelser.

Avspilling av direktesending

Forfattere

OpenAI

Forskningsledere

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Bidragsytere

Research

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Teknisk arbeid

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkt

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Lederskapsstøtte

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry