Tutvustame API-s järgmise põlvkonna helimudeleid
Uus helimudelite komplekt, mis toetab hääleagente, on nüüd saadaval arendajatele üle kogu maailma.

Värskendus 28. augustil 2025: teatasime Realtime API üldisest kättesaadavusest. Loe lähemalt siit.
Viimaste kuude jooksul oleme investeerinud tekstipõhiste agentide – või süsteemide, mis täidavad kasutajate nimel iseseisvalt ülesandeid – intelligentsuse, võimekuse ja kasulikkuse edendamisse, tuues välja sellised väljalasked nagu Operator, süvauuring, arvuti kasutamise agendid ja Responses API sisseehitatud tööriistadega. Kuid selleks, et agendid oleksid tõeliselt kasulikud, peavad inimesed saama agentidega pidada sügavamaid ja intuitiivsemaid suhtlusi, mitte ainult teksti kaudu, kasutades loomulikku kõnekeelt, et tõhusalt suhelda.
Täna tutvustame API-s uusi kõnest tekstiks ja tekstist kõneks helimudeleid – see võimaldab luua võimsamaid, kohandatavamaid ja intelligentsemaid häälagente, mis pakuvad tõelist väärtust. Meie uusimad kõnest tekstiks muundamise mudelid seavad uue tipptaseme etaloni, ületades olemasolevaid lahendusi täpsuse ja usaldusväärsuse poolest—eriti keerulistes olukordades, mis hõlmavad aktsente, mürarikkaid keskkondi ja erinevaid kõnetempoid. Need täiustused suurendavad transkriptsiooni usaldusväärsust, muutes mudelid eriti hästi sobivaks kasutusjuhtudeks, nagu kliendikõnekeskused, koosolekumärkmete transkribeerimine ja palju muud.
Esimest korda saavad arendajad juhendada tekst kõneks mudelit rääkima kindlal viisil – näiteks „räägi nagu kaastundlik klienditeeninduse agent“ –, avades hääleagentide jaoks uue kohandamise taseme. See võimaldab laia valikut kohandatud rakendusi, alates empaatilisematest ja dünaamilisematest klienditeeninduse häältest kuni väljendusrikka jutustamiseni loovate jutustamiskogemuste jaoks.
Käivitasime oma esimese helimudeli 2022 ja sellest ajast alates oleme pühendunud nende mudelite intelligentsuse, täpsuse ja usaldusväärsuse parandamisele. Nende uute helimudelite abil saavad arendajad luua täpsemaid ja töökindlamaid kõnest tekstiks süsteeme ning väljendusrikkaid, isikupäraseid tekstist kõneks hääli – kõik API kaudu.
Tutvustame uusi gpt-4o-transcribe ja gpt-4o-mini-transcribe mudeleid, millel on võrreldes algsete Whisper mudelitega väiksem sõnavigade määr ning parem keele tuvastus ja täpsus.
gpt-4o-transcribe näitab paremat Word Error Rate'i (WER) tulemuslikkust võrreldes olemasolevate Whisperi mudelitega mitmetes väljakujunenud võrdlusalustes, peegeldades märkimisväärset edasiminekut meie kõnest tekstiks tehnoloogias. Need edusammud tulenevad otseselt sihipärastest uuendustest kinnistavas õppimises ja ulatuslikust vahetreeningust mitmekesiste, kvaliteetsete heliandmestikega.
Selle tulemusena suudavad need uued kõnest tekstiks mudelid paremini tabada kõne nüansse, vähendada valesti tuvastamisi ja suurendada transkriptsiooni usaldusväärsust, eriti keerulistes olukordades, mis hõlmavad aktsente, mürarikkaid keskkondi ja erinevaid kõnetempoid. Need mudelid on nüüd saadaval kõnest-tekstiks API-s(avaneb uues aknas).
Word Error Rate (WER) mõõdab kõnetuvastusmudelite täpsust, arvutades valesti transkribeeritud sõnade protsendi võrreldes võrdlustranskriptsiooniga – mida madalam on WER, seda parem, ja see tähendab vähem vigu. Meie uusimad kõnest tekstiks muundamise mudelid saavutavad madalama WER-i erinevates võrdluskomplektides, sealhulgas FLEURS (väheste näidetega õppimise universaalsete kõne-esituste hindamine)—mitmekeelne kõne võrdluskomplekt, mis hõlmab üle 100 keele ja kasutab käsitsi transkribeeritud helinäidiseid. Need tulemused näitavad suuremat transkriptsiooni täpsust ja tugevamat keelelist katvust. Nagu siin näidatud, ületavad meie mudelid järjekindlalt Whisper v2 ja Whisper v3 kõigis keelehindamistes.
FLEURS-is pakuvad meie mudelid madalamat sõnavea määra (WER) ja tugevat mitmekeelset tulemuslikkust. Mida madalam WER, seda parem ja see tähendab vähem vigu. Nagu siin näidatud, on meie mudelid võrreldavad teiste juhtivate mudelitega või ületavad neid enamiku peamiste keelte puhul.
Samuti lansseerime uue gpt-4o-mini-tts mudeli, millel on parem juhitavus. Esimest korda saavad arendajad mudelit “juhendada” mitte ainult selles, mida öelda, vaid ka kuidas seda öelda, võimaldades rohkem kohandatud kogemusi kasutusjuhtumite jaoks alates klienditeenindusest kuni loomingulise jutustamiseni. Mudel on saadaval tekst kõneks API-s(avaneb uues aknas). Pane tähele, et need tekstist kõneks mudelid on piiratud tehislike, eelseadistatud häältega, mida me jälgime, et tagada nende järjepidev vastavus sünteetilistele eelseadistustele.
Meie uued helimudelid tuginevad GPT‑4o ja GPT‑4o‑mini arhitektuuridele ning on põhjalikult eelkoolitatud spetsialiseeritud helikesksetel andmestikel, mis on olnud kriitilise tähtsusega mudelite jõudluse optimeerimisel. See sihipärane lähenemine pakub sügavamat arusaama kõne nüanssidest ja võimaldab erakordset jõudlust heliga seotud ülesannetes.
Oleme täiustanud oma destilleerimistehnikaid, mis võimaldavad teadmiste ülekandmist meie suurimatelt helimudelitelt väiksematele ja tõhusamatele mudelitele. Kasutades täiustatud iseõppimise metoodikaid, suudavad meie destilleerimisandmestikud tõhusalt tabada realistlikku vestlusdünaamikat, jäljendades ehtsaid kasutaja-assistendi suhtlusi. See aitab meie väiksematel mudelitel pakkuda suurepärast vestluskvaliteeti ja reageerimisvõimet.
Meie kõnest-tekstiks mudelite jaoks oleme integreerinud tugeva kinnistava õppimise (RL) paradigma, mis tõstab transkriptsiooni täpsuse tipptasemele. See metoodika parandab märkimisväärselt täpsust ja vähendab hallutsinatsioone, muutes meie kõnest-tekstiks lahendused erakordselt konkurentsivõimeliseks keerulistes kõnetuvastuse stsenaariumides.
Need arengud tähistavad edusamme audiomodelleerimise valdkonnas, ühendades uuenduslikud metoodikad praktiliste täiustustega, et parandada jõudlust kõnerakendustes.
Need uued helimudelid on nüüd saadaval kõigile arendajatele – rohkem heliga arendamise kohta leidub siin(avaneb uues aknas). Arendajatele, kes juba loovad tekstipõhiste mudelitega vestluskogemusi, on meie kõnest tekstiks ja tekstist kõneks mudelite lisamine lihtsaim viis häälagendi loomiseks. Avaldame integratsiooni Agents SDK(avaneb uues aknas) -ga, mis lihtsustab seda arendusprotsessi. Arendajatele, kes soovivad luua madala latentsusajaga kõnest-kõneks kogemusi, soovitame kasutada meie kõnest-kõneks mudeleid Realtime API-s.
Tulevikku vaadates plaanime jätkata investeerimist oma mudelite intelligentsuse ja täpsuse parandamisse ning uurida viise, kuidas arendajad saaksid tuua oma kohandatud hääled, et luua veelgi isikupärasemaid kogemusi, mis vastavad meie ohutusstandarditele. Lisaks jätkame vestlusi poliitikakujundajate, teadlaste, arendajate ja loomeinimestega sünteetiliste häältega kaasnevate väljakutsete ja võimaluste üle. Meil on põnev näha, milliseid uuenduslikke ja loovaid rakendusi arendajad nende täiustatud helivõimaluste abil loovad. Samuti investeerime teistesse modaalsustesse, sealhulgas video, et võimaldada arendajatel luua multimodaalseid agentseid kogemusi.
Autorid
Uurimistöö juhid
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Kaastöötajad
Teadustöö
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Inseneriteadus
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Toode
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Juhtkonna sponsorid
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry