Predstavljanje modela zvuka sljedeće generacije u API-ju
Novi paket audio modela za pokretanje glasovnih agenata, sada je dostupan programerima diljem svijeta.

Ažuriranje od 28. kolovoza 2025.: Najavili smo opću dostupnost Realtime API-ja. Saznajte više ovdje.
Tijekom posljednjih nekoliko mjeseci uložili smo u unaprjeđenje inteligencije, mogućnosti i korisnosti tekstualnih agenata — odnosno sustava koji samostalno izvršavaju zadatke u ime korisnika — uz izdanja kao što su Operator, Dubinsko istraživanje, Agenti koji koriste računalo te Responses API s ugrađenim alatima. No da bi agenti bili zaista korisni, ljudi trebaju imati dublje i intuitivnije interakcije s agentima, ne samo putem teksta — koristeći prirodni govorni jezik za učinkovitu komunikaciju.
Danas predstavljamo nove audio modele za pretvaranje govora u tekst i teksta u govor u API-ju — što omogućuje izradu snažnijih, prilagodljivijih i inteligentnijih glasovnih agenata koji pružaju stvarnu vrijednost. Naši najnoviji modeli za pretvaranje govora u tekst postavljaju novo mjerilo vrhunskih postignuća, jer nadmašuju postojeća rješenja u točnosti i pouzdanosti — posebno u izazovnim scenarijima s naglascima, bučnim okruženjima i različitim brzinama govora. Ta poboljšanja povećavaju pouzdanost transkripcije što modele čini posebno prikladnima za primjene kao što su korisnički pozivni centri, transkripcija bilješki sa sastanaka i druge.
Po prvi put, razvojni inženjeri mogu također uputiti model za pretvaranje teksta u govor da govori na specifičan način — na primjer, „govorite kao suosjećajan agent korisničke podrške“ — što otključava novu razinu prilagodbe za glasovne agente. To omogućuje širok raspon prilagođenih primjena, od empatičnijih i dinamičnijih glasova korisničke podrške do izražajnog pripovijedanja za kreativna iskustva pripovijedanja.
Pokrenuli smo naš prvi audio model 2022. godine i od tada smo posvećeni poboljšanju inteligencije, točnosti i pouzdanosti tih modela. S ovim novim audio modelima, programeri mogu izraditi preciznije i robusnije sustave za pretvaranje govora u tekst te izražajne i karakterne glasove za pretvaranje teksta u govor — i sve to unutar API-ja.
Predstavljamo nove modele gpt-4o-transcribe i gpt-4o-mini-transcribe s poboljšanjima u stopi pogrešaka u riječima, boljim prepoznavanjem jezika i većom točnošću u usporedbi s izvornim modelima Whisper.
Model gpt-4o-transcribe pokazuje poboljšanu izvedbu stope pogrešaka riječi (WER) u odnosu na postojeće Whisper modele na više etabliranih mjerila, što predstavlja značajan napredak u našoj tehnologiji pretvaranja govora u tekst. Ta poboljšanja izravno proizlaze iz ciljanih inovacija u učenju s potkrepljivanjem i opsežnog srednjeg treniranja s raznolikim, visokokvalitetnim skupovima audio podataka.
Kao rezultat toga, ti novi modeli za pretvaranje govora u tekst mogu bolje prepoznati nijanse govora, smanjiti pogrešna prepoznavanja i povećati pouzdanost transkripcije, posebno u izazovnim situacijama koje uključuju naglaske, bučna okruženja i različite brzine govora. Ti modeli sada su dostupni u API-ju za pretvaranje govora u tekst(otvara se u novom prozoru).
Stopa pogrešaka riječi (WER) mjeri točnost modela za prepoznavanje govora izračunavanjem postotka pogrešno transkribiranih riječi u usporedbi s referentnim transkriptom — niža WER vrijednost je bolja i znači manje pogrešaka. Naši najnoviji modeli za pretvaranje govora u tekst postižu niži WER u svim referentnim testovima, uključujući FLEURS (eng. Few-shot Learning Evaluation of Universal Representations of Speech ili Evaluacija učenja s malim brojem primjera univerzalnih reprezentacija govora) — višejezični referentni test govora koji obuhvaća više od 100 jezika i koristi ručno transkribirane audio uzorke. Ovi rezultati pokazuju veću točnost transkripcije i robusniju jezičnu pokrivenost. Kao što je ovdje prikazano, naši modeli dosljedno nadmašuju Whisper v2 i Whisper v3 u svim jezičnim evaluacijama.
Na FLEURS-u, naši modeli postižu nižu stopu pogreške riječi (WER) i snažne višejezične performanse. Niži WER je bolji i znači manje pogrešaka. Kao što je ovdje prikazano, naši modeli se podudaraju ili nadmašuju druge vodeće modele u većini velikih jezika.
Uz to uvodimo i novi model gpt-4o-mini-tts s boljom mogućnošću upravljanja. Po prvi put, razvojni inženjeri mogu „uputiti” model ne samo o tome što reći, već kako će to reći — što omogućuje bolje prilagođena iskustva za slučajeve korištenja od korisničke službe do kreativnog pripovijedanja. Model je dostupan u API-ju za pretvaranje teksta u govor(otvara se u novom prozoru). Imajte na umu da su ti modeli za pretvaranje teksta u govor ograničeni na umjetne, unaprijed zadane glasove koje nadziremo kako bismo osigurali da dosljedno odgovaraju sintetičkim postavkama.
Naši novi audio modeli temelje se na arhitekturama GPT‑4o i GPT‑4o‑mini te su opsežno prethodno trenirani na specijaliziranim skupovima podataka usmjerenima na zvuk, koji su bili ključni za optimizaciju performansi modela. Takav ciljani pristup pruža dublji uvid u nijanse govora i omogućuje izvanredne performanse u zadacima povezanim s audio sadržajem.
Poboljšali smo naše tehnike destilacije, što omogućuje prijenos znanja s naših najvećih audio modela na manje i učinkovitije modele. Korištenjem naprednih metodologija samostalnog učenja, naši skupovi podataka za destilaciju učinkovito bilježe realističnu dinamiku razgovora, čime repliciraju autentične interakcije između korisnika i pomoćnika. To našim manjim modelima pomaže osigurati izvrsnu kvalitetu razgovora i odzivnost.
Za naše modele za pretvaranje govora u tekst integrirali smo paradigmu snažno usmjerenu na učenje s potkrepljivanjem (RL), čime smo točnost transkripcije podigli na razinu najmodernijih rješenja. Takva metodologija značajno poboljšava preciznost i smanjuje pojavu halucinacija, što naša rješenja za pretvaranje govora u tekst čini iznimno konkurentnima u složenim scenarijima prepoznavanja govora.
Ti razvojni koraci predstavljaju napredak u području audio modeliranja, kombinirajući inovativne metodologije s praktičnim poboljšanjima za bolje performanse u govornim aplikacijama.
Ti novi audio modeli sada su dostupni svim razvojnim inženjerima – više o izradi s audio ovdje(otvara se u novom prozoru). Za razvojne inženjere koji već izrađuju konverzacijska iskustva s modelima temeljenima na tekstu, dodavanje naših modela za pretvaranje govora u tekst i teksta u govor najjednostavniji je način za izradu glasovnog agenta. Objavljujemo integraciju s Agents SDK-om(otvara se u novom prozoru) koja pojednostavljuje razvojni proces. Za razvojne programere koji žele izraditi iskustva s niskom latencijom u pretvaranju govora u govor, preporučujemo upotrebu naših modela za pretvaranje govora u govor u Realtime API-ju.
Gledajući unaprijed, planiramo nastaviti ulagati u poboljšanje inteligencije i točnosti naših audio modela te istraživati načine kako omogućiti programerima da koriste vlastite prilagođene glasove za izgradnju još više personaliziranih iskustava, u skladu s našim sigurnosnim standardima. Osim toga, nastavljamo sudjelovati u razgovorima s kreatorima politika, istraživačima, razvojnim inženjerima i kreativcima o izazovima i prilikama koje sintetički glasovi mogu donijeti. Veselimo se vidjeti inovativne i kreativne aplikacije koje će programeri razviti upotrebom te poboljšane audio mogućnosti. Osim toga, ulagat ćemo u druge modalitete — uključujući video — kako bismo programerima omogućili stvaranje multimodalnih agentnih iskustava.
Autori
Voditelji istraživanja
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Suradnici
Istraživanje
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Inženjerstvo
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Proizvod
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Pokrovitelji vodstva
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry