Preskočite na glavni sadržaj
OpenAI

20. mart 2025.

ObjavljivanjeProduct

Predstavljanje audio modela sljedeće generacije u API-ju

Novi set audio modela za pokretanje glasovnih agenata, sada dostupan programerima širom svijeta.

Herojska slika bloga OpenAI o audio modelima sljedeće generacije
Učitavanje…

Ažuriranje 28. augusta 2025.: Najavili smo opštu dostupnost Realtime API-ja. Saznajte više ovdje.


Tokom proteklih nekoliko mjeseci, investirali smo u unapređenje inteligencije, sposobnosti i korisnosti tekstualnih agenata—ili sistema koji samostalno izvršavaju zadatke u ime korisnika—uz izdanja kao što su Operator, Duboko istraživanje, Agenti koji koriste računalo i Responses API s ugrađenim alatima. Međutim, da bi agenti bili zaista korisni, ljudi trebaju imati mogućnost dubljih, intuitivnijih interakcija s agentima, ne samo putem teksta—koristeći prirodni govorni jezik za efikasnu komunikaciju.

Danas pokrećemo nove modele za pretvaranje govora u tekst i teksta u govor u API-ju—što omogućava kreiranje moćnijih, prilagodljivijih i inteligentnijih glasovnih agenata koji pružaju stvarnu vrijednost. Naši najnoviji modeli za pretvaranje govora u tekst postavljaju novi standard u industriji, nadmašujući postojeća rješenja u tačnosti i pouzdanosti—posebno u izazovnim situacijama koje uključuju akcente, bučna okruženja i različite brzine govora. Ova poboljšanja povećavaju pouzdanost transkripcije, čineći modele posebno pogodnim za slučajeve upotrebe kao što su korisnički centri za pozive, transkripcija bilješki sa sastanaka i još mnogo toga.

Po prvi put, programeri mogu uputiti model za pretvaranje teksta u govor da govori na specifičan način—na primjer, „govori kao suosjećajan agent korisničke podrške“—otvarajući novi nivo prilagodbe za glasovne agente. Ovo omogućava širok spektar prilagođenih aplikacija, od empatičnijih i dinamičnijih glasova korisničke podrške do izražajne naracije za kreativna iskustva pripovijedanja.

Pokrenuli smo naš prvi audio model u 2022. i od tada smo se posvetili poboljšanju inteligencije, tačnosti i pouzdanosti ovih modela. Uz ove nove audio modele, programeri mogu kreirati preciznije i robusnije sisteme za prepoznavanje govora i izražajne, karakteristične glasove za sintetizaciju govora—sve unutar API-ja.

Smireno
Surfer
Profesionalno
Srednjovjekovni vitez
Ljubitelj istinitih zločina
Priča za laku noć

Više o našim najnovijim audio modelima

Novi modeli pretvaranja govora u tekst

Predstavljamo nove modele gpt-4o-transcribe i gpt-4o-mini-transcribe s poboljšanjima u stopi grešaka u riječima, boljim prepoznavanjem jezika i većom tačnošću u poređenju s originalnim Whisper modelima.

gpt-4o-transcribe pokazuje poboljšane performanse u pogledu Word Error Rate (WER) u odnosu na postojeće Whisper modele na više etabliranih mjerila, što odražava značajan napredak u našoj tehnologiji pretvaranja govora u tekst. Ova poboljšanja proizlaze direktno iz ciljanih inovacija u učenju s potkrepljivanjem i opsežnog srednjeg treniranja s raznolikim, visokokvalitetnim audio skupovima podataka.

Kao rezultat, ovi novi modeli za pretvaranje govora u tekst mogu bolje uhvatiti nijanse govora, smanjiti pogrešna prepoznavanja i povećati pouzdanost transkripcije, posebno u izazovnim situacijama s akcentima, bučnim okruženjima i različitim brzinama govora. Ovi modeli su sada dostupni u API-ju za prepoznavanje govora(otvara se u novom prozoru).

Stopa grešaka riječi (WER) mjeri tačnost modela za prepoznavanje govora izračunavanjem postotka pogrešno transkribiranih riječi u odnosu na referentni transkript—niži WER je bolji i znači manje grešaka. Naši najnoviji modeli za pretvaranje govora u tekst postižu niži WER na različitim referentnim testovima, uključujući FLEURS (Učenje s malim brojem primjera univerzalnih reprezentacija govora)—multijezični referentni test govora koji obuhvata više od 100 jezika koristeći ručno transkribovane audio uzorke. Ovi rezultati pokazuju veću tačnost transkripcije i robusniju pokrivenost jezika. Kao što je ovdje prikazano, naši modeli dosljedno nadmašuju Whisper v2 i Whisper v3 u svim jezičkim evaluacijama.

Na FLEURS-u, naši modeli postižu nižu stopu greške riječi (WER) i snažne višejezične performanse. Niži WER je bolji i znači manje grešaka. Kao što je ovdje prikazano, naši modeli se podudaraju ili nadmašuju druge vodeće modele u većini glavnih jezika.

Novi model pretvaranja teksta u govor

Također lansiramo novi gpt-4o-mini-tts model s boljom upravljivošću. Po prvi put, programeri mogu „uputiti“ model ne samo šta da kaže, već kako da to kaže—omogućavajući prilagođenija iskustva za slučajeve upotrebe od korisničke podrške do kreativnog pripovijedanja. Model je dostupan u API-ju za pretvaranje teksta u govor(otvara se u novom prozoru). Imajte na umu da su ovi modeli za pretvaranje teksta u govor ograničeni na umjetne, unaprijed postavljene glasove, koje pratimo kako bismo osigurali da se dosljedno podudaraju sa sintetičkim unaprijed postavkama.

Tehničke inovacije koje stoje iza modela

Pretreniranje s autentičnim audio skupovima podataka

Naši novi audio modeli nadograđuju se na arhitekture GPT‑4o i GPT‑4o‑mini te su opsežno prethodno obučeni na specijaliziranim audio-centričnim skupovima podataka, koji su bili ključni za optimizaciju performansi modela. Ovaj ciljani pristup pruža dublji uvid u nijanse govora i omogućava izuzetne performanse u zadacima vezanim za audio.

Napredne metodologije destilacije

Poboljšali smo naše tehnike destilacije, omogućujući prijenos znanja s naših najvećih audio modela na manje, učinkovitije modele. Korištenjem naprednih metodologija samostalnog učenja, naši skupovi podataka za destilaciju efikasno bilježe realističnu dinamiku razgovora, replicirajući autentične interakcije između korisnika i asistenta. Ovo pomaže našim manjim modelima da pruže odličan kvalitet razgovora i brzu odzivnost.

Paradigma učenja s potkrepljivanjem

Za naše modele prepoznavanja govora u tekst, integrirali smo paradigmu koja se u velikoj mjeri oslanja na učenje s potkrepljivanjem (RL), podižući tačnost transkripcije na najmodernije nivoe. Ova metodologija dramatično poboljšava preciznost i smanjuje halucinacije, čineći naša rješenja za pretvaranje govora u tekst izuzetno konkurentnima u složenim scenarijima prepoznavanja govora.

Ovi razvojni koraci predstavljaju napredak u oblasti audio modeliranja, kombinujući inovativne metodologije s praktičnim poboljšanjima za poboljšane performanse u aplikacijama za govor.

Dostupnost API-ja

Ovi novi audio modeli su sada dostupni svim programerima – više o izradi s audio sadržajem ovdje(otvara se u novom prozoru). Za programere koji već razvijaju iskustva razgovora s tekstualnim modelima, dodavanje naših modela za pretvaranje govora u tekst i teksta u govor je najjednostavniji način za izgradnju glasovnog agenta. Objavljujemo integraciju s Agents SDK-om(otvara se u novom prozoru) koja pojednostavljuje ovaj razvojni proces. Za programere koji žele kreirati iskustva pretvaranja govora u govor s niskom latencijom, preporučujemo korištenje naših modela za pretvaranje govora u govor u Realtime API-ju.

Šta je sljedeće

Gledajući unaprijed, planiramo nastaviti ulagati u poboljšanje inteligencije i tačnosti naših audio modela te istraživati načine kako bismo programerima omogućili korištenje vlastitih prilagođenih glasova za izgradnju još personaliziranijih iskustava, u skladu s našim sigurnosnim standardima. Osim toga, nastavljamo sudjelovati u razgovorima s kreatorima politika, istraživačima, programerima i kreativcima o izazovima i prilikama koje sintetički glasovi mogu predstavljati. Uzbuđeni smo što ćemo vidjeti inovativne i kreativne aplikacije koje će programeri razviti koristeći ove poboljšane audio mogućnosti. Također ćemo ulagati u druge modalitete—uključujući video—kako bismo omogućili programerima da kreiraju multimodalna agentička iskustva.

Repriza prijenosa uživo

Autori

OpenAI

Voditelji istraživanja

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Saradnici

Istraživanje

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Inženjering

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Product

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponzori rukovodstva

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry