Pāriet uz galveno saturu
OpenAI

2025. gada 20. marts

IzlaidumsProdukts

Iepazīstinām ar nākamās paaudzes audio modeļiem API.

Jauns audio modeļu kopums balss aģentu darbībai – tagad pieejams izstrādātājiem visā pasaulē.

OpenAI nākamās paaudzes audio modeļu bloga ieraksta galvenais attēls
Notiek ielāde…

Atjauninājums 2025. gada 28. augustā: mēs esam paziņojuši par Realtime API vispārēju pieejamību. Uzzini vairāk šeit.


Pēdējo dažu mēnešu laikā mēs esam ieguldījuši līdzekļus, lai uzlabotu teksta bāzes aģentu (sistēmu, kas patstāvīgi veic uzdevumus lietotāju vārdā) intelektu, iespējas un lietderību, izlaižot tādus risinājumus kā operatori, dziļā izpēte, datoru izmantojoši aģenti un Responses API ar iebūvētiem rīkiem. Tomēr, lai aģenti būtu patiesi noderīgi, cilvēkiem ir jāspēj veidot dziļāku un intuitīvāku mijiedarbību ar aģentiem, neaprobežojoties tikai ar tekstu, bet izmantojot dabisku runāto valodu, lai efektīvi sazinātos.

Šodien mēs ieviešam jaunus runas pārveidošanas tekstā un teksta pārveidošanas runā audio modeļus savā API – tas ļauj izveidot jaudīgākus, pielāgojamākus un gudrākus balss aģentus, kas sniedz reālu vērtību. Mūsu jaunākie runas pārveidošanas tekstā modeļi nosaka jaunu nozares etalonu, pārspējot esošos risinājumus precizitātes un uzticamības ziņā – jo īpaši sarežģītos scenārijos, kuros ir akcenti, trokšņaina vide un mainīgs runas ātrums. Šie uzlabojumi palielina transkripcijas uzticamību, padarot modeļus īpaši piemērotus tādiem lietošanas gadījumiem kā klientu zvanu centri, sanāksmju piezīmju transkripcija u.c.

Pirmo reizi izstrādātāji var arī likt teksta–runas modelim runāt noteiktā veidā, piemēram, “runā kā iejūtīgs klientu apkalpošanas aģents”, tādējādi paverot jaunu pielāgošanas līmeni balss aģentiem. Tas nodrošina plašu pielāgotu lietojumu klāstu, no empātiskākām un dinamiskākām klientu apkalpošanas balsīm līdz izteiksmīgam stāstījumam radošai stāstniecības pieredzei.

Mēs laidām klajā savu pirmo audio modeli 2022. gadā, un kopš tā laika esam apņēmušies uzlabot šo modeļu intelektu, precizitāti un uzticamību. Izmantojot šos jaunos audio modeļus, izstrādātāji var izveidot precīzākas un robustākas runas pārveidošanas tekstā sistēmas un izteiksmīgas teksta pārvēršanas runā balsis – viss API ietvaros.

Mierīga
Sērfotājs
Profesionāls
Viduslaiku bruņinieks
Kriminālstāstu entuziasts
Stāsts pirms gulētiešanas

Vairāk par mūsu jaunākajiem audio modeļiem

Jauni runas pārveidošanas tekstā modeļi

Mēs ieviešam jaunus gpt-4o-transcribe un gpt-4o-mini-transcribe modeļus ar uzlabotu vārdu kļūdu līmeni, labāku valodas atpazīšanu un precizitāti, salīdzinot ar sākotnējiem Whisper modeļiem.

gpt-4o-transcribe demonstrē uzlabotu vārdu kļūdu īpatsvara (WER) veiktspēju salīdzinājumā ar esošajiem Whisper modeļiem vairākos atzītos etalonos, atspoguļojot būtisku progresu mūsu runas pārvēršanas tekstā tehnoloģijā. Šie sasniegumi tieši izriet no mērķtiecīgām inovācijām stimulētās mācīšanās procesā un plašām vidusposma apmācībām ar daudzveidīgām, augstas kvalitātes audio datu kopām.

Tā rezultātā šie jaunie runas–teksta modeļi spēj labāk uztvert runas nianses, samazināt kļūdainu atpazīšanu un palielināt transkripcijas uzticamību, īpaši sarežģītos scenārijos, kuros ir akcenti, trokšņaina vide un mainīgs runas ātrums. Šie modeļi tagad ir pieejami ar speech-to-text API(atveras jaunā logā).

Vārdu kļūdu īpatsvars (WER) mēra runas atpazīšanas modeļu precizitāti, aprēķinot nepareizi transkribēto vārdu procentuālo daļu salīdzinājumā ar atsauces transkripciju – zemāks WER ir labāks, tas nozīmē mazāk kļūdu. Mūsu jaunākie runas–teksta modeļi sasniedz zemāku WER dažādos etalonos, tostarp FLEURS (Dažpiemēru mācīšanās novērtējums universālajām runas reprezentācijām) – tas ir daudzvalodu runas etalons, kas aptver vairāk nekā 100 valodas, izmantojot manuāli transkribētus audio paraugus. Šie rezultāti parāda lielāku transkripcijas precizitāti un plašāku valodu aptvērumu. Kā redzams šeit, mūsu modeļi konsekventi pārspēj Whisper v2 un Whisper v3 visos valodu novērtējumos.

Etalonā FLEURS mūsu modeļi nodrošina zemāku WER un spēcīgu daudzvalodu veiktspēju. Zemāks WER ir labāks un nozīmē mazāk kļūdu. Kā redzams šeit, mūsu modeļi sasniedz citiem vadošajiem modeļiem atbilstošu vai labāku sniegumu vairumā lielāko valodu.

Jauns teksta–runas modelis

Mēs arī laižam klajā jaunu gpt-4o-mini-tts modeli ar uzlabotu vadāmību. Pirmo reizi izstrādātāji var “instruēt” modeli ne tikai par to, ko teikt, bet arī to pateikt – sniedzot vairāk pielāgotu pieredzi dažādiem lietošanas gadījumiem, sākot no klientu apkalpošanas līdz radošai stāstniecībai. Modelis ir pieejams ar text-to-speech API(atveras jaunā logā). Ņem vērā, ka šie teksta–runas modeļi ir ierobežoti ar mākslīgām, iepriekš iestatītām balsīm, kuras mēs uzraugām, lai nodrošinātu, ka tās konsekventi atbilst sintētiskajiem iepriekš iestatītajiem modeļiem.

Tehniskās inovācijas, kas ir modeļu pamatā

Priekšapmācība ar autentiskām audio datu kopām

Mūsu jaunie audio modeļi ir veidoti uz GPT‑4o un GPT‑4o‑mini arhitektūrām un ir plaši priekšapmācīti specializētās audio datu kopās, kas ir bijis būtiski modeļu veiktspējas optimizēšanai. Šī mērķtiecīgā pieeja sniedz padziļinātu ieskatu runas niansēs un nodrošina izcilu veiktspēju ar skaņu saistītos uzdevumos.

Uzlabotas destilācijas metodoloģijas

Mēs esam pilnveidojuši savas destilācijas metodes, ļaujot pārnest zināšanas no mūsu lielākajiem audio modeļiem uz mazākiem un efektīvākiem modeļiem. Izmantojot progresīvas pašspēles metodoloģijas, mūsu destilācijas datukopas efektīvi uztver reālistisku sarunu dinamiku, atdarinot autentiskas lietotāja–palīga mijiedarbības. Tas palīdz mūsu mazākajiem modeļiem nodrošināt izcilu sarunvalodas kvalitāti un atsaucību.

Stimulētās mācīšanās paradigma

Saviem runas–teksta modeļiem mēs esam integrējuši intensīvu stimulētās mācīšanās (RL) paradigmu, paaugstinot transkripcijas precizitāti līdz vismodernākajam līmenim. Šī metodoloģija būtiski uzlabo precizitāti un samazina halucinācijas, padarot mūsu runas–teksta risinājumus izcili konkurētspējīgus sarežģītos runas atpazīšanas scenārijos.

Šie sasniegumi norāda uz progresu audio modelēšanas jomā, apvienojot inovatīvas metodoloģijas ar praktiskiem uzlabojumiem, lai uzlabotu runas lietojumu veiktspēju.

API pieejamība

Šie jaunie audio modeļi tagad ir pieejami visiem izstrādātājiem – vairāk par izstrādi ar audio lasi šeit(atveras jaunā logā). Izstrādātājiem, kas jau veido sarunu pieredzi ar tekstā balstītiem modeļiem, mūsu runas pārveidošansa tekstā un teksta pārveidošanas runā modeļu pievienošana ir vienkāršākais veids, kā izveidot balss aģentu. Mēs izlaižam integrāciju ar Agents SDK(atveras jaunā logā), kas vienkāršo šo izstrādes procesu. Izstrādātājiem, kuri vēlas veidot zema latentuma runas–runas pieredzi, iesakām izmantot mūsu runas pārveidošanas runā modeļus ar Realtime API.

Kas būs tālāk?

Raugoties nākotnē, mēs plānojam turpināt ieguldīt savu audio modeļu intelekta un precizitātes uzlabošanā un pētīt veidus, kā izstrādātāji varētu izmantot paši savas pielāgotās balsis, lai veidotu vēl personalizētāku pieredzi, kas atbilst mūsu drošības standartiem. Turklāt mēs turpinām iesaistīties sarunās ar politikas veidotājiem, pētniekiem, izstrādātājiem un radošajiem cilvēkiem par sarežģījumiem un iespējām, ko var radīt sintētiskās balsis. Mēs ar nepacietību gaidām, kādas inovatīvas un radošas lietotnes jūs izveidosit, izmantojot šīs uzlabotās audio iespējas. Mēs ieguldīsim arī citās modalitātēs, tostarp video, lai izstrādātāji varētu veidot multimodālas aģentu pieredzes.

Tiešraides straumes atkārtojums

Autori

OpenAI

Izpētes vadītāji

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Līdzstrādnieki

Izpēte

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Inženierija

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkts

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Vadības līmeņa atbalstītāji

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry