Pereiti prie pagrindinio turinio
OpenAI

2025 m. kovo 20 d.

LeidimasProduktas

Pristatome naujos kartos garso modelius API

Naujas garso modelių rinkinys balso agentams valdyti, dabar prieinamas kūrėjams visame pasaulyje.

„OpenAI“ naujos kartos garso modelių tinklaraščio pagrindinis vaizdas
Įkeliama...

2025 m. rugpjūčio 28 d. atnaujinimas: paskelbėme apie bendrą „Realtime API“ prieinamumą. Sužinokite daugiau čia.


Per pastaruosius kelis mėnesius investavome į tekstinių agentų – sistemų, kurios savarankiškai atlieka užduotis naudotojų vardu, – intelekto, galimybių ir naudingumo tobulinimą, išleisdami tokius produktus kaip „Operator“, „Deep Research“, „Computer-Using Agents“ ir „Responses API“ su integruotais įrankiais. Tačiau tam, kad agentai būtų tikrai naudingi, žmonės turi turėti galimybę su jais bendrauti giliau ir intuityviau, ne tik tekstu – naudodami natūralią šnekamąją kalbą efektyviam bendravimui.

Šiandien API paleidžiame naujus kalbos vertimo į tekstą ir teksto vertimo į kalbą garso modelius, leidžiančius kurti galingesnius, labiau pritaikomus ir intelektualesnius balso agentus, teikiančius realią vertę. Mūsų naujausi kalbos vertimo į tekstą modeliai nustato naują pažangiausią etaloną, pranokdami esamus sprendimus tikslumu ir patikimumu – ypač sudėtingais scenarijais, apimančiais akcentus, triukšmingą aplinką ir kintantį kalbėjimo greitį. Šie patobulinimai padidina transkripcijos patikimumą, todėl modeliai ypač tinka tokiems naudojimo atvejams kaip klientų aptarnavimo centrai, susitikimų pastabų transkribavimas ir kt.

Pirmą kartą kūrėjai taip pat gali nurodyti teksto vertimo į kalbą modeliui kalbėti tam tikru būdu – pavyzdžiui, „talk like a sympathetic customer service agent“ (kalbėk kaip užjaučiantis klientų aptarnavimo agentas) – taip atverdami naują balso agentų pritaikymo lygį. Tai įgalina platų pritaikytų programų spektrą – nuo empatiškesnių ir dinamiškesnių klientų aptarnavimo balsų iki ekspresyvaus pasakojimo kūrybinėse patirtyse.

Pirmąjį garso modelį pristatėme 2022 m. ir nuo to laiko esame įsipareigoję tobulinti šių modelių intelektą, tikslumą ir patikimumą. Naudodami šiuos naujus garso modelius, kūrėjai gali kurti tikslesnes ir patikimesnes kalbos vertimo į tekstą sistemas bei ekspresyvius, charakteringus teksto vertimo į kalbą balsus – viską API ribose.

Ramybė
Banglentininkas
Profesionalus
Viduramžių riteris
Tikrų nusikaltimų mėgėjas
Pasaka prieš miegą

Daugiau apie mūsų naujausius garso modelius

Nauji kalbos vertimo į tekstą modeliai

Pristatome naujus gpt-4o-transcribe ir gpt-4o-mini-transcribe modelius su patobulintu žodžių klaidų lygiu ir geresniu kalbos atpažinimu bei tikslumu, palyginti su originaliais „Whisper“ modeliais.

gpt-4o-transcribe demonstruoja geresnius žodžių klaidų lygio (WER) rodiklio rezultatus nei esami „Whisper“ modeliai daugelyje nustatytų lyginamųjų testų, atspindėdamas didelę pažangą mūsų kalbos vertimo į tekstą technologijoje. Šie pasiekimai tiesiogiai kyla iš tikslinių inovacijų skatinamojo mokymosi srityje ir plataus vidurinio mokymo (angl. midtraining) naudojant įvairius, aukštos kokybės garso duomenų rinkinius.

Dėl to šie nauji kalbos vertimo į tekstą modeliai gali geriau užfiksuoti kalbos niuansus, sumažinti neatpažinimo atvejų skaičių ir padidinti transkripcijos patikimumą, ypač sudėtingais scenarijais, apimančiais akcentus, triukšmingą aplinką ir kintantį kalbėjimo greitį. Šie modeliai jau prieinami kalbos vertimo į tekstą API(atsidaro naujame lange).

Žodžių klaidų lygis (WER) matuoja kalbos atpažinimo modelių tikslumą, apskaičiuodamas neteisingai transkribuotų žodžių procentą, palyginti su etalonine transkripcija – mažesnis WER yra geriau ir reiškia mažiau klaidų. Mūsų naujausi kalbos vertimo į tekstą modeliai pasiekia mažesnį WER lyginamuosiuose testuose, įskaitant FLEURS („Few-shot Learning Evaluation of Universal Representations of Speech“) – daugiakalbį kalbos lyginamąjį testą, apimantį daugiau nei 100 kalbų ir naudojantį rankiniu būdu transkribuotus garso pavyzdžius. Šie rezultatai rodo didesnį transkripcijos tikslumą ir tvirtesnį kalbų padengimą. Kaip parodyta čia, mūsų modeliai nuosekliai lenkia „Whisper v2“ ir „Whisper v3“ visuose kalbų vertinimuose.

FLEURS duomenų rinkinyje mūsų modeliai pasiekia mažesnį WER ir užtikrina gerą daugiakalbį veikimą. Mažesnis WER yra geriau ir reiškia mažiau klaidų. Kaip parodyta čia, mūsų modeliai daugelyje pagrindinių kalbų prilygsta kitiems pirmaujantiems modeliams arba juos lenkia.

Naujas teksto vertimo į kalbą modelis

Taip pat išleidžiame naują gpt-4o-mini-tts modelį su geresniu valdomumu. Pirmą kartą kūrėjai gali „instruktuoti“ modelį ne tik ką sakyti, bet ir kaip tai sakyti – įgalindami labiau pritaikytas patirtis naudojimo atvejams nuo klientų aptarnavimo iki kūrybinio pasakojimo. Modelis prieinamas teksto vertimo į kalbą API(atsidaro naujame lange). Atkreipkite dėmesį, kad šie teksto vertimo į kalbą modeliai apsiriboja dirbtiniais, iš anksto nustatytais balsais, kuriuos stebime, kad užtikrintume, jog jie nuosekliai atitinka sintetinius nustatymus.

Techninės inovacijos, slypinčios už modelių

Išankstinis mokymas naudojant autentiškus garso duomenų rinkinius

Mūsų nauji garso modeliai sukurti remiantis „GPT‑4o“ ir „GPT‑4o‑mini“ architektūromis ir yra išsamiai apmokyti naudojant specializuotus, į garsą orientuotus duomenų rinkinius, kurie buvo kritiškai svarbūs optimizuojant modelio našumą. Šis tikslinis požiūris suteikia gilesnį supratimą apie kalbos niuansus ir įgalina išskirtinį našumą atliekant su garsu susijusias užduotis.

Pažangios distiliavimo metodikos

Patobulinome savo distiliavimo metodus, įgalindami žinių perdavimą iš didžiausių garso modelių į mažesnius, efektyvesnius modelius. Pasitelkdami pažangias savarankiško žaidimo (angl. self-play) metodikas, mūsų distiliavimo duomenų rinkiniai efektyviai užfiksuoja realistinę pokalbių dinamiką, atkartodami tikras naudotojo ir asistento sąveikas. Tai padeda mūsų mažesniems modeliams užtikrinti puikią pokalbio kokybę ir reagavimą.

Skatinamojo mokymosi paradigma

Savo kalbos vertimo į tekstą modeliams integravome skatinamojo mokymosi (angl. reinforcement learning, RL) paradigmą, pakeldami transkripcijos tikslumą iki pažangiausio lygio. Ši metodika smarkiai pagerina tikslumą ir sumažina pramanų kiekį, todėl mūsų kalbos vertimo į tekstą sprendimai tampa itin konkurencingi sudėtinguose kalbos atpažinimo scenarijuose.

Šie pokyčiai rodo pažangą garso modeliavimo srityje, sujungiant novatoriškas metodikas su praktiniais patobulinimais, siekiant geresnio našumo kalbos programose.

API prieinamumas

Šie nauji garso modeliai jau prieinami visiems kūrėjams – daugiau apie kūrimą su garsu skaitykite čia(atsidaro naujame lange). Kūrėjams, jau kuriantiems pokalbių patirtis su tekstiniais modeliais, mūsų kalbos vertimo į tekstą ir teksto vertimo į kalbą modelių pridėjimas yra paprasčiausias būdas sukurti balso agentą. Išleidžiame integraciją su Agents SDK(atsidaro naujame lange), kuri supaprastina šį kūrimo procesą. Kūrėjams, norintiems kurti mažos delsos kalbos vertimo į kalbą patirtis, rekomenduojame kurti naudojant mūsų kalbos vertimo į kalbą modelius „Realtime API“.

Kas toliau?

Žvelgdami į ateitį, planuojame ir toliau investuoti į savo garso modelių intelekto ir tikslumo tobulinimą bei tyrinėti būdus, kaip leisti kūrėjams naudoti savo pasirinktinius balsus kuriant dar labiau suasmenintas patirtis, atitinkančias mūsų saugos standartus. Be to, tęsiame pokalbius su politikos formuotojais, tyrėjais, kūrėjais ir kūrybininkais apie iššūkius ir galimybes, kuriuos gali sukelti sintetiniai balsai. Nekantraujame pamatyti inovatyvias ir kūrybingas programas, kurias kūrėjai sukurs naudodami šiuos patobulintus garso pajėgumus. Taip pat investuosime į kitas modalumo formas – įskaitant vaizdo įrašus – kad įgalintume kūrėjus kurti daugiarūšes agentines patirtis.

Tiesioginės transliacijos pakartojimas

Autoriai

OpenAI

Tyrimų vadovai

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Autoriai

Moksliniai tyrimai

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Inžinerija

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produktas

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Vadovybės rėmėjai

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry