Preskočite na glavno vsebino
OpenAI

20. marec 2025

IzdajaIzdelek

Predstavitev zvočnih modelov naslednje generacije v API-ju

Nov nabor zvočnih modelov za poganjanje glasovnih agentov, ki je zdaj na voljo razvijalcem po vsem svetu.

Uvodna slika bloga o zvočnih modelih naslednje generacije OpenAI
Nalaganje …

Posodobitev 28. avgusta 2025: Najavili smo splošno razpoložljivost Realtime API-ja. Več o tem preberite tukaj.


V zadnjih nekaj mesecih smo vlagali v napredek inteligence, zmogljivosti in uporabnosti agentov, ki temeljijo na besedilu, oziroma sistemov, ki samostojno opravljajo naloge v imenu uporabnikov, z izdajami, kot so Operator, poglobljeno raziskovanje, agent za uporabo računalnika in Responses API z vgrajenimi orodji. Da bi bili agenti resnično uporabni, pa morajo imeti ljudje možnost globljih in bolj intuitivnih interakcij z agenti, ki presegajo zgolj besedilo, z uporabo naravnega govorjenega jezika za učinkovito komunikacijo.

Danes v aplikacijskem programskem vmesniku (API) na trg lansiramo nove zvočne modele za pretvorbo govora v besedilo in pretvorbo besedila v govor, s čimer omogočamo razvoj zmogljivejših, prilagodljivejših in inteligentnejših glasovnih agentov, ki ponujajo resnično vrednost. Naši najnovejši modeli za pretvorbo govora v besedilo postavljajo novo merilo zmogljivosti, saj presegajo obstoječe rešitve glede točnosti in zanesljivosti, zlasti v zahtevnih scenarijih, ki vključujejo naglase, hrupna okolja in različne hitrosti govora. Te izboljšave povečujejo zanesljivost prepisovanja, zaradi česar so modeli še posebej primerni za primere uporabe, kot so klicni centri za podporo strankam, prepisovanje zapiskov s sestankov in podobno.

Razvijalci lahko prvič tudi modelu za pretvorbo besedila v govor podajo navodilo, naj govori na določen način, na primer »govori kot empatičen svetovalec za pomoč strankam«, kar odpira novo raven prilagodljivosti za glasovne agente. To omogoča širok nabor prilagojenih aplikacij, od bolj empatičnih in dinamičnih glasov za podporo strankam do izrazne naracije za ustvarjalne pripovedne izkušnje.

Prvi zvočni model smo lansirali na trg leta 2022 in od takrat smo zavezani izboljševanju inteligence, točnosti in zanesljivosti teh modelov. S temi novimi zvočnimi modeli lahko razvijalci zgradijo natančnejše in robustnejše sisteme za pretvorbo govora v besedilo ter izrazite, karakterne glasove za pretvorbo besedila v govor, vse v aplikacijskem programskem vmesniku (API).

Umirjen
Spletni deskar
Profesionalno
Srednjeveški vitez
Navdušenec nad kriminalkami po resničnih dogodkih
Pravljica za lahko noč

Več o naših najnovejših zvočnih modelih

Novi modeli za pretvorbo govora v besedilo

Predstavljamo nova modela gpt-4o-transcribe in gpt-4o-mini-transcribe z izboljšano stopnjo razpoznavanja besed ter boljšim razpoznavanjem jezika in natančnostjo v primerjavi z izvirnimi modeli Whisper.

gpt-4o-transcribe izkazuje izboljšano zmogljivost stopnje (WER) v primerjavi z obstoječimi modeli Whisper v več uveljavljenih primerjalnih preizkusih, kar odraža pomemben napredek v naši tehnologiji pretvorbe govora v besedilo. Ti napredki izhajajo neposredno iz ciljno usmerjenih inovacij na področju spodbujevalnega učenja (RL) in obsežnega srednjega učenja z raznolikimi, visokokakovostnimi zvočnimi nabori podatkov.

Posledično ti novi modeli za pretvorbo govora v besedilo bolje zajemajo nianse govora, zmanjšujejo napačna prepoznavanja in povečujejo zanesljivost prepisovanja, zlasti v zahtevnih scenarijih, ki vključujejo naglase, hrupna okolja in različne hitrosti govora. Ti modeli so zdaj na voljo v API-ju za pretvorbo govora v besedilo(odpre se v novem oknu).

Stopnja napačno razpoznanih besed (WER) meri točnost modelov za pretvorbo govora v besedilo tako, da izračuna odstotek napačno prepisanih besed v primerjavi z referenčnim prepisom; nižja stopnja WER je boljša in pomeni manj napak. Naši najnovejši modeli za pretvorbo govora v besedilo dosegajo nižjo stopnjo napak besed (WER) v primerjalnih preizkusih, vključno s FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), večjezičnim govornim primerjalnim preizkusom, ki zajema več kot 100 jezikov in uporablja ročno prepisane zvočne vzorce. Ti rezultati kažejo večjo točnost prepisovanja in robustnejšo jezikovno pokritost. Kot je prikazano tukaj, naši modeli dosledno presegajo Whisper v2 in Whisper v3 pri vseh jezikovnih evalvacijah.

Na FLEURS naši modeli dosegajo nižjo stopnjo napak besed (WER) in močno večjezično zmogljivost. Stopnja WER je boljša in pomeni manj napak. Kot je prikazano tukaj, se naši modeli v večini glavnih jezikov ujemajo z drugimi vodilnimi modeli ali jih presegajo.

Nov model za pretvorbo besedila v govor

Prav tako uvajamo nov model gpt-4o-mini-tts z boljšo vodljivostjo. Razvijalci lahko prvič modelu 'podajo navodilo' ne le, kaj naj pove, temveč tudi, kako naj to pove, kar omogoča bolj prilagojene izkušnje za primere uporabe, ki segajo od podpore strankam do ustvarjalnega pripovedovanja. Model je na voljo v API-ju za pretvorbo besedila v govor(odpre se v novem oknu). Upoštevajte, da so ti modeli za pretvorbo besedila v govor omejeni na umetne, prednastavljene glasove, ki jih nadzorujemo, da zagotovimo njihovo dosledno ujemanje s sintetičnimi prednastavitvami.

Tehnične inovacije v ozadju modelov

Predhodno učenje z avtentičnimi zvočnimi nabori podatkov

Naši novi zvočni modeli temeljijo na arhitekturah GPT‑4o in GPT‑4o‑mini ter so obsežno predhodno učeni na specializiranih zvočno usmerjenih naborih podatkov, ki so bili ključni za optimizacijo zmogljivosti modelov. Ta ciljno usmerjen pristop omogoča globlji vpogled v nianse govora ter izjemno zmogljivost pri nalogah, povezanih z zvokom.

Napredne metodologije destilacije

Izboljšali smo naše tehnike destilacije, kar omogoča prenos znanja iz naših največjih zvočnih modelov na manjše in učinkovitejše modele. Z uporabo naprednih metodologij samostojne igre naši nabori podatkov za destilacijo učinkovito zajemajo realistične pogovorne dinamike ter posnemajo pristne interakcije med uporabnikom in asistentom. To našim manjšim modelom omogoča zagotavljanje odlične kakovosti pogovora in odzivnosti.

Paradigma spodbujevalnega učenja

Za naše modele za pretvorbo govora v besedilo smo uvedli paradigmo, ki v veliki meri temelji na spodbujevalnem učenju (RL), s čimer smo točnost prepisovanja dvignili na raven najsodobnejših rešitev. Ta metodologija izrazito izboljšuje natančnost in zmanjšuje halucinacijo, zaradi česar so naše rešitve za pretvorbo govora v besedilo izjemno konkurenčne v kompleksnih scenarijih prepoznavanja govora.

Ti dosežki predstavljajo napredek na področju modeliranja zvoka, saj združuje inovativne metodologije s praktičnimi izboljšavami za izboljšano zmogljivost v govornih aplikacijah.

Razpoložljivost vmesnika API

Ti novi zvočni modeli so zdaj na voljo vsem razvijalcem – več o razvoju z zvokom tukaj(odpre se v novem oknu). Za razvijalce, ki že gradijo pogovorne izkušnje z modeli, ki temeljijo na besedilu, je dodajanje naših modelov za pretvorbo govora v besedilo in pretvorbo besedila v govor najpreprostejši način za izgradnjo glasovnega agenta. Objavljamo integracijo s kompletom za razvoj programske opreme (SDK) Agents SDK(odpre se v novem oknu), ki poenostavlja ta razvojni proces. Razvijalcem, ki želijo graditi nizkozakasnitvene izkušnje pretvorbe govora v govor, priporočamo uporabo naših modelov za pretvorbo govora v govor v aplikacijskem programskem vmesniku (API) Realtime API.

Kaj naprej

V prihodnje nameravamo še naprej vlagati v izboljševanje inteligence in točnosti naših zvočnih modelov ter raziskovati načine, kako razvijalcem omogočiti uporabo lastnih glasov po meri za gradnjo še bolj personaliziranih izkušenj, ki so skladne z našimi varnostnimi standardi. Poleg tega nadaljujemo razprave z oblikovalci politik, raziskovalci, razvijalci in ustvarjalci o izzivih in priložnostih, ki jih lahko prinašajo sintetični glasovi. Veselimo se inovativnih in ustvarjalnih aplikacij, ki jih bodo razvijalci zgradili z uporabo teh izboljšanih zvočnih zmogljivosti. Vlagali bomo tudi v druge modalnosti, vključno z videom, da bi razvijalcem omogočili gradnjo večmodalnih agentskih izkušenj.

Ponovitev prenosa v živo

Avtorji

OpenAI

Vodje raziskav

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Avtorji prispevkov

Raziskave

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Tehnologija

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Izdelek

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponzorji vodij

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry