Lumaktaw sa pangunahing content
OpenAI

Marso 20, 2025

PaglabasProdukto

Pagpapakilala ng mga susunod na henerasyon na modelo ng audio sa API

Isang bagong suite ng mga modelo ng audio upang paganahin ang mga voice agent, na ngayon ay magagamit na ng mga developer sa buong mundo.

Larawan ng hero ng blog ng mga susunod na henerasyon na modelo ng audio ng OpenAI
Naglo-load…

Update noong Agosto 28, 2025: Inanunsyo namin ang pangkalahatang availability ng Realtime API. Dagdagan ang nalalaman dito.


Sa nakalipas na ilang buwan, namuhunan kami sa pagpapahusay ng katalinuhan, mga kakayahan, at kapakinabangan ng mga text-based na agent—o mga sistema na nagsasakatuparan ng mga gawain nang nakapag-iisa para sa mga gumagamit—sa pamamagitan ng mga release tulad ng Operator, Malalimang Pananaliksik, Mga Agent na Gumagamit ng Computer, at ang Responses API na may mga built-in na tool. Gayunpaman, upang maging tunay na kapaki-pakinabang ang mga agent, kailangang magkaroon ang mga tao ng mas malalim at mas intuitive na mga interaksyon sa mga agent na higit pa sa text—gamit ang natural na pasalitang wika para sa epektibong pakikipag-ugnayan.

Ngayon, inilulunsad namin ang mga bagong speech-to-text at text-to-speech na mga audio na modelo sa API—na ginagawang posible na bumuo ng mas makapangyarihan, nako-customize, at matatalinong voice agent na nag-aalok ng tunay na halaga. Ang aming pinakabagong mga modelo ng speech-to-text ay nagtakda ng makabagong pamantayan, na nakahihigit sa mga kasalukuyang solusyon sa katumpakan at pagiging maaasahan—lalo na sa mga mapanghamong sitwasyon na may kinalaman sa mga accent, maingay na kapaligiran, at iba't ibang bilis ng pagsasalita. Pinapataas ng mga pagpapahusay na ito ang pagiging maaasahan ng transkripsyon, kaya't ang mga modelo ay lalo pang angkop para sa mga use case tulad ng mga customer call center, transkripsyon ng mga tala ng pagpupulong, at iba pa.

Sa unang pagkakataon, maaari na ring utusan ng mga developer ang modelo ng text-to-speech na magsalita sa isang partikular na paraan—halimbawa, “magsalita na parang isang maunawaing ahente ng serbisyo sa customer”—na nagbubukas ng bagong antas ng pag-customize para sa mga voice agent. Nagbibigay-daan ito sa malawak na hanay ng mga iniangkop na aplikasyon, mula sa mas empatiko at dynamic na mga boses para sa serbisyong pangkustomer hanggang sa masining na pagsasalaysay para sa mga malikhaing karanasan sa pagkukuwento.

Inilunsad namin ang aming unang audio na modelo noong 2022 at mula noon, tumuon na kami sa pagpapahusay ng katalinuhan, katumpakan, at pagiging maaasahan ng mga modelo nitong ito. Sa mga bagong mga modelo ng audio na ito, makakabuo ang mga developer ng mas tumpak at mas malawak na mga sistema ng speech-to-text at mas nagpapahayag at may karakter na mga boses ng text-to-speech—lahat sa loob ng API.

Kalmado
Surfer
Propesyonal
Medieval na kabalyero
Tagahanga ng true crime
Kuwento sa oras ng pagtulog

Karagdagang impormasyon tungkol sa aming pinakabagong mga modelo ng audio

Mga bagong speech-to-text na modelo

Ipinapakilala namin ang mga bagong gpt-4o-transcribe at gpt-4o-mini-transcribe na mga modelo na may mga pagpapahusay sa word error rate at mas mahusay na pagkilala at katumpakan ng wika, kumpara sa mga orihinal na modelo ng Whisper.

Ipinapakita ng gpt-4o-transcribe ang pinahusay na pagganap ng Word Error Rate (WER) kumpara sa mga kasalukuyang modelo ng Whisper sa iba’t ibang itinatag na pamantayan, na sumasalamin sa makabuluhang pag-usad ng aming speech-to-text na teknolohiya. Ang mga pagsulong na ito ay direktang nagmumula sa mga naka-target na inobasyon sa pagpapatibay ng pag-aaral at malawakang midtraining gamit ang magkakaiba't mataas na kalidad na mga dataset ng audio.

Bilang resulta, mas mahusay na nakukuha ng mga bagong modelo ng speech-to-text ang mga detalye ng pagsasalita, nababawasan ang mga maling pagkilala, at napapataas ang pagiging maaasahan ng transkripsyon, lalo na sa mga mapanghamong sitwasyon na may kinalaman sa mga accent, maingay na kapaligiran, at iba-ibang bilis ng pagsasalita. Ang mga modelong ito ay available na ngayon sa speech-to-text API(magbubukas sa bagong window).

Sinusukat ng Word Error Rate (WER) ang katumpakan ng mga modelo ng pagkilala sa pagsasalita sa pamamagitan ng pagkalkula ng porsiyento ng mga maling na-transcribe na salita kumpara sa reperensyang transcript—mas maganda ang mas mababang WER at mas kaunti ang pagkakamali. Nakakamit ng aming pinakabagong mga modelo ng speech-to-text ang mas mababang WER sa iba't ibang pamantayan, kabilang ang FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech)—isang multilingual na pamantayan ng pagsasalita na sumasaklaw sa mahigit 100 wika gamit ang mga audio sample na manu-manong na-transcribe. Ipinapakita ng mga resultang ito ang mas mataas na katumpakan ng transkripsyon at mas malawak na saklaw ng wika. Gaya ng ipinapakita rito, palaging nalalampasin ng aming mga modelo ang Whisper v2 at Whisper v3 sa lahat ng pagsusuri sa wika.

Sa FLEURS, ang aming mga modelo ay naghahatid ng mas mababang WER at mahusay na multilingual na pagganap. Mas maganda ang mas mababang WER at mas kaunti ang pagkakamali. Gaya ng ipinapakita rito, ang aming mga modelo ay tumutugma o mas mahusay kaysa sa iba pang nangungunang mga modelo kung ihahambing sa karamihan ng mga pangunahing wika.

Bagong modelo ng text-to-speech

Naglulunsad din kami ng bagong gpt-4o-mini-tts na modelo na may mas mahusay na kakayahang magmaniobra. Sa unang pagkakataon, maaari nang “turuan” ng mga developer ang modelo hindi lamang kung ano ang sasabihin kundi kung paano ito sasabihin—na nagbibigay-daan sa mas pasadyang mga karanasan para sa mga kaso ng paggamit mula sa serbisyo sa customer hanggang sa malikhaing pagkukuwento. Ang modelo ay makukuha sa text-to-speech API(magbubukas sa bagong window). Tandaan na ang mga modelong text-to-speech na ito ay limitado sa mga artipisyal na boses na naka-preset, na sinusubaybayan namin upang matiyak na palagi silang tumutugma sa mga syntetikong preset.

Mga teknikal na inobasyon sa likod ng mga modelo

Pretraining gamit ang mga tunay na mga audio dataset

Ang aming mga bagong modelo ng audio ay nakabatay sa mga arkitektura ng GPT‑4o at GPT‑4o‑mini at malawakan ang pretraining sa mga espesyalisadong dataset na nakatuon sa audio, na naging kritikal sa pag-optimize ng pagganap ng modelo. Ang naka-target na pamamaraang ito ay nagbibigay ng mas malalim na pananaw sa mga bahagyang pagkakaiba sa pagsasalita at nagbibigay-daan sa pambihirang pagganap sa mga gawaing may kinalaman sa audio.

Mga advanced na metodolohiya ng distilasyon

Pinahusay namin ang aming mga teknik sa distilasyon, na nagpapahintulot sa paglilipat ng kaalaman mula sa aming pinakamalalaking mga modelo ng audio patungo sa mas maliliit at mas mahusay na mga modelo. Sa paggamit ng mga advanced na metodolohiya ng self-play, epektibong nakukuha ng aming mga dataset ng distilasyon ang makatotohanang dinamika ng pag-uusap, na ginagaya ang tunay na mga interaksyon ng gumagamit at katulong. Nakakatulong ito sa aming mas maliliit na modelo na makapaghatid ng mahusay na kalidad ng pakikipag-usap at mahusay na pagtugon.

Paradaym ng pagpapatibay ng pag-aaral

Para sa mga modelo naming speech-to-text, isinama namin ang paradym na lubos na nakatuon sa pagpapatibay ng pag-aaral (RL), na nagtutulak sa katumpakan ng pag-transcribe sa mga antas na pinakabago sa industriya. Ang metodolohiyang ito ay lubos na nagpapahusay sa katumpakan at nagpapababa ng mga maling interpretasyon, kaya nagiging napakakumpetitibo ang aming mga solusyon sa speech-to-text sa mga kumplikadong sitwasyon ng pagkilala sa pagsasalita.

Ang mga pag-unlad na ito ay kumakatawan sa progreso sa larangan ng pagmomodelo ng audio, na pinagsasama ang mga makabagong metodolohiya at praktikal na pagpapahusay para sa mas mahusay na pagganap sa mga aplikasyon ng pagsasalita.

Pagiging available ng API

Ang mga bagong modelo ng audio na ito ay magagamit na ngayon ng lahat ng mga developer – higit pang impormasyon tungkol sa pagbuo gamit ang audio dito(magbubukas sa bagong window). Para sa mga developer na kasalukuyang bumubuo ng mga karanasan sa pakikipag-usap gamit ang mga modelong nakabatay sa text, ang pagdaragdag ng mga modelo naming speech-to-text at text-to-speech ang pinakamadaling paraan upang makabuo ng voice agent. Naglalabas kami ng integrasyon sa Agents SDK(magbubukas sa bagong window) na nagpapasimple sa prosesong ito ng pag-develop. Para sa mga developer na naghahanap na bumuo ng mga karanasang mababa ang latency na speech-to-speech, inirerekomenda naming gamitin ang mga modelo naming speech-to-speech sa Realtime API.

Ano ang susunod

Sa hinaharap, plano naming ipagpatuloy ang pamumuhunan sa pagpapahusay ng talino at katumpakan ng aming mga audio na modelo at paggalugad ng mga paraan upang payagan ang mga developer na magdala ng kanilang sariling mga custom na boses upang makabuo ng mas personalisadong mga karanasan na nakaayon sa aming mga pamantayan sa kaligtasan. Bukod dito, patuloy kaming nakikilahok sa mga talakayan kasama ang mga tagapagbatas, mananaliksik, developer, at mga malikhaing indibidwal tungkol sa mga hamon at oportunidad na maaaring idulot ng mga sintetikong boses. Nasasabik kaming makita ang makabago at malikhaing mga aplikasyon na bubuuin ng mga developer gamit ang mga pinahusay na kakayahan sa audio. Mamumuhunan din kami sa iba pang mga modalidad—kabilang ang video—upang pahintulutan ang mga developer na bumuo ng multimodal na agentic na mga karanasan.

Replay ng livestream

Mga May-akda

OpenAI

Mga nangunguna sa pananaliksik

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Mga Contributor

Pananaliksik

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Engineering

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkto

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Mga tagapagtaguyod ng pamunuan

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry