Ruka hadi kwenye maudhui kuu
OpenAI

20 Machi 2025

ToaProduct

Kuwasilisha miundo ya sauti inayofuata katika API

Seti mpya ya miundo ya sauti ya kuendesha mawakala wa sauti, sasa inapatikana kwa wasanidi programu kote duniani.

Picha ya kichwa ya blogu ya miundo ya sauti ya kisasa ya OpenAI
Inapakia…

Sasisho la Tarehe 28 Agosti, 2025: Tulitangaza upatikanaji wa jumla wa Realtime API. Jifunze zaidi hapa.


Katika miezi michache iliyopita, tumewekeza katika kuendeleza akili, uwezo, na manufaa ya mawakala wa maandishi—au mifumo inayofanya kazi kwa kujitegemea kwa niaba ya watumiaji—na matoleo kama Operator, Deep Research, Computer-Using Agents, na Responses API yenye zana zilizojengewa ndani. Hata hivyo, ili mawakala wawe na manufaa ya kweli, watu wanahitaji kuwa na maingiliano ya kina na angavu zaidi na mawakala, zaidi ya maandishi tu—kwa kutumia lugha ya kawaida ya kuzungumza ili kuwasiliana kwa ufanisi.

Leo, tunazindua miundo mipya ya kubadilisha sauti kuwa maandishi na ya kubadilisha maandishi kuwa sauti katika API—na kuwezesha kuunda mawakala wa sauti wenye nguvu zaidi, wanaoweza kubinafsishwa, wenye akili zaidi na wenye thamani halisi. Miundo yetu ya hivi punde ya kubadilisha sauti kuwa maandishi imeweka kiwango kipya cha hali ya juu, ikishinda suluhisho zilizopo katika usahihi na kutegemeka —hasa katika hali ngumu zinazohusisha lafudhi, mazingira yenye kelele, na kasi tofauti za usemi. Maboresho haya yanaongeza kutegemeka kwa unukuzi, na kufanya miundo ifae hasa kwa matumizi kama vile vituo vya simu kwa wateja, unukuzi wa madokezo ya mikutano, na zaidi.

Kwa mara ya kwanza, wasanidi programu wanaweza pia kuelekeza muundo wa kubadilisha maandishi kuwa hotuba kuzungumza kwa njia maalum—kwa mfano, “ongea kama wakala wa huduma kwa wateja mwenye huruma”—na hivyo kufungua kiwango kipya cha ubinafsishaji kwa mawakala wa sauti. Hii inawezesha matumizi mbalimbali yaliyobinafsishwa, kuanzia sauti za huduma kwa wateja zenye huruma na nguvu hadi usimulizi wa kuelezea hisia kwa uzoefu wa ubunifu wa usimulizi wa hadithi.

Tulizindua muundo wetu wa kwanza wa sauti mnamo 2022 na tangu wakati huo, tumejitolea kuboresha akili, usahihi, na kutegemeka kwa miundo hii. Kwa miundo hii mipya ya sauti, wasanidi programu wanaweza kujenga mifumo sahihi na thabiti zaidi ya kubadilisha sauti kuwa maandishi, na sauti za kubadilisha maandishi kuwa sauti zenye sifa zinazoelezea na kueleweka—yote ndani ya API.

Calm
Surfer
Mtaalamu
Medieval knight
Shabiki wa hadithi za uhalifu wa kweli
Hadithi ya wakati wa kulala

Maelezo zaidi kuhusu miundo yetu mipya ya sauti

Miundo mipya ya kubadilisha sauti kuwa maandishi

Tunaanzisha miundo mipya ya gpt-4o-transcribe na gpt-4o-mini-transcribe yenye maboresho katika kiwango cha makosa ya maneno, utambuzi na usahihi bora wa lugha, ikilinganishwa na miundo asili ya Whisper.

gpt-4o-transcribe inaonyesha utendaji uliboreshwa wa Kiwango cha Makosa ya Maneno (WER) ikilinganishwa na miundo iliyopo ya Whisper katika vigezo vingi vilivyoanzishwa, ikionyesha maendeleo makubwa katika teknolojia yetu ya kubadilisha sauti kuwa maandishi. Maendeleo haya yanatokana moja kwa moja na ubunifu uliolengwa katika mafunzo ya uimarishaji na mafunzo ya kina ya kati kwa kutumia seti za data za sauti zenye utofauti na ubora wa juu.

Kwa hivyo, miundo hii mipya ya kubadilisha sauti kuwa maandishi inaweza kunasa vyema zaidi tofauti ndogo za usemi, kupunguza makosa ya utambuzi, na kuongeza kutegemeka kwa unukuzi, hasa katika hali zenye changamoto zinazohusisha lafudhi, mazingira yenye kelele, na kasi tofauti za usemi. miundo hii inapatikana sasa katika speech-to-text API(fungua katika dirisha jipya).

Kiwango cha Makosa ya Maneno (WER) hupima usahihi wa miundo ya utambuzi wa usemi kwa kukokotoa asilimia ya maneno yaliyoandikwa vibaya ikilinganishwa na nakala ya marejeleo—WER ya chini ni bora na inamaanisha makosa machache. Miundo yetu ya hivi karibuni ya kubadilisha sauti kuwa maandishi inapata WER ya chini zaidi katika vigezo vya kulinganisha, ikiwemo FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech)—kigezo cha kulinganisha cha usemi cha lugha nyingi kinachojumuisha zaidi ya lugha 100 kwa kutumia sampuli za sauti zilizonakiliwa kwa mkono. Matokeo haya yanaonyesha usahihi mkubwa wa unukuzi na uenezaji thabiti zaidi wa lugha. Kama inavyoonyeshwa hapa, miundo yetu hufanya kazi bora zaidi kuliko Whisper v2 na Whisper v3 katika tathmini zote za lugha.

Kwenye FLEURS, miundo yetu hutoa WER ya chini na utendaji thabiti wa lugha nyingi. WER ya chini ni bora na inamaanisha makosa machache. Kama inavyoonyeshwa hapa, miundo yetu inalingana au inazidi miundo mingine inayoongoza katika lugha nyingi kuu.

Muundo mpya wa kubadilisha maandishi kuwa sauti

Tunazindua pia muundo mpya wa gpt-4o-mini-tts wenye uwezo bora wa kuelekezwa. Kwa mara ya kwanza, wasanidi programu wanaweza “kuuelekeza” muundo sio tu kuhusu cha kusema bali jinsi ya kukisema—na hivyo kuwezesha uzoefu uliobinafsishwa zaidi kwa matumizi kuanzia huduma kwa wateja hadi usimulizi wa hadithi za ubunifu. Muundo unapatikana katika text-to-speech API(fungua katika dirisha jipya). Kumbuka kwamba miundo hii ya kubadilisha maandishi kuwa sauti ina uwezo tu wa sauti bandia zilizowekwa awali, ambazo tunazifuatilia ili kuhakikisha kwamba zinalingana na mipangilio ya awali ya sintetiki kila wakati.

Ubunifu wa kiteknolojia inayoendesha miundo

Mafunzo ya awali kwa kutumia seti halisi za data za sauti

Miundo yetu mipya ya sauti imajengwa kwa msingi wa usanifu wa GPT‑4o na GPT‑4o‑mini na imefunzwa kwa seti maalum za data zinazozingatia sauti, ambazo zimekuwa muhimu katika kuboresha utendaji wa miundo. Mbinu hii hutoa ufahamu wa kina zaidi kuhusu vipengele vya usemi na huwezesha utendaji wa kipekee katika kazi zinazohusiana na sauti.

Mbinu za hali ya juu za kuchuja

Tumeboresha mbinu zetu za kuchuja, na kuwezesha uhamishaji wa maarifa kutoka kwa miundo yetu mikubwa zaidi ya sauti hadi miundo midogo na yenye ufanisi zaidi. Kwa kutumia mbinu za hali ya juu za kujichezea, seti zetu za data za uchujaji hunasa mienendo halisi ya mazungumzo, na kuiga mwingiliano halisi wa mtumiaji na msaidizi. Hii husaidia miundo yetu midogo kutoa ubora wa hali ya juu wa mazungumzo na mwitikio.

Dhana ya mafunzo ya uimarishaji

Kwa miundo yetu ya kubadilisha sauti kuwa maandishi, tumeunganisha dhana inayotegemea sana mafunzo ya uimarishaji (RL), tukiboresha usahihi wa unukuzi hadi viwango vya hali ya juu. Mbinu hii inaboresha usahihi kwa kiasi kikubwa na kupunguza matokeo ya uongo, na kufanya suluhisho zetu za kubadilisha sauti kuwa maandishi ziwe bora zaidi katika hali changamano za utambuzi wa usemi.

Maendeleo haya yanawakilisha maendeleo katika uwanja wa uundaji wa sauti, ukichanganya mbinu bunifu na uboreshaji wa vitendo kwa ajili ya utendaji ulioboreshwa katika programu za usemi.

Upatikanaji wa API

Miundo hii mipya ya sauti inapatikana sasa kwa wasanidi programu wote – zaidi kuhusu kujenga kwa kutumia sauti hapa(fungua katika dirisha jipya). Kwa wasanidi programu ambao tayari wanaunda uzoefu wa mazungumzo kwa kutumia miundo inayotegemea maandishi, kuongeza miundo yetu ya kubadilisha sauti kuwa maandishi na kubadilisha maandishi kuwa sauti ni njia rahisi zaidi ya kujenga wakala wa sauti. Tunatoa muunganisho na Agents SDK(fungua katika dirisha jipya) ambao unarahisisha mchakato huu wa uundaji. Kwa wasanidi programu wanaotaka kujenga uzoefu wa sauti hadi sauti bila kuchelewa, tunapendekeza kujenga kwa kutumia miundo yetu ya sauti hadi sauti katika Realtime API.

Kipi kinaychofuata

Tukiangalia mbele, tunapanga kuendelea kuwekeza katika kuboresha akili na usahihi wa miundo yetu ya sauti na kuchunguza njia za kuwaruhusu wasanidi programu kuleta sauti zao maalum ili kujenga uzoefu uliobinafsishwa zaidi kwa njia zinazoendana na viwango vyetu vya usalama. Zaidi ya hayo, tunaendelea kushiriki katika mazungumzo na watunga sera, watafiti, wasanidi programu, na wabunifu kuhusu changamoto na fursa ambazo sauti bandia zinaweza kuleta. Tunatazamia kuona programu za ubunifu na za kipekee ambazo wasanidi programu wataunda kwa kutumia uwezo huu wa sauti ulioboreshwa. Pia tutawekeza katika mbinu nyingine—ikiwemo video—ili kuwawezesha wasanidi programu kujenga uzoefu wa kiwakala wa aina nyingi.

Rudia matangazo ya moja kwa moja

Waandishi

OpenAI

Viongozi wa utafiti

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Wachangiaji

Utafiti

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Uhandisi

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Product

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Wadhamini wa uongozi

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry