Kynning á næstu kynslóð hljóðlíkana í API
Nýtt safn hljóðlíkana til að knýja raddfulltrúa, nú í boði fyrir forritara um allan heim.

Uppfærsla 28. ágúst 2025: Við tilkynntum almennt framboð á Realtime API. Lestu meira hér.
Undanfarna mánuði höfum við fjárfest í að efla gervigreind, getu og notagildi textamiðaðra fulltrúa—eða kerfa sem sjálfstætt framkvæma verkefni fyrir hönd notenda—með útgáfum eins og Stjórnandi, djúprannsókn, fulltrúum sem nota tölvu og Responses API með innbyggðum verkfærum. Hins vegar, til þess að fulltrúar séu raunverulega gagnlegir, þarf fólk að geta átt dýpri og innsæisríkari samskipti við þá en bara í gegnum texta—með því að nota náttúrulegt talað mál til að eiga skilvirk samskipti.
Í dag kynnum við ný tal-í-texta og texta-í-tal hljóðlíkön í API—sem gerir það mögulegt að þróa öflugri, sérsniðnari og greindari raddfulltrúa sem veita raunverulegt virði. Nýjustu tal-í-texta líkönin okkar setja nýtt viðmið í fremstu röð og skara fram úr núverandi lausnum hvað varðar nákvæmni og áreiðanleika—sérstaklega í krefjandi aðstæðum með hreim, hávaðasömu umhverfi og mismunandi talhraða. Þessar endurbætur auka áreiðanleika umritunar, sem gerir líkönin sérstaklega hentug fyrir notkunartilvik eins og þjónustuver, umritun fundargerða og fleira.
Í fyrsta sinn geta forritarar einnig leiðbeint texta-í-tal líkaninu um að tala á ákveðinn hátt—til dæmis „talaðu eins og samúðarfullur þjónustufulltrúi“—og þannig opnað nýtt stig sérsniðningar fyrir fulltrúa. Þetta greiðir fyrir fjölbreytt úrval sérsniðinna forrita, allt frá samkenndarfullum og dýnamískum röddum í þjónustu við viðskiptavini til tjáningarríkrar frásagnar fyrir skapandi sagnagerðarupplifanir.
Við settum á markað fyrsta hljóðlíkanið okkar árið 2022 og síðan þá höfum við skuldbundið okkur til að bæta gervigreind, nákvæmni og áreiðanleika þessara líkana. Með þessum nýju líkönum geta forritarar búið til nákvæmari og öflugri tal-í-texta kerfi og svipmeiri, persónulegri texta-í-tal raddir—allt innan API.
Við erum að kynna ný gpt-4o-transcribe og gpt-4o-mini-transcribe líkön með endurbótum á villuhlutfalli orða og betri tungumálagreiningu og nákvæmni, samanborið við upprunalegu Hvíslari-líkönin.
gpt-4o-transcribe sýnir betri frammistöðu í Word Error Rate (WER) en núverandi Hvíslari-líkön á mörgum rótgrónum viðmiðum, sem endurspeglar verulegar framfarir í tal-í-texta tækni okkar. Þessar framfarir stafa beint af markvissum nýjungum í styrkingarnámi og umfangsmikilli miðþjálfun með fjölbreyttum og hágæða hljóðgagnasöfnum.
Þess vegna geta þessi nýju tal-í-texta líkön betur fangað blæbrigði í tali, dregið úr ranggreiningum og aukið áreiðanleika umritunar, sérstaklega í krefjandi aðstæðum með hreim, hávaðasömu umhverfi og mismunandi talhraða. Þessi líkön eru nú í boði í speech-to-text API(opnast í nýjum glugga).
Word Error Rate (WER) mælir nákvæmni talgreiningarlíkana með því að reikna hlutfall ranglega umritaðra orða miðað við viðmiðunartexta—lægra WER er betra og þýðir færri villur. Nýjustu tal-í-texta líkönin okkar ná lægri WER yfir viðmið, þar á meðal FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech)—fjöltyngt talviðmið sem nær yfir meira en 100 tungumál og notar umritaðar hljóðupptökur. Þessar niðurstöður sýna aukna nákvæmni í umritun og sterkari tungumálaþjónustu. Eins og sýnt er hér skara líkönin okkar stöðugt fram úr Hvíslari v2 og Hvíslari v3 í öllum tungumálamatsferlum.
Á FLEURS skila líkönin okkar lægra WER og sterkri fjöltyngdri frammistöðu. Lægra WER er betra og þýðir færri villur. Eins og sýnt er hér, jafnast líkönin okkar á við eða skara fram úr öðrum leiðandi líkönum í flestum helstu tungumálum.
Við erum líka að kynna nýtt gpt-4o-mini-tts líkan með betri stýringu. Í fyrsta sinn geta forritarar „leiðbeint“ líkaninu ekki aðeins um hvað það á að segja heldur einnig hvernig það á að segja það—sem gerir kleift að bjóða upp á sérsniðnari upplifun fyrir notkunartilvik, allt frá þjónustu við viðskiptavini til skapandi frásagnar. Líkanið er í boði í text-to-speech API(opnast í nýjum glugga). Athugaðu að þessi texta-í-tal líkön eru takmörkuð við tilbúnar, forstilltar raddir, sem við fylgjumst með til að tryggja að þær passi stöðugt við tilbúnar forstillingar.
Nýju hljóðlíkönin okkar byggja á GPT‑4o og GPT‑4o‑mini högunum og eru ítarlega forþjálfuð á sérhæfðum hljóðgagnasöfnum, sem hefur verið lykilatriði í að hámarka frammistöðu líkansins. Þessi markvissa nálgun veitir ítarlegri innsýn í blæbrigði í tali og gerir kleift að skila framúrskarandi frammistöðu í hljóðtengdum verkefnum.
Við höfum bætt síunartækni okkar, sem gerir kleift að flytja þekkingu frá stærstu hljóðlíkönum okkar yfir í minni og skilvirkari líkön. Með því að nýta háþróaðar sjálfsleiks-aðferðir ná síunargagnasöfn okkar á skilvirkan hátt að fanga raunhæfa samtalsdýnamík og endurskapa ósvikin samskipti milli notanda og aðstoðarmanns. Þetta hjálpar minni líkönunum okkar að skila framúrskarandi samtalsgæðum og skjótum viðbrögðum.
Fyrir tal-í-texta líkönin okkar höfum við samþætt hugmyndafræði sem byggir mikið á styrkingarnámi (RL), sem eykur nákvæmni umritunar upp á háþróað stig. Þessi aðferðafræði eykur nákvæmni verulega og dregur úr ofskynjunum, sem gerir tal-í-texta lausnir okkar einstaklega samkeppnishæfar í flóknum talgreiningaraðstæðum.
Þessar framfarir endurspegla skref fram á við á sviði hljóðlíkangerðar, þar sem nýstárlegar aðferðir eru sameinaðar hagnýtum endurbótum til að bæta afköst í talforritum.
Þessi nýju hljóðlíkön eru nú í boði fyrir alla forritara – meira um hvernig á að smíða með hljóði hér(opnast í nýjum glugga). Fyrir þróunaraðila sem þegar eru að þróa samræðuupplifanir með textamiðuðum líkönum er einfaldasta leiðin til að búa til raddfulltrúa að bæta við tal-í-texta og texta-í-tal líkönum okkar. Við erum að gefa út samþættingu við Agents SDK(opnast í nýjum glugga) sem einfaldar þetta þróunarferli. Fyrir þróunaraðila sem vilja búa til tal-í-tal upplifun með litlum biðtíma mælum við með að nota tal-í-tal líkönin okkar í Realtime API.
Við horfum til framtíðar og ætlum að halda áfram að fjárfesta í að bæta gervigreind og nákvæmni hljóðlíkana okkar. Við munum einnig kanna leiðir til að gera forriturum kleift að nota sínar eigin sérsniðnu raddir til að skapa enn persónulegri upplifanir, í samræmi við öryggisstaðla okkar. Að auki erum við að halda áfram að eiga í samtölum við stefnumótendur, rannsakendur, þróunaraðila og skapandi einstaklinga um þær áskoranir og tækifæri sem tilbúnar raddir geta haft í för með sér. Við hlökkum til að sjá nýstárleg og skapandi forrit sem forritarar munu smíða með þessum endurbættu hljóðmöguleikum. Við munum einnig fjárfesta í öðrum miðlum—þar á meðal myndböndum—til að gera forriturum kleift að byggja upp fjölþætta upplifun með fulltrúum.
Höfundar
Rannsóknarstjórar
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Þátttakendur
Rannsóknir
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Verkfræði
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Vara
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Forystuaðilar sem veita stuðning
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry