Esittelyssä seuraavan sukupolven äänimallit API-rajapinnassa
Uusi äänimallien kokonaisuus ääniagenttien käyttöön. Nyt saatavilla kehittäjille maailmanlaajuisesti.

Päivitys 28. elokuuta 2025: ilmoitimme reaaliaikaisen API:n yleisestä saatavuudesta. Lue lisää täältä.
Viime kuukausien aikana olemme investoineet tekstipohjaisten agenttien – tai järjestelmien, jotka suorittavat tehtäviä itsenäisesti käyttäjien puolesta – älykkyyden, kyvykkyyksien ja hyödyllisyyden kehittämiseen julkaisuilla, kuten Operator, syvätutkimus, tietokonetta käyttävät agentit ja Responses API sisäänrakennetuilla työkaluilla. Jotta agentit olisivat aidosti hyödyllisiä, ihmisten täytyy pystyä olemaan syvällisemmässä ja intuitiivisemmassa vuorovaikutuksessa agenttien kanssa pelkän tekstin sijaan – käyttäen luonnollista puhuttua kieltä tehokkaaseen viestintään.
Tänään julkaisemme API:ssa uudet puheesta tekstiksi- ja tekstistä puheeksi -äänimallit, mikä mahdollistaa entistä tehokkaampien, mukautettavampien ja älykkäämpien ääniagenttien rakentamisen, jotka tarjoavat todellista arvoa. Uusimmat puheesta tekstiksi -mallimme asettavat uuden huipputason vertailuarvon, ylittäen olemassa olevat ratkaisut tarkkuudessa ja luotettavuudessa – erityisesti haastavissa tilanteissa, joissa on aksentteja, meluisia ympäristöjä ja vaihtelevia puhenopeuksia. Nämä parannukset lisäävät transkription luotettavuutta, mikä tekee malleista erityisen sopivia käyttötapauksiin, kuten asiakaspalvelukeskuksiin ja kokousmuistiinpanojen transkriptioon.
Ensimmäistä kertaa kehittäjät voivat ohjeistaa tekstistä puheeksi -mallia puhumaan tietyllä tavalla, esimerkiksi ”puhu kuin empaattinen asiakaspalveluagentti”, mikä avaa ääniagenttien mukauttamiselle uuden tason. Tämä mahdollistaa laajan valikoiman räätälöityjä sovelluksia, aina empaattisemmista ja dynaamisemmista asiakaspalveluäänistä ilmaisuvoimaiseen kerrontaan luovissa tarinankerrontakokemuksissa.
Julkaisimme ensimmäisen äänimallimme vuonna 2022 ja siitä lähtien olemme sitoutuneet parantamaan näiden mallien älykkyyttä, tarkkuutta ja luotettavuutta. Näiden uusien äänimallien avulla kehittäjät voivat luoda tarkempia ja kestävämpiä puheesta tekstiksi -järjestelmiä sekä ilmeikkäitä ja persoonallisia tekstistä puheeksi -ääniä – kaikki API:n kautta.
Esittelemme uudet gpt-4o-transcribe- ja gpt-4o-mini-transcribe-mallit, joissa on parannuksia sanan virhetasoon sekä parempi kielentunnistus ja tarkkuus verrattuna alkuperäisiin Whisper-malleihin.
gpt-4o-transcribe osoittaa parantunutta sanan virhetaso (WER) -suorituskykyä verrattuna nykyisiin Whisper-malleihin useilla vakiintuneilla vertailuarvoilla, mikä heijastaa merkittävää edistystä puheentunnistusteknologiassamme. Nämä edistysaskeleet johtuvat suoraan kohdennetuista innovaatioista vahvistusoppimisessa ja laajasta keskitason koulutuksesta monipuolisilla, korkealaatuisilla äänitietojoukoilla.
Tämän seurauksena nämä uudet puheesta tekstiksi -mallit pystyvät paremmin havaitsemaan puheen vivahteet, vähentämään tunnistamisvirheitä ja parantamaan transkription luotettavuutta, erityisesti haastavissa tilanteissa, joissa on aksentteja, meluisia ympäristöjä ja vaihtelevia puhenopeuksia. Nämä mallit ovat nyt saatavilla puheesta tekstiksi-API:ssa(avautuu uudessa ikkunassa).
Sanan virhetaso (WER) mittaa puheentunnistusmallien tarkkuutta laskemalla virheellisesti litteroitujen sanojen prosenttiosuuden viitelitterointiin verrattuna – mitä pienempi WER on, sitä parempi, ja se tarkoittaa vähemmän virheitä. Uusimmat puheentunnistusmallimme saavuttavat alhaisemman WER:n eri vertailuaineistoissa, mukaan lukien FLEURS (muutamalla esimerkillä opettamisen arviointi universaalien puhe-esitysten oppimisessa) – monikielinen puhevertailuaineisto, joka kattaa yli 100 kieltä ja käyttää manuaalisesti litteroituja ääninäytteitä. Nämä tulokset osoittavat vahvempaa transkription tarkkuutta ja kielen kattavuutta. Kuten tässä näkyy, mallimme suoriutuvat johdonmukaisesti paremmin kuin Whisper v2 ja Whisper v3 kaikissa kieliarvioissa.
FLEURS-aineistossa mallimme saavuttavat alhaisemman sanan virhetason (WER) ja vahvan monikielisen suorituskyvyn. Matalampi WER on parempi ja tarkoittaa vähemmän virheitä. Kuten tässä näkyy, mallimme vastaavat tai ylittävät muiden johtavien mallien tason useimmissa tärkeimmissä kielissä.
Julkaisemme myös uuden gpt-4o-mini-tts -mallin, jossa on parempi ohjattavuus. Ensimmäistä kertaa kehittäjät voivat “ohjeistaa” mallia paitsi mitä sanoa, myös miten sanoa se – mikä mahdollistaa entistä räätälöidympiä kokemuksia asiakaspalvelusta luovaan tarinankerrontaan. Malli on saatavilla tekstistä puheeksi API:ssa(avautuu uudessa ikkunassa). Huomaa, että nämä tekstistä puheeksi -mallit rajoittuvat keinotekoisiin, ennalta määritettyihin ääniin, joita valvomme varmistaaksemme, että ne vastaavat johdonmukaisesti synteettisiä esiasetuksia.
Uudet äänimallimme rakentuvat GPT‑4o‑ ja GPT‑4o‑mini‑arkkitehtuureille ja ovat laajasti esikoulutettuja erikoistuneilla äänikeskeisillä tietojoukoilla, jotka ovat olleet ratkaisevan tärkeitä mallien suorituskyvyn optimoinnissa. Tämä kohdennettu lähestymistapa antaa syvällisemmän ymmärryksen puheen vivahteista ja mahdollistaa erinomaisen suorituskyvyn kaikissa ääniin liittyvissä tehtävissä.
Olemme parantaneet tiivistysmenetelmiämme, mikä mahdollistaa tiedon siirtämisen suurimmista äänimalleistamme pienempiin ja tehokkaampiin malleihin. Hyödyntämällä edistyneitä itseoppimismenetelmiä, tiivistämistietojoukkomme tallentavat tehokkaasti realistisia keskusteludynamiikkoja ja jäljittelevät aitoja käyttäjä-avustaja-vuorovaikutuksia. Tämä auttaa pienempiä mallejamme tuottamaan erinomaisen keskustelulaadun ja reagointikyvyn.
Puheesta tekstiksi -malleihimme olemme integroineet vahvistusoppimiseen (RL) painottuvan paradigman, joka on nostanut transkription tarkkuuden huipputasolle. Tämä menetelmä parantaa huomattavasti tarkkuutta ja vähentää virhetulkintoja, mikä tekee puheesta tekstiksi -ratkaisuistamme erittäin kilpailukykyisiä monimutkaisissa puheentunnistustilanteissa.
Nämä kehitysaskeleet edustavat edistystä audiomallinnuksen alalla, yhdistäen innovatiivisia menetelmiä käytännön parannuksiin puhesovellusten suorituskyvyn parantamiseksi.
Nämä uudet äänimallit ovat nyt kaikkien kehittäjien käytettävissä – lisätietoja äänen parissa rakentamisesta löydät täältä(avautuu uudessa ikkunassa). Kehittäjille, jotka jo luovat keskustelukokemuksia tekstipohjaisilla malleilla, puheesta tekstiksi- ja tekstistä puheeksi -malliemme lisääminen on helpoin tapa luoda ääniagentti. Julkaisemme integraation Agents SDK(avautuu uudessa ikkunassa):n kanssa, joka yksinkertaistaa tätä kehitysprosessia. Kehittäjille, jotka haluavat luoda vähäviiveisiä puheesta puheeksi -kokemuksia, suosittelemme käyttämään puheesta puheeksi -mallejamme Realtime API:ssa.
Tulevaisuutta silmällä pitäen aiomme jatkaa investointeja äänimalliemme älykkyyden ja tarkkuuden parantamiseen sekä tutkia keinoja, joilla kehittäjät voivat tuoda omia mukautettuja ääniään luodakseen entistä yksilöllisempiä kokemuksia turvallisuusstandardiemme mukaisesti. Lisäksi jatkamme keskusteluja poliittisten päättäjien, tutkijoiden, kehittäjien ja luovien ammattilaisten kanssa synteettisten äänien tuomista haasteista ja mahdollisuuksista. Odotamme innolla, millaisia innovatiivisia ja luovia sovelluksia kehittäjät luovat näiden parannettujen äänitoimintojen avulla. Investoimme myös muihin modaliteetteihin – mukaan lukien video – jotta kehittäjät voivat luoda multimodaalisia agenttisia kokemuksia.
Tekijät
Tutkimusaiheet
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Tukijat
Tutkimus
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Tekniikka
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Tuote
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Johtajuuden tukijat
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry