Představujeme audio modely další generace v rozhraní API
Nová sada audio modelů pro podporu hlasových agentů, nyní k dispozici vývojářům po celém světě.

Aktualizace k 28. srpnu 2025: Oznámili jsme všeobecnou dostupnost rozhraní Realtime API. Více informací zde.
Během posledních několika měsíců jsme investovali do rozvoje inteligence, schopností a užitečnosti textových agentů (tedy systémů, které samostatně plní úkoly jménem uživatelů) a vydali jsme funkce typu operátor, hloubkový výzkum, agent používající počítač a rozhraní Responses API s integrovanými nástroji. Aby však byli agenti skutečně užiteční, musí mít lidé možnost hlubší a intuitivnější interakce s agenty, než je pouhý text. K efektivní komunikaci musí používat přirozený mluvený jazyk.
Dnes v rozhraní API spouštíme nové zvukové modely převodu řeči na text a textu na řeč, které umožňují vytvářet výkonnější, přizpůsobitelnější a inteligentnější hlasové agenty, kteří nabízejí skutečnou hodnotu. Naše nejnovější modely převodu řeči na text nastavují nový standard špičkové úrovně, překonávají stávající řešení přesností a spolehlivosti, zejména v náročných scénářích zahrnujících přízvuky, hlučné prostředí a různé rychlosti řeči. Tato vylepšení zvyšují spolehlivost přepisu, takže modely jsou obzvláště vhodné pro použití v zákaznických call centrech, při přepisování poznámek z jednání atd.
Poprvé také mohou vývojáři dát modelu převodu textu na řeč pokyn, aby mluvil určitým způsobem: například „mluv jako sympatický pracovník zákaznického servisu“ Otevírá se tím nová úroveň přizpůsobení hlasových agentů. To umožňuje širokou škálu aplikací na míru, od empatičtějšího a dynamičtějšího hlasu v zákaznickém servisu až po expresivní vyprávění pro kreativní vyprávění příběhů.
Náš první audio model jsme uvedli na trh v roce 2022 a od té doby se snažíme zlepšovat inteligenci, přesnost a spolehlivost těchto modelů. Díky těmto novým zvukovým modelům mohou vývojáři vytvářet přesnější a robustnější systémy převodu řeči na text a výrazné, charakteristické hlasy pro převod textu na řeč. To vše v rámci rozhraní API.
Představujeme nové modely gpt-4o-transcribe a gpt-4o-mini-transcribe s vylepšenou mírou chybovosti slov, lepším rozpoznáváním jazyka a vyšší přesností ve srovnání s původními modely Whisper.
gpt-4o-transcribe vykazuje lepší výkonnost v oblasti chybovosti slov (Word Error Rate - WER) než stávající modely Whisper v několika zavedených srovnávacích testech, což odráží významný pokrok v naší technologii převodu řeči na text. Tyto pokroky jsou přímým důsledkem cílených inovací v oblasti posilování učení a rozsáhlého středního tréninku s různými, vysoce kvalitními soubory zvukových dat.
Díky tomu mohou tyto nové modely převodu řeči na text lépe zachytit nuance řeči, snížit počet chybných rozpoznání a zvýšit spolehlivost přepisu, zejména v náročných scénářích zahrnujících přízvuk, hlučné prostředí a různé rychlosti řeči. Tyto modely jsou nyní k dispozici v rozhraní API pro převod řeči na text(otevře se v novém okně).
Míra chybovosti slov (WER) měří přesnost modelů pro rozpoznávání řeči tím, že vypočítává procento nesprávně přepsaných slov ve srovnání s referenčním přepisem. Čím je hodnota WER nižší, tím je to lepší a znamená méně chyb. Naše nejnovější modely převodu řeči na text dosahují nižších hodnot WER ve srovnávacích testech, včetně srovnání FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), což je vícejazyčný srovnávací test řeči zahrnující více než 100 jazyků, který používá ručně přepisované zvukové vzorky. Tyto výsledky ukazují vyšší přesnost přepisu a robustnější pokrytí jazyka. Jak je zde vidět, naše modely konzistentně překonávají modely Whisper v2 a Whisper v3 ve všech jazykových hodnoceních.
V systému FLEURS dosahují naše modely nižší chybovosti slov (WER) a vysoké vícejazyčné výkonnosti. Nižší hodnota WER je lepší a znamená méně chyb. Jak je zde uvedeno, naše modely se ve většině hlavních jazyků vyrovnají jiným předním modelům nebo je překonávají.
Také spouštíme nový model gpt-4o-mini-tts s lepšími možnostmi řízení. Poprvé mohou vývojáři „dávat“ modelu pokyny nejen v tom, co má říkat, ale i jak to má říkat. To umožňuje více přizpůsobené zážitky pro použití v prostředích od zákaznického servisu po kreativní vyprávění příběhů. Model je dostupný v API pro převod textu na řeč(otevře se v novém okně). Upozorňujeme, že tyto modely pro převod textu na řeč jsou omezeny na umělé, přednastavené hlasy, které sledujeme, abychom měli jistotu, že konzistentně odpovídají syntetickým přednastaveným hlasům.
Naše nové audio modely staví na architekturách GPT‑4o a GPT‑4o‑mini a jsou důkladně předtrénováné na specializovaných datasetech zaměřených na audio, které byly rozhodující pro optimalizaci výkonu modelu. Tento cílený přístup poskytuje hlubší vhled do nuancí řeči a umožňuje výjimečný výkon v úlohách souvisejících se zvukem.
Vylepšili jsme naše techniky destilace, které umožňují přenos znalostí z našich největších audio modelů do menších a efektivnějších modelů. Díky pokročilým metodikám samostatného přehrávání zachycují naše destilační datové sady účinně realistickou dynamiku konverzace a kopírují skutečné interakce mezi uživatelem a asistentem. Díky tomu naše menší modely poskytují vynikající kvalitu konverzace a rychlou odezvu.
Do našich modelů převodu řeči na text jsme integrovali paradigma učení s posilováním (RL), které posunulo přesnost přepisu na nejmodernější úroveň. Tato metodika výrazně zvyšuje přesnost a snižuje halucinace, díky čemuž jsou naše řešení převodu řeči na text mimořádně konkurenceschopná ve složitých scénářích rozpoznávání řeči.
Tento vývoj představuje pokrok v oblasti modelování zvuku a kombinuje inovativní metodiky s praktickými vylepšeními pro zvýšení výkonu v řečových aplikacích.
Tyto nové audio modely jsou nyní k dispozici všem vývojářům – více informací o vývoji s audiem najdete zde(otevře se v novém okně). Pro vývojáře, kteří už vytvářejí konverzační aplikace s textovými modely, je přidání našich modelů pro převod řeči na text a textu na řeč nejjednodušším způsobem, jak vytvořit hlasového agenta. Vydáváme integraci s Agents SDK(otevře se v novém okně), která tento proces vývoje zjednodušuje. Vývojářům, kteří chtějí vytvářet aplikace s nízkou latencí pro řečový vstup i výstup, doporučujeme použít naše modely pro řečový vstup i výstup v rozhraní Realtime API.
Do budoucna plánujeme i nadále investovat do zlepšování inteligence a přesnosti našich audio modelů a zkoumat způsoby, jak umožnit vývojářům přinášet vlastní hlasy a vytvářet tak ještě personalizovanější zážitky způsobem, který je v souladu s našimi bezpečnostními standardy. Kromě toho se i nadále zapojujeme do rozhovorů s tvůrci politik, výzkumníky, vývojáři a kreativci o výzvách a příležitostech, které mohou syntetické hlasy přinášet. Jsme zvědaví, jaké inovativní a kreativní aplikace budou vývojáři s využitím těchto rozšířených zvukových možností vytvářet. Budeme také investovat do dalších modalit, včetně videa, abychom vývojářům umožnili vytvářet multimodální agentntí prostředí.
Autoři
Vedoucí výzkumu
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Přispěvatelé
Výzkum
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Inženýrství
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produkt
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Hlavní sponzoři
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry