Preskočiť na hlavný obsah
OpenAI

20. marca 2025

VydanieProdukt

Predstavujeme audio modely novej generácie v API.

Nová sada audio modelov na pohon hlasových agentov, teraz dostupná pre vývojárov na celom svete.

Hlavný obrázok blogu OpenAI o modeloch novej generácie pre audio
Načítava sa…

Aktualizácia z 28. augusta 2025: Oznámili sme všeobecnú dostupnosť Realtime API. Viac informácií nájdeš tu.


Za posledných niekoľko mesiacov sme investovali do rozvoja inteligencie, schopností a užitočnosti textových agentov alebo systémov, ktoré samostatne vykonávajú úlohy v mene používateľov s vydaniami ako operátor, hlboký výskum, agent používania počítača a Responses API so vstavanými nástrojmi. Aby však boli agenti skutočne užitoční, ľudia musia byť schopní mať s agentmi hlbšie a intuitívnejšie interakcie nad rámec samotného textu – musia na efektívnu komunikáciu používať prirodzený hovorený jazyk.

Dnes uvádzame nové modely prevodu reči na text a textu na reč v rozhraní API, čo umožňuje vytvárať výkonnejších, prispôsobiteľných a inteligentných hlasových agentov, ktorí prinášajú skutočnú hodnotu. Naše najnovšie modely prevodu reči na text stanovujú nový špičkový štandard, prekonávajú existujúce riešenia v presnosti a spoľahlivosti, najmä v náročných situáciách s prízvukmi, hlučným prostredím a rôznymi rýchlosťami reči. Tieto vylepšenia zvyšujú spoľahlivosť prepisu, vďaka čomu sú modely obzvlášť vhodné na použitie v zákazníckych call centrách, pri prepisovaní poznámok zo stretnutí a podobne.

Po prvýkrát môžu vývojári inštruovať model prevodu textu na reč, aby hovoril konkrétnym spôsobom – napríklad „hovor ako empatický agent zákazníckej podpory“ – čím sa otvára nová úroveň prispôsobenia pre hlasových agentov. Toto umožňuje širokú škálu prispôsobených aplikácií, od empatickejších a dynamickejších hlasov zákazníckeho servisu až po expresívne rozprávanie pre kreatívne zážitky z tvorivého rozprávania príbehov.

V roku 2022 sme uviedli na trh náš prvý audio model a odvtedy sme sa zaviazali zlepšovať inteligenciu, presnosť a spoľahlivosť týchto modelov. S týmito novými audio modelmi môžu vývojári vytvárať presnejšie a robustnejšie systémy na prevod reči na text a expresívne, charakteristické hlasy na prevod textu na reč – to všetko v rámci API.

Pokoj
Surfer
Professional
Stredoveký rytier
Nadšenec kriminálnych prípadov
Rozprávka na dobrú noc

Viac o našich najnovších modeloch audio zariadení

Nové modely prevodu reči na text

Predstavujeme nové modely gpt-4o-transcribegpt-4o-mini-transcribe so zlepšenou mierou chybovosti slov, lepším rozpoznávaním jazykov a vyššou presnosťou v porovnaní s pôvodnými modelmi Whisper.

gpt-4o-transcribe demonštruje zlepšený výkon v miere chybovosti slov (WER) oproti existujúcim modelom Whisper naprieč viacerými zavedenými benchmarkmi, čo odráža významný pokrok v našej technológii prevodu reči na text. Tieto pokroky priamo vyplývajú z cielených inovácií v učení posilňovaním a rozsiahleho stredného tréningu s rozmanitými vysokokvalitnými zvukovými dátovými súbormi.

V dôsledku toho môžu tieto nové modely prevodu reči na text lepšie zachytiť nuansy reči, znížiť chybné rozpoznania a zvýšiť spoľahlivosť prepisu, najmä v náročných situáciách s prízvukmi, hlučným prostredím a rôznymi rýchlosťami reči. Tieto modely sú teraz k dispozícii v API pre prevod reči na text(otvorí sa v novom okne).

Miera chybovosti slov (WER) meria presnosť modelov na rozpoznávanie reči tým, že vypočíta percento nesprávne prepísaných slov v porovnaní s referenčným prepisom. Nižšia hodnota WER je lepšia a znamená menej chýb. Naše najnovšie modely prevodu reči na text dosahujú nižšiu WER naprieč benchmarkmi vrátane FLEURS (niekoľkopríkladové vyhodnotenie učenia univerzálneho zastúpenia reči) – multilingválneho benchmarku reči, ktorý pokrýva viac ako 100 jazykov a používa manuálne prepísané zvukové vzorky. Tieto výsledky ukazujú vyššiu presnosť prepisu a robustnejšie pokrytie jazykov. Ako je tu uvedené, naše modely dôsledne prekonávajú Whisper v2 a Whisper v3 vo všetkých jazykových hodnoteniach.

Na FLEURS naše modely dosahujú nižšiu mieru chybovosti slov (WER) a silný viacjazyčný výkon. Nižšia hodnota WER je lepšia a znamená menej chýb. Ako je tu uvedené, naše modely sa vyrovnajú alebo prekonávajú iné popredné modely vo väčšine hlavných jazykov.

Nový model prevodu textu na reč

Taktiež uvádzame nový model gpt-4o-mini-tts s lepšou ovládateľnosťou. Po prvýkrát môžu vývojári „inštruovať“ model nielen o tom, čo má povedať, ale aj ako to má povedať, umožňujúc tak viac prispôsobené zážitky pre prípady použitia od zákazníckeho servisu až po tvorivé rozprávanie príbehov. Model je dostupný v API na prevod textu na reč(otvorí sa v novom okne). Upozorňujeme, že tieto modely prevodu textu na reč sú obmedzené na umelé prednastavené hlasy, ktoré monitorujeme, aby sme zabezpečili, že vždy zodpovedajú syntetickým predvoľbám.

Technické inovácie za modelmi

Predtrénovanie s autentickými zvukovými dátovými súbormi

Naše nové audio modely stavajú na architektúrach GPT‑4o a GPT‑4o‑mini a sú rozsiahlo predtrénované na špecializovaných datasetoch zameraných na zvuk, ktoré boli kľúčové pri optimalizácii výkonu modelu. Tento cielený prístup poskytuje hlbší pohľad na nuansy reči a umožňuje výnimočný výkon v úlohách súvisiacich so zvukom.

Pokročilé metódy destilácie

Vylepšili sme naše techniky destilácie, čo umožňuje prenos znalostí z  našich najväčších zvukových modelov do menších a efektívnejších modelov. Využitím pokročilých metodík samoučenia naše destilačné súbory údajov efektívne zachytávajú realistickú dynamiku konverzácií a replikujú autentické interakcie medzi používateľom a asistentom. To pomáha našim menším modelom poskytovať vynikajúcu kvalitu konverzácie a pohotovosť.

Paradigma učenia posilňovaním

Pre naše modely prevodu reči na text sme integrovali paradigmu silne zameranú na učenie posilňovaním (RL), čím sme dosiahli, že presnosť prepisu dosahuje úroveň najmodernejších technológií. Táto metodika dramaticky zlepšuje presnosť a znižuje výskyt halucinácií, čím sa naše riešenia prevodu reči na text stávajú mimoriadne konkurencieschopnými v zložitých scenároch rozpoznávania reči.

Tieto vývojové kroky predstavujú pokrok v oblasti modelovania zvuku, kombinujúc inovatívne metodiky s praktickými vylepšeniami pre lepší výkon v rečových aplikáciách.

Dostupnosť API

Tieto nové audio modely sú teraz k dispozícii všetkým vývojárom – viac o tvorbe so zvukom nájdeš tu(otvorí sa v novom okne). Pre vývojárov, ktorí už vytvárajú konverzačné zážitky s textovými modelmi, je pridanie našich modelov na prevod reči na text a textu na reč najjednoduchším spôsobom, ako vytvoriť hlasového agenta. Uvádzame integráciu s Agents SDK(otvorí sa v novom okne), ktorá zjednodušuje tento proces vývoja. Pre vývojárov, ktorí chcú vytvárať zážitky s nízkou latenciou pri preklade z reči do reči, odporúčame použiť naše modely prekladu z reči do reči v Realtime API.

Čo bude ďalej

S výhľadom do budúcnosti plánujeme naďalej investovať do zlepšovania inteligencie a presnosti našich audio modelov a skúmať spôsoby, ako umožniť vývojárom priniesť si vlastné hlasy na vytváranie ešte personalizovanejších zážitkov, ktoré sú v súlade s našimi bezpečnostnými štandardmi. Okrem toho pokračujeme v rozhovoroch s tvorcami politík, výskumníkmi, vývojármi a kreatívcami o výzvach a príležitostiach, ktoré môžu syntetické hlasy prinášať. Tešíme sa na inovatívne a kreatívne aplikácie, ktoré vývojári vytvoria s týmito vylepšenými zvukovými možnosťami. Taktiež budeme investovať do ďalších modalít vrátane videa, aby sme vývojárom umožnili vytvárať multimodálne agentné zážitky.

Záznam z priameho prenosu

Autori

OpenAI

Výskumné vedenie

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Prispievatelia

Vyhľadávanie

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Technika

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkt

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponzori lídrov

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry