Ugrás a fő tartalomra
OpenAI

2025. március 20.

KiadásTermék

A következő generációs audio modellek bemutatása az API-ban.

Új hangmodell sorozat, amely hangalapú ügynököket működtet, mostantól világszerte elérhető a fejlesztők számára.

OpenAI következő generációs audio modellek blog főképe
Betöltés…

Frissítés 2025. augusztus 28-án: Bejelentettük a Realtime API általános elérhetőségét. Tudj meg többet itt.


Az elmúlt hónapok során tovább fejlesztettük a szövegalapú ágensek intelligenciáját, képességeit és gyakorlati hasznosságát—olyan rendszerekét, amelyek önállóan képesek feladatokat ellátni a felhasználók nevében—; ennek részeként kiadtuk az operátort, a mély kutatást, a számítógép-használó ügynököt és a beépített eszközökkel rendelkező Responses API-t, hogy még hatékonyabb fejlesztést és használatot tegyünk lehetővé. Azonban ahhoz, hogy az ügynökök valóban hasznosak legyenek, az embereknek képesnek kell lenniük mélyebb, intuitívabb interakciókra az ügynökökkel, nem csupán szövegen keresztül, hanem a természetes beszélt nyelvet használva a hatékony kommunikáció érdekében.

Ma új speech-to-text és szöveg-beszéd modelleket indítunk el az API-ban—ezek lehetővé teszik, hogy még erősebb, még inkább testre szabható és még intelligensebb hangalapú ügynökök létrehozását, amelyek valódi értéket nyújtanak. Legújabb beszéd-szöveg átalakító modelljeink új, csúcstechnológiás mércét állítanak fel, pontosságban és megbízhatóságban felülmúlva a meglévő megoldásokat—különösen a kihívást jelentő helyzetekben, mint például akcentus, zajos környezetek és változó beszédsebesség esetén. Ezek a fejlesztések növelik az átírat megbízhatóságát, így a modellek különösen jól alkalmazhatók olyan felhasználási esetekben, mint az ügyfélszolgálati call centerek, a megbeszélések jegyzeteinek átírása és még sok más.

A fejlesztők most először azt is megadhatják a szöveg-beszéd modellnek, hogy egy adott módon szólaljon meg—például: „úgy beszélj, mint egy együttérző ügyfélszolgálati munkatárs”—, ezzel a hangalapú ügynökök testreszabhatóságát új szintre emelve. Ez lehetővé teszi a testre szabott alkalmazások széles skáláját, az empatikusabb és dinamikusabb ügyfélszolgálati hangoktól a kreatív történetmesélési élmények kifejező narrációjáig.

Első hangmodellünket 2022-ben indítottuk el, és azóta elkötelezettek vagyunk e modellek intelligenciájának, pontosságának és megbízhatóságának javítása mellett. Ezekkel az új hangmodellekkel a fejlesztők pontosabb és robusztusabb beszéd-szöveg átalakító rendszereket, valamint kifejező, karakteres szöveg-beszéd hangokat építhetnek—mindezt az API-n belül.

Nyugodt
Szörfös
Professzionális
Középkori lovag
True crime rajongó
Esti mese

További információ a legújabb audiomodelljeinkről

Új beszédfelismerő modellek

Bevezetjük az új gpt-4o-transcribe és gpt-4o-mini-transcribe modelleket, amelyek javított szóhibaaránnyal, valamint jobb nyelvfelismeréssel és pontossággal rendelkeznek az eredeti Whisper modellekhez képest.

A gpt-4o-transcribe a meglévő Whisper modellekhez képest több, széles körben elfogadott benchmarkon jobb Word Error Rate (WER) teljesítményt mutat, ami jelentős előrelépést tükröz a beszédet szöveggé alakító technológiánk terén. Ezek a fejlesztések közvetlenül a megerősítéses tanulás célzott innovációjában és a sokszínű, kiváló minőségű hangadatkészletekkel végzett kiterjedt mid-training tanításban gyökereznek.

Ennek eredményeként ezek az új beszéd-szöveg átalakító modellek jobban meg tudják ragadni a beszéd árnyalatait, csökkenteni a félreértéseket, és növelni az átírat megbízhatóságát, különösen az olyan kihívást jelentő helyzetekben, mint az akcentusok, zajos környezetek és eltérő beszédtempók. Ezek a modellek mostantól elérhetők a speech-to-text API-ban(új ablakban nyílik meg).

A Word Error Rate (WER) a beszédfelismerő modellek pontosságát méri azáltal, hogy kiszámítja a hibásan átírt szavak arányát egy referencianyelvi átíráshoz képest—minél alacsonyabb a WER, annál jobb, vagyis annál kevesebb a hiba. Legújabb beszéd-szöveg átalakító modelljeink alacsonyabb WER-t érnek el a benchmarkokban, beleértve a FLEURS-t (kevés lövéses Learning Evaluation of Universal Representations of Speech)—egy többnyelvű beszéd benchmarkot, amely több mint 100 nyelvet fed le, kézzel átírt hangmintákat felhasználva. Ezek az eredmények nagyobb átírási pontosságot és erősebb nyelvi lefedettséget mutatnak. Ahogyan itt látható, modelljeink minden nyelvi értékelés során következetesen felülmúlják a Whisper v2-t és a Whisper v3-at.

A FLEURS adatkészleten modelljeink alacsonyabb szóhibaarányt (WER) és erős többnyelvű teljesítményt nyújtanak. Az alacsonyabb WER jobb, és kevesebb hibát eredményez. Amint itt látható, modelljeink a legtöbb nagy nyelven felveszik a versenyt más vezető modellekkel, vagy felül is múlják azokat.

Új szövegfelolvasó modell

Emellett elindítunk egy új gpt-4o-mini-tts modellt is, amely jobb irányíthatóságot kínál. A fejlesztők most először „utasíthatják” a modellt nemcsak arra, hogy mit mondjon, hanem arra is, hogyan mondja—ezáltal testreszabottabb élményeket tesz lehetővé az ügyfélszolgálattól a kreatív történetmesélésig terjedő felhasználásig. A modell elérhető a text-to-speech API(új ablakban nyílik meg)-ban. Fontos megjegyezni, hogy ezek a szövegfelolvasó modellek kizárólag mesterséges, előre beállított hangokra korlátozódnak, amelyeket folyamatosan ellenőrzünk, hogy mindig megfeleljenek a szintetikus előbeállításoknak.

A modellek mögött rejlő technikai újítások

Előzetes tanulás autentikus hangadatkészletekkel

Új hangmodelljeink a GPT‑4o és a GPT‑4o‑mini architektúrákra épülnek, és alapos előzetes képzésen estek át speciális, hangközpontú adathalmazokon, amelyek kulcsfontosságúak voltak a modell teljesítményének optimalizálásához. Ez a célzott megközelítés mélyebb betekintést nyújt a beszéd árnyalataiba, és kivételes teljesítményt tesz lehetővé a hanggal kapcsolatos feladatok terén.

Fejlett disztillációs módszerek

Továbbfejlesztettük disztillációs technikáinkat, lehetővé téve a tudás átadását a legnagyobb hangmodelljeinkből a kisebb, hatékonyabb modellekbe. A fejlett önjáték-módszertanokra támaszkodva a disztillációs adathalmazaink hatékonyan rögzítik a valósághű beszélgetési dinamikát, és hitelesen reprodukálják a felhasználó-asszisztens interakciókat. Ez segíti kisebb modelljeinket abban, hogy kiváló beszélgetési minőséget és gyors reagálást biztosítsanak.

Megerősítéses tanulási paradigma

A beszéd-szöveg átalakító modelljeinkhez egy megerősítéses tanulás (RL)-központú paradigmát integráltunk, amely az átirat pontosságát a legkorszerűbb szintre emeli. Ez a módszertan drasztikusan javítja a pontosságot és csökkenti a félreértést, így a beszéd-szöveg átalakító megoldásaink kivételesen versenyképesek az összetett beszédfelismerési helyzetekben.

Ezek a fejlesztések előrelépést jelentenek a hangmodellezés területén, ötvözve az innovatív módszertanokat a gyakorlati fejlesztésekkel a beszédalkalmazások jobb teljesítménye érdekében.

API elérhetősége

Ezek az új audio modellek mostantól minden fejlesztő számára elérhetők – további információ az audio alapú fejlesztésről itt(új ablakban nyílik meg) található. Azoknak a fejlesztőknek, akik már szöveges alapú modellekkel építik a beszélgetési élményt, a beszéd-szöveg és szöveg-beszéd átalakító modelljeink hozzáadása a legegyszerűbb módja egy hangalapú ügynök létrehozásának. Az Agents SDK(új ablakban nyílik meg)-val való integrációt elérhetővé tesszük, amely jelentősen leegyszerűsíti ezt a fejlesztési folyamatot. Az alacsony késleltetésű beszéd-beszéd élmények létrehozására törekvő fejlesztőknek azt javasoljuk, hogy a Realtime API-ban használják a beszéd-beszéd modelljeinket.

Mi következik?

Előretekintve azt tervezzük, hogy továbbra is befektetünk hangmodelljeink intelligenciájának és pontosságának javításába, valamint olyan lehetőségek feltárásába, amelyek révén a fejlesztők saját egyéni hangokat hozhatnak létre, hogy még személyre szabottabb élményeket teremtsenek, amelyek összhangban állnak a biztonsági szabványainkkal. Emellett továbbra is egyeztetünk a döntéshozókkal, kutatókkal, fejlesztőkkel és kreatívokkal a szintetikus hangok által felvetett kihívásokról és lehetőségekről. Izgatottan várjuk, hogy milyen innovatív és kreatív alkalmazásokat hoznak létre a fejlesztők a továbbfejlesztett hangfunkciók segítségével. Más modalitásokba is befektetünk—beleértve a videót is—, hogy a fejlesztők multimodális, ügynökszerű élményeket hozhassanak létre.

Élő közvetítés visszajátszása

Szerzők

OpenAI

Kutatási vezetők

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Közreműködők

Kutatások

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Mérnöki tevékenység

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Termék

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Vezetői szponzorok

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry