Przejdź do treści głównej
OpenAI

20 marca 2025

WersjaProdukt

Przedstawiamy modele audio nowej generacji w interfejsie API

Nowy zestaw modeli audio do agentów głosowych – już dostępny dla programistów na całym świecie.

Modele audio OpenAI nowej generacji – obraz główny wpisu na blogu
Ładowanie…

Aktualizacja z 28 sierpnia 2025 r.: Ogłosiliśmy powszechną dostępność interfejsu Realtime API. Dowiedz się więcej tutaj.


Od kilku miesięcy inwestujemy w rozwój inteligencji, możliwości i użyteczności agentów tekstowych, czyli systemów, które samodzielnie wykonują zadania w imieniu użytkowników. Udostępniliśmy już takie produkty jak operator, głębokie badania, agenci korzystający z komputera i interfejs Responses API z wbudowanymi narzędziami. Aby jednak aby agenci byli naprawdę użyteczni, ludzie muszą mieć możliwość prowadzenia z nimi pogłębionych, bardziej intuicyjnych interakcji wykraczających poza sam tekst – używając naturalnego języka mówionego na potrzeby skutecznej komunikacji.

Dzisiaj wprowadzamy do API nowe modele audio służące do zamiany mowy na tekst i tekstu na mowę, umożliwiając tworzenie bardziej zaawansowanych, konfigurowalnych i inteligentnych agentów głosowych zapewniających realne korzyści. Nasze najnowsze modele zamiany mowy na tekst ustanawiają nowy, najwyższy branżowy standard, przewyższając istniejące rozwiązania pod względem dokładności i niezawodności – szczególnie w trudnych warunkach obejmujących akcenty, hałaśliwe otoczenie i zmienne tempo mowy. Te ulepszenia zwiększają niezawodność transkrypcji, co sprawia, że nowe modele szczególnie dobrze nadają się do takich zastosowań jak centra obsługi klienta, transkrypcja notatek ze spotkań itd.

Ponadto po raz pierwszy programiści mogą instruować model zamiany tekstu na mowę, aby mówił w określony sposób – na przykład wydając mu polecenie „mów jak empatyczny agent obsługi klienta” – co otwiera nowy poziom personalizacji agentów głosowych. Przekłada się on na szeroki zakres zindywidualizowanych zastosowań, od bardziej empatycznych i dynamicznych głosów w obsłudze klienta po ekspresyjną narrację w obszarze kreatywnego opowiadania historii.

Pierwszy model audio wprowadziliśmy w 2022 roku i od tego czasu nieustannie dążymy do ulepszania inteligencji, dokładności i niezawodności swoich modeli. Dzięki nowym modelom audio programiści mogą tworzyć dokładniejsze i bardziej niezawodne systemy zamiany mowy na tekst oraz ekspresyjne, pełne charakteru głosy wykorzystujące zamianę tekstu na mowę – a wszystko to w ramach interfejsu API.

Spokojny
Surfer
Profesjonalne
Średniowieczny rycerz
Miłośnik programów true crime
Bajka na dobranoc

Więcej informacji o naszych najnowszych modelach audio

Nowe modele zamiany mowy na tekst

Wprowadzamy nowe modele gpt-4o-transcribe i gpt-4o-mini-transcribe, które cechują się poprawą współczynnika błędów słów oraz lepszym rozpoznawaniem języka i lepszą dokładnością w porównaniu z oryginalnymi modelami Whisper.

gpt-4o-transcribe wykazuje poprawę wartości współczynnika błędów słów (Word Error Rate, WER) w porównaniu z dotychczasowymi modelami Whisper w wielu uznanych testach porównawczych, co świadczy o znaczących postępach w rozwoju naszej technologii zamiany mowy na tekst. Postępy te wynikają bezpośrednio z ukierunkowanych innowacji w obszarze uczenia przez wzmacnianie oraz szeroko zakrojonego treningu pośredniego z wykorzystaniem zróżnicowanych, wysokiej jakości zbiorów danych audio.

W rezultacie nowe modele zamiany mowy na tekst lepiej wychwytują niuanse mowy, zmniejszają liczbę przypadków błędnego rozpoznania oraz zwiększają niezawodność transkrypcji, zwłaszcza w trudnych scenariuszach obejmujących akcenty, hałaśliwe otoczenie i zmienne tempo mówienia. Modele te są już dostępne w interfejsie API zamiany mowy na tekst(otwiera nowe okno).

Współczynnik błędów słów (Word Error Rate, WER) mierzy dokładność modeli rozpoznawania mowy, obliczając odsetek nieprawidłowo przetranskrybowanych słów w porównaniu z transkrypcją wzorcową – im niższy WER, tym lepiej, ponieważ oznacza to mniej błędów. Nasze najnowsze modele zamiany mowy na tekst osiągają niższe wartości WER w różnych testach porównawczych, w tym we FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) – wielojęzycznym teście porównawczym mowy obejmującym ponad 100 języków i wykorzystującym ręcznie transkrybowane próbki audio. Wyniki te wskazują na większą dokładność transkrypcji i szerszy zakres językowy. Jak pokazano w tym miejscu, nasze modele konsekwentnie przewyższają modele Whisper v2 i Whisper v3 we wszystkich testach językowych.

W teście FLEURS nasze modele osiągają niższy wskaźnik WER i wysoką wydajność wielojęzyczną. Im niższa wartość WER, tym lepiej, ponieważ oznacza mniej błędów. Jak pokazano w tym miejscu, nasze modele dorównują innym czołowym modelom lub je przewyższają w większości głównych języków.

Nowy model zamiany tekstu na mowę

Wprowadzamy również nowy model gpt-4o-mini-tts z lepszą sterowalnością. Po raz pierwszy programiści mogą „instruować” model w kwestii nie tylko tego, co ma powiedzieć, ale też jak ma to zrobić, co otwiera drogę do większej indywidualizacji w szerokim zakresie zastosowań, od obsługi klienta po kreatywne opowiadanie historii. Model jest dostępny w interfejsie API zamiany tekstu na mowę(otwiera nowe okno). Należy pamiętać, że te modele zamiany tekstu na mowę są ograniczone do sztucznych, gotowych głosów, które monitorujemy w celu zapewnienia ich stałej zgodności z ustawieniami syntezy.

Innowacje techniczne stojące za modelami

Trening wstępny przy użyciu zbiorów danych z autentycznym dźwiękiem

Nasze nowe modele audio opierają się na architekturach GPT‑4o i GPT‑4o‑mini oraz zostały poddane szeroko zakrojonemu treningowi wstępnemu na specjalistycznych zbiorach danych skoncentrowanych na dźwięku, które były kluczowym elementem optymalizacji działania modeli. To ukierunkowane podejście zapewnia bardziej szczegółowy wgląd w niuanse mowy i pozwala osiągnąć wyjątkową skuteczność w zadaniach związanych z dźwiękiem.

Zaawansowane metody destylacji

Udoskonaliliśmy techniki destylacji, umożliwiając transfer wiedzy z naszych największych modeli audio do modeli mniejszych i bardziej wydajnych. Wykorzystując zaawansowane metodologie autointerakcji, nasze zbiory danych do destylacji skutecznie wychwytują realistyczną dynamikę rozmów, odtwarzając autentyczne interakcje między użytkownikiem a asystentem. Dzięki temu nasze mniejsze modele mogą zapewniać doskonałą jakość rozmów i szybkość reakcji.

Paradygmat uczenia przez wzmacnianie

Z myślą o naszych modelach zamiany mowy na tekst zastosowaliśmy paradygmat kładący duży nacisk na uczenie przez wzmacnianie (RL), co pozwoliło osiągnąć dokładność transkrypcji na poziomie najnowocześniejszych rozwiązań. Ta metodologia diametralnie poprawia precyzję i ogranicza halucynacje, dzięki czemu nasze rozwiązania do zamiany mowy na tekst są wyjątkowo konkurencyjne w złożonych scenariuszach rozpoznawania mowy.

Te osiągnięcia oznaczają postęp w obszarze modelowania dźwięku, łącząc innowacyjne metody z praktycznymi ulepszaniami w celu poprawy wydajności w zastosowaniach związanych z mową.

Dostępność interfejsu API

Nowe modele audio są już dostępne dla wszystkich programistów – więcej informacji na temat tworzenia aplikacji z dźwiękiem można znaleźć tutaj(otwiera nowe okno). W przypadku programistów, którzy już tworzą środowiska konwersacyjne z modelami opartymi na tekście, dodanie naszych modeli zamiany mowy na tekst i tekstu na mowę jest najprostszym sposobem na stworzenie agenta głosowego. Wprowadzamy integrację z zestawem Agents SDK(otwiera nowe okno), która upraszcza ten proces programowania. Jeśli chodzi o programistów chcących tworzyć aplikacje zamieniające mowę na mowę z niskim opóźnieniem, zalecamy korzystanie z naszych modeli zamiany mowy na mowę w interfejsie Realtime API.

Dalsze działania

W przyszłości zamierzamy nadal inwestować w rozwijanie inteligencji i precyzji naszych modeli audio oraz poszukiwać sposobów, które umożliwią programistom stosowanie własnych, niestandardowych głosów w celu tworzenia jeszcze bardziej spersonalizowanych środowisk w zgodzie z naszymi standardami bezpieczeństwa. Ponadto kontynuujemy dialog z decydentami, badaczami, programistami oraz twórcami na temat możliwych wyzwań i szans związanych z głosami syntetycznymi. Z niecierpliwością czekamy na innowacyjne i kreatywne aplikacje, które stworzą programiści przy użyciu naszych ulepszonych możliwości audio. Będziemy również inwestować w inne modalności – w tym wideo – aby umożliwić programistom tworzenie multimodalnych funkcji agentowych.

Nagranie transmisji na żywo

Autorzy

OpenAI

Kierownicy badań

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Współpracownicy

Badania

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Inżynieria

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Produkt

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Wsparcie ze strony kierownictwa

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry