Преминаване към основното съдържание
OpenAI

20 март 2025 г.

ПусканеПродукт

Представяне на аудио модели от следващо поколение в API

Нов набор от аудио модели за захранване на гласови агенти, вече достъпен за разработчици по целия свят.

Основно изображение за блога на OpenAI за аудио модели от следващо поколение
Зареждане…

Актуализация на 28 август 2025 г.: Обявихме общата наличност на Realtime API. Научете повече тук.


През последните няколко месеца сме инвестирали в усъвършенстване на интелигентността, възможностите и полезността на текстовите агенти – системи, които самостоятелно изпълняват задачи от името на потребителите – с пускането на оператор, дълбоко проучване, използващи компютър агенти и API за отговори с вградени инструменти. Въпреки това, за да бъдат агентите наистина полезни, хората трябва да могат да осъществяват по-задълбочени и интуитивни взаимодействия с тях, отвъд текста, използвайки естествен говорим език за ефективна комуникация.

Днес пускаме нови аудио модели за преобразуване на реч в текст и текст в реч в API, което прави възможно изграждането на по-мощни, персонализирани и интелигентни гласови агенти, които предлагат реална стойност. Най-новите ни модели за преобразуване на реч в текст поставят нов еталон в индустрията, като превъзхождат съществуващите решения по точност и надеждност – особено в предизвикателни ситуации, включващи акценти, шумна среда и различни скорости на речта. Тези подобрения увеличават надеждността на транскрипцията, което прави моделите особено подходящи за случаи на употреба като центрове за обслужване на клиенти, транскрибиране на бележки от срещи и други.

За първи път разработчиците могат също да инструктират модела за преобразуване на текст в реч да говори по конкретен начин – например „говорете като съпричастен агент за обслужване на клиенти“ – отключвайки ново ниво на персонализиране за гласови агенти. Това позволява широк набор от персонализирани приложения, вариращи от по-съпричастни и динамични гласове за обслужване на клиенти до изразително повествование за творчески преживявания при разказване на истории.

Пуснахме първия си аудио модел през 2022 г. и оттогава сме ангажирани с подобряването на интелигентността, точността и надеждността на тези модели. С тези нови аудио модели разработчиците могат да създават по-точни и надеждни системи за преобразуване на реч в текст и изразителни, характерни гласове за преобразуване на текст в реч – всичко това в рамките на API.

Спокоен
Сърфист
Професионално
Средновековен рицар
Любител на реални криминални истории
Приказка за лека нощ

Повече за най-новите ни аудио модели

Нови модели за преобразуване на реч в текст

Представяме новите модели gpt-4o-transcribe и gpt-4o-mini-transcribe с подобрения в процента на грешки при разпознаване на думи и по-добро езиково разпознаване и точност в сравнение с оригиналните модели Whisper.

gpt-4o-transcribe демонстрира подобрена производителност по отношение на Word Error Rate (WER) спрямо съществуващите модели Whisper в множество утвърдени еталони, което отразява значителен напредък в нашата технология за преобразуване на реч в текст. Тези подобрения произтичат пряко от целенасочени иновации в обучението с утвърждение и обширно междинно обучение с разнообразни и висококачествени набори от аудио данни.

В резултат на това тези нови модели за преобразуване на реч в текст могат по-добре да улавят нюансите на речта, да намаляват погрешните разпознавания и да повишават надеждността на транскрипцията, особено в предизвикателни ситуации, включващи акценти, шумна среда и различни скорости на речта. Тези модели вече са налични в API за преобразуване на реч в текст(отваря се в нов прозорец).

Процентът на грешки в думите (WER) измерва точността на моделите за разпознаване на реч, като изчислява процента на неправилно транскрибираните думи в сравнение с референтна транскрипция. По-ниският WER е по-добър и означава по-малко грешки. Най-новите ни модели за преобразуване на реч в текст постигат по-нисък WER по различни еталони, включително FLEURS (Оценка на универсални представяния на речта за обучение с малко повторения) – многоезичен еталон, обхващащ над 100 езика с ръчно транскрибирани аудио проби. Тези резултати демонстрират по-висока точност на транскрипцията и по-широк езиков обхват. Както е показано тук, нашите модели последователно превъзхождат Whisper v2 и Whisper v3 във всички езикови оценки.

Във FLEURS нашите модели постигат по-нисък процент на грешки в думите (WER) и силна многоезична производителност. По-ниската стойност на WER е по-добра и означава по-малко грешки. Както е показано тук, нашите модели съответстват на други водещи модели или ги превъзхождат в повечето основни езици.

Нов модел за преобразуване на текст в реч

Освен това пускаме нов модел gpt-4o-mini-tts с по-добра управляемост. За първи път разработчиците могат да „инструктират“ модела не само какво да каже, но и как да го каже, което позволява по-персонализирани преживявания за случаи на употреба, вариращи от обслужване на клиенти до творческо разказване на истории. Моделът е наличен в API за преобразуване на текст в реч(отваря се в нов прозорец). Имайте предвид, че тези модели за преобразуване на текст в реч са ограничени до изкуствени, предварително зададени гласове, които наблюдаваме, за да гарантираме, че те последователно съответстват на синтетичните предварително зададени настройки.

Технически иновации зад моделите

Предварително обучение с автентични аудио набори от данни

Нашите нови аудио модели надграждат архитектурите GPT‑4o и GPT‑4o‑mini и са обстойно предварително обучени върху специализирани аудио-центрирани набори от данни, които са били критични за оптимизирането на производителността на модела. Този целенасочен подход предоставя по-задълбочено разбиране на нюансите в речта и позволява изключителна производителност при задачи, свързани с аудио.

Напреднали методологии за синтез

Подобрихме нашите техники за синтез, което позволява прехвърляне на знания от най-големите ни аудио модели към по-малки и по-ефективни модели. Използвайки усъвършенствани методологии за самоигра, нашите набори от данни за синтез ефективно улавят реалистичната динамика на разговорите, възпроизвеждайки автентични взаимодействия между потребител и асистент. Това помага на нашите по-малки модели да осигурят отлично качество на разговорите и бърза реакция.

Парадигма на обучение с утвърждение

За нашите модели за преобразуване на реч в текст интегрирахме парадигма, силно ориентирана към обучение с утвърждение (RL), като изведохме точността на транскрипцията до най-съвременни нива. Тази методология значително подобрява прецизността и намалява халюцинациите, което прави нашите решения за преобразуване на реч в текст изключително конкурентоспособни в сложни ситуации за разпознаване на реч.

Тези разработки представляват напредък в областта на аудио моделирането, съчетавайки иновативни методологии с практически подобрения за подобрена производителност в приложенията за реч.

Наличност на API

Тези нови аудио модели вече са достъпни за всички разработчици – повече информация за създаването с аудио има тук(отваря се в нов прозорец). За разработчици, които вече изграждат разговорни изживявания с текстови модели, добавянето на нашите модели за преобразуване на реч в текст и текст в реч е най-лесният начин да изградите гласов агент. Пускаме интеграция с Agents SDK(отваря се в нов прозорец), която опростява процеса на разработка. За разработчици, които искат да създават преживявания с ниско забавяне от реч към реч, препоръчваме да използвате нашите модели за реч към реч в Realtime API.

Какво следва

С поглед към бъдещето, планираме да продължим да инвестираме в подобряването на интелигентността и точността на нашите аудио модели и да проучваме начини, които позволяват на разработчиците да внедряват свои собствени персонализирани гласове, за да създават още по-персонализирани изживявания, съобразени с нашите стандарти за безопасност. Освен това продължаваме да водим разговори с политици, изследователи, разработчици и творци относно предизвикателствата и възможностите, които синтетичните гласове могат да предложат. С нетърпение очакваме да видим иновативните и креативни приложения, които разработчиците ще създадат, използвайки тези подобрени аудио възможности. Ще инвестираме и в други модалности – включително видео – за да дадем възможност на разработчиците да създават мултимодални агентни изживявания.

Повторение на излъчване в реално време

Автори

OpenAI

Изследователски насоки

Кристина Ким, Джунхуа Мао, И Шън, Ю Джан

Сътрудници

Проучване

Алекс Пайно, Боуен Ченг, Ченгсю Джуанг, Крис Кох, Деймиън Мроуца, Ерик Ритър, Джейкъб Меник, Джеймс Беткър, Джи Лин, Джейми Кирос, Джиахуи Ю, Лианг Джоу, Лию Чен, Кевин Лу, Маделин Бойд, Майкъл Лампе, Майк Хийтън, Нансин Чен, Нитиш Кескар, Саачи Джейн, Сам Тойцер, Сомай Джейн, Тао Сю, Томър Каплан, Уей Хан, Сяннин Чен, Йе Джиа

Инженерство

Алина Ву, Андрес Гарсия Гарсия, Арши Бхатнагар, Авитал Оливър, Брендън Куин, Кристина Хуанг, Дейвид Фанг, Драгос Оприца, Доминик Кундел, Едеде Ойвох, Ярослав Твердохлиб, Джиаченг Фенг, Джей Чен, Джения Варавва, Джордан Ситкин, Джоузеф Флоренсио, Лиен Мамитсука, Мада Афлак, Маноли Лиодакис, Марк Хъднал, Ноа Маккалъм, Ола Окелола, Питър Бакум, Рохан Мехта, Ромен Юе, Уанинг Джианг, Уейн Чанг, Йилей Чиан

Продукт

Анубха Сривастава, Джаки Шанън, Джеф Харис, Реа Мияра, Сяолин Хао

Спонсори на ръководството

Ейдън Кларк, Андрю Гибиански, Дейвид Сасаки, Кевин Уейл, Лиъм Федус, Марк Чен, Ник Райдър, Ник Търли, Оливие Годеман, Прафула Дхаривал, Шенгджия Джао, Шучао Би, Шъруин У, Сулман Чоудри