Переход к основному контенту
OpenAI

20 марта 2025 г.

РелизТовар

Представляем аудиомодели нового поколения в API

Новый набор аудиомоделей для голосовых агентов теперь доступен разработчикам по всему миру.

Изображение-заголовок блога OpenAI об аудиомоделях нового поколения
Загрузка…

Обновление от 28 августа 2025 г.: Объявление о доступности Realtime API для всех пользователей. Подробнее читайте здесь.


За последние несколько месяцев мы инвестировали в повышение интеллекта, возможностей и полезности текстовых агентов — или систем, которые независимо выполняют задачи от имени пользователей — с релизами Operator, Deep Research, Computer-Using Agents и Responses API с встроенными инструментами. Однако для того, чтобы агенты были по-настоящему полезны, люди должны иметь более глубокие и интуитивные взаимодействия с агентами, выходящими за рамки текста — используя естественный устный язык для эффективного общения.

Сегодня мы запускаем новые аудиомодели преобразования речи в текст и текста в речь в API, что позволяет создавать более мощных, настраиваемых и интеллектуальных голосовых агентов, которые приносят реальную пользу. Наши новейшие модели преобразования речи в текст устанавливают новый передовой стандарт, превосходя существующие решения по точности и надежности, особенно в сложных сценариях с акцентами, шумной обстановкой и различной скоростью речи. Эти улучшения повышают надежность транскрипции, делая модели особенно хорошо подходящими для таких сценариев использования, как колл-центры, расшифровка заметок встреч и многое другое.

Впервые разработчики могут инструктировать модель преобразования текста в речь говорить определённым образом — например, «говори как понимающий агент службы поддержки клиентов», — открывая новый уровень настройки для голосовых агентов. Это открывает широкий спектр адаптированных приложений, от более эмпатичных и динамичных голосов службы поддержки клиентов до выразительного повествования для творческих повествовательных опытов.

Мы запустили нашу первую аудиомодель в 2022, и с тех пор мы стремимся улучшать интеллектуальные возможности, точность и надежность этих моделей. С новыми моделями разработчики могут создавать более точные и надёжные системы преобразования речи в текст и выразительные, характерные голоса для преобразования текста в речь — всё это в рамках API.

Спокойствие
Сёрфер
Профессиональный
Средневековый рыцарь
Любитель true crime
Сказка на ночь

Подробнее о наших последних аудиомоделях

Новые модели преобразования речи в текст

Мы представляем новые модели gpt-4o-transcribe и gpt-4o-mini-transcribe с улучшенным показателем ошибок по словам, а также с более качественным распознаванием языка и более высокой точностью по сравнению с исходными моделями Whisper.

gpt-4o-transcribe демонстрирует улучшенные показатели ошибок по словам (WER) по сравнению с существующими моделями Whisper на нескольких общепринятых бенчмарках, что отражает значительный прогресс в нашей технологии преобразования речи в текст. Эти достижения напрямую связаны с целевыми инновациями в обучении с подкреплением и обширным промежуточным обучением на разнообразных, высококачественных аудионаборах данных.

В результате эти новые модели преобразования речи в текст могут лучше улавливать нюансы речи, снижать количество ошибок распознавания и повышать надежность транскрипции, особенно в сложных сценариях с акцентами, шумной обстановкой и различной скоростью речи. Эти модели уже доступны в API преобразования речи в текст(открывается в новом окне).

Коэффициент ошибок по словам (WER) измеряет точность моделей распознавания речи, вычисляя процент неверно расшифрованных слов по сравнению с эталонной транскрипцией — чем ниже WER, тем лучше, и это означает меньше ошибок. Наши новейшие модели преобразования речи в текст достигают более низкого WER на контрольных наборах, включая FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) — многоязычный речевой бенчмарк, охватывающий более 100 языков и использующий вручную транскрибированные аудиосэмплы. Эти результаты демонстрируют более высокую точность транскрипции и более обширный охват языков. Как показано здесь, наши модели стабильно превосходят Whisper v2 и Whisper v3 во всех языковых оценках.

На FLEURS наши модели обеспечивают более низкий процент ошибок в словах (WER) и высокую многоязычную производительность. Чем ниже WER, тем лучше, и это означает меньше ошибок. Как показано здесь, наши модели не уступают или даже превосходят другие ведущие модели по большинству основных языков.

Новая модель преобразования текста в речь

Мы также запускаем новую модель gpt-4o-mini-tts с улучшенной управляемостью. Впервые разработчики могут «инструктировать» модель не только о том, что говорить, но и как это говорить, обеспечивая более настраиваемые возможности для сценариев использования — от службы поддержки клиентов до творческого сторителлинга. Модель доступна в API преобразования текста в речь(открывается в новом окне). Обратите внимание, что эти модели преобразования текста в речь ограничены искусственными, предустановленными голосами, которые мы контролируем, чтобы гарантировать их постоянное соответствие синтетическим предустановкам.

Технические инновации, лежащие в основе моделей

Предварительное обучение с использованием аутентичных аудионаборов данных

Наши новые аудиомодели основаны на архитектурах GPT‑4o и GPT‑4o‑mini и прошли масштабное предварительное обучение на специализированных аудионаборах данных, которые сыграли ключевую роль в оптимизации производительности модели. Такой целенаправленный подход даёт более глубокое понимание нюансов речи и обеспечивает исключительную производительность в аудиозадачах.

Современные методики получения знаний из других моделей

Мы усовершенствовали наши методы получения знаний из других моделей, что позволяет переносить знания из наших самых крупных аудиомоделей в более компактные и эффективные модели. Используя передовые методологии самопроверки, наши наборы сжатых данных эффективно фиксируют реалистичную динамику диалогов, воспроизводя подлинные взаимодействия «пользователь-ассистент». Это помогает нашим меньшим моделям обеспечивать превосходное качество общения и отзывчивость.

Парадигма обучения с подкреплением

Для наших моделей преобразования речи в текст мы внедрили парадигму, в значительной степени основанную на обучении с подкреплением (RL), что позволило довести точность транскрипции до передового уровня. Эта методология значительно повышает точность и уменьшает количество ошибок, делая наши решения по преобразованию речи в текст исключительно конкурентоспособными в сложных сценариях распознавания речи.

Эти разработки представляют собой прогресс в области аудиомоделирования, сочетая инновационные методологии с практическими улучшениями для повышения производительности в речевых приложениях.

Доступность API

Эти новые аудио модели уже доступны всем разработчикам — подробнее о разработке с использованием аудио читайте здесь(открывается в новом окне). Для разработчиков, которые уже создают диалоговые сценарии с текстовыми моделями, добавление наших моделей преобразования речи в текст и текста в речь — это самый простой способ создать голосового агента. Мы выпускаем интеграцию с Agents SDK(открывается в новом окне), которая упрощает процесс разработки. Разработчикам, желающим создавать опыт преобразования речи с низкой задержкой, мы рекомендуем использовать наши модели преобразования речи в Realtime API.

Следующие шаги

В будущем мы намерены продолжать инвестировать в улучшение интеллектуальных возможностей и точности наших аудиомоделей, а также исследовать способы, которые позволят разработчикам использовать собственные голоса для создания еще более персонализированных решений, соответствующих нашим стандартам безопасности. Кроме того, мы продолжаем вести обсуждения с законодателями, исследователями, разработчиками и представителями творческих профессий о вызовах и возможностях, которые могут представлять синтетические голоса. Нам не терпится увидеть, какие инновационные и креативные приложения разработчики создадут с этими расширенными аудиовозможностями. Мы также будем инвестировать в другие модальности, в том числе видео, чтобы разработчики могли создавать мультимодальные агентные решения.

Повтор трансляции в прямом эфире

Авторы

OpenAI

Руководители исследований

Кристина Ким, Цзюньхуа Мао, И Шэнь, Юй Чжан

Участники

Исследования

Алекс Пайно, Боуэн Чэн, Чэнсю Чжуан, Крис Кох, Дэмиан Мровка, Эрик Риттер, Джейкоб Меник, Джеймс Беткер, Цзи Лин, Джейми Кирос, Цзяхуэй Ю, Лян Чжоу, Лию Чен, Кевин Лу, Мадлен Бойд, Майкл Лампе, Майк Хитон, Наньсин Чен, Нитиш Кескар, Саачи Джайн, Сэм Тойзер, Сомай Джайн, Тао Сюй, Томер Каплан, Вэй Хань, Сяннин Чэнь, Е Цзя

Инженерия

Алина Ву, Андрес Гарсия Гарсия, Арши Бхатнагар, Авиталь Оливер, Брендан Куинн, Кристина Хуанг, Дэвид Фанг, Драгос Оприка, Доминик Кундел, Эдеде Ойво, Ярослав Твердохлиб, Цзяченг Фэнг, Джей Чен, Джения Варавва, Джордан Ситкин, Джозеф Флоренсио, Лиен Мамицука, Мада Афлак, Маноли Лиодакис, Марк Хадналл, Ноа МакКаллум, Ола Окелола, Питер Баккум, Рохан Мехта, Ромен Хюэт, Ваннин Цзян, Уэйн Чанг, Илей Цянь

Продукт

Ануба Сривастава, Джеки Шеннон, Джефф Харрис, Реа Мияра, Сяолинь Хао

Спонсоры лидеров

Эйден Кларк, Эндрю Гибиански, Дэвид Сасаки, Кевин Вейл, Лиам Федус, Марк Чен, Ник Райдер, Ник Терли, Оливье Годеман, Прафулла Даривал, Шэнцзя Чжао, Шучао Би, Шервин Ву, Сулман Чоудри