Представляємо аудіомоделі наступного покоління в API
Новий набір аудіомоделей для голосових агентів тепер доступний розробникам по всьому світу.

Оновлення від 28 серпня 2025 року: Оголошення про загальну доступність Realtime API. Детальніше читайте тут.
Протягом останніх кількох місяців ми інвестували у покращення інтелекту, можливостей та корисності текстових агентів — або систем, які незалежно виконують завдання від імені користувачів — з релізами Operator, Deep Research, Computer-Using Agents та Responses API із вбудованими інструментами. Однак для того, аби агенти були по-справжньому корисними, люди повинні мати більш глибокі та інтуїтивні взаємодії з агентами, які виходять за рамки тексту, використовуючи природну мову для ефективного спілкування.
Сьогодні ми запускаємо нові аудіомоделі перетворення мовлення в текст і тексту в мовлення в API, що дозволяє створювати більш потужних, настроюваних та інтелектуальних голосових агентів, які приносять реальну користь. Наші новітні моделі перетворення мовлення в текст встановлюють новий передовий стандарт, перевершуючи існуючі рішення щодо точності та надійності, особливо у складних сценаріях з акцентами, шумною обстановкою та різною швидкістю мовлення. Ці покращення підвищують надійність транскрипції, роблячи моделі особливо добре підходящими для таких сценаріїв використання, як кол-центри, розшифровування нотаток зустрічей та багато іншого.
Вперше розробники можуть інструктувати модель перетворення тексту в мову говорити певним чином — наприклад, «говори як розуміючий агент служби підтримки», — відкриваючи новий рівень налаштування для голосових агентів. Це відкриває широкий спектр адаптованих застосунків, від більш емпатичних та динамічних голосів служби підтримки клієнтів до виразної оповіді для творчості.
Ми запустили нашу першу аудіомодель у 2022, і з того часу ми прагнемо покращувати інтелектуальні можливості, точність та надійність цих моделей. З новими моделями розробники можуть створювати більш точні та надійні системи перетворення мови в текст і виразні, характерні голоси для перетворення тексту на мову — усе це в рамках API.
Ми представляємо нові моделі gpt-4o-transcribe та gpt-4o-mini-transcribe з покращеним показником помилок за словами, а також з більш якісним розпізнаванням мови та вищою точністю в порівнянні з вихідними моделями Whisper.
gpt-4o-transcribe демонструє покращені показники помилок за словами (WER) порівняно з існуючими моделями Whisper на кількох загальноприйнятих бенчмарках, що відображає значний прогрес у нашій технології перетворення мови на текст. Ці досягнення безпосередньо пов'язані з цільовими інноваціями у навчанні з підкріпленням та широким проміжним навчанням на різноманітних, високоякісних аудіонаборах даних.
У результаті ці нові моделі перетворення мовлення в текст можуть краще вловлювати нюанси мови, знижувати кількість помилок розпізнавання та підвищувати надійність транскрипції, особливо у складних сценаріях з акцентами, шумною обстановкою та різною швидкістю мови. Ці моделі наразі доступні в API розпізнавання мовлення(відкривається у новому вікні).
Коефіцієнт помилок за словами (WER) вимірює точність моделей розпізнавання мовлення, обчислюючи відсоток неправильно розшифрованих слів порівняно з еталонною транскрипцією — що нижче WER, тим краще, і це означає менше помилок. Наші новітні моделі перетворення мовлення в текст досягають нижчого WER на контрольних наборах, включаючи FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) — багатомовний мовний бенчмарк, що охоплює понад 100 мов і використовує транскрибовані вручну аудіосемпли. Ці результати демонструють більш високу точність транскрипції та ширше охоплення мов. Як показано тут, наші моделі стабільно перевершують Whisper v2 та Whisper v3 у всіх мовних оцінках.
На FLEURS наші моделі забезпечують нижчий відсоток помилок у словах (WER) та високу багатомовну продуктивність. Що нижчий WER, тим краще, і це означає менше помилок. Як показано тут, наші моделі не поступаються або навіть перевершують інші провідні моделі з більшості основних мов.
Ми також запускаємо нову модель gpt-4o-mini-tts із покращеною керованістю. Вперше розробники можуть «інструктувати» модель не тільки про те, що говорити, а й як це говорити, забезпечуючи більш налаштовані можливості для сценаріїв використання — від служби підтримки клієнтів до творчого сторителлінгу. Модель доступна в API перетворення тексту на мовлення(відкривається у новому вікні). Зверніть увагу, що ці моделі перетворення тексту в мову обмежені штучними, встановленими голосами, які ми контролюємо, щоб гарантувати їхню постійну відповідність синтетичним предустановкам.
Наші нові аудіомоделі засновані на архітектурах GPT‑4o та GPT‑4o‑mini та пройшли масштабне попереднє навчання на спеціалізованих аудіонаборах даних, які відіграли ключову роль в оптимізації продуктивності моделі. Такий цілеспрямований підхід дає глибше розуміння нюансів мови та забезпечує виняткову продуктивність в аудіозадачах.
Ми вдосконалили наші методи здобуття знань з інших моделей, що дозволяє переносити знання з наших найбільших аудіомоделей до більш компактних та ефективних моделей. Використовуючи передові методи самоперевірки, наші набори стислих даних ефективно фіксують реалістичну динаміку діалогів, відтворюючи справжні взаємодії «користувач-помічник». Це допомагає нашим меншим моделям забезпечувати чудову якість спілкування та чуйність.
Для наших моделей перетворення мовлення в текст ми впровадили парадигму, яка значною мірою заснована на навчанні з підкріпленням (RL), що дозволило довести точність транскрипції до передового рівня. Ця методологія значно підвищує точність і зменшує кількість помилок, роблячи наші рішення щодо перетворення мовлення на текст виключно конкурентоспроможними у складних сценаріях розпізнавання мовлення.
Ці розробки є прогресом в галузі аудіомоделювання, поєднуючи інноваційні методології з практичними поліпшеннями для підвищення продуктивності в мовних додатках.
Ці нові аудіомоделі вже доступні всім розробникам — більше про розробку з аудіо читайте тут(відкривається у новому вікні). Для розробників, які вже створюють діалогові сценарії з текстовими моделями, додавання наших моделей перетворення мовлення в текст і тексту в мовлення — це найпростіший спосіб створити голосового агента. Ми випускаємо інтеграцію з Agents SDK(відкривається у новому вікні), що спрощує процес розробки. Розробникам, які бажають створювати досвід перетворення мовлення з низькою затримкою, ми рекомендуємо використовувати наші моделі перетворення мовлення в Realtime API.
У майбутньому ми маємо намір продовжувати інвестувати у покращення інтелектуальних можливостей та точності наших аудіомоделей, а також дослідити способи, які дозволять розробникам використовувати власні голоси для створення ще більш персоналізованих рішень, що відповідають нашим стандартам безпеки. Крім того, ми продовжуємо вести обговорення із законодавцями, дослідниками, розробниками та представниками творчих професій про виклики та можливості, які можуть представляти синтетичні голоси. Нам кортить побачити, які інноваційні та креативні програми розробники створять із цими розширеними аудіоможливостями. Ми також інвестуватимемо в інші модальності, у тому числі відео, щоб розробники могли створювати мультимодальні агентні рішення.
Автори
Керівники досліджень
Крістіна Кім, Цзюньхуа Мао, І Шень, Юй Чжан
Учасники
Дослідження
Алекс Пайно, Боуен Чен, Ченсю Чжуан, Кріс Кох, Деміан Мровка, Ерік Ріттер, Джейкоб Менік, Джеймс Беткер, Джи Лін, Джеймі Кірос, Цзяхуей Ю, Лян Чжоу, Лію Чен, Кевін Лу, Медлін Бойд, Майкл Лемпі, Майк Хітон, Нансінь Чен, Нітіш Кескар, Саачі Джейн, Сем Тойзер, Сомай Джайн, Тао Сюй, Томер Каплан, Вей Хань, Сяннін Чень, Є Цзя
Інженерія
Аліна Ву, Андрес Гарсіа Гарсія, Арші Бхатнагар, Авітал Олівер, Брендан Квінн, Крістіна Хуанг, Девід Фанг, Драгос Опріка, Домінік Кундел, Едеде Ойвох, Ярослав Твердохліб, Цзяченг Фенг, Джей Чен, Дженія Варавва, Джордан Сіткін, Джозеф Флоренсіо, Ліен Маміцука, Мада Афлак, Манолі Ліодакіс, Марк Хадналл, Ноа МакКаллум, Ола Окелола, Пітер Баккум, Рохан Мета, Ромен Х'юет, Ванінг Цзян, Уейн Чанг, Ілей Цянь
Продукт
Анубха Шрівастава, Джекі Шеннон, Джефф Харріс, Реа Міяра, Сяолінь Хао
Спонсори лідерів
Ейден Кларк, Ендрю Гібіанські, Девід Сасакі, Кевін Вейл, Ліам Федус, Марк Чен, Нік Райдер, Нік Терлі, Олів'є Годеман, Прафулла Дхарівал, Шенцзя Чжао, Шучао Бі, Шервін Ву, Сулман Чоудрі