Перейти до основного вмісту
OpenAI

6 березня 2026 р.

Стартап

Як Descript забезпечує масштабне багатомовне дублювання відео

Використовуючи моделі міркування OpenAI, Descript забезпечив автоматичну локалізацію великих бібліотек контенту без втрати часу чи змісту.

Логотип Descript на тлі рожево-фіолетового абстрактного хвильового візерунка.
Розмір компанії: Стартап
Регіон: Північна Америка
Галузь: Технології
Продукти: API

Результати

43

Покращення дотримання тривалості у процентних пунктах завдяки OpenAI

Результати

15%

Зростання кількості експортів із дубляжем після розгортання

Завантаження…

Descript(відкривається у новому вікні) — це ШІ-нативний відеоредактор, створений навколо простої ідеї: якщо ви вмієте редагувати текст, ви маєте вміти редагувати й відео. З моменту запуску Descript ШІ забезпечував роботу кожного аспекту продукту: транскрипцію, редагування, очищення аудіо та дедалі складніші творчі робочі процеси. Вони роками працювали на базі OpenAI, використовуючи Whisper для транскрибування та моделі серії GPT у редакторі Underlord. 

Переклад швидко став ефективним прикладом використання. Переклад відео завжди був повільним і дорогим процесом, що вимагав залучення мовних експертів для керування проєктами, підготовки механічних перекладів, контролю якості та створення відповідного аудіо. LLM суттєво скорочують цей робочий процес, роблячи можливим високоякісний переклад у великих масштабах.

І субтитри, і дубляж потребують семантичної точності: переклад має в першу чергу зберігати початковий зміст. Дотримання тривалості ж відіграє різну роль у кожному з видів перекладу. Для субтитрів ця опція необов’язкова, хоча вона й робить їх краще. Але для дубляжу це критично важливо, адже якщо перекладене мовлення триває надто довго або надто коротко, воно звучатиме неприродно, навіть якщо зміст збережено ідеально.

Щоб вирішити цю проблему, Descript переробили свій конвеєр перекладу, використовуючи моделі міркування OpenAI, щоб оптимізувати семантичну точність і дотримання тривалості під час генерації, а не після. У перші 30 днів після розгортання експорт перекладених відео з дубляжем зріс на 15%, а дотримання тривалості покращилося на 13–43 відсоткові пункти залежно від мови.

«Озвучення стає дедалі популярнішим сценарієм використання Descript, тож ми створюємо способи робити це пакетно для компаній, які хочуть перекладати та синхронізувати артикуляцію для цілих бібліотек», — зазначає генеральна директорка Лора Беркгаузер.

Поява проблем із дубляжем

Переклад був однією з перших і найбільш затребуваних функцій Descript. Компанія почала з перекладу лише субтитрів, чого було достатньо певний час; але багато користувачів хотіли піти далі й отримувати озвучення (дубляж) цільовою мовою.

Постійно виникала одна й та сама проблема: дубльований звук не завжди звучав правильно. «Мабуть, найголовнішою скаргою, яку ми чули, була неприродність темпу мовлення для перекладеної мови», — розповідає Алекс Містратов, керівник відділу ШІ в Descript.

Проблема зводилася до того, що різним мовам потрібна різна кількість часу, щоб висловити ту саму думку. Descript зауважили, наприклад, що в середньому німецька є «довшою» мовою, ніж англійська. Щоб уміститися у фіксовані відеосегменти, перекладене мовлення часто доводилося штучно прискорювати або уповільнювати. «У результаті часто виходили або „бурундуки“, або „сонні велетні“», — пояснює Містратов.

Англійська:

Німецька:

“Please review the safety guidelines before operating the machine.”

Склади: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Склади: 24 (більше на 40%)

У цьому разі звук німецькою довелося б або неприродно прискорити, або переклад потрібно було б переписати, щоб вкластися в часові обмеження.

Користувачам лишалося два варіанти: вручну змінювати таймінг аудіо сегмент за сегментом або переписувати сам переклад, щоб він вкладався в часові рамки. Обидва підходи вимагали глибокого редагування хронології, а також — доволі часто — володіння цільовою мовою практично на рівні носія. Це виснажувало авторів і ставало перешкодою для масштабування функції у великих корпоративних проєктах із локалізації.

Оптимізація перекладів з урахуванням часу, а не лише сенсу

Команда мала чітке уявлення про те, що потрібно для успішного дубляжу. Системі потрібно не лише оптимізувати семантичне значення, але й враховувати часові обмеження. Наприклад, під час перекладу з англійської на німецьку модель має розуміти, як скоротити кількість слів або спростити концепцію, щоб дубльоване аудіо звучало природно.

Більш ранні підходи спочатку оптимізували семантичну точність, а потім намагалися виправити таймінг. У результаті часто отримували переклади, які були семантично правильними, але не завжди дотримувалися обмежень тривалості, тож загальна якість усе ще була недостатньою. 

«Ми проводили поступові тести, навіть нічого не генеруючи, просто просили модель визначити кількість складів у фрагменті тексту», — згадує Містратов. «Більш ранні моделі просто були не здатні з цим упоратися.»

Надійний підрахунок складів виявився критично важливим. Якби модель не могла послідовно обчислювати склади, вона не змогла б надійно націлюватися на конкретний часовий інтервал.

Моделі серії GPT‑5 забезпечили рівень послідовності міркувань, якого бракувало попереднім моделям, особливо в завданнях на кшталт підрахунку складів і відстеження обмежень. Завдяки цьому покращенню Descript переробили процеси перекладу та дубляжу.

Спочатку система Descript розбиває транскрипт на фрагменти, орієнтуючись на рамки речень, природні паузи та мовленнєві патерни в оригінальному записі. Кожен фрагмент зберігає семантичну безперервність, але є достатньо малим, щоб про нього можна було міркувати як про одиницю часу.

Далі модель обчислює кількість складів у фрагменті. Використовуючи припущення щодо темпу мовлення, специфічні для мови, система оцінює, на скільки складів має орієнтуватися перекладений фрагмент, щоб зберегти природний темп («дотримання тривалості»). Запит просить модель оптимізувати як дотримання тривалості, так і збереження змісту. Сусідні фрагменти завантажуються як контекст, щоб модель зберігала семантичну узгодженість між сегментами.

Команда оцінила кілька конфігурацій, щоб збалансувати дотримання тривалості, семантичну точність, затримку та вартість. Вибрана конфігурація забезпечила чітке дотримання обмежень та високу швидкість роботи, уможлививши переклад великих обсягів без ручного переналаштування таймінгів. У результаті було сформовано робочий процес перекладу, в якому темп розглядається як основна змінна, а не як щось, що виправляють постфактум.

Визначення та вимірювання природного темпу

Щоб розробити критерії прийнятності, команда провела тести прослуховування: вони згенерували перекладені аудіозразки та коригували швидкість відтворення невеликими кроками, просячи користувачів оцінити, коли мовлення ставало неприродним. 

«Усе, що було уповільнено на 10% або прискорено на 20%, загалом усе ще звучало природно», — розповідає Містратов. Поза цим діапазоном мовлення вже ставало надто спотвореним. 

Попередні системи показували низькі результати за цим показником. Залежно від мови, лише від 40% до 60% сегментів потрапляли в межі прийнятного вікна темпу. Завдяки переробленому процесу цей показник зріс із 40%–60% до 73%–83% залежно від мови.

Команда також оцінювала семантичну відповідність за допомогою окремого оцінювання типу «model-as-judge» за шкалою від 1 («зовсім інший зміст») до 5 («семантичний еквівалент»).  Для дубляжу було вирішено прийняти нижчий семантичний поріг, ніж для перекладу лише субтитрів, де обмеження тривалості не мають такого критичного значення. Навіть із таким компромісом 85,5% сегментів отримали оцінку чотири або п’ять із п’яти за семантичну відповідність.

Зрештою, було отримано систему, яка могла збалансувати два різних обмеження — час і зміст — із вимірюваною надійністю. І оскільки обидві метрики є автоматизованими, Descript може постійно оцінювати нові випуски моделей і варіації запитів за тими самими тестами.

Розкриття потенціалу масштабної локалізації відео

Переклад переходить від окремих відео до великих бібліотек контенту, і Descript додає більше контролю над налаштуванням перекладів, зокрема можливість за потреби надавати пріоритет суворішій семантичній точності.

Переклад у Descript — лише один шар ширшої мультимодальної системи. Перекладений текст надходить у систему генерації мовлення, яка надалі забезпечує синхронізацію артикуляції та фінальний рендеринг відео. 

Покращення на текстовому рівні роблять можливим збереження природного темпу, але загальний досвід також залежить від того, наскільки добре аудіо модель зберігає тон, ритм і невербальні характеристики мовлення. Саме в цьому команда бачить наступний аспект для покращення. 

«Значною мірою підвищенню якості перекладу сприятиме те, що процес стане більш мультимодальним — поєднання аудіо, відео та тексту разом із ухваленням рішення про переклад», — говорить Містратов. «Це має краще зберігати невербальні характеристики мовлення, як-от тон і наголос, і зберігати ще більше оригінальної подачі».

Потужніші моделі міркування зробили складність дубляжу для Descript більш керованою. Після перетину порогу, за яким моделі могли надійно врівноважувати компроміси між темпом і змістом, переклад став тим, що команда могла систематично вдосконалювати та впроваджувати в масштабі.