Переход к основному контенту
OpenAI

6 марта 2026 г.

Стартап

Как инженеры Descript масштабировали многоязычный дубляж видео

Используя модели рассуждений OpenAI, Descript автоматизировала локализацию больших библиотек контента без потери тайминга и смысла.

Логотип и словесный знак Descript на фоне абстрактной розово-фиолетовой звуковой волны.
Размер компании: стартап
Регион: Северная Америка
Промышленность: технологии
Продукты: API

Результаты

43

улучшение соблюдения длительности с OpenAI в процентных пунктах

Результаты

15 %

Увеличение числа экспортов с дубляжом после развертывания

Загрузка…

Descript(открывается в новом окне) — это видеоредактор, изначально созданный на базе ИИ и построенный вокруг простой идеи: если вы умеете редактировать текст, вы должны уметь редактировать и видео. С самых первых дней Descript ИИ лежит в основе каждого аспекта продукта: транскрипции, редактирования, очистки звука и всё более сложных творческих рабочих процессов. Они уже много лет используют технологии OpenAI, применяя Whisper для транскрипции, а модели серии GPT — в своём ИИ-редакторе Underlord.

Перевод быстро стал вариантом использования с высоким воздействием. Традиционно перевод видео был медленным и дорогостоящим процессом: требовались языковые специалисты, которые управляли проектами, выполняли рутинный перевод, контролировали качество и создавали соответствующую аудиодорожку. Большие языковые модели существенно сокращают этот процесс, делая возможным перевод высокого качества в больших масштабах.

Субтитры и дубляж одинаково требуют семантической точности: перевод должен сохранять исходный смысл. Однако соблюдение длительности играет в каждом из них разную роль. Для субтитров это желательное дополнение. Для дубляжа это критически важно: если переведённая речь оказывается слишком длинной или слишком короткой, она будет звучать неестественно, даже если смысл передан верно.

Чтобы решить эту проблему, Descript переработала свой пайплайн перевода, используя модели рассуждений OpenAI для оптимизации семантической точности и соблюдения длительности непосредственно при генерации, а не после неё. В первые 30 дней после внедрения экспорт переведённых видео с дубляжом увеличился на 15 %, а соблюдение длительности улучшилось на 13–43 процентных пункта в зависимости от языка.

«Дубляж становится всё более популярным сценарием использования Descript, поэтому мы разрабатываем способы выполнять его в пакетном режиме для компаний, которые хотят переводить целые библиотеки и синхронизировать озвучку с движением губ», — сказала Лора Буркхаузер, генеральный директор Descript.

Где дубляж начал давать сбой

Перевод был одной из первых и самых востребованных функций Descript. Сначала они переводили только субтитры, и это работало хорошо. Но многие пользователи хотели большего — чтобы видео также получало озвучку на целевом языке.

Однако одна проблема всплывала снова и снова: дублированная аудиодорожка не всегда звучала естественно. «Пожалуй, главная жалоба, которую мы слышали, заключалась в том, что темп речи на языке перевода был неестественным», — сказал Алекс Мистратов, руководитель направления ИИ-продуктов в Descript.

Проблема сводилась к тому, что в разных языках требуется разное количество времени, чтобы выразить одну и ту же мысль. В Descript например заметили, что в среднем немецкий — более «длинный» язык, чем английский. Чтобы уложиться в фиксированные видеосегменты, переведённую речь часто приходилось искусственно ускорять или замедлять. «В результате голос звучал либо как у бурундука, либо как у сонного великана», — объясняет Мистратов.

Английский:

Немецкий:

“Please review the safety guidelines before operating the machine.”

Слогов: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Слогов: 24 (увеличение на 40 %)

В этом случае немецкое аудио пришлось бы либо неестественно ускорить, либо переписать перевод, чтобы уложиться в отведённое время.

Пользователям оставалось два варианта: вручную корректировать тайминг аудио сегмент за сегментом или переписать сам перевод, чтобы он уложился в отведённое время. Оба подхода требовали глубокого редактирования таймлайна и зачастую владения целевым языком почти на уровне носителя. Это было утомительным для авторов и стало препятствием для масштабирования функции на крупные корпоративные проекты локализации.

Оптимизация переводов по времени, а не только по смыслу

У команды было четкое представление о том, что потребуется, чтобы дубляж заработал. Системе нужно было бы не только выполнять оптимизацию с учетом семантического смысла, но и учитывать временные ограничения. Например, при переводе с английского на немецкий модели необходимо понимать, как использовать меньше слов или упрощать концепцию, чтобы дублированная речь звучала естественно.

Более ранние подходы сначала оптимизировали семантическую точность, а затем пытались скорректировать временную синхронизацию. Переводы часто были семантически корректными, но регулярно не соблюдали ограничения по длительности, а общее качество всё равно оставалось недостаточно высоким. 

«Мы проводили поэтапные тесты, даже ничего не генерируя — просто просили модель определить количество слогов в фрагменте текста, — рассказывает Мистратов. — Более ранние модели с этим просто не справлялись».

Надежный подсчет слогов оказался критически важным. Если модель не могла стабильно подсчитывать слоги, она не могла надежно ориентироваться на конкретный диапазон длительности.

Модели серии GPT‑5 обеспечили уровень согласованности рассуждений, которого не хватало более ранним моделям, особенно в таких задачах, как подсчёт слогов и отслеживание ограничений. Благодаря этому улучшению компания Descript переработала свой процесс перевода и дубляжа.

Сначала система Descript разбивает расшифровку на фрагменты, ориентируясь на границы предложений, естественные паузы и особенности речи в исходной записи. Каждый фрагмент сохраняет семантическую целостность, но достаточно мал, чтобы его можно было анализировать как единицу тайминга.

Затем модель вычисляет количество слогов в фрагменте. Используя характерные для конкретного языка допущения о скорости речи, система оценивает, на какое количество слогов должен ориентироваться переведённый фрагмент, чтобы сохранить естественный темп («соответствие длительности»). Промпт просит модель оптимизировать как соблюдение заданной длительности, так и сохранение смысла. Окружающие фрагменты передаются в качестве контекста, чтобы модель сохраняла семантическую связность между сегментами.

Команда оценила несколько конфигураций, чтобы сбалансировать соответствие длительности, семантическую точность, задержку и стоимость. Выбранная конфигурация обеспечила строгое соблюдение ограничений, на производственной скорости, позволяя выполнять перевод высоких объемов без ручной корректировки времени. В результате удалось создать конвейер перевода, в котором темп речи учитывается с самого начала, а не корректируется уже после обработки.

Определение и измерение естественного темпа

Чтобы разработать приёмочные критерии для оценочных тестов, команда провела тесты на слуховое восприятие: они создавали переведённые аудиообразцы и небольшими шагами изменяли скорость воспроизведения, прося пользователей оценить, когда речь начинала звучать неестественно. 

«Как правило, любой материал, который замедляли на 10 % или ускоряли на 20 %, по-прежнему звучал естественно», — сказал Мистратов. За пределами этого диапазона речь становилась слишком искажённой. 

По этому показателю более ранние системы демонстрировали низкие результаты. В зависимости от языка только от 40 % до 60 % сегментов попадали в допустимый диапазон темпа. После переработки пайплайна этот показатель вырос с 40–60 % до 73–83 % в зависимости от языка.

Команда также оценила семантическое соответствие с помощью отдельной оценки моделью в роли судьи по шкале от 1 («совершенно другое») до 5 («семантически эквивалентно»).  Для дубляжа было решено принять низкий порог семантического соответствия, чем для перевода только для субтитров, где ограничения по длите не имеют значения. Несмотря на этот компромисс, 85,5 % сегментов получили оценку 4 или 5 из 5 за соблюдательное соответствие.

В результате получилась система, способная уравновешивать два конкурирующих ограничения — временные рамки и смысл — с измеримой степенью уверенности. А поскольку обе метрики были автоматизированы, Descript может непрерывно оценивать новые версии моделей и вариации промптов по одним и тем же бенчмаркам.

Масштабная локализация видео становится реальностью

По мере того как перевод переходит от отдельных видео к крупным библиотекам контента, Descript добавляет больше возможностей для управления настройкой переводов, включая возможность при необходимости отдавать приоритет более строгой смысловой точности.

Перевод в Descript — это лишь один уровень более широкой мультимодальной системы. Переведённый текст передаётся в генерацию речи, которая затем управляет синхронизацией губ и финальным рендерингом видео. 

Улучшения на текстовом уровне позволяют добиться естественного темпа, однако общее впечатление также зависит от того, насколько хорошо аудиомодель сохраняет тон, ритм и невербальные характеристики речи. Именно в этом команда видит следующий этап развития. 

«Во многом дальнейшее повышение качества перевода связано с тем, чтобы сделать конвейер обработки по-настоящему мультимодальным — использовать аудио, видео и текст одновременно при выборе оптимального перевода, — говорит Мистратов. — Это позволит лучше сохранять невербальные особенности речи, такие как интонация и смысловые акценты, а также ещё точнее передавать манеру речи оригинала».

Для Descript более мощные модели рассуждений позволили справиться со сложностью дубляжа. После преодоления порога за которым модели смогли надежно находить баланс между компромиссами темпа подачи и передачи смысла, перевод стал тем, что команда могла систематически совершенствовать и развертывать в масштабе.