Преминаване към основното съдържание
OpenAI

6 март 2026 г.

Стартъп

Как Descript осъществява мащабен многоезичен видеодублаж

Използвайки моделите със структурирано анализиране на OpenAI, Descript отключи автоматична локализация на големи библиотеки със съдържание, без да губи времевата синхронизация или смисъла.

Лого и логотип на Descript върху розов и лилав абстрактен фон с вълнообразна форма.
Размер на дружеството: Стартъп
Регион: Северна Америка
Промишленост: Технология
Продукти: API (приложно-програмен интерфейс)

Резултати

43

Подобрение в спазването на продължителността в процентни пунктове с OpenAI

Резултати

15%

Увеличение на експорта на дублирани материали след внедряването

Зареждане…

Descript(отваря се в нов прозорец) е видео редактор, създаден с изкуствен интелект, изграден около една проста идея – ако можете да редактирате текст, трябва да можете да редактирате и видео. Още от ранните дни на Descript ИИ задвижва всеки аспект на продукта – транскрипция, редактиране, почистване на аудио и все по-сложни творчески работни процеси. Descript използва OpenAI от години, използвайки Whisper за транскрипция и модели от серията GPT в своя съвместен редактор Underlord. 

Преводът бързо се утвърди като приложение с голямо въздействие. Традиционно преводът на видео винаги е бил бавен и скъп, изисквайки езикови експерти да управляват проекти, да изготвят рутинни преводи, да се занимават с контрол на качеството и да генерират съответното аудио. Големите езикови модели драстично съкращават този работен процес, като правят възможен висококачествен превод в голям мащаб.

Както субтитрите, така и дублажът изискват семантична достоверност. Преводът трябва да запазва оригиналното значение. Но спазването на продължителността играе различна роля при двата вида превод. За субтитрите продължителността е желателна. При дублаж тя е решаваща, защото ако преведената реч е твърде дълга или твърде кратка, ще звучи неестествено, дори ако смисълът е правилен.

За да се справи с това, Descript преработи своя процес за превод, използвайки моделите със структурирано анализиране на OpenAI, за да оптимизира семантичната достоверност и спазването на продължителността по време на генерирането, а не след това. През първите 30 дни след внедряването експортирането на преведени видеоклипове с дублаж се увеличиха с 15%, а спазването на продължителността се подобри с 13 до 43 процентни пункта в зависимост от езика.

„Дублирането е все по-популярно приложение за Descript, затова изграждаме начини да го правим пакетно за компании, които искат да превеждат и да правят устна синхронизация на цели библиотеки“, каза Лора Бъркхаузер, главен изпълнителен директор.

Където дублажът започна да се разпада

Преводът беше една от най-ранните и най-търсените функции на Descript. Те започнаха с превод само на субтитрите, което работеше добре, но много потребители искаха да отидат по-далеч и да имат говорима реч (дублаж) на целевия език.

Въпреки това постоянно изникваше един и същ проблем: дублираният звук не винаги звучеше правилно. „Вероятно най-честото оплакване, което чухме, беше, че темпото на речта звучеше неестествено на преведения език“, казва Алекс Мистратов, ръководител на ИИ продуктите в Descript.

Проблемът се свеждаше до факта, че различните езици изискват различно време, за да изразят една и съща идея. Например, по наблюдения на Descript като цяло немският е „по-дълъг“ език от английския. За да се вмести във фиксирани видео сегменти, преведената реч често трябваше да бъде изкуствено ускорена или забавена. „Щеше да се получи нещо, което звучи като земни белки или като сънлив гигант“, обяснява Мистратов.

Английски:

Немски:

„Моля, прегледайте насоките за безопасност, преди да работите с машината.“

Срички: 18

“Моля, прегледайте правилата за безопасност, преди да работите с машината.”

Срички: 24 (40% увеличение)

В този случай немското аудио или ще трябва да бъде ускорено неестествено, или преводът ще трябва да бъде пренаписан, за да се вмести във времевия бюджет.

Потребителите имаха два варианта – ръчно да пренастроят времето на аудиото, сегмент по сегмент, или да пренапишат самия превод, за да пасне. И двата подхода изискваха задълбочени редакции на времевата линия и често – почти родно владеене на целевия език. Това беше досадно за създателите и се превърна в пречка за мащабирането на функцията към големи корпоративни проекти за локализация.

Оптимизиране на преводите за времева синхронизация, а не само за смисъл

Екипът имаше ясна представа какво ще е необходимо, за да проработи дублажът. Системата трябваше не само да оптимизира за семантично значение, но и да отчита ограниченията във времето. Когато се превежда от английски на немски, например, моделът би трябвало да разбира как да използва по-малко думи или да опрости концепцията, така че дублираният аудиозапис да остане естествен.

По-ранните подходи първо оптимизираха семантичната вярност и се опитваха да коригират времевата синхронизация след това. Преводите често бяха семантично коректни, но редовно не спазваха ограниченията за продължителност и цялостното качество все още не беше достатъчно добро. 

„Проведохме поетапни тестове, без дори да генерираме каквото и да било, просто накарахме модела да изведе броя на сричките в откъс от текст“, каза Мистратов. „По-ранните модели просто не бяха добри в това.“

Надеждното броене на срички се оказа критично. Ако моделът не можеше да изчислява срички последователно, той не би могъл надеждно да се насочи към конкретен времеви диапазон.

Моделите от серията GPT‑5 внесоха ниво на структурирано анализиране, което по-ранните модели нямаха, особено при задачи като броене на срички и проследяване на ограничения. С това подобрение Descript преработи своя процес на превод и дублаж.

Първо, системата на Descript разделя стенограмата на части, водена от границите на изреченията, естествените паузи и речевите модели в оригиналния запис. Всеки фрагмент запазва семантичната непрекъснатост, но е достатъчно малък, за да се разглежда като времева единица.

Оттам моделът изчислява броя на сричките в сегмента. Правейки специфични за езика предположения за скоростта на речта, системата оценява към колко срички трябва да се стреми преведеният фрагмент, за да се запази естественият ритъм („придържане към продължителността“). Подканата изисква моделът да оптимизира както за придържане към продължителността, така и за запазване на смисъла. Околните фрагменти се подават като контекст, така че моделът да поддържа семантична последователност между сегментите.

Екипът оцени множество конфигурации, за да балансира спазването на продължителността, семантичната достоверност, забавянето и разходите. Избраната конфигурация осигури стриктно спазване на ограниченията при производствена скорост, което позволи превод с голям обем без ръчно пренастройване на времето. Резултатът е конвейер за превод, при който темпото се третира като основна променлива, вместо като нещо, което се коригира впоследствие.

Определяне и измерване на естественото темпо

За да разработи критериите за приемане за оценките, екипът проведе тестове за слушане. Екипът генерира преведени аудио образци и коригира скоростта на възпроизвеждане на малки стъпки, като помоли потребителите да оценят кога речта става неестествена. 

„Всичко, което беше забавено с 10% или ускорено с 20%, като цяло все още звучеше естествено“, казва Мистратов. Отвъд този диапазон речта стана твърде изкривена. 

По-ранните системи се представяха слабо по този показател. В зависимост от езика само 40% до 60% от сегментите попаднаха в приемливия времеви диапазон. С преработения процес този показател се увеличи от 40% – 60% до между 73% – 83%, в зависимост от езика.

Екипът също така оцени семантичната вярност, използвайки отделна оценка „модел като съдия“ по скала от 1 („напълно различно“) до 5 („семантично еквивалентно“).  За дублаж те решиха да приемат по-нисък семантичен праг, отколкото при превод само на надписи, при който ограниченията за продължителност са без значение. Дори с този компромис 85,5% от сегментите бяха оценени с четири или пет от пет за семантично съответствие.

Резултатът беше система, която можеше да балансира две конкуриращи се ограничения – време и смисъл – с измерима увереност. И тъй като и двата показателя бяха автоматизирани, Descript може непрекъснато да оценява нови версии на модела и вариации на подкани спрямо същите еталони.

Разработване на локализация на видео в голям мащаб

С развитието на преводите от единични видеклипове към големи библиотеки със съдържание, Descript въвежда повече контрол върху настройките на преводите, включително възможността за приоритизиране на по-строга семантична точност, когато е необходимо.

Преводът в Descript е само един слой от по-широка мултимодална система. Преведеният текст преминава към генерирането на реч, което след това задвижва синхронизацията на устните и финалното рендиране на видеото. 

Подобренията в текстовия слой правят възможно естественото темпо, но цялостното изживяване зависи и от това колко добре аудио моделът запазва тона, каданса и невербалните характеристики на речта. Там екипът вижда следващото предизвикателство. 

„Голяма част от това, което подобрява резултатите от превода, е да направим работния процес по-мултимедиен: да включим аудио, видео и текст заедно, когато решаваме как да превеждаме“, казва Мистратов. „Това би трябвало по-добре да запази невербалните характеристики на речта, като тон и наблягане, и да съхрани още повече от оригинала.“

За Descript по-силните модели със структурирано анализиране направиха сложността на дублажа управляемa. С преминаването на прага, при който моделите можеха надеждно да балансират компромисите между темпото и смисъла, преводът се превърна в нещо, което екипът можеше систематично да подобрява и да внедрява в мащаб.