Hur Descript utvecklar flerspråkig videodubbning i stor skala
Med hjälp av OpenAI-resonemangsmodeller låste Descript upp automatisk lokalisering av stora innehållsbibliotek utan förlust av tid eller betydelse.

Resultat
43
Förbättring i procentenheter av följsamhet av varaktighet med OpenAI
Resultat
15%
Ökning av dubbade exporter efter lansering
Descript(öppnas i ett nytt fönster) är en AI-native videoredigerare skapad utifrån en enkel idé: om man kan redigera text borde man även kunna redigera video. Ända sedan Descripts tidiga dagar har AI drivit alla aspekter av produkten: transkription, redigering, ljudrensning och alltmer komplexa kreativa arbetsflöden. De har byggt på OpenAI i åratal och använt Whisper för transkription och GPT‑seriemodeller i sin medredaktör Underlord.
Översättning framstod snabbt som ett användningsfall med stor effekt. Traditionellt har översättning av video varit långsamt och dyrt, och krävt att språkexperter hanterar projekt, producerar översättningar, hanterar kvalitetskontroller, och genererar motsvarande ljud. LLM:er komprimerar arbetsflödet dramatiskt vilket möjliggör högkvalitativ översättning i stor skala.
Både textning och dubbning kräver semantisk trohet: översättningen måste bevara den ursprungliga betydelsen. Följsamhet av varaktighet spelar också en stor roll i varje fall. För bildtexter är det något som är bra att ha. För dubbning är det avgörande eftersom för långt eller för kort översatt tal kommer att låta onaturligt även om betydelsen är korrekt.
För att åtgärda detta omdesignade Descript sin översättningspipeline med hjälp av OpenAI-resonemangsmodeller för optimering av semantisk trohet och följsamhet av varaktighet under genereringen, inte efter. Under de första 30 dagarna efter lanseringen ökade exporten av översatta videor med dubbning med 15 % och följsamheten av varaktighet förbättrades med 13 till 43 procentenheter beroende på språk.
"Dubbning är blir alltmer propulärt med Descript och vi håller därför på att skapa sätt att göra det i batch för företag som vill översätta och läppsynkronisera hela bibliotek", sade Laura Burkhauser, VD.
Översättning var en av Descripts tidigaste och mest efterfrågade funktioner. De började med endast översättning av bildtexter vilket fungerade bra men många användare efterfrågade uppläst ljud (dubbning) på målspråket.
Fast ett problem fortsatte att dyka upp: dubbat ljud lät inte alltid rätt. "Det främsta klagomålet vi hörde var förmodligen att taltakten var onaturlig på det översatta språket", sade Aleks Mistratov, chef för AI-produkter på Descript.
Problemet berodde på att olika språk tar olika lång tid på sig att uttrycka samma idé. Descript observerade till exempel att tyska i genomsnitt är ett "längre" språk än engelska. För att få det att passa in i fixerade videosegment var översatt tal ofta tvunget att snabbas upp eller saktas ner. "Resultatet var något som lät som en snabb ekorre eller sömnig jätte", förklarade Mistratov.
Engelska: | Tyska: |
"Granska säkerhetsriktlinjerna innan du använder maskinen." Vokaler: 18 | "Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen." Vokaler: 24 (40 % ökning) |
I det här fallet skulle det tyska ljudet antingen behöva snabbas upp på ett onaturligt sätt eller så skulle översättningen behöva skrivas om för att passa tidsbudgeten.
Användarna hade två alternativ: att manuellt ändra tidsinställningen för ljudsegmenten eller skriva om själva översättningen så att den passar. Båda metoderna krävde djupgående redigeringar av tidslinjen och ofta nästan flytande språkkunskaper i målspråket. Det var problematiskt för skaparna och blev ett hinder för skalandet av funktionen till stora lokaliseringsprojekt för företag.
Teamet hade en tydlig teori om vad som skulle krävas för att få dubbning att fungera. Systemet skulle inte bara behöva optimera för semantisk innebörd utan även vara medvetet om tidsbegränsningar. Modellen behövde till exempel förstå vid översättning från engelska till tyska hur den använder färre ord eller förenklar koncept så att den dubbade ljudinspelningen förblir naturlig.
Tidigare metoder optimerade först semantisk återgivning och försökte därefter korrigera timing. Översättningarna var ofta semantiskt korrekta men missade rutinmässigt tidsbegränsningarna och den övergripande kvaliteten var fortfarande inte tillräckligt bra.
"Vi körde stegvisa tester utan att ens generera någonting, vi bad endast modellen att mata ut antalet vokaler i en textbit", sade Mistratov. "Tidigare modeller var helt enkelt inte bra på det."
Tillförlitlig räkning av vokaler visade sig vara avgörande. Om modellen inte kunde konsekvent räkna antalet vokaler kunde den inte hålla sig inom en viss varaktighet.
GPT‑5‑seriens modeller gav en nivå av konsekvens i resonemanget som tidigare modeller saknade, särskilt för uppgifter såsom räkning av vokaler och begränsning av varaktighet. Med den förbättringen omdesignade Descript sin översättnings- och dubbningspipeline.
Descripts system delar först upp transkriptionen i segment med hjälp av meningsgränser, naturliga pauser och talmönster i den ursprungliga inspelningen. Varje bit upprätthåller semantisk kontinuitet men är tillräckligt liten för att kunna resoneras om som en tidsenhet.
Därefter beräknar modellen antalet vokaler i biten. Med hjälp av språkspecifika antaganden om talhastighet uppskattar systemet hur många vokaler den översatta delen ska rikta in sig på för att bevara naturligt tempo ("följsamhet av varaktighet"). Prompten ber modellen att optimera för följsamhet av varaktighet och bevarande av betydelse. Omgivande segment används kontext så att modellen bibehåller semantisk koherens mellan segment.
Teamet utvärderade flera konfigurationer för att balansera följsamhet av varaktighet, semantisk trohet, latens och kostnad. Den valda konfigurationen levererade stark efterlevnad av begränsningar i produktionstakten vilket möjliggjorde översättning i hög volym utan manuell omtajmning. Resultatet är en översättningspipeline där tempo betraktas som en förstklassig variabel i stället för något som korrigeras i efterhand.
För att utveckla acceptanskriterierna för utvärderingar genomförde teamet lyssningstester: de genererade översatta ljudprover och justerade uppspelningshastigheten i små steg samt bad användarna att betygsätta när talet blev onaturligt.
"Allt som saktades ner med 10 % eller ökade hastigheten med 20 % lät i allmänhet fortfarande naturligt", sade Mistratov. Utanför detta intervall blev talet för förvrängt.
Tidigare system presterade dåligt enligt det måttet. Beroende på vilket språk föll endast 40 % till 60 % av segmenten inom det acceptabla tempofönstret. Med den omdesignade pipelinen ökade siffran från 40–60 % till mellan 73 % och 83 % beroende på vilket språk.
Teamet utvärderade även semantisk trohet med hjälp av en separat modell som domare som dömde med en skala på 1 ("helt annorlunda") till 5 ("semantiskt ekvivalent"). För dubbning beslutade de att acceptera en lägre semantisk tröskel än för enbart textning där begränsningar av varaktighet är irrelevant. Även med den avvägningen fick 85,5 % av segmenten betyget fyra eller fem av fem för semantisk följsamhet.
Resultatet blev ett system som kunde balansera två konkurrerande begränsningar (timing och betydelse) med mätbar säkerhet. Eftersom båda mätvärdena automatiserades kan även Descript kontinuerligt utvärdera nya modellreleaser och ge förslag på variationer mot samma riktmärken.
I takt med att översättning går från enskilda videor till stora innehållsbibliotek ökar Descript kontrollen över hur översättningar finjusteras, inklusive möjlighet att prioritera striktare semantisk återgivning vid behov.
Översättning inuti Descript är bara ett lager i ett bredare multimodalt system. Översatt text matas in i talgenerering som sedan driver läppsynkronisering och slutlig videorendering.
Förbättringar i textlagret möjliggör naturligt tempo men den övergripande upplevelsen beror även på hur väl ljudmodellen bevarar ton, kadens och icke-verbala egenskaper i tal. Det är där teamet ser nästa genombrott.
"Mycket av det som kommer att förbättra översättningsresultatet göra processen mer multimodal: att integrera ljud, video och text tillsammans när man bestämmer hur man ska översätta", sade Mistratov. "Det borde bibehålla talets icke-verbala egenskaper bättre såsom ton och betoning samt bevara mer av den ursprungliga framförandet."
För Descript gjorde starkare resonemangsmodeller komplexiteten i dubbning hanterbar. Genom att överstiga tröskeln där modeller på ett tillförlitligt sätt kunde balansera avvägningar mellan tempo och betydelse blev översättning något som teamet systematiskt kunde förbättra och implementera i stor skala.


