Gå til hovedindhold
OpenAI

6. marts 2026

Nystartet virksomhed

Hvordan Descript udvikler flersproget videodubbing i stor skala

Ved hjælp af OpenAI-ræsonneringsmodeller muliggjorde Descript automatisk lokalisering af store indholdsbiblioteker uden at miste timing eller mening.

Descript-logo og ordmærke på en lyserød og lilla abstrakt bølgeformet baggrund.
Virksomhedsstørrelse: Nystartet virksomhed
Region: Nordamerika
Branche: Teknologi
Produkter: API

Resultater

43

Procentvis forbedring i varighedsoverholdelse med OpenAI

Resultater

15 %

Stigning i dubbede eksporter efter udrulning

Indlæser ...

Descript(åbner i et nyt vindue) er et AI-native videoredigeringsprogram, der er baseret på en simpel idé: hvis du kan redigere tekst, burde du også kunne redigere video. Siden Descripts tidlige dage har AI drevet alle aspekter af produktet: transskription, redigering, lydoprydning og stadig mere komplekse kreative arbejdsgange. Descript har bygget på OpenAI i årevis og bruger Whisper til transskription og GPT‑seriens modeller i deres co-editor Underlord. 

Oversættelse blev hurtigt et brugsscenarie med stor betydning. Traditionelt set har oversættelse af video været langsom og dyr og har krævet sprogeksperter til at styre projekter, producere rutineprægede oversættelser, håndtere kvalitetskontrol og generere tilsvarende lyd. LLM'er komprimerer dramatisk den arbejdsgang, hvilket gør oversættelse af høj kvalitet i stor skala mulig.

Både billedtekster og dubbet tale kræver semantisk nøjagtighed, fordi oversættelsen skal bevare den oprindelige betydning. Overholdelse af varighed spiller dog også en vigtig rolle. For billedtekster er det noget, der er rart at have. For dubbet tale er det afgørende, fordi hvis den oversatte tale er for lang eller for kort, vil den lyde unaturlig, selvom betydningen er korrekt.

For at imødegå dette redesignede Descript sin oversættelsespipeline ved hjælp af OpenAI-ræsonneringsmodeller for at optimere semantisk troværdighed og overholdelse af varighed under genereringen i stedet for efter genereringen. I de første 30 dage efter udrulningen steg eksporten af oversatte videoer med dubbing med 15 %, og overholdelse af varighed blev forbedret med 13 til 43 procentpoint, afhængigt af sproget.

“Dubbing er et stadig mere populært anvendelsestilfælde for Descript, så vi bygger måder at gøre det på i batch for virksomheder, der ønsker at oversætte og læbesynkronisere hele biblioteker,” siger Laura Burkhauser, CEO.

Hvor der opstod problemer med synkronisering

Oversættelse var en af Descripts tidligste og mest efterspurgte funktioner. De startede med oversættelse udelukkende med undertekster, hvilket fungerede godt, men mange brugere ønskede at gå videre og få oplæst lyd (dubbing) på målsproget.

Der var dog et problem, der blev ved med at dukke op: indtalt tale lød ikke altid naturligt. “Den nok største klage, vi hørte, var, at taletempoet var unaturligt på det oversatte sprog,” siger Aleks Mistratov, Head of AI Product hos Descript.

Problemet var, at forskellige sprog kræver forskellig tid til at udtrykke den samme idé. Descript observerede for eksempel, at tysk i gennemsnit er et længere sprog end engelsk. For at passe ind i faste videosegmenter måtte den oversatte tale ofte fremskyndes eller sænkes kunstigt. "Slutproduktet ville derfor ende med at lyde som et jordegern eller en søvnig kæmpe," forklarede Mistratov.

Engelsk:

Tysk:

“Please review the safety guidelines before operating the machine.”

Stavelser: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Stavelser: 24 (40 % stigning)

I dette tilfælde ville den tyske lyd enten skulle fremskyndes unaturligt, eller oversættelsen skulle omskrives, så den passer til tidsbegrænsningen.

Brugerne havde to muligheder: manuelt at justere lyden segment for segment eller omskrive selve oversættelsen, så den passede. Begge tilgange krævede dybdegående redigeringer af tidslinjen og ofte næsten indfødt flydende beherskelse af målsproget. Det var tidskrævende for skabere og blev en hindring for at skalere funktionen til store virksomheds-lokaliseringsprojekter.

Optimering af oversættelser med fokus på timing, ikke kun mening

Teamet havde en klar teori om, hvad der skulle til for at få dubbing til at fungere. Systemet skulle ikke kun optimere for semantisk betydning, men skulle også være opmærksomt på tidsmæssige begrænsninger. Når man for eksempel oversætter fra engelsk til tysk, skal modellen forstå, hvordan man bruger færre ord eller forenkler konceptet, så den dubbede lyd forbliver naturlig.

Tidligere tilgange optimerede først semantisk nøjagtighed og forsøgte derefter at korrigere timingen. Oversættelserne var ofte semantisk korrekte, men de overholdt ofte ikke begrænsningerne for varighed, og den samlede kvalitet var stadig ikke tilfredsstillende. 

“Vi udførte inkrementelle tests uden at generere noget som helst, vi bad blot modellen om at angive antallet af stavelser i et tekststykke,” sagde Mistratov. “Tidligere modeller var ganske simpelt ikke gode til det.”

Pålidelig stavelsesoptælling viste sig at være afgørende. Hvis modellen ikke konsekvent kunne beregne stavelser, kunne den ikke pålideligt sigte mod et bestemt varighedsvindue.

GPT‑5‑seriens model bragte et niveau af konsistens i ræsonnering, som tidligere modeller manglede, især for arbejdsopgaver som stavelsestælling og sporing af begrænsninger. Med den forbedring redesignede Descript sin oversættelses- og dubbingproces.

Først opdeler Descripts system transskriptionen i mindre segmenter, der er styret af sætningsgrænser, naturlige pauser og talemønstre i den oprindelige optagelse. Hvert segment opretholder semantisk kontinuitet, men er lille nok til at kunne ræsonnere som en tidsenhed.

Derfra beregner modellen antallet af stavelser i segmentet. Ved hjælp af sprogspecifikke antagelser om taletempo estimerer systemet, hvor mange stavelser det oversatte segment bør sigte efter for at bevare et naturligt tempo (“varighedsoverholdelse”). Prompten beder modellen om at optimere for både varighedsoverholdelse og bevarelse af betydning. Omgivende segmenter sendes med som kontekst, så modellen bevarer semantisk sammenhæng på tværs af segmenter.

Teamet evaluerede flere konfigurationer for at opnå en balance mellem varighedsoverholdelse, semantisk nøjagtighed, latenstid og omkostninger. Den valgte opsætning sikrede stærk overholdelse af begrænsninger ved produktionshastighed, hvilket muliggjorde oversættelse i store mængder uden manuel justering. Resultatet er en oversættelsesproces, hvor tempo behandles som en førsteklasses variabel i stedet for noget, der korrigeres efterfølgende.

Definition og måling af naturlig rytme

For at udvikle acceptkriterierne for evalueringer gennemførte teamet lyttetests. De genererede oversatte lydprøver og justerede afspilningshastigheden i små trin, mens de bad brugerne om at vurdere, hvornår talen virkede unaturlig. 

“Alt, der blev gjort langsommere med 10 %, eller blev fremskyndet med 20 %, lød generelt stadig naturligt,” siger Mistratov. Ud over dette interval blev talen for forvrænget. 

Tidligere systemer præsterede dårligt efter denne måling. Afhængigt af sproget faldt kun 40 % til 60 % af segmenterne inden for det acceptable tempo-vindue. Med den redesignede proces steg dette tal fra 40 %–60 % til mellem 73 % og 83 %, afhængigt af sproget.

Teamet evaluerede også semantisk troværdighed ved hjælp af en separat model-som-dommer-vurdering på en skala fra 1 ("helt anderledes") til 5 ("semantisk ækvivalent").  Til dubbing besluttede de at acceptere en lavere semantisk tærskel end ved oversættelse af kun billedtekster, hvor varighedsbegrænsninger er irrelevante. Selv med den afvejning blev 85,5 % af segmenterne vurderet til fire eller fem ud af fem for semantisk overensstemmelse.

Resultatet var et system, der kunne balancere to konkurrerende begrænsninger, nemlig timing og mening, med målbar sikkerhed. Eftersom begge målinger var automatiserede, kan Descript også løbende evaluere nye modeludgivelser og variationer i prompts mod de samme benchmarks.

Muliggør videolokalisering i stor skala

I takt med at oversættelse går fra enkeltvideoer til store indholdsbiblioteker, implementerer Descript mere kontrol over, hvordan oversættelser finjusteres, herunder muligheden for at prioritere en højere grad af semantisk nøjagtighed, når det er nødvendigt.

Oversættelse i Descript er kun ét lag i et bredere multimodalt system. Oversat tekst fødes ind i talegenerering, som derefter driver læbesynkronisering og endelig videogengivelse. 

Forbedringer i tekstlaget gør naturligt tempo mulig, men den samlede oplevelse afhænger også af, hvor godt lydmodellen bevarer tone, hastighed og ikke-verbale karakteristika ved tale. Det er der, holdet ser den næste grænse. 

“Meget af det, der vil forbedre oversættelsesresultaterne, er at gøre processen mere multimodal ved at inddrage lyd, video og tekst sammen, når man beslutter, hvordan man skal oversætte,” sagde Mistratov. "Det burde bedre bevare talens nonverbale karakteristika, såsom tone og betoning, og bevare endnu mere af den oprindelige tale."

For Descript gjorde stærkere ræsonneringsmodeller det muligt at gøre kompleksiteten ved dubbing håndterbar. Ved at krydse den tærskel, hvor modeller pålideligt kunne afveje kompromiser mellem tempo og betydning, blev oversættelse noget, teamet systematisk kunne forbedre og udrulle i stor skala.