Preskočite na glavno vsebino
OpenAI

6. marec 2026

Zagonsko podjetje

Kako Descript razvija večjezično sinhronizacijo številnih videov

Z uporabo OpenAI-jevih modelov sklepanja je Descript omogočil avtomatizirano lokalizacijo obsežnih knjižnic vsebin, ne da bi pri tem izgubil časovno usklajenost ali pomen.

Logotip in besedni znak za Descript na rožnato-vijoličnem abstraktnem ozadju v obliki vala.
Velikost podjetja: Zagonsko podjetje
Regija: Severna Amerika
Industrija: Tehnologija
Izdelki: API

Rezultati

43

Izboljšanje skladnosti trajanju z OpenAI v odstotnih točkah

Rezultati

15 %

Povečanje sinhroniziranih izvozov po uvedbi

Nalaganje …

Descript(odpre se v novem oknu) je video urejevalnik, ki ga izvorno poganja umetna inteligenca (UI), zgrajen okoli preproste zamisli: če znate urejati besedilo, lahko urejate tudi video. Že od samega nastanka Descripta UI poganja vsak vidik produkta: prepisovanje, urejanje, čiščenje zvoka in vse kompleksnejše ustvarjalne delovne tokove. Na OpenAI se opirajo že več let; za prepisovanje uporabljajo Whisper, modele serije GPT pa v svojem pomožnem urejevalniku Underlord. 

Prevajanje se je hitro izkazalo kot primer uporabe z velikim učinkom. Tradicionalno je bilo prevajanje videov počasno in drago, saj je zahtevalo jezikovne strokovnjake za vodenje projektov, pripravo rutinskih prevodov, nadzor kakovosti in generiranje ustreznega zvoka. Veliki jezikovni modeli ta delovni tok bistveno skrajšajo, zato omogočajo kakovostno prevajanje v velikem obsegu.

Tako podnapisi kot sinhronizacija zahtevajo semantično zvestobo: prevod mora ohraniti izvirni pomen. Vendar ima usklajenost trajanja pri vsakem od njiju drugačno vlogo. Pri podnapisih je to zaželeno. Pri sinhronizaciji je to ključnega pomena, saj bo prevedeni govor zvenel nenaravno, če bo trajal predolgo ali prekratko, tudi če je pomen pravilen.

Da bi to odpravili, je Descript svoj prevajalski cevovod preoblikoval z uporabo OpenAI-jevih modelov sklepanja, tako da med generiranjem, in ne naknadno, optimizira semantično zvestobo in usklajenost trajanja. V prvih 30 dneh po uvedbi se je izvoz prevedenih videov s sinhronizacijo povečal za 15 %, usklajenost trajanja pa se je glede na jezik izboljšala za 13 do 43 odstotnih točk.

»Sinhronizacija je za Descript vse bolj priljubljen primer uporabe, zato razvijamo načine, kako to izvajati paketno za organizacije, ki želijo prevesti in uskladiti gibanje ustnic v celotnih knjižnicah,« je povedala izvršna direktorica Laura Burkhauser.

Kje se je sinhronizacija zalomila

Prevajanje je bilo ena najzgodnejših in najbolj zahtevanih funkcionalnosti Descripta. Začeli so samo s prevajanjem podnapisov, kar je delovalo dobro, vendar so številni uporabniki želeli iti še dlje in imeti govorjeni zvok (sinhronizacijo) v ciljnem jeziku.

Vendar se je stalno pojavljala ena težava: sinhronizirani zvok ni vedno zvenel pravilno. »Verjetno je bila najpogostejša pripomba ta, da je bil tempo govora v prevedenem jeziku nenaraven,« je povedal Aleks Mistratov, vodja produktov UI pri Descriptu.

Težava je izvirala iz dejstva, da različni jeziki za izražanje iste zamisli potrebujejo različno količino časa. Descript je na primer ugotovil, da je nemščina v povprečju »daljši« jezik kot angleščina. Da bi se prevedeni govor prilegal fiksnim video segmentom, ga je bilo treba pogosto umetno pospešiti ali upočasniti. »Na koncu smo dobili nekaj, kar je zvenelo kot veverice na heliju ali zaspan velikan,« je pojasnil Mistratov.

Angleščina:

Nemščina:

“Please review the safety guidelines before operating the machine.”

Zlogov: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Zlogov: 24 (40 % povečanje)

V tem primeru bi bilo treba nemški zvok bodisi nenaravno pospešiti bodisi bi bilo treba prevod preoblikovati, da bi ustrezal časovni omejitvi.

Uporabnikom sta preostali dve možnosti: ročno prilagoditi časovni potek zvoka segment za segmentom ali pa na novo napisati sam prevod, da bi se prilegal. Oba pristopa sta zahtevala obsežne popravke časovnice in pogosto skoraj materno tekoče znanje ciljnega jezika. To je bilo za ustvarjalce zamudno in je postalo ovira pri razširjanju te funkcionalnosti na obsežne lokalizacijske projekte v velikih podjetjih.

Optimizacija prevodov glede na časovno usklajenost, ne le glede na pomen

Ekipa je imela jasno predstavo o tem, kaj je potrebno, da bi sinhronizacija delovala. Sistem bi moral optimizirati ne le semantični pomen, temveč upoštevati tudi časovne omejitve. Pri prevajanju iz angleščine v nemščino bi moral model na primer razumeti, kako uporabiti manj besed ali poenostaviti koncept, da bi sinhronizirani zvok ostal naraven.

Prejšnji pristopi so najprej optimizirali semantično zvestobo in šele nato poskušali popraviti časovno usklajenost. Prevodi so bili pogosto semantično pravilni, vendar redno niso izpolnjevali omejitev trajanja, zato splošna kakovost še vedno ni bila dovolj dobra. 

»Izvajali smo postopne teste, pri katerih sploh nismo ničesar generirali, temveč smo model samo prosili, naj izpiše število zlogov v delu besedila,« je povedal Mistratov. »Prejšnji modeli tega preprosto niso obvladali.«

Zanesljivo štetje zlogov se je izkazalo za ključno. Če model ni mogel dosledno izračunavati števila zlogov, ni mogel zanesljivo ciljati na določeno trajanje.

Modeli serije GPT‑5 so prinesli raven doslednosti pri sklepanju, ki je prejšnjim modelom manjkala, zlasti pri nalogah, kot sta štetje zlogov in sledenje omejitvam. S to izboljšavo je Descript na novo zasnoval svoj prevajalski in sinhronizacijski cevovod.

Najprej Descriptov sistem prepis razdeli na segmente ob upoštevanju mej stavkov, naravnih premorov in vzorcev govora v izvirnem posnetku. Vsak segment ohranja semantično kontinuiteto, hkrati pa je dovolj majhen, da ga je mogoče obravnavati kot časovno enoto.

Nato model izračuna število zlogov v segmentu. Na podlagi predpostavk o hitrosti govora, značilnih za posamezni jezik, sistem oceni, koliko zlogov naj vsebuje prevedeni segment, da se ohrani naraven tempo govora ('usklajenost trajanja'). Poziv modelu naroča optimizacijo tako glede usklajenosti trajanja kot glede ohranjanja pomena. Sosednji segmenti so posredovani kot kontekst, da model ohrani semantično koherentnost med segmenti.

Ekipa je ovrednotila več konfiguracij, da bi uravnotežila usklajenost trajanja, semantično zvestobo, latenco in stroške. Izbrana postavitev je zagotovila zanesljivo sledenje omejitvam pri produkcijski hitrosti, kar omogoča prevajanje v velikem obsegu brez ročnega časovnega prilagajanja. Rezultat je prevajalski cevovod, v katerem je tempo govora obravnavan kot osrednja spremenljivka, ne pa kot nekaj, kar se popravlja naknadno.

Opredelitev in merjenje naravnega tempa govora

Za oblikovanje meril sprejemljivosti za evalvacije je ekipa izvedla teste poslušanja: ustvarili so prevedene zvočne vzorce in v majhnih korakih prilagajali hitrost predvajanja, uporabnike pa prosili, naj ocenijo, kdaj govor postane nenaraven. 

»Kar koli je bilo upočasnjeno za 10 % ali pospešeno za 20 %, je praviloma še vedno zvenelo naravno,« je povedal Mistratov. Izven tega razpona je govor postal preveč popačen. 

Prejšnji sistemi so se na podlagi tega merila odrezali slabo. Odvisno od jezika je le 40% do 60% segmentov spadalo v sprejemljivo časovno okno tempa. S prenovljenim cevovodom se je ta delež glede na jezik povečal z 40–60 % na 73–83 %.

Ekipa je pomensko zvestobo ocenila tudi z ločeno oceno modela v vlogi ocenjevalnika na lestvici od 1 (»popolnoma drugačno«) do 5 (»semantično enakovredno«).  Pri sinhronizaciji so se odločili sprejeti nižji semantični prag kot pri prevajanju samo podnapisov, kjer omejitve trajanja niso pomembne. Tudi ob tem kompromisu je bilo 85,5 % segmentov glede ohranjanja pomena ocenjenih s 4 ali 5 od 5.

Nastali sistem je lahko z merljivo zanesljivostjo uravnotežil dve konkurenčni omejitvi: časovno usklajenost in pomen. Ker sta bili obe metriki avtomatizirani, lahko Descript nove izdaje modelov in različice pozivov neprekinjeno vrednoti glede na iste primerjalne preizkuse.

Omogočanje lokalizacije videov v velikem obsegu

Ker se prevajanje širi s posameznih videov na obsežne knjižnice vsebin, Descript v način prilagajanja prevodov uvaja več nadzora, tudi možnost, da se po potrebi večji poudarek nameni pomenski zvestobi.

Prevajanje v Descriptu je le ena plast širšega večmodalnega sistema. Prevedeno besedilo se uporabi za tvorjenje govora, ta pa nato usmerja usklajevanje gibanja ustnic in končno ustvarjanje videa. 

Izboljšave na ravni besedila omogočajo naraven tempo govora, vendar je celotna izkušnja odvisna tudi od tega, kako dobro zvočni model ohranja ton, ritem in nebesedne prvine govora. Ekipa v tem vidi naslednje področje napredka. 

»Velik del izboljšav pri rezultatih prevajanja bo izhajal iz tega, da bo cevovod postal bolj večmodalen: pri odločanju o prevodu bo skupaj upošteval zvok, video in besedilo,« je povedal Mistratov. »Tako bi se morale bolje ohraniti nebesedne prvine govora, kot sta ton in poudarek, ter še več izvirnega načina podaje.«

Za Descript so zmogljivejši modeli sklepanja omogočili, da je zapletenost sinhronizacije postala obvladljiva. Ko so modeli dosegli raven, na kateri so lahko zanesljivo uravnotežili razmerje med tempom govora in pomenom, je prevajanje postalo nekaj, kar je ekipa lahko sistematično izboljševala in uvajala v velikem obsegu.