Preskočite na glavni sadržaj
OpenAI

6. ožujka 2026.

Startup

Kako Descript izvodi opširnu višejezičnu sinkronizaciju videa

Korištenjem OpenAI modela za rasuđivanje, Descript je omogućio automatsku lokalizaciju velikih biblioteka sadržaja bez gubitka vremenskog usklađivanja ili značenja.

Descript logotip i naziv na ružičastoj i ljubičastoj apstraktnoj pozadini s valnim oblikom.
Veličina tvrtke: Startup
Regija: Sjeverna Amerika
Industrija: Tehnologija
Proizvodi: API

Rezultati

43

Poboljšanje pridržavanja trajanja u postotnim bodovima uz OpenAI

Rezultati

15 %

Povećanje izvoza sinkroniziranih sadržaja nakon uvođenja

Učitavanje…

Descript(otvara se u novom prozoru) je alat za uređivanje videozapisa temeljen na umjetnoj inteligenciji koji je izgrađen oko jednostavne ideje: ako možete uređivati tekst, trebali biste moći uređivati i videozapis. Od Descriptovih početaka, umjetna inteligencija pokreće svaki aspekt proizvoda: transkripciju, uređivanje, čišćenje zvuka i sve složenije kreativne tijekove rada. Godinama su gradili na OpenAI-ju i upotrebljavali model Whisper za transkripciju i modele iz serije GPT unutar svojeg istovjetnog alata Underlord. 

Prevođenje se brzo nametnulo kao slučaj uporabe s velikim utjecajem. Tradicionalno, prijevod videozapisa je spor i skup, zahtijeva jezične stručnjake za upravljanje projektima, izradu rutinskih prijevoda, kontrolu kvalitete i generiranje odgovarajućeg zvuka. LLM-ovi dramatično smanjuju taj radni tijek, čime prevođenje visoke kvalitete u velikom opsegu postaje moguće.

Titlovi i sinkronizacija zahtijevaju semantičku vjernost: prijevod mora očuvati izvorno značenje. No pridržavanje trajanja ima drugačiju ulogu u svakom od njih. Za titlove to nije nužno, ali je poželjno. Za sinkronizaciju je to ključno jer ako prevedeni govor traje predugo ili prekratko, zvučat će neprirodno čak i ako je značenje točno.

Kako bi to riješio, Descript je redizajnirao svoj prevoditeljski proces pomoću OpenAI modela za rasuđivanje kako bi optimizirao semantičku vjernost i za održavanje trajanja tijekom generiranja, a ne nakon njega. U prvih 30 dana nakon uvođenja, izvoz prevedenih videozapisa sa sinkronizacijom povećao se za 15 %, a održavanje trajanja poboljšalo se za 13 do 43 postotna boda, ovisno o jeziku.

„Sinkronizacija je sve popularniji slučaj upotrebe za Descript, pa razvijamo načine za skupno prevođenje i sinkronizaciju cijelih biblioteka za tvrtke koje to žele,” rekla je Laura Burkhauser, izvršna direktorica.

Gdje je sinkronizacija počela propadati

Prijevod je bio jedna od Descriptovih najranijih i najtraženijih značajki. Počeli su s samo s prijevodom titlova, što je dobro funkcioniralo — no mnogi su korisnici željeli korak dalje i imati govoreni tekst (sinkronizaciju) na ciljnom jeziku.

No jedan se problem stalno ponavljao: sinkronizirani zvuk nije uvijek zvučao kako treba. „Vjerojatno pritužba broj jedan koju smo čuli jest da je brzina govora bila neprirodna u prevedenom jeziku”, rekao je Aleks Mistratov, voditelj AI proizvoda u tvrtki Descript.

Problem se sveo na činjenicu da različitim jezicima treba različito vrijeme da izraze istu ideju. Descript je na primjer primijetio da se u njemačkom jeziku u prosjeku upotrebljava više riječi od engleskog. Kako bi se uklopio u fiksne segmente videozapisa, prevedeni govor često se morao umjetno ubrzati ili usporiti. „Na kraju biste imali nešto što bi zvučalo kao vjeverice ili pospani div”, objasnio je Mistratov.

Engleski:

Njemački:

„Molimo pregledajte sigurnosne smjernice prije rukovanja strojem.”

Slogovi: 18

„Molimo provjerite sigurnosne smjernice prije nego što rukujete strojem.“

Slogovi: 24 (povećanje od 40 %)

U tom slučaju njemački zvuk morao bi se ili neprirodno ubrzati ili bi prijevod trebalo prepraviti kako bi se uklopio u vremensko ograničenje.

Korisnicima su preostale dvije mogućnosti: ručno ponovno uskladiti zvuk segment po segment ili prepraviti prijevod kako bi odgovarao. Oba pristupa zahtijevala su značajne izmjene vremenskog rasporeda i često gotovo izvrsnu tečnost u ciljnom jeziku. To je bilo zamorno za kreatore i postalo je prepreka za skaliranje značajke na velike lokalizacijske projekte u poduzećima.

Optimiziranje prijevoda za tajmiranje, a ne samo značenje

Tim je imao jasnu teoriju o tome što bi bilo potrebno da sinkronizacija uspije. Sustav bi se morao ne samo optimizirati za semantičko značenje već i biti svjestan vremenskih ograničenja. Primjerice, pri prevođenju s engleskog na njemački, model bi morao razumjeti kako upotrijebiti manje riječi ili pojednostaviti koncept, kako bi sinkronizirani zvuk ostao prirodan.

Raniji pristupi prvo su optimizirali semantičku vjernost i pokušavali naknadno ispraviti tajmiranje. Prijevodi su često bili semantički ispravni, ali su redovito prelazili ograničenja trajanja, a ukupna kvaliteta i dalje nije bila dovoljno dobra. 

„Proveli smo inkrementalna testiranja, čak nismo ništa ni generirali, samo smo tražili od modela da ispiše broj slogova u dijelu teksta“, rekao je Mistratov. „Raniji modeli jednostavno nisu bili dobri u tome.“

Pouzdano brojanje slogova pokazalo se ključnim. Ako model nije mogao dosljedno izračunavati slogove, nije mogao pouzdano ciljati određeni vremenski raspon trajanja.

Modeli iz serije GPT‑5 donijeli su razinu dosljednosti u rasuđivanju koja je nedostajala ranijim modelima, osobito na zadacima poput brojanja slogova i praćenja ograničenja. S tim poboljšanjem, Descript je redizajnirao svoj proces prevođenja i sinkronizacije.

Prvo, Descriptov sustav razbija transkript na dijelove, vodi se granicama rečenica, prirodnim stankama i obrascima govora u izvornoj snimci. Svaki segment održava semantički kontinuitet, ali je dovoljno malen da se o njemu može prosuđivati kao o vremenskoj jedinici.

Nakon toga, model izračunava broj slogova u dijelu. Koristeći pretpostavke o brzini govora specifične za jezik, sustav procjenjuje na koliko bi slogova prevedeni segment trebao ciljati kako bi se očuvao prirodnu brzinu govora („pridržavanje trajanja”). Upit traži od modela da optimizira i pridržavanje trajanja i očuvanje značenja. Okolni dijelovi prosljeđuju se kao kontekst kako bi model održao semantičku koherentnost kroz segmente.

Tim je procijenio više konfiguracija kako bi uskladio pridržavanje trajanja, semantičku vjernost, latenciju i trošak. Odabrana konfiguracija omogućila je snažno pridržavanje ograničenja pri produkcijskoj brzini, omogućujući prevođenje velikog obujma bez ručnog ponovnog tempiranja. Rezultat je prevoditeljski cjevovod u kojem se brzina govora tretira kao ključna varijabla, a ne kao nešto što se ispravlja naknadno.

Definiranje i mjerenje prirodne brzine govora

Kako bi razvili kriterije prihvaćanja za evals, tim je proveo testove slušanja: generirali su prevedene audio uzorke i prilagođavali brzinu reprodukcije u malim koracima i pri tome od korisnika tražili da ocijene kada je govor postao neprirodan. 

„Sve što je bilo usporeno za 10 % ili ubrzano za 20 %, u većini je slučajeva i dalje zvučalo prirodno”, rekao je Mistratov. Izvan tog raspona, govor je postao previše izobličen. 

Raniji sustavi su slabo funkcionirali prema toj mjeri. Ovisno o jeziku, samo 40% do 60% segmenata bilo je unutar prihvatljivog raspona brzine govora. S redizajniranim cjevovodom, taj se broj povećao s 40 % – 60 % na 73 % do 83 %, ovisno o jeziku.

Tim je također procijenio semantičku vjernost koristeći zasebnu ocjenu modela-kao-suca na ljestvici od 1 („potpuno različito”) do 5 („semantički ekvivalentno“).  Za sinkronizaciju su odlučili prihvatiti niži prag semantičke usklađenosti nego za puki prijevod titlova, gdje ograničenja trajanja nisu relevantna. Čak i uz taj kompromis, 85,5 % segmenata ocijenjeno je s četiri ili pet od pet za semantičku usklađenost.

Rezultat je bio sustav koji je mogao uskladiti dva suprotstavljena ograničenja — vrijeme i značenje — s mjerljivom sigurnošću. Budući da su obje metrike automatizirane, Descript može kontinuirano procjenjivati nova izdanja modela i varijacije upita prema istim mjerilima.

Otključavanje lokalizacije videozapisa velikog opsega

Kako se prijevod pomiče s pojedinačnih videozapisa na velike biblioteke sadržaja, Descript uvodi veću kontrolu u prilagodbu prijevoda, uključujući mogućnost davanja prednosti strožoj semantičkoj vjernosti kada je to potrebno.

Prijevod unutar opisa samo je jedan sloj šireg višemodalnog sustava. Prevedeni tekst ulazi u generiranje govora, koje zatim pokreće sinkronizaciju usana i konačno renderiranje videozapisa. 

Poboljšanja na sloju teksta omogućuju prirodan tempo, ali cjelokupno iskustvo također ovisi o tome koliko dobro audio model očuva ton, kadencu i neverbalne karakteristike govora. Tu tim vidi sljedeći izazov. 

„Mnogo toga što će poboljšati izlaz prijevoda jest činjenje postupka multimodalnijim: uključivanje zvuka, videozapisa i teksta zajedno pri odlučivanju o prijevodu”, rekao je Mistratov. „To bi trebalo bolje održati neverbalne karakteristike govora, poput tona i naglaska, i očuvati još više izvorne izvedbe.”

Za Descript, snažniji modeli za rasuđivanje učinili su složenost sinkronizacije izvedivom. Prelaskom praga na kojem su modeli mogli pouzdano uravnotežiti kompromise između tempa i značenja, prevođenje je postalo nešto što je tim mogao sustavno poboljšavati i primjenjivati u velikom opsegu.