Preskočite na glavni sadržaj
OpenAI

6. mart 2026.

Startup

Kako Descript razvija višejez. sinh. videozapisa u velikom obimu

Korištenjem OpenAI modela rezonovanja, Descript je omogućio automatsku lokalizaciju velikih biblioteka sadržaja bez gubitka vremena ili značenja.

Descript logo i oznaka preko ružičaste i ljubičaste apstraktne pozadine sa valnim oblikom.
Veličina kompanije: Startup
Regija: Sjeverna Amerika
Industrija: Tehnologija
Proizvodi: API

Rezultati

43

Poboljšanje procentnih poena u pridržavanju trajanja uz OpenAI

Rezultati

15%

Povećanje izvoza sa sinhronizacijom nakon uvođenja

Učitavanje…

Descript(otvara se u novom prozoru) je UI-nativni video editor izgrađen oko jednostavne ideje: ako možete uređivati tekst, trebali biste moći uređivati video. Od ranih dana Descripta, umjetna inteligencija je pokretala svaki aspekt proizvoda: transkripciju, uređivanje, čišćenje zvuka i sve složenije kreativne tokove rada. Godinama su gradili na OpenAI-u, koristeći Whisper za transkripciju i modele iz serije GPT unutar svog ko-uređivača Underlord. 

Prevođenje se brzo pojavilo kao slučaj upotrebe sa velikim uticajem. Tradicionalno, prevođenje videa je bilo sporo i skupo, zahtijevajući jezičke stručnjake da upravljaju projektima, izrađuju rutinske prijevode, provode kontrolu kvaliteta i generiraju odgovarajući audio. LLM-ovi dramatično sažimaju taj tok rada, čineći prevođenje visokog kvaliteta u velikom obimu mogućim.

Titlovi i sinhronizacija oba zahtijevaju semantičku vjernost: prevod mora očuvati izvorno značenje. Ali pridržavanje trajanja ima drugačiju ulogu u svakom od njih. Za natpise, to je korisno imati. Za sinhronizaciju je to ključno, jer ako prevedeni govor traje predugo ili prekratko, zvučat će neprirodno čak i ako je značenje ispravno.

Kako bi to riješio, Descript je redizajnirao svoj prevodilački cjevovod koristeći OpenAI modele rezonovanja kako bi optimizirao semantičku vjernost i pridržavanje trajanja tokom generisanja, a ne nakon toga. U prvih 30 dana nakon uvođenja, izvoz prevedenih videa sa sinhronizacijom porastao je za 15%, a pridržavanje trajanja poboljšalo se za 13 do 43 procentna poena, ovisno o jeziku.

„Sinhronizacija je sve popularniji slučaj upotrebe za Descript, pa gradimo načine da se to radi u serijama za kompanije koje žele prevesti i uskladiti pokrete usana za čitave biblioteke,“ rekla je Laura Burkhauser, izvršna direktorica.

Gdje je sinhronizacija počela da se raspada

Prevođenje je bila jedna od Descriptovih najranijih i najtraženijih funkcija. Počeli su s prevođenjem samo titlova, što je dobro funkcionisalo—ali mnogi korisnici su željeli ići dalje i imati govorni audio (sinhronizaciju) na ciljnom jeziku.

Međutim, jedan problem se stalno pojavljivao: sinhronizovani audio nije uvijek zvučao ispravno. „Vjerovatno prva pritužba koju smo čuli bila je da je tempo govora bio neprirodan na prevedenom jeziku“, rekao je Aleks Mistratov, voditelj UI proizvoda u Descript.

Problem se sveo na činjenicu da različitim jezicima treba različito vremena da izraze istu ideju. Descript je, na primjer, primijetio da je u prosjeku njemački “duži” jezik od engleskog. Da bi se uklopio u fiksne video segmente, prevedeni govor je često morao biti umjetno ubrzan ili usporen. “Završili biste s nečim što je zvučalo kao vjeverice, ili pospani div,” objasnio je Mistratov.

Engleski:

Njemački:

“Please review the safety guidelines before operating the machine.” „(Molimo vas da pregledate sigurnosne smjernice prije rukovanja mašinom).”

Slogovi: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.” „(Molimo provjerite sigurnosne smjernice prije nego što rukujete mašinom.)”

Slogovi: 24 (povećanje od 40%)

U ovom slučaju, njemački audio bi ili morao biti neprirodno ubrzan, ili bi se prevod morao prepisati kako bi se uklopio u vremenski budžet.

Korisnicima su bile dostupne dvije opcije: ručno uskladiti audio segment po segment, ili prepraviti prevod kako bi odgovarao. Oba pristupa zahtijevala su značajne izmjene vremenske linije i, često, gotovo izvorno poznavanje ciljnog jezika. Bilo je zamorno za kreatore i predstavljalo je prepreku za skaliranje funkcije na velike projekte lokalizacije za preduzeća.

Optimizacija prijevoda za vremensko usklađivanje, a ne samo značenje

Tim je imao jasnu teoriju o tome šta je potrebno da sinhronizacija funkcioniše. Sistem bi morao ne samo optimizirati semantičko značenje, već i uzeti u obzir vremenska ograničenja. Kada se prevodi s engleskog na njemački, model bi morao razumjeti kako koristiti manje riječi ili pojednostaviti koncept, kako bi sinhronizovani audio zvučao prirodno.

Raniji pristupi su prvo optimizirali semantičku vjernost i pokušavali ispraviti tajming nakon toga. Prijevodi su često bili semantički ispravni, ali su rutinski promašivali ograničenja trajanja, a ukupni kvalitet i dalje nije bio dovoljno dobar. 

„Proveli smo inkrementalne testove, čak nismo ni generisali ništa, samo smo tražili od modela da ispiše broj slogova u dijelu teksta,“ rekao je Mistratov. „Raniji modeli jednostavno nisu bili dobri u tome.“

Ispostavilo se da je pouzdano brojanje slogova kritično. Ako model nije mogao dosljedno brojati slogove, nije mogao pouzdano ciljati određeni vremenski okvir.

Modeli iz serije GPT‑5 donijeli su nivo dosljednosti u rezonovanju koji ranijim modelima nije bio dostupan, posebno na zadacima poput brojanja slogova i praćenja ograničenja. S tim poboljšanjem, Descript je redizajnirao svoj proces za prevođenje i sinhronizaciju.

Prvo, Descriptov sistem razbija transkript u dijelove, vođen granicama rečenica, prirodnim pauzama i obrascima govora u originalnom snimku. Svaki segment održava semantički kontinuitet, ali je dovoljno mali da se o njemu može rezonovati kao o vremenskoj jedinici.

Odatle, model izračunava broj slogova u dijelu. Koristeći pretpostavke o brzini govora specifične za jezik, sistem procjenjuje koliko slogova bi prevedeni segment trebao ciljati kako bi se očuvao prirodan tempo (“pridržavanje trajanja”). Upit traži od modela da optimizira i za pridržavanje trajanja i za očuvanje značenja. Okolni dijelovi se prosljeđuju kao kontekst kako bi model održao semantičku koherentnost kroz segmente.

Tim je evaluirao više konfiguracija kako bi se uravnotežilo pridržavanje trajanja, semantička vjernost, latencija i trošak. Odabrana postavka pružila je snažno pridržavanje ograničenja pri brzini na nivou produkcije, omogućavajući prevođenje velikog obima bez ručnog ponovnog tempiranja. Rezultat je prevodilački pipeline u kojem se tempo tretira kao varijabla prvog reda, umjesto kao nešto što se ispravlja naknadno.

Definiranje i mjerenje prirodnog tempa

Kako bi razvili kriterije prihvatanja za evaluacije, tim je proveo testove slušanja: generirali su prevedene audio uzorke i prilagođavali brzinu reprodukcije u malim koracima, tražeći od korisnika da ocijene kada je govor postao neprirodan. 

„Sve što je bilo usporeno za 10%, ili ubrzano za 20%, uglavnom je i dalje zvučalo prirodno“, rekao je Mistratov. Izvan ovog raspona, govor je postao previše izobličen. 

Raniji sistemi su loše radili prema toj mjeri. Ovisno o jeziku, samo 40% do 60% segmenata bilo je u prihvatljivom rasponu tempa. S redizajniranim pipelineom, taj broj je porastao s 40%–60% na između 73% i 83%, ovisno o jeziku.

Tim je, takođe, procijenio semantičku vjernost koristeći zasebnu ocjenu modela-kao-sudije na skali od 1 ('potpuno drugačije') do 5 ('semantički ekvivalentno').  Za sinkronizaciju su odlučili prihvatiti niži semantički prag nego za prijevod samo titlova, gdje ograničenja trajanja nisu relevantna. Čak i uz taj kompromis, 85,5% segmenata je ocijenjeno sa četiri ili pet od pet za semantičku usklađenost.

Rezultat je bio sistem koji je mogao uravnotežiti dva konkurentna ograničenja—vremensko usklađivanje i značenje—uz mjerljivo samopouzdanje. A budući da su obje metrike bile automatizirane, Descript je u mogućnosti kontinuirano evaluirati nova izdanja modela i varijacije upita u odnosu na ista mjerila.

Otključavanje lokalizacije velikih videozapisa

Kako se prevođenje pomjera sa pojedinačnih videa na velike biblioteke sadržaja, Descript uvodi više kontrole u način podešavanja prevoda, uključujući mogućnost davanja prednosti strožijoj semantičkoj vjernosti kada je to potrebno.

Prevod unutar Descripta je samo jedan sloj šireg višemodalnog sistema. Prevedeni tekst se koristi za generisanje govora, što zatim pokreće sinhronizaciju usana i konačno renderovanje video zapisa. 

Poboljšanja na tekstualnom sloju omogućavaju prirodan tempo, ali ukupno iskustvo, takođe, zavisi od toga koliko dobro audio model očuva ton, kadencu i neverbalne karakteristike govora. Tu tim vidi sljedeću granicu. 

„Mnogo toga što će poboljšati rezultate prevođenja jeste da se proces učini multimodalnijim: uključivanjem zvuka, videa i teksta zajedno pri odlučivanju kako prevesti“, rekao je Mistratov. „To bi trebalo bolje održavati neverbalne karakteristike govora, poput tona i naglaska, i sačuvati još više originalne izvedbe.“

Za Descript, snažniji modeli rezonovanja učinili su složenost sinhronizacije izvodljivom. Prelaskom praga na kojem su modeli mogli pouzdano balansirati kompromise između tempa i značenja, prevođenje je postalo nešto što je tim mogao sistematski poboljšavati i implementirati u velikom obimu.