Paano napapalawak ng Descript ang multilingual video dubbing
Gamit ang mga nangangatwirang modelo ng OpenAI, na-unlock ng Descript ang awtomatikong lokalisasyon ng malalaking content library nang hindi nawawala ang timing o kahulugan.

Mga resulta
43
Pag-angat ng porsyento sa pagsunod sa itinakdang tagal gamit ang OpenAI
Mga resulta
15%
Pagtaas ng mga dubbed export pagkatapos ng paglunsad
Ang Descript(magbubukas sa bagong window) ay isang AI-native na video editor na binuo sa simpleng ideya: kung kaya mong mag-edit ng teksto, dapat kaya mo ring mag-edit ng video. Mula pa noong mga unang araw ng Descript, pinapagana ng AI ang bawat aspeto ng produkto: transkripsyon, pag-edit, paglilinis ng audio, at mas lalo pang kumplikadong mga malikhaing workflow. Ilang taon na silang bumubuo gamit ang OpenAI, gamit ang Whisper para sa transkripsyon at mga modelo ng serye ng GPT sa loob ng kanilang co-editor na Underlord.
Mabilis na lumitaw ang pagsasalin bilang use case na may mataas na epekto. Tradisyonal, naging mabagal at magastos ang pagsasalin ng video, na nangangailangan ng mga eksperto sa wika para pamahalaan ang mga proyekto, gumawa ng mga paulit-ulit na pagsasalin, pangasiwaan ang quality control, at bumuo ng katumbas na audio. Lubhang pinaiikli ng mga LLM ang workflow na iyon, kaya nagiging posible ang de-kalidad na pagsasalin sa malakihang saklaw.
Ang mga caption at dubbing ay parehong nangangailangan ng semantikong katapatan: dapat mapanatili ng pagsasalin ang orihinal na kahulugan. Pero gumaganap ng ibang papel ang pagsunod sa tagal sa bawat isa. Para sa mga caption, magandang magkaroon nito. Para sa dubbing, kritikal ito, dahil kung masyadong mahaba o masyadong maikli ang takbo ng isinaling pananalita, magiging hindi natural ang tunog nito kahit tama ang kahulugan.
Para matugunan ito, muling idinisenyo ng Descript ang pipeline nito sa pagsasalin gamit ang mga nangangatwirang modelo ng OpenAI para i-optimize ang semantikong katapatan at pagsunod sa tagal sa panahon ng pagbuo, hindi pagkatapos. Sa unang 30 araw pagkatapos ng rollout, tumaas ng 15% ang mga export ng mga isinaling video na may dubbing, at bumuti ang pagsunod sa tagal ng 13 hanggang 43 percentage points, depende sa wika.
“Lalong nagiging popular na paggamit ng Descript ang dubbing, kaya gumagawa kami ng mga paraan para magawa ito nang maramihan para sa mga kumpanyang gustong isalin at i-lip-sync ang buong library ng mga video,” sabi ni CEO Laura Burkhauser.
Ang pagsasalin ay isa sa pinakamaaga at pinaka-hinihiling na feature ng Descript. Nagsimula sila sa pagsasalin na may mga caption lang, na naging maayos naman—pero maraming user ang gustong magpatuloy pa at nakapagsalita ng audio (dubbing) sa target na wika.
Gayunpaman, may isyu na patuloy na lumilitaw: hindi laging tama ang tunog ng dubbed audio. “Marahil ang pinakamadalas na reklamo na narinig namin ay hindi natural ang bilis ng pagsasalita sa isinaling wika,” sabi ni Aleks Mistratov, Head of AI Product sa Descript.
Ang problema ay nagmumula sa katotohanang magkakaiba ang oras na kailangan ng bawat wika para maipahayag ang parehong ideya. Halimbawa, naobserbahan ni Descript na sa karaniwan, "mas mahabang" wika ang German kaysa sa English. Para magkasya sa mga nakapirming bahagi ng video, kadalasang kailangang artipisyal na bilisan o pabagalin ang mga isinalin na salita. “Magiging parang mga chipmunk ang tunog nito, o antok na higante,” paliwanag ni Mistratov.
English: | German: |
“Pakisuri ang mga gabay sa kaligtasan bago patakbuhin ang makina.” Mga pantig: 18 | “Pakisuri ang mga patakaran sa kaligtasan bago patakbuhin ang makina.” Mga pantig: 24 (40% pagtaas) |
Sa kasong ito, maaaring pabilisin nang hindi natural ang German na audio, o muling isulat ang salin para magkasya sa itinakdang oras.
Naiwan ang mga user na may dalawang opsyon: manu-manong i-retime ang audio segment kada segment, o muling isulat ang mismong pagsasalin parag magkasya ito. Nangangailangan ang parehong pamamaraan ng masusing pag-edit sa timeline at, kadalasan, halos native na kasanayan sa target na wika. Nakakapagod ito para sa mga creator, at naging hadlang sa pagpapalawak ng feature sa malalaking proyektong lokalisasyon na pang-enterprise.
May malinaw na teorya ang team kung ano ang kakailanganin para gumana ang pagda-dub. Kakailanganin ng system na hindi lang i-optimize para sa semantikong kahulugan, kundi maging may kamalayan din sa mga hadlang sa oras. Kapag nagsasalin mula sa English patungong German, halimbawa, kailangang maunawaan ng modelo kung paano gumamit ng mas kaunting salita o pasimplehin ang konsepto para manatiling natural ang na-dub na audio.
Inuna ng mga naunang pamamaraan ang pag-optimize ng semantikong katapatan at sinubukang itama ang timing pagkatapos. Kadalasang tama ang semantika ng mga pagsasalin, ngunit palagi nilang hindi nasusunod ang mga limitasyon sa tagal, at hindi pa rin sapat ang pangkalahatang kalidad.
“Nagsagawa kami ng mga incremental na pagsubok, hindi man lang nakabuo ng kahit ano, hinihiling lang namin sa modelo na i-output ang bilang ng mga pantig sa tipak ng text," sabi ni Mistratov. “Hindi talaga magaling diyan ang mga naunang modelo.”
Mahalaga ang maaasahang pagbibilang ng pantig. Kung hindi kayang tuluy-tuloy na kalkulahin ng modelo ang mga pantig, hindi nito mapagkakatiwalaang mata-target ang partikular na window ng tagal.
Naghatid ang mga modelong GPT‑5 series ng mas pare-parehong kakayahan sa pangangatwiran na kulang sa mga naunang modelo, lalo na sa mga gawain tulad ng pagbibilang ng pantig at pagsubaybay sa mga constraint. Sa pagpapabuting iyon, muling idinisenyo ng Descript ang pipeline nito para sa pagsasalin at pagda-dub.
Una, hinahati ng sytem ng Descript ang transcript sa mga chunk, na ginagabayan ng mga hangganan ng pangungusap, natural na paghinto, at mga pattern ng pagsasalita sa orihinal na recording. Pinapanatili nng bawat chunk ang semantikong pagpapatuloy, pero maliit para mapag-isipan bilang timing unit.
Mula roon, kinakalkula ng modelo ang bilang ng mga pantig sa bahagi. Gamit ang mga palagay na partikular sa wika tungkol sa bilis ng pagsasalita, tinatantiya ng system kung ilang pantig ang dapat targetin ng isinaling chunk para mapanatili ang natural na pacing (“duration adherence”). Hinihiling ng prompt sa modelo na i-optimize para sa parehong pagsunod sa tagal at pagpapanatili ng kahulugan. Ipinapasa ang mga nakapaligid na chunk bilang konteksto upang mapanatili ng modelo ang pagkakaugnay-ugnay ng kahulugan sa mga segment.
Sinuri ng team ang maraming configuration upang mabalanse ang pagsunod sa tagal, semantic fidelity, latency, at gastos. Ang napiling setup ay naghatid ng mahusay na pagsunod sa mga limitasyon sa bilis na pang-produksyon, na nagbibigay-daan sa mataas na dami ng pagsasalin nang walang manu-manong retiming. Ang resulta ay translation pipeline kung saan itinuturing na pangunahing salik ang pacing, hindi na lang inaayos pagkatapos.
Para ma-develop ang mga pamantayan sa pagtanggap para sa mga eval, nagsagawa ang team ng mga listening test: bumuo sila ng mga isinaling sample ng audio at in-adjust ang bilis ng playback sa maliliit na pagtaas, at hiniling sa mga user na i-rate kung kailan naging hindi natural ang pagsasalita.
“Anumang bagay na pinabagal ng 10%, o pinabilis ng 20%, sa pangkalahatan ay natural pa rin ang tunog," sabi ni Mistratov. Higit pa sa saklaw na ito, masyadong naging baluktot ang pananalita.
Hindi maganda ang naging resulta ng mga naunang system ayon sa panukat na iyon. Depende sa wika, 40% hanggang 60% lang ng mga segment ang pasok sa katanggap-tanggap na pacing window. Sa muling idinisenyong pipeline, tumaas ang bilang na iyon mula 40%–60% hanggang sa pagitan ng 73% at 83%, depende sa wika.
Sinuri rin ng team ang semantic fidelity gamit ang hiwalay na model-as-judge na pag-rate sa scale na 1 (“lubusang magkaiba”) hanggang 5 (“magkapareho ang kahulugan”). Para sa dubbing, nagpasya silang tumanggap ng mas mababang semantikong threshold kaysa sa para sa caption-only na pagsasalin, kung saan hindi mahalaga ang mga limitasyon sa tagal. Kahit na may ganoong tradeoff, 85.5% ng mga segment ang na-rate na apat o lima sa lima para sa semantic adherence.
Ang resulta ay system na puwedeng magbalanse ng dalawang nagtutunggaling hadlang—tiyempo at kahulugan—nang may masusukat na kumpiyansa. At dahil naka-automate ang parehong sukatan, nagagawa ng Descript na patuloy na suriin ang mga bagong release ng modelo at mga variation ng prompt laban sa parehong mga benchmark.
Habang lumilipat ang pagsasalin mula sa mga iisang video patungo sa malalaking content library, nagkakaroon ng higit na kontrol ang Descript sa kung paano inaayos ang mga pagsasalin, kabilang ang kakayahang unahin ang mas mahigpit na semantic fidelity kung kinakailangan.
Ang pagsasalin sa loob ng Descript ay isang layer lang ng mas malawak na multimodal na system. Ang isinaling text ay ipinapasok sa speech generation, na siya namang ginagamit para sa lip sync at pinal na pag-render ng video.
Ginagawang posible ng mga pagpapahusay sa layer ng text ang natural na pacing, pero nakadepende rin ang pangkalahatang karanasan sa kung gaano kahusay napapanatili ng modelo ng audio ang tono, cadence, at mga di-berbal na katangian ng pananalita. Doon nakikita ng team ang susunod na frontier.
“Marami sa mga magpapabuti sa output ng pagsasalin ay ang paggawa ng pipeline na mas multimodal: pagsasama-sama ng audio, video, at teksto kapag nagpapasya kung paano isasalin,” sabi ni Mistratov. “Mas makakatulong iyon na mapanatili ang mga di-berbal na katangian ng pagsasalita, tulad ng tono at diin, at mapanatili pa ang mas marami sa orihinal na paghahatid.”
Para sa Descript, ginawa ng mas malalakas na mga nangangatwirang modelo na maging mas madaling pamahalaan ang kumplikadong proseso ng dubbing. Sa pamamagitan ng pagtawid sa hangganan kung saan maaasahang mababalanse ng mga modelo ang mga kompromiso sa pagitan ng bilis at kahulugan, naging bagay na sistematikong mapapabuti ng team ang pagsasalin, at mailalapat nang malawakan.


