Liwati menyang isi utama
OpenAI

6 Maret 2026

Startup

Kepiye Descript ngrancang dubbing video multibasa ing skala gedhe

Kanthi nggunakake modhèl penalaran OpenAI, Descript mbukak kemampuan lokalisasi otomatis kanggo koleksi kontèn gedhé tanpa kelangan ketepatan wektu utawa makna.

Logo Descript lan tandha tembung ing ndhuwur latar mburi gelombang abstrak jambon lan ungu.
Ukuran perusahaan: Startup
Wilayah: Amerika Lor
Industri: Teknologi
Produk: API

Asil

43

Peningkatan poin persentase ing kepatuhan durasi karo OpenAI

Asil

15%

Mundhake ekspor sing wis disulih swara sawisé peluncuran

Lagi dimuat…

Descript(mbukak ing jendhela anyar) yaiku editor video AI-native sing dibangun adhedhasar gagasan prasaja: yen bisa nyunting teks, kudu bisa nyunting video. Wiwit awal Descript, AI wis dadi penggerak saben aspek produk: transkripsi, panyuntingan, ngresiki audio, lan alur kerja kreatif sing saya kompleks. Dheweke wis pirang-pirang taun mbangun adhedhasar OpenAI, nggunakake Whisper kanggo transkripsi lan model seri GPT ing editor bebarengan duweke, Underlord. 

Penerjemahan kanthi cepet muncul minangka kasus panggunaan sing nduwèni pangaruh gedhé. Sacara tradhisional, nerjemahake video kuwi proses sing alon lan larang, amarga mbutuhake ahli basa kanggo ngatur proyek, nggawe terjemahan sing sifaté mekanis, nangani kontrol mutu, lan ngasilake audio sing cocog. LLMs nyederhanakake alur kerja kasebut kanthi drastis, saéngga terjemahan kualitas dhuwur ing skala gedhé bisa diwujudaké.

Teks katrangan lan dubbing loro-lorone mbutuhake kasetyan semantik: terjemahan kudu njaga teges asline. Nanging, kepatuhan marang durasi nduweni peran sing beda ing saben-sabené. Kanggo teks katrangan, kuwi becik yen ana. Kanggo dubbing, iki wigati banget, amarga yen tuturan sing diterjemahaké durasiné dawa banget utawa cendhak banget, bakal keprungu ora alami sanajan tegesé bener.

Kanggo ngatasi perkara iki, Descript ngrancang ulang alur kerja terjemahane nganggo model penalaran OpenAI kanggo ngoptimalake kasetyan semantik lan kepatuhan marang durasi sajrone proses generasi, dudu sawisé rampung. Sajrone 30 dina pisanan sawise peluncuran, ekspor video terjemahan sing nganggo dubbing mundhak 15%, lan kepatuhan marang durasi saya tambah apik 13 nganti 43 poin persentase, gumantung marang basane.

“Dubbing dadi kasus panggunaan sing saya populer kanggo Descript, mula kita lagi mbangun cara supaya bisa ditindakake kanthi cara batch kanggo perusahaan sing pengin nerjemahake lan nyelarasake gerak lambe kanggo kabèh koleksi konten,” ujare Laura Burkhauser, CEO.

Ing endi dubbing wiwit ora lumaku kanthi becik

Terjemahan minangka salah siji fitur Descript sing paling awal lan paling akeh dijaluk. Dheweke miwiti nganggo terjemahan sing mung kanggo caption, sing asilé apik—nanging akeh pangguna kepengin luwih saka kuwi lan nduwèni audio wicara (dubbing) ing basa sasaran.

Nanging, ana siji masalah sing terus muncul: audio sulih swara ora mesthi keprungu pas. “Mbokmenawa keluhan nomer siji sing paling kerep dirungokake yaiku tempo wicara sing ora alami ing basa terjemahan,” ujare Aleks Mistratov, Kepala Produk AI ing Descript.

Pangkal masalahé yaiku basa-basa sing béda mbutuhaké wektu sing béda-béda kanggo ngandharaké gagasan sing padha. Descript nyathet, contone, manawa kanthi rata-rata basa Jerman iku basa sing luwih “dawa” tinimbang basa Inggris. Supaya pas karo segmen video sing wis ditemtokake, tuturan sing wis diterjemahake asring kudu dipercepat utawa diperlambat kanthi artifisial. “Pungkasane, bakal ana swara kaya bajing cilik, utawa raksasa sing ngantuk,” jlentrehe Mistratov.

Inggris:

Jerman:

“Mangga dipunwaos pandhuan kaslametan sadèrèngipun ngoperasèkaken mesin.”

Suku kata: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Suku kata: 24 (mundhak 40%)

Ing kahanan iki, audio basa Jerman kudu dicepetake nganti ora lumrah, utawa terjemahane kudu ditulis maneh supaya cocog karo watesan wektu.

Pangguna mung nduwé rong pilihan: ngatur maneh wektu audio kanthi manual saben segmen, utawa nulis ulang terjemahané dhéwé supaya pas. Kaloro pendekatan kasebut mbutuhake panyuntingan timeline sing jero lan, asring, kefasihan ing basa sasaran sing meh padha karo panutur asli. Iki njlimet lan mboseni kanggo para kreator, lan dadi pangalang kanggo nggedhekake skala fitur kasebut menyang proyek lokalisasi perusahaan gedhe.

Ngoptimalake terjemahan supaya pas wektune, ora mung maknane

Tim kasebut nduwèni téori sing cetha babagan apa sing dibutuhake supaya dubbing bisa kasil. Sistem kasebut ora mung kudu ngoptimalake makna semantik, nanging uga kudu nggatekake watesan wektu. Nalika nerjemahake saka basa Inggris menyang basa Jerman, umpamané, model kudu mangerteni carane nggunakake tembung sing luwih sithik utawa nyederhanakake konsep, supaya audio sulih swara tetep krasa alami.

Pendekatan sadurunge luwih dhisik ngoptimalake kasetyan semantik lan banjur nyoba mbenerake pewaktuan sawisé iku. Terjemahané kerep bener saka segi makna, nanging bola-bali ora netepi watesan durasi, lan kualitasé sakabèhé isih durung cukup apik. 

“Kita nindakake tes inkremental, malah ora nganti ngasilake apa-apa, mung njaluk model supaya ngetokake cacahing wanda ing sawijining potongan teks,” ujare Mistratov. “Model-model sadurungé pancèn ora pinter nindakake kuwi.”

Pangétungan wanda sing bisa diandelake pranyata krusial. Yèn model ora bisa ngétung wanda kanthi konsisten, model ora bisa kanthi andal nargetaké rentang durasi tartamtu.

Modhel-modhel seri GPT‑5 nggawa tingkat konsistensi penalaran sing ora diduweni modhel-modhel sadurunge, utamane ing tugas kaya ngitung wanda lan nglacak watesan. Kanthi paningkatan kasebut, Descript ngrancang ulang alur kerja penerjemahan lan dubbing-e.

Kaping pisan, sistem Descript mecah transkrip dadi potongan-potongan, kanthi dipandu dening wates ukara, jeda alami, lan pola wicara ing rekaman asli. Saben perangan njaga kesinambungan semantik, nanging ukurane cukup cilik kanggo dianalisis minangka unit wektu.

Saka kono, modhel ngetung cacahing wanda ing potongan kasebut. Kanthi nggunakake asumsi laju wicara sing mligi kanggo saben basa, sistem ngira-ngira pira wanda sing kudu ditargetake dening potongan terjemahan supaya tetep njaga irama alami (“pematuhan durasi”). Pituduh kasebut njaluk model supaya ngoptimalake loro-lorone: netepi durasi lan njaga makna. Perangan sakubengé diwènèhaké minangka konteks supaya model njaga koherensi semantik antarsegmen.

Tim kasebut ngevaluasi pirang-pirang konfigurasi kanggo ngimbangi kesesuaian durasi, kasetyan semantik, latensi, lan biaya. Setelan sing dipilih bisa njaga kepatuhan sing kuwat marang watesan ing kacepetan produksi, saéngga ndhukung terjemahan kanthi volume gedhé tanpa perlu ngatur ulang wektu kanthi manual. Asilé yaiku alur kerja terjemahan ing ngendi tempo dianggep minangka variabel utama, dudu mung perkara sing dibenerake sawisé prosesé rampung.

Nemtokake lan ngukur tempo alami

Kanggo nyusun kritéria panriman kanggo evaluasi, tim nindakake tes ngrungokaké: tim nggawé conto audio terjemahan lan nyetel kacepetan puter maneh sethithik-sethithik, banjur njaluk pangguna menehi rating kapan tuturan dadi ora alami. 

“Apa wae sing dilambatake 10%, utawa dicepetake 20%, umume isih keprungu alami,” ujare Mistratov. Ing njaba rentang iki, wicara dadi kakehan gangguan. 

Sistem-sistem sadurungé kinerjané kurang apik miturut ukuran kasebut. Gumantung saka basane, mung 40% nganti 60% segmen sing mlebu ing rentang pacing sing bisa ditampa. Kanthi pipeline sing wis didesain ulang, angka kasebut mundhak saka 40%–60% dadi antarane 73% lan 83%, gumantung marang basane.

Tim kasebut uga ngevaluasi kasetyan semantik nganggo skor panilaian model minangka juri sing kapisah, kanthi skala saka 1 (“beda babar pisan”) nganti 5 (“padha maknané sacara semantik”).  Kanggo dubbing, pihak kasebut mutusaké kanggo nampa ambang semantik sing luwih endhek tinimbang kanggo terjemahan mung kanggo takarir, ing ngendi watesan durasi ora relevan. Sanajan ana kompromi kuwi, 85,5% segmen dirating papat utawa lima saka lima kanggo kesesuaian semantik.

Asilé yaiku sistem sing bisa ngimbangi loro watesan sing saingan—waktu lan teges—kanthi tingkat kapercayan sing bisa diukur. Lan amarga loro metrik kasebut diotomatisasi, Descript bisa terus-terusan ngevaluasi rilis model anyar lan variasi pituduh nganggo tolok ukur sing padha.

Mbukak lokalisasi video skala gedhe

Nalika panerjemahan berkembang saka video siji menyang pustaka konten gedhé, Descript lagi nambahake kontrol luwih akeh babagan carane terjemahan disetel, kalebu kemampuan kanggo ngutamakake kasetyan semantik sing luwih ketat yen dibutuhake.

Penerjemahan ing Descript iku mung salah siji lapisan saka sistem multimodal sing luwih jembar. Teks sing wis diterjemahake dadi input kanggo panggawéan wicara, sing banjur nyurung sinkronisasi lambe lan rendering video pungkasan. 

Pangapikan ing lapisan teks ndadekake tempo alami bisa diwujudake, nanging pengalaman sakabèhé uga gumantung marang sepira apike model audio njaga nada, irama, lan ciri-ciri nonverbal saka wicara. Ing kono tim kasebut ndeleng wilayah anyar sabanjuré. 

“Akeh bab sing bakal ningkatake asil terjemahan yaiku nggawe alur kerja luwih multimodal: nggabungake audio, video, lan teks bebarengan nalika nemtokake carane nerjemahake,” ujare Mistratov. “Kuwi kuduné luwih bisa njaga ciri-ciri nonverbal ing wicara, kayata nada lan penekanan, lan njaga luwih akèh manèh saka cara penyampaian asliné.”

Kanggo Descript, model panalaran sing luwih kuwat nggawe kerumitan dubbing dadi bisa ditangani. Kanthi ngliwati ambang wates ing ngendi model-model bisa kanthi andal ngimbangi pertukaran antarane tempo lan makna, terjemahan dadi sawijining prakara sing bisa ditingkatake kanthi sistematis dening tim, lan disebarake kanthi skala gedhe.