Cara Descript bina alih suara video berbilang bahasa skala besar
Dengan menggunakan model penaakulan OpenAI, Descript membuka kunci penyetempatan automatik pustaka kandungan yang besar tanpa kehilangan pemasaan atau makna.

Hasil
43
Peningkatan mata peratusan dalam pematuhan tempoh dengan OpenAI
Hasil
15%
Peningkatan eksport alih suara selepas pelancaran
Descript(dibuka dalam tetingkap baru) ialah penyunting video natif AI yang dibina berasaskan idea mudah: jika anda boleh menyunting teks, anda sepatutnya boleh menyunting video. Sejak awal penubuhan Descript, AI telah menguasakan setiap aspek produk: transkripsi, penyuntingan, pembersihan audio, dan aliran kerja kreatif yang semakin kompleks. Mereka telah membina dengan OpenAI selama bertahun-tahun, menggunakan Whisper untuk transkripsi dan siri model GPT dalam penyunting bersama mereka, Underlord.
Terjemahan dengan cepat muncul sebagai kes penggunaan berimpak tinggi. Secara tradisinya, terjemahan video adalah perlahan dan mahal, memerlukan pakar bahasa untuk mengurus projek, menghasilkan terjemahan rutin, mengendalikan kawalan kualiti, dan menjana audio yang sepadan. LLM memampatkan aliran kerja itu dengan ketara, menjadikan terjemahan berkualiti tinggi pada skala sebesar mungkin.
Kapsyen dan alih suara kedua-duanya memerlukan kesetiaan semantik: terjemahan mesti mengekalkan makna asal. Tetapi pematuhan tempoh memainkan peranan yang berbeza dalam setiap satu. Untuk kapsyen, ia bagus jika ada. Untuk alih suara, ini adalah kritikal, kerana jika pertuturan yang diterjemahkan terlalu panjang atau terlalu pendek, ia akan kedengaran tidak semula jadi walaupun maksudnya betul.
Untuk menangani perkara ini, Descript mereka bentuk semula saluran terjemahannya menggunakan model penaakulan OpenAI untuk mengoptimumkan kesetiaan semantik dan pematuhan tempoh semasa penjanaan, bukan selepas itu. Dalam 30 hari pertama selepas pelancaran, eksport video terjemahan dengan alih suara meningkat 15%, dan pematuhan tempoh bertambah baik sebanyak 13 hingga 43 mata peratusan, bergantung pada bahasa.
“Alih suara ialah kes penggunaan yang semakin popular untuk Descript, jadi kami sedang membina cara untuk melakukannya secara kelompok bagi syarikat yang mahu menterjemah dan menyelaraskan gerak bibir keseluruhan pustaka kandungan,” kata Laura Burkhauser, Ketua Pegawai Eksekutif (CEO).
Terjemahan adalah antara ciri terawal dan paling banyak diminta Descript. Mereka bermula dengan terjemahan sari kata sahaja, yang berfungsi dengan baik—tetapi ramai pengguna mahu melangkah lebih jauh dan mempunyai audio pertuturan (dubbing) dalam bahasa sasaran.
Namun, satu isu terus timbul: audio alih suara tidak sentiasa kedengaran betul. “Barangkali aduan nombor satu yang kami dengar ialah kadar pertuturan itu tidak semula jadi dalam bahasa terjemahan,” kata Aleks Mistratov, Ketua Produk AI di Descript.
Masalahnya berpunca daripada hakikat bahawa bahasa yang berbeza mengambil masa yang berbeza untuk menyatakan idea yang sama. Descript memerhatikan, sebagai contoh, bahawa secara purata bahasa Jerman ialah bahasa yang “lebih panjang” daripada bahasa Inggeris. Untuk menyesuaikan diri dengan segmen video tetap, ucapan yang diterjemahkan sering terpaksa dipercepatkan atau diperlahankan secara buatan. “Awak akan berakhir dengan sesuatu yang kedengaran seperti tupai chipmunk, atau gergasi yang mengantuk,” jelas Mistratov.
Bahasa Inggeris: | Jerman: |
“Sila semak garis panduan keselamatan sebelum mengendalikan mesin.” Suku kata: 18 | “Sila semak garis panduan keselamatan sebelum mengendalikan mesin.” Suku kata: 24 (peningkatan 40%) |
Dalam kes ini, audio bahasa Jerman sama ada perlu dipercepatkan secara tidak semula jadi, atau terjemahan perlu ditulis semula agar sesuai dengan had masa.
Pengguna mempunyai dua pilihan: melaraskan masa audio secara manual segmen demi segmen, atau menulis semula terjemahan agar sesuai. Kedua-dua pendekatan memerlukan suntingan garis masa yang mendalam dan, selalunya, kefasihan hampir setara dengan penutur asli dalam bahasa sasaran. Ia membosankan bagi pencipta dan menjadi penghalang untuk menskalakan ciri tersebut kepada projek penyetempatan perusahaan besar.
Pasukan itu mempunyai teori yang jelas tentang apa yang diperlukan untuk menjayakan alih suara. Sistem ini perlu bukan sahaja dioptimumkan untuk makna semantik, tetapi juga menyedari kekangan masa. Apabila menterjemah daripada bahasa Inggeris ke bahasa Jerman, sebagai contoh, model perlu memahami cara menggunakan lebih sedikit perkataan atau memudahkan konsep supaya audio alih suara kekal semula jadi.
Pendekatan terdahulu mengoptimumkan kesetiaan semantik terlebih dahulu dan cuba membetulkan pemasaan selepas itu. Terjemahan itu selalunya betul dari segi semantik, tetapi ia secara rutin terlepas kekangan tempoh, dan kualiti keseluruhan masih tidak cukup baik.
“Kami menjalankan ujian berperingkat, tanpa menjana apa-apa, hanya meminta model untuk mengeluarkan bilangan suku kata dalam satu bahagian teks,” kata Mistratov. “Model-model terdahulu sememangnya tidak begitu bagus dalam hal itu.”
Pengiraan suku kata yang boleh dipercayai ternyata sangat penting. Jika model tidak dapat mengira suku kata secara konsisten, ia tidak dapat menyasarkan tetingkap tempoh tertentu dengan boleh dipercayai.
Model siri GPT‑5 membawa tahap konsistensi penaakulan yang tidak dimiliki oleh model terdahulu, terutamanya pada tugas seperti pengiraan suku kata dan penjejakan kekangan. Dengan penambahbaikan itu, Descript mereka bentuk semula saluran proses terjemahan dan alih suara.
Pertama, sistem Descript memecahkan transkrip kepada bahagian-bahagian, berpandukan sempadan ayat, jeda semula jadi, dan corak pertuturan dalam rakaman asal. Setiap bahagian mengekalkan kesinambungan semantik, tetapi cukup kecil untuk membuat penaakulan mengenainya sebagai unit pemasaan.
Dari situ, model mengira bilangan suku kata dalam bahagian tersebut. Dengan menggunakan andaian kadar pertuturan khusus bahasa, sistem menganggarkan berapa banyak suku kata yang patut disasarkan oleh segmen terjemahan untuk mengekalkan rentak yang semula jadi (“duration adherence”). Prom meminta model untuk mengoptimumkan kedua-dua pematuhan tempoh dan pemeliharaan makna. Ketulan di sekeliling dihantar sebagai konteks supaya model mengekalkan koheren semantik merentas segmen.
Pasukan menilai pelbagai konfigurasi untuk mengimbangi pematuhan tempoh, kesetiaan semantik, kependaman, dan kos. Persediaan yang dipilih memberikan pematuhan kekangan yang kukuh pada kelajuan pengeluaran, membolehkan terjemahan berjumlah tinggi tanpa penetapan masa semula secara manual. Hasilnya ialah saluran paip terjemahan di mana pemasaan dianggap sebagai pembolehubah kelas pertama dan bukannya sesuatu yang dibetulkan selepas itu.
Untuk membangunkan kriteria penerimaan bagi evals, pasukan menjalankan ujian mendengar: mereka menjana sampel audio terjemahan dan melaraskan kelajuan main balik dalam kenaikan kecil, meminta pengguna menilai apabila pertuturan menjadi tidak semula jadi.
“Apa-apa sahaja yang diperlahankan sebanyak 10% atau dipercepatkan sebanyak 20% secara umumnya masih kedengaran semula jadi,” kata Mistratov. Di luar julat ini, pertuturan menjadi terlalu terherot.
Sistem terdahulu menunjukkan prestasi yang kurang baik mengikut ukuran itu. Bergantung pada bahasa, hanya 40% hingga 60% segmen berada dalam julat kelajuan yang boleh diterima. Dengan saluran yang direka bentuk semula, angka itu meningkat daripada 40%–60% kepada antara 73% dan 83%, bergantung pada bahasa.
Pasukan itu juga menilai kesetiaan semantik menggunakan penarafan model-sebagai-hakim yang berasingan pada skala antara 1 (“sama sekali berbeza”) hingga 5 (“setara secara semantik”). Untuk alih suara, mereka memutuskan untuk menerima ambang semantik yang lebih rendah berbanding terjemahan kapsyen sahaja, di mana kekangan tempoh tidak relevan. Walaupun dengan kompromi itu, 85.5% segmen dinilai empat atau lima daripada lima bagi pematuhan semantik.
Hasilnya ialah sistem yang dapat mengimbangi dua kekangan yang bersaing—masa dan makna—dengan keyakinan yang dapat diukur. Dan kerana kedua-dua metrik itu diautomatikkan, Descript dapat menilai secara berterusan keluaran model baharu dan variasi prom berbanding penanda aras yang sama.
Apabila terjemahan beralih daripada video tunggal kepada pustaka kandungan yang besar, Descript sedang membina lebih banyak kawalan dalam cara terjemahan ditala, termasuk keupayaan untuk mengutamakan kesetiaan semantik yang lebih ketat apabila diperlukan.
Terjemahan dalam Descript hanyalah satu lapisan dalam sistem multimodal yang lebih luas. Teks terjemahan disalurkan ke dalam penjanaan pertuturan, yang kemudian memacu penyelarasan bibir dan pemapar video akhir.
Penambahbaikan pada lapisan teks membolehkan rentak yang semula jadi, tetapi pengalaman keseluruhan juga bergantung pada sejauh mana model audio mengekalkan nada, irama, dan ciri-ciri bukan lisan pertuturan. Di situlah pasukan melihat perbatasan seterusnya.
“Banyak perkara yang akan meningkatkan output terjemahan ialah menjadikan saluran paip lebih multimodal: menggabungkan audio, video, dan teks bersama-sama apabila memutuskan cara untuk menterjemah,” kata Mistratov. “Itu sepatutnya dapat mengekalkan ciri-ciri bukan lisan dalam pertuturan, seperti nada dan penekanan, dan mengekalkan lebih banyak lagi penyampaian asal.”
Untuk Descript, model penaakulan yang lebih kukuh menjadikan kerumitan alih suara lebih mudah diurus. Dengan melintasi ambang di mana model boleh mengimbangi pertukaran antara kelajuan dan makna dengan kebolehpercayaan, penterjemahan menjadi sesuatu yang boleh ditingkatkan secara sistematik oleh pasukan dan gunakan pada skala besar.


