
成果
43
採用 OpenAI 後,時長符合度提升幅度(百分點)
成果
15%
推出後的配音影片匯出量增幅
Descript(在新視窗中開啟) 是一款以 AI 為核心的影片編輯器,理念很簡單:只要你懂得編輯文字,就也能編輯影片。Descript 自創立之初,便運用 AI 支援產品的各項功能,包括轉錄、編輯、音訊清理,以及日益複雜的創作工作流程。多年來,Descript 一直以 OpenAI 技術為基礎開發產品,透過 Whisper 進行轉錄,並將 GPT 系列模型整合到協作編輯器 Underlord。
翻譯很快便成為一項效益顯著的應用情境。傳統影片翻譯既耗時又昂貴,需要語言專家管理專案、製作譯文、控管品質,並製作相應的音訊。大型語言模型 (LLM) 大幅精簡這套工作流程,讓大規模提供高品質翻譯成為可能。
字幕與配音都必須兼顧語意忠實度,也就是譯文必須保留原意。但時長符合度對兩者的作用不同。對字幕來說,符合時長是加分項目。對配音來說,符合時長卻是必要條件。翻譯後的語音若太長或太短,即使意思正確,聽起來仍不自然。
為了解決這個問題,Descript 採用 OpenAI 推理模型重新設計翻譯流程,在生成階段便同時最佳化語意忠實度與時長符合度,而非事後修正。新流程推出後的前 30 天,含配音的翻譯影片匯出量增加 15%;時長符合度也依語言不同,提升 13 至 43 個百分點。
Descript 執行長 Laura Burkhauser 表示:「配音已成為 Descript 越來越熱門的應用情境,因此我們正開發批次處理功能,協助企業翻譯整個內容庫並同步口型。」
翻譯是 Descript 最早推出的功能之一,也是使用者最常提出的需求之一。Descript 起初只提供字幕翻譯,成效不錯;但許多使用者希望再進一步,讓影片也能配上目標語言的口語音訊,也就是配音。
然而,有個問題不斷出現:配音不一定自然。Descript AI 產品主管 Aleks Mistratov 指出:「我們聽到最多的抱怨,大概就是翻譯成其他語言後,語速聽起來不自然。」
問題在於,不同語言表達同一概念所需的時間不同。例如,Descript 發現,平均而言,德文表達同一內容所需的時間比英文「更長」。為了配合固定長度的影片片段,翻譯後的語音往往必須人為加快或放慢。Mistratov 表示:「最後聽起來不是像花栗鼠,就是像昏昏欲睡的巨人。」
英文: | 德文: |
“Please review the safety guidelines before operating the machine.” 音節數:18 | “Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.” 音節數:24(增加 40%) |
在這種情況下,德文音訊要麼被迫加快到不自然的速度,要麼就得改寫譯文來符合時長限制。
使用者只能二選一:逐段手動調整音訊時間,或改寫譯文本身來配合時長。兩種做法都需要大幅編修時間軸,而且通常還得具備接近母語程度的目標語言能力。這對創作者而言十分繁瑣,也讓這項功能難以擴展到大型企業在地化專案。
團隊很清楚,要讓配音功能順利運作,系統必須具備哪些能力。系統不只要最佳化語意,也必須掌握時長限制。例如,將英文翻成德文時,模型必須懂得精簡用字或簡化概念,讓配音保持自然。
先前的方法會優先最佳化語意忠實度,再於事後修正時長。譯文的語意通常正確,卻屢屢不符時長限制,整體品質仍不夠好。
Mistratov 表示:「我們逐步進行測試,甚至不讓模型生成任何內容,只請模型輸出一段文字的音節數。早期模型根本不擅長這件事。」
事實證明,準確計算音節數是關鍵。如果模型無法每次都正確計算音節數,就無法穩定地讓譯文落在特定時長範圍內。
GPT‑5 系列模型展現了早期模型欠缺的穩定推理能力,在計算音節數和追蹤限制條件等任務上尤其明顯。有了這項進步,Descript 便重新設計翻譯與配音流程。
首先,Descript 的系統會依據句子邊界、自然停頓和原始錄音的說話模式,將逐字稿切分成多個片段。每個片段既保有連貫語意,長度也夠短,可視為單一時長單位進行推理。
接著,模型會計算片段的音節數。系統會根據各語言的預估語速,推算翻譯後的片段應有多少音節,才能維持自然語速,也就是達到「時長符合度」。提示詞會要求模型同時最佳化時長符合度並保留原意。系統也會提供前後片段作為脈絡,讓模型維持各片段之間的語意連貫。
團隊評估多種設定,力求在時長符合度、語意忠實度、延遲與成本之間取得平衡。最終選用的設定能以正式上線所需的速度準確遵循限制條件,無須手動調整時長即可處理大量翻譯。這套翻譯流程把語速視為核心變數,而不是留待事後修正。
為了制定評測的驗收標準,團隊進行聆聽測試:先生成翻譯後的音訊樣本,再逐步微調播放速度,請使用者評估語音從哪個速度開始顯得不自然。
Mistratov 表示:「一般來說,語音放慢 10% 或加快 20%,聽起來仍然自然。」超出這個範圍後,語音就會嚴重失真。
按照這項指標,早期系統的表現並不理想。視語言而定,只有 40% 至 60% 的片段落在可接受的語速範圍內。翻譯流程重新設計後,這項比例從 40% 至 60% 提升至 73% 至 83%,實際數值依語言而異。
團隊也使用另一個模型擔任評審,以 1 分(「完全不同」)至 5 分(「語意相同」)的量表評估語意忠實度。字幕翻譯不受時長限制,因此團隊決定,配音可以接受比純字幕翻譯稍低的語意門檻。即使做出這項取捨,仍有 85.5% 的片段在語意忠實度方面獲得 4 分或 5 分。
最終,系統得以兼顧時長與語意這兩項相互牴觸的限制,成效也可量化驗證。由於兩項指標都已自動化,Descript 能以相同的評測基準,持續評估新版模型和不同版本的提示詞。
隨著翻譯範圍從單支影片擴大到大型內容庫,Descript 也讓使用者更能掌控翻譯的調校方式,包括在必要時優先採用更嚴格的語意忠實度標準。
Descript 的翻譯功能只是整套多模態系統中的一層。翻譯後的文字會送入語音生成系統,再用來驅動口型同步和最終影片算繪。
改善文字層面的處理可讓語速更自然,但整體體驗也取決於音訊模型能否保留語氣、說話節奏及其他非語言特徵。團隊認為,這正是下一個有待突破的方向。
Mistratov 表示:「要改善翻譯成果,很大一部分得靠流程整合更多模態:在決定如何翻譯時,同時考量音訊、影片與文字。這樣應該更能保留語氣、重音等語音的非語言特徵,也能更完整地呈現原始說話方式。」
有了能力更強的推理模型,Descript 終於能處理配音帶來的複雜問題。當模型跨越門檻,能夠在語速與語意之間做出可靠取捨後,團隊便能有系統地改善翻譯,並大規模部署。


