跳到主要內容
OpenAI

2026年3月6日

初創企業

Descript 如何大規模製作多語言影片配音

透過 OpenAI 推理模型,Descript 能在不影響語意與節奏的情況下,自動為大型內容庫進行本地化。

Descript 標誌與字樣位於粉紅與紫色抽象聲波背景之上。
公司規模: 初創公司
地區: 北美洲
行業: 科技
產品: API

成效

43

使用 OpenAI 後,時長貼合度提升的百分點數

成效

15%

推出後配音影片匯出量增加

正在載入...

Descript(在新視窗中開啟) 是一款 AI 原生影片編輯器,建基於一個簡單理念:既然我們可以編輯文字,也應該可以編輯影片。從 Descript 成立初期開始,AI 一直支援產品的每個環節,包括轉錄、編輯、音訊清理,以及日益複雜的創作工作流程。多年來,他們一直運用 OpenAI 建立產品,以 Whisper 進行轉錄,並在協作編輯器 Underlord 中採用 GPT 系列模型。 

翻譯很快便成為極具影響力的應用情境。傳統的影片翻譯流程既費時又昂貴,需要由語言專家管理項目、進行逐字翻譯、處理質素控制,以及生成相應的音訊。大型語言模型 (LLM) 大幅縮短這套工作流程,讓大規模提供高質素翻譯成為可能。

字幕和配音同樣要求語義忠實,譯文必須保留原意。但時長貼合度對兩者的作用並不相同。對字幕而言,有固然理想,但並非必要。對配音而言,時長貼合度至關重要,因為如果翻譯後的語音過長或過短,即使意思正確,聽起來也會不自然。

為解決這個問題,Descript 運用 OpenAI 推理模型重新設計翻譯流程,在生成譯文時同步優化語義忠實度和時長貼合度,而非事後調整。推出後首 30 日內,經翻譯和配音的影片匯出量增加 15%,時長貼合度則視乎語言而定,提升 13 至 43 個百分點。

Descript 行政總裁 Laura Burkhauser 表示:「配音在 Descript 的應用越來越普及,因此我們正開發批量處理方式,讓有意翻譯整個內容庫並同步唇形的公司使用。」

配音開始遇上瓶頸

翻譯是 Descript 最早推出,也是用戶最常要求的功能之一。他們最初只提供字幕翻譯,成效不俗,但不少用戶希望更進一步,加入以目標語言朗讀的語音(配音)。

然而,一個問題反覆出現:配音聽起來不一定自然。Descript AI 產品主管 Aleks Mistratov 表示:「我們最常聽到的投訴,大概是翻譯後的語音節奏不自然。」

問題在於,不同語言表達同一個意思所需的時間各有不同。例如,Descript 發現德文平均比英文「更長」。為了配合固定長度的影片片段,翻譯後的語音往往要刻意加快或放慢。Mistratov 解釋:「結果聽起來不是像花栗鼠說話般又快又急,就是像昏昏欲睡的巨人般又低沉又悶。」

英文:

德文:

「Please review the safety guidelines before operating the machine.」

音節:18

「Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.」

音節:24(增加 40%)

在這個例子中,為符合時間限制,便可能需要將德文語音不自然地加快速度,又或者需要重新改寫翻譯內容。

用戶只剩下兩個選擇:逐段手動調整音訊時長,或改寫譯文以配合時長。兩種方法都需要大幅修改時間軸,而且往往要求用戶對目標語言有接近母語程度的掌握。這不但令創作者感到繁瑣,也阻礙了功能擴展至大型企業本地化項目。

優化翻譯,不只求達意,也要配合時長

團隊清楚知道,要令配音真正奏效,需要做到甚麼。系統除了要優化語義,也需要顧及時長限制。例如,將英文翻譯成德文時,模型需要懂得精簡字句或簡化概念,讓配音仍然自然流暢。

早期方法會先優化語義忠實度,再嘗試調整時長。譯文的語義往往正確,卻經常不符合時長限制,整體質素仍未達標。 

Mistratov 表示:「我們進行了逐步測試,甚至沒有要求模型生成任何內容,只是請它輸出一段文字的音節數目。」「早期模型根本不擅長這項工作。」

結果證明,可靠地計算音節至關重要。如果模型無法持續準確計算音節,便無法可靠地將語音控制在特定時長範圍內。

GPT‑5 系列模型的推理一致性達到早期模型欠缺的水平,尤其擅長計算音節和追蹤限制等任務。憑藉這項改進,Descript 重新設計了翻譯和配音流程。

首先,Descript 的系統會參考原始錄音的句子分界、自然停頓和說話模式,將逐字稿分成多個片段。每個片段都保持語義連貫,同時足夠精簡,可作為時長單位加以推理。

然後,模型會計算片段的音節數目。系統根據不同語言的語速假設,估算翻譯片段應包含多少音節,從而保持自然語速(「時長貼合度」)。提示詞要求模型同時優化時長貼合度並保留原意。系統亦會提供前後片段作為情境,讓模型維持各片段之間的語義連貫。

團隊評估了多種設定,以平衡時長貼合度、語義忠實度、延遲和成本。最終採用的設定能以生產環境所需的速度有效遵從限制,支援大量翻譯,毋須手動調整時長。由此建立的翻譯流程會將語速視為核心變項,而非留待事後修正。

界定和衡量自然語速

為制定評估的驗收準則,團隊進行了聆聽測試:他們生成翻譯後的音訊樣本,逐步微調播放速度,並請用戶評定語音何時開始變得不自然。 

Mistratov 表示:「語音放慢 10% 或加快 20% 後,一般仍然聽起來自然。」超出這個範圍,語音便會過度失真。 

按這項標準衡量,早期系統的表現欠佳。視乎語言而定,只有 40% 至 60% 的片段處於可接受的語速範圍。採用重新設計的流程後,這個比例由 40% 至 60% 增至 73% 至 83%,視乎語言而定。

團隊亦使用另一個模型擔任評審,按 1 分(「完全不同」)至 5 分(「語義等同」)的評分尺度,評估語義忠實度。  在配音方面,他們決定採用比純字幕翻譯較低的語義門檻,因為後者毋須考慮時長限制。即使作出這項取捨,仍有 85.5% 的片段在語義貼合度方面獲評為 4 分或 5 分(滿分 5 分)。

最終,系統能夠可靠兼顧時長和意思這兩項相互衝突的限制,成效亦可量化。由於兩項指標的評估均已自動化,Descript 可持續使用相同基準測試,評估新推出的模型和不同提示詞。

拓展大規模影片本地化

隨着翻譯由單一影片擴展至大型內容庫,Descript 正加入更多翻譯調整控制功能,包括在有需要時優先採用更嚴格的語義忠實度標準。

Descript 的翻譯功能只是整個多模態系統的一環。翻譯後的文字會輸入語音生成流程,再驅動唇形同步和最終影片生成。 

文字層面的改進可帶來自然語速,但整體體驗亦取決於音訊模型能否保留語氣、說話節奏,以及語音的非語言特徵。團隊認為,這正是下一個突破方向。 

Mistratov 表示:「提升翻譯成果的一大關鍵,是令流程更加多模態:決定如何翻譯時,同時結合音訊、影片和文字。」「這應有助進一步保留語音的非語言特徵,例如語氣和重音,並更完整地呈現原有的演繹方式。」

對 Descript 而言,更強大的推理模型讓複雜的配音工作變得可處理。當模型達到能夠可靠兼顧語速與意思的水平,團隊便可有系統地改進翻譯,並大規模部署。