跳至主要內容
OpenAI

2026年3月6日

新創公司

Descript 如何打造可大規模運作的多語言影片配音系統

Descript 採用 OpenAI 推理模型,自動將大型內容庫本地化,同時保留原有時序與語意。

粉紫色抽象聲波背景上呈現 Descript 標誌與字樣。
公司規模: 新創公司
地區: 北美洲
產業: 科技
產品: API

成果

43

採用 OpenAI 後,時長符合度提升幅度(百分點)

成果

15%

推出後的配音影片匯出量增幅

載入中…

Descript(在新視窗中開啟) 是一款以 AI 為核心的影片編輯器,理念很簡單:只要你懂得編輯文字,就也能編輯影片。Descript 自創立之初,便運用 AI 支援產品的各項功能,包括轉錄、編輯、音訊清理,以及日益複雜的創作工作流程。多年來,Descript 一直以 OpenAI 技術為基礎開發產品,透過 Whisper 進行轉錄,並將 GPT 系列模型整合到協作編輯器 Underlord。

翻譯很快便成為一項效益顯著的應用情境。傳統影片翻譯既耗時又昂貴,需要語言專家管理專案、製作譯文、控管品質,並製作相應的音訊。大型語言模型 (LLM) 大幅精簡這套工作流程,讓大規模提供高品質翻譯成為可能。

字幕與配音都必須兼顧語意忠實度,也就是譯文必須保留原意。但時長符合度對兩者的作用不同。對字幕來說,符合時長是加分項目。對配音來說,符合時長卻是必要條件。翻譯後的語音若太長或太短,即使意思正確,聽起來仍不自然。

為了解決這個問題,Descript 採用 OpenAI 推理模型重新設計翻譯流程,在生成階段便同時最佳化語意忠實度與時長符合度,而非事後修正。新流程推出後的前 30 天,含配音的翻譯影片匯出量增加 15%;時長符合度也依語言不同,提升 13 至 43 個百分點。

Descript 執行長 Laura Burkhauser 表示:「配音已成為 Descript 越來越熱門的應用情境,因此我們正開發批次處理功能,協助企業翻譯整個內容庫並同步口型。」

配音功能為何開始出問題

翻譯是 Descript 最早推出的功能之一,也是使用者最常提出的需求之一。Descript 起初只提供字幕翻譯,成效不錯;但許多使用者希望再進一步,讓影片也能配上目標語言的口語音訊,也就是配音。

然而,有個問題不斷出現:配音不一定自然。Descript AI 產品主管 Aleks Mistratov 指出:「我們聽到最多的抱怨,大概就是翻譯成其他語言後,語速聽起來不自然。」

問題在於,不同語言表達同一概念所需的時間不同。例如,Descript 發現,平均而言,德文表達同一內容所需的時間比英文「更長」。為了配合固定長度的影片片段,翻譯後的語音往往必須人為加快或放慢。Mistratov 表示:「最後聽起來不是像花栗鼠,就是像昏昏欲睡的巨人。」

英文:

德文:

“Please review the safety guidelines before operating the machine.”

音節數:18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

音節數:24(增加 40%)

在這種情況下,德文音訊要麼被迫加快到不自然的速度,要麼就得改寫譯文來符合時長限制。

使用者只能二選一:逐段手動調整音訊時間,或改寫譯文本身來配合時長。兩種做法都需要大幅編修時間軸,而且通常還得具備接近母語程度的目標語言能力。這對創作者而言十分繁瑣,也讓這項功能難以擴展到大型企業在地化專案。

翻譯最佳化不只要顧語意,也要顧時長

團隊很清楚,要讓配音功能順利運作,系統必須具備哪些能力。系統不只要最佳化語意,也必須掌握時長限制。例如,將英文翻成德文時,模型必須懂得精簡用字或簡化概念,讓配音保持自然。

先前的方法會優先最佳化語意忠實度,再於事後修正時長。譯文的語意通常正確,卻屢屢不符時長限制,整體品質仍不夠好。

Mistratov 表示:「我們逐步進行測試,甚至不讓模型生成任何內容,只請模型輸出一段文字的音節數。早期模型根本不擅長這件事。」

事實證明,準確計算音節數是關鍵。如果模型無法每次都正確計算音節數,就無法穩定地讓譯文落在特定時長範圍內。

GPT‑5 系列模型展現了早期模型欠缺的穩定推理能力,在計算音節數和追蹤限制條件等任務上尤其明顯。有了這項進步,Descript 便重新設計翻譯與配音流程。

首先,Descript 的系統會依據句子邊界、自然停頓和原始錄音的說話模式,將逐字稿切分成多個片段。每個片段既保有連貫語意,長度也夠短,可視為單一時長單位進行推理。

接著,模型會計算片段的音節數。系統會根據各語言的預估語速,推算翻譯後的片段應有多少音節,才能維持自然語速,也就是達到「時長符合度」。提示詞會要求模型同時最佳化時長符合度並保留原意。系統也會提供前後片段作為脈絡,讓模型維持各片段之間的語意連貫。

團隊評估多種設定,力求在時長符合度、語意忠實度、延遲與成本之間取得平衡。最終選用的設定能以正式上線所需的速度準確遵循限制條件,無須手動調整時長即可處理大量翻譯。這套翻譯流程把語速視為核心變數,而不是留待事後修正。

定義並衡量自然語速

為了制定評測的驗收標準,團隊進行聆聽測試:先生成翻譯後的音訊樣本,再逐步微調播放速度,請使用者評估語音從哪個速度開始顯得不自然。

Mistratov 表示:「一般來說,語音放慢 10% 或加快 20%,聽起來仍然自然。」超出這個範圍後,語音就會嚴重失真。

按照這項指標,早期系統的表現並不理想。視語言而定,只有 40% 至 60% 的片段落在可接受的語速範圍內。翻譯流程重新設計後,這項比例從 40% 至 60% 提升至 73% 至 83%,實際數值依語言而異。

團隊也使用另一個模型擔任評審,以 1 分(「完全不同」)至 5 分(「語意相同」)的量表評估語意忠實度。字幕翻譯不受時長限制,因此團隊決定,配音可以接受比純字幕翻譯稍低的語意門檻。即使做出這項取捨,仍有 85.5% 的片段在語意忠實度方面獲得 4 分或 5 分。

最終,系統得以兼顧時長與語意這兩項相互牴觸的限制,成效也可量化驗證。由於兩項指標都已自動化,Descript 能以相同的評測基準,持續評估新版模型和不同版本的提示詞。

推動大規模影片在地化

隨著翻譯範圍從單支影片擴大到大型內容庫,Descript 也讓使用者更能掌控翻譯的調校方式,包括在必要時優先採用更嚴格的語意忠實度標準。

Descript 的翻譯功能只是整套多模態系統中的一層。翻譯後的文字會送入語音生成系統,再用來驅動口型同步和最終影片算繪。

改善文字層面的處理可讓語速更自然,但整體體驗也取決於音訊模型能否保留語氣、說話節奏及其他非語言特徵。團隊認為,這正是下一個有待突破的方向。

Mistratov 表示:「要改善翻譯成果,很大一部分得靠流程整合更多模態:在決定如何翻譯時,同時考量音訊、影片與文字。這樣應該更能保留語氣、重音等語音的非語言特徵,也能更完整地呈現原始說話方式。」

有了能力更強的推理模型,Descript 終於能處理配音帶來的複雜問題。當模型跨越門檻,能夠在語速與語意之間做出可靠取捨後,團隊便能有系統地改善翻譯,並大規模部署。