
成效
43
使用 OpenAI 后在时长契合度上的百分点提升
成效
15%
功能上线后配音导出量的增幅
Descript(在新窗口中打开) 是一款 AI 原生视频编辑器,其构建理念非常简单:如果你会编辑文本,你就应该能够编辑视频。自 Descript 创立初期起,AI 就驱动着该产品的方方面面:转录、编辑、音频清理以及日益复杂的创意工作流。许多年来,他们一直基于 OpenAI 进行构建,在转录方面使用 Whisper,并在其协同编辑器 Underlord 中使用 GPT 系列模型。
翻译迅速成为一个高影响力的用例。一直以来,视频翻译既漫长又昂贵,需要语言专家来管理项目、制作机械的翻译、进行质量控制,并生成相应的音频。大语言模型 (LLM) 大幅压缩了该工作流,使得大规模高质量翻译成为可能。
字幕和配音都需要语义保真度:翻译必须保留原始含义。但时长契合度在两者中扮演的角色不同。对于字幕而言,它是一个锦上添花的选项。对于配音而言,它则是至关重要的,因为如果翻译后的语音过长或过短,即使意思完全正确,听起来也会很不自然。
为了解决这一问题,Descript 利用 OpenAI 推理模型重新设计了其翻译流水线,在生成过程中(而非事后)同时针对语义保真度 (semantic fidelity) 与时长契合度进行优化。在上线后的前 30 天内,带配音的翻译视频导出量增加了 15%,且时长契合度提升了 13 到 43 个百分点(因语言而异)。
“对 Descript 而言,配音是一个越来越受欢迎的用例,因此我们正在为希望对整个视频库进行翻译与对口型 (lip-sync) 的企业构建批量处理方式,”首席执行官 Laura Burkhauser 表示。
翻译是 Descript 最早推出且需求量极大的功能之一。他们最初从仅字幕翻译开始,效果很好。但许多用户希望更进一步,获得目标语言的口语配音 (dubbing)。
然而,一个问题不断浮现:配音音频听起来并不总是那么自然。“我们听到的最主要的抱怨可能就是,翻译后的语言语速显得很不自然,”Descript AI 产品负责人 Aleks Mistratov 说道。
问题的实质在于,不同语言表达同一个意思所需的时间各不相同。例如,Descript 观察到,平均而言德语比英语“更长”。为了适应固定的视频片段,翻译后的语音往往不得不人工加速或放慢。“结果听起来就像是花栗鼠在尖叫,或者是睡眼腥忪的巨人在说话,”Mistratov 解释道。
英语: | 德语: |
“Please review the safety guidelines before operating the machine.” 音节数:18 | “Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.” 音节数:24(增加了 40%) |
在这种情况下,要么需要不自然地加速德语音频,要么需要重新撰写翻译内容以适应时间限制。
用户当时只有两种选择:逐段手动重新调整音频时间,或者重新撰写翻译内容本身以使其契合。这两种方法都需要对时间线进行繁琐的修改,且通常需要对目标语言达到接近母语的熟练程度。这对创作者来说非常繁琐,也成为了将该功能推广至大型企业本地化项目的阻碍。
团队对于如何让配音顺畅运作有着清晰的思路。系统不仅需要优化语义表达,还需要感知时间节奏上的限制。例如,在将英语翻译为德语时,模型需要理解如何减少用词或简化概念,从而使配音音频保持自然。
较早的方法是先优化语义保真度,事后再试图修正时间节奏。翻译在语义上往往是正确的,但通常无法满足时长限制,整体质量依然不够理想。
“我们进行了增量测试,甚至不生成任何内容,只是要求模型输出一段文本中的音节数量,”Mistratov 说道。“早期模型在这方面根本不擅长。”
事实证明,可靠的音节计数至关重要。如果模型无法稳定地计算音节,它就无法可靠地匹配特定的时长窗口。
GPT‑5 系列模型带来了早期模型所缺乏的推理一致性,特别是在音节计数和约束追踪等任务上。凭借这一提升,Descript 重新设计了其翻译与配音流水线。
首先,Descript 的系统以原始录音中的句子边界、自然停顿和说话习惯为指导,将转录文本拆分为多个文本块 (chunks)。每个文本块都保持语义上的连贯性,同时足够小,可以作为一个时间单位来进行推理。
从这里开始,模型会计算该文本块中的音节数量。利用特定语言的语速假设,系统会预估翻译后的文本块应该以多少个音节为目标,以保持自然的语速节奏(即“时长契合度”)。提示词要求模型同时针对时长契合度与意思保留进行优化。上下文中的相邻文本块也会作为背景信息传入,以便模型在各片段之间保持语义连贯。
团队评估了多种配置,以平衡时长契合度、语义保真度、延迟和成本。最终选定的配置在生产速度下展现出了强劲的约束遵循能力,实现了无需手动调整时间的批量翻译。其成果是一个将语速节奏视为一等变量 (first-class variable) 的翻译流水线,而不是事后才去纠正的补救措施。
为了制定评估的验收标准,团队进行了听力测试:他们生成了翻译后的音频样本,并以微小增量调整播放速度,让用户对语音何时变得不自然进行评分。
“任何放慢 10% 或加速 20% 以内的语音,总体上听起来依然自然,”Mistratov 说道。一旦超出这个范围,语音就会变得过于失真。
早期系统按该标准衡量表现较差。只有 40% 到 60% 的片段落在可接受的语速窗口内,具体取决于语言。借助重新设计的流水线,这一数字从 40%–60% 提升到了 73% 至 83% 之间(因语言而异)。
团队还使用单独的模型作为裁判 (model-as-judge),在 1(“截然不同”)到 5(“语义等价”)的范围内评估语义保真度。对于配音,他们决定接受比纯字幕翻译(此时,时长约束无关紧要)略低的语义阈值。即便做出了这一权衡,仍有 85.5% 的片段在语义契合度上获得了 4 分或 5 分(满分 5 分)。
其成果是一个能够在时间节奏与语义这两个相互竞争的约束之间取得可衡量平衡的系统。此外,由于这两个指标都是自动化的,Descript 能够根据相同的基准,持续对新发布的模型和提示词变体进行评估。
随着翻译从单个视频延伸至庞大的内容库,Descript 正在为翻译的微调方式加入更多控制,包括在需要时优先保障更严格的语义保真度。
Descript 内部的翻译只是更广泛的多模态系统中的一个层级。翻译后的文本输入到语音生成中,进而驱动口型同步和最终的视频渲染。
文本层的提升使自然语速成为可能,但整体体验同样取决于音频模型能否很好地保留语音的语调、抑扬顿挫等非语言特征。这正是团队的下一个前沿方向。
“改善翻译输出效果的关键,在于让流水线更具多模态特性:在决定如何翻译时,将音频、视频和文本融合在一起,”Mistratov 说道。“这应该能更好地保留语音的非语言特征(如语调和重音),并更完整地保留原有的表达风格。”
对 Descript 而言,更强大的推理模型使配音的复杂性变得可控。通过跨越“模型能够可靠平衡语速与语义权衡”的门槛,翻译变为了团队可以系统性改善并大规模部署的技术。


