Cách Descript lồng tiếng video đa ngôn ngữ ở quy mô lớn
Sử dụng các mô hình lý luận OpenAI, Descript đã mở khóa bản địa hóa tự động các thư viện nội dung lớn mà không làm mất thời gian hoặc ý nghĩa.

Kết quả
43
Mức cải thiện điểm phần trăm về mức độ tuân thủ thời lượng với OpenAI
Kết quả
15%
Xuất khẩu phim lồng tiếng tăng sau khi ra mắt.
Descript(mở trong cửa sổ mới) là một trình chỉnh sửa video hoàn toàn dựa trên trí tuệ nhân tạo, được xây dựng dựa trên một ý tưởng đơn giản: nếu bạn có thể chỉnh sửa văn bản, bạn cũng có thể chỉnh sửa video. Ngay từ những ngày đầu thành lập, trí tuệ nhân tạo (AI) đã hỗ trợ mọi khía cạnh của sản phẩm Descript: chuyển đổi giọng nói thành văn bản, chỉnh sửa, làm sạch âm thanh và cả các quy trình sáng tạo ngày càng phức tạp. Họ đã xây dựng dựa trên OpenAI trong nhiều năm, sử dụng Whisper để phiên âm và các mô hình chuỗi GPT bên trong trình biên tập chung Underlord của họ.
Dịch thuật nhanh chóng nổi lên như một trường hợp sử dụng có tác động lớn. Theo truyền thống, việc dịch video diễn ra chậm và tốn kém, đòi hỏi các chuyên gia ngôn ngữ quản lý dự án, tạo ra các bản dịch rập khuôn, xử lý kiểm soát chất lượng và tạo ra âm thanh tương ứng. Các hệ thống quản lý ngôn ngữ pháp lý (LLM) giúp rút ngắn đáng kể quy trình làm việc, cho phép dịch thuật chất lượng cao trên quy mô lớn.
Cả phụ đề và lồng tiếng đều yêu cầu tính trung thực về mặt ngữ nghĩa: bản dịch phải giữ nguyên ý nghĩa ban đầu. Nhưng việc tuân thủ thời hạn đóng vai trò khác nhau trong mỗi trường hợp. Đối với phụ đề, đây là một tính năng hữu ích. Đối với lồng tiếng, điều đó rất quan trọng, bởi vì nếu lời thoại được dịch quá dài hoặc quá ngắn, nó sẽ nghe có vẻ không tự nhiên ngay cả khi ý nghĩa là chính xác.
Để giải quyết vấn đề này, Descript đã thiết kế lại đường ống dịch của mình bằng cách sử dụng các mô hình lý luận OpenAI để tối ưu hóa độ trung thực ngữ nghĩa và tuân thủ thời lượng trong quá trình tạo chứ không phải sau đó. Trong 30 ngày đầu tiên sau khi ra mắt, xuất khẩu video được dịch với lồng tiếng tăng 15% và độ tuân thủ thời lượng được cải thiện từ 13 đến 43 điểm phần trăm, tùy thuộc vào ngôn ngữ.
Laura Burkhauser, Giám đốc điều hành cho biết: “Lồng tiếng là một trường hợp sử dụng ngày càng phổ biến cho Descript, vì vậy chúng tôi đang xây dựng các cách để thực hiện nó theo lô cho các công ty muốn dịch và đồng bộ hóa toàn bộ thư viện.
Dịch thuật là một trong những tính năng sớm nhất và được yêu cầu nhiều nhất của Descript. Họ bắt đầu với bản dịch chỉ có phụ đề, cách này hoạt động tốt—nhưng nhiều người dùng muốn tiến xa hơn và có âm thanh lồng tiếng bằng ngôn ngữ mục tiêu.
Tuy nhiên, một vấn đề cứ liên tục nổi lên: âm thanh lồng tiếng không phải lúc nào cũng nghe đúng. Aleks Mistratov, Trưởng bộ phận Sản phẩm AI tại Descript cho biết: “Có lẽ lời phàn nàn số một mà chúng tôi nghe là tốc độ của bài phát biểu không tự nhiên trong ngôn ngữ dịch.
Vấn đề nằm ở chỗ các ngôn ngữ khác nhau cần thời gian khác nhau để diễn đạt cùng một ý tưởng. Ví dụ, Descript nhận thấy rằng trung bình tiếng Đức là một ngôn ngữ "dài" hơn tiếng Anh. Để phù hợp với các đoạn video cố định, lời thoại được dịch thường phải được tăng tốc hoặc làm chậm một cách nhân tạo. “Kết quả sẽ là âm thanh nghe giống như tiếng sóc chuột, hoặc một người khổng lồ đang ngủ gật,” Mistratov giải thích.
Tiếng Anh: | Tiếng Đức: |
“Vui lòng xem lại các hướng dẫn an toàn trước khi vận hành máy.” Âm tiết: 18 | “Vui lòng kiểm tra các hướng dẫn an toàn trước khi vận hành máy.” Âm tiết: 24 (tăng 40%) |
Trong trường hợp này, âm thanh tiếng Đức sẽ phải được tăng tốc một cách không tự nhiên, hoặc bản dịch sẽ cần phải được viết lại để phù hợp với ngân sách thời gian.
Người dùng chỉ còn hai lựa chọn: tự điều chỉnh thời gian từng đoạn âm thanh một, hoặc viết lại toàn bộ bản dịch cho phù hợp. Cả hai phương pháp đều yêu cầu chỉnh sửa sâu trên dòng thời gian và, thường là, khả năng thông thạo gần như người bản xứ trong ngôn ngữ đích. Điều đó gây tẻ nhạt cho người tạo, và trở thành rào cản đối với việc mở rộng quy mô tính năng này cho các dự án bản địa hóa doanh nghiệp lớn.
Nhóm đã có một giả thuyết rõ ràng về những gì cần thiết để lồng tiếng thành công. Hệ thống không chỉ cần tối ưu hóa ý nghĩa ngữ nghĩa mà còn phải lưu tâm đến các ràng buộc về thời gian. Ví dụ, khi dịch từ tiếng Anh sang tiếng Đức, mô hình cần phải hiểu cách sử dụng ít từ hơn hoặc đơn giản hóa khái niệm để đoạn âm thanh được lồng tiếng vẫn tự nhiên.
Các phương pháp tiếp cận trước đó đã tối ưu hóa độ trung thực ngữ nghĩa trước tiên và cố gắng điều chỉnh thời gian sau đó. Các bản dịch thường đúng về mặt ngữ nghĩa, nhưng chúng thường bỏ qua các hạn chế về thời lượng và chất lượng tổng thể vẫn không đủ tốt.
Mistratov nói: “Chúng tôi đã chạy các bài kiểm tra gia tăng, thậm chí không tạo ra bất cứ thứ gì, chỉ yêu cầu mô hình xuất ra số âm tiết trong một đoạn văn bản. “Các mô hình trước đó đơn giản là không giỏi việc đó.”
Việc đếm số âm tiết một cách đáng tin cậy hóa ra là rất quan trọng. Nếu mô hình không thể tính toán số âm tiết một cách nhất quán, thì mô hình sẽ không thể nhắm mục tiêu một cách đáng tin cậy vào một khoảng thời lượng cụ thể.
Các mô hình dòng GPT‑5 mang lại mức độ nhất quán lý luận mà các mô hình trước đó thiếu, đặc biệt là đối với các nhiệm vụ như đếm âm tiết và theo dõi ràng buộc. Với sự cải tiến đó, Descript đã thiết kế lại đường ống dịch và lồng tiếng của mình.
Đầu tiên, hệ thống của Descript chia bảng điểm thành các phần, được hướng dẫn bởi ranh giới câu, tạm dừng tự nhiên và kiểu nói trong bản ghi gốc. Mỗi đoạn duy trì tính liên tục ngữ nghĩa, nhưng đủ nhỏ để lý luận như một đơn vị thời gian.
Từ đó, mô hình sẽ tính toán số lượng âm tiết trong đoạn văn. Sử dụng các giả định về tốc độ nói cụ thể theo ngôn ngữ, hệ thống ước tính có bao nhiêu âm tiết mà đoạn dịch nên nhắm mục tiêu để duy trì nhịp độ tự nhiên (“tuân thủ thời gian”). Câu lệnh yêu cầu mô hình tối ưu hóa cho cả thời lượng, tuân thủ và bảo toàn ý nghĩa. Các đoạn văn bản xung quanh được truyền vào như ngữ cảnh để mô hình duy trì tính nhất quán về ngữ nghĩa giữa các phân đoạn.
Nhóm đã đánh giá nhiều cấu hình khác nhau để cân bằng giữa việc tuân thủ thời lượng, độ chính xác ngữ nghĩa, độ trễ và chi phí. Cấu hình được lựa chọn mang lại khả năng tuân thủ ràng buộc mạnh mẽ ở tốc độ sản xuất, cho phép dịch thuật khối lượng lớn mà không cần điều chỉnh thời gian thủ công. Kết quả là một quy trình dịch thuật trong đó nhịp độ được coi là một biến số quan trọng hàng đầu thay vì là thứ được điều chỉnh sau đó.
Để phát triển các tiêu chí chấp nhận cho bộ đánh giá Evals, nhóm đã thực hiện các bài kiểm tra nghe: họ tạo ra các mẫu âm thanh đã được dịch và điều chỉnh tốc độ phát lại theo các mức tăng nhỏ, yêu cầu người dùng đánh giá thời điểm giọng nói trở nên không tự nhiên.
“Bất cứ điều gì bị chậm lại 10%, hoặc tăng tốc 20%, nói chung vẫn nghe có vẻ tự nhiên”, Mistratov nói. Ngoài phạm vi này, giọng nói trở nên quá méo mó.
Các hệ thống trước đây hoạt động kém hiệu quả theo tiêu chí đó. Tùy thuộc vào ngôn ngữ, chỉ có từ 40% đến 60% các đoạn phim nằm trong khung thời gian cho phép. Với quy trình được thiết kế lại, con số đó đã tăng từ 40%–60% lên từ 73% đến 83%, tùy thuộc vào ngôn ngữ.
Nhóm nghiên cứu cũng đánh giá độ chính xác về ngữ nghĩa bằng cách sử dụng một mô hình riêng biệt đóng vai trò là người đánh giá, trên thang điểm từ 1 (“hoàn toàn khác biệt”) đến 5 (“tương đương về ngữ nghĩa”). Đối với lồng tiếng, họ quyết định chấp nhận một ngưỡng ngữ nghĩa thấp hơn so với dịch chỉ chú thích, nơi các ràng buộc về thời lượng là không liên quan. Ngay cả với sự đánh đổi đó, 85.5% phân đoạn được đánh giá là bốn hoặc năm trên năm về mức độ tuân thủ ngữ nghĩa.
Kết quả là một hệ thống có thể cân bằng hai hạn chế cạnh tranh - thời gian và ý nghĩa - với sự tự tin có thể đo lường được. Và bởi vì cả hai số liệu đều được tự động hóa, Descript có thể liên tục đánh giá các bản phát hành mô hình mới và nhắc nhở các biến thể so với cùng một điểm chuẩn.
Khi dịch thuật chuyển từ các video đơn lẻ sang các thư viện nội dung lớn, Descript đang xây dựng thêm nhiều khả năng kiểm soát về cách các bản dịch được tinh chỉnh, bao gồm khả năng ưu tiên độ trung thành ngữ nghĩa nghiêm ngặt hơn khi cần.
Dịch thuật bên trong Descript chỉ là một lớp của một hệ thống đa phương thức rộng hơn. Văn bản đã dịch được đưa vào quá trình tạo giọng nói, sau đó thúc đẩy đồng bộ hóa môi và kết xuất video cuối cùng.
Những cải tiến ở lớp văn bản làm cho nhịp độ tự nhiên trở nên khả thi, nhưng trải nghiệm tổng thể cũng phụ thuộc vào mức độ mô hình âm thanh bảo tồn âm thanh, nhịp điệu và các đặc điểm phi ngôn ngữ của lời nói. Đó là nơi nhóm nhìn thấy tiên phong tiếp theo.
“Phần lớn những yếu tố sẽ cải thiện kết quả dịch thuật là việc làm cho quy trình xử lý trở nên đa phương thức hơn: kết hợp âm thanh, video và văn bản với nhau khi quyết định cách dịch,” Mistratov nói. “Điều đó sẽ duy trì tốt hơn các đặc điểm phi ngôn ngữ của lời nói, như giọng điệu và sự nhấn mạnh, và bảo tồn nhiều hơn nữa sự phát biểu ban đầu.”
Đối với Descript, các mô hình lý luận mạnh mẽ hơn làm cho sự phức tạp của việc lồng tiếng trở nên dễ hiểu. Bằng cách vượt qua ngưỡng mà các mô hình có thể cân bằng đáng tin cậy giữa nhịp độ và ý nghĩa, dịch thuật trở thành thứ mà nhóm có thể cải thiện một cách có hệ thống và triển khai trên quy mô lớn.


