Descript अभियंते मोठ्या प्रमाणात बहुभाषिक व्हिडिओ डबिंग कसे करतात
OpenAI रीझनिंग मॉडेल्स वापरून, Descript ने टाइमिंग किंवा अर्थ न गमावता मोठ्या कंटेंट लायब्ररींचे स्वयंचलित लोकलायझेशन शक्य केले.

निकाल
43
OpenAI सह कालावधी पालनात टक्केवारी गुणांची सुधारणा
निकाल
15%
रोलआउटनंतर डब केलेल्या निर्यातीत वाढ
Descript(नवीन विंडोमध्ये उघडेल) हा AI-नेटिव्ह व्हिडिओ एडिटर आहे, जो एका साध्या कल्पनेभोवती तयार केला आहे: जर तुम्ही मजकूर एडिट करू शकत असाल, तर तुम्ही व्हिडिओही एडिट करू शकला पाहिजे. Descript च्या सुरुवातीच्या दिवसांपासून, AI ने उत्पादनाच्या प्रत्येक पैलूला चालना दिली आहे: ट्रान्सक्रिप्शन, संपादन, ऑडिओ क्लीनअप आणि अधिकाधिक जटिल सर्जनशील कार्यप्रवाह. ते अनेक वर्षांपासून OpenAI वर काम करत आहेत, ट्रान्सक्रिप्शनसाठी Whisper आणि त्यांच्या को-एडिटर Underlord मध्ये GPT सिरीज मॉडेल्स वापरत आहेत.
भाषांतर द्रुतपणे उच्च प्रभाव असलेली युज केस म्हणून उदयास आले. परंपरेने, व्हिडिओचे भाषांतर करणे संथ आणि महागडे राहिले आहे, ज्यासाठी भाषा तज्ज्ञांना प्रकल्प व्यवस्थापित करणे, यांत्रिक भाषांतरे तयार करणे, गुणवत्ता नियंत्रण हाताळणे आणि त्यानुसार ऑडिओ तयार करणे आवश्यक होते. LLMs त्या कार्यप्रवाहाला नाट्यमयरीत्या संकुचित करतात, ज्यामुळे मोठ्या प्रमाणावर उच्च-गुणवत्तेचे भाषांतर शक्य होते.
कॅप्शन्स आणि डबिंग या दोन्हीसाठी अर्थनिष्ठा आवश्यक आहे: भाषांतराने मूळ अर्थ कायम राखला पाहिजे. पण कालावधीचे पालन प्रत्येकात वेगळी भूमिका बजावते. कॅप्शन्ससाठी, हे असले तर चांगले आहे. डबिंगसाठी हे अत्यंत महत्त्वाचे आहे, कारण अनुवादित संवाद खूप लांब किंवा खूप लहान झाला तर, अर्थ योग्य असला तरी तो अनैसर्गिक वाटेल.
हे सोडवण्यासाठी, Descript ने OpenAI रीझनिंग मॉडेल्स वापरून त्याची भाषांतर पाइपलाइन पुन्हा डिझाइन केली, जेणेकरून जनरेशन दरम्यान—नंतर नाही—अर्थनिष्ठा आणि कालावधीचे पालन यासाठी ऑप्टिमाइझ करता येईल. रोलआउटनंतरच्या पहिल्या 30 दिवसांत, डबिंगसह भाषांतरित व्हिडिओंच्या एक्सपोर्टमध्ये 15% वाढ झाली, आणि भाषेनुसार कालावधीचे पालन 13 ते 43 टक्के पॉइंट्सने सुधारले.
“Descript साठी डबिंग हा अधिकाधिक लोकप्रिय वापरप्रकार आहे, त्यामुळे संपूर्ण लायब्ररींचे भाषांतर आणि लिप-सिंक करायचे असलेल्या कंपन्यांसाठी आम्ही ते बॅचमध्ये करण्याचे मार्ग तयार करत आहोत,” असे लॉरा बर्कहाउझर, CEO, म्हणाल्या.
अनुवाद हे Descript चे सर्वात पहिले आणि सर्वाधिक मागणी असलेले वैशिष्ट्यांपैकी एक होते. त्यांनी फक्त कॅप्शन्सचे भाषांतर करून सुरुवात केली, जे चांगले काम करत होते—पण अनेक वापरकर्त्यांना आणखी पुढे जायचे होते आणि लक्ष्य भाषेत बोललेला ऑडिओ (डबिंग) हवा होता.
तथापि, एक समस्या वारंवार समोर येत राहिली: डब केलेला ऑडिओ नेहमीच योग्य वाटत नसे. "कदाचित आम्ही ऐकलेली सर्वात मोठी तक्रार अशी होती की भाषांतरित भाषेत भाषणाचा वेग नैसर्गिक वाटत नव्हता," असे Descript येथील AI उत्पादन प्रमुख अलेक्स मिस्ट्रॅटोव्ह यांनी सांगितले.
समस्या यावर येऊन ठेपली की वेगवेगळ्या भाषांना तीच कल्पना व्यक्त करण्यासाठी वेगवेगळा वेळ लागतो. Descript ने, उदाहरणार्थ, असे निरीक्षण केले की सरासरीने जर्मन ही इंग्रजीपेक्षा “लांब” भाषा आहे. स्थिर व्हिडिओ विभागांमध्ये बसण्यासाठी, भाषांतरित भाषणाचा वेग अनेकदा कृत्रिमरीत्या वाढवला किंवा मंदावला जावा लागला. “तुम्हाला शेवटी चिपमंक्ससारखा, किंवा झोपाळू राक्षसासारखा आवाज असलेली काहीतरी गोष्ट मिळेल,” असे मिस्त्रातोव्हने स्पष्ट केले.
इंग्रजी: | जर्मन: |
“मशीन चालवण्यापूर्वी कृपया सुरक्षा मार्गदर्शक तत्त्वांचे पुनरावलोकन करा.” अक्षरगण: 18 | “कृपया मशीन चालवण्यापूर्वी सुरक्षा मार्गदर्शक तत्त्वे तपासा.” अक्षरसंख्या: 24 (40% वाढ) |
या प्रकरणात, जर्मन ऑडिओचा वेग अनैसर्गिकरीत्या वाढवावा लागेल, किंवा वेळेच्या बजेटमध्ये बसण्यासाठी भाषांतर पुन्हा लिहावे लागेल.
वापरकर्त्यांकडे दोन पर्याय उरले: ऑडिओचे सेगमेंटनुसार हाताने पुन्हा टाइमिंग करणे, किंवा ते बसावे म्हणून भाषांतरच पुन्हा लिहिणे. दोन्ही दृष्टिकोनांसाठी टाइमलाइनमध्ये सखोल संपादने आवश्यक होती आणि अनेकदा लक्ष्य भाषेत जवळपास मातृभाषिक प्रावीण्यही आवश्यक होते. हे क्रिएटर्ससाठी कंटाळवाणे होते, आणि मोठ्या एंटरप्राइज लोकॅलायझेशन प्रोजेक्ट्ससाठी हे फीचर स्केल करण्यामध्ये अडथळा बनले.
डबिंग यशस्वी करण्यासाठी काय आवश्यक आहे याबद्दल संघाकडे एक स्पष्ट संकल्पना होती. प्रणालीला केवळ अर्थासाठी ऑप्टिमाइझ करणे पुरेसे नाही, तर वेळेच्या मर्यादांचीही जाणीव असणे आवश्यक आहे. उदाहरणार्थ, इंग्रजीतून जर्मनमध्ये भाषांतर करताना, डब केलेला ऑडिओ नैसर्गिक राहावा यासाठी मॉडेलला कमी शब्द वापरणे किंवा संकल्पना सोपी करणे समजणे आवश्यक आहे.
पूर्वीचे दृष्टिकोन प्रथम अर्थसाम्य अनुकूलित करत आणि नंतर वेळेचे समायोजन सुधारण्याचा प्रयत्न करत. भाषांतरे अनेकदा अर्थाच्या दृष्टीने बरोबर होती, पण ती नियमितपणे कालावधीच्या निर्बंधांना चुकत होती, आणि एकूण गुणवत्ता पुरेशी चांगली नव्हती.
“आम्ही टप्प्याटप्प्याने चाचण्या केल्या, काहीही तयार न करता, फक्त मॉडेलला मजकुराच्या एका भागातील अक्षरांची संख्या सांगण्यास सांगितले,” मिस्ट्राटोव्ह म्हणाले. “आधीची मॉडेल्स त्यामध्ये फारशी चांगली नव्हती.”
विश्वसनीय अक्षरगणना अत्यंत महत्त्वाची ठरली. जर मॉडेल सातत्याने अक्षरगणना करू शकले नाही, तर ते विशिष्ट कालावधीच्या विंडोला विश्वासार्हपणे लक्ष्य करू शकले नसते.
GPT‑5 मालिकेतील मॉडेल्सनी रीझनिंगमधील सुसंगततेची पातळी आणली जी आधीच्या मॉडेल्समध्ये नव्हती, विशेषतः अक्षरगणना आणि निर्बंध ट्रॅकिंगसारख्या कामांमध्ये. त्या सुधारणेसह, Descript ने त्याची भाषांतर आणि डबिंग पाइपलाइन पुन्हा डिझाइन केली.
प्रथम, Descript ची प्रणाली मूळ रेकॉर्डिंगमधील वाक्यांच्या सीमा, नैसर्गिक थांबे आणि बोलण्याच्या पॅटर्न्स यांच्या मार्गदर्शनाखाली ट्रान्सक्रिप्टचे भागांमध्ये विभाजन करते. प्रत्येक चंक अर्थसातत्य राखतो, पण टाइमिंग युनिट म्हणून त्याबद्दल तर्कशक्ती वापरण्यासाठी पुरेसा लहान असतो.
त्यानंतर, मॉडेल त्या भागातील अक्षरसमूहांची संख्या मोजते. भाषा-विशिष्ट बोलण्याच्या गतीविषयक गृहितकांचा वापर करून, नैसर्गिक गती टिकवण्यासाठी (“duration adherence”) भाषांतरित भागाने किती अक्षरसमूहांना लक्ष्य करावे याचा अंदाज प्रणाली लावते. प्रॉम्प्ट मॉडेलला कालावधीचे पालन आणि अर्थ जतन या दोन्हींसाठी ऑप्टिमाइझ करण्यास सांगतो. मॉडेलने विभागांमध्ये अर्थसुसंगतता कायम राखावी म्हणून आजूबाजूचे तुकडे संदर्भ म्हणून पास केले जातात.
कालावधीचे पालन, अर्थविषयक निष्ठा, लेटन्सी, आणि खर्च यांचा समतोल साधण्यासाठी संघाने अनेक कॉन्फिगरेशन्सचे मूल्यांकन केले. निवडलेल्या सेटअपने प्रॉडक्शन गतीने निर्बंधांचे मजबूत पालन दिले, ज्यामुळे मॅन्युअल रिटायमिंगशिवाय हाय-वॉल्यूम भाषांतर शक्य झाले. परिणाम असा एक ट्रान्सलेशन पाइपलाइन आहे जिथे पेसिंगला नंतर दुरुस्त करायची गोष्ट म्हणून नव्हे, तर प्रथम‑श्रेणीतील चल म्हणून मानले जाते.
इव्हॅल्ससाठी स्वीकृती निकष विकसित करण्यासाठी, संघाने लिसनिंग टेस्ट्स केल्या: त्यांनी भाषांतरित ऑडिओ नमुने तयार केले आणि प्लेबॅक गती लहान टप्प्यांत समायोजित केली, आणि भाषण कधी अनैसर्गिक झाले याचे रेटिंग देण्यास वापरकर्त्यांना सांगितले.
“10% ने मंदावलेली, किंवा 20% ने वेग वाढवलेली कोणतीही गोष्ट, साधारणपणे तरीही नैसर्गिकच वाटत होती,” Mistratov म्हणाले. या श्रेणीपलीकडे, भाषण खूप विकृत झाले.
पूर्वीच्या प्रणालींनी त्या मापनानुसार खराब कामगिरी केली. भाषेनुसार, केवळ 40% ते 60% विभाग स्वीकार्य गतीच्या विंडोमध्ये आले. पुनर्रचित पाइपलाइनसह, भाषेनुसार, तो आकडा 40%–60% वरून 73% आणि 83% दरम्यान वाढला.
संघाने 1 (“पूर्णपणे वेगळे”) ते 5 (“अर्थाच्या दृष्टीने समतुल्य”) अशा स्केलवर स्वतंत्र मॉडेल-as-judge रेटिंग वापरून सेमॅंटिक फिडेलिटीचेही मूल्यांकन केले. डबिंगसाठी, त्यांनी कॅप्शन-फक्त भाषांतरापेक्षा कमी अर्थविषयक उंबरठा स्वीकारण्याचा निर्णय घेतला, जिथे कालावधीची बंधने अप्रासंगिक आहेत. त्या तडजोडीसहही, 85.5% सेगमेंट्सना अर्थसंबंधी अनुरूपतेसाठी पाचपैकी चार किंवा पाच असे रेटिंग देण्यात आले.
परिणाम अशी एक प्रणाली होती जी दोन स्पर्धात्मक बंधने—वेळ आणि अर्थ—मोजता येण्याजोग्या आत्मविश्वासासह संतुलित करू शकत होती. आणि दोन्ही मेट्रिक्स स्वयंचलित असल्यामुळे, Descript त्याच बेंचमार्क्सच्या आधारे नवीन मॉडेल रिलीजेस आणि प्रॉम्प्ट व्हेरिएशन्सचे सतत मूल्यांकन करू शकते.
भाषांतर एकल व्हिडिओंपासून मोठ्या कंटेंट लायब्ररींकडे जात असताना, Descript भाषांतरे कशी ट्यून केली जातात यामध्ये अधिक नियंत्रण तयार करत आहे, ज्यामध्ये गरज पडल्यास अधिक कठोर अर्थसाम्य निष्ठेला प्राधान्य देण्याची क्षमता समाविष्ट आहे.
Descript मधील भाषांतर हे व्यापक मल्टिमोडल प्रणालीतील फक्त एक स्तर आहे. अनुवादित मजकूर भाषण जनरेशनमध्ये जातो, जे नंतर लिप सिंक आणि अंतिम व्हिडिओ रेंडरिंग चालवते.
टेक्स्ट लेयरमधील सुधारणा नैसर्गिक गती शक्य करतात, पण एकूण अनुभव ऑडिओ मॉडेल टोन, लय, आणि भाषणाच्या अवाचिक वैशिष्ट्यांना किती चांगल्या प्रकारे जपते यावरही अवलंबून असतो. तिथेच संघाला पुढील अत्याधुनिक दिसते.
“भाषांतर आउटपुट सुधारण्यासाठी जे बरेच काही मदत करणार आहे ते म्हणजे पाइपलाइन अधिक मल्टिमोडल करणे: भाषांतर कसे करायचे हे ठरवताना ऑडिओ, व्हिडिओ आणि मजकूर एकत्र समाविष्ट करणे,” असे मिस्ट्रॅटोव्ह म्हणाले. “यामुळे स्पीचची टोन आणि एम्फॅसिस यांसारखी नॉनव्हर्बल वैशिष्ट्ये अधिक चांगल्या प्रकारे टिकून राहतील, आणि मूळ डिलिव्हरीमधील आणखी जास्त भाग जपला जाईल.”
Descript साठी, अधिक मजबूत रीझनिंग मॉडेल्समुळे डबिंगची गुंतागुंत हाताळण्याजोगी झाली. पेसिंग आणि अर्थ यांमधील तडजोडी विश्वसनीयपणे संतुलित करू शकतील अशा टप्प्यापर्यंत मॉडेल्स पोहोचल्यामुळे, भाषांतर हे संघ पद्धतशीरपणे सुधारू शकणारी आणि मोठ्या प्रमाणावर तैनात करू शकणारी गोष्ट बनली.


