મુખ્ય વિષય-સામગ્રી પર જાવો
OpenAI

6 માર્ચ, 2026

સ્ટાર્ટઅપ

Descript દ્વારા મોટા પાયે બહુભાષી વીડિયો ડબિંગનું એન્જિનિયરિંગ

OpenAI રિઝનિંગ મોડલ્સનો ઉપયોગ કરીને, Descriptએ ટાઇમિંગ અથવા અર્થ ગુમાવ્યા વિના વિશાળ કન્ટેન્ટ લાઇબ્રેરીઓનું સ્વચાલિત સ્થાનિકીકરણ શક્ય બનાવ્યું.

ગુલાબી અને જાંબલી અમૂર્ત વેવફોર્મ બૅકગ્રાઉન્ડ પર Descript લોગો અને વર્ડમાર્ક.
કંપનીનું કદ: સ્ટાર્ટઅપ
પ્રદેશ: ઉત્તર અમેરિકા
ઉદ્યોગ: ટેકનોલોજી
પ્રોડક્ટ્સ: API

પરિણામો

43

OpenAI સાથે સમયગાળાના પાલનમાં ટકાવારી પોઇન્ટનો સુધારો

પરિણામો

15%

રોલઆઉટ પછી ડબ કરેલા એક્સપોર્ટ્સમાં વધારો

લોડિંગ…

Descript(નવી વિન્ડોમાં ખૂલે છે) એ એક AI-નેટિવ વીડિયો એડિટર છે, જે એક સરળ વિચાર પર આધારિત છે: જો તમે ટેક્સ્ટ એડિટ કરી શકો છો, તો તમે વીડિયો પણ એડિટ કરી શકવા જોઈએ. Descript ના શરૂઆતના દિવસોથી જ, AI એ ઉત્પાદનના દરેક પાસાને સંચાલિત કર્યું છે: ટ્રાન્સક્રિપ્શન, એડિટિંગ, ઑડિયો ક્લીનઅપ અને સતત વધુ જટિલ બનતા સર્જનાત્મક વર્કફ્લોઝ. તેઓ વર્ષોથી OpenAI પર બિલ્ડ કરી રહ્યા છે, જેમાં ટ્રાન્સક્રિપ્શન માટે Whisper અને તેમના સહ-સંપાદક Underlord માં GPT શ્રેણીના મોડલ્સનો ઉપયોગ કરવામાં આવે છે. 

અનુવાદ ઝડપથી અત્યંત પ્રભાવશાળી ઉપયોગ તરીકે ઉભરી આવ્યો. પરંપરાગત રીતે, વીડિયોનું ભાષાંતર ધીમું અને ખર્ચાળ રહ્યું છે, જેમાં પ્રોજેક્ટ્સનું સંચાલન કરવા, મશીન અનુવાદો તૈયાર કરવા, ગુણવત્તા નિયંત્રણ સંભાળવા અને સંબંધિત ઑડિયો જનરેટ કરવા માટે ભાષા નિષ્ણાતોની જરૂર પડે છે. LLMs તે વર્કફ્લોને નોંધપાત્ર રીતે સંક્ષિપ્ત કરે છે, જેનાથી મોટા પાયે ઉચ્ચ-ગુણવત્તાવાળો અનુવાદ શક્ય બને છે.

કૅપ્શન્સ અને ડબિંગ બંનેમાં અર્થની સચોટતા જરૂરી છે: અનુવાદમાં મૂળ અર્થ જળવાઈ રહેવું જોઈએ. પરંતુ દરેકમાં અવધિનું પાલન અલગ ભૂમિકા ભજવે છે. કૅપ્શન્સ માટે, તે હોય તો સારું, પણ આવશ્યક નથી. ડબિંગ માટે આ અત્યંત મહત્વપૂર્ણ છે, કારણ કે જો અનુવાદિત સંવાદ ખૂબ લાંબો કે ખૂબ ટૂંકો થઈ જાય, તો અર્થ સાચો હોવા છતાં તે અસ્વાભાવિક લાગશે.

આનો ઉકેલ લાવવા માટે, Descript એ જનરેશન પછી નહીં, પરંતુ જનરેશન દરમિયાન જ અર્થની સચોટતા અને અવધિનું પાલન ઑપ્ટિમાઇઝ કરવા OpenAI રિઝનિંગ મોડલ્સનો ઉપયોગ કરીને તેની અનુવાદ પાઇપલાઇનને ફરીથી ડિઝાઇન કરી. રોલઆઉટ પછીના પ્રથમ 30 દિવસમાં, ડબિંગ સાથેના અનુવાદિત વીડિયોના એક્સપોર્ટમાં 15% વધારો થયો અને ભાષા પર આધાર રાખીને અવધિ પાલનમાં 13 થી 43 ટકાવારી પોઈન્ટનો સુધારો થયો.

“Descript માટે ડબિંગ વધુને વધુ લોકપ્રિય ઉપયોગ બની રહ્યો છે, તેથી જે કંપનીઓ સમગ્ર લાઇબ્રેરીઓનું અનુવાદ અને લિપ-સિંક કરવા માંગે છે તેમના માટે અમે તેને બેચમાં કરવાની રીતો બનાવી રહ્યા છીએ,” સીઈઓ લૉરા બર્કહાઉઝરે કહ્યું.

જે તબક્કે ડબિંગની પ્રક્રિયા ખોરવાવા લાગી

અનુવાદ Descript ની સૌથી પ્રારંભિક અને સૌથી વધુ માંગવાળી સુવિધાઓમાંની એક હતી. તેઓએ માત્ર કૅપ્શનના અનુવાદથી શરૂઆત કરી, જે સારી રીતે કરતું હતું—પરંતુ ઘણા વપરાશકર્તાઓ વધુ આગળ વધીને લક્ષ્ય ભાષામાં બોલાયેલ ઑડિયો (ડબિંગ) મેળવવા માંગતા હતા.

જોકે, એક સમસ્યા વારંવાર સામે આવતી રહી: ડબ કરેલો ઑડિયો હંમેશાં બરાબર લાગતો નહોતો. “અમે સાંભળેલી કદાચ સૌથી મોટી ફરિયાદ એ હતી કે અનુવાદિત ભાષામાં બોલવાની ગતિ અસ્વાભાવિક હતી,” Descript ખાતે AI પ્રોડક્ટના વડા એલેક્સ મિસ્ટ્રાતોવે કહ્યું.

સમસ્યા એ હતી કે અલગ-અલગ ભાષાઓમાં એક જ વિચાર વ્યક્ત કરવા માટે અલગ-અલગ સમય લાગે છે. ઉદાહરણ તરીકે, Descript એ નોંધ્યું કે સરેરાશ રીતે જર્મન ભાષા અંગ્રેજી કરતાં લાંબી છે. નિયત વીડિયો સેગમેન્ટ્સમાં ફિટ બેસાડવા માટે, અનુવાદિત વાણી ઘણીવાર કૃત્રિમ રીતે ઝડપી અથવા ધીમી કરવી પડતી હતી. “પરિણામે તમને એવું કંઈક મળતું જે ચિપમંક્સ અથવા કોઈ ઊંઘતા જાયન્ટ જેવું સંભળાતું,” મિસ્ટ્રાટોવે સમજાવ્યું.

અંગ્રેજી:

જર્મન:

“Please review the safety guidelines before operating the machine.”

ઉચ્ચારખંડો: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

ઉચ્ચારખંડો: 24 (40% વધારો)

આ કિસ્સામાં, જર્મન ઑડિયોને અસ્વાભાવિક રીતે ઝડપી કરવો પડશે અથવા નિર્ધારિત સમય મર્યાદામાં બંધબેસે તે માટે અનુવાદને ફરીથી લખવું પડશે.

વપરાશકર્તાઓ પાસે બે વિકલ્પો વધ્યા હતા: ઑડિયોને સેગમેન્ટ પ્રમાણે મેન્યુઅલી ફરીથી સમયબદ્ધ કરવું અથવા અનુવાદને જ ફરીથી લખવું જેથી તે બરાબર ફિટ થાય. બંને અભિગમોમાં સમયરેખામાં ઝીણવટભર્યા ફેરફારો અને ઘણીવાર લક્ષ્ય ભાષામાં લગભગ મૂળ વક્તા જેવી પ્રવાહિતાની જરૂર પડતી હતી. તે સર્જકો માટે કંટાળાજનક હતું અને આ સુવિધાને મોટા એન્ટરપ્રાઇઝ સ્થાનિકીકરણ પ્રોજેક્ટ્સ સુધી વિસ્તૃત કરવામાં અવરોધ બન્યું.

અનુવાદોને માત્ર અર્થ માટે જ નહીં, સમયસંયોજન માટે પણ ઑપ્ટિમાઇઝ કરવું

ડબિંગને સફળ બનાવવા માટે શું જરૂરી હશે તે અંગે ટીમ પાસે સ્પષ્ટ ધારણા હતી. સિસ્ટમે માત્ર અર્થની સચોટતા માટે ઑપ્ટિમાઇઝ કરવું જ નહીં, પરંતુ સમયસંબંધિત મર્યાદાઓનું પણ ધ્યાન રાખવાની જરૂર હતી. ઉદાહરણ તરીકે, અંગ્રેજીમાંથી જર્મન ભાષામાં અનુવાદ કરતી વખતે, મોડલે ઓછા શબ્દો કેવી રીતે વાપરવા અથવા ધારણાને કેવી રીતે સરળ બનાવવી તે સમજવું પડશે, જેથી ડબિંગ કરાયેલ ઑડિયો સ્વાભાવિક રહે.

અગાઉના અભિગમો પહેલા અર્થની સચોટતાને ઑપ્ટિમાઇઝ કરતા હતા અને ત્યારબાદ સમયસૂચન સુધારવાનો પ્રયાસ કરતા હતા. અનુવાદો ઘણીવાર અર્થની દૃષ્ટિએ સાચા હતા, પરંતુ તેઓ વારંવાર અવધિ સંબંધિત મર્યાદાઓ ચૂકી જતા હતા અને એકંદર ગુણવત્તા હજી પણ પૂરતી સારી ન હોતી. 

“અમે ક્રમિક પરીક્ષણો ચલાવ્યા, જેમાં કંઈ પણ બનાવ્યું નહીં, માત્ર મોડલને ટેક્સ્ટના એક ભાગમાં ઉચ્ચારખંડોની સંખ્યા જણાવવા કહ્યું,” મિસ્ટ્રાટોવે જણાવ્યું. “અગાઉનાં મોડલ્સ તેમાં ખાસ સારાં ન હતા.”

વિશ્વસનીય ઉચ્ચારખંડોની ગણતરી નિર્ણાયક સાબિત થઈ. જો મોડલ સુસંગત રીતે ઉચ્ચારખંડોની ગણતરી કરી શકતું ન હોય, તો તે વિશ્વસનીય રીતે ચોક્કસ સમયગાળાને લક્ષ્ય બનાવી શકતું ન હતું.

GPT‑5 શ્રેણીના મોડલ્સે રિઝનિંગની સાતત્યતાનું એવું સ્તર લાવ્યું, જે અગાઉના મોડલ્સમાં ન હતું, ખાસ કરીને ઉચ્ચારણોની ગણતરી અને નિયંત્રણ ટ્રેકિંગ જેવા કાર્યોમાં. તે સુધારા સાથે, Descript એ તેની અનુવાદ અને ડબિંગ પાઇપલાઇનને ફરીથી ડિઝાઇન કરી.

સૌપ્રથમ, Descript ની સિસ્ટમ મૂળ રેકોર્ડિંગમાં વાક્યની સીમાઓ, સ્વાભાવિક વિરામ અને બોલવાની શૈલીના આધારે ટ્રાન્સક્રિપ્ટને નાના ભાગોમાં વિભાજિત કરે છે. દરેક ભાગ અર્થસંબંધિત સાતત્ય જાળવી રાખે છે, પરંતુ તે એટલો નાનો હોય છે કે તેને સમયના એક એકમ તરીકે ગણી શકાય.

ત્યાંથી, મોડલ ભાગમાં રહેલા ઉચ્ચારખંડોની સંખ્યા ગણે છે. ભાષા-વિશિષ્ટ બોલવાના દરની ધારણાઓનો ઉપયોગ કરીને, સિસ્ટમ અંદાજ લગાવે છે કે સ્વાભાવિક ગતિ (“અવધિનું પાલન”) જાળવવા માટે અનુવાદિત ખંડે કેટલા ઉચ્ચારખંડોનું લક્ષ્ય રાખવું જોઈએ. આ પ્રોમ્પ્ટ મોડલને અવધિનું પાલન અને અર્થની જાળવણી બંને માટે શ્રેષ્ઠ બનાવવાનું કહે છે. આસપાસના ભાગોને સંદર્ભ તરીકે આપવામાં આવે છે જેથી મોડલ સેગમેન્ટ્સ વચ્ચે અર્થવિષયક સુસંગતતા જાળવી રાખે.

ટીમે અવધિ અનુપાલન, અર્થ સચોટતા, લેટન્સી અને ખર્ચ વચ્ચે સંતુલન સાધવા માટે બહુવિધ કન્ફિગરેશન્સનું મૂલ્યાંકન કર્યું. પસંદ કરેલા વ્યવસ્થાએ ઉત્પાદન ગતિએ મર્યાદાઓનું ચુસ્ત પાલન કર્યું, જેનાથી મેન્યુઅલ સમયસૂચન વિના મોટા પાયે અનુવાદ સક્ષમ બન્યું. પરિણામ એ એવી અનુવાદ પ્રક્રિયા છે જેમાં ગતિને પછીથી સુધારવાની બાબત તરીકે નહીં, પરંતુ મુખ્ય ચલ તરીકે ગણવામાં આવે છે.

સ્વાભાવિક ગતિનું નિર્ધારણ અને માપન

મૂલ્યાંકન માટે સ્વીકૃતિના માપદંડ વિકસાવવા માટે, ટીમે સાંભળવાની કસોટીઓ ચલાવી: તેમણે અનુવાદિત ઑડિયો નમૂનાઓ બનાવ્યા અને પ્લેબૅક ગતિને નાના પ્રમાણમાં સમાયોજિત કરી, વપરાશકર્તાઓને વાણી ક્યારે અસ્વાભાવિક લાગવા માંડી તે રેટ કરવા કહ્યું. 

“જે કંઈ 10% ધીમું કરવામાં આવ્યું હતું અથવા 20% ઝડપી કરવામાં આવ્યું હતું, તે સામાન્ય રીતે હજી પણ સ્વાભાવિક સંભળાતું હતું,” મિસ્ટ્રાટોવે કહ્યું. આ રેન્જની બહાર, વાણી ખૂબ જ વિકૃત થઈ ગઈ. 

અગાઉની સિસ્ટમોએ તે માપદંડ મુજબ નબળું પ્રદર્શન કર્યું હતું. ભાષાના આધારે, માત્ર 40% થી 60% સેગમેન્ટ્સ જ સ્વીકાર્ય પેસિંગ વિન્ડોમાં આવ્યા હતા. નવેસરથી ડિઝાઇન કરેલી પાઇપલાઇન સાથે, તે આંકડો 40%–60%થી વધીને, ભાષાના આધારે, 73% અને 83%ની વચ્ચે થયો.

ટીમે 1 (“સંપૂર્ણપણે અલગ”) થી 5 (“અર્થની દ્રષ્ટિએ સમાન”) સુધીના સ્કેલ પર અલગ નિર્ણાયક તરીકે મોડલ રેટિંગનો ઉપયોગ કરીને અર્થવિષયક સચોટતાનું પણ મૂલ્યાંકન કર્યું.  ડબિંગ માટે, તેમણે ફક્ત કૅપ્શન માટેના અનુવાદ કરતાં નીચા અર્થવિષયક માપદંડ સ્વીકારવાનું નક્કી કર્યું, જ્યાં અવધિ મર્યાદાઓ લાગુ પડતી નથી. તે બાંધછોડ સાથે પણ, 85.5% સેગમેન્ટ્સને અર્થવિષયક પાલન માટે પાંચમાંથી ચાર અથવા પાંચનું રેટિંગ આપવામાં આવ્યું હતું.

પરિણામે એક એવી સિસ્ટમ તૈયાર થઈ, જે બે પરસ્પર વિરોધી મર્યાદાઓ—સમય અને અર્થ—વચ્ચે માપી શકાય તેવી ખાતરી સાથે સંતુલન સાધી શકતી હતી. અને બંને મેટ્રિક્સ ઓટોમેટેડ હોવાથી, Descript સમાન બેન્ચમાર્ક્સ સામે નવા મોડલ રિલીઝ અને પ્રોમ્પ્ટ વેરિએશન્સનું સતત મૂલ્યાંકન કરી શકે છે.

મોટા પાયે વીડિયો સ્થાનિકીકરણને સક્ષમ બનાવવું

જેમ જેમ અનુવાદ એકલ વીડિયોથી વિશાળ કન્ટેન્ટ લાઇબ્રેરીઓ સુધી વિસ્તરે છે, તેમ Descript અનુવાદોને કેવી રીતે સુસંગત બનાવવામાં વધુ નિયંત્રણ લાવી રહ્યું છે, જેમાં જરૂર પડે ત્યારે વધુ કડક અર્થવિષયક સચોટતાને પ્રાથમિકતા આપવાની ક્ષમતા પણ સામેલ છે.

Descript માં અનુવાદ એ એક વ્યાપક મલ્ટિમોડલ સિસ્ટમનું માત્ર એક સ્તર છે. અનુવાદિત ટેક્સ્ટ સ્પીચ જનરેશનમાં જાય છે, જે પછી લિપ સિંક અને અંતિમ વીડિયો રેન્ડરિંગને સંચાલિત કરે છે. 

ટેક્સ્ટના સ્તરે થયેલા સુધારાઓ સ્વાભાવિક ગતિને શક્ય બનાવે છે, પરંતુ સમગ્ર અનુભવ એ પર પણ નિર્ભર કરે છે કે ઑડિયો મોડલ વાણીના સૂર, લય અને બિનશાબ્દિક વિશેષતાઓને કેટલી સારી રીતે જાળવી રાખે છે. અને અહીં જ ટીમ પોતાનું આગામી અત્યાધુનિક ક્ષેત્ર ઓળખે છે. 

“અનુવાદના આઉટપુટને બહેતર બનાવવામાં મોટો ફાળો પાઇપલાઇનને વધુ મલ્ટિમોડલ બનાવવાનો રહેશે: એટલે કે અનુવાદ કેવી રીતે કરવો તે નક્કી કરતી વખતે ઑડિયો, વીડિયો અને ટેક્સ્ટને એકસાથે ધ્યાનમાં લેવા,” મિસ્ત્રાતોવે કહ્યું. “તેનાથી વાણીની બિનશાબ્દિક લાક્ષણિકતાઓ, જેમ કે સ્વર અને શબ્દો પરનો ભાર વધુ સારી રીતે જળવાઈ રહેશે અને મૂળ રજૂઆતને હજુ પણ વધુ સારી રીતે અકબંધ રાખી શકાશે.”

Descript માટે, વધુ શક્તિશાળી રીઝનિંગ મોડલ્સે ડબિંગની જટિલતાને ઉકેલવી સરળ બનાવી દીધી. ગતિ અને અર્થ વચ્ચેની બાંધછોડને મોડલ્સ વિશ્વસનીય રીતે સંતુલિત કરી શકે, તે તબક્કો વટાવ્યા પછી અનુવાદ એક એવી પ્રક્રિયા બની ગઈ જેમાં ટીમ વ્યવસ્થિત રીતે સુધારો કરી શકી અને તેને મોટા પાયે અમલમાં મૂકી શકી.