Descript பன்மொழி வீடியோ டப்பிங்கை எவ்வாறு பொறியமைக்கிறது
OpenAI ரீஸனிங் மாடல்களைப் பயன்படுத்தி, நேரமிடல் அல்லது பொருளை இழக்காமல் பெரிய உள்ளடக்க நூலகங்களின் தானியங்கி உள்ளூர்மயமாக்கலை Descript செயல்படுத்தியது.

முடிவுகள்
43
OpenAI மூலம் காலஅளவு பின்பற்றலில் சதவீதப் புள்ளி மேம்பாடு
முடிவுகள்
15%
வெளியீட்டுக்குப் பிறகு டப் செய்யப்பட்ட ஏற்றுமதிகளில் அதிகரிப்பு
Descript(புதிய சாளரத்தில் திறக்கும்) என்பது ஒரு எளிய யோசனையை மையமாகக் கொண்டு உருவாக்கப்பட்ட AI-நேட்டிவ் வீடியோ எடிட்டர்: நீங்கள் உரையை எடிட் செய்ய முடிந்தால், வீடியோவையும் எடிட் செய்ய முடியும். Descript-இன் ஆரம்ப நாட்களிலிருந்தே, தயாரிப்பின் ஒவ்வொரு அம்சத்தையும் AI இயக்கி வருகிறது: டிரான்ஸ்கிரிப்ஷன், எடிட்டிங், ஆடியோ சுத்திகரிப்பு, மேலும் அதிகரித்து வரும் சிக்கலான படைப்பாற்றல் பணிப்பாய்வுகள். பல ஆண்டுகளாக அவர்கள் OpenAI தொழில்நுட்பத்தைப் பயன்படுத்தி வருகின்றனர். குரலை உரையாக மாற்ற Whisper-ஐயும், தங்களின் Underlord இணைத் தொகுப்பியில் GPT தொடர் மாடல்களையும் பயன்படுத்தி வருகின்றனர்.
மொழிபெயர்ப்பு விரைவாக ஒரு உயர் தாக்கம் கொண்ட பயன்பாடாக உருவெடுத்தது. பாரம்பரியமாக, வீடியோ மொழிபெயர்ப்பு மெதுவாகவும் செலவாகவும் இருந்து வந்தது; திட்டங்களை நிர்வகிக்க, இயந்திரமயமான மொழிபெயர்ப்புகளை உருவாக்க, தரக் கட்டுப்பாட்டை கையாள, மற்றும் அதற்கேற்ற ஆடியோவை உருவாக்க மொழி நிபுணர்கள் தேவைப்பட்டனர். LLMs அந்த பணிப்பாய்வை வியத்தகு முறையில் சுருக்கி, அளவிலான உயர்தர மொழிபெயர்ப்பை சாத்தியமாக்குகின்றன.
வசன வரிகளும் (Captions), குரல் மாற்றமும் (Dubbing) இரண்டிலும் பொருள் துல்லியம் அவசியம்; மொழிபெயர்ப்பு மூல உள்ளடக்கத்தின் அசல் அர்த்தத்தைத் துல்லியமாகப் பாதுகாக்க வேண்டும். ஆனால் காலநீடிப்பு பின்பற்றுதல் ஒவ்வொன்றிலும் வேறுபட்ட பங்கு வகிக்கிறது. கேப்ஷன்களுக்கு, இது இருந்தால் நல்லது. டப்பிங்கிற்கு, இது மிக முக்கியம், ஏனெனில் மொழிபெயர்க்கப்பட்ட பேச்சு மிக நீளமாகவோ அல்லது மிகக் குறுகியதாகவோ இருந்தால், பொருள் சரியாக இருந்தாலும் அது இயல்பற்றதாக இருக்கும்.
இதனைச் சமாளிக்க, Descript, OpenAI ரீஸனிங் மாடல்களைப் பயன்படுத்தி தனது மொழிபெயர்ப்பு பைப்லைனை மறுவடிவமைத்து, உருவாக்கத்தின் போது (பின்னர் அல்ல) அர்த்த நம்பகத்தன்மை மற்றும் காலநீள இணக்கத்தை மேம்படுத்துமாறு ஒழுங்குபடுத்தியது. ரோல்அவுட்-க்கு பிறகு முதல் 30 நாட்களில், டப்பிங் உடன் மொழிபெயர்க்கப்பட்ட வீடியோக்களின் ஏற்றுமதிகள் 15% அதிகரித்தன, மேலும் மொழியைப் பொறுத்து, காலநீள இணக்கம் 13 முதல் 43 சதவீத புள்ளிகள் வரை மேம்பட்டது.
“டப்பிங் Descript இல் விருத்திபெறும் பிரபலமான பயன்பாடு ஆகி வருகிறது, ஆகவே முழு நூலகங்களை மொழிபெயர்த்து லிப்-சிங்க் செய்ய விரும்பும் நிறுவனங்களுக்கு அதை தொகுப்பாக செய்யும் வழிகளை நாம் உருவாக்குகிறோம்,” என்று CEO Laura Burkhauser கூறினார்.
மொழிபெயர்ப்பு என்பது Descript இன் ஆரம்பகால மற்றும் மிகவும் அதிகமாகக் கோரப்பட்ட அம்சங்களில் ஒன்றாகும். அவர்கள் கேப்ஷன்கள்-மட்டும் மொழிபெயர்ப்புடன் தொடங்கினர், அது நன்றாக வேலை செய்தது—ஆனால் பல பயனர்கள் மேலும் முன்னேறி, இலக்கு மொழியில் பேசும் ஆடியோ (டப்பிங்) இருக்க வேண்டும் என்று விரும்பினர்.
இருப்பினும், ஒரு பிரச்சனை தொடர்ந்து வெளிப்பட்டது: டப் செய்யப்பட்ட ஆடியோ எப்போதும் சரியாக இருக்கவில்லை. “மொழிபெயர்க்கப்பட்ட மொழியில் பேச்சின் வேகம் இயல்பற்றதாக இருந்தது என்பதே நாங்கள் கேட்ட மிக முக்கியமான புகார்,” என்று Descript நிறுவனத்தின் AI தயாரிப்பு தலைவர் Aleks Mistratov கூறினார்.
பிரச்சினை இறுதியில் இதற்கே வந்தது: வெவ்வேறு மொழிகள் ஒரே கருத்தை வெளிப்படுத்த வெவ்வேறு அளவு நேரம் எடுக்கும். உதாரணமாக, சராசரியாக ஜெர்மன் மொழி ஆங்கிலத்தை விட “நீளமான” மொழி என்று Descript கவனித்தது. நிலையான வீடியோ பகுதிகளில் பொருந்துவதற்காக, மொழிபெயர்க்கப்பட்ட பேச்சு பெரும்பாலும் செயற்கையாக வேகப்படுத்தப்படவோ அல்லது மெதுவாக்கப்படவோ வேண்டியிருந்தது. “இறுதியில் சிப்மங்க்ஸ் போல, அல்லது தூக்கமயமான ஒரு மாபெரும் மனிதன் போல ஒலிக்கும் ஒன்றை நீங்கள் பெறுவீர்கள்,” என்று Mistratov விளக்கினார்.
ஆங்கிலம்: | ஜெர்மன்: |
“இயந்திரத்தை இயக்குவதற்கு முன் பாதுகாப்பு வழிகாட்டுதல்களை மதிப்பாய்வு செய்யவும்.” அசைகள்: 18 | “இயந்திரத்தை இயக்குவதற்கு முன் பாதுகாப்பு வழிகாட்டுதல்களை தயவுசெய்து சரிபார்க்கவும்.” அசை எண்ணிக்கை: 24 (40% அதிகரிப்பு) |
இந்த நிலையில், ஜெர்மன் ஆடியோவை இயல்பற்ற வகையில் வேகப்படுத்த வேண்டியிருக்கும் அல்லது நேரத்திற்குள் பொருந்துமாறு மொழிபெயர்ப்பை மீண்டும் எழுத வேண்டியிருக்கும்.
பயனர்களுக்கு இரண்டு விருப்பங்கள் மட்டுமே இருந்தன: ஆடியோவை பகுதி பகுதியாக கைமுறையாக மீண்டும் நேரமிடுவது அல்லது நேரத்திற்குள் பொருந்துமாறு மொழிபெயர்ப்பை மீண்டும் எழுதுவது. இரு அணுகுமுறைகளும் ஆழமான காலவரிசை திருத்தங்களைத் தேவைப்படுத்தின, மேலும் பல நேரங்களில் இலக்கு மொழியில் தாய்மொழி பேசுபவருக்கு நிகரான சரளத்தையும் தேவைப்படுத்தின. இது உருவாக்குநர்களுக்கு சலிப்பூட்டுவதாக இருந்தது, மேலும் பெரிய எண்டர்பிரைஸ் உள்ளூர்மயமாக்கல் திட்டங்களுக்கு இந்த அம்சத்தை விரிவுபடுத்துவதற்கு ஒரு தடையாக மாறியது.
டப்பிங் செயல்பட என்ன தேவைப்படும் என்பதற்கான தெளிவான கோட்பாடு குழுவிடம் இருந்தது. அமைப்பு அர்த்தவியல் பொருளை மட்டும் மேம்படுத்துவதோடு அல்லாமல், நேரக் கட்டுப்பாடுகளையும் கருத்தில் கொள்ள வேண்டியிருக்கும். உதாரணமாக, ஆங்கிலத்திலிருந்து ஜெர்மனுக்கு மொழிபெயர்க்கும்போது, டப் செய்யப்பட்ட ஆடியோ இயல்பாகவே இருக்க, மாடல் குறைவான சொற்களை எவ்வாறு பயன்படுத்துவது அல்லது கருத்தை எவ்வாறு எளிமைப்படுத்துவது என்பதைப் புரிந்துகொள்ள வேண்டும்.
முந்தைய அணுகுமுறைகள் முதலில் சொற்பொருள் நம்பகத்தன்மையை மேம்படுத்தி, பின்னர் நேரத்தை சரிசெய்ய முயற்சித்தன. மொழிபெயர்ப்புகள் பெரும்பாலும் பொருள் ரீதியாகச் சரியாக இருந்தன, ஆனால் அவை வழக்கமாக காலஅளவு கட்டுப்பாடுகளை தவறவிட்டன, மேலும் ஒட்டுமொத்த தரமும் இன்னும் போதுமானதாக இல்லை.
“நாங்கள் படிப்படியான சோதனைகள் நடத்தினோம், எதையும் உருவாக்கவில்லை, உரையின் ஒரு பகுதியிலுள்ள அசைகளின் எண்ணிக்கையை வெளியிடுமாறு மாடலிடம் கேட்டோம்,” என்று Mistratov கூறினார். “முந்தைய மாடல்கள் அதில் சிறந்தவை அல்ல.”
நம்பகமான அசை எண்ணிக்கை முக்கியமானதாக மாறியது. மாடல் தொடர்ந்து அசை எண்ணிக்கையை கணக்கிட முடியாவிட்டால், அது குறிப்பிட்ட காலநீள சாளரத்தை நம்பகமாக இலக்கு வைக்க முடியாது.
GPT‑5 தொடர் மாடல்கள், குறிப்பாக அசை எண்ணிக்கை கணக்கிடுதல் மற்றும் கட்டுப்பாடு கண்காணித்தல் போன்ற பணிகளில், முந்தைய மாடல்களில் இல்லாத அளவிலான ரீஸனிங் ஒற்றுமைத்தன்மையை கொண்டு வந்தன. அந்த மேம்பாட்டுடன், Descript தனது மொழிபெயர்ப்பு மற்றும் டப்பிங் செயல்முறையை மறுவடிவமைத்தது.
முதலில், Descript’s அமைப்பு அசல் பதிவில் உள்ள வாக்கிய எல்லைகள், இயல்பான இடைவெளிகள் மற்றும் பேச்சு முறைகளை அடிப்படையாகக் கொண்டு எழுத்துருவாக்கத்தை பகுதிகளாகப் பிரிக்கிறது. ஒவ்வொரு துண்டும் அர்த்தவியல் தொடர்ச்சியைப் பராமரிக்கிறது, ஆனால் நேர அலகாகக் கருதி காரணம் கூறுவதற்கு போதுமான அளவு சிறியது.
அங்கிருந்து, மாடல் அந்த துண்டில் உள்ள அசை எண்ணிக்கையை கணக்கிடுகிறது. மொழி-சார்ந்த பேசும்-வேக முன்கணிப்புகளைப் பயன்படுத்தி, இயல்பான வேகத்தைப் பாதுகாக்க (“duration adherence”) மொழிபெயர்க்கப்பட்ட பகுதி எத்தனை அசை எண்ணிக்கையை இலக்காகக் கொள்ள வேண்டும் என்பதை முறைமை மதிப்பிடுகிறது. ப்ராம்ப்ட், காலநீட்சி கடைபிடிப்பும் அர்த்தப் பாதுகாப்பும் இரண்டிற்கும் மாடல் உகந்ததாக்க வேண்டும் என்று கேட்கிறது. சுற்றியுள்ள துண்டுகள் சூழலாக வழங்கப்படுகின்றன, இதனால் மாடல் பகுதிகளுக்கிடையே பொருளியல் ஒத்திசைவைப் பேணுகிறது.
கால அளவு இணக்கத்தை, அர்த்தத் துல்லியத்தை, தாமதத்தை மற்றும் செலவை சமநிலைப்படுத்த, குழு பல கட்டமைப்புகளை மதிப்பீடு செய்தது. தேர்ந்தெடுக்கப்பட்ட அமைப்பு உற்பத்தி வேகத்தில் வலுவான கட்டுப்பாடு-பின்பற்றுதலை வழங்கியது; கைமுறையான மறுநேரமிடல் இல்லாமல் அதிக அளவு மொழிபெயர்ப்பை சாத்தியமாக்கியது. இதன் விளைவாக, பின்னர் திருத்தப்படும் ஒன்றாக அல்லாமல், வேகநிலையை முதல் தர மாறிலியாகக் கருதும் ஒரு மொழிபெயர்ப்பு பைப்லைன் உருவாகிறது.
எவால்ஸிற்கான ஏற்றுக்கொள்ளும் அளவுகோல்களை உருவாக்க, குழு கேட்கும் சோதனைகளை நடத்தியது: அவர்கள் மொழிபெயர்க்கப்பட்ட ஆடியோ மாதிரிகளை உருவாக்கி, பிளேபேக் வேகத்தை சிறிய படிகளாகச் சரிசெய்தனர், பேச்சு இயல்பற்றதாக மாறிய நேரத்தை பயனர்கள் மதிப்பிடுமாறு கேட்டனர்.
“10% மெதுவாக்கப்பட்டதோ, அல்லது 20% வேகப்படுத்தப்பட்டதோ எதுவாக இருந்தாலும், பொதுவாக அது இன்னும் இயல்பாகவே இருந்தது,” என்று Mistratov கூறினார். இந்த வரம்பிற்கு அப்பால், பேச்சு மிக அதிகமாக சிதைந்துவிட்டது.
முந்தைய அமைப்புகள் அந்த அளவீட்டில் மோசமாக செயல்பட்டன. மொழியைப் பொறுத்து, ஏற்றுக்கொள்ளத்தக்க வேகச் சாளரத்திற்குள் 40% to 60% பகுதியே வந்தன. மறுவடிவமைக்கப்பட்ட பைப்லைன் மூலம், அந்த எண்ணிக்கை மொழியைப் பொறுத்து 40%–60% இலிருந்து 73% மற்றும் 83% இடையில் உயர்ந்தது.
குழு, 1 (“முழுமையாக வேறு”) முதல் 5 (“அர்த்தத்தில் சமம்”) வரை அளவுகோலில், தனி “model-as-judge” முறையை பயன்படுத்தி அர்த்தத் துல்லியத்தையும் மதிப்பீடு செய்தது. டப்பிங்கிற்காக, அவர்கள் கேப்ஷன் மட்டும் மொழிபெயர்ப்பில் இல்லாத கால எல்லைகளை பொருட்படுத்தாமல், குறைந்த அர்த்தத் துல்லியம் பரிமாணத்தை ஏற்க தீர்மானித்தனர். அந்த சமரசம் இருந்தபோதிலும், 85.5% பகுப்புகள் அர்த்த ஒத்திசைவில் ஐந்தில் நான்கு அல்லது ஐந்து என மதிப்பிடப்பட்டன.
இதன் விளைவு அளவிடக்கூடிய நம்பிக்கையுடன், நேரம் மற்றும் பொருள் என்ற இரண்டு போட்டியிடும் கட்டுப்பாடுகளை சமநிலைப்படுத்தக்கூடிய ஒரு அமைப்பாக இருந்தது. மேலும், இரு மெட்ரிக்ஸ்களும் தானியக்கமாக இருந்ததால், Descript அதே அளவுகோல்களுக்கு எதிராக புதிய மாடல் வெளியீடுகளையும் ப்ராம்ப்ட் மாறுபாடுகளையும் தொடர்ந்து மதிப்பீடு செய்ய முடிகிறது.
மொழிபெயர்ப்பு தனிப்பட்ட வீடியோக்களிலிருந்து பெரிய உள்ளடக்க நூலகங்களுக்கு நகரும் போது, தேவையான சமயங்களில் மேலும் கடுமையான அர்த்தத் துல்லியத்திற்கு முன்னுரிமை அளிக்கும் திறனையும் உட்பட, மொழிபெயர்ப்புகளை சீரமைப்பதில் Descript அதிக கட்டுப்பாட்டை உருவாக்குகிறது.
Descript-இன் உள்ளேயுள்ள மொழிபெயர்ப்பு, ஒரு பரந்த மல்டிமோடல் அமைப்பின் ஒரே ஒரு அடுக்கு மட்டுமே. மொழிபெயர்க்கப்பட்ட உரை பேச்சு உருவாக்கத்திற்குள் செல்கிறது; அது பின்னர் லிப் சிங்க் மற்றும் இறுதி வீடியோ ரெண்டரிங்கை இயக்குகிறது.
உரை அடுக்கில் செய்யப்பட்ட மேம்பாடுகள் இயல்பான வேகத்தை சாத்தியமாக்குகின்றன, ஆனால் ஒட்டுமொத்த அனுபவம் ஆடியோ மாடல் பேச்சின் தொனி, லயம், மற்றும் சொற்களற்ற பண்புகளை எவ்வளவு நன்றாகப் பாதுகாக்கிறது என்பதையும் சார்ந்துள்ளது. அதுதான் அடுத்த ஃப்ரண்டியர் குழு பார்க்கும் இடம்.
"மொழிபெயர்ப்பின் தரத்தை மேம்படுத்துவதற்கான முக்கிய அம்சம், மொழிபெயர்ப்பு செயல்முறையை மேலும் பன்முகத் தகவல் (Multimodal) அடிப்படையிலானதாக மாற்றுவதாகும். அதாவது, மொழிபெயர்ப்பைத் தீர்மானிக்கும்போது ஒலி, காணொளி மற்றும் உரை ஆகியவற்றை ஒருங்கிணைத்து பயன்படுத்த வேண்டும்," என்று Mistratov தெரிவித்தார். “அது தொனி மற்றும் வலியுறுத்தல் போன்ற பேச்சின் சொற்களற்ற பண்புகளை மேலும் சிறப்பாகப் பராமரிக்கவும், அசல் வழங்கலின் இன்னும் அதிகமான பகுதியைப் பாதுகாக்கவும் உதவும்.”
Descript-க்கு, வலுவான ரீஸனிங் மாடல்கள் டப்பிங் சிக்கலை எளிதாக்கின. வேகமும் அர்த்தமும் இடையிலான சமநிலைகளை மாடல்கள் நம்பகமாக சமாளிக்கக்கூடிய எல்லையைத் தாண்டியதன் மூலம், மொழிபெயர்ப்பு குழுவால் முறையாக மேம்படுத்தப்பட்டு, பெரிய அளவில் செயல்படுத்தப்பட்டது.


