Descript బహుభాషా వీడియో డబ్బింగ్ను ఎలా అభివృద్ధి చేస్తోంది
OpenAI రీజనింగ్ మోడల్స్ను ఉపయోగించి, టైమింగ్ లేదా అర్థాన్ని కోల్పోకుండా పెద్ద కంటెంట్ లైబ్రరీల ఆటోమేటిక్ లోకలైజేషన్ను Descript సాధ్యమయ్యేలా చేసింది.

ఫలితాలు
43
OpenAI తో వ్యవధి అనుసరణలో శాతం పాయింట్ల మెరుగుదల
ఫలితాలు
15%
రోల్అవుట్ తర్వాత డబ్ చేసిన ఎగుమతుల్లో పెరుగుదల
Descript(కొత్త విండోలో తెరుచుకుంటుంది) అనేది ఒక సరళమైన ఆలోచన చుట్టూ రూపొందించబడిన AI-నేటివ్ వీడియో ఎడిటర్: మీరు టెక్స్ట్ను ఎడిట్ చేయగలిగితే, వీడియోను కూడా ఎడిట్ చేయగలగాలి. Descript ప్రారంభ రోజుల నుంచే, ఉత్పత్తిలోని ప్రతి అంశానికి AI ఆధారంగా ఉంది: ట్రాన్స్క్రిప్షన్, ఎడిటింగ్, ఆడియో క్లీనప్, అలాగే మరింత సంక్లిష్టమవుతున్న సృజనాత్మక వర్క్ఫ్లోలు. వారు ఏళ్లుగా OpenAI ఆధారంగా రూపొందిస్తున్నారు, ట్రాన్స్క్రిప్షన్ కోసం Whisperను మరియు తమ సహ-ఎడిటర్ Underlordలో GPT సిరీస్ మోడల్స్ను ఉపయోగిస్తున్నారు.
అనువాదం త్వరగానే హై-ఇంపాక్ట్ యూజ్ కేస్గా అవతరించింది. సాంప్రదాయంగా, వీడియో అనువాదం నెమ్మదిగా మరియు ఖర్చుతో కూడుకున్నది. ప్రాజెక్టులను నిర్వహించడం, పునరావృత అనువాదాలను తయారుచేయడం, నాణ్యత నియంత్రణ నిర్వహించడం మరియు సంబంధిత ఆడియోను సృష్టించడం కోసం భాషా నిపుణులు అవసరమయ్యేవారు. LLMs ఆ వర్క్ఫ్లోను గణనీయంగా కుదించి, పెద్ద స్థాయిలో హై నాణ్యత అనువాదాన్ని సాధ్యం చేస్తాయి.
క్యాప్షన్లు మరియు డబ్బింగ్ రెండింటికీ అర్థపరమైన నిష్ఠ అవసరం: అనువాదం అసలు అర్థాన్ని సంరక్షించాలి. కానీ వ్యవధి అనుసరణ ప్రతి దాంట్లో వేరే పాత్రను పోషిస్తుంది. క్యాప్షన్ల విషయంలో, ఇది తప్పనిసరి కాదు కానీ ఉంటే మంచిది. డబ్బింగ్ కోసం ఇది అత్యంత కీలకం, ఎందుకంటే అనువదించిన మాటల వ్యవధి చాలా ఎక్కువగా లేదా చాలా తక్కువగా ఉంటే, అర్థం సరైనదైనా అది సహజంగా వినిపించదు.
దీనిని పరిష్కరించడానికి, Descript తన అనువాద పైప్లైన్ను OpenAI రీజనింగ్ మోడల్స్ ఉపయోగించి పునఃరూపకల్పన చేసింది, తద్వారా అర్థపరమైన విశ్వసనీయత మరియు వ్యవధి అనుసరణను తరువాత కాకుండా జనరేషన్ సమయంలోనే ఆప్టిమైజ్ చేయవచ్చు. అమలు ప్రారంభమైన తర్వాత మొదటి 30 రోజుల్లో, డబ్బింగ్తో అనువదించిన వీడియోల ఎగుమతులు 15% పెరిగాయి, అలాగే భాషను బట్టి వ్యవధి అనుసరణ 13 నుండి 43 శాతం పాయింట్ల వరకు మెరుగుపడింది.
“Descript కోసం డబ్బింగ్ అనేది వేగంగా ప్రాచుర్యం పొందుతున్న ఉపయోగ సందర్భం, కాబట్టి మొత్తం లైబ్రరీలను అనువదించి లిప్-సింక్ చేయాలనుకునే కంపెనీల కోసం దాన్ని బ్యాచ్గా చేయడానికి మార్గాలను మేము రూపొందిస్తున్నాం,” అని సీఈఓ లారా బర్క్హౌజర్ అన్నారు.
అనువాదం అనేది Descriptలో ప్రారంభం నుంచే అత్యధికంగా అభ్యర్థించబడిన ఫీచర్లలో ఒకటి. వారు మొదట కేవలం క్యాప్షన్ల అనువాదంతో ప్రారంభించారు, అది బాగా పనిచేసింది—కానీ చాలా మంది వినియోగదారులు మరింత ముందుకు Go చేసి లక్ష్య భాషలో మాటల ఆడియో (డబ్బింగ్) ఉండాలని కోరుకున్నారు.
అయితే, ఒక సమస్య మళ్లీ మళ్లీ తలెత్తుతూనే ఉంది: డబ్ చేసిన ఆడియో ఎల్లప్పుడూ సహజంగా అనిపించేది కాదు. “మేము విన్న ఫిర్యాదుల్లో బహుశా ప్రధానమైనది, అనువదించిన భాషలో మాటల వేగం సహజంగా లేదనేదే,” అని డిస్క్రిప్ట్లో AI ప్రొడక్ట్ హెడ్ అలెక్స్ మిస్ట్రాటోవ్ అన్నారు.
సమస్య చివరికి, అదే భావాన్ని వ్యక్తం చేయడానికి వేర్వేరు భాషల్లో పట్టే సమయం వేర్వేరుగా ఉంటుంది అనే విషయానికే వచ్చి చేరింది. ఉదాహరణకు, సగటున జర్మన్ అనేది ఇంగ్లీష్ కంటే “పొడవైన” భాష అని Descript గమనించింది. నిర్దిష్ట వీడియో సెగ్మెంట్లలో ఇమిడేలా, అనువదించిన మాటల ఆడియోను తరచుగా కృత్రిమంగా వేగవంతం చేయాల్సి లేదా నెమ్మదింపాల్సి వచ్చేది. “చివరికి నువ్వు చిప్మంక్లలా లేదా నిద్రమత్తులో ఉన్న రాక్షసుడిలా వినిపించే ఏదో ఒకటి దొరుకుతుంది,” అని మిస్ట్రాటోవ్ వివరించారు.
ఇంగ్లిష్: | జర్మన్: |
“యంత్రాన్ని ఆపరేట్ చేయడానికి ముందు దయచేసి భద్రతా మార్గదర్శకాలను సమీక్షించండి.” అచ్చులు: 18 | “యంత్రాన్ని ఆపరేట్ చేయడానికి ముందు దయచేసి భద్రతా మార్గదర్శకాలను పరిశీలించండి.” సిల్లబుల్స్: 24 (40% పెరుగుదల) |
ఈ సందర్భంలో, జర్మన్ ఆడియోను అసహజంగా వేగవంతం చేయాల్సి వస్తుంది, లేదా సమయ పరిమితికి సరిపడేలా అనువాదాన్ని మళ్లీ రాయాల్సి ఉంటుంది.
వినియోగదారులకు రెండు ఎంపికలే మిగిలాయి: ఆడియోను సెగ్మెంట్ వారీగా మాన్యువల్గా రీటైమ్ చేయడం, లేదా అది సరిపోయేలా అనువాదాన్నే తిరిగి రాయడం. ఈ రెండు విధానాలకూ టైమ్లైన్లో లోతైన సవరణలు చేయడం మరియు, తరచుగా, లక్ష్య భాషలో మాతృభాషా స్థాయికి సమీపమైన పట్టు అవసరమయ్యాయి. ఇది క్రియేటర్లకు శ్రమతో కూడినదిగా ఉండేది, అలాగే పెద్ద ఎంటర్ప్రైజ్ లోకలైజేషన్ ప్రాజెక్ట్లకు ఈ ఫీచర్ను స్కేల్ చేయడంలో అడ్డంకిగా మారింది.
డబ్బింగ్ను విజయవంతం చేయడానికి ఏమి అవసరమవుతుందో బృందానికి స్పష్టమైన సిద్ధాంతం ఉంది. సిస్టమ్ అర్థపరమైన భావాన్ని మాత్రమే ఆప్టిమైజ్ చేయకుండా, సమయ పరిమితుల గురించి కూడా అవగాహన కలిగి ఉండాలి. ఉదాహరణకు, ఇంగ్లీష్ నుంచి జర్మన్లోకి అనువదిస్తున్నప్పుడు, డబ్ చేసిన ఆడియో సహజంగా ఉండేలా మోడల్ తక్కువ పదాలను ఎలా ఉపయోగించాలో లేదా భావనను ఎలా సరళీకరించాలో అర్థం చేసుకోవాలి.
మునుపటి విధానాలు మొదట అర్థపరమైన నిష్ఠను మెరుగుపరచి, ఆ తర్వాత సమయాన్ని సరిచేయడానికి ప్రయత్నించాయి. అనువాదాలు తరచుగా అర్థపరంగా సరైనవే అయినప్పటికీ, అవి నిడివి పరిమితులను క్రమం తప్పకుండా పాటించలేదు, అలాగే మొత్తం నాణ్యత ఇంకా తగినంతగా లేదు.
“మేము దశలవారీ పరీక్షలు నిర్వహించాం. ఏదీ రూపొందించడం లేదు, కేవలం టెక్స్ట్లోని ఒక భాగంలో సిలబుల్స్ సంఖ్యను మోడల్కి అడిగాం,” అని మిస్ట్రాటోవ్ అన్నారు. “మునుపటి మోడల్స్ ఆ విషయంలో అంత బాగా పనిచేయలేకపోయేవి.”
నమ్మదగిన సిలబుల్ లెక్కింపు కీలకమని తేలింది. మోడల్ సిలబుల్లను స్థిరంగా లెక్కించలేకపోతే, అది నిర్దిష్ట వ్యవధి గడువును విశ్వసనీయంగా లక్ష్యంగా చేసుకోలేకపోయేది.
మునుపటి మోడల్స్లో లేని స్థాయి రీజనింగ్ కన్సిస్టెన్సీని GPT‑5 సిరీస్ మోడల్స్ అందించాయి, ముఖ్యంగా సిలబుల్ కౌంటింగ్ మరియు కన్స్ట్రెయింట్ ట్రాకింగ్ వంటి టాస్క్స్లో. ఆ మెరుగుదలతో, Descript తన అనువాదం మరియు డబ్బింగ్ పైప్లైన్ను పునర్రూపకల్పన చేసింది.
ముందుగా, Descript వ్యవస్థ అసలు రికార్డింగ్లోని వాక్య సరిహద్దులు, సహజ విరామాలు మరియు మాట్లాడే నమూనాల ఆధారంగా ట్రాన్స్క్రిప్ట్ను భాగాలుగా విభజిస్తుంది. ప్రతి ఖండం అర్థపరమైన నిరంతరత్వాన్ని కలిగి ఉంటుంది, కానీ టైమింగ్ యూనిట్గా విశ్లేషించడానికి సరిపడా చిన్నదిగా ఉంటుంది.
అక్కడి నుండి, మోడల్ భాగంలో ఉన్న అక్షరాల సంఖ్యను లెక్కిస్తుంది. భాషకు ప్రత్యేకమైన మాట్లాడే వేగ అంచనాలను ఉపయోగించి, సహజమైన గమనాన్ని కాపాడేందుకు అనువదించిన భాగం ఎన్ని అక్షరాలు లక్ష్యంగా పెట్టుకోవాలో సిస్టమ్ అంచనా వేస్తుంది (“వ్యవధి అనుసరణ”). వ్యవధి అనుసరణ మరియు అర్థ పరిరక్షణ రెండింటినీ మెరుగుపరచమని ప్రాంప్ట్ మోడల్ను అడుగుతుంది. మోడల్ సెగ్మెంట్ల మధ్య అర్థపూర్వక సమన్వయాన్ని నిలుపుకోవడానికి, చుట్టుపక్కల భాగాలను సందర్భంగా అందిస్తారు.
వ్యవధి అనుసరణ, అర్థపరమైన నిష్ఠ, విలంబం మరియు ఖర్చు మధ్య సమతుల్యాన్ని సాధించడానికి బృందం అనేక కాన్ఫిగరేషన్లను మూల్యాంకనం చేసింది. ఎంచుకున్న సెటప్ ప్రొడక్షన్ వేగంలో పరిమితులను బలంగా అనుసరించే సామర్థ్యాన్ని అందించింది, మాన్యువల్ రీటైమింగ్ అవసరం లేకుండా హై-వాల్యూమ్ అనువాదాన్ని సాధ్యం చేసింది. ఫలితంగా, గతి అనేది తర్వాత సరిచేయాల్సిన అంశం కాకుండా, ప్రథమ-శ్రేణి వేరియబుల్గా పరిగణించబడే అనువాద పైప్లైన్ ఏర్పడుతుంది.
మూల్యాంకనాల కోసం ఆమోద ప్రమాణాలను రూపొందించడానికి, బృందం శ్రవణ పరీక్షలు నిర్వహించింది: వారు అనువదించిన ఆడియో నమూనాలను సృష్టించి, ప్లేబ్యాక్ వేగాన్ని చిన్న చిన్న దశల్లో సర్దుబాటు చేస్తూ, మాట ఎప్పుడు అసహజంగా అనిపించిందో వినియోగదారులను అడిగి రేట్ చేయమని కోరారు.
“10% నెమ్మదింపబడిన లేదా 20% వేగవంతం చేయబడిన ఏదైనా సాధారణంగా ఇప్పటికీ సహజంగానే వినిపించింది,” అని మిస్ట్రాటోవ్ అన్నారు. ఈ పరిధికి మించి, మాట చాలా వక్రీకృతమైంది.
ఆ ప్రమాణం ప్రకారం, మునుపటి సిస్టమ్లు పేలవమైన పనితీరును కనబరిచాయి. భాషను బట్టి, కేవలం 40% నుండి 60% వరకు సెగ్మెంట్లు మాత్రమే ఆమోదయోగ్యమైన పేసింగ్ విండోలోకి వచ్చాయి. రీడిజైన్ చేసిన పైప్లైన్తో, భాషను బట్టి ఆ సంఖ్య 40%-60% నుండి 73% నుండి 83% వరకు పెరిగింది.
బృందం 1 (“పూర్తిగా భిన్నమైనది”) నుండి 5 (“అర్థపరంగా సమానమైనది”) వరకు ఉండే స్కేల్పై, ప్రత్యేక మోడల్-యాజ్-జడ్జ్ రేటింగ్ను ఉపయోగించి అర్థపరమైన విశ్వసనీయతను కూడా మూల్యాంకనం చేసింది. డబ్బింగ్ కోసం, వ్యవధి పరిమితులు వర్తించని కేవలం క్యాప్షన్ అనువాదంతో పోలిస్తే, తక్కువ అర్థపరమైన ప్రమాణాన్ని అంగీకరించాలని వారు నిర్ణయించారు. ఆ పరస్పర సర్దుబాటు ఉన్నప్పటికీ, 85.5% సెగ్మెంట్లు అర్థపరమైన అనుసరణ విషయంలో 5లో 4 లేదా 5 రేటింగ్ పొందాయి.
ఫలితంగా, టైమింగ్ మరియు అర్థం అనే పరస్పరం పోటీపడే రెండు పరిమితులను కొలవగల నమ్మక స్థాయితో సమతుల్యం చేయగల వ్యవస్థ లభించింది. రెండు మెట్రిక్స్ కూడా ఆటోమేటెడ్ కావడంతో, Descript కొత్త మోడల్ విడుదలలు మరియు ప్రాంప్ట్ వేరియేషన్లను అదే బెంచ్మార్క్లతో పోల్చి నిరంతరం మూల్యాంకనం చేయగలదు.
అనువాదం ఒక్కో వీడియో నుంచి పెద్ద కంటెంట్ లైబ్రరీల వరకు విస్తరిస్తుండగా, అవసరమైనప్పుడు మరింత కఠినమైన అర్థపరమైన నిష్ఠకు ప్రాధాన్యం ఇవ్వగల సామర్థ్యంతో సహా, అనువాదాలను సర్దుబాటు చేసే విధానంపై Descript మరింత నియంత్రణను రూపొందిస్తోంది.
Descriptలోని అనువాదం, మరింత విస్తృతమైన మల్టీమోడల్ వ్యవస్థలో కేవలం ఒక పొర మాత్రమే. అనువదించిన టెక్స్ట్ స్పీచ్ జనరేషన్కు ఇన్పుట్గా వెళ్తుంది, అది తరువాత లిప్ సింక్ మరియు తుది వీడియో రెండరింగ్ను నడిపిస్తుంది.
టెక్స్ట్ లేయర్లో చేసిన మెరుగుదలలు సహజమైన పేసింగ్ను సాధ్యమయ్యేలా చేస్తాయి, కానీ మొత్తం అనుభవం ఆడియో మోడల్ మాటల టోన్, కేడెన్స్ మరియు మాట్లాడే విధానంలోని నాన్వర్బల్ లక్షణాలను ఎంత బాగా కాపాడుతుందనేదానిపై కూడా ఆధారపడి ఉంటుంది. బృందం తదుపరి సరిహద్దును అక్కడే చూస్తోంది.
“అనువాద అవుట్పుట్ను మెరుగుపరచడంలో పెద్ద భాగం పైప్లైన్ను మరింత మల్టీమోడల్గా మార్చడమే: ఎలా అనువదించాలో నిర్ణయించేటప్పుడు ఆడియో, వీడియో, టెక్స్ట్లను కలిపి పరిగణనలోకి తీసుకోవడం,” అని మిస్ట్రటోవ్ అన్నారు. “దాంతో స్వరభావం, నొక్కి చెప్పడం వంటి మాటల అమౌఖిక లక్షణాలను మరింత మెరుగ్గా నిలుపుకోవడమే కాకుండా, అసలు చెప్పిన తీరును కూడా ఇంకా ఎక్కువగా సంరక్షించవచ్చు.”
Descript కోసం, మరింత శక్తివంతమైన రీజనింగ్ మోడల్స్ డబ్బింగ్లోని సంక్లిష్టతను నిర్వహించగలిగేలా చేశాయి. పేసింగ్ మరియు అర్థం మధ్య ఉండే రాజీలను మోడల్స్ విశ్వసనీయంగా సమతుల్యం చేయగల స్థాయిని దాటడంతో, అనువాదం అనేది టీమ్ వ్యవస్థబద్ధంగా మెరుగుపరచగలిగే మరియు పెద్ద స్థాయిలో డిప్లాయ్ చేయగలిగే అంశంగా మారింది.


