Descript ಮಹಾ ಪ್ರಮಾಣದಲ್ಲಿ ಬಹುಭಾಷಾ ವೀಡಿಯೊ ಡಬ್ಬಿಂಗ್ ರೂಪಿಸುವುದು ಹೇಗೆ
OpenAI ರೀಜನಿಂಗ್ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸಿಕೊಂಡು, Descript ಸಮಯ ಅಥವಾ ಅರ್ಥವನ್ನು ಕಳೆದುಕೊಳ್ಳದೆ ದೊಡ್ಡ ವಿಷಯ ಲೈಬ್ರರಿಗಳ ಸ್ವಯಂಚಾಲಿತ ಸ್ಥಳೀಕರಣವನ್ನು ಸಾಧಿಸಿತು.

ಫಲಿತಾಂಶಗಳು
43
OpenAI ಬಳಸಿ ಅವಧಿ ಪಾಲನೆಯಲ್ಲಿ ಶೇಕಡಾ ಅಂಕ ಸುಧಾರಣೆ
ಫಲಿತಾಂಶಗಳು
15%
ರೋಲೌಟ್ ನಂತರ ಡಬ್ಬಿಂಗ್ ಮಾಡಿದ ಎಕ್ಸ್ಪೋರ್ಟ್ಗಳಲ್ಲಿ ಹೆಚ್ಚಳ
Descript(ಹೊಸ ಕಿಟಕಿಯಲ್ಲಿ ತೆರೆಯುತ್ತದೆ) ಒಂದು AI-ನೇಟಿವ್ ವೀಡಿಯೊ ಸಂಪಾದಕವಾಗಿದ್ದು ಒಂದು ಸರಳ ಆಲೋಚನೆಯ ಸುತ್ತ ನಿರ್ಮಿಸಲಾಗಿದೆ: ನೀವು ಪಠ್ಯವನ್ನು ಸಂಪಾದಿಸಬಲ್ಲಿರಾದರೆ, ನೀವು ವೀಡಿಯೊವನ್ನೂ ಸಂಪಾದಿಸಬಲ್ಲವರಾಗಿರಬೇಕು. Descript ನ ಆರಂಭಿಕ ದಿನಗಳಿಂದಲೇ, AI ಉತ್ಪನ್ನದ ಪ್ರತಿಯೊಂದು ಅಂಶಕ್ಕೂ ಶಕ್ತಿ ತುಂಬಿದೆ: ಲಿಪ್ಯಂತರ, ಸಂಪಾದನೆ, ಆಡಿಯೊ ಸ್ವಚ್ಛಗೊಳಿಸುವಿಕೆ ಮತ್ತು ಹೆಚ್ಚುತ್ತಿರುವ ಸಂಕೀರ್ಣ ಸೃಜನಶೀಲ ಕೆಲಸದ ಹರಿವುಗಳು. ಅವರು ವರ್ಷಗಳಿಂದ OpenAI ಮೇಲೆ ನಿರ್ಮಿಸುತ್ತಿದ್ದಾರೆ, ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಷನ್ಗಾಗಿ Whisper ಅನ್ನು ಮತ್ತು ತಮ್ಮ ಸಹ-ಸಂಪಾದಕ Underlord ಒಳಗೆ GPT ಸರಣಿ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸುತ್ತಿದ್ದಾರೆ.
ಅನುವಾದವು ತ್ವರಿತವಾಗಿ ಹೆಚ್ಚಿನ ಪ್ರಭಾವ ಬೀರುವ ಬಳಕೆಯ ಸಂದರ್ಭವಾಗಿ ಹೊರಹೊಮ್ಮಿತು. ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ, ವೀಡಿಯೋವನ್ನು ಅನುವಾದಿಸುವುದು ನಿಧಾನ ಮತ್ತು ದುಬಾರಿಯಾಗಿತ್ತು, ಯೋಜನೆಗಳನ್ನು ನಿರ್ವಹಿಸಲು, ಯಾಂತ್ರಿಕ ಅನುವಾದಗಳನ್ನು ತಯಾರಿಸಲು, ಗುಣಮಟ್ಟ ನಿಯಂತ್ರಣವನ್ನು ನಿರ್ವಹಿಸಲು ಮತ್ತು ಹೊಂದಾಣಿಕೆಯ ಆಡಿಯೋವನ್ನು ಸೃಷ್ಟಿಸಲು ಭಾಷಾ ತಜ್ಞರ ಅಗತ್ಯವಿತ್ತು. LLMs ಆ ಕಾರ್ಯಪ್ರವಾಹವನ್ನು ಗಣನೀಯವಾಗಿ ಸಂಕುಚಿತಗೊಳಿಸುತ್ತವೆ, ಇದರಿಂದ ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ಉನ್ನತ ಗುಣಮಟ್ಟದ ಅನುವಾದವನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತವೆ.
ಕ್ಯಾಪ್ಷನ್ಗಳು ಮತ್ತು ಡಬ್ಬಿಂಗ್ ಎರಡಕ್ಕೂ ಶಬ್ದಾರ್ಥ ನಿಷ್ಠೆ ಅಗತ್ಯ: ಅನುವಾದವು ಮೂಲ ಅರ್ಥವನ್ನು ಸಂರಕ್ಷಿಸಬೇಕು. ಆದರೆ ಅವಧಿ ಪಾಲನೆ ಪ್ರತಿಯೊಂದರಲ್ಲಿ ವಿಭಿನ್ನ ಪಾತ್ರ ವಹಿಸುತ್ತದೆ. ಶೀರ್ಷಿಕೆಗಳಿಗಾಗಿ, ಇದು ಇದ್ದರೆ ಒಳ್ಳೆಯದು. ಡಬ್ಬಿಂಗ್ಗಾಗಿ, ಇದು ಅತ್ಯಂತ ಮಹತ್ವದ್ದಾಗಿದೆ, ಏಕೆಂದರೆ ಅನುವಾದಿತ ಮಾತು ತುಂಬಾ ಉದ್ದವಾಗಿದೆಯಾದರೂ ಅಥವಾ ತುಂಬಾ ಚಿಕ್ಕದಾಗಿದೆಯಾದರೂ, ಅರ್ಥ ಸರಿಯಾಗಿದ್ದರೂ ಸಹ ಅದು ಅಸ್ವಾಭಾವಿಕವಾಗಿ ಕೇಳಿಸುತ್ತದೆ.
ಇದನ್ನು ಪರಿಹರಿಸಲು, Descript ತನ್ನ ಅನುವಾದ ಪೈಪ್ಲೈನ್ ಅನ್ನು OpenAI ರೀಜನಿಂಗ್ ಮಾಡೆಲ್ಗಳನ್ನು ಬಳಸಿ ಮರು ವಿನ್ಯಾಸಗೊಳಿಸಿತು, ಅರ್ಥಾತ್ಮಕ ನಿಷ್ಠೆ ಮತ್ತು ಅವಧಿ ಅನುಗುಣತೆಯನ್ನು ಉತ್ಪಾದನೆಯ ಸಮಯದಲ್ಲೇ ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲು, ನಂತರ ಅಲ್ಲ. ರೋಲೌಟ್ ನಂತರದ ಮೊದಲ 30 ದಿನಗಳಲ್ಲಿ, ಡಬ್ಬಿಂಗ್ನೊಂದಿಗೆ ಅನುವಾದಿತ ವೀಡಿಯೊಗಳ ಎಕ್ಸ್ಪೋರ್ಟ್ಗಳು 15% ಹೆಚ್ಚಾದವು ಮತ್ತು ಭಾಷೆಯ ಮೇಲೆ ಅವಲಂಬಿಸಿ, ಅವಧಿ ಅನುಸರಣೆ 13 ರಿಂದ 43 ಶೇಕಡಾ ಅಂಕಗಳಷ್ಟು ಸುಧಾರಿಸಿತು.
“ಡಬ್ಬಿಂಗ್ Descript ಗೆ ಹೆಚ್ಚು ಜನಪ್ರಿಯ ಬಳಕೆ ಪ್ರಕರಣವಾಗಿದೆ, ಆದ್ದರಿಂದ ಸಂಪೂರ್ಣ ಲೈಬ್ರರಿಗಳನ್ನು ಅನುವಾದಿಸಿ ಮತ್ತು ಲಿಪ್-ಸಿಂಕ್ ಮಾಡಲು ಬಯಸುವ ಕಂಪನಿಗಳಿಗಾಗಿ ಅದನ್ನು ಬ್ಯಾಚ್ನಲ್ಲಿ ಮಾಡಲು ನಾವು ಮಾರ್ಗಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದೇವೆ,” ಎಂದು CEO ಲಾರಾ ಬರ್ಕ್ಹೌಸರ್ ಹೇಳಿದರು.
ಅನುವಾದವು Descript’s ನ ಅತ್ಯಂತ ಆರಂಭಿಕ ಮತ್ತು ಅತ್ಯಂತ ಹೆಚ್ಚು ವಿನಂತಿಸಲಾದ ವೈಶಿಷ್ಟ್ಯಗಳಲ್ಲಿ ಒಂದಾಗಿತ್ತು. ಅವರು ಕ್ಯಾಪ್ಷನ್ಗಳು ಮಾತ್ರ ಇರುವ ಅನುವಾದದಿಂದ ಆರಂಭಿಸಿದರು, ಅದು ಚೆನ್ನಾಗಿ ಕೆಲಸ ಮಾಡಿತು—ಆದರೆ ಅನೇಕ ಬಳಕೆದಾರರು ಇನ್ನಷ್ಟು ಮುಂದುವರಿದು ಗುರಿ ಭಾಷೆಯಲ್ಲಿ ಮಾತನಾಡುವ ಆಡಿಯೋ (ಡಬ್ಬಿಂಗ್) ಕೂಡ ಬಯಸಿದರು.
ಆದರೆ, ಒಂದು ಸಮಸ್ಯೆ ಮತ್ತೆ ಮತ್ತೆ ಹೊರಬರುತ್ತಲೇ ಇತ್ತು: ಡಬ್ ಮಾಡಿದ ಆಡಿಯೊ ಯಾವಾಗಲೂ ಸರಿಯಾಗಿ ಕೇಳಿಸುತ್ತಿರಲಿಲ್ಲ. “ಅನುವಾದಿತ ಭಾಷೆಯಲ್ಲಿ ಮಾತಿನ ವೇಗವು ನೈಸರ್ಗಿಕವಲ್ಲ ಎಂದು ನಾವು ಕೇಳಿದ ಬಹುಶಃ ಮೊದಲನೇ ದೂರು,” ಎಂದು Descriptನಲ್ಲಿ AI ಉತ್ಪನ್ನದ ಮುಖ್ಯಸ್ಥ ಆಗಿರುವ ಅಲೆಕ್ಸ್ ಮಿಸ್ಟ್ರಾಟೊವ್ ಹೇಳಿದರು.
ಸಮಸ್ಯೆ ಕೊನೆಗೆ ಈ ವಿಷಯಕ್ಕೆ ಇಳಿಯಿತು: ವಿಭಿನ್ನ ಭಾಷೆಗಳು ಅದೇ ಕಲ್ಪನೆಯನ್ನು ವ್ಯಕ್ತಪಡಿಸಲು ವಿಭಿನ್ನ ಪ್ರಮಾಣದ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಸರಾಸರಿಯಾಗಿ ಜರ್ಮನ್ ಇಂಗ್ಲಿಷ್ಗಿಂತ “ಉದ್ದ” ಭಾಷೆಯಾಗಿದೆ ಎಂದು Descript ಗಮನಿಸಿತು. ನಿಶ್ಚಿತ ವೀಡಿಯೊ ವಿಭಾಗಗಳಿಗೆ ಹೊಂದಿಸಲು, ಅನುವಾದಿತ ಭಾಷಣವನ್ನು ಕೃತಕವಾಗಿ ವೇಗಗೊಳಿಸಬೇಕಾಗುತ್ತಿತ್ತು ಅಥವಾ ನಿಧಾನಗೊಳಿಸಬೇಕಾಗುತ್ತಿತ್ತು. “ನೀವು ಕೊನೆಗೆ ಚಿಪ್ಮಂಕ್ಗಳಂತೆ, ಅಥವಾ ನಿದ್ರಾವಸ್ಥೆಯಲ್ಲಿರುವ ದೈತ್ಯನಂತೆ ಕೇಳಿಸುವ ಯಾವುದೋ ಒಂದನ್ನು ಪಡೆಯುತ್ತೀರಿ,” ಎಂದು ಮಿಸ್ಟ್ರಾಟೋವ್ ವಿವರಿಸಿದರು.
ಇಂಗ್ಲಿಷ್: | ಜರ್ಮನ್: |
“ಯಂತ್ರವನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸುವ ಮೊದಲು ದಯವಿಟ್ಟು ಸುರಕ್ಷತಾ ಮಾರ್ಗಸೂಚಿಗಳನ್ನು ಪರಿಶೀಲಿಸಿ.” ಅಕ್ಷರಾಂಶಗಳು: 18 | “ಯಂತ್ರವನ್ನು ಚಾಲನೆ ಮಾಡುವ ಮೊದಲು ದಯವಿಟ್ಟು ಸುರಕ್ಷತಾ ಮಾರ್ಗಸೂಚಿಗಳನ್ನು ಪರಿಶೀಲಿಸಿ.” ಅಕ್ಷರಾಂಶಗಳು: 24 (40% ಹೆಚ್ಚಳ) |
ಈ ಸಂದರ್ಭದಲ್ಲಿ, ಜರ್ಮನ್ ಆಡಿಯೋವನ್ನು ಅಸ್ವಾಭಾವಿಕವಾಗಿ ವೇಗಗೊಳಿಸಬೇಕಾಗುತ್ತದೆ ಅಥವಾ ಸಮಯದ ಬಜೆಟ್ಗೆ ಹೊಂದಿಕೊಳ್ಳುವಂತೆ ಅನುವಾದವನ್ನು ಮರುಬರೆಯಬೇಕಾಗುತ್ತದೆ.
ಬಳಕೆದಾರರಿಗೆ ಎರಡು ಆಯ್ಕೆಗಳು ಮಾತ್ರ ಉಳಿದವು: ಆಡಿಯೋವನ್ನು ಸೆಗ್ಮೆಂಟ್ಗೊಂದು ಸೆಗ್ಮೆಂಟ್ವಾಗಿ ಕೈಯಾರೆ ಮರುಸಮಯಗೊಳಿಸುವುದು ಅಥವಾ ಅದು ಹೊಂದಿಕೊಳ್ಳುವಂತೆ ಅನುವಾದವನ್ನೇ ಮರುಬರೆಯುವುದು. ಎರಡೂ ವಿಧಾನಗಳಿಗೆ ಆಳವಾದ ಟೈಮ್ಲೈನ್ ಸಂಪಾದನೆಗಳು ಮತ್ತು, ಬಹುಶಃ, ಗುರಿ ಭಾಷೆಯಲ್ಲಿ ಸ್ಥಳೀಯರ ಸಮೀಪದ ಪ್ರಾವೀಣ್ಯತೆ ಅಗತ್ಯವಿತ್ತು. ಇದು ಕ್ರಿಯೇಟರ್ಗಳಿಗೆ ಕಷ್ಟಕರವಾಗಿತ್ತು ಮತ್ತು ದೊಡ್ಡ ಎಂಟರ್ಪ್ರೈಸ್ ಸ್ಥಳೀಕರಣ ಯೋಜನೆಗಳಿಗೆ ವೈಶಿಷ್ಟ್ಯವನ್ನು ವ್ಯಾಪಕಗೊಳಿಸಲು ತಡೆಗೋಡೆಯಾಯಿತು.
ಡಬ್ಬಿಂಗ್ ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಏನು ಬೇಕಾಗುತ್ತದೆ ಎಂಬುದರ ಬಗ್ಗೆ ತಂಡಕ್ಕೆ ಸ್ಪಷ್ಟವಾದ ಸಿದ್ಧಾಂತವಿತ್ತು. ವ್ಯವಸ್ಥೆಯು ಅರ್ಥಾತ್ಮಕ ಅರ್ಥಕ್ಕಾಗಿ ಮಾತ್ರವಲ್ಲದೆ, ಸಮಯದ ನಿರ್ಬಂಧಗಳ ಬಗ್ಗೆ ಅರಿವು ಹೊಂದಿರಲು ಆಪ್ಟಿಮೈಸ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಇಂಗ್ಲಿಷ್ನಿಂದ ಜರ್ಮನ್ಗೆ ಅನುವಾದಿಸುವಾಗ, ಡಬ್ ಮಾಡಿದ ಆಡಿಯೋ ಸಹಜವಾಗಲು, ಮಾಡೆಲ್ ಕಡಿಮೆ ಪದಗಳನ್ನು ಹೇಗೆ ಬಳಸಬೇಕು ಅಥವಾ ಕಲ್ಪನೆಯನ್ನು ಹೇಗೆ ಸರಳಗೊಳಿಸಬೇಕು ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬೇಕಾಗುತ್ತದೆ.
ಹಿಂದಿನ ವಿಧಾನಗಳು ಮೊದಲು ಶಬ್ದಾರ್ಥದ ನಿಷ್ಠೆಯನ್ನು ಸುಧಾರಿಸಿತು ಮತ್ತು ನಂತರ ಸಮಯವನ್ನು ಸರಿಪಡಿಸಲು ಪ್ರಯತ್ನಿಸಿತು. ಅನುವಾದಗಳು ಬಹುಸಾರ ಶಬ್ದಾರ್ಥದ ದೃಷ್ಟಿಯಿಂದ ಸರಿಯಾಗಿದ್ದವು, ಆದರೆ ಅವು ನಿಯಮಿತವಾಗಿ ಅವಧಿ ನಿರ್ಬಂಧಗಳನ್ನು ತಪ್ಪಿಸುತ್ತಿದ್ದವು ಮತ್ತು ಒಟ್ಟಾರೆ ಗುಣಮಟ್ಟ ಇನ್ನೂ ತೃಪ್ತಿಕರವಾಗಿರಲಿಲ್ಲ.
“ನಾವು ಕ್ರಮೇಣ ಪರೀಕ್ಷೆಗಳನ್ನು ನಡೆಸಿದ್ದೇವೆ, ಏನನ್ನೂ ಉತ್ಪಾದಿಸದೇ ಕೂಡ, ಕೇವಲ ಪಠ್ಯದ ಒಂದು ಭಾಗದಲ್ಲಿನ ಅಕ್ಷರಾಂಶಗಳ ಸಂಖ್ಯೆಯನ್ನು ಔಟ್ಪುಟ್ ಮಾಡಲು ಮಾಡೆಲ್ಗೆ ಕೇಳುತ್ತಿದ್ದೇವೆ,” ಎಂದು ಮಿಸ್ಟ್ರಾಟೋವ್ ಹೇಳಿದರು. “ಹಿಂದಿನ ಮಾಡೆಲ್ಗಳು ಅದರಲ್ಲಿ ಸರಳವಾಗಿ ಚೆನ್ನಾಗಿರಲಿಲ್ಲ.”
ವಿಶ್ವಾಸಾರ್ಹ ಅಕ್ಷರಾಂಶ ಎಣಿಕೆ ಅತ್ಯಂತ ಮುಖ್ಯವಾಗಿದೆ. ಮಾಡೆಲ್ ಸ್ಥಿರವಾಗಿ ಅಕ್ಷರಾಂಶಗಳನ್ನು ಲೆಕ್ಕ ಹಾಕಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ಅದು ನಿರ್ದಿಷ್ಟ ಅವಧಿ ವಿಂಡೋವನ್ನು ಗುರಿಯಾಗಿಸಲು ಸಾಧ್ಯವಾಗುವುದಿಲ್ಲ.
GPT‑5 ಸರಣಿಯ ಮಾಡೆಲ್ಗಳು ಹಿಂದಿನ ಮಾಡೆಲ್ಗಳಲ್ಲಿ ಕೊರತೆಯಾಗಿದ್ದ ರೀಜನಿಂಗ್ ಸ್ಥಿರತೆಯನ್ನು ತಂದವು, ವಿಶೇಷವಾಗಿ ಅಕ್ಷರಗಣನೆ ಮತ್ತು ನಿರ್ಬಂಧ ಟ್ರ್ಯಾಕಿಂಗ್ನಂತಹ ಕಾರ್ಯಗಳಲ್ಲಿ. ಆ ಸುಧಾರಣೆಯೊಂದಿಗೆ, Descript ತನ್ನ ಅನುವಾದ ಮತ್ತು ಡಬ್ಬಿಂಗ್ ಪೈಪ್ಲೈನ್ ಅನ್ನು ಮರು ವಿನ್ಯಾಸಗೊಳಿಸಿತು.
ಮೊದಲು, Descript ನ ಸಿಸ್ಟಮ್ ಮೂಲ ರೆಕಾರ್ಡಿಂಗ್ನಲ್ಲಿನ ವಾಕ್ಯ ಗಡಿಗಳು, ಸ್ವಾಭಾವಿಕ ವಿರಾಮಗಳು ಮತ್ತು ಮಾತನಾಡುವ ಮಾದರಿಗಳ ಮಾರ್ಗದರ್ಶನದೊಂದಿಗೆ ಲಿಪ್ಯಂತರವನ್ನು ಚಂಕ್ಗಳಾಗಿ ವಿಭಜಿಸುತ್ತದೆ. ಪ್ರತಿ ಚಂಕ್ ಅರ್ಥವ್ಯವಸ್ಥೆಯ ನಿರಂತರತೆಯನ್ನು ಕಾಪಾಡುತ್ತದೆ, ಆದರೆ ಸಮಯ ಘಟಕವಾಗಿ ಅದರ ಬಗ್ಗೆ ತರ್ಕಿಸಲು ಸಾಕಷ್ಟು ಚಿಕ್ಕದಾಗಿದೆ.
ಅಲ್ಲಿಂದ, ಮಾಡೆಲ್ ಭಾಗದಲ್ಲಿನ ಅಕ್ಷರಾಂಶಗಳ ಸಂಖ್ಯೆಯನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುತ್ತದೆ. ಭಾಷೆ-ನಿರ್ದಿಷ್ಟ ಮಾತನಾಡುವ-ವೇಗದ ಊಹೆಗಳ ಆಧಾರದ ಮೇಲೆ, ಸಹಜ ಗತಿಯನ್ನೇ ಉಳಿಸಿಕೊಳ್ಳಲು (“ಅವಧಿಯ ಅನುಸರಣೆ”) ಅನುವಾದಿತ ಭಾಗವು ಎಷ್ಟು ಅಕ್ಷರಾಂಶಗಳನ್ನು ಗುರಿಯಾಗಿರಿಸಬೇಕು ಎಂದು ಸಿಸ್ಟಮ್ ಅಂದಾಜಿಸುತ್ತದೆ. ಪ್ರಾಂಪ್ಟ್ ಮಾಡೆಲ್ಗೆ ಅವಧಿ ಅನುಗುಣತೆ ಮತ್ತು ಅರ್ಥ ಸಂರಕ್ಷಣೆ ಎರಡಕ್ಕೂ ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲು ಕೇಳುತ್ತದೆ. ಸುತ್ತಮುತ್ತಲಿನ ಚಂಕ್ಗಳನ್ನು ಸನ್ನಿವೇಶವಾಗಿ ಪಾಸ್ ಮಾಡಲಾಗುತ್ತದೆ, ಇದರಿಂದ ಮಾಡೆಲ್ ವಿಭಾಗಗಳಾದ್ಯಂತ ಅರ್ಥಾತ್ಮಕ ಸುಸಂಬದ್ಧತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುತ್ತದೆ.
ತಂಡವು ಅವಧಿ ಅನುಸರಣೆ, ಅರ್ಥಾತ್ಮಕ ನಿಷ್ಠೆ, ಲೇಟೆನ್ಸಿ ಮತ್ತು ವೆಚ್ಚವನ್ನು ಸಮತೋಲನಗೊಳಿಸಲು ಅನೇಕ ಸಂರಚನೆಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿತು. ಆಯ್ಕೆಮಾಡಿದ ಸೆಟಪ್ ಉತ್ಪಾದನಾ ವೇಗದಲ್ಲಿ ಬಲವಾದ ನಿರ್ಬಂಧ-ಅನುಸರಣೆಯನ್ನು ಒದಗಿಸಿತು, ಕೈಯಿಂದ ಮರುಸಮಯಗೊಳಿಸುವಿಕೆ ಇಲ್ಲದೆ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಅನುವಾದವನ್ನು ಸಾಧ್ಯವಾಗಿಸಿತು. ಫಲಿತಾಂಶವು ಒಂದು ಅನುವಾದ ಪೈಪ್ಲೈನ್ ಆಗಿದ್ದು, ಅದರಲ್ಲಿ ಪೇಸಿಂಗ್ ಅನ್ನು ನಂತರ ಸರಿಪಡಿಸುವ ವಿಷಯವಾಗಿ ಅಲ್ಲದೆ ಪ್ರಥಮ ದರ್ಜೆಯ ಚರವಾಗಿ ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ.
ಎವಾಲ್ಸ್ಗಾಗಿ ಸ್ವೀಕಾರ ಮಾನದಂಡಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಲು, ತಂಡವು ಶ್ರವಣ ಪರೀಕ್ಷೆಗಳನ್ನು ನಡೆಸಿತು: ಅವರು ಅನುವಾದಿತ ಆಡಿಯೋ ಮಾದರಿಗಳನ್ನು ರಚಿಸಿ, ಪ್ಲೇಬ್ಯಾಕ್ ವೇಗವನ್ನು ಸಣ್ಣ ಪ್ರಮಾಣದಲ್ಲಿ ಹೊಂದಿಸಿದರು ಮತ್ತು ಭಾಷಣ ಅಸ್ವಾಭಾವಿಕವಾಗುವಾಗ ಬಳಕೆದಾರರಿಂದ ಮೌಲ್ಯಮಾಪನವನ್ನು ಕೇಳಿದರು.
“10% ನಿಧಾನಗೊಳಿಸಿದರೂ ಅಥವಾ 20% ವೇಗಗೊಳಿಸಿದರೂ, ಸಾಮಾನ್ಯವಾಗಿ ಇನ್ನೂ ಸಹ ಸ್ವಾಭಾವಿಕವಾಗಿಯೇ ಕೇಳಿಸುತ್ತಿತ್ತು,” ಎಂದು ಮಿಸ್ಟ್ರಾಟೋವ್ ಹೇಳಿದರು. ಈ ವ್ಯಾಪ್ತಿಯನ್ನು ಮೀರಿ, ಭಾಷಣವು ತುಂಬಾ ವಿಕೃತವಾಯಿತು.
ಹಿಂದಿನ ವ್ಯವಸ್ಥೆಗಳು ಆ ಮಾಪನದ ಪ್ರಕಾರ ದುರ್ಬಲವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿವೆ. ಭಾಷೆಯ ಮೇಲೆ ಅವಲಂಬಿಸಿ, ಕೇವಲ 40% ರಿಂದ 60% ವರೆಗೆ ವಿಭಾಗಗಳು ಸ್ವೀಕಾರಾರ್ಹ ಪೇಸಿಂಗ್ ವಿಂಡೋ ಒಳಗೆ ಬಂದವು. ಮರುವಿನ್ಯಾಸಗೊಳಿಸಿದ ಪೈಪ್ಲೈನ್ನೊಂದಿಗೆ, ಆ ಸಂಖ್ಯೆ ಭಾಷೆಯ ಮೇಲೆ ಅವಲಂಬಿಸಿ 40%–60% ರಿಂದ 73% ರಿಂದ 83% ಗೆ ಹೆಚ್ಚಾಗಿದೆ.
ತಂಡವು 1 (“ಸಂಪೂರ್ಣವಾಗಿ ವಿಭಿನ್ನ”) ರಿಂದ 5 (“ಅರ್ಥಾತ್ಮಕವಾಗಿ ಸಮಾನ”) ವರೆಗೆ ಇರುವ ಮಾಪಕದಲ್ಲಿ ಪ್ರತ್ಯೇಕ ಮಾಡೆಲ್-ಆಸ್-ಜಡ್ಜ್ ರೇಟಿಂಗ್ ಬಳಸಿ ಅರ್ಥಾತ್ಮಕ ನಿಷ್ಠೆಯನ್ನೂ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿತು. ಡಬ್ಬಿಂಗ್ಗಾಗಿ, ಅವಧಿ ನಿರ್ಬಂಧಗಳು ಅಪ್ರಸ್ತುತವಾಗಿರುವ ಕ್ಯಾಪ್ಷನ್-ಮಾತ್ರ ಅನುವಾದಕ್ಕಿಂತ ಕಡಿಮೆ ಶಬ್ದಾರ್ಥ ಮಿತಿಯನ್ನು ಸ್ವೀಕರಿಸಲು ಅವರು ನಿರ್ಧರಿಸಿದರು. ಆ ವಿನಿಮಯದ ಹೊರತಾಗಿಯೂ, 85.5% ವಿಭಾಗಗಳನ್ನು ಅರ್ಥಾತ್ಮಕ ಅನುಸರಣೆಗೆ ಐದರಲ್ಲಿ ನಾಲ್ಕು ಅಥವಾ ಐದು ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗಿದೆ.
ಫಲಿತಾಂಶವು ಅಳೆಯಬಹುದಾದ ಆತ್ಮವಿಶ್ವಾಸದೊಂದಿಗೆ ಸಮಯ ಮತ್ತು ಅರ್ಥ ಎಂಬ ಎರಡು ಸ್ಪರ್ಧಾತ್ಮಕ ನಿರ್ಬಂಧಗಳನ್ನು ಸಮತೋಲನಗೊಳಿಸಬಲ್ಲ ವ್ಯವಸ್ಥೆಯಾಗಿತ್ತು. ಮತ್ತು ಎರಡೂ ಮೆಟ್ರಿಕ್ಗಳು ಸ್ವಯಂಚಾಲಿತವಾಗಿದ್ದರಿಂದ, Descript ಅದೇ ಮಾನದಂಡಗಳ ವಿರುದ್ಧ ಹೊಸ ಮಾಡೆಲ್ ಬಿಡುಗಡೆಗಳು ಮತ್ತು ಪ್ರಾಂಪ್ಟ್ ವ್ಯತ್ಯಾಸಗಳನ್ನು ನಿರಂತರವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.
ಅನುವಾದವು ಒಂದೇ ವೀಡಿಯೊಗಳಿಂದ ದೊಡ್ಡ ವಿಷಯ ಗ್ರಂಥಾಲಯಗಳತ್ತ ಸಾಗುತ್ತಿದ್ದಂತೆ, ಅಗತ್ಯವಿದ್ದಾಗ ಕಟ್ಟುನಿಟ್ಟಾದ ಅರ್ಥಾತ್ಮಕ ನಿಷ್ಠೆಗೆ ಆದ್ಯತೆ ನೀಡಲು, ಅನುವಾದಗಳನ್ನು ಹೊಂದಿಸಲು Descript ಹೆಚ್ಚು ನಿಯಂತ್ರಣವನ್ನು ನಿರ್ಮಿಸುತ್ತಿದೆ.
Descript ಒಳಗಿನ ಅನುವಾದವು ವಿಶಾಲವಾದ ಮಲ್ಟಿಮೋಡಲ್ ವ್ಯವಸ್ಥೆಯ ಕೇವಲ ಒಂದು ಪದರ ಮಾತ್ರ. ಅನುವಾದಿತ ಪಠ್ಯವು ಮಾತು ಜನರೇಷನ್ಗೆ ಫೀಡ್ ಆಗುತ್ತದೆ, ಅದು ನಂತರ ಲಿಪ್ ಸಿಂಕ್ ಮತ್ತು ಅಂತಿಮ ವೀಡಿಯೊ ರೆಂಡರಿಂಗ್ ಅನ್ನು ಚಾಲನೆ ಮಾಡುತ್ತದೆ.
ಪಠ್ಯ ಪದರದಲ್ಲಿ ಸುಧಾರಣೆಗಳು ಸ್ವಾಭಾವಿಕ ಗತಿಯನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತವೆ. ಆದರೆ ಒಟ್ಟಾರೆ ಅನುಭವವು ಆಡಿಯೋ ಮಾಡೆಲ್ ಧ್ವನಿತನ, ಲಯ ಮತ್ತು ಮಾತಿನ ಅಶಬ್ದ ಲಕ್ಷಣಗಳನ್ನು ಎಷ್ಟು ಚೆನ್ನಾಗಿ ಉಳಿಸುತ್ತದೆ ಎಂಬುದರ ಮೇಲೂ ಅವಲಂಬಿತವಾಗಿದೆ. ಅಲ್ಲಿಯೇ ತಂಡವು ಮುಂದಿನ ಅತ್ಯಾಧುನಿಕತೆಯನ್ನು ನೋಡುತ್ತದೆ.
“ಅನುವಾದ ಔಟ್ಪುಟ್ ಅನ್ನು ಸುಧಾರಿಸಲು ಪೈಪ್ಲೈನ್ ಅನ್ನು ಇನ್ನಷ್ಟು ಮಲ್ಟಿಮೋಡಲ್ ಆಗಿ ಮಾಡುವುದು ಮುಖ್ಯ: ಅನುವಾದವನ್ನು ಹೇಗೆ ಮಾಡಬೇಕು ಎಂದು ನಿರ್ಧರಿಸುವಾಗ ಆಡಿಯೋ, ವಿಡಿಯೋ ಮತ್ತು ಪಠ್ಯವನ್ನು ಒಟ್ಟಿಗೆ ಸೇರಿಸುವುದು,” ಎಂದು ಮಿಸ್ಟ್ರಾಟೋವ್ ಹೇಳಿದರು. “ಅದು ಮಾತಿನ ಸ್ವರ ಮತ್ತು ಒತ್ತಡದಂತಹ ವಾಕ್ಯೇತರ ಲಕ್ಷಣಗಳನ್ನು ಉತ್ತಮವಾಗಿ ಕಾಪಾಡುತ್ತದೆ ಮತ್ತು ಮೂಲ ವಿತರಣೆಯ ಇನ್ನೂ ಹೆಚ್ಚಿನ ಭಾಗವನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ.”
Descriptಗಾಗಿ, ಹೆಚ್ಚು ಬಲವಾದ ರೀಜನಿಂಗ್ ಮಾಡೆಲ್ಗಳು ಡಬ್ಬಿಂಗ್ನ ಸಂಕೀರ್ಣತೆಯನ್ನು ನಿರ್ವಹಿಸಬಹುದಾಗಿಸಿವೆ. ಪೇಸಿಂಗ್ ಮತ್ತು ಅರ್ಥದ ನಡುವಿನ ಸಮತೋಲನವನ್ನು ಮಾಡೆಲ್ಗಳು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿ ಸಾಧಿಸಬಹುದಾದ ಮಿತಿಯನ್ನು ದಾಟಿದ ನಂತರ, ಅನುವಾದವು ತಂಡವು ವ್ಯವಸ್ಥಿತವಾಗಿ ಸುಧಾರಿಸಬಹುದಾದ ಮತ್ತು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ಅನುಷ್ಠಾನಗೊಳಿಸಬಹುದಾದ ವಿಷಯವಾಯಿತು.


