কিভাবে Descript বড় পরিসরে বহুভাষিক ভিডিও ডাবিং তৈরি করে
OpenAI রিজনিং মডেল ব্যবহার করে, Descript টাইমিং বা অর্থ হারানোর ঝুঁকি ছাড়াই বড় কন্টেন্ট লাইব্রেরিগুলোর স্বয়ংক্রিয় লোকালাইজেশন আনলক করেছে.

ফলাফল
43
OpenAI-এর মাধ্যমে সময়কাল মেনে চলায় শতাংশ পয়েন্ট উন্নতি
ফলাফল
15%
রোল-আউটের পর ডাব করা রপ্তানির বৃদ্ধি
Descript(একটি নতুন উইন্ডোতে খোলে) হলো একটি AI-নেটিভ ভিডিও এডিটর, যা একটি সহজ ধারণাকে কেন্দ্র করে তৈরি: আপনি যদি টেক্সট এডিট করতে পারেন, তাহলে ভিডিওও এডিট করতে পারা উচিত. Descript-এর শুরুর দিনগুলো থেকেই, AI পণ্যের প্রতিটি দিককে চালিত করেছে: ট্রান্সক্রিপশন, এডিটিং, অডিও ক্লিনআপ এবং ক্রমশ আরও জটিল সৃজনশীল কর্মপ্রবাহ. তারা বছরের পর বছর ধরে OpenAI প্ল্যাটফর্ম ব্যবহার করে এটি তৈরি করেছে; যেখানে ট্রান্সক্রিপশনের জন্য Whisper এবং তাদের কো-এডিটর Underlord-এর ভেতরে GPT সিরিজের মডেলগুলো ব্যবহার করা হয়েছে.
অনুবাদ দ্রুতই একটি উচ্চ-প্রভাব ব্যবহার কেস হিসেবে উদীয়মান হয়ে ওঠে. ঐতিহ্যগতভাবে, ভিডিও অনুবাদ ধীর এবং ব্যয়বহুল ছিল, যেখানে ভাষা বিশেষজ্ঞদের প্রকল্প পরিচালনা, রুটিন অনুবাদ তৈরি, গুণমান নিয়ন্ত্রণ সামলানো এবং সংশ্লিষ্ট অডিও তৈরি করতে হতো. LLM-গুলো সেই ওয়ার্কফ্লোকে নাটকীয়ভাবে সংকুচিত করে, ফলে বড় পরিসরে উচ্চমানের অনুবাদ সম্ভব হয়.
ক্যাপশন এবং ডাবিং—উভয় ক্ষেত্রেই শব্দার্থগত বিশ্বস্ততা প্রয়োজন: অনুবাদে মূল অর্থ অক্ষুণ্ণ থাকতে হবে. কিন্তু সময়কাল মেনে চলা প্রতিটিতে ভিন্ন ভূমিকা পালন করে. ক্যাপশনের ক্ষেত্রে, এটি থাকলে ভালো. ডাবিংয়ের ক্ষেত্রে, এটি অত্যন্ত গুরুত্বপূর্ণ, কারণ অনূদিত সংলাপ খুব বেশি দীর্ঘ বা খুব বেশি সংক্ষিপ্ত হলে, অর্থ সঠিক হলেও তা অস্বাভাবিক শোনাবে.
এটি সমাধান করতে, Descript অনুবাদ তৈরির সময়ই (পরে নয়) অর্থগত বিশ্বস্ততা এবং সময়কাল মেনে চলা অপ্টিমাইজ করতে OpenAI রিজনিং মডেল ব্যবহার করে তার অনুবাদ পাইপলাইন পুনর্নকশা করেছে. রোলআউটের পর প্রথম 30 দিনে, ডাবিংসহ অনূদিত ভিডিও-এর এক্সপোর্ট 15% বেড়েছে এবং ভাষার উপর নির্ভর করে, সময়কাল অনুসরণ 13 থেকে 43 শতাংশ পয়েন্ট উন্নত হয়েছে.
“Descript-এর জন্য ডাবিং একটি ক্রমবর্ধমান জনপ্রিয় ব্যবহারক্ষেত্র, তাই আমরা এমন কোম্পানিগুলোর জন্য ব্যাচে এটি করার উপায় তৈরি করছি যারা পুরো লাইব্রেরি অনুবাদ করতে এবং লিপ-সিঙ্ক করতে চায়,” বলেছেন লরা বুরখাউসার, CEO.
অনুবাদ ছিল Descript-এর প্রথম দিকের এবং সবচেয়ে বেশি অনুরোধকৃত বৈশিষ্ট্যগুলোর একটি. তারা শুধুমাত্র ক্যাপশন অনুবাদ দিয়ে শুরু করেছিল, যা ভালোভাবে কাজ করেছিল—কিন্তু অনেক ব্যবহারকারী আরও এগোতে চেয়েছিল এবং কাংক্ষিত ভাষায় কথ্য অডিও (ডাবিং) চেয়েছিল.
তবে, একটি সমস্যা বারবার দেখা দিচ্ছিল: ডাব করা অডিও সব সময় শুনতে ঠিক মনে হচ্ছিল না. “সম্ভবত আমরা যে এক নম্বর অভিযোগটি শুনেছি তা ছিল অনূদিত ভাষায় কথার গতি অস্বাভাবিক ছিল,” বলেন Descript-এর AI পণ্য প্রধান আলেক্স মিস্ত্রাটভ.
সমস্যাটি ছিল মূলত এই যে, একই ধারণা প্রকাশ করতে একেক ভাষায় একেক রকম সময়ের প্রয়োজন হয়. Descript লক্ষ্য করেছে যে, উদাহরণস্বরূপ, গড় হিসেবে জার্মান ইংরেজির তুলনায় একটি “দীর্ঘতর” ভাষা. নির্দিষ্ট ভিডিও সেগমেন্টে ফিট করাতে, অনূদিত বক্তৃতাকে প্রায়ই কৃত্রিমভাবে গতি বাড়াতে বা কমাতে হতো. “আপনি শেষ পর্যন্ত এমন কিছু শুনতে পেতেন যা অনেকটা চিপমাঙ্ক-এর মতো তীক্ষ্ণ অথবা এক তন্দ্রাচ্ছন্ন দৈত্যের মতো শোনাত” মিসট্রাটভ ব্যাখ্যা করেছেন.
ইংরেজি: | জার্মান: |
“মেশিনটি চালানোর আগে অনুগ্রহ করে নিরাপত্তা নির্দেশিকাগুলি পর্যালোচনা করুন.” সিলেবল: 18 | “মেশিনটি চালানোর আগে অনুগ্রহ করে নিরাপত্তা নির্দেশিকা যাচাই করুন.” সিলেবল: 24 (40% বৃদ্ধি) |
এই ক্ষেত্রে, জার্মান অডিওটিকে হয় অস্বাভাবিকভাবে গতি বাড়াতে হবে অথবা সময় বাজেটের মধ্যে মানিয়ে নিতে অনুবাদটি পুনরায় লিখতে হবে.
ব্যবহারকারীদের সামনে দুটি বিকল্প ছিল: অডিওটি সেগমেন্ট ধরে ধরে হাতে করে পুনরায় টাইমিং ঠিক করা অথবা অনুবাদটিই নতুন করে লিখে সেটিকে মানানসই করা. উভয় পদ্ধতিতেই টাইমলাইনে গভীর এডিট করতে হতো এবং প্রায়ই কাঙ্ক্ষিত ভাষায় প্রায় মাতৃভাষার মতো সাবলীলতা প্রয়োজন হতো. এটি ক্রিয়েটরদের জন্য ছিল ক্লান্তিকর এবং বড় এন্টারপ্রাইজ লোকালাইজেশন প্রকল্পে ফিচারটি স্কেল করার ক্ষেত্রে একটি বাধা হয়ে উঠেছিল.
ডাবিং সফল করতে কী লাগবে সে সম্পর্কে দলের একটি স্পষ্ট ধারণা ছিল. সিস্টেমটিকে কেবল অর্থগত মাধুর্যের জন্যই নয়, বরং সময়ের সীমাবদ্ধতা সম্পর্কেও সচেতন হতে হবে. উদাহরণস্বরূপ, ইংরেজি থেকে জার্মানে অনুবাদ করার সময়, ডাব করা অডিও যাতে স্বাভাবিক থাকে, সে জন্য মডেলকে কম শব্দ ব্যবহার করা বা ধারণাটি সরলভাবে প্রকাশ করা কিভাবে করতে হয় তা বুঝতে হবে.
আগের পদ্ধতিগুলো প্রথমে অর্থগত বিশ্বস্ততাকে উন্নত করত এবং পরে সময় নির্ধারণ সংশোধন করার চেষ্টা করত. অনুবাদগুলো প্রায়ই শব্দার্থগতভাবে সঠিক ছিল, কিন্তু তারা নিয়মিতভাবে সময়কাল সীমাবদ্ধতাগুলো মেনে চলতে ব্যর্থ হতো এবং সামগ্রিক মান এখনও যথেষ্ট ভালো ছিল না.
“আমরা ইনক্রিমেন্টাল টেস্ট চালিয়েছি, এমনকি কিছুই তৈরি করিনি, শুধু মডেলকে টেক্সটের একটি অংশে কতটি সিলেবল আছে তা আউটপুট দিতে বলেছি,” মিস্ট্রাটভ বললেন. “আগের মডেলগুলো সহজেই সেটা করতে ততটা ভালো ছিল না.”
নির্ভরযোগ্যভাবে সিলেবল গণনা করা অত্যন্ত গুরুত্বপূর্ণ বলে প্রমাণিত হলো. মডেলটি যদি ধারাবাহিকভাবে সিলেবল বা শব্দাংশ গণনা করতে না পারে, তবে এটি নির্ভরযোগ্যভাবে একটি নির্দিষ্ট সময়ের ব্যাপ্তিকে লক্ষ্য করতে পারবে না.
GPT‑5 সিরিজের মডেলগুলি যুক্তি-প্রয়োগের সামঞ্জস্যের একটি নতুন স্তর এনেছে যা আগের মডেলগুলিতে ছিল না, বিশেষ করে সিলেবল গণনা এবং কনস্ট্রেইন্ট ট্র্যাকিংয়ের মতো কাজে. সেই উন্নতির মাধ্যমে, Descript তার অনুবাদ এবং ডাবিং পাইপলাইন পুনরায় ডিজাইন করেছে.
প্রথমে, Descript-এর সিস্টেম ট্রান্সক্রিপ্টটিকে বাক্যের সীমানা, স্বাভাবিক বিরতি এবং মূল রেকর্ডিংয়ের কথনধারার প্যাটার্ন অনুসরণ করে খণ্ডে ভাগ করে. প্রতিটি চাঙ্ক অর্থগত ধারাবাহিকতা বজায় রাখে, তবে এটি টাইমিং ইউনিট হিসেবে বিবেচনার জন্য যথেষ্ট ছোট.
সেখান থেকে, মডেলটি ঐ অংশের (chunk) সিলেবল বা শব্দাংশ গণনা করে. ভাষা-নির্দিষ্ট কথা বলার গতির অনুমান ব্যবহার করে, সিস্টেমটি প্রাকৃতিক গতি বজায় রাখতে (“duration adherence”) অনূদিত অংশটি কতটি সিলেবল লক্ষ্য করবে তা অনুমান করে. প্রম্পটটি মডেলকে সময়কাল অনুসরণ এবং অর্থ সংরক্ষণ—উভয়ের জন্য অপ্টিমাইজ করতে বলে. পার্শ্ববর্তী চাঙ্কগুলো কন্টেক্সট হিসেবে পাস করা হয় যাতে মডেলটি সেগমেন্ট জুড়ে অর্থগত সুসংগততা বজায় রাখে.
দলটি সময়কাল অনুসরণ, অর্থগত বিশ্বস্ততা, লেটেন্সি এবং খরচের মধ্যে ভারসাম্য বজায় রাখতে একাধিক কনফিগারেশন মূল্যায়ন করেছে. নির্বাচিত সেটআপটি প্রোডাকশন গতিতে শক্তিশালীভাবে সীমাবদ্ধতা অনুসরণ নিশ্চিত করেছে, ফলে ম্যানুয়াল রিটাইমিং ছাড়াই উচ্চ-পরিমাণ অনুবাদ সম্ভব হয়েছে. ফলাফল হলো একটি অনুবাদ পাইপলাইন, যেখানে পেসিংকে পরে সংশোধন করার মতো কিছু না ভেবে প্রথম-শ্রেণির ভেরিয়েবল হিসেবে বিবেচনা করা হয়.
মূল্যায়নের (evals) গ্রহণযোগ্যতার মানদণ্ড নির্ধারণ করতে দলটি 'লিসেনিং টেস্ট' বা শোনার পরীক্ষা চালিয়েছিল: তারা অনুদিত অডিওর নমুনা তৈরি করে এবং খুব সামান্য পরিমাণে প্লেব্যাক গতি পরিবর্তন করে ব্যবহারকারীদের কাছে জানতে চেয়েছিল যে, ঠিক কোন পর্যায়ে কথাগুলো অস্বাভাবিক শোনাতে শুরু করে.
“10% গতি কমানো বা 20% গতি বাড়ানো—এমন যেকোনো কিছু সাধারণত এখনও স্বাভাবিকই শোনাত,” মিস্ট্রাটভ বলেছেন. এই সীমার বাইরে, বক্তৃতা অত্যন্ত বিকৃত হয়ে গিয়েছিল.
আগের সিস্টেমগুলো সেই পরিমাপ অনুযায়ী দুর্বলভাবে কাজ করেছিল. ভাষার উপর নির্ভর করে, মাত্র 40% থেকে 60% সেগমেন্ট গ্রহণযোগ্য পেসিং উইন্ডোর মধ্যে পড়েছে. পুনর্নকশা করা পাইপলাইনের মাধ্যমে, ভাষার উপর নির্ভর করে, সেই সংখ্যা 40%–60% থেকে বেড়ে 73% এবং 83%-এর মধ্যে হয়েছে.
দলটি এক (“সম্পূর্ণ ভিন্ন”) থেকে পাঁচ (“অর্থগতভাবে সমতুল্য”) পর্যন্ত একটি স্কেলে পৃথক মডেল-অ্যাজ-জাজ রেটিং ব্যবহার করে অর্থগত বিশ্বস্ততাও মূল্যায়ন করেছে. ডাবিংয়ের জন্য, তারা ক্যাপশন-শুধু অনুবাদের তুলনায় কম শব্দার্থগত থ্রেশহোল্ড গ্রহণ করার সিদ্ধান্ত নিয়েছে, যেখানে সময়কাল-সংক্রান্ত সীমাবদ্ধতা প্রাসঙ্গিক নয়. এই সমঝোতা সত্ত্বেও, 85.5% সেগমেন্টকে অর্থগত অনুগত্যের জন্য পাঁচের মধ্যে চার বা পাঁচ হিসেবে রেটিং দেওয়া হয়েছে.
ফলাফলটি ছিল এমন একটি সিস্টেম, যা পরিমাপযোগ্য আত্মবিশ্বাসের সাথে সময়নির্ধারণ এবং অর্থ—এই দুইটি প্রতিদ্বন্দ্বী সীমাবদ্ধতার মধ্যে ভারসাম্য বজায় রাখতে পারত. আর যেহেতু উভয় মেট্রিকই স্বয়ংক্রিয় ছিল, Descript একই বেঞ্চমার্কের বিপরীতে নতুন মডেল রিলিজ এবং প্রম্পট ভ্যারিয়েশনগুলোকে ধারাবাহিকভাবে মূল্যায়ন করতে সক্ষম.
অনুবাদ যখন একক ভিডিও থেকে বৃহৎ কনটেন্ট লাইব্রেরিতে বিস্তৃত হয়, তখন Descript অনুবাদ টিউন করার ক্ষেত্রে আরও নিয়ন্ত্রণ যোগ করছে, যার মধ্যে প্রয়োজন হলে কঠোর অর্থগত বিশ্বস্ততাকে অগ্রাধিকার দেওয়ার ক্ষমতাও রয়েছে.
Descript-এর ভেতরের অনুবাদ একটি বৃহত্তর মাল্টিমোডাল সিস্টেমের মাত্র একটি স্তর. অনূদিত টেক্সট স্পিচ জেনারেশনে যায়, যা পরে লিপ সিঙ্ক এবং চূড়ান্ত ভিডিও রেন্ডারিং পরিচালনা করে.
টেক্সট স্তরে উন্নতিগুলো স্বাভাবিক গতি সম্ভব করে, কিন্তু সামগ্রিক অভিজ্ঞতা নির্ভর করে অডিও মডেল কতটা ভালোভাবে বক্তৃতার টোন, ছন্দ, এবং অমৌখিক বৈশিষ্ট্যগুলো সংরক্ষণ করে তার উপর. সেখানেই দলটি পরবর্তী ফ্রন্টিয়ার দেখতে পায়.
“অনুবাদের আউটপুট উন্নত করতে যা অনেকটা সাহায্য করবে তা হলো পাইপলাইনকে আরও মাল্টিমোডাল করা: কিভাবে অনুবাদ করতে হবে তা নির্ধারণের সময় অডিও, ভিডিও এবং টেক্সটকে একসঙ্গে অন্তর্ভুক্ত করা,” বলেন মিস্ত্রাটভ. “এতে স্পিচের টোন ও জোরের মতো অমৌখিক বৈশিষ্ট্যগুলো আরও ভালোভাবে বজায় থাকবে এবং মূল ডেলিভারির আরও বেশি অংশ সংরক্ষণ করবে.”
Descript-এর জন্য, আরও শক্তিশালী যুক্তিপ্রয়োগকারী মডেলগুলো ডাবিংয়ের জটিলতাকে সামাল দেওয়ার মতো করে তুলেছে. মডেলগুলো যখন পেসিং এবং অর্থের মধ্যে ট্রেডঅফ নির্ভরযোগ্যভাবে ভারসাম্য করতে পারত সেই থ্রেশহোল্ড অতিক্রম করার মাধ্যমে, অনুবাদ এমন কিছু হয়ে উঠল যা টিমটি পদ্ধতিগতভাবে উন্নত করতে পারত এবং বৃহৎ পরিসরে ডিপ্লয় করতে পারত.


