როგორ ქმნის Descript მასშტაბურ მრავალენოვან ვიდეოდუბლირებას
OpenAI-ის მსჯელობის მოდელების გამოყენებით, Descript-მა შესაძლებელი გახადა დიდი შიგთავსის ბიბლიოთეკების ავტომატური ლოკალიზაცია დროისა და მნიშვნელობის დაკარგვის გარეშე.

შედეგები
43
პროცენტული პუნქტებით გაუმჯობესება ხანგრძლივობის დაცვაში OpenAI-ის მეშვეობით
შედეგები
15%
დუბლირებული ექსპორტების ზრდა დანერგვის შემდეგ
Descript(იხსნება ახალ ფანჯარაში) არის AI-ზე აგებული ვიდეორედაქტორი, რომელიც მარტივ იდეას ეფუძნება: თუ ტექსტის რედაქტირება შეგიძლიათ, ვიდეოს რედაქტირებაც უნდა შეგეძლოთ. Descript-ის ადრეული დღეებიდანვე ხელოვნური ინტელექტი საფუძვლად ედო პროდუქტის ყველა ასპექტს: ტრანსკრიფციას, რედაქტირებას, აუდიოს გაწმენდას და სულ უფრო რთულ კრეატიულ სამუშაო პროცესებს. ისინი წლების განმავლობაში OpenAI-ზე დაყრდნობით ქმნიან პროდუქტებს: ტრანსკრიფციისთვის იყენებენ Whisper-ს, ხოლო GPT‑სერიის მოდელებს — თავიანთ თანარედაქტორ Underlord-ში.
თარგმნა სწრაფად გამოიკვეთა, როგორც მაღალი გავლენის მქონე გამოყენების შემთხვევა. ტრადიციულად, ვიდეოს თარგმნა ნელი და ძვირადღირებული პროცესი იყო, რაც ენის სპეციალისტებისგან მოითხოვდა პროექტების მართვას, მექანიკური თარგმანის შესრულებას, ხარისხის კონტროლის განხორციელებას და შესაბამისი აუდიოს შექმნას. LLM-ები მნიშვნელოვნად ამცირებს ამ სამუშაო პროცესს და იძლევა მაღალი ხარისხის მასშტაბური თარგმნის შესაძლებლობას.
სუბტიტრებიც და დუბლირებაც სემანტიკურ სიზუსტეს მოითხოვს: თარგმანმა უნდა შეინარჩუნოს ორიგინალის მნიშვნელობა. თუმცა ხანგრძლივობის დაცვა თითოეულში განსხვავებულ როლს ასრულებს. სუბტიტრებისთვის ეს სასურველია, მაგრამ აუცილებელი არ არის. დუბლირებისთვის ეს კრიტიკულად მნიშვნელოვანია, რადგან თუ თარგმნილი მეტყველება მეტისმეტად გრძელი ან მეტისმეტად მოკლე გამოვა, ის არაბუნებრივად ჟღერს, თუნდაც მნიშვნელობა სწორად იყოს გადმოცემული.
ამის აღმოსაფხვრელად, Descript-მა გადაამუშავა თავისი თარგმნის პროცესი OpenAI-ის მსჯელობის მოდელების გამოყენებით, რათა სემანტიკური სიზუსტისა და ხანგრძლივობის დაცვის ოპტიმიზაცია გენერირებისასვე მომხდარიყო და არა მის შემდეგ. დანერგვიდან პირველ 30 დღეში დუბლირებით ნათარგმნი ვიდეოების ექსპორტი 15%-ით გაიზარდა, ხოლო ხანგრძლივობის დაცვის მაჩვენებელი, ენის მიხედვით, 13-დან 43 პროცენტულ პუნქტამდე გაუმჯობესდა.
„დუბლირება Descript-ის გამოყენების სულ უფრო პოპულარული სცენარია, ამიტომ ვქმნით გზებს, რომ ეს პაკეტურ რეჟიმში გააკეთონ კომპანიებმა, რომლებსაც მთელი ბიბლიოთეკების თარგმნა და ტუჩების მოძრაობასთან სინქრონიზაცია სურთ“, — განაცხადა ლაურა ბურკჰაუზერმა, აღმასრულებელმა დირექტორმა.
თარგმანი Descript-ის ერთ-ერთი პირველი და ყველაზე მოთხოვნადი ფუნქცია იყო. მათ დაიწყეს მხოლოდ სუბტიტრების თარგმნით, რაც კარგად მუშაობდა — თუმცა ბევრ მომხმარებელს სურდა უფრო მეტი შესაძლებლობა ჰქონოდა და სამიზნე ენაზე გახმოვანებული აუდიო (დუბლირება) მიეღო.
თუმცა, ერთი პრობლემა კვლავ ჩნდებოდა: დუბლირებული აუდიო ყოველთვის ბუნებრივად არ ჟღერდა. „ალბათ, ყველაზე ხშირი პრეტენზია, რომელიც გვესმოდა, ის იყო, რომ თარგმნილ ენაზე მეტყველების ტემპი არაბუნებრივი იყო“, — თქვა ალექს მისტრატოვმა, Descript-ის AI პროდუქტის ხელმძღვანელმა.
პრობლემა საბოლოოდ იმაში მდგომარეობდა, რომ სხვადასხვა ენაზე ერთი და იმავე აზრის გამოსახატად სხვადასხვა დროა საჭირო. მაგალითად, Descript-მა შენიშნა, რომ საშუალოდ გერმანული ინგლისურზე უფრო „გრძელი“ ენაა. ფიქსირებულ ვიდეოსეგმენტებში ჩასატევად, თარგმნილი მეტყველება ხშირად ხელოვნურად უნდა აჩქარებულიყო ან შენელებულიყო. „საბოლოოდ ვიღებდით რაღაცას, რაც ბურუნდუკებივით ან მთვლემარე გოლიათივით ჟღერდა“, — განმარტა მისტრატოვმა.
ინგლისური: | გერმანული: |
„გთხოვთ, მანქანის ექსპლუატაციამდე გაეცნოთ უსაფრთხოების სახელმძღვანელო მითითებებს.“ მარცვლები: 18 | “Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.” მარცვლები: 24 (40% ზრდა) |
ამ შემთხვევაში, ან გერმანული აუდიო არაბუნებრივად უნდა აჩქარდეს, ან თარგმანი უნდა გადაკეთდეს, რათა გამოყოფილ დროში ჩაეტიოს.
მომხმარებლებს რჩებოდათ ორი ვარიანტი: აუდიოს დროის სეგმენტ-სეგმენტად ხელით გასწორება ან თავად თარგმანის გადაკეთება, მოსარგებად. ორივე მიდგომა მოითხოვდა ქრონოლოგიის სიღრმისეულ რედაქტირებას და, ხშირად, სამიზნე ენის თითქმის მშობლიურ დონეზე ფლობას. ეს შემქმნელებისთვის შრომატევადი იყო და ფუნქციის დიდი საწარმოების ლოკალიზაციის პროექტებზე მასშტაბირების გზაზე დაბრკოლებად იქცა.
გუნდს მკაფიო წარმოდგენა ჰქონდა იმაზე, რა იქნებოდა საჭირო, რომ დუბლირებას წარმატებით ემუშავა. სისტემას დასჭირდებოდა არა მხოლოდ სემანტიკური მნიშვნელობისთვის ოპტიმიზაცია, არამედ დროითი შეზღუდვების გათვალისწინებაც. მაგალითად, ინგლისურიდან გერმანულად თარგმნისას მოდელს უნდა ესმოდეს, როგორ გამოიყენოს ნაკლები სიტყვა ან გაამარტივოს კონცეფცია, რათა დუბლირებული აუდიო ბუნებრივად ჟღერდეს.
ადრინდელი მიდგომები პირველ რიგში სემანტიკური სიზუსტის გაუმჯობესებას ცდილობდა და დროითი სინქრონიზაციის კორექტირებას მოგვიანებით ახორციელებდა. თარგმანები ხშირად სემანტიკურად სწორი იყო, მაგრამ ისინი რეგულარულად ვერ აკმაყოფილებდნენ ხანგრძლივობის შეზღუდვებს, ხოლო საერთო ხარისხი მაინც არასაკმარისი იყო.
„ჩვენ ეტაპობრივ ტესტებს ვატარებდით — არაფერს ვაგენერირებდით, უბრალოდ მოდელს ვთხოვდით, ტექსტის მონაკვეთში მარცვლების რაოდენობა გამოეტანა“, — თქვა მისტრატოვმა. „უბრალოდ ადრინდელი მოდელები ამას კარგად ვერ ახერხებდნენ.“
აღმოჩნდა, რომ მარცვლების საიმედოდ დათვლა კრიტიკულად მნიშვნელოვანი იყო. თუ მოდელი მარცვლებს თანმიმდევრულად ვერ გამოთვლიდა, ის კონკრეტულ ხანგრძლივობის ფანჯარაზე საიმედო ტარგეტირებას ვერ მოახდენდა.
GPT‑5 სერიის მოდელებმა შემოიტანეს მსჯელობის თანმიმდევრულობის ისეთი დონე, რომელიც ადრინდელ მოდელებს აკლდათ, განსაკუთრებით ისეთ ამოცანებში, როგორიცაა მარცვლების დათვლა და შეზღუდვებისთვის თვალყურის დევნება. ამ გაუმჯობესების შედეგად, Descript-მა თავისი თარგმნისა და დუბლირების სამუშაო პროცესი გადააკეთა.
პირველ რიგში, Descript-ის სისტემა ტრანსკრიპტს ფრაგმენტებად ყოფს, საწყის ჩანაწერში წინადადებების საზღვრების, ბუნებრივი პაუზებისა და მეტყველების შაბლონების გათვალისწინებით. თითოეული ფრაგმენტი ინარჩუნებს სემანტიკურ უწყვეტობას, მაგრამ საკმარისად მცირეა, რომ მასზე, როგორც დროის ერთეულზე, მსჯელობა შესაძლებელი იყოს.
ამის შემდეგ მოდელი ითვლის ფრაგმენტში მარცვლების რაოდენობას. თითოეული ენისთვის დამახასიათებელი მეტყველების ტემპის ვარაუდების გამოყენებით, სისტემა აფასებს, რამდენ მარცვალზე უნდა იყოს ორიენტირებული თარგმნილი მონაკვეთი, რათა შენარჩუნდეს ბუნებრივი ტემპი („ხანგრძლივობის დაცვა“). მოთხოვნა მოდელს სთხოვს, ოპტიმიზაცია მოახდინოს როგორც ხანგრძლივობის დაცვის, ისე მნიშვნელობის შენარჩუნების კუთხით. მიმდებარე ფრაგმენტები კონტექსტის სახით გადაეცემა, რათა მოდელმა სეგმენტებს შორის სემანტიკური თანმიმდევრულობა შეინარჩუნოს.
გუნდმა შეაფასა რამდენიმე კონფიგურაცია ხანგრძლივობის დაცვის, სემანტიკური სიზუსტის, დაყოვნებისა და ღირებულების დასაბალანსებლად. შერჩეულმა კონფიგურაციამ უზრუნველყო შეზღუდვების მკაცრი დაცვა პროდუქტიული სიჩქარით, რაც შესაძლებელს ხდის მაღალი მოცულობის ტექსტის თარგმნას დროის ხელით ხელახლა კორექტირების გარეშე. შედეგად ვიღებთ თარგმანის პროცესს, სადაც ტემპი განიხილება როგორც ძირითადი ცვლადი, და არა როგორც რამე, რაც შემდგომში გამოსწორებას საჭიროებს.
შეფასებებისთვის მისაღებობის კრიტერიუმების შესამუშავებლად, გუნდმა მოსმენის ტესტები ჩაატარა: შექმნა თარგმნილი აუდიო ნიმუშები და დაკვრის სიჩქარე მცირე ნაბიჯებით დაარეგულირა, მომხმარებლებს კი სთხოვა, შეეფასებინათ, როდის ხდებოდა მეტყველება არაბუნებრივი.
„ყველაფერი, რაც 10%-ით იყო შენელებული ან 20%-ით აჩქარებული, ზოგადად მაინც ბუნებრივად ჟღერდა,“ თქვა მისტრატოვმა. ამ დიაპაზონის მიღმა მეტყველება მეტისმეტად დამახინჯებული ხდებოდა.
ადრინდელი სისტემები ამ მაჩვენებლით ცუდ შედეგებს იძლეოდნენ. ენის მიხედვით, სეგმენტების მხოლოდ 40%-დან 60%-მდე ხვდებოდა მისაღები ტემპის დიაპაზონში. ხელახლა შემუშავებული პროცესის შედეგად, ეს მაჩვენებელი 40%–60%-დან 73%–83%-მდე გაიზარდა, რაც დამოკიდებულია ენაზე.
გუნდმა ასევე შეაფასა სემანტიკური სიზუსტე ცალკეული მოდელი-მსაჯულის შეფასებით, სკალაზე 1-დან („სრულიად განსხვავებული“) 5-მდე („სემანტიკურად ეკვივალენტური“). დუბლირებისთვის მათ გადაწყვიტეს დაეშვათ უფრო დაბალი სემანტიკური ზღვარი, ვიდრე მხოლოდ სუბტიტრების თარგმნისას, სადაც ხანგრძლივობის შეზღუდვები არ არის რელევანტური. ამ კომპრომისის მიუხედავად, სეგმენტების 85,5% სემანტიკური შესაბამისობის მიხედვით ხუთიდან ოთხი ან ხუთი ქულით შეფასდა.
შედეგად შეიქმნა სისტემა, რომელსაც შეეძლო ორი ურთიერთკონკურენტი შეზღუდვის — დროითი პარამეტრებისა და მნიშვნელობის — დაბალანსება გაზომვადი სანდოობით. და რადგან ორივე მეტრიკა ავტომატიზებული იყო, Descript-ს შეუძლია მუდმივად შეაფასოს მოდელის ახალი გამოშვებები და პრომპტის ვარიაციები იმავე ეტალონების მიხედვით.
როდესაც თარგმნა ცალკეული ვიდეოებიდან დიდ შიგთავსის ბიბლიოთეკებზე გადადის, Descript თარგმანების მორგების პროცესში უფრო მეტ კონტროლს ამატებს, საჭიროების შემთხვევაში უფრო მკაცრი სემანტიკური სიზუსტისთვის პრიორიტეტის მინიჭების შესაძლებლობის ჩათვლით.
Descript-ში თარგმანი უფრო ფართო მულტიმოდალური სისტემის მხოლოდ ერთი ფენაა. ნათარგმნი ტექსტი ნაკადით გადადის მეტყველების გენერირებაში, რომელიც შემდეგ მართავს ტუჩების სინქრონიზაციას და საბოლოო ვიდეოს გენერაციას.
ტექსტის შრის დონეზე გაუმჯობესებები შესაძლებელს ხდის ბუნებრივ ტემპს, მაგრამ საერთო გამოცდილება ასევე დამოკიდებულია იმაზე, რამდენად კარგად ინარჩუნებს აუდიო მოდელი მეტყველების ტონს, რიტმს და არავერბალურ მახასიათებლებს. გუნდი სწორედ აქ ხედავს შემდეგ მოწინავე მიმართულებას.
„თარგმანის შედეგის გაუმჯობესებაში დიდ როლს შეასრულებს პროცესისთვის მეტი მულტიმოდალურობის უზრუნველყოფა: აუდიოს, ვიდეოსა და ტექსტის ერთობლივად გათვალისწინება იმის გადაწყვეტისას, თუ როგორ ითარგმნოს“, — თქვა მისტრატოვმა. „ამით უკეთ უნდა იყოს შენარჩუნებული მეტყველების არავერბალური მახასიათებლები, როგორიცაა ტონი და მახვილები, და კიდევ უფრო მეტად შენარჩუნდებული იქნება თავდაპირველი გადმოცემა.“
Descript-ისთვის უფრო ძლიერმა მსჯელობის მოდელებმა დუბლირების სირთულე მართვადი გახადეს. იმ ზღვრის გადალახვით, რომლის მიღმაც მოდელებს ტემპსა და აზრს შორის კომპრომისების საიმედოდ დაბალანსება შეეძლოთ, გუნდისთვის შესაძლებელი გახდა თარგმანის სისტემურად გაუმჯობესება და ფართო მასშტაბით დანერგვა.


