Pereiti prie pagrindinio turinio
OpenAI

2026 m. kovo 6 d.

Startuolis

Kaip „Descript“ kuria masinį daugiakalbį vaizdo dubliavimą

Naudodama „OpenAI“ protavimo modelius, „Descript“ atvėrė galimybę automatiškai lokalizuoti dideles turinio bibliotekas, neprarandant laiko sinchronizacijos ar prasmės.

„Descript“ logotipas ir žodinis prekių ženklas rožiniame ir violetiniame abstrakčiame bangos formos fone.
Įmonės dydis: Startuolis
Regionas: Šiaurės Amerika
Sritis: Technologijos
Produktai: API

Rezultatai

43

Trukmės atitikimo pagerėjimas procentiniais punktais naudojant „OpenAI“

Rezultatai

15 %

Dubliuoto turinio eksporto augimas po išleidimo

Įkeliama...

„Descript“(atsidaro naujame lange) – tai DI pagrįsta vaizdo įrašų redagavimo priemonė, sukurta remiantis paprasta idėja: jei galite redaguoti tekstą, turėtumėte galėti redaguoti ir vaizdo įrašą. Nuo pat „Descript“ gyvavimo pradžios DI valdė kiekvieną produkto aspektą: transkribavimą, redagavimą, garso valymą ir vis sudėtingesnes kūrybines darbo eigas. Įmonė daugelį metų remiasi „OpenAI“, naudodami „Whisper“ transkribavimui ir GPT serijos modelius savo bendrojoje redagavimo priemonėje „Underlord“. 

Vertimas greitai tapo vienu iš svarbiausių panaudojimo atvejų. Tradiciškai vaizdo įrašų vertimas buvo lėtas ir brangus, reikalaujantis kalbos ekspertų, kurie valdytų projektus, atliktų mechaninius vertimus, užtikrintų kokybės kontrolę ir sugeneruotų atitinkamą garsą. LLM iš esmės sutrumpina šią darbo eigą, leisdami atlikti aukštos kokybės vertimus dideliu mastu.

Tiek subtitrams, tiek dubliavimui būtinas semantinis tikslumas: vertimas turi išsaugoti originalo prasmę. Tačiau nustatytos trukmės laikymasis kiekvienu atveju yra skirtingos svarbos. Subtitrams tai – privalumas, bet ne būtinybė. Dubliavimui tai – kritiškai svarbu, nes jei išversta kalba trunka per ilgai arba per trumpai, ji skambės nenatūraliai net ir esant teisingai prasmei.

Siekdama išspręsti šią problemą, „Descript“ pertvarkė savo vertimo procesą, naudodama „OpenAI“ protavimo modelius, kad optimizuotų semantinį tikslumą ir trukmės laikymąsi per generavimo procesą, o ne po jo. Per pirmąsias 30 dienų po įdiegimo išverstų vaizdo įrašų su dubliavimu eksportas išaugo 15 proc., o trukmės laikymasis pagerėjo nuo 13 iki 43 proc., priklausomai nuo kalbos.

„Dubliavimas – vis populiaresnis „Descript“ naudojimo atvejis, todėl kuriame būdus, kaip tai atlikti paketais įmonėms, norinčioms išversti ir sinchronizuoti ištisas bibliotekas“, – sakė generalinė direktorė Laura Burkhauser.

Kur dubliavimas pradėjo strigti

Vertimas buvo viena pirmųjų ir labiausiai pageidaujamų „Descript“ funkcijų. Įmonė pradėjo nuo subtitrų vertimo, kuris veikė gerai, tačiau daugelis naudotojų norėjo žengti dar toliau – turėti įgarsintą vertimą (dubliavimą) tiksline kalba.

Vis dėlto viena problema nuolat kartojosi: dubliuotas garsas ne visada skambėjo gerai. „Turbūt dažniausias nusiskundimas, kurį girdėdavome, buvo tas, kad išversta kalba buvo nenatūralaus tempo“, – sakė Aleks Mistratov, „Descript“ DI produktų vadovas.

Problemos esmė ta, kad skirtingomis kalbomis išreikšti tą pačią mintį užtrunka nevienodai. Pavyzdžiui, „Descript“ pastebėjo, kad vidutiniškai vokiečių kalba yra „ilgesnė“ nei anglų. Norint sutilpti į fiksuotus vaizdo įrašo segmentus, išverstą kalbą dažnai tekdavo dirbtinai pagreitinti arba sulėtinti. „Galutinis rezultatas skambėdavo kaip burundukų arba mieguisto milžino kalba“, – aiškino A. Mistratov.

Anglų k.:

Vokiečių k.:

„Please review the safety guidelines before operating the machine.“

Skiemenų: 18

„Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.“

Skiemenų: 24 (40 proc. daugiau)

Šiuo atveju vokišką garsą tektų nenatūraliai pagreitinti arba vertimą reikėtų perrašyti, kad jis tilptų į laiko ribas.

Naudotojams likdavo dvi galimybės: rankiniu būdu perplanuoti garsą kiekvienam segmentui arba perrašyti patį vertimą, kad jis tiktų. Abiem atvejais reikėdavo atlikti nuodugnius laiko juostos pakeitimus ir, dažniausiai, puikiai mokėti tikslinę kalbą. Kūrėjams tai buvo varginantis darbas, tapęs kliūtimi pritaikyti šią funkciją dideliems įmonių lokalizavimo projektams.

Vertimų optimizavimas atsižvelgiant į laiką, o ne tik į prasmę

Komanda turėjo aiškią teoriją, ko reikės, kad dubliavimas veiktų. Sistema turėjo ne tik optimizuoti semantinę prasmę, bet ir atsižvelgti į laiko apribojimus. Pavyzdžiui, verčiant iš anglų į vokiečių kalbą, modelis turėjo suprasti, kaip panaudoti mažiau žodžių arba supaprastinti sąvoką, kad dubliuotas garsas išliktų natūralus.

Ankstesni metodai pirmiausia optimizuodavo semantinį tikslumą, o laiką bandydavo pakoreguoti vėliau. Vertimai dažnai būdavo semantiškai teisingi, tačiau jie nuolat neatitikdavo trukmės apribojimų, o bendra kokybė vis tiek nebuvo pakankamai gera. 

„Atlikome laipsniškus testus net nieko negeneruodami, o tik prašydami modelio pateikti skiemenų skaičių teksto fragmente“, – pasakojo A. Mistratov. „Ankstesni modeliai tiesiog nebuvo tam pakankamai geri.“

Paaiškėjo, kad patikimas skiemenų skaičiavimas yra kritiškai svarbus. Jei modelis negalėjo nuosekliai suskaičiuoti skiemenų, jis negalėjo patikimai pataikyti į konkrečios trukmės langą.

GPT‑5 serijos modeliai užtikrino protavimo nuoseklumą, kurio trūko ankstesniems modeliams, ypač atliekant tokias užduotis kaip skiemenų skaičiavimas ir apribojimų stebėjimas. Įdiegusi šį patobulinimą, „Descript“ pertvarkė savo vertimo ir dubliavimo procesą.

Pirmiausia „Descript“ sistema padalija transkripciją į fragmentus, vadovaudamasi sakinių ribomis, natūraliomis pauzėmis ir kalbėjimo modeliais originaliame įraše. Kiekvienas fragmentas išlaiko semantinį tęstinumą, bet yra pakankamai mažas, kad jį būtų galima vertinti kaip laiko vienetą.

Tada modelis suskaičiuoja skiemenų skaičių fragmente. Naudodama konkrečiai kalbai būdingas kalbėjimo tempo prielaidas, sistema įvertina, kiek skiemenų turėtų sudaryti išverstą fragmentą, kad būtų išlaikytas natūralus tempas („trukmės laikymasis“). Užklausos modelyje prašoma optimizuoti tiek trukmės laikymąsi, tiek prasmės išsaugojimą. Aplinkiniai fragmentai perduodami kaip kontekstas, kad modelis išlaikytų semantinę darną visuose segmentuose.

Komanda įvertino kelias konfigūracijas, siekdama suderinti trukmės laikymąsi, semantinį tikslumą, vėlavimą ir išlaidas. Pasirinkta sąranka užtikrino griežtą apribojimų laikymąsi gamybiniu greičiu, atverdama galimybę atlikti didelės apimties vertimus be rankinio laiko koregavimo. Rezultatas – vertimo konvejeris, kuriame tempas laikomas pirmaeiliu kintamuoju, o ne tuo, kas vėliau taisoma.

Natūralaus tempo apibrėžimas ir matavimas

Siekdama nustatyti priimtinumo kriterijus vertinimams, komanda atliko klausymo testus: sugeneravo išversto garso pavyzdžius ir po truputį keitė atkūrimo greitį, prašydama naudotojų įvertinti, kada kalba tampa nenatūrali. 

„Viskas, kas buvo sulėtinta 10 proc. arba pagreitinta 20 proc., paprastai vis dar skambėjo natūraliai“, – sakė A. Mistratov. Už šio diapazono ribų kalba tapdavo per daug iškraipyta. 

Ankstesnių sistemų rezultatai pagal šį matą buvo prasti. Priklausomai nuo kalbos, tik nuo 40 proc. iki 60 proc. segmentų patekdavo į priimtino tempo langą. Įdiegus pertvarkytą procesą, šis skaičius padidėjo nuo 40–60 proc. iki 73–83 proc., priklausomai nuo kalbos.

Komanda taip pat įvertino semantinį tikslumą, naudodama atskirą modelio kaip teisėjo vertinimą skalėje nuo 1 („visiškai skiriasi“) iki 5 („semantiškai atitinka“). Dubliavimui ji nusprendė priimti žemesnę semantinę ribą nei vertimui tik su subtitrais, kur trukmės apribojimai neturi reikšmės. Net ir priėmus tokį kompromisą, 85,5 proc. segmentų semantinis atitikimas buvo įvertintas keturiais arba penkiais balais iš penkių.

Rezultatas buvo sistema, galinti pamatuojamai patikimai subalansuoti du vienas kitam prieštaraujančius apribojimus – laiką ir prasmę. Be to, kadangi abu metrikos rodikliai buvo automatizuoti, „Descript“ gali nuolat vertinti naujas modelių versijas ir užklausų variacijas pagal tuos pačius lyginamuosius standartus.

Didelio masto vaizdo įrašų lokalizavimo atvėrimas

Vertimui pereinant nuo pavienių vaizdo įrašų prie didelių turinio bibliotekų, „Descript“ kuria daugiau vertimų derinimo kontrolės priemonių, įskaitant galimybę prireikus teikti pirmenybę griežtesniam semantiniam tikslumui.

Vertimas „Descript“ sistemoje yra tik vienas platesnės daugiarūšės sistemos sluoksnis. Išverstas tekstas perduodamas kalbos generavimo sistemai, kuri tada valdo lūpų sinchronizaciją ir galutinį vaizdo įrašo atvaizdavimą. 

Teksto sluoksnio patobulinimai leidžia pasiekti natūralų tempą, tačiau bendra patirtis taip pat priklauso nuo to, kaip gerai garso modelis išsaugo toną, intonaciją ir neverbalines kalbos savybes. Būtent čia komanda mato kitą proveržio kryptį. 

„Didžiąją dalį vertimo rezultato pagerins konvejerio pavertimas daugiarūšiu labiau integruojant garsą, vaizdą ir tekstą kartu, kai sprendžiama, kaip versti“, – teigė A. Mistratov. „Tai turėtų geriau išlaikyti neverbalines kalbos savybes, tokias kaip tonas ir akcentas, ir išsaugoti dar daugiau pradinio pristatymo savybių.“

„Descript“ atveju stipresni protavimo modeliai leido suvaldyti dubliavimo sudėtingumą. Peržengus ribą, kai modeliai galėjo patikimai subalansuoti kompromisus tarp tempo ir prasmės, vertimas tapo tuo, ką komanda galėjo sistemingai tobulinti ir diegti dideliu mastu.