Pāriet uz galveno saturu
OpenAI

2026. gada 6. marts

Jaunuzņēmums

Kā Descript nodrošina daudzvalodu video dublēšanu plašā mērogā

Izmantojot OpenAI spriestspējas modeļus, Descript nodrošināja automātisku lielu satura bibliotēku lokalizāciju, nezaudējot laika sinhronizāciju un nozīmi.

Descript logotips un vārda zīme uz rozā un purpursarkana abstrakta viļņveida fona.
Uzņēmuma lielums: Jaunuzņēmums
Reģions: Ziemeļamerika
Nozare: Tehnoloģija
Produkti: API

Rezultāti

43

Ilguma ievērošanas uzlabojums procentpunktos, izmantojot OpenAI

Rezultāti

15%

Dublēto video eksporta pieaugums pēc ieviešanas

Notiek ielāde…

Descript(atveras jaunā logā) ir uz mākslīgo intelektu balstīts video redaktors, kas veidots ap vienkāršu ideju – ja vari rediģēt tekstu, tev vajadzētu spēt rediģēt arī video. Kopš Descript pirmsākumiem mākslīgais intelekts ir darbinājis ikvienu produkta aspektu: transkripciju, rediģēšanu, audio attīrīšanu un arvien sarežģītākas radošās darbplūsmas. Descript jau gadiem ilgi ir balstījies uz OpenAI, izmantojot Whisper transkripcijai un GPT sērijas modeļus savā līdzredaktorā Underlord. 

Tulkošana ātri kļuva par nozīmīgu lietošanas gadījumu. Tradicionāli video tulkošana ir bijusi lēna un dārga, un tai bija nepieciešami valodu eksperti, lai pārvaldītu projektus, veiktu rutīnas tulkojumus, nodrošinātu kvalitātes kontroli un izveidotu atbilstošu audio. Lielie valodu modeļi ievērojami saīsina šo darbplūsmu, padarot iespējamu augstas kvalitātes tulkošanu lielā mērogā.

Gan subtitriem, gan dublēšanai ir nepieciešama semantiskā precizitāte – proti, tulkojumam ir jāsaglabā sākotnējā nozīme. Taču ilguma ievērošanai katrā no šiem gadījumiem ir atšķirīga nozīme. Subtitriem tas ir vēlams, bet ne obligāts. Dublēšanai tas ir ļoti svarīgi, jo, ja tulkotā runa ir pārāk gara vai īsa, tā skanēs nedabiski, pat ja nozīme ir pareiza.

Lai to risinātu, Descript pārveidoja savu tulkošanas procesu, izmantojot OpenAI spriestspējas modeļus, lai optimizētu semantisko atbilstību un ilguma ievērošanu ģenerēšanas laikā, nevis pēc tam. Pirmajās 30 dienās pēc ieviešanas iztulkoto videoklipu ar dublējumu eksportēšana pieauga par 15%, un ilguma atbilstība uzlabojās par 13 līdz 43 procentpunktiem atkarībā no valodas.

“Dublēšana ir arvien populārāks Descript lietošanas gadījums, tāpēc mēs izstrādājam veidus, kā to veikt lielā apjomā uzņēmumiem, kas vēlas tulkot un sinhronizēt veselas bibliotēkas,” saka izpilddirektore Laura Burkhausere.

Kur dublēšana sāka nedarboties

Tulkošana bija viena no Descript agrākajām un pieprasītākajām funkcijām. Tika sākts ar tikai subtitru tulkošanu, kas darbojās labi, taču daudzi lietotāji vēlējās iet tālāk – lai mērķa valodā būtu runāts audio (dublēšana).

Tomēr pastāvīgi parādījās viena problēma – dublētais audio ne vienmēr skanēja pareizi. "Iespējams, galvenā sūdzība, ko mēs dzirdējām, bija par to, ka runas temps tulkotajā valodā ir nedabisks," saka Alekss Mistratovs, Descript mākslīgā intelekta produktu vadītājs.

Problēma bija saistīta ar to, ka dažādās valodās vienas un tās pašas domas izteikšanai ir nepieciešams atšķirīgs laiks. Descript novēroja, piemēram, ka vidēji vācu valoda ir “garāka” valoda nekā angļu valoda. Lai iekļautos fiksētos video segmentos, tulkotā runa bieži vien bija mākslīgi jāpaātrina vai jāpalēnina. "Rezultātā jūs iegūtu kaut ko tādu, kas izklausītos pēc burundukiem vai miegaina milža," skaidro Mistratovs.

Angļu valoda:

Vācu valoda:

“Please review the safety guidelines before operating the machine.”

Zilbes: 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Zilbes: 24 (40% pieaugums)

Šajā gadījumā vācu audio vai nu būtu nedabiski jāpaātrina, vai arī tulkojums būtu jāpārraksta, lai iekļautos atvēlētajā laikā.

Lietotājiem bija divas iespējas: manuāli pielāgot audio pa segmentiem vai pārrakstīt tulkojumu, lai pielāgotu tā garumu. Abām pieejām bija nepieciešami padziļināti laika grafika labojumi un bieži vien gandrīz dzimtās valodas līmeņa prasmes mērķa valodā. Tas bija nogurdinoši veidotājiem un kļuva par šķērsli funkcijas pielāgošanai liela mēroga uzņēmumu lokalizācijas projektos.

Tulkojumu optimizēšana pēc laika, nevis tikai nozīmes

Komandai bija skaidra teorija par to, kas būtu nepieciešams, lai dublēšana darbotos. Sistēmai būtu nepieciešams ne tikai optimizēt semantisko nozīmi, bet arī apzināties laika ierobežojumus. Piemēram, tulkojot no angļu valodas vācu valodā, modelim būtu jāsaprot, kā izmantot mazāk vārdu vai vienkāršot jēdzienu, lai dublētais audio saglabātos dabisks.

Agrākās pieejas vispirms optimizēja semantisko atbilstību un pēc tam mēģināja koriģēt laika sinhronizāciju. Tulkojumi bieži vien bija semantiski pareizi, taču tajos nereti netika ievēroti ilguma ierobežojumi, un to kopējā kvalitāte joprojām nebija pietiekami laba. 

“Mēs veicām inkrementālus testus, pat neko negenerējot, tikai prasot modelim izvadīt zilbju skaitu teksta fragmentā,” saka Mistratovs. “Agrākiem modeļi tas vienkārši labi nepadevās.”

Izrādījās, ka uzticama zilbju skaitīšana ir kritiski svarīga. Ja modelis nespēja konsekventi aprēķināt zilbes, tas nevarēja droši noteikt konkrētu ilguma logu.

GPT‑5 sērijas modeļi nodrošināja spriestspējas konsekvences līmeni, kāda agrākiem modeļiem trūka, īpaši tādos uzdevumos kā zilbju skaitīšana un ierobežojumu izsekošana. Līdz ar šo uzlabojumu Descript pārveidoja savu tulkošanas un dublēšanas procesu.

Pirmkārt, Descript sistēma sadala transkripciju fragmentos, vadoties pēc teikumu robežām, dabiskām pauzēm un runas modeļiem oriģinālajā ierakstā. Katrs fragments saglabā semantisko nepārtrauktību, bet ir pietiekami mazs, lai to varētu apsvērt kā laika vienību.

Pēc tam modelis aprēķina zilbju skaitu fragmentā. Izmantojot valodai specifiskus pieņēmumus par runas ātrumu, sistēma novērtē, uz cik zilbēm tulkotajam fragmentam būtu jātiecas, lai saglabātu dabisku runas plūsmu (“ilguma atbilstība”). Uzvedne prasa modelim optimizēt gan ilguma ievērošanu, gan nozīmes saglabāšanu. Apkārtējie fragmenti tiek nodoti kā konteksts, lai modelis saglabātu semantisko saskaņotību starp segmentiem.

Komanda izvērtēja vairākas konfigurācijas, lai līdzsvarotu ilguma atbilstību, semantisko precizitāti, latentumu un izmaksas. Izvēlētā konfigurācija nodrošināja stingru ierobežojumu ievērošanu ražošanas vides ātrumā, ļaujot veikt liela apjoma tulkošanu bez manuālas laika pielāgošanas. Rezultāts ir tulkošanas process, kurā temps tiek uzskatīts par pirmā svarīguma mainīgo, nevis par kaut ko, ko labo pēc fakta.

Dabiskā tempa definēšana un mērīšana

Lai izstrādātu pieņemšanas kritērijus vērtējumiem, komanda veica klausīšanās testus – viņi ģenerēja tulkotos audio paraugus un nelielos soļos pielāgoja atskaņošanas ātrumu, lūdzot lietotājiem novērtēt, kad runa kļūst nedabiska. 

“Viss, kas tika palēnināts par 10% vai paātrināts par 20%, parasti joprojām skanēja dabiski,” sacīja Mistratovs. Ārpus šī diapazona runa kļuva pārāk izkropļota. 

Agrākās sistēmas pēc šī rādītāja uzrādīja sliktus rezultātus. Atkarībā no valodas tikai 40% līdz 60% segmentu iekļāvās pieņemamajā runas tempa intervālā. Izmantojot pārveidoto procesu, šis rādītājs pieauga no 40%–60% līdz 73%–83% atkarībā no valodas.

Komanda arī novērtēja semantisko atbilstību, izmantojot atsevišķu modeli kā tiesnesi, vērtējot skalā no 1 (“pilnīgi atšķirīgs”) līdz 5 (“semantiski ekvivalents”).  Dublēšanai viņi nolēma pieņemt zemāku semantisko slieksni nekā tikai subtitru tulkošanai, kur ilguma ierobežojumi nav svarīgi. Pat ar šo kompromisu 85,5% segmentu semantiskā atbilstība tika novērtēta ar četriem vai pieciem punktiem no pieciem.

Rezultātā tika izveidota sistēma, kas spēja sabalansēt divus konkurējošus ierobežojumus – laiku un nozīmi – ar izmērāmu pārliecību. Un, tā kā abi rādītāji tika automatizēti, Descript spēj nepārtraukti novērtēt jaunu modeļu izlaidumus un uzvedņu variācijas, izmantojot tos pašus etalonus.

Iespēju pavēršana liela mēroga video lokalizācijai

Tulkošanai pārejot no atsevišķiem video uz lielām satura bibliotēkām, Descript ievieš vairāk kontroles pār to, kā tulkojumi tiek pielāgoti, tostarp iespēju vajadzības gadījumā noteikt prioritāti stingrākai semantiskajai precizitātei.

Tulkošana Descript sistēmā ir tikai viens slānis plašākā multimodālā sistēmā. Tulkotais teksts tiek izmantots runas ģenerēšanā, kas pēc tam nodrošina lūpu sinhronizāciju un gala video renderēšanu. 

Uzlabojumi teksta slānī nodrošina dabisku tempu, bet kopējā pieredze ir atkarīga arī no tā, cik labi audio modelis saglabā runas intonāciju, ritmu un neverbālās īpašības. Tur komanda saskata nākamo robežšķirtni. 

“Tulkošanas rezultātus lielā mērā uzlabos tas, ka process tiek padarīts multimodālāks – apvienojot audio, video un tekstu, kad tiek lemts, kā tulkot,” sacīja Mistratovs. “Tam vajadzētu labāk saglabāt runas neverbālās īpašības, piemēram, toni un uzsvaru, un saglabāt vēl vairāk no oriģinālā runas veida.”

Descript gadījumā spēcīgāki spriestspējas modeļi padarīja dublēšanas sarežģītību pārvaldāmu. Pārkāpjot slieksni, kur modeļi varēja uzticami līdzsvarot kompromisus starp tempu un nozīmi, tulkošana kļuva par kaut ko tādu, ko komanda varēja sistemātiski uzlabot un izvietot plašā mērogā.