Ugrás a fő tartalomra
OpenAI

2026. március 6.

Startup

Így szinkronizál többnyelvű videókat kötegelve a Descript

Az OpenAI érvelési modelljeinek használatával a Descript lehetővé tette a nagy tartalomkönyvtárak automatikus lokalizálását anélkül, hogy a szinkron vagy a jelentés elveszne.

Descript logó és szóvédjegy rózsaszín és lila absztrakt hullámformás háttéren.
Vállalat mérete: Startup
Régió: Észak-Amerika
Ipar: Technológia
Termékek: API

Eredmények

43

Százalékpontos javulás az időtartam betartásában az OpenAI segítségével

Eredmények

15%

A szinkronnal ellátott exportok növekedése a bevezetés után

Betöltés…

A Descript(új ablakban nyílik meg) egy mesterséges intelligencia-alapú videószerkesztő, amely egy egyszerű ötletre épül: ha tudsz szöveget szerkeszteni, videót is tudnod kell szerkeszteni. A Descript korai napjai óta a mesterséges intelligencia a termék minden aspektusát működteti: az átírást, a szerkesztést, a hangtisztítást és az egyre összetettebb kreatív munkafolyamatokat. Évek óta az OpenAI-ra építenek, a Whispert használják átíráshoz, és a GPT‑sorozat modelljeit a társszerkesztőjükön, az Underlordon belül. 

A fordítás gyorsan nagy hatású felhasználási területként jelent meg. Hagyományosan a videók fordítása lassú és költséges volt, és nyelvi szakértőket igényelt a projektek menedzseléséhez, a rutinszerű fordítások elkészítéséhez, a minőség-ellenőrzés kezeléséhez, valamint a megfelelő hanganyag előállításához. Az LLM-ek drasztikusan tömörítik ezt a munkafolyamatot, lehetővé téve a kiváló minőségű fordítást nagy mértékben.

A feliratok és a szinkron is szemantikai hűséget igényel: a fordításnak meg kell őriznie az eredeti jelentést. De az időtartam betartása mindegyikben más szerepet játszik. A feliratok esetében ez inkább csak hasznos extra. A szinkronhoz ez kritikus, mert ha a lefordított beszéd túl hosszúra vagy túl rövidre sikerül, természetellenesen fog hangzani, még akkor is, ha a jelentés helyes.

Ennek érdekében a Descript újratervezte a fordítási folyamatát, és az OpenAI érvelési modelljeit használta, hogy a generálás során – nem pedig utólag – optimalizálja a szemantikai hűséget és az időtartam betartását. A bevezetést követő első 30 napban a szinkronnal ellátott, lefordított videók exportja 15%-kal nőtt, és az időtartamhoz való igazodás 13-43 százalékponttal javult, a nyelvtől függően.

„A szinkronizálás egyre népszerűbb felhasználási eset a Descript számára, ezért olyan megoldásokat fejlesztünk, amelyekkel a teljes folyamat kötegelt módon is elvégezhető azoknak a vállalatoknak, amelyek teljes könyvtárakat szeretnének lefordítani és ajakszinkronizálni” – mondta Laura Burkhauser, vezérigazgató.

Ahol a szinkron kezdett szétesni

A fordítás a Descript egyik legkorábbi és leginkább kért funkciója volt. A feliratos fordítással kezdték, ami jól működött – de sok felhasználó szeretett volna továbblépni, és a célnyelven beszélt hangot (szinkront) is használni.

Azonban egy probléma újra és újra felbukkant: a szinkronizált hang nem mindig hangzott jól. „Valószínűleg az első számú panasz, amit hallottunk, az volt, hogy a beszéd tempója természetellenes volt a lefordított nyelven” – mondta Aleks Mistratov, a Descript AI-termékekért felelős vezetője.

A probléma végső soron arra vezethető vissza, hogy a különböző nyelvek eltérő időt igényelnek ugyanannak a gondolatnak a kifejezéséhez. A Descript például megfigyelte, hogy átlagosan a német „hosszabb” nyelv, mint az angol. Ahhoz, hogy illeszkedjen a rögzített videószegmensekbe, a fordított beszédet gyakran mesterségesen fel kellett gyorsítani vagy le kellett lassítani. „Olyasmi lenne belőle, ami úgy hangzana, mint mókusok, vagy egy álmos óriás” – magyarázta Mistratov.

Angol:

Német:

„Kérjük, a gép üzemeltetése előtt tekintse át a biztonsági irányelveket.”

Szótagok: 18

„Kérjük, ellenőrizze a biztonsági irányelveket, mielőtt a gépet üzemelteti.”

Szótagok: 24 (40%-os növekedés)

Ebben az esetben a német hanganyagot vagy természetellenesen fel kellene gyorsítani, vagy a fordítást át kellene írni, hogy beleférjen az időkeretbe.

A felhasználóknak két lehetőségük maradt: a hanganyagot szegmensről szegmensre manuálisan újraidőzíteni, vagy magát a fordítást átírni, hogy az illeszkedjen. Mindkét megközelítés mély idővonal-szerkesztést igényelt, és gyakran a célnyelv közel anyanyelvi szintű ismeretét követelte meg. Ez a készítők számára fáradságos volt, és akadállyá vált a funkció nagyvállalati, nagyszabású lokalizációs projektekre való kiterjesztésében.

A fordítások optimalizálása az időzítéshez, nem csupán a jelentéshez

A csapatnak egyértelmű elképzelése volt arról, hogy mi szükséges a szinkronizálás működéséhez. A rendszernek nemcsak a szemantikai jelentésre kellene optimalizálnia, hanem az időzítési korlátokat is figyelembe kellene vennie. Amikor például angolról németre fordítunk, a modellnek meg kell értenie, hogyan használjon kevesebb szót, vagy egyszerűsítse a koncepciót, hogy a szinkronizált hanganyag természetes maradjon.

A korábbi megközelítések először a szemantikai hűséget optimalizálták, majd utána próbálták korrigálni az időzítést. A fordítások gyakran szemantikailag helyesek voltak, de rendszeresen nem tartották be az időtartamra vonatkozó korlátokat, és az összminőség még mindig nem volt megfelelő. 

„Inkrementális teszteket futtattunk, még csak nem is generáltunk semmit, csak arra kértük a modellt, hogy adja meg egy szövegrészlet szótagjainak számát” – magyarázta Mistratov. „A korábbi modellek egyszerűen nem voltak elég jók ehhez.”

A megbízható szótag-számlálás kritikusnak bizonyult. Ha a modell nem tudta volna következetesen kiszámítani a szótagokat, nem tudott volna megbízhatóan egy adott időtartam-ablakot megcélozni.

A GPT‑5 sorozat modelljei olyan szintű érvelésbeli következetességet hoztak, amely a korábbi modellekből hiányzott, különösen az olyan feladatoknál, mint a szótagok számlálása és a megkötések követése. Ezzel a fejlesztéssel a Descript újratervezte a fordítási és szinkronizálási munkafolyamatát.

Először a Descript rendszere a leiratot darabokra bontja, a mondathatárok, a természetes szünetek és az eredeti felvétel beszédmintái alapján. Minden darab megőrzi a szemantikai folytonosságot, de elég kicsi ahhoz, hogy időzítési egységként lehessen róla gondolkodni.

Onnan a modell kiszámítja a szótagok számát az egységben. Nyelvspecifikus beszédtempó-feltételezések alapján a rendszer megbecsüli, hogy a fordított egységnek hány szótagot kell tartalmaznia a természetes tempó megőrzéséhez („időtartam betartása”). Az utasítás arra kéri a modellt, hogy egyszerre optimalizáljon az időtartam betartására és a jelentés megőrzésére. A környező egységek kontextusként kerülnek átadásra, hogy a modell fenntartsa a szemantikai koherenciát a szegmensek között.

A csapat több konfigurációt értékelt, hogy egyensúlyt találjon az időtartam betartása, a szemantikai hűség, a késleltetés és a költség között. A kiválasztott beállítás éles környezetben is erős korlátkövetést biztosított nagy sebességgel, lehetővé téve a nagy volumenű fordítást manuális újraidőzítés nélkül. Az eredmény egy olyan fordítási folyamat, amelyben a tempót elsődleges változóként kezeljük, nem pedig olyasvalamiként, amit utólag korrigálunk.

A természetes ütem meghatározása és mérése

Az értékelések elfogadási kritériumainak kidolgozásához a csapat hallgatási teszteket végzett: lefordított hangmintákat készítettek, és kis lépésekben módosították a lejátszási sebességet, miközben arra kérték a felhasználókat, hogy értékeljék, mikor vált a beszéd természetellenessé. 

„Bármi, amit 10%-kal lelassítottunk vagy 20%-kal felgyorsítottunk, általában még mindig természetesen hangzott” – mondta Mistratov. Ezen a tartományon túl a beszéd túlságosan torz lett. 

A korábbi rendszerek gyengén teljesítettek e mérce szerint. A nyelvtől függően a szegmenseknek csak 40%–60%-a esett az elfogadható tempótartományon belül. Az áttervezett folyamattal ez a szám 40%–60%-ról 73% és 83% közé emelkedett, nyelvtől függően.

A csapat a szemantikai hűséget is értékelte egy külön modell-bíró értékeléssel, egy 1 („teljesen eltérő”) és 5 („szemantikailag egyenértékű”) közötti skálán.  A szinkronhoz úgy döntöttek, hogy alacsonyabb szemantikai küszöböt fogadnak el, mint a csak feliratos fordítás esetében, ahol az időtartam-korlátok irrelevánsak. Még ezzel a kompromisszummal együtt is a szegmensek 85,5%-át ötös skálán négyesre vagy ötösre értékelték a szemantikai megfelelés szempontjából.

Az eredmény egy olyan rendszer lett, amely mérhető magabiztossággal képes volt egyensúlyt teremteni két egymással versengő korlát, az időzítés és a jelentés között. És mivel mindkét metrika automatizált volt, a Descript képes folyamatosan értékelni az új modellkiadásokat és az utasításvariációkat ugyanazok alapján.

A nagyméretű videólokalizáció megvalósítása

Ahogy a fordítás az egyedi videókról a nagy tartalomkönyvtárakra terjed ki, a Descript egyre több irányítást épít be abba, hogyan hangolhatók a fordítások, beleértve annak lehetőségét is, hogy szükség esetén a szigorúbb szemantikai hűséget részesítse előnyben.

A Descripten belüli fordítás csak egy rétege a szélesebb multimodális rendszernek. A lefordított szöveg a beszédgenerálásba kerül, amely ezután a szájmozgás-szinkront és a végső videó renderelését irányítja. 

A szövegréteg fejlesztései lehetővé teszik a természetes tempót, de az összélmény attól is függ, hogy az audio modell mennyire jól őrzi meg a beszéd hangszínét, ritmusát és nem verbális jellemzőit. Ott látja a csapat a következő élvonalbeli területet. 

„A fordítási eredmény javításának nagy része abból fog adódni, hogy a folyamatot multimodálisabbá tesszük: a fordítás eldöntésekor a hangot, a videót és a szöveget együtt építjük be” – mondta Mistratov. „Ez jobban megőrizné a beszéd nem verbális jellemzőit, például a hangszínt és a hangsúlyt, és még többet megőrizne az eredeti előadásmódból.”

A Descript számára az erősebb érvelési modellek lehetővé tették a szinkronizálás bonyolultságának kezelését. Azáltal, hogy átléptük azt a küszöböt, ahol a modellek megbízhatóan egyensúlyba hozhatták az ütemezés és a jelentés közötti kompromisszumokat, a fordítás olyasmivé vált, amit a csapat szisztematikusan fejleszthetett és nagy léptékben alkalmazhatott.