Salta al contingut principal
OpenAI

6 de març del 2026

Empresa emergent

Descript desenvolupa doblatge de vídeo multilingüe a gran escala

Mitjançant els models de raonament d’OpenAI, Descript va fer possible la localització automàtica de grans biblioteques de contingut sense perdre la sincronització ni el significat.

Logotip i marca denominativa de Descript sobre un fons amb una forma d’ona abstracta en rosa i porpra.
Mida de l'empresa: Empresa emergent
Regió: Amèrica del Nord
Indústria: Tecnologia
Productes: API

Resultats

43

Millora en punts percentuals del compliment de la durada amb OpenAI

Resultats

15%

Augment de les exportacions doblades després del desplegament

S'està carregant…

Descript(s'obre en una finestra nova) és un editor de vídeo natiu d’IA creat a partir d’una idea senzilla: si pots editar text, hauries de poder editar vídeo. Des dels inicis de Descript, la IA ha impulsat tots els aspectes del producte: la transcripció, l’edició, la neteja d’àudio i fluxos de treball creatius cada cop més complexos. Fa anys que desenvolupen amb OpenAI, utilitzant Whisper per a la transcripció i models de la sèrie GPT dins del seu coeditor Underlord. 

La traducció es va consolidar ràpidament com un dels casos d'ús amb més impacte. Tradicionalment, la traducció de vídeo ha estat un procés lent i costós, que requeria experts lingüístics per gestionar els projectes, elaborar les traduccions, dur a terme el control de qualitat i generar l'àudio corresponent. Els LLM comprimeixen dràsticament aquest flux de treball, fent possible la traducció d'alta qualitat a gran escala.

Els subtítols i el doblatge requereixen fidelitat semàntica: la traducció ha de preservar el significat original. Però el compliment de la durada té un paper diferent en cadascun. Pel que fa als subtítols, és convenient, però no imprescindible. Per al doblatge, és crucial, perquè si la locució traduïda és massa llarga o massa curta, sonarà poc natural encara que el significat sigui correcte.

Per resoldre aquest problema, Descript va redissenyar el seu flux de traducció utilitzant models de raonament d'OpenAI per optimitzar la fidelitat semàntica i el respecte de la durada durant la generació, i no pas a posteriori. Durant els primers 30 dies després del desplegament, les exportacions de vídeos traduïts amb doblatge van augmentar un 15 %, i el grau d'ajust a la durada va millorar entre 13 i 43 punts percentuals, segons la llengua.

"El doblatge és un cas d'ús cada vegada més popular a Descript, per això estem desenvolupant eines que permetin fer-lo per lots per a les empreses que volen traduir i sincronitzar el moviment dels llavis de biblioteques senceres de vídeos", va afirmar la directora executiva, Laura Burkhauser.

On el doblatge va començar a fallar

La traducció va ser una de les primeres funcions de Descript i una de les més sol·licitades. Van començar amb la traducció només dels subtítols, que funcionava bé, però molts usuaris volien anar més enllà i tenir àudio parlat (doblatge) en la llengua de destinació.

Tanmateix, hi havia un problema que continuava apareixent: l'àudio doblat no sempre sonava bé. "Probablement, la queixa que sentíem més sovint era que el ritme de la parla en la llengua traduïda resultava poc natural", va afirmar Aleks Mistratov, responsable de Producte d'IA de Descript.

El problema venia donat pel fet que diferents llengües necessiten diferents quantitats de temps per expressar la mateixa idea. Descript va observar, per exemple, que, de mitjana, l’alemany és una llengua «més llarga» que l’anglès. Per encaixar en segments de vídeo fixos, sovint s’havia d’accelerar o alentir artificialment la locució traduïda. "Al final, obtenies un resultat que sonava com si parlessin uns esquirols accelerats o un gegant adormit", va explicar Mistratov.

Anglès:

Alemany:

“Si us plau, revisa les instruccions de seguretat abans de fer funcionar la màquina.”

Síl·labes: 18

“Revisa les directrius de seguretat abans d’utilitzar la màquina.”

Síl·labes: 24 (augment del 40 %)

En aquest cas, caldria accelerar l’àudio en alemany de manera poc natural, o bé caldria reescriure la traducció perquè s’ajustés al temps disponible.

Els usuaris només teniu dues opcions: reajustar manualment la sincronització de l’àudio segment per segment, o reescriure la traducció mateixa perquè encaixi. Tots dos enfocaments requerien edicions profundes de la línia de temps i, sovint, una fluïdesa gairebé nativa en la llengua de destinació. Era tediós per als creadors i es va convertir en un obstacle per escalar la funcionalitat a grans projectes de localització empresarials.

Optimitzar les traduccions per ajustar-les a la durada, no només al significat

L’equip tenia una teoria clara sobre què caldria per fer que el doblatge funcionés. El sistema havia d'optimitzar no només el significat semàntic, sinó també tenir en compte les restriccions temporals. Per exemple, en traduir de l'anglès a l'alemany, el model havia d'entendre com utilitzar menys paraules o simplificar el concepte perquè l'àudio doblat continués sonant natural.

Els enfocaments anteriors optimitzaven primer la fidelitat semàntica i intentaven corregir la sincronització temporal posteriorment. Les traduccions sovint eren semànticament correctes, però habitualment no respectaven les restriccions de durada, i la qualitat global encara no era prou bona. 

“Vam fer proves incrementals, sense ni tan sols generar res, simplement demanant al model que indiqués el nombre de síl·labes en un fragment de text”, va dir Mistratov. “Els models anteriors, senzillament, no eren bons en això.”

El recompte fiable de síl·labes va resultar fonamental. Si el model no podia calcular les síl·labes de manera coherent, no podia apuntar de manera fiable a una finestra de durada específica.

Els models de la sèrie GPT‑5 van aportar un nivell de consistència en el raonament que els models anteriors no tenien, especialment en tasques com el recompte de síl·labes i el seguiment de les restriccions. Amb aquesta millora, Descript va redissenyar el seu flux de treball de traducció i doblatge.

En primer lloc, el sistema de Descript divideix la transcripció en fragments, tenint en compte els límits de les frases, les pauses naturals i els patrons de parla de l’enregistrament original. Cada fragment manté la continuïtat semàntica, però és prou petit perquè el model el pugui tractar com una unitat temporal.

A partir d’aquí, el model calcula el nombre de síl·labes del fragment. A partir d'hipòtesis específiques sobre la velocitat de parla de cada llengua, el sistema estima quantes síl·labes hauria de tenir cada fragment traduït per mantenir un ritme natural ("ajust a la durada"). La indicació demana al model que optimitzi tant el compliment de la durada com la preservació del significat. Els fragments circumdants es passen com a context perquè el model mantingui la coherència semàntica entre segments.

L'equip va avaluar diverses configuracions per equilibrar l'ajust a la durada, la fidelitat semàntica, la latència i el cost. La configuració seleccionada va oferir un excel·lent compliment de les restriccions a velocitat de producció, fet que va permetre traduir grans volums de contingut sense necessitat de reajustar-ne manualment la sincronització temporal. El resultat és un flux de treball de traducció en què el ritme es tracta com una variable de primer ordre en lloc d’alguna cosa que es corregeix a posteriori.

Definir i mesurar el ritme natural

Per definir els criteris d'acceptació de les avaluacions (evals), l'equip va dur a terme proves d'escolta: va generar mostres d'àudio traduït i en va ajustar gradualment la velocitat de reproducció, demanant als usuaris que valoressin a partir de quin punt la parla començava a sonar poc natural. 

“Tot el que s’alentís un 10 %, o s’accelerés un 20 %, generalment continuava sonant natural”, va dir Mistratov. Més enllà d’aquest rang, la parla quedava massa distorsionada. 

Els sistemes anteriors tenien un rendiment baix segons aquesta mètrica. Segons la llengua, només entre el 40% i el 60% dels segments es trobaven dins de la finestra de ritme acceptable. Amb el flux de processament redissenyat, aquesta xifra va augmentar d’entre el 40% i el 60% a entre el 73% i el 83%, segons l’idioma.

L’equip també va avaluar la fidelitat semàntica mitjançant una valoració independent amb un model com a jutge en una escala que va de l’1 (“completament diferent”) al 5 (“semànticament equivalent”).  Per al doblatge, van decidir acceptar un llindar semàntic més baix que en la traducció destinada únicament a subtítols, on les restriccions de durada són irrellevants. Fins i tot amb aquesta contrapartida, el 85,5 % dels segments van rebre una puntuació de quatre o cinc sobre cinc en adherència semàntica.

El resultat va ser un sistema capaç d’equilibrar dues restriccions contraposades —la temporització i el significat— amb un grau de confiança mesurable. I com que totes dues mètriques es van automatitzar, Descript pot avaluar contínuament les noves versions del model i les variacions d’indicació amb els mateixos punts de referència.

Fer possible la localització de vídeo a gran escala

A mesura que la traducció passa de vídeos individuals a grans biblioteques de contingut, Descript està incorporant més control sobre com s’ajusten les traduccions, inclosa la capacitat de prioritzar una fidelitat semàntica més estricta quan calgui.

La traducció a Descript només és una capa d’un sistema multimodal més ampli. El text traduït s’utilitza com a entrada per a la generació de veu, que després controla la sincronització labial i la renderització final del vídeo. 

Les millores introduïdes en la capa de text fan possible mantenir un ritme natural, però l'experiència global també depèn de fins a quin punt el model d'àudio és capaç de preservar el to, la cadència i les característiques no verbals de la parla. És aquí on l’equip veu la propera d'avantguarda. 

"Gran part del que millorarà els resultats de la traducció és fer que el flux de treball sigui més multimodal: incorporar àudio, vídeo i text conjuntament a l’hora de decidir com traduir," va dir Mistratov. “Això hauria de mantenir millor les característiques no verbals de la parla, com ara el to i l’èmfasi, i conservar encara més la manera original d’expressar-se.”

Gràcies a Descript, models de raonament més potents van fer que la complexitat del doblatge fos assumible. En assolir el punt en què els models van ser capaços d'equilibrar de manera fiable el ritme i el significat, la traducció es va convertir en un procés que l'equip podia millorar de manera sistemàtica i desplegar a gran escala.