Cómo Descript gestiona el doblaje multilingüe de vídeos a escala
Con los modelos de razonamiento de OpenAI, Descript automatizó la localización de grandes bibliotecas de contenido sin perder la temporización ni el significado.

Resultados
43
Mejora en puntos porcentuales en el ajuste temporal con OpenAI
Resultados
15 %
Aumento de las exportaciones con doblaje tras el despliegue
Descript(se abre en una ventana nueva) es un editor de vídeo nativo de IA creado en torno a una idea sencilla: si puedes editar texto, deberías poder editar vídeo. Desde los inicios de Descript, la IA ha impulsado todos los aspectos del producto: transcripción, edición, limpieza del audio y flujos de trabajo creativos cada vez más complejos. Llevan años desarrollando con OpenAI, usando Whisper para la transcripción y modelos de la serie GPT dentro de su coeditor Underlord.
La traducción surgió rápidamente como un caso de uso de alto impacto. Tradicionalmente, traducir vídeos era lento y costoso, y requería expertos lingüísticos para gestionar proyectos, producir traducciones automáticas, encargarse del control de calidad y generar el audio correspondiente. Los LLM reducen drásticamente ese flujo de trabajo, lo que permite realizar traducciones de alta calidad a gran escala.
Los subtítulos y el doblaje requieren fidelidad semántica: la traducción debe conservar el significado original. Pero el ajuste temporal desempeña un papel distinto en cada uno. En el caso de los subtítulos, es algo deseable, pero no imprescindible. En el doblaje, es fundamental, porque si el habla traducida dura demasiado o demasiado poco, sonará poco natural aunque el significado sea el correcto.
Para abordar esto, Descript rediseñó su flujo de traducción utilizando modelos de razonamiento de OpenAI para optimizar la fidelidad semántica y el ajuste temporal durante la generación, no después. En los primeros 30 días tras la implementación, las exportaciones de vídeos traducidos con doblaje aumentaron un 15 %, y el ajuste temporal mejoró entre 13 y 43 puntos porcentuales, según el idioma.
«El doblaje es un caso de uso cada vez más popular en Descript, así que estamos desarrollando formas de hacerlo por lotes para empresas que quieran traducir y ajustar la sincronización labial de catálogos completos», afirma Laura Burkhauser, CEO.
La traducción fue una de las primeras funciones de Descript y una de las más solicitadas. Empezaron con la traducción solo de subtítulos, que funcionó bien, pero muchos usuarios querían ir más allá y tener audio hablado (doblaje) en el idioma de destino.
Sin embargo, había un problema que seguía apareciendo: el audio doblado no siempre sonaba bien. «Probablemente, la principal queja que escuchamos fue que el ritmo del habla no resultaba natural en el idioma traducido», recuerda Aleks Mistratov, responsable de Producto de IA en Descript.
El problema radicaba en que expresar una misma idea lleva distintas cantidades de tiempo según el idioma. Descript observó, por ejemplo, que de media el alemán es un idioma «más largo» que el inglés. Para encajar en segmentos de vídeo fijos, a menudo había que acelerar o ralentizar artificialmente la locución traducida. «El resultado sería algo que sonaría como unas ardillas o como un gigante adormilado», explica Mistratov.
Inglés: | Alemán: |
«Please review the safety guidelines before operating the machine». Sílabas: 18 | «Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen». Sílabas: 24 (aumento del 40 %) |
En este caso, el audio en alemán tendría que acelerarse de forma poco natural, o la traducción tendría que reescribirse para ajustarse al tiempo disponible.
Los usuarios tenían dos opciones: reajustar manualmente la temporización del audio segmento a segmento, o reescribir la propia traducción para que encajara. Ambos enfoques requerían ajustes profundos en la línea de tiempo y, a menudo, un dominio casi nativo del idioma de destino. Resultaba tedioso para los creadores y se convirtió en un obstáculo para ampliar la funcionalidad a grandes proyectos de localización empresarial.
El equipo tenía una teoría clara sobre lo que haría falta para que el doblaje funcionara. El sistema no solo tendría que optimizar el significado semántico, sino también tener en cuenta las limitaciones de tiempo. Al traducir del inglés al alemán, por ejemplo, el modelo tendría que entender cómo usar menos palabras o simplificar el concepto, para que el audio doblado resultara natural.
Los enfoques anteriores optimizaban primero la fidelidad semántica e intentaban corregir después la sincronización temporal. Las traducciones solían ser semánticamente correctas, pero incumplían sistemáticamente las restricciones temporales y la calidad general seguía sin ser lo suficientemente buena.
«Hicimos pruebas incrementales, sin siquiera generar nada; simplemente le pedimos al modelo que devolviera el número de sílabas de un fragmento de texto», cuenta Mistratov. «A los modelos anteriores, sencillamente, no se les daba bien eso».
El recuento fiable de sílabas resultó ser fundamental. Si el modelo no podía calcular las sílabas de forma sistemática, no podía ajustarse de forma fiable a un intervalo temporal específico.
Los modelos de la serie GPT‑5 aportaron un nivel de coherencia en el razonamiento del que carecían los modelos anteriores, especialmente en tareas como el recuento de sílabas y el seguimiento de restricciones. Con esa mejora, Descript rediseñó su flujo de trabajo de traducción y doblaje.
En primer lugar, el sistema de Descript divide la transcripción en fragmentos, guiándose por los límites de las frases, las pausas naturales y los patrones de habla de la grabación original. Cada fragmento mantiene la continuidad semántica, pero es lo bastante pequeño como para razonar sobre él como unidad temporal.
A partir de ahí, el modelo calcula el número de sílabas del fragmento. Mediante supuestos sobre la velocidad del habla específicos de cada idioma, el sistema estima a cuántas sílabas debería aspirar el fragmento traducido para mantener un ritmo natural («ajuste temporal»). El prompt pide al modelo que optimice tanto el ajuste temporal como la conservación del significado. Los fragmentos circundantes se pasan como contexto para que el modelo mantenga la coherencia semántica entre segmentos.
El equipo evaluó varias configuraciones para equilibrar el ajuste temporal, la fidelidad semántica, la latencia y el coste. La configuración seleccionada ofreció un alto cumplimiento de las restricciones a velocidad de producción, lo que permitió realizar un gran volumen de traducción sin necesidad de reajustes manuales. El resultado es un flujo de traducción en el que el ritmo se trata como una variable de primer orden, en vez de como algo que se corrige a posteriori.
Para desarrollar los criterios de aceptación de las evaluaciones, el equipo realizó pruebas de escucha: generaron muestras de audio traducido y ajustaron la velocidad de reproducción en pequeños incrementos, pidiendo a los usuarios que valoraran cuándo el habla empezaba a sonar poco natural.
«Cualquier cosa que se hubiera ralentizado un 10 % o acelerado un 20 % generalmente seguía sonando natural», indica Mistratov. Más allá de este rango, el habla se distorsionaba demasiado.
Los sistemas anteriores no daban buenos resultados desde ese punto de vista. Según el idioma, solo entre el 40 % y el 60 % de los segmentos se situaron dentro del intervalo de ritmo aceptable. Con el proceso rediseñado, esa cifra aumentó del 40 %–60 % a entre el 73 % y el 83 %, según el idioma.
El equipo también evaluó la fidelidad semántica mediante una calificación independiente del modelo como juez en una escala que iba del 1 («completamente diferente») al 5 («semánticamente equivalente»). Para el doblaje, decidieron aceptar un umbral semántico más bajo que en la traducción solo para subtítulos, donde las restricciones temporales son irrelevantes. Incluso con esa contrapartida, el 85,5 % de los segmentos obtuvo una puntuación de 4 o 5 sobre 5 en fidelidad semántica.
El resultado fue un sistema capaz de equilibrar dos restricciones contrapuestas —el tiempo y el significado— con un nivel de confianza medible. Y como ambas métricas estaban automatizadas, Descript puede evaluar continuamente nuevas versiones de modelos y variaciones de prompts con las mismas referencias de evaluación.
A medida que la traducción pasa de vídeos individuales a grandes bibliotecas de contenido, Descript está incorporando más control sobre cómo se ajustan las traducciones, incluida la posibilidad de priorizar una fidelidad semántica más estricta cuando sea necesario.
La traducción dentro de Descript es solo una capa de un sistema multimodal más amplio. El texto traducido se introduce en la generación de voz, que a su vez impulsa la sincronización labial y el renderizado final del vídeo.
Las mejoras en la capa del texto permiten un ritmo natural, pero la experiencia general también depende de lo bien que el modelo de audio conserve el tono, la cadencia y las características no verbales del habla. Ahí es donde el equipo ve la siguiente de frontera.
«Gran parte de lo que va a mejorar los resultados de la traducción consiste en hacer que el flujo de trabajo sea más multimodal: incorporar audio, vídeo y texto conjuntamente a la hora de decidir cómo traducir», asegura Mistratov. «Eso debería mantener mejor las características no verbales del habla, como el tono y el énfasis, y conservar aún más la forma original de expresarse».
Para Descript, unos modelos de razonamiento más potentes hicieron manejable la complejidad del doblaje. Al cruzar el umbral en el que los modelos podían equilibrar de forma fiable las concesiones entre ritmo y significado, la traducción pasó a ser algo que el equipo podía mejorar sistemáticamente e implementar a gran escala.


