Cómo Descript lleva el doblaje multilingüe a gran escala
Con modelos de razonamiento de OpenAI, Descript logró la localización automática de grandes bibliotecas de contenido sin perder sincronización ni significado.

Resultados
43
Mejora en puntos porcentuales del cumplimiento de la duración con OpenAI
Resultados
15 %
Aumento en las exportaciones tras la implementación
Descript(se abre en una nueva ventana) es un editor de video nativo con IA basado en una idea sencilla: si puedes editar texto, también deberías poder editar video. Desde los primeros días de Descript, la IA ha impulsado todos los aspectos del producto: transcripción, edición, limpieza de audio y flujos de trabajo creativos cada vez más complejos. Llevan años desarrollando sobre OpenAI, usando Whisper para transcripción y modelos de la serie GPT dentro de su coeditor Underlord.
La traducción surgió rápidamente como un caso de uso de alto impacto. Tradicionalmente, traducir videos ha sido un proceso lento y costoso, que requiere expertos en idiomas para gestionar proyectos, producir traducciones literales, encargarse del control de calidad y generar el audio correspondiente. Los LLM reducen drásticamente ese flujo de trabajo, lo que permite la traducción de alta calidad a gran escala.
Tanto los subtítulos como el doblaje requieren fidelidad semántica: la traducción debe conservar el significado original. Sin embargo, el cumplimiento de la duración desempeña un papel diferente en cada uno. Para los subtítulos, es algo deseable. En el doblaje, esto es fundamental, porque si el diálogo traducido dura demasiado o muy poco, sonará poco natural aunque el significado sea correcto.
Para resolver este problema, Descript rediseñó su flujo de traducción con modelos de razonamiento de OpenAI para optimizar la fidelidad semántica y la duración objetivo desde la generación, en lugar de corregirlas después. En los primeros 30 días después de la implementación, las exportaciones de videos traducidos con doblaje aumentaron un 15 %, y el ajuste a la duración mejoró entre 13 y 43 puntos porcentuales, según el idioma.
“El doblaje es un caso de uso cada vez más popular para Descript, por eso estamos desarrollando formas de hacerlo por lotes para empresas que quieren traducir y sincronizar el movimiento de los labios en catálogos completos”, dijo Laura Burkhauser, directora ejecutiva.
La traducción fue una de las primeras funciones de Descript y una de las más solicitadas. Comenzaron con la traducción solo de subtítulos, que funcionó bien — pero muchos usuarios querían ir más allá y tener audio hablado (doblaje) en el idioma de destino.
Sin embargo, había un problema recurrente: el audio doblado no siempre sonaba natural. “Probablemente, la principal queja que escuchamos fue que el ritmo del habla no era natural en el idioma traducido”, dijo Aleks Mistratov, director de producto de IA en Descript.
El problema era que cada idioma requiere un tiempo distinto para expresar la misma idea. Descript observó, por ejemplo, que en promedio el alemán es un idioma “más largo” que el inglés. Para ajustarse a segmentos de video de duración fija, el habla traducida a menudo tenía que acelerarse o ralentizarse artificialmente. “Terminabas con una voz de ardilla aguda y rápida, o con la de un gigante adormilado”, explicó Mistratov.
Inglés: | Alemán: |
“Revisa las pautas de seguridad antes de operar la máquina.” Sílabas: 18 | “Verifica los lineamientos de seguridad antes de operar la máquina.” Sílabas: 24 (aumento del 40 %) |
En este caso, el audio en alemán tendría que acelerarse de forma poco natural, o la traducción tendría que reescribirse para ajustarse al tiempo disponible.
A los usuarios les quedaban dos opciones: reajustar manualmente los tiempos del audio segmento por segmento, o reescribir la traducción para que encajara. Ambos enfoques requerían ediciones exhaustivas en la línea de tiempo y, a menudo, una fluidez casi nativa en el idioma de destino. Era tedioso para los creadores y se convirtió en un obstáculo para escalar la funcionalidad a grandes proyectos de localización empresarial.
El equipo tenía una teoría clara sobre lo que haría falta para que el doblaje funcionara. El sistema no solo tendría que optimizar el significado semántico, sino también tener en cuenta las restricciones de duración. Al traducir del inglés al alemán, por ejemplo, el modelo tendría que entender cómo usar menos palabras o simplificar el concepto, para que el audio doblado siguiera sonando natural.
Los enfoques anteriores optimizaban primero la fidelidad semántica e intentaban corregir la sincronización después. Las traducciones a menudo eran semánticamente correctas, pero con frecuencia no cumplían con las restricciones de duración, y la calidad general aún no era lo suficientemente buena.
“Hicimos pruebas incrementales, sin siquiera generar nada. Solo le pedíamos al modelo que indicara el número de sílabas en un fragmento de texto”, dijo Mistratov. “Los modelos anteriores simplemente no eran buenos para eso”.
El conteo confiable de sílabas resultó ser fundamental. Si el modelo no podía calcular las sílabas de forma consistente, no podía ajustarse de forma confiable a una duración determinada.
Los modelos de la serie GPT‑5 aportaron un nivel de consistencia en el razonamiento que los modelos anteriores no tenían, especialmente en tareas como el conteo de sílabas y el seguimiento de restricciones. Con esa mejora, Descript rediseñó su flujo de trabajo de traducción y doblaje.
Primero, el sistema de Descript divide la transcripción en fragmentos según los límites de las oraciones, las pausas naturales y los patrones de habla de la grabación original. Cada fragmento mantiene la continuidad semántica, pero es lo suficientemente pequeño como para analizarlo como una unidad de tiempo.
A partir de ahí, el modelo calcula el número de sílabas en el fragmento. Con base en supuestos sobre la velocidad de habla de cada idioma, el sistema estima cuántas sílabas debe tener cada fragmento traducido para mantener un ritmo natural (“cumplimiento de la duración”). El prompt le pide al modelo que optimice tanto la adherencia a la duración como la preservación del significado. Los fragmentos circundantes se pasan como contexto para que el modelo mantenga la coherencia semántica entre segmentos.
El equipo evaluó múltiples configuraciones para equilibrar el cumplimiento de la duración, la fidelidad semántica, la latencia y el costo. La configuración seleccionada ofreció un sólido cumplimiento de las restricciones a velocidad de producción, lo que permitió traducir grandes volúmenes de contenido sin tener que ajustar la duración manualmente El resultado es un flujo de traducción en el que el ritmo se considera una variable clave desde el inicio, en lugar de algo que se corrige posteriormente.
Para desarrollar los criterios de aceptación de las evaluaciones, el equipo realizó pruebas de escucha: generaron muestras de audio traducido y ajustaron la velocidad de reproducción en pequeños incrementos, pidiendo a los usuarios que calificaran en qué momento el habla comenzaba a sonar poco natural.
“Todo lo que se ralentizaba en un 10 % o se aceleraba en un 20 %, por lo general seguía sonando natural”, dijo Mistratov. Más allá de este rango, el habla se volvió demasiado distorsionada.
Los sistemas anteriores tuvieron un desempeño deficiente según esa medida. Según el idioma, solo entre el 40 % y el 60 % de los segmentos quedaron dentro de la ventana de ritmo aceptable. Con el pipeline rediseñado, esa cifra aumentó de entre el 40 % y el 60 % a entre el 73 % y el 83 %, según el idioma.
El equipo también evaluó la fidelidad semántica mediante una calificación independiente de modelo como juez en una escala de 1 (“completamente diferente”) a 5 (“semánticamente equivalente”). Para el doblaje, decidieron aceptar un umbral semántico más bajo que para la traducción solo con subtítulos, donde las restricciones de duración son irrelevantes. Incluso con esa compensación, el 85.5 % de los segmentos recibieron una calificación de cuatro o cinco de cinco en fidelidad semántica.
El resultado fue un sistema capaz de equilibrar dos objetivos en conflicto: la duración y el significado, con una confianza medible. Y como ambas métricas estaban automatizadas, Descript puede evaluar de forma continua las nuevas versiones de modelos y las variaciones de prompt frente a las mismas referencias.
A medida que la traducción pasa de videos individuales a grandes bibliotecas de contenido, Descript incorpora más control en la forma en que se ajustan las traducciones, incluida la posibilidad de priorizar una mayor fidelidad semántica cuando sea necesario.
La traducción en Descript es solo una capa dentro de un sistema multimodal más amplio. El texto traducido pasa a la generación de voz, que después se encarga de la sincronización labial y del renderizado final del video.
Las mejoras en la capa de texto permiten lograr un ritmo natural, pero la experiencia completa también depende de la capacidad del modelo de audio para conservar el tono, la cadencia y las características no verbales de la voz. Ahí es donde el equipo ve el próximo gran desafío.
“Gran parte de lo que mejorará los resultados de traducción consiste en hacer que el flujo de trabajo sea más multimodal: incorporar audio, video y texto en conjunto al decidir cómo traducir”, dijo Mistratov. “Eso debería conservar mejor las características no verbales del habla, como el tono y el énfasis, y preservar aún más la forma de expresión original.”
Para Descript, los modelos de razonamiento más potentes hicieron que la complejidad del doblaje fuera manejable. Al superar el umbral en el que los modelos podían equilibrar de forma confiable las compensaciones entre ritmo y significado, la traducción se convirtió en algo que el equipo podía mejorar sistemáticamente y desplegar a gran escala.


