Sari la conținutul principal
OpenAI

6 martie 2026

Startup

Cum proiectează Descript dublajul video multilingv la scară largă

Folosind modelele de raționament OpenAI, Descript a reușit să localizeze automat biblioteci de conținut de mari dimensiuni, fără a compromite sincronizarea sau sensul.

Sigla și marca verbală Descript pe un fundal abstract cu forme ondulate în nuanțe de roz și violet.
Dimensiunea companiei: Startup
Regiune: America de Nord
Sector de activitate: Tehnologie
Produse: API

Rezultate

43

Îmbunătățire în puncte procentuale a respectării duratei cu OpenAI

Rezultate

15%

Creștere a exporturilor cu dublaj după lansare

Se încarcă…

Descript(se deschide într-o fereastră nouă) este un editor video nativ cu inteligență artificială, dezvoltat pe baza unei idei simple: dacă poți edita text, ar trebui să poți edita conținut video. Încă de la începuturile Descript, inteligența artificială a contribuit la toate aspectele produsului: transcriere, editare, ordonarea fișierelor audio și fluxuri de lucru creative tot mai complexe. De ani de zile, se bazează pe OpenAI, folosind Whisper pentru transcriere și modelele GPT în cadrul co-editorului Underlord. 

Traducerea a devenit rapid un caz de utilizare cu impact ridicat. În mod tradițional, traducerea video era lentă și costisitoare, necesitând experți lingvistici pentru a gestiona proiecte, produce traduceri de rutină, gestiona controlul calității și genera conținutul audio corespunzător. LLM-urile comprimă dramatic acel flux de lucru, făcând posibilă traducerea de înaltă calitate la scară.

Atât subtitrările, cât și dublajul necesită fidelitate semantică: traducerea trebuie să păstreze sensul original. Însă respectarea duratei joacă un rol diferit în fiecare caz. Pentru subtitrări, este un plus. Pentru dublaj, este esențial, deoarece dacă vorbirea tradusă este prea lungă sau prea scurtă, va suna nefiresc chiar dacă sensul este corect.

Pentru a rezolva această problemă, Descript și-a reproiectat procesul de traducere folosind modele de raționament OpenAI pentru a optimiza fidelitatea semantică și respectarea duratei în timpul generării, nu după. În primele 30 de zile după lansare, exporturile de videoclipuri traduse cu dublaj au crescut cu 15%, iar respectarea duratei s-a îmbunătățit cu 13 până la 43 de puncte procentuale, în funcție de limbă.

„Dublajul este un caz de utilizare tot mai popular pentru Descript, așa că dezvoltăm modalități de a-l realiza în loturi pentru companiile care doresc să traducă și să dubleze biblioteci întregi”, a declarat Laura Burkhauser, directorul executiv.

Momentul în care dublajul a început să dea greș

Traducerea a fost una dintre cele mai vechi și cele mai solicitate funcții ale Descript. Inițial, traducea doar subtitrări, ceea ce a funcționat bine, dar mulți utilizatori au dorit mai mult și voiau să aibă și conținut audio (dublaj) în limba țintă.

Totuși, o problemă a continuat să apară: sunetul dublat nu suna întotdeauna corect. „Probabil cea mai frecventă nemulțumire pe care am auzit-o a fost ritmul nefiresc al vorbirii în limba tradusă”, a declarat Aleks Mistratov, directorul departamentului de produse IA de la Descript.

Problema s-a redus la faptul că limbile diferite necesită intervale de timp diferite pentru a exprima aceeași idee. Descript a observat, de exemplu, că, în medie, germana este o limbă „mai lungă” decât engleza. Pentru a se încadra în segmente video fixe, vorbirea tradusă a trebuit adesea să fie accelerată sau încetinită artificial. „Se ajungea la niște sunete ca de veverițe sau ca ale unui uriaș somnoros”, a explicat Mistratov.

engleză:

germană:

„Please review the safety guidelines before operating the machine.”

Silabe: 18

„Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Silabe: 24 (creștere de 40%)

În acest caz, conținutul audio în germană ar trebui fie accelerat în mod artificial, fie traducerea ar trebui rescrisă pentru a se încadra în timpul alocat.

Utilizatorii aveau două opțiuni: să resincronizeze manual fiecare segment audio sau să rescrie traducerea însăși pentru a o adapta. Ambele abordări implicau editări aprofundate ale cronologiei și, adesea, o fluență aproape nativă în limba țintă. Era obositor pentru creatori și a devenit un obstacol în calea extinderii acestei funcționalități la proiectele mari de localizare ale întreprinderilor.

Optimizarea traducerilor din punct de vedere al sincronizării, nu doar al sensului

Echipa avea o viziune clară asupra a ceea ce era necesar pentru ca dublajul să funcționeze. Sistemul nu trebuia doar să optimizeze sensul semantic, ci și să țină cont de constrângerile de timp. Când se traduce din engleză în germană, de exemplu, modelul ar trebui să înțeleagă cum să folosească mai puține cuvinte sau să simplifice conceptul, astfel încât dublajul să rămână natural.

Abordările anterioare au optimizat mai întâi fidelitatea semantică și au încercat să corecteze sincronizarea ulterior. Traducerile erau adesea corecte semantic, dar omiteau constant constrângerile de durată, iar calitatea generală tot nu era suficient de bună. 

„Am efectuat teste incrementale, fără să generăm nimic, ci doar cerându-i modelului să indice numărul de silabe dintr-un fragment de text”, a afirmat Mistratov. „Modelele anterioare pur și simplu nu se descurcau în acest sens.”

Numărarea fiabilă a silabelor s-a dovedit a fi esențială. Dacă modelul nu putea calcula silabele consecvent, nu putea viza în mod fiabil o durată specifică.

Modelele din seria GPT‑5 au adus un nivel de consecvență a raționamentului care nu exista în modelele anterioare, în special în sarcini precum numărarea silabelor și urmărirea constrângerilor. Odată cu această îmbunătățire, Descript și-a reproiectat fluxul de lucru pentru traducere și dublaj.

Mai întâi, sistemul Descript împarte transcrierea în fragmente, ghidat de limitele propozițiilor, pauzele naturale și tiparele de vorbire din înregistrarea originală. Fiecare fragment menține continuitatea semantică, dar este suficient de mic pentru a putea fi analizat prin raționament ca o unitate temporală.

De acolo, modelul calculează numărul de silabe din fragment. Pe baza unor ipoteze specifice limbii privind ritmul de vorbire, sistemul estimează numărul de silabe pe care ar trebui să îl conțină fragmentul tradus pentru a păstra un ritm natural („respectarea duratei”). Solicitarea îi cere modelului să optimizeze atât respectarea duratei, cât și păstrarea sensului. Fragmentele din jur sunt transmise sub formă de context, astfel încât modelul să mențină coerența semantică între segmente.

Echipa a evaluat mai multe configurații pentru a găsi un echilibru între respectarea duratei, fidelitatea semantică, latența și costuri. Configurația aleasă a asigurat o respectare riguroasă a constrângerilor la viteza de producție, permițând traducerea unui volum mare de text fără a fi necesară resincronizarea manuală. A rezultat un proces de traducere în care ritmul este tratat ca o variabilă de prim rang, și nu ca un element care se corectează ulterior.

Definirea și măsurarea ritmului natural

Pentru a dezvolta criteriile de acceptare pentru evaluări, echipa a efectuat teste de ascultare: a generat mostre audio traduse și a ajustat viteza de redare în trepte mici, cerându-le utilizatorilor să evalueze momentele în care vorbirea a devenit nefirească. 

„Orice a fost încetinit cu 10% sau accelerat cu 20% a continuat să sune, în general, natural”, a declarat Mistratov. Dincolo de acest interval, vorbirea devenea prea distorsionată. 

Sistemele anterioare au avut performanțe slabe din acest punct de vedere. În funcție de limbă, doar 40% până la 60% dintre segmente s-au încadrat în intervalul acceptabil de ritm. Datorită reorganizării procesului, acest procent a crescut de la 40–60% la 73–83%, în funcție de limbă.

De asemenea, echipa a evaluat fidelitatea semantică folosind un sistem separat de evaluare de tip „model-ca-evaluator”, pe o scară cuprinsă între 1 („complet diferit”) și 5 („echivalent semantic”).  Pentru dublaj, a decis să accepte un prag semantic mai scăzut decât în cazul traducerii exclusiv pentru subtitrare, unde constrângerile duratei sunt irelevante. Chiar și cu acest compromis, 85,5% dintre segmente au fost evaluate cu patru sau cinci din cinci pentru respectarea semantică.

A rezultat un sistem capabil să împace două constrângeri concurente — sincronizarea și sensul — cu un grad de încredere cuantificabil. Și pentru că ambii indicatori au fost automatizați, Descript poate evalua permanent noile versiuni ale modelelor și variațiile de solicitări în raport cu aceleași teste de performanță.

Descoperirea localizării video la scară largă

Pe măsură ce traducerea trece de la videoclipuri individuale la biblioteci de conținut de mari dimensiuni, Descript oferă un control sporit asupra modului în care sunt reglate traducerile, inclusiv posibilitatea de a acorda prioritate unei fidelități semantice mai stricte atunci când este necesar.

În Descript, traducerea reprezintă doar o componentă a unui sistem multimodal mai amplu. Textul tradus este introdus în generarea vorbirii, care apoi determină sincronizarea audiovizuală și randarea finală a videoclipului. 

Îmbunătățirile aduse la nivelul textului permit un ritm natural, dar experiența generală depinde și de măsura în care modelul audio reușește să păstreze tonul, ritmul și caracteristicile nonverbale ale vorbirii. Acolo consideră echipa că se află următoarea frontieră. 

„Un factor important care va contribui la îmbunătățirea calității traducerilor este transformarea procesului într-unul mai multimodal: integrarea conținutului audio, video și text în luarea deciziilor privind modul de traducere”, a declarat Mistratov. „Astfel, ar trebui să se păstreze mai bine caracteristicile nonverbale ale vorbirii, precum tonul și accentul, și să se redea și mai fidel modul original de exprimare.”

În cazul Descript, modelele de raționament mai performante au făcut ca procesul de dublaj să devină mai ușor de gestionat. Odată ce modelele au reușit să găsească un echilibru fiabil între ritm și sens, traducerea a devenit un proces pe care echipa l-a putut îmbunătăți sistematic și implementa la scară largă.