Անցնել հիմնական բովանդակությանը
OpenAI

6 մարտի, 2026 թ.

Ստարտափ

Descript-ը մեծ մասշտաբով անում է բազմալեզու տեսանյութերի դուբլյաժ

Օգտագործելով OpenAI հիմնավորման մոդելները՝ Descript-ը հնարավորություն տվեց մեծ բովանդակության գրադարանների ավտոմատ տեղայնացման՝ առանց ժամանակագրությունը կամ իմաստը կորցնելու։

Descript-ի լոգոն և բառային նշանը վարդագույն և մանուշակագույն աբստրակտ ալիքաձև ֆոնի վրա։
Ընկերության չափը: Ստարտափ
Տարածաշրջան: Հյուսիսային Ամերիկա
Արդյունաբերություն: Տեխնոլոգիա
Արտադրանքներ: API

Արդյունքներ

43

Տոկոսային կետերով բարելավում տևողության պահպանման մեջ՝ OpenAI-ի միջոցով

Արդյունքներ

15%

Կրկնօրինակված արտահանման աճը թողարկումից հետո

Բեռնվում է…

Descript(բացվում է նոր պատուհանում) -ը ԱԲ-ին բնիկ տեսանյութերի խմբագիր է՝ կառուցված մի պարզ գաղափարի շուրջ. եթե կարող եք խմբագրել տեքստը, պետք է կարողանաք խմբագրել նաև տեսանյութը։ Descript-ի վաղ օրերից ի վեր ԱԲ-ն հզորացրել է արտադրանքի յուրաքանչյուր կողմը՝ տառադարձում, խմբագրում, աուդիոյի մաքրում և գնալով ավելի բարդ ստեղծագործական աշխատանքային հոսքեր։ Նրանք տարիներ շարունակ կառուցել են OpenAI-ի վրա՝ օգտագործելով Whisper-ը տառադարձման համար և GPT շարքի մոդելներ իրենց Underlord համախմբագրիչում։ 

Թարգմանությունը արագորեն ի հայտ եկավ որպես բարձր ազդեցություն ունեցող օգտագործման դեպք։ Ավանդաբար, տեսանյութերի թարգմանությունը եղել է դանդաղ և թանկ՝ պահանջելով լեզվական մասնագետների՝ նախագծերը կառավարելու, մեխանիկական թարգմանություններ պատրաստելու, որակի վերահսկում իրականացնելու և համապատասխան աուդիո ստեղծելու համար։ LLM-ները զգալիորեն սեղմում են այդ աշխատանքային հոսքը՝ դարձնելով մասշտաբով բարձրորակ թարգմանությունը հնարավոր։

Ենթագրերը և դուբլյաժը երկուսն էլ պահանջում են սեմանտիկ ճշգրտություն. թարգմանությունը պետք է պահպանի սկզբնական իմաստը։ Բայց տևողությանը հետևելը յուրաքանչյուրում տարբեր դեր է խաղում։ Ինչ վերաբերում է ենթագրերին, դա հաճելի է ունենալ։ Դուբլյաժի համար դա շատ կարևոր է, քանի որ եթե թարգմանված խոսքը չափազանց երկար կամ չափազանց կարճ լինի, այն անբնական կհնչի, նույնիսկ եթե իմաստը ճիշտ է։

Սա լուծելու համար Descript-ը վերանախագծեց իր թարգմանության խողովակաշարը՝ օգտագործելով OpenAI հիմնավորման մոդելները՝ գեներացման ընթացքում օպտիմալելու համար իմաստային հավատարիմությունը և տևողության պահպանությունը։ Գործարկումից հետո առաջին 30 օրերի ընթացքում կրկնօրինակմամբ թարգմանված տեսանյութերի արտահանումները աճեցին 15%-ով, իսկ տևողության համապատասխանությունը բարելավվեց 13-ից 43 տոկոսային կետով՝ կախված լեզվից։

«Դուբլյաժը Descript-ի համար գնալով ավելի տարածված օգտագործման դեպք է, ուստի մենք կառուցում ենք եղանակներ՝ այն խմբաքանակով կատարելու համար այն ընկերությունների համար, որոնք ցանկանում են թարգմանել և համաժամեցնել շրթունքները ամբողջ գրադարանների համար», - ասաց գործադիր տնօրեն Լաուրա Բուրկհաուզերը։

Այնտեղ, որտեղ դուբլյաժը սկսեց խափանվել

Թարգմանությունը Descript-ի ամենավաղ և ամենապահանջված հնարավորություններից մեկն էր։ Նրանք սկսեցին միայն ենթագրերի թարգմանությամբ, որը լավ աշխատեց, բայց շատ օգտատերեր ցանկանում էին ավելի հեռու գնալ և ունենալ բանավոր աուդիո (դուբլայժ) թիրախային լեզվով։

Այնուամենայնիվ, մեկ խնդիր շարունակ ի հայտ էր գալիս՝ դուբլյաժված աուդիոն միշտ չէ, որ ճիշտ էր հնչում։ «Հավանաբար թիվ մեկ բողոքը, որ լսեցինք, այն էր, որ խոսքի տեմպը թարգմանված լեզվում անբնական էր», — նշեց Descript-ի ԱԲ արտադրանքի գծով ղեկավար Ալեքս Միստրատովը։

Խնդիրը հանգում էր այն փաստին, որ տարբեր լեզուները նույն գաղափարը արտահայտելու համար տարբեր քանակի ժամանակ են պահանջում։ Descript-ը նկատել է, օրինակ, որ միջինում գերմաներենը անգլերենից «ավելի երկար» լեզու է։ Ֆիքսված տեսանյութի հատվածների մեջ տեղավորվելու համար թարգմանված խոսքը հաճախ ստիպված էր արհեստականորեն արագացվել կամ դանդաղեցվել։ «Վերջում կստացվեր մի բան, որ կհնչեր ինչպես սկյուռիկներ կամ քնկոտ հսկա»,— բացատրեց Միստրատովը։

Անգլերեն՝

Գերմաներեն՝

«Խնդրում ենք վերանայել անվտանգության ուղեցույցները՝ նախքան մեքենան շահագործելը»։

Վանկեր՝ 18

“Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedienen.”

Վանկեր՝ 24 (40% աճ)

Այս դեպքում գերմաներենի աուդիոն կամ պետք է անբնականորեն արագացվի, կամ թարգմանությունը պետք է վերաշարադրվի՝ ժամանակային բյուջեին համապատասխանեցնելու համար։

Օգտատերերին մնացել էր երկու տարբերակ՝ ձեռքով վերաժամանակեցնել աուդիոն՝ հատված առ հատված, կամ վերաշարադրել թարգմանությունը՝ այն համապատասխանեցնելու համար։ Երկու մոտեցումներն էլ պահանջում էին ժամանակացույցի խորը խմբագրումներ և հաճախ՝ թիրախային լեզվին գրեթե մայրենի մակարդակի տիրապետում։ Սա ստեղծողների համար ձանձրալի էր և դարձավ խոչընդոտ՝ առանձնահատկությունը մասշտաբավորելու խոշոր ձեռնարկային տեղայնացման նախագծերի համար։

Թարգմանությունների օպտիմալացում՝ ժամանակի, ոչ միայն իմաստի համար

Թիմը հստակ պատկերացում ուներ, թե ինչ է անհրաժեշտ դուբլյաժը գործարկելու համար։ Համակարգը պետք է ոչ միայն օպտիմալացնի իմաստային նշանակության համար, այլ նաև տեղյակ լինի ժամանակային սահմանափակումների մասին։ Օրինակ՝ անգլերենից գերմաներեն թարգմանելիս, մոդելը պետք է հասկանա, թե ինչպես օգտագործել ավելի քիչ բառեր կամ պարզեցնել գաղափարը, որպեսզի դուբլյաժված աուդիոն մնա բնական։

Ավելի վաղ մոտեցումները նախ օպտիմալացնում էին իմաստային հավատարիմությունը և փորձում էին հետո շտկել ժամանակագրումը։ Թարգմանությունները հաճախ իմաստային առումով ճիշտ էին, բայց դրանք կանոնավոր կերպով չէին համապատասխանում տևողության սահմանափակումներին, և ընդհանուր որակը դեռևս բավականաչափ լավ չէր։ 

«Մենք կատարեցինք ինկրեմենտալ թեստեր՝ նույնիսկ ոչինչ չստեղծելով, պարզապես խնդրելով մոդելին արտածել տեքստի մի հատվածում վանկերի թիվը», — նշեց Միստրատովը։ «Ավելի վաղ մոդելները պարզապես այդ հարցում լավ չէին»։

Հուսալի վանկերի հաշվարկը պարզվեց, որ կարևոր նշանակություն ուներ։ Եթե մոդելը չէր կարող հետևողականորեն հաշվարկել վանկերը, այն չէր կարող հուսալիորեն թիրախավորել որոշակի տևողության պատուհան։

GPT‑5 շարքի մոդելները ապահովեցին հիմնավորման հետևողականության այնպիսի մակարդակ, որը պակասում էր ավելի վաղ մոդելներին, հատկապես այնպիսի առաջադրանքներում, ինչպիսիք են վանկերի հաշվարկը և սահմանափակումների հետևումը։ Այդ բարելավմամբ Descript-ը վերանախագծեց իր թարգմանության և դուբլյաժի խողովակաշարը։

Նախ, Descript-ի համակարգը սղագրությունը բաժանում է հատվածների՝ առաջնորդվելով նախադասությունների սահմաններով, բնական դադարներով և խոսքի օրինաչափություններով բնօրինակ ձայնագրության մեջ։ Յուրաքանչյուր հատված պահպանում է սեմանտիկ շարունակականությունը, բայց բավականաչափ փոքր է, որպեսզի դրա մասին հնարավոր լինի հիմնավորել որպես ժամանակային միավոր։

Այնտեղից մոդելը հաշվարկում է հատվածում վանկերի քանակը։ Օգտագործելով լեզվին հատուկ խոսքի արագության ենթադրություններ՝ համակարգը գնահատում է, թե քանի վանկ պետք է թիրախավորի թարգմանված հատվածը՝ բնական տեմպը պահպանելու համար։ Հարցումը մոդելից պահանջում է օպտիմալացնել ինչպես տևողությանը համապատասխանելը, այնպես էլ իմաստի պահպանումը։ Շրջապատող հատվածները փոխանցվում են որպես համատեքստ, որպեսզի մոդելը պահպանի իմաստային համահունչությունը հատվածների միջև։

Թիմը գնահատեց մի քանի կոնֆիգուրացիաներ՝ տևողության պահպանման, սեմանտիկ հավատարիմության, լատենտության և արժեքի միջև հավասարակշռություն ապահովելու համար։ Ընտրված կարգավորումը արտադրական արագությամբ ապահովեց սահմանափակումներին ուժեղ հետևում՝ հնարավորություն տալով մեծ ծավալի թարգմանություն՝ առանց ձեռքով վերաժամաչափման։ Արդյունքը թարգմանության մի գործընթաց է, որտեղ տեմպը դիտվում է որպես առաջին դասի փոփոխական, այլ ոչ թե որպես հետագայում շտկվող ինչ-որ բան։

Բնական տեմպի սահմանում և չափում

Գնահատումների համար ընդունման չափանիշները մշակելու նպատակով թիմը անցկացրեց լսողական թեստեր. նրանք ստեղծեցին թարգմանված աուդիո նմուշներ և փոքր քայլերով կարգավորեցին վերարտադրման արագությունը՝ օգտատերերին խնդրելով գնահատել, թե երբ խոսքը դարձավ անբնական։ 

«Այն ամենը, ինչը դանդաղեցվել էր 10%-ով կամ արագացվել էր 20%-ով, ընդհանուր առմամբ դեռ բնական էր հնչում»,— ասաց Միստրատովը։ Այս միջակայքից դուրս խոսքը չափազանց աղավաղված դարձավ։ 

Ավելի վաղ համակարգերը այդ չափման համաձայն վատ արդյունքներ էին ցույց տալիս։ Կախված լեզվից՝ հատվածների միայն 40%-ից 60%-ն էր տեղավորվում ընդունելի տեմպի միջակայքում։ Վերանախագծված խողովակաշարի շնորհիվ այդ թիվը 40%–60%-ից աճեց՝ հասնելով 73% և 83% միջակայքին՝ կախված լեզվից։

Թիմը նաև գնահատել է իմաստային հավատարմությունը՝ օգտագործելով մոդելի գնահատման առանձին համակարգ՝ 1-ից («լիովին տարբեր») մինչև 5 («իմաստապես համարժեք») սանդղակով։  Դուբլյաժի համար նրանք որոշեցին ընդունել ավելի ցածր իմաստային շեմ, քան միայն ենթագրերի թարգմանության դեպքում, որտեղ տևողության սահմանափակումները նշանակություն չունեն։ Նույնիսկ այդ փոխզիջման դեպքում, հատվածների 85,5%-ը գնահատվել է չորս կամ հինգ՝ հինգից՝ ըստ իմաստային համապատասխանության։

Արդյունքը մի համակարգ էր, որը կարող էր չափելի վստահությամբ հավասարակշռել երկու մրցակցող սահմանափակումները՝ ժամանակացույցը և իմաստը։ Եվ քանի որ երկու չափանիշներն էլ ավտոմատացված էին, Descript-ը կարող է շարունակաբար գնահատել մոդելի նոր թողարկումները և հարցման տարբերակները՝ նույն հենանիշների համեմատությամբ։

Լայնածավալ վիդեո տեղայնացման հնարավորությունների բացահայտում

Քանի որ թարգմանությունը մեկ տեսանյութից անցնում է մեծ բովանդակության գրադարանների, Descript-ը ավելի մեծ վերահսկողություն է ապահովում թարգմանությունների կարգավորման վրա, այդ թվում՝ անհրաժեշտության դեպքում ավելի խիստ իմաստային ճշգրտություն տալու հնարավորությամբ։

Descript-ի ներսում թարգմանությունը ավելի լայն մուլտիմոդալ համակարգի միայն մեկ շերտն է։ Թարգմանված տեքստը փոխանցվում է խոսքի գեներացմանը, որն այնուհետև ապահովում է շուրթերի համաժամացումը և վերջնական տեսանյութի արտապատկերումը։ 

Տեքստային շերտի բարելավումները հնարավորություն են տալիս բնական տեմպի ապահովմանը, սակայն ընդհանուր փորձառությունը կախված է նաև նրանից, թե որքան լավ է աուդիո մոդելը պահպանում խոսքի տոնը, ռիթմը և ոչ վերբալ բնութագրերը։ Ահա թե որտեղ է թիմը տեսնում հաջորդ սահմանը։ 

«Թարգմանության արդյունքի բարելավման մեծ մասը կապված է հոսքագիծն ավելի բազմամոդալ դարձնելու հետ։ Թարգմանելու եղանակը որոշելիս՝ աուդիո, տեսանյութ և տեքստ համատեղելով», - ասաց Միստրատովը։ «Դա պետք է ավելի լավ պահպանի խոսքի ոչ վերբալ առանձնահատկությունները, ինչպիսիք են տոնը և շեշտադրումը, և ավելի շատ պահպանի բնօրինակ արտասանությունը»։

Descript-ի համար ավելի հզոր հիմնավորման մոդելները կրկնօրինակման բարդությունը դարձրին կառավարելի։ Հաղթահարելով այն շեմը, որտեղ մոդելները կարող էին հուսալիորեն հավասարակշռել տեմպի և իմաստի միջև փոխզիջումները, թարգմանությունը դարձավ մի գործընթաց, որը թիմը կարող էր համակարգված բարելավել և մասշտաբայնորեն կիրառել։