Негізгі мазмұнға өту
OpenAI

2026 ж. 6 наурыз

Стартап

Descript көптілді бейне дубляжын ауқымды түрде қалай әзірлейді

OpenAI-дың ойлау модельдерін пайдалана отырып, Descript үлкен контент кітапханаларын уақыт пен мағына жоғалтпай автоматты түрде жергілікті тілге аударуды іске қосты.

Қызғылт және күлгін абстрактілі толқын пішінді фонның үстіндегі Descript логотипі мен фирмалық жазуы.
Компания көлемі: Стартап
Аймақ: Солтүстік Америка
Сала: Технология
Өнімдер: API

Нәтижелер

43

OpenAI көмегімен ұзақтыққа сәйкестік көрсеткішінің пайыздық ұлғаюы

Нәтижелер

15%

Енгізілгеннен кейін дубляждалған экспорттардың артуы

Жүктелуде…

Descript(жаңа терезеде ашылады) — қарапайым идеяға негізделген ЖИ-нативті бейне редакторы: мәтінді өңдей алсаңыз, бейнені де өңдей алуыңыз керек. Descript-тің алғашқы күндерінен бастап жасанды интеллект өнімнің барлық қырларын қамтамасыз етіп келеді: транскрипция, өңдеу, аудионы тазарту және барған сайын күрделене түсетін шығармашылық жұмыс процестері. Олар жылдар бойы OpenAI негізінде жұмыс істеп келеді, транскрипция үшін Whisper-ды және өздерінің Underlord бірлескен редакторында GPT сериясының модельдерін пайдаланады. 

Аударма тез арада жоғары әсері бар қолдану жағдайы ретінде пайда болды. Дәстүрлі түрде бейнені аудару баяу әрі қымбат процесс болып келді: жобаларды басқару, жаттанды аудармалар жасау, сапаны бақылау және тиісті аудионы жасау үшін тіл мамандары қажет болатын. LLM-дер бұл жұмыс процесін айтарлықтай ықшамдап, ауқымды түрде жоғары сапалы аударманы жасауға мүмкіндік береді.

Субтитрлер де, дубляж да семантикалық дәлдікті талап етеді: аударма түпнұсқа мағынасын сақтауы тиіс. Алайда ұзақтықты сақтау олардың әрқайсысында әртүрлі рөл атқарады. Субтитрлер үшін бұл міндетті емес, бірақ болғаны жақсы. Дубляж үшін бұл аса маңызды, өйткені аударылған сөз тым ұзақ не тым қысқа болып кетсе, мағынасы дұрыс болған күннің өзінде табиғи естілмейді.

Осыны шешу үшін Descript семантикалық дәлдік пен ұзақтыққа сәйкестікті кейін емес, генерациялау барысында оңтайландыру мақсатында OpenAI-дың ойлайтын модельдерін пайдаланып, өзінің аударма пайплайнын қайта жобалады. Іске қосылғаннан кейінгі алғашқы 30 күнде дубляжы бар аударылған бейнелердің экспорты 15 %-ға өсті, ал ұзақтыққа сәйкестік тілге байланысты 13-тен 43 пайыздық тармаққа дейін жақсарды.

«Дубляж Descript үшін барған сайын танымал қолдану сценарийіне айналып келеді, сондықтан біз бүтін кітапханаларды аударып, ерін қимылымен синхрондағысы келетін компаниялар үшін мұны пакеттік режимде орындау жолдарын әзірлеп жатырмыз», — деді компанияның бас директоры Лаура Буркхаузер.

Дубляж әлсірей бастаған тұс

Аударма Descript-тің ең алғашқы және ең жиі сұралған мүмкіндіктерінің бірі болды. Олар тек субтитрлерді аударудан бастады, бұл жақсы нәтиже берді — бірақ көптеген пайдаланушылар әрі қарай Go, мақсатты тілде дыбысталған аудиоға (дубляжға) ие болғысы келді.

Алайда бір мәселе қайта-қайта туындады: дубляждалған аудио әрдайым дұрыс естілмеді. «Біз естіген шағымдардың ішіндегі ең негізгісі аударма тілінде сөйлеу қарқынының табиғи естілмеуі болса керек», — деді Descript компаниясының ЖИ өнімдері жөніндегі басшысы Алекс Мистратов.

Мәселе бір ойды жеткізу үшін әртүрлі тілдерде әртүрлі уақыт қажет болатынына келіп тірелді. Descript, мысалы, неміс тілі орта есеппен ағылшын тіліне қарағанда «ұзынырақ» тіл екенін байқады. Бекітілген бейне сегменттеріне сыйдыру үшін аударылған сөйлеуді жиі жасанды түрде жылдамдатуға немесе баяулатуға тура келді. «Ақырында дыбысы борсық тышқандардай шиқылдаған немесе ұйқы басқан алыптай бірдеңе шығар еді», — деп түсіндірді Мистратов.

Ағылшын:

Неміс:

«Машинаны пайдаланбас бұрын қауіпсіздік нұсқауларын қарап шығыңыз».

Буындар: 18

«Машинаны пайдаланбас бұрын қауіпсіздік ережелерін қарап шығыңыз».

Буындар: 24 (40% өсім)

Бұл жағдайда неміс тіліндегі аудионы табиғи емес түрде жылдамдатуға тура келеді немесе аударманы берілген уақытқа сыйдыру үшін қайта жазу қажет болады.

Пайдаланушыларда екі ғана нұсқа қалды: аудио сегменттерін қолмен қайта реттеу немесе аударманы сәйкес ету үшін қайта жазу. Екі тәсіл де таймлайнды терең өңдеуді және көбіне мақсатты тілді ана тіліндей еркін меңгеруді талап етті. Бұл жасаушылар үшін бірсарынды әрі көп уақыт алатын процесс болды және бұл мүмкіндікті ірі корпоративтік локализация жобаларына масштабтауға кедергі болды.

Аудармаларды тек мағынасы үшін ғана емес, уақыт жағынан да оңтайландыру

Командада дубляждың сәтті шығуы үшін не қажет болатыны жөнінде нақты теория болды. Жүйе семантикалық мағынаны оңтайландырумен ғана шектелмей, уақыт шектеулерін де ескеруі қажет болар еді. Мысалы, ағылшын тілінен неміс тіліне аударғанда, дубляждалған аудио табиғи болып қалуы үшін модель аз сөзбен жеткізу немесе ұғымды жеңілдету жолын түсінуі керек.

Бұрынғы тәсілдер алдымен мағыналық дәлдікті оңтайландырып, кейін уақытты түзетуге тырысты. Аудармалар көбіне мағына жағынан дұрыс болды, бірақ ұзақтыққа қойылған шектеулер үнемі сақталмады, ал жалпы сапа әлі де талапқа сай болмады. 

«Біз кезең-кезеңімен сынақтар жүргіздік: ештеңе шығармай, модельден мәтін үзіндісіндегі буындар санын анықтауды сұрадық», — деді Мистратов. «Бұрынғы модельдер мұны онша жақсы орындай алмайтын».

Буындарды сенімді түрде санау аса маңызды екені анықталды. Егер модель буындарды дәйекті түрде есептей алмаса, ол белгілі бір ұзақтық аралығын сенімді түрде көздей алмайды.

GPT‑5 сериясындағы модельдер бұрынғы модельдерде болмаған ой қорыту тұрақтылығының деңгейін қамтамасыз етті, әсіресе буындарды санау және шектеулерді қадағалау сияқты тапсырмаларда. Осы жетілдірудің арқасында Descript аударма және дубляж жұмыс тізбегін қайта жасады.

Алдымен Descript жүйесі түпнұсқа жазбадағы сөйлем шекараларын, табиғи кідірістерді және сөйлеу үлгілерін басшылыққа ала отырып, транскриптті бөліктерге бөледі. Әрбір бөлік семантикалық сабақтастықты сақтайды, бірақ уақыт бірлігі ретінде пайымдауға жеткілікті кішкентай.

Содан кейін модель фрагменттегі буындар санын есептейді. Тілге тән сөйлеу қарқыны туралы болжамдарды пайдалана отырып, жүйе табиғи қарқынды сақтау («ұзақтыққа сәйкестік») үшін аударылған фрагментте қанша буын болуы керектігін есептейді. Көмексөз модельден ұзақтыққа сәйкестікті де, мағынаны сақтауды да оңтайландыруды сұрайды. Айналасындағы фрагменттер контекст ретінде беріледі, осылайша модель сегменттер арасында семантикалық үйлесімділікті сақтайды.

Команда ұзақтыққа сәйкестікті, семантикалық дәлдікті, кідірісті және шығынды теңгеру үшін бірнеше конфигурацияны бағалады. Таңдалған конфигурация өндірістік жылдамдықта шектеулерді қатаң сақтауды қамтамасыз етіп, қолмен уақытты қайта реттеусіз жоғары көлемді аударма жасауға мүмкіндік берді. Нәтижесінде қарқын кейіннен түзетілетін нәрсе ретінде емес, толыққанды айнымалы ретінде қарастырылатын аударма пайплайны қалыптасады.

Табиғи қарқынды анықтау және өлшеу

Бағалауларға арналған қабылдау критерийлерін әзірлеу үшін команда тыңдау сынақтарын жүргізді: олар аударылған аудио үлгілерін жасап, ойнату жылдамдығын аздап арттыра отырып, пайдаланушылардан сөйлеудің қай кезде табиғи емес естіле бастайтынын бағалауды сұрады. 

«10%-ға баяулатылған немесе 20%-ға жылдамдатылған кез келген нәрсе, жалпы алғанда, әлі де табиғи естілді», — деді Мистратов. Бұл диапазоннан тыс дыбыс тым қатты бұрмаланды. 

Бұрынғы жүйелер сол көрсеткіш бойынша төмен нәтиже көрсетті. Тілге байланысты сегменттердің тек 40 % -дан 60 % -ға дейінгі бөлігі ғана қолайлы қарқын аралығына сай келді. Қайта жобаланған пайплайнның арқасында бұл көрсеткіш тілге байланысты 40 %–60 % -дан 73 % пен 83 % аралығына дейін өсті.

Команда сондай-ақ семантикалық дәлдікті бөлек модель-төреші арқылы 1-ден («мүлдем басқа») 5-ке («семантикалық тұрғыдан баламалы») дейінгі шкала бойынша бағалады.  Дубляж үшін, ұзақтық шектеулері маңызды емес тек субтитрлерге арналған аудармамен салыстырғанда, олар семантикалық сәйкестік шегін төменірек қабылдауға шешім қабылдады. Сол ымыраға қарамастан, сегменттердің 85,5 %-ы семантикалық сәйкестік бойынша бес баллдан төрт немесе бес баллға бағаланды.

Нәтижесінде екі өзара бәсекелес шектеуді — уақыттау мен мағынаны — өлшенетін сенімділікпен теңгеруге қабілетті жүйе пайда болды. Екі метрика да автоматтандырылғандықтан, Descript жаңа модель шығарылымдары мен көмексөз нұсқаларын бірдей эталондармен салыстыра отырып үздіксіз бағалай алады.

Кең ауқымды бейне локализациясын іске қосу

Аударма жекелеген видеолардан ауқымды контент кітапханаларына ауысқан сайын, Descript аудармалардың бапталуын көбірек басқару мүмкіндігін енгізіп жатыр, соның ішінде қажет болғанда қатаңырақ семантикалық дәлдікке басымдық беру мүмкіндігі де бар.

Descript ішіндегі аударма — анағұрлым кең мультимодальды жүйенің бір ғана қабаты. Аударылған мәтін сөйлеуді синтездеу процесіне беріледі, ал ол кейін ерін қимылын синхрондауды және соңғы бейнені рендерлеуді басқарады. 

Мәтіндік деңгейдегі жақсартулар табиғи қарқынды қамтамасыз етеді, бірақ жалпы тәжірибе аудио модельдің үн реңін, сөйлеу ырғағын және сөйлеудің вербалды емес сипаттарын қаншалықты жақсы сақтайтынына байланысты. Команда келесі үлкен мүмкіндікті дәл осы жерден көріп отыр. 

«Аударма нәтижесін жақсартудың көп бөлігі пайплайнды анағұрлым мультимодальды етуге байланысты: аудио, видео және мәтінді бірге ескере отырып, қалай аудару керектігін шешу», — деді Мистратов. «Бұл сөйлеудің дауыс ырғағы мен екпін сияқты бейвербалды сипаттарын жақсырақ сақтап, бастапқы жеткізу мәнерін одан да көбірек сақтауы тиіс».

Descript үшін ойлау қабілеті жоғары модельдер дубляж жасаудың күрделілігін жеңілдетті. Модельдер қарқын мен мағына арасындағы ымыраларды сенімді түрде теңгере алатын межені кесіп өткеннен кейін, аударма команда үшін жүйелі түрде жетілдіріліп, кең көлемде енгізілетін процесске айналды.