Ruka hadi kwenye maudhui kuu
OpenAI

6 Machi 2026

Biashara ya kuanza

Jinsi Descript hubuni uigizaji wa sauti wa video wa lugha nyingi

Kwa kutumia miundo ya uwazaji ya OpenAI, Descript ilifanikisha ujanibishaji wa kiotomatiki wa maktaba kubwa za maudhui bila kupoteza muda au maana.

Nembo ya Descript na wordmark juu ya mandharinyuma ya dhahania ya mawimbi ya rangi ya waridi na zambarau.
Ukubwa wa kampuni: Biashara ya kuanza
Mkoa: Amerika ya Kaskazini
Sekta: Teknolojia
Bidhaa: API

Matokeo

43

Maboresho ya pointi za asilimia katika uzingatiaji wa muda kwa kutumia OpenAI

Matokeo

Asilimia 15%

Ongezeko la uhamishaji nje wa maudhui yaliyowekwa sauti ya lugha nyingine baada ya uzinduzi

Inapakia…

Descript(fungua katika dirisha jipya) ni kihariri cha video asilia cha AI kilichoundwa kuhusu wazo rahisi: ikiwa unaweza kuhariri maandishi, unapaswa kuweza kuhariri video. Tangu siku za awali za Descript, AI imewezesha kila kipengele cha bidhaa: unukuzi, uhariri, usafishaji wa sauti, na taratibu za kazi za ubunifu zinazozidi kuwa changamani. Wameendeleza OpenAI kwa miaka mingi, wakitumia Whisper kwa unukuzi na miundo ya mfululizo ya GPT ndani ya kihariri mwenza chao cha Underlord. 

Tafsiri ilijitokeza haraka kama mfano wa onyesho la matumizi lenye matokeo makubwa. Kijadi, kutafsiri video kumekuwa kwa polepole na kwa gharama kubwa, hivyo kuhitaji wataalamu wa lugha kusimamia miradi, kutoa tafsiri za kurudia-rudia, kushughulikia udhibiti wa ubora, na kuzalisha sauti inayolingana. LLM hupunguza kwa kiasi kikubwa utaratibu huo wa kazi, na kufanya tafsiri ya ubora wa juu kwa kiwango kikubwa iwezekane.

Manukuu na uwekaji sauti zote zinahitaji uaminifu wa kisemantiki: tafsiri lazima ihifadhi maana asilia. Lakini uzingatiaji wa muda una jukumu tofauti katika kila moja. Kwa manukuu, si lazima, lakini ni vyema kuwa nayo. Kwa uwekaji sauti, ni muhimu sana, kwa sababu ikiwa usemi uliotafsiriwa utakuwa mrefu sana au mfupi sana, utasikika si wa kawaida hata kama maana ni sahihi.

Ili kushughulikia hili, Descript ilibuni upya njia yake ya uwasilishaji wa tafsiri kwa kutumia miundo ya uwazaji ya OpenAI ili kuboresha uaminifu wa kimaana na ufuataji wa muda wakati wa uzalishaji, si baada ya hapo. Katika siku 30 za kwanza baada ya uzinduzi, uhamishaji wa video zilizotafsiriwa zilizowekwa sauti uliongezeka kwa asilimia 15, na kufuata muda kuliboreka kwa alama 13 hadi 43 za asilimia, kulingana na lugha.

“Uwekaji sauti ni hali ya matumizi inayozidi kuwa maarufu kwa Descript, kwa hivyo tunaunda njia za kuifanya kwa makundi kwa kampuni zinazotaka kutafsiri na kusawazisha maktaba nzima,” alisema Laura Burkhauser, CEO.

Mahali ambapo uwekaji sauti ulianza kuvurugika

Tafsiri ilikuwa mojawapo ya vipengele vya awali zaidi vya Descript na vilivyoombwa sana. Walianza na tafsiri ya manukuu pekee, ambayo ilifanya kazi vizuri—lakini watumiaji wengi walitaka kwenda mbali zaidi na kuwa na sauti inayozungumzwa (uwekaji sauti) katika lugha lengwa.

Hata hivyo, tatizo moja liliendelea kujitokeza: sauti iliyoingizwa haikusikika ipasavyo kila wakati. "Labda malalamiko makuu tuliyoyasikia ni kwamba kasi ya usemi haikuwa ya kawaida katika lugha iliyotafsiriwa," alisema Aleks Mistratov, Mkuu wa Bidhaa ya AI katika Descript.

Tatizo lilitokana na ukweli kwamba lugha tofauti huchukua muda tofauti kueleza wazo lile lile. Descript iliona, kwa mfano, kwamba kwa wastani Kijerumani ni lugha “ndefu” zaidi kuliko Kiingereza. Ili kutoshea katika sehemu za video zisizobadilika, usemi uliotafsiriwa mara nyingi ulilazimika kuharakishwa au kupunguzwa kasi kwa njia ya bandia. "Ungeishia na kitu kinachosikika kama chipmunks, au jitu linalosinzia," Mistratov alielezea.

Kiingereza:

Kijerumani:

“Tafadhali kagua miongozo ya usalama kabla ya kuendesha mashine.”

Silabi: 18

"Bitte überprüfen Sie die Sicherheitsrichtlinien, bevor Sie die Maschine bedieenn."

Silabi: 24 (ongezeko la asilimia 40)

Katika hali hii, sauti ya Kijerumani ingelazimika kuharakishwa kwa njia isiyo ya kawaida, au tafsiri ingehitaji kuandikwa upya ili itoshe ndani ya bajeti ya muda.

Watumiaji waliachwa na chaguo mbili: kurekebisha muda wa sauti hao wenyewe sehemu kwa sehemu, au kuandika upya tafsiri yenyewe ili iweze kutoshea kwa usahihi. Mbinu zote mbili zilihitaji uhariri wa kina wa ratiba na, mara nyingi, ufasaha wa karibu wa kiwango cha mzawa katika lugha lengwa. Ilikuwa kazi ya kuchosha kwa waundaji, na ikawa kikwazo cha kupanua kipengele hicho kwa miradi mikubwa ya ujanibishaji wa biashara.

Kuboresha tafsiri kwa kuzingatia muda, si tu maana

Timu ilikuwa na nadharia wazi ya kile ambacho kingehitajika ili kufanya uwekaji sauti ufanye kazi kwa ufanisi. Mfumo ungehitaji si tu kuboresha maana ya kisemantiki, bali pia kufahamu vikwazo vya muda. Kwa mfano, wakati wa kutafsiri kutoka Kiingereza kwenda Kijerumani, muundo ungehitaji kuelewa jinsi ya kutumia maneno machache au kurahisisha dhana, ili sauti iliyowekwa ibaki ya asili.

Mbinu za awali ziliboresha uaminifu wa kisemantiki kwanza na kujaribu kurekebisha muda baadaye. Tafsiri mara nyingi zilikuwa sahihi kimaana, lakini mara kwa mara zilikosa vikwazo vya muda, na ubora wa jumla bado haukuwa wa kutosha. 

“Tulifanya majaribio ya hatua kwa hatua, hata bila kuzalisha chochote, tulikuwa tu tukiuliza muundo utoe idadi ya silabi katika kipande cha maandishi,” Mistratov alisema. “Miundo ya awali haikuwa bora katika hilo.”

Kuhesabu silabi kwa uaminifu kulibainika kuwa muhimu. Ikiwa muundo usingeweza kukokotoa silabi kwa uthabiti, usingeweza kulenga kwa uhakika dirisha mahususi la muda.

Miundo ya mfululizo wa GPT‑5 ilileta kiwango cha uthabiti wa uwazaji ambacho miundo ya awali haikuwa nacho, hasa katika kazi kama kuhesabu silabi na kufuatilia vikwazo. Kwa uboreshaji huo, Descript ilibuni upya mchakato wake wa kutafsiri na uwekaji sauti.

Kwanza, mfumo wa Descript hugawanya nakala ya mazungumzo katika vipande, ukiongozwa na mipaka ya sentensi, mapumziko ya asili, na mifumo ya kuzungumza katika rekodi asili. Kila kipande hudumisha mwendelezo wa semantiki, lakini ni kidogo vya kutosha kuwaza kuhusu kama kitengo cha muda.

Kuanzia hapo, muundo hukokotoa idadi ya silabi katika kipande hicho. Kwa kutumia makadirio ya kasi ya kuzungumza yanayobainishwa kwa kila lugha, mfumo hukadiria ni silabi ngapi kipande kilichotafsiriwa kinapaswa kulenga ili kudumisha mfuatano wa asili (“uafuasi wa muda”). Kidokezo huuliza muundo kuboresha uzingatiaji wa muda na uhifadhi wa maana. Vipande vinavyozunguka hupitishwa kama muktadha ili muundo udumishe mshikamano wa kisemantiki katika sehemu mbalimbali.

Timu ilitathmini usanidi mbalimbali ili kusawazisha uzingatiaji wa muda, uaminifu wa kisemantiki, ucheleweshaji, na gharama. Mpangilio uliochaguliwa ulitoa ufuataji thabiti wa vikwazo kwa kasi ya uzalishaji, na kuwezesha tafsiri ya kiasi kikubwa bila kupanga upya muda wewe mwenyewe. Matokeo yake ni njia ya utafsiri ambapo kasi huchukuliwa kama kigezo cha daraja la kwanza badala ya kitu kilichorekebishwa baada ya tukio.

Kufafanua na kupima mwendo wa asili

Ili kuunda vigezo vya kukubalika kwa tathmini, timu ilifanya majaribio ya kusikiliza: walizalisha sampuli za sauti zilizotafsiriwa na kurekebisha kasi ya uchezaji kwa hatua ndogo, wakiwauliza watumiaji wakadirie ni lini usemi ulianza kuonekana usio wa kawaida. 

“Kitu chochote kilichopunguzwa kasi kwa asilimia 10, au kilichoharakishwa kwa asilimia 20, kwa ujumla bado kilisikika kuwa cha asili,” Mistratov alisema. Zaidi ya kiwango hiki, usemi ulipotoshwa sana. 

Mifumo ya awali ilifanya vibaya kwa kipimo hicho. Kulingana na lugha, ni asilimia 40 hadi asilimia 60 tu ya sehemu zilizokuwa ndani ya dirisha linalokubalika la kasi. Kwa mkondo ulioundwa upya, idadi hiyo iliongezeka kutoka asilimia 40–60 hadi kati ya asilimia 73 na 83, kulingana na lugha.

Timu pia ilitathmini uaminifu wa kisemantiki kwa kutumia ukadiriaji tofauti wa muundo-kama-mwamuzi kwa kipimo kinachoanzia 1 (“tofauti kabisa”) hadi 5 (“sawa kisemantiki”).  Kwa uwekaji sauti, waliamua kukubali kizingiti cha chini cha semantiki kuliko tafsiri ya manukuu pekee, ambapo vikwazo vya muda havihusiki. Hata kwa mabadilishano hayo, asilimia 85.5 ya sehemu zilikadiriwa kuwa nne au tano kati ya tano kwa kuzingatia kisemantiki.

Matokeo yalikuwa mfumo ambao ungeweza kusawazisha vikwazo viwili vinavyoshindana—muda na maana—kwa kujiamini kunakoweza kupimika. Na kwa sababu vipimo vyote viwili vilikuwa vya kiotomatiki, Descript ina uwezo wa kuendelea kutathmini matoleo mapya ya muundo na tofauti za madokezo dhidi ya viwango hivyo hivyo.

Kufungua ujanibishaji wa video kwa kiwango kikubwa

Kadiri tafsiri zinavyohama kutoka video za pekee hadi maktaba kubwa za maudhui, Descript inaunda udhibiti zaidi wa jinsi tafsiri zinavyorekebishwa, ikijumuisha uwezo wa kutanguliza uaminifu wa hali ya juu wa kisemantiki inapohitajika.

Tafsiri ndani ya Descript ni tabaka moja tu la mfumo mpana wa mifumo mingi. Maandishi yaliyotafsiriwa huingizwa kwenye uzalishaji wa usemi, ambao kisha huendesha usawazishaji wa midomo na utoaji wa mwisho wa video. 

Maboresho katika safu ya maandishi yanawezesha mwendo wa asili, lakini uzoefu wa jumla pia unategemea jinsi muundo wa sauti unavyohifadhi sauti, mdundo, na sifa zisizo za maneno za usemi. Hapo ndipo timu inaona mpaka unaofuata. 

“Sehemu kubwa ya kitakachoboresha matokeo ya tafsiri ni kuufanya mchakato uwe wa mifumo mingi zaidi: kujumuisha sauti, video, na maandishi pamoja wakati wa kuamua jinsi ya kutafsiri,” alisema Mistratov. “Hilo linapaswa kudumisha vyema zaidi sifa zisizo za maneno za usemi, kama vile sauti na msisitizo, na kuhifadhi zaidi hata utoaji wa asili.”

Kwa Descript, miundo ya uwazaji yenye nguvu zaidi ilifanya ugumu wa kuweka sauti kuwa rahisi kushughulikia. Kwa kuvuka kizingiti ambapo miundo ingeweza kusawazisha kwa uhakika mabadiliko kati ya kasi na maana, tafsiri ikawa jambo ambalo timu ingeweza kuboresha kwa utaratibu na kutumika kwa kiwango kikubwa.