API-ում հաջորդ սերնդի աուդիո մոդելների ներկայացում
Ձայնային ագենտների համար նախատեսված աուդիո մոդելների նոր փաթեթ, որն այժմ հասանելի է ծրագրավորողներին ամբողջ աշխարհում։

Թարմացումը՝ 18 օգոստոսի, 2025 թ.-ին․ մենք հայտարարեցինք Realtime API-ի ընդհանուր հասանելիության մասին։ Իմացեք ավելին այստեղ։
Վերջին մի քանի ամիսների ընթացքում մենք ներդրումներ ենք կատարել տեքստային ագենտների կամ օգտատերերի անունից ինքնուրույն առաջադրանքներ կատարող համակարգերի՝ բանականության, հնարավորությունների և օգտակարության զարգացման գործում՝ ստեղծելով այնպիսի թողարկումներ, ինչպիսիք են Օպերատորը, Խորքահին ուսումնասիրությունը, Համակարգիչ օգտագործող ագենտը և Պատասխանների API-ը՝ ներկառուցված գործիքներով։ Սակայն, որպեսզի ագենտներն իսկապես օգտակար լինեն, մարդիկ պետք է կարողանան ագենտների հետ ունենալ ավելի խորը և ինտուիտիվ փոխազդեցություններ՝ ոչ միայն տեքստի միջոցով, այլև օգտագործելով բնական խոսակցական լեզու՝ արդյունավետ հաղորդակցվելու համար։
Այսօր մենք API-ում թողարկում ենք նոր խոսքից տեքստ և տեքստից խոսքի աուդիո մոդելներ՝ հնարավորություն տալով ստեղծել ավելի հզոր, հարմարեցվող և խելացի ձայնային ագենտներ, որոնք իրական արժեք են ապահովում։ Մեր վերջին խոսքից տեքստի մոդելները սահմանում են նոր, ոլորտի առաջատար չափանիշ՝ ճշգրտությամբ և հուսալիությամբ գերազանցելով առկա լուծումները հատկապես բարդ սցենարներում, որոնք ներառում են շեշտադրումներ, աղմկոտ միջավայրեր և խոսքի տարբեր արագություններ։ Այս բարելավումները բարձրացնում են սղագրության հուսալիությունը՝ մոդելները դարձնելով հատկապես հարմար այնպիսի օգտագործման դեպքերի համար, ինչպիսիք են հաճախորդների զանգերի կենտրոնները, հանդիպումների նշումների սղագրումը և այլն։
Առաջին անգամ ծրագրավորողները կարող են նաև հրահանգել տեքստից խոսքի մոդելին խոսել որոշակի ձևով, օրինակ՝ «խոսել ինչպես կարեկից հաճախորդների սպասարկման ներկայացուցիչը»՝ բացելով ձայնային ագենտների համար հարմարեցման նոր մակարդակ։ Սա հնարավորություն է տալիս հարմարեցված կիրառությունների լայն շրջանակ՝ սկսած ավելի կարեկցող և դինամիկ հաճախորդների սպասարկման ձայներից մինչև արտահայտիչ պատմություններ՝ ստեղծագործական պատմվածքների փորձառությունների համար։
Մենք գործարկեցինք մեր առաջին աուդիո մոդելը 2022 -ին, և այդ ժամանակվանից ի վեր մենք հանձնառու ենք բարելավել այս մոդելների բանականությունը, ճշգրտությունը և հուսալիությունը։ Այս նոր աուդիո մոդելների միջոցով ծրագրավորողները կարող են ստեղծել ավելի ճշգրիտ և կայուն խոսքից տեքստ համակարգեր և արտահայտիչ, բնորոշ տեքստից խոսք ձայներ՝ բոլորը API-ի շրջանակներում։
Մենք ներկայացնում ենք նոր gpt-4o-transcribe և gpt-4o-mini-transcribe մոդելներ՝ բարելավված բառային սխալի մակարդակով և ավելի լավ լեզվի ճանաչմամբ ու ճշգրտությամբ՝ համեմատած բնօրինակ Whisper մոդելների հետ։
gpt-4o-transcribe-ը ցույց է տալիս Բառի սխալի մակարդակի (WER) բարելավված կատարողականություն՝ համեմատած առկա Whisper մոդելների հետ մի շարք հաստատված չափանիշների շրջանակներում, ինչն արտացոլում է մեր խոսքից տեքստ տեխնոլոգիայի զգալի առաջընթացը։ Այս առաջընթացներն անմիջականորեն բխում են ամրապնդումով ուսուցման նպատակային նորարարություններից և բազմազան, բարձրորակ աուդիո տվյալների հավաքածուներով լայնածավալ միջանկյալ ուսուցումից։
Արդյունքում, այս նոր խոսքից տեքստի մոդելները կարող են ավելի լավ որսալ խոսքի նրբերանգները, նվազեցնել սխալ ճանաչումները և բարձրացնել տառադարձման հուսալիությունը, հատկապես բարդ սցենարներում, որոնք ներառում են շեշտադրումներ, աղմկոտ միջավայրեր և խոսքի տարբեր արագություններ։ Այս մոդելները այժմ հասանելի են խոսքից տեքստ API(բացվում է նոր պատուհանում)-ում։
Բառային սխալի մակարդակը (WER) չափում է խոսքի ճանաչման մոդելների ճշգրտությունը՝ հաշվարկելով սխալ տառադարձված բառերի տոկոսը՝ համեմատած հղումային տառադարձման հետ։ Որքան ցածր է WER-ը, այնքան ավելի լավ է, ինչը նշանակում է ավելի քիչ սխալներ։ Մեր վերջին խոսքից տեքստ մոդելները հասնում են ավելի ցածր WER-ի տարբեր չափանիշներում, ներառյալ FLEURS-ը (Խոսքի Համընդհանուր Ներկայացումների մի քանի հարցում Ուսուցման Գնահատում)՝ բազմալեզու խոսքի չափանիշ, որն ընդգրկում է ավելի քան 100 լեզու՝ օգտագործելով ձեռքով տառադարձման աուդիո նմուշներ։ Այս արդյունքները ցույց են տալիս ավելի բարձր տառադարձման ճշգրտություն և ավելի ամուր լեզվական ծածկույթ։ Ինչպես ցույց է տրված այստեղ, մեր մոդելները հետևողականորեն գերազանցում են Whisper v2-ը և Whisper v3-ը բոլոր լեզվական գնահատականներում։
FLEURS հարթակում մեր մոդելներն ապահովում են ավելի ցածր բառային սխալի մակարդակ (WER) և ուժեղ բազմալեզու կատարողականություն։ WER-ը որքան ցածր է, այնքան լավ է և նշանակում է ավելի քիչ սխալներ։ Ինչպես ցույց է տրված այստեղ, մեր մոդելները համընկնում են կամ գերազանցում են այլ առաջատար մոդելներին հիմնական լեզուների մեծ մասի մեջ։
Մենք նաև ներկայացնում ենք նոր gpt-4o-mini-tts մոդել՝ ավելի լավ կառավարելիությամբ։ Առաջին անգամ ծրագրավորողները կարող են «հրահանգել» մոդելին ոչ միայն թե ինչ ասել, այլ նաև թե ինչպես ասել՝ հնարավորություն տալով ավելի հարմարեցված փորձառություններ օգտագործման դեպքերի համար՝ սկսած հաճախորդների սպասարկումից մինչև ստեղծագործական պատմությունների պատմում։ Մոդելը հասանելի է տեքստից խոսքի API(բացվում է նոր պատուհանում)-ում։ Նկատի ունեցեք, որ այս տեքստից խոսք մոդելները սահմանափակվում են արհեստական, նախապես սահմանված ձայներով, որոնք մենք վերահսկում ենք՝ համոզվելու, որ դրանք հետևողականորեն համապատասխանում են սինթետիկ նախադրված ձայներին։
Մեր նոր աուդիո մոդելները հիմնված են GPT‑4o և GPT‑4o‑mini ճարտարապետությունների վրա և լայնորեն նախապես ուսուցանվել են մասնագիտացված աուդիո-կենտրոնացված տվյալների հավաքածուներով, որոնք կարևոր նշանակություն են ունեցել մոդելի կատարողականության օպտիմալացման գործում։ Այս նպատակային մոտեցումը ապահովում է ավելի խորը պատկերացում խոսքի նրբերանգների վերաբերյալ և հնարավորություն է տալիս բացառիկ կատարողականություն աուդիո-առնչվող առաջադրանքներում։
Մենք կատարելագործել ենք մեր դիստիլյացիայի տեխնիկաները՝ հնարավորություն տալով գիտելիքի փոխանցում մեր ամենամեծ մոդելներից դեպի ավելի փոքր, ավելի արդյունավետ մոդելներ։ Օգտագործելով առաջադեմ ինքնախաղի մեթոդաբանություններ՝ մեր դիստիլյացիայի տվյալների հավաքածուները արդյունավետորեն որսում են իրատեսական խոսակցական դինամիկան՝ վերարտադրելով իրական օգտատեր-օգնական փոխազդեցությունները։ Սա օգնում է մեր ավելի փոքր մոդելներին ապահովել գերազանց խոսակցական որակ և արձագանքման հիանալի արագություն։
Մեր խոսքից տեքստ մոդելների համար մենք ինտեգրել ենք ամրապնդումով ուսուցման (RL) ծանրաբեռնված պարադիգմ՝ տառադարձման ճշգրտությունը հասցնելով գերժամանակակից մակարդակների։ Այս մեթոդաբանությունը զգալիորեն բարելավում է ճշգրտությունը և նվազեցնում է հալյուցինացիան՝ մեր խոսքից տեքստ լուծումները դարձնելով բացառիկ մրցունակ բարդ խոսքի ճանաչման սցենարներում։
Այս զարգացումները ներկայացնում են աուդիո մոդելավորման ոլորտում առաջընթաց՝ համադրելով նորարարական մեթոդաբանությունները գործնական բարելավումների հետ՝ խոսքի հավելվածներում ավելի բարձր արդյունավետություն ապահովելու համար։
Այս նոր աուդիո մոդելներն այժմ հասանելի են բոլոր ծրագրավորողներին․ աուդիոյի հետ աշխատելու մասին ավելին կարելի է իմալանալ այստեղ(բացվում է նոր պատուհանում)։ Տեքստային մոդելներով արդեն զրույցային փորձառություններ ստեղծող ծրագրավորողների համար մեր խոսքից տեքստ և տեքստից խոսք մոդելների ավելացումը ձայնային ագենտ ստեղծելու ամենապարզ միջոցն է։ Մենք թողարկում ենք ինտեգրում Agents SDK(բացվում է նոր պատուհանում)-ի հետ, որը պարզեցնում է այս մշակման գործընթացը։ Ցածր հապաղմամբ խոսքից խոսք փորձառություններ ստեղծել ցանկացող ծրագրավորողների համար խորհուրդ ենք տալիս օգտագործել մեր խոսքից խոսք մոդելները Realtime API-ում։
Առաջիկայում մենք նախատեսում ենք շարունակել ներդրումներ կատարել մեր աուդիո մոդելների բանականության և ճշգրտության բարելավման մեջ և ուսումնասիրել ուղիներ, որոնք թույլ կտան ծրագրավորողներին ստեղծել իրենց սեփական անհատական ձայները՝ ավելի անհատականացված փորձառություններ կառուցելու համար՝ մեր անվտանգության չափանիշներին համապատասխան։ Բացի այդ, մենք շարունակում ենք ներգրավվել քաղաքականություն մշակողների, հետազոտողների, ծրագրավորողների և ստեղծագործողների հետ քննարկումներում՝ սինթետիկ ձայների ներկայացրած մարտահրավերների և հնարավորությունների շուրջ։ Մենք ոգևորված ենք տեսնելու, թե ինչ նորարարական և ստեղծագործական կիրառություններ ծրագրավորողները կստեղծեն՝ օգտագործելով այս բարելավված աուդիո հնարավորությունները։ Մենք նաև ներդրումներ կկատարենք այլ մոդալությունների մեջ՝ ներառյալ վիդեոն, որպեսզի ծրագրավորողները կարողանան ստեղծել բազմամոդալ ագենտային փորձառություններ։
Հեղինակներ
Հետազոտական ուղղություններ
Քրիստինա Քիմ, Ջունհուա Մաո, Յի Շեն, Յու ՉԺան
Ներդրողներ
Հետազոտություններ
Ալեքս Փայնո, Բոուեն Չենգ, Չենգսյու Չժուանգ, Քրիս Կոխ, Դամիան Մրովկա, Էրիկ Ռիտեր, Ջեյքոբ Մենիկ, Ջեյմս Բետկեր, Ջի Լին, Ջեյմի Կիրոս, Ջիահուի Յու, Լյանգ Չժոու, Լիյու Չեն, Քևին Լու, Մադելին Բոյդ, Մայքլ Լամպե, Մայք Հիթոն, Նանսին Չեն, Նիտիշ Կեսկար, Սաաչի Ջայն, Սեմ Թոյզեր, Սոմայ Ջայն, Տաո Սու, Թոմեր Կապլան, Վեյ Հան, Սյանգնին Չեն, Յե Ջիա
Ճարտարագիտություն
Ալինա Վու, Անդրես Գարսիա Գարսիա, Արշի Բհաթնագար, Ավիտալ Օլիվեր, Բրենդան Քուին, Քրիստինա Հուանգ, Դեյվիդ Ֆանգ, Դրագոս Օպրիկա, Դոմինիկ Կունդել, Էդեդե Օյվոհ, Իարոսլավ Տվերդոխլիբ, Ջյաչեն Ֆենգ, Ջեյ Չեն, Ջենիա Վարավվա, Ջորդան Սիտկին, Ջոզեֆ Ֆլորենսիո, Լիեն Մամիցուկա, Մադա Աֆլակ, Մանոլի Լիոդակիս, Մարկ Հադնալ, Նոա ՄաքՔալում, Օլա Օկելոլա, Փիթեր Բակում, Ռոհան Մեհտա, Ռոմեն Հուետ, Վանինգ Ցզյան, Ուեյն Չանգ, Յիլեյ Ցյան
Արտադրանք
Անուբհա Սրիվաստավա, Ջեքի Շենոն, Ջեֆ Հարիս, Ռեա Միյարա, Սյաոլին Հաո
Ղեկավարության հովանավորներ
Էյդան Քլարկ, Էնդրյու Գիբիանսկի, Դեյվիդ Սասակի, Քևին Վեյլ, Լիամ Ֆեդուս, Մարկ Չեն, Նիք Ռայդեր, Նիք Թերլի, Օլիվիե Գոդեմեն, Պրաֆուլա Դարիուալ, Շենջիա Ժաո, Շուչաո Բի, Շերվին Վու, Սուլման Չաուդրի