स्किप करके मेन कंटेंट पर जाऍं
OpenAI

API में नेक्स्ट-जेनरेशन ऑडियो मॉडल्स पेश किए जा रहे हैं

वॉइस एजेंट्स को सक्षम बनाने के लिए ऑडियो मॉडल का एक नया सेट, अब विश्वभर के डेवलपर्स के लिए उपलब्ध है।

OpenAI की अगली पीढ़ी के ऑडियो मॉडल ब्लॉग की हीरो इमेज
लोड किया जा रहा है...

28 अगस्त, 2025 को अपडेट: हमने Realtime API की सामान्य उपलब्धता की घोषणा की। यहां और जानें


पिछले कुछ महीनों में, हमने टेक्स्ट-आधारित एजेंट्स—या ऐसे सिस्टम्स जो यूज़र्स की ओर से स्वतंत्र रूप से कार्य करते हैं—की बुद्धिमत्ता, क्षमताओं, और उपयोगिता को बढ़ाने में निवेश किया है, जैसे कि Operator, डीप रिसर्च, कंप्यूटर-यूज़िंग एजेंट्स, और बिल्ट-इन टूल्स वाले Responses API के रिलीज़ के साथ। हालांकि, एजेंट्स के वास्तव में उपयोगी होने के लिए, लोगों को केवल टेक्स्ट से आगे बढ़कर एजेंट्स के साथ अधिक गहरे और सहज इंटरैक्शन करने में सक्षम होना चाहिए—प्रभावी ढंग से संवाद करने के लिए प्राकृतिक बोली जाने वाली भाषा का उपयोग करते हुए।

आज, हम API में नए स्पीच-टू-टेक्स्ट और टेक्स्ट-टू-स्पीच ऑडियो मॉडल लॉन्च कर रहे हैं—जो अधिक शक्तिशाली, अनुकूलन योग्य और बुद्धिमान वॉइस एजेंट बनाने की क्षमता प्रदान करते हैं, जो वास्तविक मूल्य प्रदान करते हैं। हमारे नवीनतम स्पीच-टू-टेक्स्ट मॉडल ने एक नया अत्याधुनिक बेंचमार्क स्थापित किया है, जो सटीकता और विश्वसनीयता में मौजूदा समाधानों से बेहतर प्रदर्शन करता है—विशेष रूप से उन चुनौतीपूर्ण परिदृश्यों में जहां विभिन्न लहजे, शोर-भरे वातावरण, और विभिन्न भाषण गति शामिल हैं। ये सुधार ट्रांसक्रिप्शन की विश्वसनीयता बढ़ाते हैं, जिससे मॉडल विशेष रूप से ग्राहक कॉल सेंटर, बैठक नोट्स ट्रांसक्रिप्शन और अन्य उपयोग मामलों के लिए उपयुक्त हो जाते हैं।

पहली बार, डेवलपर्स टेक्स्ट-टू-स्पीच मॉडल को किसी विशेष तरीके से बोलने के लिए निर्देश दे सकते हैं—जैसे, “सहानुभूतिपूर्ण ग्राहक सेवा एजेंट की तरह बात करो”—जिससे वॉइस एजेंट्स के लिए अनुकूलन का एक नया स्तर खुलता है। यह ज़्यादा सहानुभूतिपूर्ण और डायनैमिक कस्टमर सर्विस वॉइसेस से लेकर क्रिएटिव स्टोरीटेलिंग अनुभवों के लिए एक्सप्रेसिव नैरेशन तक, अनुकूलित ऐप्लिकेशन्स की एक व्यापक रेंज को इनेबल करता है।

हमने 2022 में अपना पहला ऑडियो मॉडल लॉन्च किया और तब से, हम इन मॉडलों की बुद्धिमत्ता, सटीकता और विश्वसनीयता को बेहतर बनाने के लिए प्रतिबद्ध हैं। इन नए मॉडल के साथ, डेवलपर्स अधिक सटीक और मज़बूत स्पीच-टू-टेक्स्ट सिस्टम और अभिव्यंजक, चरित्रपूर्ण टेक्स्ट-टू-स्पीच आवाज़ें—सब कुछ API के भीतर—बना सकते हैं।

शांत
सर्फर
पेशेवर
मध्यकालीन योद्धा
सच्चे अपराध के शौकीन
बेडटाइम स्टोरी

हमारे नवीनतम ऑडियो मॉडल्स के बारे में अधिक जानकारी

नए स्पीच-टू-टेक्स्ट मॉडल

हम मूल Whisper मॉडल की तुलना में, word error rate में सुधार और बेहतर भाषा पहचान व सटीकता के साथ नए gpt-4o-transcribe और gpt-4o-mini-transcribe मॉडल पेश कर रहे हैं।

gpt-4o-transcribe मौजूदा Whisper मॉडल की तुलना में कई स्थापित बेंचमार्क पर बेहतर Word Error Rate (WER) प्रदर्शन दिखाता है, जो हमारी स्पीच-टू-टेक्स्ट तकनीक में महत्वपूर्ण प्रगति को दर्शाता है। ये प्रगति सीधे रीइंफ़ोर्समेंट लर्निंग में लक्षित नवाचारों और विविध, उच्च-गुणवत्ता वाले ऑडियो डेटासेट के साथ व्यापक मिडट्रेनिंग से उत्पन्न होती हैं।

नतीजतन, ये नए स्पीच-टू-टेक्स्ट मॉडल भाषण की बारीकियों को बेहतर तरीके से पकड़ सकते हैं, गलत पहचान को कम कर सकते हैं, और ट्रांसक्रिप्शन की विश्वसनीयता बढ़ा सकते हैं, खासकर उन चुनौतीपूर्ण परिदृश्यों में जिनमें विभिन्न लहज़े, शोर-भरे वातावरण, और भाषण की विभिन्न गति शामिल होती हैं। ये मॉडल अब स्पीच-टू-टेक्स्ट API(एक नई विंडो में खुलेगा) में उपलब्ध हैं।

Word Error Rate (WER) स्पीच-रिकग्निशन मॉडल की सटीकता को मापता है, यह एक संदर्भ ट्रांसक्रिप्ट की तुलना में गलत तरीके से ट्रांसक्राइब किए गए शब्दों का प्रतिशत निकालकर करता है—कम WER बेहतर है और इसका मतलब है कम त्रुटियाँ। हमारे नवीनतम स्पीच-टू-टेक्स्ट मॉडल विभिन्न बेंचमार्क्स पर कम WER प्राप्त करते हैं, जिनमें FLEURS (फ्यू-शॉट Learning Evaluation of Universal Representations of Speech)—एक बहुभाषी स्पीच बेंचमार्क शामिल है, जो मैन्युअल रूप से ट्रांसक्राइब किए गए ऑडियो नमूनों का उपयोग करके 100 से अधिक भाषाओं को कवर करता है। ये परिणाम बेहतर ट्रांसक्रिप्शन सटीकता और अधिक मज़बूत भाषा कवरेज को दर्शाते हैं। जैसा कि यहाँ दिखाया गया है, हमारे मॉडल सभी भाषा मूल्यांकनों में लगातार Whisper v2 और Whisper v3 से बेहतर प्रदर्शन करते हैं।

FLEURS पर, हमारे मॉडल कम WER और मज़बूत बहुभाषी प्रदर्शन देते हैं। कम WER बेहतर है और इसका मतलब है कि कम त्रुटियाँ होती हैं। जैसा कि यहाँ दिखाया गया है, हमारे मॉडल अधिकांश प्रमुख भाषाओं में अन्य प्रमुख मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करते हैं।

नया टेक्स्ट-टू-स्पीच मॉडल

हम बेहतर नियंत्रण क्षमता के साथ एक नया gpt-4o-mini-tts मॉडल भी लॉन्च कर रहे हैं। पहली बार, डेवलपर्स मॉडल को सिर्फ यह नहीं “निर्देश” दे सकते हैं कि क्या कहना है, बल्कि कैसे कहना है—जिससे ग्राहक सेवा से लेकर रचनात्मक कहानी कहने तक के उपयोग मामलों के लिए अधिक अनुकूलित अनुभव संभव हो पाते हैं। मॉडल टेक्स्ट-टू-स्पीच API(एक नई विंडो में खुलेगा) में उपलब्ध है। ध्यान दें कि ये टेक्स्ट-टू-स्पीच मॉडल कृत्रिम, प्रीसेट आवाज़ों तक सीमित हैं, जिनकी हम निगरानी करते हैं ताकि यह सुनिश्चित किया जा सके कि वे लगातार सिंथेटिक प्रीसेट्स से मेल खाते रहें।

मॉडल्स के पीछे की तकनीकी नवाचार

प्रामाणिक ऑडियो डेटासेट के साथ पूर्व-प्रशिक्षण

हमारे नए ऑडियो मॉडल GPT‑4o और GPT‑4o‑mini आर्किटेक्चर्स पर आधारित हैं और इन्हें विशेष ऑडियो-केंद्रित डेटासेट्स पर व्यापक रूप से प्रीट्रेन किया गया है, जो मॉडल के प्रदर्शन को अनुकूलित करने में महत्वपूर्ण रहे हैं। यह टार्गेटेड अप्रोच स्पीच के नाज़ुक फ़र्क पर गहरी इनसाइट्स देता है और ऑडियो-रिलेटेड टास्क में बेहतरीन परफ़ॉर्मेंस को सक्षम बनाता है।

उन्नत डिस्टिलेशन कार्यप्रणालियाँ

हमने अपनी डिस्टिलेशन तकनीकों को उन्नत किया है, जिससे हमारे सबसे बड़े ऑडियो मॉडल से छोटे और अधिक कुशल मॉडल में ज्ञान का स्थानांतरण संभव हो गया है। उन्नत सेल्फ-प्ले पद्धतियों का उपयोग करके, हमारे डिस्टिलेशन डेटासेट्स वास्तविक बातचीत की गतिशीलता को प्रभावी ढंग से पकड़ते हैं, और असली उपयोगकर्ता-सहायक इंटरैक्शनों की नकल करते हैं। यह हमारे छोटे मॉडलों को बेहतरीन संवादात्मक गुणवत्ता और त्वरित प्रतिक्रिया देने में मदद करता है।

रीइंफ़ोर्समेंट लर्निंग प्रतिमान

हमारे speech-to-text मॉडल के लिए, हमने एक रीइंफ़ोर्समेंट लर्निंग (RL)-प्रधान प्रतिमान को एकीकृत किया है, जिससे ट्रांसक्रिप्शन की सटीकता को अत्याधुनिक स्तरों तक पहुँचाया गया है। यह विधि सटीकता में काफी सुधार करती है और भ्रम को कम करती है, जिससे हमारी स्पीच-टू-टेक्स्ट समाधान जटिल स्पीच पहचान परिदृश्यों में अत्यधिक प्रतिस्पर्धी बनते हैं।

ये विकास ऑडियो मॉडलिंग के क्षेत्र में प्रगति का प्रतीक हैं, जो नवाचारी कार्यप्रणालियों को व्यावहारिक सुधारों के साथ जोड़ते हैं ताकि भाषण अनुप्रयोगों में बेहतर प्रदर्शन सुनिश्चित किया जा सके।

API उपलब्धता

ये नए ऑडियो मॉडल अब सभी डेवलपर्स के लिए उपलब्ध हैं – ऑडियो के साथ निर्माण के बारे में अधिक जानकारी यहाँ(एक नई विंडो में खुलेगा) है। जो डेवलपर्स पहले से टेक्स्ट-बेस्ड मॉडल के साथ बातचीत के अनुभव बना रहे हैं, उनके लिए हमारे स्पीच-टू-टेक्स्ट और टेक्स्ट-टू-स्पीच मॉडल जोड़ना एक वॉइस एजेंट बनाने का सबसे आसान तरीका है। हम Agents SDK(एक नई विंडो में खुलेगा) के साथ एक इंटीग्रेशन जारी कर रहे हैं जो इस विकास प्रक्रिया को सरल बनाता है। कम-लेटेंसी स्पीच-टू-स्पीच अनुभव बनाने के इच्छुक डेवलपर्स के लिए, हम Realtime API में हमारे स्पीच-टू-स्पीच मॉडल का उपयोग करने की सलाह देते हैं।

आगे क्या है

आगे की सोचते हुए, हम अपने ऑडियो मॉडल की बुद्धिमत्ता और सटीकता में सुधार के लिए निवेश जारी रखने और डेवलपर्स को हमारे सुरक्षा मानकों के अनुरूप और अधिक व्यक्तिगत अनुभव बनाने के लिए अपनी कस्टम आवाज़ें लाने के तरीकों का पता लगाने की योजना बना रहे हैं। इसके अलावा, हम बातचीत जारी रख रहे हैं, जिसमें हम नीति-निर्माताओं, शोधकर्ताओं, डेवलपर्स और क्रिएटिव्स के साथ सिंथेटिक वॉइस द्वारा प्रस्तुत की जा सकने वाली चुनौतियों और अवसरों पर चर्चा कर रहे हैं। हम यह देखने के लिए उत्साहित हैं कि डेवलपर्स इन उन्नत ऑडियो क्षमताओं का उपयोग करके कितने नवाचारी और रचनात्मक अनुप्रयोग बनाएंगे। हम डेवलपर्स को मल्टीमोडल एजेंटिक अनुभव बनाने में सक्षम करने के लिए वीडियो सहित अन्य मोडैलिटीज़ में भी निवेश करेंगे।

लाइवस्ट्रीम रीप्ले

लेखक

OpenAI

रिसर्च लीड

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

कॉन्ट्रीब्यूटर्स

रिसर्च

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

इंजीनियरिंग

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

प्रोडक्ट

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

नेतृत्व प्रायोजक

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry