API मध्ये पुढील पिढीचे ऑडिओ मॉडेल्स सादर करत आहे
व्हॉइस एजंट्सना सामर्थ्य देण्यासाठी ऑडिओ मॉडेल्सचा एक नवीन संच, आता जगभरातील विकसकांसाठी उपलब्ध आहे.

28 ऑगस्ट, 2025 चे अपडेट: आम्ही Realtime API ची सर्वसाधारण उपलब्धता जाहीर केली. येथे अधिक जाणून घ्या.
गेल्या काही महिन्यांत, आम्ही मजकूर-आधारित एजंट्स—किंवा वापरकर्त्यांच्या वतीने स्वतंत्रपणे कामे पूर्ण करणाऱ्या प्रणाली—यांची बुद्धिमत्ता, क्षमता आणि उपयुक्तता वाढवण्यासाठी गुंतवणूक केली आहे, जसे की Operator, डीप रिसर्च, कॉम्प्युटर-यूझिंग एजंट्स, आणि बिल्ट-इन टूल्ससह Responses API यांसारख्या रिलीजेसद्वारे. तथापि, एजंट्स खरोखर उपयुक्त ठरावेत यासाठी, लोकांना केवळ मजकुरापलीकडे जाऊन एजंट्ससोबत अधिक सखोल, अधिक सहज संवाद साधता आला पाहिजे—प्रभावीपणे संवाद साधण्यासाठी नैसर्गिक बोलली जाणारी भाषा वापरून.
आज, आम्ही API मध्ये नवीन स्पीच-टू-टेक्स्ट आणि टेक्स्ट-टू-स्पीच ऑडिओ मॉडेल्स लॉन्च करत आहोत—जे अधिक शक्तिशाली, कस्टमाइझ करण्यायोग्य, आणि बुद्धिमान व्हॉइस एजंट्स तयार करण्यास सक्षम करतात, जे खरे मूल्य प्रदान करतात. आमची नवीनतम स्पीच-टू-टेक्स्ट मॉडेल्सने एक नवीन अत्याधुनिक बेंचमार्क सेट केला आहे, अचूकता आणि विश्वासार्हतेमध्ये विद्यमान उपायांपेक्षा चांगली कामगिरी करत—विशेषतः उच्चार, गोंगाटयुक्त वातावरण, आणि बदलत्या भाषण गतीचा समावेश असलेल्या आव्हानात्मक परिस्थितींमध्ये. या सुधारणा ट्रान्सक्रिप्शनची विश्वसनीयता वाढवतात, ज्यामुळे मॉडेल्स ग्राहक कॉल सेंटर्स, मीटिंग नोट्स ट्रान्सक्रिप्शन, आणि इतर वापर प्रकरणांसाठी विशेषतः योग्य ठरतात.
पहिल्यांदाच, डेव्हलपर्स टेक्स्ट-टू-स्पीच मॉडेलला विशिष्ट पद्धतीने बोलण्यासाठी सूचना देऊ शकतात—उदाहरणार्थ, “सहानुभूतीपूर्ण ग्राहक सेवा प्रतिनिधीसारखे बोला”—यामुळे व्हॉइस एजंट्ससाठी कस्टमायझेशनची एक नवीन पातळी उघडते. हे अधिक सहानुभूतीपूर्ण आणि गतिमान ग्राहक सेवा आवाजांपासून ते सर्जनशील कथाकथन अनुभवांसाठी अभिव्यक्तिपूर्ण निवेदनापर्यंत, सानुकूलित अनुप्रयोगांची विस्तृत श्रेणी सक्षम करते.
आम्ही 2022 मध्ये आमचं पहिलं ऑडिओ मॉडेल लॉन्च केलं आणि तेव्हापासून, आम्ही या मॉडेल्सची बुद्धिमत्ता, अचूकता आणि विश्वासार्हता सुधारण्यासाठी वचनबद्ध आहोत. या नवीन ऑडिओ मॉडेल्ससह, विकसक अधिक अचूक आणि मजबूत स्पीच-टू-टेक्स्ट प्रणाली आणि अभिव्यक्त, व्यक्तिमत्त्वपूर्ण टेक्स्ट-टू-स्पीच आवाज—हे सर्व API मध्ये—तयार करू शकतात.
मूळ Whisper मॉडेल्सच्या तुलनेत, शब्द त्रुटी दरात सुधारणा तसेच अधिक चांगली भाषा ओळख आणि अचूकता असलेली नवीन gpt-4o-transcribe आणि gpt-4o-mini-transcribe मॉडेल्स आम्ही सादर करत आहोत.
gpt-4o-transcribe अनेक स्थापित बेंचमार्क्सवर विद्यमान Whisper मॉडेल्सच्या तुलनेत Word Error Rate (WER) कामगिरीत सुधारणा दर्शवते, ज्यामुळे आमच्या स्पीच-टू-टेक्स्ट तंत्रज्ञानात लक्षणीय प्रगती दिसून येते. ही प्रगती थेट रीइन्फोर्समेंट लर्निंगमधील लक्षित नवकल्पना आणि विविध, उच्च-गुणवत्तेच्या ऑडिओ डेटासेट्ससह व्यापक मिडट्रेनिंगमधून येते.
परिणामी, ही नवीन स्पीच-टू-टेक्स्ट मॉडेल भाषणातील सूक्ष्मता अधिक चांगल्या प्रकारे पकडू शकतात, चुकीच्या ओळखींना कमी करू शकतात, आणि ट्रान्स्क्रिप्शनची विश्वासार्हता वाढवू शकतात, विशेषतः उच्चार, गोंगाटयुक्त वातावरण, आणि बदलत्या भाषण गतींचा समावेश असलेल्या आव्हानात्मक परिस्थितींमध्ये. ही मॉडेल्स आता स्पीच-टू-टेक्स्ट API(नवीन विंडोमध्ये उघडेल) मध्ये उपलब्ध आहेत.
वर्ड एरर रेट (WER) संदर्भ ट्रान्सक्रिप्टच्या तुलनेत चुकीने ट्रान्सक्राइब झालेल्या शब्दांची टक्केवारी मोजून स्पीच-रिकग्निशन मॉडेल्सची अचूकता मोजतो—WER जितका कमी तितका चांगला, आणि त्याचा अर्थ कमी त्रुटी. आमची नवीनतम स्पीच-टू-टेक्स्ट मॉडेल्स विविध बेंचमार्क्समध्ये कमी WER साध्य करतात, ज्यामध्ये FLEURS (फ्यू-शॉट Learning Evaluation of Universal Representations of Speech)—100 पेक्षा जास्त भाषांमध्ये मॅन्युअली ट्रान्सक्राइब केलेल्या ऑडिओ नमुन्यांचा वापर करणारा एक बहुभाषिक स्पीच बेंचमार्क—याचाही समावेश आहे. हे परिणाम अधिक अचूक ट्रान्स्क्रिप्शन आणि अधिक व्यापक भाषिक कव्हरेज दर्शवतात. येथे दाखवल्याप्रमाणे, आमची मॉडेल्स सर्व भाषा मूल्यांकनांमध्ये सातत्याने Whisper v2 आणि Whisper v3 पेक्षा चांगली कामगिरी करतात.
FLEURS वर, आमची मॉडेल्स कमी WER आणि मजबूत बहुभाषिक कार्यक्षमता प्रदान करतात. कमी WER चांगला असतो आणि याचा अर्थ कमी चुका होतात. येथे दाखवल्याप्रमाणे, आमची मॉडेल्स बहुतेक प्रमुख भाषांमध्ये इतर आघाडीच्या मॉडेल्सशी बरोबरी करतात किंवा त्यांच्यापेक्षा चांगली कामगिरी करतात.
आम्ही अधिक चांगल्या नियंत्रणक्षमतेसह एक नवीन gpt-4o-mini-tts मॉडेल देखील लॉन्च करत आहोत. पहिल्यांदाच, विकसकांना मॉडेलला फक्त काय बोलायचे याबद्दलच नाही तर कसे बोलायचे याबद्दलही “सूचना” देता येतात—यामुळे ग्राहक सेवा ते सर्जनशील कथा सांगणे अशा विविध वापर प्रकरणांसाठी अधिक सानुकूलित अनुभव सक्षम होतात. मॉडेल टेक्स्ट-टू-स्पीच API(नवीन विंडोमध्ये उघडेल) मध्ये उपलब्ध आहे. लक्षात ठेवा की ही टेक्स्ट-टू-स्पीच मॉडेल्स कृत्रिम, प्रीसेट व्हॉईसेसपुरती मर्यादित आहेत, आणि ती सातत्याने सिंथेटिक प्रीसेट्सशी जुळतात याची खात्री करण्यासाठी आम्ही त्यांचे निरीक्षण करतो.
आमची नवीन ऑडिओ मॉडेल्स GPT‑4o आणि GPT‑4o‑mini आर्किटेक्चर्सवर आधारित आहेत आणि विशेष ऑडिओ-केंद्रित डेटासेट्सवर व्यापकपणे प्रीट्रेन केलेली आहेत, ज्यामुळे मॉडेलची कार्यक्षमता ऑप्टिमाइझ करण्यात महत्त्वपूर्ण योगदान मिळाले आहे. हा लक्षित दृष्टिकोन भाषणातील सूक्ष्म छटा आणि अर्थबोधाबद्दल सखोल अंतर्दृष्टी प्रदान करतो आणि ऑडिओ-संबंधित कार्यांमध्ये उत्कृष्ट कामगिरी सक्षम करतो.
आम्ही आमच्या डिस्टिलेशन तंत्रांचा विकास केला आहे, ज्यामुळे आमच्या सर्वात मोठ्या ऑडिओ मॉडेल्समधून लहान आणि अधिक कार्यक्षम मॉडेल्समध्ये ज्ञान हस्तांतरण शक्य झाले आहे. प्रगत self-play पद्धतींचा लाभ घेऊन, आमचे डिस्टिलेशन डेटासेट्स वास्तववादी संभाषण गतीशीलता प्रभावीपणे टिपतात आणि खऱ्या वापरकर्ता-असिस्टंट संवादांची पुनर्रचना करतात. यामुळे आमची लहान मॉडेल्स उत्कृष्ट संभाषण गुणवत्ता आणि प्रतिसादक्षमता प्रदान करतात.
आमच्या स्पीच-टू-टेक्स्ट मॉडेल्ससाठी, आम्ही रीइन्फोर्समेंट लर्निंग (RL)-आधारित पॅराडाइम समाविष्ट केला आहे, ज्यामुळे ट्रान्स्क्रिप्शन अचूकता अत्याधुनिक स्तरांपर्यंत पोहोचली आहे. ही पद्धत अचूकता लक्षणीयरीत्या सुधारते आणि भ्रम कमी करते, ज्यामुळे जटिल भाषण ओळख परिस्थितींमध्ये आमची स्पीच-टू-टेक्स्ट सोल्यूशन्स अपवादात्मकरीत्या स्पर्धात्मक ठरतात.
या घडामोडी ऑडिओ मॉडेलिंगच्या क्षेत्रातील प्रगतीचे प्रतिनिधित्व करतात, ज्या नाविन्यपूर्ण पद्धतींना व्यावहारिक सुधारणा यांच्यासोबत एकत्र करतात, ज्यामुळे भाषण अनुप्रयोगांमध्ये सुधारित कामगिरी साध्य होते.
ही नवीन ऑडिओ मॉडेल्स आता सर्व विकसकांसाठी उपलब्ध आहेत – ऑडिओसह बिल्डिंगबद्दल अधिक येथे(नवीन विंडोमध्ये उघडेल). जे डेव्हलपर्स आधीच टेक्स्ट-आधारित मॉडेल्ससह संभाषण अनुभव तयार करत आहेत, त्यांच्यासाठी आमची स्पीच-टू-टेक्स्ट आणि टेक्स्ट-टू-स्पीच मॉडेल्स जोडणे हा व्हॉइस एजंट तयार करण्याचा सर्वात सोपा मार्ग आहे. आम्ही एजंट्स SDK(नवीन विंडोमध्ये उघडेल) सह एक एकत्रीकरण जारी करत आहोत, जे या विकास प्रक्रियेला सुलभ करते. कमी विलंब असलेल्या स्पीच-टू-स्पीच अनुभव तयार करू इच्छिणाऱ्या विकसकांसाठी, आम्ही Realtime API मधील आमच्या स्पीच-टू-स्पीच मॉडेलसह तयार करण्याची शिफारस करतो.
पुढे पाहता, आम्ही आमच्या ऑडिओ मॉडेल्सची बुद्धिमत्ता आणि अचूकता सुधारण्यासाठी गुंतवणूक करत राहण्याची योजना आखत आहोत आणि डेव्हलपर्सना त्यांच्या स्वतःच्या कस्टम आवाजांचा वापर करून अधिक वैयक्तिकृत अनुभव तयार करण्यासाठी मार्ग शोधत आहोत, जे आमच्या सुरक्षा मानकांशी सुसंगत असतील. याव्यतिरिक्त, सिंथेटिक आवाजांमुळे उद्भवू शकणाऱ्या आव्हानां आणि संधींबाबत धोरणकर्ते, संशोधक, विकासक आणि सर्जनशील व्यक्तींशी चर्चा करण्यासाठी आम्ही सतत संवाद साधत आहोत. आम्ही या सुधारित ऑडिओ क्षमतांचा वापर करून विकसक कोणते नाविन्यपूर्ण आणि सर्जनशील अनुप्रयोग तयार करतील हे पाहण्यासाठी उत्सुक आहोत. आम्ही विकसकांना मल्टिमोडल एजंटिक अनुभव तयार करण्यास सक्षम करण्यासाठी व्हिडिओसह इतर मोडॅलिटीजमध्येही गुंतवणूक करू.
लेखक
संशोधन लीड्स
क्रिस्टीना किम, जुनहुआ माओ, यी शेन, यू झांग
योगदानकर्ते
रिसर्च
अलेक्स पैनो, बोवेन चेंग, चेंगझू झुआंग, क्रिस कोच, डेमियन म्रोका, एरिक रिटर, जेकब मेनिक, जेम्स बेटकर, जी लिन, जेमी किरोस, जियाहुई यु, लियांग झोउ, लियू चेन, केविन लु, मॅडेलिन बॉयड, मायकेल लॅम्पे, माइक हीटन, नानझिन चेन, नितीश केस्कर, साची जैन, सॅम टोइझर, सोमाय जैन, ताओ झू, टोमर कप्लान, वेई हान, शियांगनिंग चेन, ये जिया
इंजिनिअरिंग
अलिना वू, अँड्रेस गार्सिया गार्सिया, अर्शी भटनागर, अविटल ओलिव्हर, ब्रेंडन क्विन, क्रिस्टिना हुआंग, डेव्हिड फँग, ड्रॅगोस ओप्रिका, डोमिनिक कुंडेल, एडेडे ओइवोह, इयारोस्लाव त्वेरदोख्लिब, जियाचेंग फेंग, जय चेन, जेनिया वारावा, जॉर्डन सिटकिन, जोसेफ फ्लोरेन्सियो, लियन मामित्सुका, माडा अफ्लक, मॅनॉली लिओडाकिस, मार्क हडनॉल, नोआ मॅककॅलम, ओला ओकेलोला, पीटर बक्कम, रोहन मेहता, रोमेन ह्यूएट, वाननिंग जियांग, वेन चांग, यिलेई कियान
प्रॉडक्ट
अनुभा श्रीवास्तव, जॅकी शॅनन, जेफ हॅरिस, रेह मियारा, झियाओलिन हाओ
लीडरशिप प्रायोजक
एडन क्लार्क, अँड्र्यू गिबियन्स्की, डेविड ससाकी, केविन वील, लियाम फेडस, मार्क चेन, निक रायडर, निक टर्ली, ओलिव्हिए गोडेमेंट, प्रफुल्ल धारीवाल, शेंगजिया झाओ, शुचाओ बि, शेरविन वू, सलमान चौधरी