हम API में GPT‑Live‑1 लॉन्च कर रहे हैं. इससे डेवलपर्स को वॉइस वाले ऐप्स और बिज़नेस वर्कफ़्लो बनाने के लिए एक ताकतवर और स्वाभाविक वॉइस मॉडल मिलेगा. GPT‑Live‑1 को पहली बार ChatGPT में पेश किया गया था. यह एक ही समय में सुन और बोल सकता है. Codex और ChatGPT वर्क(एक नई विंडो में खुलेगा) की तरह, यह गहरी रीज़निंग और दूसरे काम अपने साथ जुड़े मॉडल्स और टूल्स को सौंप सकता है.
API में GPT‑Live‑1 के लिए हमने ऐसी नई क्षमताओं पर फ़ोकस किया है, जिनसे डेवलपर्स अपने यूज़र्स, वर्कफ़्लो और लक्ष्यों के हिसाब से वॉइस के अनुभव को कंट्रोल और कस्टमाइज़ कर सकें. GPT‑Live‑1 की एक बड़ी ताकत है बातचीत के बीच रुकावटों को आसानी से संभालना. इसका बिज़नेस पर असर भी दिख रहा है. शुरुआती टेस्ट में Speak ने पाया कि GPT‑Live‑1 ने लैंग्वेज ट्यूटर के जवाब देने से पहले सीखने वालों को सोचने के लिए ज़्यादा समय दिया और पुराने टर्न-बेस्ड सिस्टम्स के मुकाबले रुकावटें लगभग 80% कम हुईं.
API में GPT‑Live‑1 की खास खूबियाँ:
रुकावटों को संभालना: एक ही मॉडल आने और जाने वाले ऑडियो को साथ में समझता है. इससे STT–LLM–TTS के जुड़े हुए आर्किटेक्चर में होने वाली देरी और कमज़ोर हैंडऑफ़ से बचा जा सकता है.
रीज़निंग और टूल कॉल सौंपना: GPT‑Live‑1 रीज़निंग और टूल कॉल्स को GPT‑6 Astra जैसे बैकएंड टेक्स्ट मॉडल या किसी थर्ड-पार्टी मॉडल को सौंप सकता है.
टोन, रफ़्तार और स्टाइल: डेवलपर्स सिस्टम प्रॉम्प्ट की मदद से एजेंट के बोलने के अंदाज़, रफ़्तार और बातचीत के अंदाज़ को तय कर सकते हैं.
साइलेंट कॉन्टेक्स्ट मैनेजमेंट और बैकग्राउंड नॉइज़: बातचीत में रुकावट डाले बिना या हर स्टेप को ज़ोर से बताए बिना, यह बैकग्राउंड नॉइज़ और शांति को बेहतर ढंग से संभालता है.
लंबे सेशन की विश्वसनीयता: लंबी बातचीत के दौरान संदर्भ को याद रखने की क्षमता और बातचीत की क्वालिटी को बेहतर बनाता है.
टेलीफ़ोन सपोर्ट: फ़ोन कॉल के लिए फ़ुल-डुप्लेक्स वॉइस एजेंट को लागू करने की सुविधा देता है, जिसमें रेस्तराँ रिज़र्वेशन से लेकर कस्टमर सपोर्ट तक शामिल हैं.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
यह डेमो समय-सीमित है. इसका उपयोग करके, आप OpenAI की शर्तों से सहमत होते हैं और हमारी प्राइवेसी पॉलिसी से अवगत होने की पुष्टि करते हैं.
पारंपरिक वॉइस एजेंट स्पीच-टू-टेक्स्ट, एक रीज़निंग मॉडल और टेक्स्ट-टू-स्पीच को एक साथ जोड़ते हैं. हर हैंडऑफ़ में देरी होती है और बातचीत की टाइमिंग, संदर्भ या स्वाभाविक लय के बिगड़ने की संभावना बढ़ जाती है. अक्सर डेवलपर्स को ही इन पड़ाव को मैनेज करना पड़ता है, जिसमें यह भी शामिल है कि जब कोई बीच में टोकता है, रुकता है या बातचीत का विषय बदलता है, तो क्या होता है.
GPT‑Live‑1 एक ही मॉडल में सुनने और बोलने का काम संभालता है, जिससे वॉइस लेयर आसान हो जाती है. यह बातचीत के दौरान होने वाली रुकावटों और छोटी प्रतिक्रियाओं का तुरंत जवाब दे सकता है, जबकि गहरी रीज़निंग का काम बैकएंड को सौंप सकता है. इससे बैकग्राउंड में काम जारी रहने के बावजूद बातचीत चलती रहती है.
डेवलपर्स बातचीत के पीछे काम करने वाले मॉडल, टूल और एजेंट हार्नेस चुनते हैं. उदाहरण के लिए, वे शेड्यूलिंग या ऑर्डर अपडेट जैसे हाई-वॉल्यूम टास्क के लिए GPT‑Live‑1 को Luna जैसे मॉडल के साथ जोड़ सकते हैं, और कस्टमर की मुश्किल समस्याओं के लिए Astra जैसे मॉडल का इस्तेमाल कर सकते हैं, जिनमें रीज़निंग की क्षमता की ज़रूरत होती है. इस फ़्लेक्सिबिलिटी की वजह से डेवलपर्स हर टास्क के हिसाब से रीज़निंग की गहराई, स्पीड और लागत को सही तरह से चुन सकते हैं.
GPT‑Live‑1 सीधे ASR ट्रांसक्रिप्ट और जवाब को टेक्स्ट में देता है. यह अल्फ़ान्यूमेरिक जानकारी को अच्छी तरह समझता है और कीवर्ड बायसिंग को सपोर्ट करता है. हालाँकि GPT‑Live‑1 टर्न-बेस्ड मॉडल नहीं है, लेकिन यह खुद पता लगा सकता है कि यूज़र की बात कब पूरी हुई. इसलिए डेवलपर्स इसी साफ़ संकेत के आधार पर सिस्टम बनाना जारी रख सकते हैं.
हमारे टेस्ट में GPT‑Live‑1 ने फ़ुल ड्युप्लेक्स बेंच पर GPT‑Realtime–2.1 के मुकाबले परफ़ॉर्मेंस में 30 फ़ीसदी पॉइंट का सुधार किया, खास तौर पर बोलने की बारी लेने में होने वाली देरी और बातचीत के व्यवहार में बड़ा सुधार हुआ. GPT–6 Astra के साथ मीडियम रीज़निंग पर इस्तेमाल करने पर यह Tau3 में #1 पर है. Tau3 पूरे काम को शुरू से आखिर तक पूरा करने में फ़्रंटियर वॉइस एजेंट की इंटेलिजेंस को मापता है.
एयरलाइन, रिटेल और टेलीकॉम में कस्टमर सर्विस के बोले गए कामों की जाँच करता है. Pass@1 यह मापता है कि काम ठीक से हुआ या नहीं. मुख्य स्कोर में हर क्षेत्र को बराबर वेट दिया जाता है.
* GPT Live बैकएंड: Astra (medium).
जानकारी माँगने और अकाउंट टूल्स का इस्तेमाल करने वाली बैंकिंग सपोर्ट की बातचीत को परखता है. Pass@1 बताता है कि 97 banking_knowledge टास्क में से कितने अच्छे से पूरे हुए.
* GPT Live बैकएंड: Astra (medium).
कुछ बोलते समय रुकने के समय को संभालना, बारी-बारी से बात करना, बीच की रुकावटें और छोटी जवाब को इवैल्युएट करता है.
बैकग्राउंड में होने वाली बातचीत, किसी दूसरे व्यक्ति से बात करने, सुनने वाले के छोटे जवाबों और बीच की रुकावटों पर मॉडल की प्रतिक्रिया को परखता है.
यह मापता है कि यूज़र जब कुछ बोलने के बाद रुकते हैं, तो एजेंट कितनी जल्दी जवाब देना शुरू करता है.
ऐसी बोली गई रिक्वेस्ट्स में टूल के इस्तेमाल की जाँच करता है, जिनमें सहज तरीके से बातचीत में रुकना, झिझकना और कुछ कहने के बाद उसे सुधारना शामिल हों. Pass@1 टूल कॉल्स के सीक्वेंस को स्कोर देता है.
* GPT Live बैकएंड: Terra (low).
टूल इस्तेमाल करने वाली ऐसी रिक्वेस्ट्स के बोले गए जवाब की जाँच करता है, जिनमें रुकने, झिझकने या अपनी बात सुधारना शामिल हों. यह स्कोर देता है कि जवाब तय किए गए इरादे से कितना मेल खाता है.
* GPT Live बैकएंड: Terra (low).
डेवलपर्स को ऐसी आवाज़ों की ज़रूरत होती है जो उनके प्रोडक्ट के हिसाब से हों और इस्तेमाल करने वालों को स्वाभाविक लगें. GPT‑Live‑1 के साथ, हम रियल-टाइम आवाज़ों के छोटे से सेट से आगे बढ़कर अलग-अलग एक्सेंट, बोलियों और भाषाओं में आवाज़ों का एक बड़ा कलेक्शन उपलब्ध करा रहे हैं, जिससे डेवलपर्स को अपने असिस्टेंट की आवाज़ चुनने में ज़्यादा विकल्प मिलेंगे.
आने वाले महीनों में हम वॉइस के विकल्पों और भाषाओं की उपलब्धता को और बढ़ाना जारी रखेंगे.
GPT‑Live‑1 आज API में मिल रहा है(एक नई विंडो में खुलेगा), फ़्रंट-एंड वॉइस लेयर के लिए $0.05 प्रति मिनट की दर से. इसे अपने प्रोडक्ट के लिए सही बैकएंड मॉडल और एजेंट हार्नेस के साथ जोड़ें. फिर वॉइस का ऐसा अनुभव बनाएँ, जो काम बढ़ने के साथ आसानी से बढ़ सके.
कस्टम वॉइस का एक्सेस पाने के लिए, योग्यता और रिक्वेस्ट के प्रोसेस के बारे में ज़्यादा जानने के लिए सेल्स टीम से संपर्क करें.
GPT‑Live‑1 पर वॉइस वर्कफ़्लो बनाने का एक और तरीका OpenAI Presence है, जो रियल-टाइम बातचीत में आवाज़ के साथ इस मॉडल का इस्तेमाल करता है. Presence कंपनियों को भरोसेमंद AI एजेंट इस्तेमाल करने में मदद करता है. ये सवालों के जवाब दे सकते हैं, समस्याएँ हल कर सकते हैं, कंपनी के सिस्टम इस्तेमाल कर सकते हैं, तय किए गए काम कर सकते हैं और ज़रूरत पड़ने पर मामला किसी व्यक्ति तक पहुँचा सकते हैं. ज़्यादा जानकारी के लिए अपने OpenAI अकाउंट डायरेक्टर से संपर्क करें.

