स्किप करके मेन कंटेंट पर जाऍं
OpenAI

API में GPT‑Live‑1 के साथ आवाज़ का ज़्यादा सहज अनुभव बनाएँ

GPT‑Live‑1, ChatGPT जैसी स्वाभाविक फ़ुल-डुप्लेक्स बातचीत को API में लाता है और डेवलपर्स को यह तय करने का ज़्यादा कंट्रोल देता है कि वॉइस एजेंट कैसे बोले और काम करे.

लोड किया जा रहा है...

हम API में GPT‑Live‑1 लॉन्च कर रहे हैं. इससे डेवलपर्स को वॉइस वाले ऐप्स और बिज़नेस वर्कफ़्लो बनाने के लिए एक ताकतवर और स्वाभाविक वॉइस मॉडल मिलेगा. GPT‑Live‑1 को पहली बार ChatGPT में पेश किया गया था. यह एक ही समय में सुन और बोल सकता है. Codex और ChatGPT वर्क⁠(एक नई विंडो में खुलेगा) की तरह, यह गहरी रीज़निंग और दूसरे काम अपने साथ जुड़े मॉडल्स और टूल्स को सौंप सकता है.

API में GPT‑Live‑1 के लिए हमने ऐसी नई क्षमताओं पर फ़ोकस किया है, जिनसे डेवलपर्स अपने यूज़र्स, वर्कफ़्लो और लक्ष्यों के हिसाब से वॉइस के अनुभव को कंट्रोल और कस्टमाइज़ कर सकें. GPT‑Live‑1 की एक बड़ी ताकत है बातचीत के बीच रुकावटों को आसानी से संभालना. इसका बिज़नेस पर असर भी दिख रहा है. शुरुआती टेस्ट में Speak ने पाया कि GPT‑Live‑1 ने लैंग्वेज ट्यूटर के जवाब देने से पहले सीखने वालों को सोचने के लिए ज़्यादा समय दिया और पुराने टर्न-बेस्ड सिस्टम्स के मुकाबले रुकावटें लगभग 80% कम हुईं.

API में GPT‑Live‑1 की खास खूबियाँ:

  • रुकावटों को संभालना: एक ही मॉडल आने और जाने वाले ऑडियो को साथ में समझता है. इससे STT–LLM–TTS के जुड़े हुए आर्किटेक्चर में होने वाली देरी और कमज़ोर हैंडऑफ़ से बचा जा सकता है.

  • रीज़निंग और टूल कॉल सौंपना: GPT‑Live‑1 रीज़निंग और टूल कॉल्स को GPT‑6 Astra जैसे बैकएंड टेक्स्ट मॉडल या किसी थर्ड-पार्टी मॉडल को सौंप सकता है.

  • टोन, रफ़्तार और स्टाइल: डेवलपर्स सिस्टम प्रॉम्प्ट की मदद से एजेंट के बोलने के अंदाज़, रफ़्तार और बातचीत के अंदाज़ को तय कर सकते हैं.

  • साइलेंट कॉन्टेक्स्ट मैनेजमेंट और बैकग्राउंड नॉइज़: बातचीत में रुकावट डाले बिना या हर स्टेप को ज़ोर से बताए बिना, यह बैकग्राउंड नॉइज़ और शांति को बेहतर ढंग से संभालता है.

  • लंबे सेशन की विश्वसनीयता: लंबी बातचीत के दौरान संदर्भ को याद रखने की क्षमता और बातचीत की क्वालिटी को बेहतर बनाता है.

  • टेलीफ़ोन सपोर्ट: फ़ोन कॉल के लिए फ़ुल-डुप्लेक्स वॉइस एजेंट को लागू करने की सुविधा देता है, जिसमें रेस्तराँ रिज़र्वेशन से लेकर कस्टमर सपोर्ट तक शामिल हैं.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

यह डेमो समय-सीमित है. इसका उपयोग करके, आप OpenAI की शर्तों से सहमत होते हैं और हमारी प्राइवेसी पॉलिसी से अवगत होने की पुष्टि करते हैं.

अपने वॉइस एजेंट आर्किटेक्चर को आसान बनाएँ और वॉइस में होने वाली लेटेंसी को कम करें

पारंपरिक वॉइस एजेंट स्पीच-टू-टेक्स्ट, एक रीज़निंग मॉडल और टेक्स्ट-टू-स्पीच को एक साथ जोड़ते हैं. हर हैंडऑफ़ में देरी होती है और बातचीत की टाइमिंग, संदर्भ या स्वाभाविक लय के बिगड़ने की संभावना बढ़ जाती है. अक्सर डेवलपर्स को ही इन पड़ाव को मैनेज करना पड़ता है, जिसमें यह भी शामिल है कि जब कोई बीच में टोकता है, रुकता है या बातचीत का विषय बदलता है, तो क्या होता है.

GPT‑Live‑1 एक ही मॉडल में सुनने और बोलने का काम संभालता है, जिससे वॉइस लेयर आसान हो जाती है. यह बातचीत के दौरान होने वाली रुकावटों और छोटी प्रतिक्रियाओं का तुरंत जवाब दे सकता है, जबकि गहरी रीज़निंग का काम बैकएंड को सौंप सकता है. इससे बैकग्राउंड में काम जारी रहने के बावजूद बातचीत चलती रहती है.

“हमारे कैस्केड बिल्ड की तुलना में, GPT‑Live‑1 ने हमारे कोड बेस को 80% तक सरल बना दिया और कोड की 23 हज़ार लाइनें हटा दीं. इसने स्वाभाविक, रियल-टाइम में रोगी की बातचीत को मुमकिन किया और हमारी टीम को अपॉइंटमेंट बुक करने से लेकर देखभाल तक के अनुभव को बेहतर बनाने के लिए समय मिला.”
—टोनी स्टोयानोव, को-फ़ाउंडर और CTO

डेवलपर्स बातचीत के पीछे काम करने वाले मॉडल, टूल और एजेंट हार्नेस चुनते हैं. उदाहरण के लिए, वे शेड्यूलिंग या ऑर्डर अपडेट जैसे हाई-वॉल्यूम टास्क के लिए GPT‑Live‑1 को Luna जैसे मॉडल के साथ जोड़ सकते हैं, और कस्टमर की मुश्किल समस्याओं के लिए Astra जैसे मॉडल का इस्तेमाल कर सकते हैं, जिनमें रीज़निंग की क्षमता की ज़रूरत होती है. इस फ़्लेक्सिबिलिटी की वजह से डेवलपर्स हर टास्क के हिसाब से रीज़निंग की गहराई, स्पीड और लागत को सही तरह से चुन सकते हैं.

GPT‑Live‑1 सीधे ASR ट्रांसक्रिप्ट और जवाब को टेक्स्ट में देता है. यह अल्फ़ान्यूमेरिक जानकारी को अच्छी तरह समझता है और कीवर्ड बायसिंग को सपोर्ट करता है. हालाँकि GPT‑Live‑1 टर्न-बेस्ड मॉडल नहीं है, लेकिन यह खुद पता लगा सकता है कि यूज़र की बात कब पूरी हुई. इसलिए डेवलपर्स इसी साफ़ संकेत के आधार पर सिस्टम बनाना जारी रख सकते हैं.

फ़ुल-डुप्लेक्स फ़ायदे को मापना

हमारे टेस्ट में GPT‑Live‑1 ने फ़ुल ड्युप्लेक्स बेंच पर GPT‑Realtime–2.1 के मुकाबले परफ़ॉर्मेंस में 30 फ़ीसदी पॉइंट का सुधार किया, खास तौर पर बोलने की बारी लेने में होने वाली देरी और बातचीत के व्यवहार में बड़ा सुधार हुआ. GPT–6 Astra के साथ मीडियम रीज़निंग पर इस्तेमाल करने पर यह Tau3 में #1 पर है. Tau3 पूरे काम को शुरू से आखिर तक पूरा करने में फ़्रंटियर वॉइस एजेंट की इंटेलिजेंस को मापता है.

एयरलाइन, रिटेल और टेलीकॉम में कस्टमर सर्विस के बोले गए कामों की जाँच करता है. Pass@1 यह मापता है कि काम ठीक से हुआ या नहीं. मुख्य स्कोर में हर क्षेत्र को बराबर वेट दिया जाता है.


* GPT Live बैकएंड: Astra (medium).

जानकारी माँगने और अकाउंट टूल्स का इस्तेमाल करने वाली बैंकिंग सपोर्ट की बातचीत को परखता है. Pass@1 बताता है कि 97 banking_knowledge टास्क में से कितने अच्छे से पूरे हुए.


* GPT Live बैकएंड: Astra (medium).

कुछ बोलते समय रुकने के समय को संभालना, बारी-बारी से बात करना, बीच की रुकावटें और छोटी जवाब को इवैल्युएट करता है.

बैकग्राउंड में होने वाली बातचीत, किसी दूसरे व्यक्ति से बात करने, सुनने वाले के छोटे जवाबों और बीच की रुकावटों पर मॉडल की प्रतिक्रिया को परखता है.

यह मापता है कि यूज़र जब कुछ बोलने के बाद रुकते हैं, तो एजेंट कितनी जल्दी जवाब देना शुरू करता है.

ऐसी बोली गई रिक्वेस्ट्स में टूल के इस्तेमाल की जाँच करता है, जिनमें सहज तरीके से बातचीत में रुकना, झिझकना और कुछ कहने के बाद उसे सुधारना शामिल हों. Pass@1 टूल कॉल्स के सीक्वेंस को स्कोर देता है.


* GPT Live बैकएंड: Terra (low).

टूल इस्तेमाल करने वाली ऐसी रिक्वेस्ट्स के बोले गए जवाब की जाँच करता है, जिनमें रुकने, झिझकने या अपनी बात सुधारना शामिल हों. यह स्कोर देता है कि जवाब तय किए गए इरादे से कितना मेल खाता है.


* GPT Live बैकएंड: Terra (low).

कस्टमर्स की राय

4 में से 1
“Yelp Host और Hatch में GPT‑Live‑1 जोड़ने से हमारे पुराने वॉइस सिस्टम के मुकाबले बातचीत की बारी संभालने और सही जवाब देने में सुधार हुआ. जब Yelp Host रिज़र्वेशन और खाने के ऑर्डर जैसी कॉल्स का जवाब देने के लिए GPT‑Live‑1 इस्तेमाल करता है, तो कॉल संभालने की दर में साफ़ सुधार दिखाई देता है. कॉल करने वाले लोग अब ज़्यादा पूरी और स्वाभाविक बातें कर रहे हैं. इससे पता चलता है कि फ़ोन पर उनका अनुभव सच में अलग महसूस हो रहा है.”
—एलेक्स लेवी, चीफ़ टेक्नोलॉजी ऑफ़िसर

नए वॉइस के विकल्प

डेवलपर्स को ऐसी आवाज़ों की ज़रूरत होती है जो उनके प्रोडक्ट के हिसाब से हों और इस्तेमाल करने वालों को स्वाभाविक लगें. GPT‑Live‑1 के साथ, हम रियल-टाइम आवाज़ों के छोटे से सेट से आगे बढ़कर अलग-अलग एक्सेंट, बोलियों और भाषाओं में आवाज़ों का एक बड़ा कलेक्शन उपलब्ध करा रहे हैं, जिससे डेवलपर्स को अपने असिस्टेंट की आवाज़ चुनने में ज़्यादा विकल्प मिलेंगे.

नई आवाज़ों को सुनें

आने वाले महीनों में हम वॉइस के विकल्पों और भाषाओं की उपलब्धता को और बढ़ाना जारी रखेंगे.

कीमत और उपलब्धता

GPT‑Live‑1 आज API में मिल रहा है⁠(एक नई विंडो में खुलेगा), फ़्रंट-एंड वॉइस लेयर के लिए $0.05 प्रति मिनट की दर से. इसे अपने प्रोडक्ट के लिए सही बैकएंड मॉडल और एजेंट हार्नेस के साथ जोड़ें. फिर वॉइस का ऐसा अनुभव बनाएँ, जो काम बढ़ने के साथ आसानी से बढ़ सके.

GPT-Live-1 और Codex कनेक्ट करना

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

GPT-Live-1 और Codex कनेक्ट करना. यह हिस्सा दिखाता है कि कोई ऐप बातचीत का कॉन्टेक्स्ट Codex को कैसे भेजता है और उसका जवाब GPT-Live-1 तक कैसे पहुँचाता है. कनेक्शन सेटअप और काम सौंपने से जुड़े हिस्से यहाँ शामिल नहीं किए गए हैं.

कस्टम वॉइस का एक्सेस पाने के लिए, योग्यता और रिक्वेस्ट के प्रोसेस के बारे में ज़्यादा जानने के लिए सेल्स टीम से संपर्क करें.

GPT‑Live‑1 पर वॉइस वर्कफ़्लो बनाने का एक और तरीका OpenAI Presence है, जो रियल-टाइम बातचीत में आवाज़ के साथ इस मॉडल का इस्तेमाल करता है. Presence कंपनियों को भरोसेमंद AI एजेंट इस्तेमाल करने में मदद करता है. ये सवालों के जवाब दे सकते हैं, समस्याएँ हल कर सकते हैं, कंपनी के सिस्टम इस्तेमाल कर सकते हैं, तय किए गए काम कर सकते हैं और ज़रूरत पड़ने पर मामला किसी व्यक्ति तक पहुँचा सकते हैं. ज़्यादा जानकारी के लिए अपने OpenAI अकाउंट डायरेक्टर से संपर्क करें.