मुख्य मजकूराकडे जा
OpenAI

प्रोडक्शन व्हॉइस एजंट्ससाठी gpt-realtime आणि Realtime API अपडेट्स सादर करत आहे

आम्ही अधिक प्रगत स्पीच-टू-स्पीच मॉडेल आणि नवीन API क्षमता जारी करत आहोत ज्यामध्ये MCP सर्व्हर सपोर्ट, इमेज इनपुट आणि SIP फोन कॉलिंग सपोर्ट समाविष्ट आहे.

व्हॉइस इंटरॲक्शन दाखवणारा स्टायलाइज्ड इंटरफेस. मध्यभागी राऊंडेड रेक्टँग्युलर ऑडिओ प्लेयर आहे ज्यात वेव्हफॉर्म व्हिज्युअलायझेशन, प्ले/पॉज बटण, “एजंट ऑनलाइन” स्टेटस इंडिकेटर, आणि 00:35 टाइमस्टॅम्प आहे. इमेजवर डॉट्ससह पांढऱ्या कर्व्ह्ड लाईन्स वाहतात, ज्यामुळे लाईव्ह ऑडिओ किंवा सिग्नल मूव्हमेंट सूचित होते. बॅकग्राऊंड व्हिविड निळा आहे, ज्यात गुलाबी आणि जांभळ्या टोनमधील ब्लर फ्लॉवर शेप्स आहेत.
लोड होत आहे...

आज आम्ही Realtime API जनरली अव्हेलेबल करत आहोत, ज्यात नवीन फीचर्स आहेत जे डेव्हलपर्स आणि एंटरप्रायझेसना विश्वासार्ह, प्रॉडक्शन-रेडी व्हॉइस एजंट्स तयार करण्यास सक्षम करतात. API आता रिमोट MCP सर्व्हर्स, इमेज इनपुट्स आणि सेशन इनिशिएशन प्रोटोकॉल (SIP) मार्फत फोन कॉलिंगला सपोर्ट करते, ज्यामुळे व्हॉइस एजंट्सना अतिरिक्त टूल्स आणि संदर्भांमध्ये प्रवेश मिळून अधिक सक्षम बनवले जाते.

आम्ही आमचे आतापर्यंतचे सर्वात प्रगत स्पीच-टू-स्पीच मॉडेल रिलीज करत आहोत—gpt-realtime. नवीन मॉडेल कॉम्प्लेक्स सूचनांचे पालन करण्यात, टूल्स अचूकपणे कॉल करण्यात, आणि अधिक नैसर्गिक आणि अभिव्यक्तीपूर्ण आवाज तयार करण्यात सुधारणा दाखवते. हे सिस्टीम मेसेजेस आणि डेव्हलपर प्रॉम्प्ट्स समजून घेण्यात अधिक चांगले आहे—चाहे ते सपोर्ट कॉलवर डिस्क्लेमर स्क्रिप्ट्स शब्दशः वाचणे असो, अल्फान्युमेरिक्स परत सांगणे असो, किंवा वाक्याच्या मधोमध भाषांमध्ये सहजतेने स्विच करणे असो. आम्ही दोन नवीन व्हॉइस रिलीज करत आहोत—Cedar आणि Marin—जे आजपासून फक्त Realtime API मध्ये अव्हेलेबल आहेत.

गेल्या ऑक्टोबरमध्ये आम्ही Realtime API सार्वजनिक बीटा मध्ये प्रथम सादर केल्यापासून, हजारो विकसकांनी या API सोबत काम केले आहे आणि आज आम्ही ज्या सुधारणा सादर करत आहोत त्या आकारण्यात मदत केली आहे—ज्या विश्वसनीयता, कमी विलंबता आणि उच्च गुणवत्तेसाठी ऑप्टिमाइझ केल्या आहेत, ज्यामुळे व्हॉइस एजंट्स प्रॉडक्शनमध्ये यशस्वीरित्या तैनात करता येतात. पारंपरिक पाईपलाइन्सप्रमाणे स्पीच-टू-टेक्स्ट आणि टेक्स्ट-टू-स्पीचमध्ये मल्टिपल मॉडेल्स चेन करण्याऐवजी, Realtime API एकाच मॉडेल आणि API मधून थेट ऑडिओ प्रोसेस आणि जनरेट करते. यामुळे लेटन्सी कमी होते, स्पीचमधील नुअन्स जपले जातात, आणि अधिक नॅचरल, एक्स्प्रेसिव्ह रिस्पॉन्सेस तयार होतात.

“OpenAI च्या Realtime API मधील नवीन स्पीच-टू-स्पीच मॉडेलमध्ये अधिक मजबूत तर्कशक्ती आणि नैसर्गिक भाषण दिसून येते—ज्यामुळे ते जटिल, अनेक टप्प्यांच्या विनंत्या हाताळू शकते, जसे की लाइफस्टाईल गरजांनुसार लिस्टिंग्स कमी करणे किंवा आमच्या BuyAbility स्कोअरसारख्या साधनांच्या मदतीने किफायतशीरतेच्या चर्चांना मार्गदर्शन करणे." यामुळे Zillow वर घर शोधणे किंवा फायनान्सिंग ऑप्शन्स एक्सप्लोर करणे मित्रासोबतच्या कन्व्हर्सेशनइतके नॅचरल वाटू शकते, ज्यामुळे घर खरेदी, विक्री आणि भाड्याने देण्यासारख्या निर्णयांना साधे करण्यात मदत होईल.”

– जोश वाईसबर्ग, Zillowमधील एआय प्रमुख

gpt-रिअलटाइम सादर करत आहोत

नवीन स्पीच-टू-स्पीच मॉडेल—gpt-रिअलटाइम—आमचे सर्वात अ‍ॅडव्हान्स्ड, प्रॉडक्शन-रेडी व्हॉइस मॉडेल आहे. आम्ही हे मॉडेल कस्टमर्ससोबत क्लोज कोलॅबोरेशनमध्ये ट्रेन केले, ज्यामुळे ते रिअल-वर्ल्ड टास्क्स—जसे कस्टमर सपोर्ट, पर्सनल असिस्टन्स आणि एज्युकेशन—यात उत्कृष्ट कामगिरी करेल, आणि मॉडेल डेव्हलपर्स कसे व्हॉइस एजंट्स तयार करतात आणि डिप्लॉय करतात यासोबत सुसंगत होईल. या मॉडेलने ऑडिओ क्वालिटी, इंटेलिजन्स, इन्स्ट्रक्शन फॉलोइंग आणि फंक्शन कॉलिंगमध्ये सुधारणा दाखवली आहे.

ऑडिओ क्वालिटी

रिअल वर्ल्डमध्ये व्हॉइस एजंट्स डिप्लॉय करण्यासाठी नैसर्गिक वाटणारे संभाषण अत्यंत महत्त्वाचे आहे. मॉडेल्सना मानवी इंटोनेशन, भावना आणि गतीने बोलणे आवश्यक आहे जेणेकरून वापरकर्त्यांसाठी आनंददायक अनुभव तयार होईल आणि सततचे संभाषण प्रोत्साहित होईल. आम्ही gpt-realtime ला उच्च दर्जाचे भाषण तयार करण्याचे प्रशिक्षण दिले आहे जे अधिक नैसर्गिक वाटेल आणि "जलद आणि व्यावसायिकपणे बोला" किंवा "फ्रेंच उच्चारात सहानुभूतीने बोला" यासारख्या सूक्ष्म सूचनांचे पालन करू शकेल.

आम्ही API मध्ये दोन नवीन व्हॉइस रिलीज करत आहोत—Marin आणि Cedar—ज्यात नॅचरल-साउंडिंग स्पीचमध्ये सर्वात मोठ्या सुधारणा आहेत. आम्ही आमचे एग्झिस्टिंग आठ व्हॉइसही अपडेट करत आहोत जेणेकरून या सुधारणांचा फायदा मिळेल.

व्हॉइस सॅम्पल - Marin
व्हॉइस सॅम्पल - Cedar

इंटेलिजन्स आणि कॉम्प्रिहेन्शन

gpt-realtime उच्च बुद्धिमत्ता दर्शवते आणि स्थानिक ऑडिओ अधिक अचूकतेने समजू शकते. मॉडेल नॉन-वर्बल संकेत (जसे की हसणे), वाक्याच्या मध्ये भाषा बदलणे, आणि टोन अनुकूलित करणे (“स्नॅपी आणि प्रोफेशनल” विरुद्ध “काईंड आणि एम्पथेटिक”) करू शकते. इंटरनल इव्हॅल्यूएशन्सनुसार, मॉडेल इतर भाषांमध्ये, ज्यात स्पॅनिश, चायनीज, जपानी आणि फ्रेंच यांचा समावेश आहे, अल्फान्युमेरिक सिक्वेन्सेस (उदा. फोन नंबर, VINs इत्यादी) ओळखण्यात अधिक अचूक कामगिरी दर्शवते. बिग बेंच ऑडिओ इव्हल मेजरिंग रिजनिंग क्षमतांमध्ये, gpt-realtime ने 82.8% अचूकता मिळवली आहे - डिसेंबर 2024 च्या आमच्या मागील मॉडेलला मागे टाकत, ज्याने 65.6% गुण मिळवले होते.

बिग बेंच ऑडिओ(नवीन विंडोमध्ये उघडेल) बेंचमार्क हा ऑडिओ इनपुटला समर्थन देणाऱ्या भाषा मॉडेल्सच्या तर्क क्षमतांचे मूल्यांकन करण्यासाठी एक मूल्यांकन डेटासेट आहे. हा डेटासेट Big Bench Hard मधील प्रश्नांना—ज्याला अ‍ॅडव्हान्स्ड रिझनिंगच्या कठोर चाचणीसाठी निवडले गेले आहे—ऑडिओ डोमेनमध्ये रूपांतरित करतो.

निर्देशांचे पालन

स्पीच-टू-स्पीच ॲप्लिकेशन तयार करताना, डेव्हलपर्स मॉडेलला कसे वागावे याबाबत सूचना देतात, ज्यात कसे बोलायचे, विशिष्ट परिस्थितीत काय सांगायचे, आणि काय करायचे किंवा काय करू नये हे समाविष्ट असते. आम्ही आमच्या सुधारणा या इन्स्ट्रक्शन्सच्या ॲड्हिअरन्सवर केंद्रित केल्या आहेत, ज्यामुळे लहान डायरेक्शन्सदेखील मॉडेलसाठी अधिक सिग्नल देतात. मल्टीचॅलेंज ऑडिओ बेंचमार्कवर सूचनांचे पालन करण्याच्या अचूकतेचे मोजमाप करताना, GPT‑realtime ला 30.5% गुण मिळतात, जे डिसेंबर 2024 मधील आमच्या मागील मॉडेलच्या 20.6% गुणांपेक्षा लक्षणीय सुधारणा आहे.

MultiChallenge(नवीन विंडोमध्ये उघडेल) LLMs ह्युमन्ससोबत मल्टी-टर्न कन्व्हर्सेशन्स किती चांगल्या प्रकारे हँडल करतात हे इव्हॅल्यूएट करते. हे चार कॅटेगरीजवर फोकस करते ज्यात करंट फ्रंटियर मॉडेल्स स्ट्रगल करतात. या आव्हानांसाठी मॉडेल्सना इन्स्ट्रक्शन-फॉलोइंग, कॉन्टेक्स्ट मॅनेजमेंट, आणि इन-कॉन्टेक्स्ट रिझनिंग एकाचवेळी एकत्र करण्याची गरज असते. आम्ही टेस्ट प्रश्नांचा ऑडिओ-फ्रेंडली सबसेट टेक्स्ट-टू-स्पीचद्वारे कन्व्हर्ट करून या मूल्यांकनाचा ऑडिओ आवृत्ती तयार केली.

फंक्शन कॉलिंग

स्पीच-टू-स्पीच मॉडेलसह एक केपेबल व्हॉइस एजंट तयार करण्यासाठी, मॉडेलला योग्य वेळी योग्य टूल्स कॉल करता यायला हवे, जेणेकरून ते प्रॉडक्शनमध्ये उपयुक्त ठरेल. आम्ही फंक्शन कॉलिंग तीन अ‍ॅक्सिसवर सुधारले आहे: रिलिव्हंट फंक्शन्स कॉल करणे, अ‍ॅप्रोप्रिएट टाइमला फंक्शन्स कॉल करणे, आणि अ‍ॅप्रोप्रिएट आर्ग्युमेंट्ससह फंक्शन्स कॉल करणे (ज्यामुळे हायर अ‍ॅक्युरसी मिळते). कॉम्प्लेक्सफंकबेंच ऑडिओ इव्हॅलवर फंक्शन कॉलिंग परफॉर्मन्स मोजताना, gpt-realtime 66.5% स्कोअर करते, तर डिसेंबर 2024 मधील आमचे मागील मॉडेल 49.7% स्कोअर करते.

आम्ही अ‍ॅसिंक्रोनस फंक्शन कॉलिंग(नवीन विंडोमध्ये उघडेल) मध्येही सुधारणा केल्या आहेत. लाँग-रनिंग फंक्शन कॉल्स आता सेशनचा फ्लो डिसरप्ट करणार नाहीत—रिझल्ट्सची वाट पाहताना मॉडेल फ्लुइड कन्व्हर्सेशन सुरू ठेवू शकते. ही फीचर gpt-realtime मध्ये नेटीव्हली उपलब्ध आहे, त्यामुळे डेव्हलपर्सना त्यांचा कोड अपडेट करण्याची गरज नाही.

ComplexFuncBench मॉडेल्स(नवीन विंडोमध्ये उघडेल) चॅलेंजिंग फंक्शन कॉलिंग टास्क्स किती चांगल्या प्रकारे हँडल करतात हे मोजते. हे परफॉर्मन्स इव्हॅल्यूएट करते अशा सिनेरिओजमध्ये जसे मल्टी-स्टेप कॉल्स, कॉन्स्ट्रेंट्स किंवा इम्प्लिसिट पॅरामिटर्सवर रिझनिंग करणे, खूप लाँग इनपुट्स हँडल करणे. आम्ही ओरिजिनल टेक्स्ट प्रॉम्प्ट्स स्पीचमध्ये कन्व्हर्ट करून आमच्या मॉडेलसाठी हे इव्हॅल्यूएशन बिल्ड केले.

रिअलटाइम API मध्ये नवीन

रिमोट MCP सर्व्हर सपोर्ट

तुम्ही Realtime API सेशनमध्ये MCP सपोर्ट सक्षम करू शकता, रिमोट MCP सर्व्हरचा URL सेशन कॉन्फिगरेशनमध्ये पास करून. एकदा कनेक्ट झाल्यावर, API आपोआप टूल कॉल्स हँडल करते, त्यामुळे मॅन्युअली इंटिग्रेशन्स वायर करण्याची गरज नाही.

ही सेटअप तुमच्या एजंटला नवीन क्षमतांनी वाढवणे सोपे करते—फक्त सेशन दुसऱ्या MCP सर्व्हरकडे पॉइंट करा, आणि त्या टूल्स लगेच उपलब्ध होतील. Realtime सोबत MCP कॉन्फिगर करण्याबद्दल अधिक जाणून घेण्यासाठी, हे मार्गदर्शक(नवीन विंडोमध्ये उघडेल) पहा.

JavaScript

1
// POST /v1/realtime/client_secrets
2
{
3
"session": {
4
"type": "realtime",
5
"tools": [
6
{
7
"type": "mcp",
8
"server_label": "stripe",
9
"server_url": "https://mcp.stripe.com",
10
"authorization": "{access_token}",
11
"require_approval": "never"
12
}
13
]
14
}
15
}
16

इमेज इनपुट

आता gpt-realtime मध्ये इमेज इनपुट्स सपोर्ट केल्या गेल्या आहेत, त्यामुळे तुम्ही Realtime API सेशनमध्ये ऑडिओ किंवा टेक्स्टसोबत इमेजेस, फोटोस आणि स्क्रीनशॉट्स जोडू शकता. आता मॉडेल कन्व्हर्सेशनला युजर प्रत्यक्षात काय पाहत आहे यामध्ये ग्राउंड करू शकते, ज्यामुळे युजर्स “तुम्हाला काय दिसते?” किंवा “या स्क्रीनशॉटमधील टेक्स्ट वाचा” असे प्रश्न विचारू शकतात.

इमेजला लाईव्ह व्हिडिओ स्ट्रिमप्रमाणे वागवण्याऐवजी, सिस्टीम त्याला संभाषणात पिक्चर जोडल्याप्रमाणे वागवते. तुमचे ॲप ठरवू शकते की कोणते इमेजेस मॉडेलसोबत शेअर करायचे आणि केव्हा शेअर करायचे. अशा प्रकारे, मॉडेल काय पाहते आणि केव्हा रिस्पॉन्ड करते हे तुमच्या कंट्रोलमध्ये राहते.

आमचे docs(नवीन विंडोमध्ये उघडेल) तपासा आणि इमेज इनपुटसह सुरुवात करा.

JavaScript

1
{
2
"type": "conversation.item.create",
3
"previous_item_id": null,
4
"item": {
5
"type": "message",
6
"role": "user",
7
"content": [
8
{
9
"type": "input_image",
10
"image_url": "data:image/{format(example: png)};base64,{some_base64_image_bytes}"
11
}
12
]
13
}
14
}
15

अ‍ॅडिशनल केपॅबिलिटीज

आम्ही Realtime API प्रॉडक्शन युजसाठी सोपी इंटिग्रेट होईल आणि अधिक फ्लेक्सिबल बनेल अशा अनेक इतर फीचर्स अ‍ॅड केले आहेत.

सेफ्टी आणि प्रायव्हसी

Realtime API मिसयुज टाळण्यासाठी मल्टिपल लेयर्स ऑफ सेफगार्ड्स आणि मिटिगेशन्स समाविष्ट करते. आपल्या सुरक्षा दृष्टिकोनाबद्दल आणि सिस्टम कार्ड तपशीलांबद्दल आपण बीटा घोषणा ब्लॉगमध्ये अधिक जाणून घेऊ शकता. आम्ही Realtime API सेशन्सवर अ‍ॅक्टिव्ह क्लासिफायर्स वापरतो, म्हणजे काही संभाषणे आमच्या हानिकारक सामग्री मार्गदर्शक तत्त्वांचे उल्लंघन करत असल्यास थांबवली जाऊ शकतात. डेव्हलपर्स एजंट्स SDK(नवीन विंडोमध्ये उघडेल) वापरून त्यांचे स्वतःचे अतिरिक्त सुरक्षा गार्डरेल सहजपणे जोडू शकतात.

आमच्या वापराची धोरणे आमच्या सेवांमधून मिळणारे आउटपुट स्पॅम, फसवणूक किंवा इतर हानिकारक हेतूंसाठी पुन्हा वापरणे किंवा वितरित करणे प्रतिबंधित आहे. डेव्हलपर्सना एन्ड युजर्सना हे देखील स्पष्ट करणे आवश्यक आहे की ते AI सोबत इंटरॲक्ट करत आहेत, जोपर्यंत ते कॉन्टेक्स्टमधून आधीच ऑब्व्हियस नाही. Realtime API इतरांचे इम्पर्सोनेशन टाळण्यासाठी प्रीसेट व्हॉइसेस वापरते.

रिअलटाइम API EU डेटा रेसिडेन्सी(नवीन विंडोमध्ये उघडेल) साठी EU-आधारित अर्जांसाठी पूर्णपणे सपोर्ट करते आणि आमच्या एंटरप्राइझ गोपनीयता वचनबद्धता अंतर्गत संरक्षित आहे.

किंमत आणि उपलब्धता

सर्वसाधारणपणे उपलब्ध असलेले रिअलटाइम API आणि नवीन gpt-realtime मॉडेल आजपासून सर्व डेव्हलपर्ससाठी उपलब्ध आहेत. आम्ही gpt-realtime च्या किमती gpt-4o-realtime-पूर्वावलोकन च्या तुलनेत 20% ने कमी करत आहोत—$31/ 1 दशलक्ष ऑडिओ इनपुट टोकन (कॅशेड इनपुट टोकनसाठी $0.40) आणि $64 / 1 दशलक्ष ऑडिओ आउटपुट टोकन (तपशीलवार किंमत(नवीन विंडोमध्ये उघडेल) पहा). आम्ही कन्व्हर्सेशन कॉन्टेक्स्टसाठी फाइन-ग्रेन्ड कंट्रोलही अ‍ॅड केले आहे, ज्यामुळे डेव्हलपर्स इंटेलिजंट टोकन लिमिट्स सेट करू शकतात आणि एकावेळी मल्टिपल टर्न्स ट्रंकेट करू शकतात, ज्यामुळे लाँग सेशन्ससाठी खर्च लक्षणीयरीत्या कमी होतो.

लाइव्हस्ट्रीम रिप्ले

लेखक

OpenAI