स्किप करके मेन कंटेंट पर जाऍं
OpenAI

API ग्राहकों के लिए तेज़ मोड

तेज़ मोड आपको भरोसेमंद, हाई-स्पीड परफ़ॉर्मेंस देता है, साथ ही पे-ऐज़-यू-गो की फ़्लेक्सिबिलिटी भी देता है. हमारे लेटेस्ट फ़्रंटियर मॉडल, gpt-5.6-sol के लिए, तेज़ मोड के साथ आपको 2.5x तक तेज़ स्पीड मिल सकती है.

तेज़ मोड चुनकर, आप ये फ़ायदे पा सकते हैं:

  • उम्मीद के मुताबिक लो लेटेंसी: तेज़ मोड, स्टैंडर्ड प्रोसेसिंग सर्विस की तुलना में टोकंस को ज़्यादा तेज़ी और ज़्यादा लगातार स्पीड से जेनरेट करता है, यहाँ तक कि पीक डिमांड के दौरान भी.
  • आसान और फ़्लेक्सिबल इस्तेमाल: स्टैंडर्ड प्रोसेसिंग की तरह, तेज़ मोड को भी फ़्लेक्सिबल, पे-ऐज़-यू-गो आधार पर एक्सेस किया जा सकता है. इसके लिए पहले से प्रोविज़निंग करने की ज़रूरत नहीं है.

ध्यान दें: 30 जुलाई, 2026 को प्रायोरिटी प्रोसेसिंग का नाम बदलकर तेज़ मोड कर दिया गया है. आप अपनी API रिक्वेस्ट्स में service_tier: प्रायोरिटी या service_tier: तेज़, इनमें से किसी का भी इस्तेमाल कर सकते हैं.

Short contextLong contextअपटाइम SLA3लेटेंसी SLA3
प्रति 1M इनपुट टोकन की क़ीमतप्रति 1M इनपुट टोकन की क़ीमत (कैश्ड)प्रति 1M आउटपुट टोकन्स की क़ीमतप्रति 1M इनपुट टोकन की क़ीमतप्रति 1M इनपुट टोकन की क़ीमत (कैश्ड)प्रति 1M आउटपुट टोकन्स की क़ीमत
GPT-5.6 Sol
$10.00$1.00$60.00$20.00$2.00$90.0099.9%99% > 80 टोकन प्रति सेकंड2
GPT-5.6 Terra
$4.00$0.40$24.00$8.00$0.80$36.0099.9%99% > 70 टोकन प्रति सेकंड2
GPT-5.6 Luna
$0.40$0.04$2.40$0.80$0.08$3.6099.9%99% > 100 टोकन प्रति सेकंड2
GPT-5.5
लंबे कॉन्टेक्स्ट1 को बाहर कर देता है
$12.50$1.250$75.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5.4 mini
लंबे कॉन्टेक्स्ट1 को बाहर कर देता है
$1.50$0.150$9.0099.9%99% > 100 टोकन प्रति सेकंड2
GPT-5.4
लंबे कॉन्टेक्स्ट1 को बाहर कर देता है
$5.00$0.500$30.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5.2
$3.50$0.350$28.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5.1
$2.50$0.250$20.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5
$2.50$0.250$20.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5 mini
$0.45$0.045$3.6099.9%99% > 80 टोकन प्रति सेकंड2
GPT-5.1 codex
$2.50$0.250$20.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-5 codex
$2.50$0.250$20.0099.9%99% > 50 टोकन प्रति सेकंड2
GPT-4.1
$3.50$0.875$14.0099.9%99% > 80 टोकन प्रति सेकंड2
GPT-4.1 mini
$0.70$0.175$2.8099.9%99% > 90 टोकन प्रति सेकंड2
GPT-4.1 nano
$0.20$0.050$0.8099.9%99% > 100 टोकन प्रति सेकंड2
GPT-4o
gpt-4o-2024-11-20
gpt-4o-2024-08-06
$4.25$2.125$17.0099.9%99% > 80 टोकन प्रति सेकंड2
gpt-4o-2024-05-13
$8.75$26.2599.9%99% > 80 टोकन प्रति सेकंड2
GPT-4o mini
$0.25$0.125$1.0099.9%99% > 90 टोकन प्रति सेकंड2
o3
$3.50$0.875$14.0099.9%99% > 80 टोकन प्रति सेकंड2
o4-mini
$2.00$0.500$8.0099.9%99% > 90 टोकन प्रति सेकंड2
1अनुरोधों का अनुमान >272K प्रॉम्प्ट टोकन के हिसाब से किया गया
2प्रति 5 मिनट के आधार पर p50 अनुरोध की लेटेंसी पर कैल्कुलेट किया जाता है. मौजूदा एंटरप्राइज़ अग्रीमेंट्स वाले कस्टमर्स के लिए, जिनकी लेटेंसी SLAs प्रति मिनट के आधार पर p50 अनुरोध की लेटेंसी पर कैल्कुलेट की जाती है, पहले के SLAs अभी भी लागू होते हैं.
3ये सिर्फ़ Enterprise कस्टमर्स पर लागू है

ये कैसे काम करता है

ग्राहक मौजूदा service_tier पैरामीटर का इस्तेमाल करके हर रिक्वेस्ट के आधार पर ट्रैफ़िक को तेज़ मोड पर भेज सकते हैं. इसके लिए service_tier = "fast" विकल्प चुनें.

तेज़ मोड से प्रोसेस किए गए टोकंस के लिए हर टोकन के हिसाब से बिल लिया जाएगा. इसकी कीमत प्रोसेसिंग की स्टैंडर्ड दरों के मुकाबले ज़्यादा होगी.

रिक्वेस्ट लेवल पर इसे कॉन्फ़िगर करने के अलावा, आप प्रोजेक्ट सेटिंग्स > 'डिफ़ॉल्ट सर्विस टियर: तेज़' में किसी प्रोजेक्ट के लिए तेज़ मोड को डिफ़ॉल्ट तौर पर भी सेट कर सकते हैं. आप हर रिक्वेस्ट के लिए इस सेटिंग को ओवरराइड कर सकते हैं. अपनी प्रोजेक्ट सेटिंग्स में 'तेज़' चुनना, प्रायोरिटी चुनने के बराबर है.

सीमाऍं

  • तेज़ मोड की रेट लिमिट्स दूसरे सर्विस टियर्स के साथ शेयर की जाती हैं.
  • कुछ दुर्लभ मामलों में, तेज़ मोड में आपके 'टोकंस प्रति मिनट' को तेज़ी से बढ़ाने पर रैम्प रेट लिमिट्स हिट हो सकती हैं. अगर आप रैंप रेट लिमिट को पार कर जाते हैं, तो अतिरिक्त ट्रैफ़िक को स्टैंडर्ड प्रोसेसिंग में भेजा जा सकता है.

अक्‍सर पूछे जाने वाले सवाल

दाम

मॉडल्स

दर सीमाएँ

भरोसा

नीतियाँ