स्किप करके मेन कंटेंट पर जाऍं
OpenAI

Jalapeño के शुरुआती परिणाम एआई इन्फ़रेंस में उद्योग-अग्रणी गति और दक्षता दिखाते हैं

लोड किया जा रहा है...
टील रंग के सर्किट बोर्ड पर लगे Jalapeño इन्फ़रेंस चिप का क्लोज़-अप.

Jalapeño, OpenAI की पहली कस्टम इन्फ़रेंस चिप, की घोषणा के बाद से हम इस चिप और इसके आसपास बनाए गए सिस्टम का परीक्षण कर रहे हैं. परिणाम प्रदर्शन में एक महत्वपूर्ण सुधार दिखाते हैं: Jalapeño ऊर्जा की प्रति इकाई अधिक AI कार्य संभाल सकता है और साथ ही प्रतिक्रियाएँ भी अधिक तेज़ी से दे सकता है. Jalapeño एक ही आर्किटेक्चर के साथ हाई थ्रूपुट और कम लेटेंसी, दोनों प्रदान करता है, जबकि मौजूदा हार्डवेयर सिस्टम को अक्सर इन दोनों के बीच समझौता करना पड़ता है.

ग्राहकों के लिए, इसका मतलब मांग बढ़ने पर तेज़ प्रतिक्रियाएँ, अधिक तत्पर एजेंट और अधिक भरोसेमंद पहुँच हो सकता है. हमारा मिशन यह तय करना है कि आर्टिफ़िशियल जेनरल इंटेलिजेंस से पूरी इंसानियत को फ़ायदा हो. ये सुधार लगातार अधिक सक्षम होती एआई को अधिक किफ़ायती और व्यापक रूप से उपलब्ध कराने में मदद करेंगे.

OpenAI मॉडल्स ने Jalapeño के डेवलपमेंट को भी तेज़ किया. पहले के मॉडल ने टीम को चिप डिज़ाइन करने और उसे चालू करने में मदद की, जबकि हमारे नवीनतम मॉडल इसे ऑप्टिमाइज़ और प्रोग्राम करने के तरीके को तेज़ कर रहे हैं. Jalapeño का परफ़ॉर्मेंस GPT‑OSS 120B, DeepSeek R1 और Kimi K2.5 1T में भी दिखता है, जो बताता है कि इसका आर्किटेक्चर OpenAI के भीतर और बाहर विकसित मॉडल्स पर काम करता है. इन तीनों में, Jalapeño ने पीक थ्रूपुट पर प्रति वॉट 1.5 से 1.9 गुना ज़्यादा AI काम किया और तुलना वाले सिस्टम्स की तुलना में 1.7 से 3.6 गुना कम एंड-टू-एंड लेटेंसी दी. हाई इंटरैक्टिव वर्कलोड्स के लिए, इसने 2.1 से 4.1 गुना ज़्यादा परफ़ॉर्मेंस दी.

Jalapeño व्यापक फुल-स्टैक बढ़त का भी प्रमाण है. OpenAI मॉडल, उत्पाद, सर्विंग सॉफ़्टवेयर, चिप, मेमोरी, नेटवर्किंग और सिस्टम को एक साथ डिज़ाइन कर सकता है. असल वर्कलोड से जो हम सीखते हैं, उसका इस्तेमाल करके हम स्टैक की हर लेयर को बेहतर बनाते हैं. Jalapeño मापे गए परिणामों के साथ कार्यशील प्रथम-पक्ष सिलिकॉन है, और यह एक बहु-पीढ़ीगत प्लेटफ़ॉर्म की शुरुआत है. आने वाले महीनों में, हम अपने ग्राहकों के लिए तेज़, अधिक सक्षम और अधिक कुशल उत्पाद प्रदान करने के लिए Jalapeño को बढ़ावा देंगे.

हमने Jalapeño के प्रदर्शन को कैसे मापा

हम समतुल्य उपयोगकर्ता अनुभव पर प्रदर्शन का मूल्यांकन करते हैं, यह मापते हुए कि प्रत्येक सिस्टम शक्ति की प्रति इकाई पर कितना उपयोगी AI कार्य पूरा कर सकता है, जबकि वह ग्राहकों और इंटरैक्टिव एजेंटों द्वारा अपेक्षित विलंबता को पूरा करता है. यह विशेष रूप से एजेंट्स के लिए मायने रखता है, जिन्हें क्रम में कई चरण पूरे करने होते हैं, इसलिए विलंब पूरे कार्य के दौरान बढ़ते जा सकते हैं.

यह समझने के लिए कि Jalapeño व्यावहारिक रूप से कैसा प्रदर्शन करता है, हमने इसे SemiAnalysis के एक सार्वजनिक बेंचमार्क InferenceX पर परखा, जो AI अनुरोध को सर्व करने की पूरी प्रक्रिया को मापता है. हमने टेस्ट की गई ऑपरेटिंग रेंज में Jalapeño की तुलना व्यावसायिक रूप से उपलब्ध प्रमुख AI सिस्टम्स से की, जिसमें हाई-थ्रूपुट सर्विंग से लेकर अत्यधिक इंटरैक्टिव, कम-लेटेंसी वाला उपयोग तक शामिल है. Jalapeño ने थ्रूपुट, ऊर्जा दक्षता और विलंबता का बेहतर संयोजन प्रदान किया. हालाँकि कभी-कभी प्रदर्शन को प्रति चिप के हिसाब से बताया जाता है, हमारा मानना है कि अधिक उपयोगी मानक पावर की प्रति इकाई प्रदर्शन है.

Jalapeño ने पिछले सर्वश्रेष्ठ TBT में बढ़त और बढ़ाई

Jalapeño हर यूज़र को ज़्यादा टोकन देता है

Jalapeño प्रति किलोवाट अधिक थ्रूपुट प्रदान करता है

तीनों सार्वजनिक मॉडलों में, Jalapeño ने परीक्षण की गई ऑपरेटिंग रेंज में प्रति watt प्रदर्शन और विलंबता का बेहतर संयोजन दिया, जिससे यह Pareto अत्याधुनिक पर स्थित हो गया. प्रणालियों की सुसंगत रूप से तुलना करने के लिए, हमने प्रत्येक एक्सेलेरेटर की प्रकाशित चिप पावर रेटिंग का उपयोग करके परिणामों को सामान्यीकृत किया. Jalapeño की रेटिंग 700 watt है, हालांकि परीक्षण किए गए वर्कलोड पर इसकी मापी गई निरंतर पावर 550 watt या उससे कम रही.

Jalapeño ने GPT‑OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T पर मजबूत प्रदर्शन किया. हमारे द्वारा परीक्षण किए गए सबसे बड़े सार्वजनिक मॉडल Kimi पर, इसने तुलना प्रणाली की अपेक्षा प्रति वॉट लगभग 1.5 गुना हाई पीक प्रदर्शन और 3.4 गुना कम एंड-टू-एंड विलंबता दी. हमारी आंतरिक टेस्टिंग में, अत्याधुनिक OpenAI मॉडलों पर Jalapeño की बढ़त और बढ़ गई, जिससे संकेत मिलता है कि वर्कलोड के बड़े और अधिक मांग वाले होने के साथ आर्किटेक्चर अधिक मूल्यवान हो जाता है.

एक ही चिप में स्पीड और एफ़िशिएंसी के लिए डिज़ाइन

Jalapeño को शुरू से इस सवाल को ध्यान में रखकर डिज़ाइन किया गया था: अगर इसका मुख्य काम आज और भविष्य के लैंग्वेज मॉडल्स को चलाना हो, खासकर इंटरैक्टिव एजेंट्स के लिए, तो हम किस तरह का हार्डवेयर बनाएँगे? Jalapeño की बेहतर परफ़ॉर्मेंस के पीछे चिप, मेमोरी, नेटवर्क, सॉफ़्टवेयर और रैक-स्केल सिस्टम को एक साथ डिज़ाइन करना है, ताकि ये सभी असल लैंग्वेज मॉडल वर्कलोड्स के हिसाब से काम करें. लैंग्वेज मॉडल इन्फ़रेंस कई अलग-अलग फ़ेज़ में चलता है और हर फ़ेज़ में अलग तरह की दिक्कत आती है. प्रिफ़िल में सिस्टम प्रॉम्प्ट को प्रोसेस करता है, इसलिए यहाँ कंप्यूट की ज़रूरत ज़्यादा होती है. वहीं डिकोड में सिस्टम एक-एक टोकन करके जवाब बनाता है, इसलिए यहाँ मेमोरी की बैंडविड्थ ज़्यादा मायने रखती है. जब डेटा को अलग-अलग कोर और चिप्स के बीच भेजना पड़ता है, तो कम्युनिकेशन से भी लेटेंसी बढ़ सकती है. इस दौरान कुछ प्रोसेसिंग यूनिट्स डेटा का इंतज़ार करते हुए खाली रह सकती हैं. अगर कोई सिस्टम एक फ़ेज़ में बहुत अच्छा काम करता है, तो डेटा का इंतज़ार करने या मॉडल की जानकारी को अलग-अलग रिसोर्स के बीच भेजने में उसका यह फ़ायदा कम हो सकता है.

हमने Jalapeño को इस तरह डिज़ाइन किया है कि डेटा को इधर-उधर भेजना और कम्युनिकेशन में होने वाली देरी कम-से-कम हो. इसका मतलब है कि मॉडल की जानकारी, जिसमें जवाब बनाते समय इस्तेमाल होने वाला KV कैश भी शामिल है, सही जगह पर रखी जा सकती है और वहीं बनी रह सकती है. साथ ही, इन्फ़रेंस के हर फ़ेज़ में ज़रूरत के हिसाब से कंप्यूट, मेमोरी और नेटवर्किंग का सही कॉम्बिनेशन इस्तेमाल किया जा सकता है. नेटवर्क इस आर्किटेक्चर का एक अहम हिस्सा है. इसका बड़ा डोमेन पूरे वर्कलोड को एक ही कनेक्टेड सिस्टम के अंदर रखने देता है. इससे डेटा को इधर-उधर भेजने की ज़रूरत कम होती है और पूरी रिक्वेस्ट शुरुआत से अंत तक तेज़ और एफ़िशिएंट बनी रहती है. इससे एक ऐसा संतुलित और फ़्लेक्सिबल एक्सेलेरेटर मिलता है, जो बदलते मॉडल आर्किटेक्चर के साथ काम कर सकता है, प्रिफ़िल और डिकोड दोनों में अच्छा प्रदर्शन कर सकता है और इनके बीच बदलते संतुलन के हिसाब से खुद को ढाल सकता है. एजेंटिक वर्कलोड्स के लिए यह एक अहम फ़ीचर है.

हमने चिप को डिज़ाइन करने के लिए AI का इस्तेमाल किया और चिप को इस तरह डिज़ाइन किया कि AI उसे प्रोग्राम कर सके

Jalapeño को बनाने में AI ने सीधे तौर पर मदद की. इसकी मदद से टीम ने शुरुआती डिज़ाइन से लेकर टेप-आउट तक का काम नौ महीनों में पूरा किया. इस दौरान अलग-अलग इम्प्लीमेंटेशन आज़माए गए, डिज़ाइन, मेज़रमेंट और वेरिफ़िकेशन के बीच का समय कम किया गया और अलग-अलग मॉडल वर्कलोड्स पर लगातार इटरेशन किया गया. AI ने चिप के अरिथमेटिक सर्किट्स को ऑप्टिमाइज़ करने में भी मदद की. इससे टीम तय समय में चिप में ज़्यादा कंप्यूट परफ़ॉर्मेंस फिट कर पाई.

Jalapeño को इस तरह डिज़ाइन किया गया है कि इंसानों और AI, दोनों के लिए इसे प्रोग्राम करना साफ़ और आसान हो. इंजीनियर्स लोकल टेंसर, साफ़ तौर पर तय कम्युनिकेशन और अनुमान के मुताबिक सिंक्रोनाइज़ेशन का इस्तेमाल करके काम बता सकते हैं. इसके बाद AI यह तय करने में मदद कर सकता है कि उस काम को पूरे सिस्टम में कैसे मैप, प्लेस, शेड्यूल और कोऑर्डिनेट किया जाए. इस साफ़ और अनुमान के मुताबिक काम करने वाले स्ट्रक्चर से AI के लिए पैरेलल प्रोग्रामिंग जैसी मुश्किल समस्या को संभालना आसान हो जाता है.

हर नए मॉडल फ़ैमिली को सपोर्ट करने के लिए अब भी नए कर्नल्स और मॉडल के हिसाब से ऑप्टिमाइज़ेशन की ज़रूरत होती है. Codex और GPT‑Astra का इस्तेमाल करके टीम ने तीन ऐसे ओपन-वेट मॉडल्स को दो महीनों के अंदर अच्छी परफ़ॉर्मेंस तक पहुँचाया, जिन्हें Jalapeño के शुरुआती प्रोडक्शन प्लान में शामिल नहीं किया गया था. इससे आर्किटेक्चर की फ़्लेक्सिबिलिटी और उसे प्रोग्राम करने में AI की मदद से मिलने वाली स्पीड, दोनों का पता चला. GPT‑OSS के कुछ चुने हुए अटेंशन और मिक्सचर-ऑफ़-एक्सपर्ट्स ब्लॉक्स के लिए AI से तैयार किए गए इम्प्लीमेंटेशन, इंसानी एक्सपर्ट्स के बनाए मौजूदा इम्प्लीमेंटेशन से 1.5 से 1.8 गुना तेज़ चले. ये आँकड़े चुने गए ब्लॉक्स पर लागू होते हैं, पूरे मॉडल पर नहीं. फिर भी, ये एक नए और बेहतर डेवलपमेंट लूप की ओर इशारा करते हैं.

एफ़िशिएंट, अल्ट्रा-फ़ास्ट इन्फ़रेंस की ओर आगे का रास्ता

AI इन्फ़्रास्ट्रक्चर की अहमियत इस बात से है कि उससे असल दुनिया में कितना काम किया जा सकता है. उतनी ही पावर और हार्डवेयर से ज़्यादा काम करने की क्षमता के कारण, Jalapeño हमें ज़्यादा लोगों की ज़रूरत पूरी करने और बेहतर नतीजे देने की लागत कम करने में मदद कर सकता है. OpenAI के लिए इससे ऑपरेटिंग लेवरेज बेहतर हो सकता है. यानी AI को चलाने की लागत की तुलना में हमारा काम और रेवेन्यू ज़्यादा तेज़ी से बढ़ सकता है. इससे AI को ज़्यादा लोगों तक पहुँचाने और बेहतर मॉडल्स, प्रोडक्ट्स और इन्फ़्रास्ट्रक्चर में लगातार निवेश करने में भी मदद मिल सकती है. तेज़ इन्फ़रेंस से तेज़ इटरेशन और नए यूज़ केस मुमकिन हो सकते हैं.

Jalapeño कम लागत और कम लेटेंसी वाले इन्फ़रेंस के लिए नई संभावनाएँ खोलता है:

  • अल्ट्रा-फ़ास्ट मोड में अब उतनी ही एफ़िशिएंसी, जो पहले सिर्फ़ फ़ास्ट मोड में मिलती थी
  • फ़ास्ट मोड में अब उतनी ही एफ़िशिएंसी, जो पहले सिर्फ़ बैच्ड मोड में मिलती थी
  • बैच्ड मोड में और बेहतर एफ़िशिएंसी

हम साल के अंत तक OpenAI के कंप्यूट इन्फ़्रास्ट्रक्चर में Jalapeño को इस्तेमाल करना शुरू करने की योजना बना रहे हैं. यह कई पीढ़ियों वाली योजना की पहली जेनरेशन है. Gen 2 पर तेज़ी से काम चल रहा है और Gen 3 का डिज़ाइन भी आकार ले रहा है. हर नई जेनरेशन में पिछली जेनरेशन से मिली सीख का इस्तेमाल किया जाएगा और एफ़िशिएंसी और स्पीड, दोनों को और बेहतर किया जाएगा.

AI की बढ़ती माँग को पूरा करने के लिए अभी मौजूद हर सोर्स से ज़्यादा कंप्यूट की ज़रूरत होगी. हम ट्रेनिंग और इन्फ़रेंस, दोनों तरह के कामों के लिए NVIDIA और दूसरे पार्टनर्स के एक्सेलेरेटर्स का बड़े पैमाने पर इस्तेमाल जारी रखेंगे. हमारा मिशन यह ध्यान रखना है कि आर्टिफ़िशियल जेनरल इंटेलिजेंस से पूरी इंसानियत को फ़ायदा हो.

Jalapeño को इस्तेमाल के लिए तैयार करते हुए हम प्रोडक्शन क्वालिफ़िकेशन जारी रख रहे हैं, सॉफ़्टवेयर को और बेहतर बना रहे हैं, बड़े पैमाने पर Jalapeño को चलाने की तैयारी कर रहे हैं और ज़्यादा मॉडल्स पर इसकी परफ़ॉर्मेंस चेक कर रहे हैं. अब तक के नतीजे दिखाते हैं कि जब पूरे सिस्टम को एक साथ ध्यान में रखकर डिज़ाइन किया जाए, तो क्या हासिल किया जा सकता है: ज़्यादा तेज़ी से जवाब देने वाला, ज़्यादा सक्षम और ज़्यादा एजेंटिक AI, जिसे ज़्यादा लोगों तक बेहतर तरीके़ से पहुँचाया जा सके.

एपेंडिक्स

GPT‑OSS 120B पर Jalapeño स्पीड और एफ़िशिएंसी के बीच सबसे बेहतर संतुलन देता है

प्रति kW थ्रूपुट अत्याधुनिक

InferenceX · GPT‑OSS‑120B · नाममात्र 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño GPT‑OSS के सभी ऑपरेटिंग पॉइंट्स में आगे है

पीक और समान थ्रूपुट

InferenceX · GPT‑OSS‑120B · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB200 1,200 W

पीक मिक्स्ड TPS / किलोवाट ज़्यादा

≈1.9×

85,448 vs. 44,960 मिक्स्ड / किलोवाट

कम एंड-टू-एंड लेटेंसी

≈1.7×

1.03 सेकंड vs. 1.80 सेकंड

कम मिनिमम TBT

≈2.7×

0.69 vs. 1.87 मिलीसेकंड (1,459 vs. 535 टोकन्स/सेकंड/यूज़र)

पहले वाली TBT पर ज़्यादा थ्रूपुट

≈53.7×

22,935 vs. 427 मिक्स्ड / किलोवाट (535.28 टोकन्स/सेकंड/यूज़र पर)

DeepSeek R1 670B पर Jalapeño स्पीड और एफ़िशिएंसी के बीच सबसे बेहतर संतुलन देता है

प्रति किलोवाट थ्रूपुट में सबसे आगे

InferenceX · DeepSeek R1 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W

DeepSeek R1 के सभी ऑपरेटिंग पॉइंट्स में आगे है

पीक और समान थ्रूपुट

InferenceX · DeepSeek R1 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W

ज़्यादा पीक मिक्स्ड TPS / किलोवाट

≈1.7×

19,641 vs. 11,781 मिक्स्ड / किलोवाट

कम एंड-टू-एंड लेटेंसी

≈3.6×

1.65 s vs. 5.99 s

कम मिनिमम TBT

≈4.1×

1.43 vs. 5.90 मिलीसेकंड (700 vs. 169 टोकन्स/सेकंड/यूज़र)

पहले वाली TBT पर ज़्यादा थ्रूपुट

≈104.3×

12,258 vs. 118 मिक्स्ड / किलोवाट (169.41 टोकन्स/सेकंड/यूज़र पर)

Kimi K2.5 1T पर Jalapeño स्पीड और एफ़िशिएंसी के बीच सबसे बेहतर संतुलन देता है

प्रति किलोवाट थ्रूपुट में सबसे आगे

InferenceX · Kimi K2.5 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W

Kimi K2.5 के सभी ऑपरेटिंग पॉइंट्स में आगे है

पीक और समान थ्रूपुट

InferenceX · Kimi K2.5 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W

ज़्यादा पीक मिक्स्ड TPS / किलोवाट

≈1.5×

18,195 vs. 11,862 मिश्रित / kW

कम एंड-टू-एंड लेटेंसी

≈3.4×

1.56 सेकंड vs. 5.31 सेकंड

कम मिनिमम TBT

≈3.8×

1.44 vs. 5.48 मिलीसेकंड (694 vs. 182 टोकन्स/सेकंड/यूज़र)

पहले वाली TBT पर ज़्यादा थ्रूपुट

≈56.1×

6,744 vs. 120 मिश्रित / kW (182.46 tok/s/user पर)

लेखक

OpenAI