Jalapeño के शुरुआती परिणाम एआई इन्फ़रेंस में उद्योग-अग्रणी गति और दक्षता दिखाते हैं

Jalapeño, OpenAI की पहली कस्टम इन्फ़रेंस चिप, की घोषणा के बाद से हम इस चिप और इसके आसपास बनाए गए सिस्टम का परीक्षण कर रहे हैं. परिणाम प्रदर्शन में एक महत्वपूर्ण सुधार दिखाते हैं: Jalapeño ऊर्जा की प्रति इकाई अधिक AI कार्य संभाल सकता है और साथ ही प्रतिक्रियाएँ भी अधिक तेज़ी से दे सकता है. Jalapeño एक ही आर्किटेक्चर के साथ हाई थ्रूपुट और कम लेटेंसी, दोनों प्रदान करता है, जबकि मौजूदा हार्डवेयर सिस्टम को अक्सर इन दोनों के बीच समझौता करना पड़ता है.
ग्राहकों के लिए, इसका मतलब मांग बढ़ने पर तेज़ प्रतिक्रियाएँ, अधिक तत्पर एजेंट और अधिक भरोसेमंद पहुँच हो सकता है. हमारा मिशन यह तय करना है कि आर्टिफ़िशियल जेनरल इंटेलिजेंस से पूरी इंसानियत को फ़ायदा हो. ये सुधार लगातार अधिक सक्षम होती एआई को अधिक किफ़ायती और व्यापक रूप से उपलब्ध कराने में मदद करेंगे.
OpenAI मॉडल्स ने Jalapeño के डेवलपमेंट को भी तेज़ किया. पहले के मॉडल ने टीम को चिप डिज़ाइन करने और उसे चालू करने में मदद की, जबकि हमारे नवीनतम मॉडल इसे ऑप्टिमाइज़ और प्रोग्राम करने के तरीके को तेज़ कर रहे हैं. Jalapeño का परफ़ॉर्मेंस GPT‑OSS 120B, DeepSeek R1 और Kimi K2.5 1T में भी दिखता है, जो बताता है कि इसका आर्किटेक्चर OpenAI के भीतर और बाहर विकसित मॉडल्स पर काम करता है. इन तीनों में, Jalapeño ने पीक थ्रूपुट पर प्रति वॉट 1.5 से 1.9 गुना ज़्यादा AI काम किया और तुलना वाले सिस्टम्स की तुलना में 1.7 से 3.6 गुना कम एंड-टू-एंड लेटेंसी दी. हाई इंटरैक्टिव वर्कलोड्स के लिए, इसने 2.1 से 4.1 गुना ज़्यादा परफ़ॉर्मेंस दी.
Jalapeño व्यापक फुल-स्टैक बढ़त का भी प्रमाण है. OpenAI मॉडल, उत्पाद, सर्विंग सॉफ़्टवेयर, चिप, मेमोरी, नेटवर्किंग और सिस्टम को एक साथ डिज़ाइन कर सकता है. असल वर्कलोड से जो हम सीखते हैं, उसका इस्तेमाल करके हम स्टैक की हर लेयर को बेहतर बनाते हैं. Jalapeño मापे गए परिणामों के साथ कार्यशील प्रथम-पक्ष सिलिकॉन है, और यह एक बहु-पीढ़ीगत प्लेटफ़ॉर्म की शुरुआत है. आने वाले महीनों में, हम अपने ग्राहकों के लिए तेज़, अधिक सक्षम और अधिक कुशल उत्पाद प्रदान करने के लिए Jalapeño को बढ़ावा देंगे.
हम समतुल्य उपयोगकर्ता अनुभव पर प्रदर्शन का मूल्यांकन करते हैं, यह मापते हुए कि प्रत्येक सिस्टम शक्ति की प्रति इकाई पर कितना उपयोगी AI कार्य पूरा कर सकता है, जबकि वह ग्राहकों और इंटरैक्टिव एजेंटों द्वारा अपेक्षित विलंबता को पूरा करता है. यह विशेष रूप से एजेंट्स के लिए मायने रखता है, जिन्हें क्रम में कई चरण पूरे करने होते हैं, इसलिए विलंब पूरे कार्य के दौरान बढ़ते जा सकते हैं.
यह समझने के लिए कि Jalapeño व्यावहारिक रूप से कैसा प्रदर्शन करता है, हमने इसे SemiAnalysis के एक सार्वजनिक बेंचमार्क InferenceX पर परखा, जो AI अनुरोध को सर्व करने की पूरी प्रक्रिया को मापता है. हमने टेस्ट की गई ऑपरेटिंग रेंज में Jalapeño की तुलना व्यावसायिक रूप से उपलब्ध प्रमुख AI सिस्टम्स से की, जिसमें हाई-थ्रूपुट सर्विंग से लेकर अत्यधिक इंटरैक्टिव, कम-लेटेंसी वाला उपयोग तक शामिल है. Jalapeño ने थ्रूपुट, ऊर्जा दक्षता और विलंबता का बेहतर संयोजन प्रदान किया. हालाँकि कभी-कभी प्रदर्शन को प्रति चिप के हिसाब से बताया जाता है, हमारा मानना है कि अधिक उपयोगी मानक पावर की प्रति इकाई प्रदर्शन है.
तीनों सार्वजनिक मॉडलों में, Jalapeño ने परीक्षण की गई ऑपरेटिंग रेंज में प्रति watt प्रदर्शन और विलंबता का बेहतर संयोजन दिया, जिससे यह Pareto अत्याधुनिक पर स्थित हो गया. प्रणालियों की सुसंगत रूप से तुलना करने के लिए, हमने प्रत्येक एक्सेलेरेटर की प्रकाशित चिप पावर रेटिंग का उपयोग करके परिणामों को सामान्यीकृत किया. Jalapeño की रेटिंग 700 watt है, हालांकि परीक्षण किए गए वर्कलोड पर इसकी मापी गई निरंतर पावर 550 watt या उससे कम रही.
Jalapeño ने GPT‑OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T पर मजबूत प्रदर्शन किया. हमारे द्वारा परीक्षण किए गए सबसे बड़े सार्वजनिक मॉडल Kimi पर, इसने तुलना प्रणाली की अपेक्षा प्रति वॉट लगभग 1.5 गुना हाई पीक प्रदर्शन और 3.4 गुना कम एंड-टू-एंड विलंबता दी. हमारी आंतरिक टेस्टिंग में, अत्याधुनिक OpenAI मॉडलों पर Jalapeño की बढ़त और बढ़ गई, जिससे संकेत मिलता है कि वर्कलोड के बड़े और अधिक मांग वाले होने के साथ आर्किटेक्चर अधिक मूल्यवान हो जाता है.
Jalapeño को शुरू से इस सवाल को ध्यान में रखकर डिज़ाइन किया गया था: अगर इसका मुख्य काम आज और भविष्य के लैंग्वेज मॉडल्स को चलाना हो, खासकर इंटरैक्टिव एजेंट्स के लिए, तो हम किस तरह का हार्डवेयर बनाएँगे? Jalapeño की बेहतर परफ़ॉर्मेंस के पीछे चिप, मेमोरी, नेटवर्क, सॉफ़्टवेयर और रैक-स्केल सिस्टम को एक साथ डिज़ाइन करना है, ताकि ये सभी असल लैंग्वेज मॉडल वर्कलोड्स के हिसाब से काम करें. लैंग्वेज मॉडल इन्फ़रेंस कई अलग-अलग फ़ेज़ में चलता है और हर फ़ेज़ में अलग तरह की दिक्कत आती है. प्रिफ़िल में सिस्टम प्रॉम्प्ट को प्रोसेस करता है, इसलिए यहाँ कंप्यूट की ज़रूरत ज़्यादा होती है. वहीं डिकोड में सिस्टम एक-एक टोकन करके जवाब बनाता है, इसलिए यहाँ मेमोरी की बैंडविड्थ ज़्यादा मायने रखती है. जब डेटा को अलग-अलग कोर और चिप्स के बीच भेजना पड़ता है, तो कम्युनिकेशन से भी लेटेंसी बढ़ सकती है. इस दौरान कुछ प्रोसेसिंग यूनिट्स डेटा का इंतज़ार करते हुए खाली रह सकती हैं. अगर कोई सिस्टम एक फ़ेज़ में बहुत अच्छा काम करता है, तो डेटा का इंतज़ार करने या मॉडल की जानकारी को अलग-अलग रिसोर्स के बीच भेजने में उसका यह फ़ायदा कम हो सकता है.
हमने Jalapeño को इस तरह डिज़ाइन किया है कि डेटा को इधर-उधर भेजना और कम्युनिकेशन में होने वाली देरी कम-से-कम हो. इसका मतलब है कि मॉडल की जानकारी, जिसमें जवाब बनाते समय इस्तेमाल होने वाला KV कैश भी शामिल है, सही जगह पर रखी जा सकती है और वहीं बनी रह सकती है. साथ ही, इन्फ़रेंस के हर फ़ेज़ में ज़रूरत के हिसाब से कंप्यूट, मेमोरी और नेटवर्किंग का सही कॉम्बिनेशन इस्तेमाल किया जा सकता है. नेटवर्क इस आर्किटेक्चर का एक अहम हिस्सा है. इसका बड़ा डोमेन पूरे वर्कलोड को एक ही कनेक्टेड सिस्टम के अंदर रखने देता है. इससे डेटा को इधर-उधर भेजने की ज़रूरत कम होती है और पूरी रिक्वेस्ट शुरुआत से अंत तक तेज़ और एफ़िशिएंट बनी रहती है. इससे एक ऐसा संतुलित और फ़्लेक्सिबल एक्सेलेरेटर मिलता है, जो बदलते मॉडल आर्किटेक्चर के साथ काम कर सकता है, प्रिफ़िल और डिकोड दोनों में अच्छा प्रदर्शन कर सकता है और इनके बीच बदलते संतुलन के हिसाब से खुद को ढाल सकता है. एजेंटिक वर्कलोड्स के लिए यह एक अहम फ़ीचर है.
Jalapeño को बनाने में AI ने सीधे तौर पर मदद की. इसकी मदद से टीम ने शुरुआती डिज़ाइन से लेकर टेप-आउट तक का काम नौ महीनों में पूरा किया. इस दौरान अलग-अलग इम्प्लीमेंटेशन आज़माए गए, डिज़ाइन, मेज़रमेंट और वेरिफ़िकेशन के बीच का समय कम किया गया और अलग-अलग मॉडल वर्कलोड्स पर लगातार इटरेशन किया गया. AI ने चिप के अरिथमेटिक सर्किट्स को ऑप्टिमाइज़ करने में भी मदद की. इससे टीम तय समय में चिप में ज़्यादा कंप्यूट परफ़ॉर्मेंस फिट कर पाई.
Jalapeño को इस तरह डिज़ाइन किया गया है कि इंसानों और AI, दोनों के लिए इसे प्रोग्राम करना साफ़ और आसान हो. इंजीनियर्स लोकल टेंसर, साफ़ तौर पर तय कम्युनिकेशन और अनुमान के मुताबिक सिंक्रोनाइज़ेशन का इस्तेमाल करके काम बता सकते हैं. इसके बाद AI यह तय करने में मदद कर सकता है कि उस काम को पूरे सिस्टम में कैसे मैप, प्लेस, शेड्यूल और कोऑर्डिनेट किया जाए. इस साफ़ और अनुमान के मुताबिक काम करने वाले स्ट्रक्चर से AI के लिए पैरेलल प्रोग्रामिंग जैसी मुश्किल समस्या को संभालना आसान हो जाता है.
हर नए मॉडल फ़ैमिली को सपोर्ट करने के लिए अब भी नए कर्नल्स और मॉडल के हिसाब से ऑप्टिमाइज़ेशन की ज़रूरत होती है. Codex और GPT‑Astra का इस्तेमाल करके टीम ने तीन ऐसे ओपन-वेट मॉडल्स को दो महीनों के अंदर अच्छी परफ़ॉर्मेंस तक पहुँचाया, जिन्हें Jalapeño के शुरुआती प्रोडक्शन प्लान में शामिल नहीं किया गया था. इससे आर्किटेक्चर की फ़्लेक्सिबिलिटी और उसे प्रोग्राम करने में AI की मदद से मिलने वाली स्पीड, दोनों का पता चला. GPT‑OSS के कुछ चुने हुए अटेंशन और मिक्सचर-ऑफ़-एक्सपर्ट्स ब्लॉक्स के लिए AI से तैयार किए गए इम्प्लीमेंटेशन, इंसानी एक्सपर्ट्स के बनाए मौजूदा इम्प्लीमेंटेशन से 1.5 से 1.8 गुना तेज़ चले. ये आँकड़े चुने गए ब्लॉक्स पर लागू होते हैं, पूरे मॉडल पर नहीं. फिर भी, ये एक नए और बेहतर डेवलपमेंट लूप की ओर इशारा करते हैं.
AI इन्फ़्रास्ट्रक्चर की अहमियत इस बात से है कि उससे असल दुनिया में कितना काम किया जा सकता है. उतनी ही पावर और हार्डवेयर से ज़्यादा काम करने की क्षमता के कारण, Jalapeño हमें ज़्यादा लोगों की ज़रूरत पूरी करने और बेहतर नतीजे देने की लागत कम करने में मदद कर सकता है. OpenAI के लिए इससे ऑपरेटिंग लेवरेज बेहतर हो सकता है. यानी AI को चलाने की लागत की तुलना में हमारा काम और रेवेन्यू ज़्यादा तेज़ी से बढ़ सकता है. इससे AI को ज़्यादा लोगों तक पहुँचाने और बेहतर मॉडल्स, प्रोडक्ट्स और इन्फ़्रास्ट्रक्चर में लगातार निवेश करने में भी मदद मिल सकती है. तेज़ इन्फ़रेंस से तेज़ इटरेशन और नए यूज़ केस मुमकिन हो सकते हैं.
Jalapeño कम लागत और कम लेटेंसी वाले इन्फ़रेंस के लिए नई संभावनाएँ खोलता है:
- अल्ट्रा-फ़ास्ट मोड में अब उतनी ही एफ़िशिएंसी, जो पहले सिर्फ़ फ़ास्ट मोड में मिलती थी
- फ़ास्ट मोड में अब उतनी ही एफ़िशिएंसी, जो पहले सिर्फ़ बैच्ड मोड में मिलती थी
- बैच्ड मोड में और बेहतर एफ़िशिएंसी
हम साल के अंत तक OpenAI के कंप्यूट इन्फ़्रास्ट्रक्चर में Jalapeño को इस्तेमाल करना शुरू करने की योजना बना रहे हैं. यह कई पीढ़ियों वाली योजना की पहली जेनरेशन है. Gen 2 पर तेज़ी से काम चल रहा है और Gen 3 का डिज़ाइन भी आकार ले रहा है. हर नई जेनरेशन में पिछली जेनरेशन से मिली सीख का इस्तेमाल किया जाएगा और एफ़िशिएंसी और स्पीड, दोनों को और बेहतर किया जाएगा.
AI की बढ़ती माँग को पूरा करने के लिए अभी मौजूद हर सोर्स से ज़्यादा कंप्यूट की ज़रूरत होगी. हम ट्रेनिंग और इन्फ़रेंस, दोनों तरह के कामों के लिए NVIDIA और दूसरे पार्टनर्स के एक्सेलेरेटर्स का बड़े पैमाने पर इस्तेमाल जारी रखेंगे. हमारा मिशन यह ध्यान रखना है कि आर्टिफ़िशियल जेनरल इंटेलिजेंस से पूरी इंसानियत को फ़ायदा हो.
Jalapeño को इस्तेमाल के लिए तैयार करते हुए हम प्रोडक्शन क्वालिफ़िकेशन जारी रख रहे हैं, सॉफ़्टवेयर को और बेहतर बना रहे हैं, बड़े पैमाने पर Jalapeño को चलाने की तैयारी कर रहे हैं और ज़्यादा मॉडल्स पर इसकी परफ़ॉर्मेंस चेक कर रहे हैं. अब तक के नतीजे दिखाते हैं कि जब पूरे सिस्टम को एक साथ ध्यान में रखकर डिज़ाइन किया जाए, तो क्या हासिल किया जा सकता है: ज़्यादा तेज़ी से जवाब देने वाला, ज़्यादा सक्षम और ज़्यादा एजेंटिक AI, जिसे ज़्यादा लोगों तक बेहतर तरीके़ से पहुँचाया जा सके.
प्रति kW थ्रूपुट अत्याधुनिक
InferenceX · GPT‑OSS‑120B · नाममात्र 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB200 1,200 W
पीक और समान थ्रूपुट
InferenceX · GPT‑OSS‑120B · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB200 1,200 W
पीक मिक्स्ड TPS / किलोवाट ज़्यादा
≈1.9×
85,448 vs. 44,960 मिक्स्ड / किलोवाट
कम एंड-टू-एंड लेटेंसी
≈1.7×
1.03 सेकंड vs. 1.80 सेकंड
कम मिनिमम TBT
≈2.7×
0.69 vs. 1.87 मिलीसेकंड (1,459 vs. 535 टोकन्स/सेकंड/यूज़र)
पहले वाली TBT पर ज़्यादा थ्रूपुट
≈53.7×
22,935 vs. 427 मिक्स्ड / किलोवाट (535.28 टोकन्स/सेकंड/यूज़र पर)
प्रति किलोवाट थ्रूपुट में सबसे आगे
InferenceX · DeepSeek R1 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W
पीक और समान थ्रूपुट
InferenceX · DeepSeek R1 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W
ज़्यादा पीक मिक्स्ड TPS / किलोवाट
≈1.7×
19,641 vs. 11,781 मिक्स्ड / किलोवाट
कम एंड-टू-एंड लेटेंसी
≈3.6×
1.65 s vs. 5.99 s
कम मिनिमम TBT
≈4.1×
1.43 vs. 5.90 मिलीसेकंड (700 vs. 169 टोकन्स/सेकंड/यूज़र)
पहले वाली TBT पर ज़्यादा थ्रूपुट
≈104.3×
12,258 vs. 118 मिक्स्ड / किलोवाट (169.41 टोकन्स/सेकंड/यूज़र पर)
प्रति किलोवाट थ्रूपुट में सबसे आगे
InferenceX · Kimi K2.5 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W
पीक और समान थ्रूपुट
InferenceX · Kimi K2.5 MXFP4 · नॉमिनल 8k/1k · STP · पैकेज TDP: Jalapeño 700 W; GB300 1,400 W
ज़्यादा पीक मिक्स्ड TPS / किलोवाट
≈1.5×
18,195 vs. 11,862 मिश्रित / kW
कम एंड-टू-एंड लेटेंसी
≈3.4×
1.56 सेकंड vs. 5.31 सेकंड
कम मिनिमम TBT
≈3.8×
1.44 vs. 5.48 मिलीसेकंड (694 vs. 182 टोकन्स/सेकंड/यूज़र)
पहले वाली TBT पर ज़्यादा थ्रूपुट
≈56.1×
6,744 vs. 120 मिश्रित / kW (182.46 tok/s/user पर)


