मुख्य मजकूराकडे जा
OpenAI

२५ ऑगस्ट, २०२६

इंजिनिअरिंगकंपनी

Jalapeñoचे प्रारंभिक निकाल AI इन्फरन्समध्ये उद्योगात आघाडीची गती आणि कार्यक्षमता दर्शवतात

लोड होत आहे...
टील रंगाच्या सर्किट बोर्डवर बसवलेल्या Jalapeño इन्फरन्स चिपचा जवळून फोटो.

Jalapeño, OpenAI ची पहिली कस्टम इन्फरन्स चिप, जाहीर केल्यापासून आम्ही या चिपची आणि तिच्याभोवती तयार केलेल्या प्रणालीची चाचणी करत आहोत. निकालांवरून कार्यक्षमतेत लक्षणीय प्रगती दिसून येते: Jalapeño ऊर्जेच्या प्रत्येक युनिटमागे अधिक AI कार्य हाताळू शकते, तसेच प्रतिसाद अधिक जलद परत करू शकते. एका आर्किटेक्चरसह Jalapeño उच्च थ्रुपुट आणि कमी विलंबता दोन्ही देते, तर विद्यमान हार्डवेअर प्रणालींना अनेकदा या दोघांमध्ये तडजोड करावी लागते.

ग्राहकांसाठी याचा अर्थ जलद प्रतिसाद, अधिक तत्पर एजंट आणि मागणी वाढत असताना अधिक विश्वासार्ह प्रवेश होय. आमचे ध्येय म्हणजे आर्टिफिशियल जनरल इंटेलिजन्सचा संपूर्ण मानवजातीला फायदा होईल याची खात्री करणे. या सुधारणांमुळे अधिकाधिक सक्षम होत जाणारी AI अधिक परवडणारी आणि अधिक व्यापकपणे उपलब्ध होण्यास मदत होईल.

OpenAI मॉडेल्सनी Jalapeño च्या विकासालाही गती दिली. आधीच्या पिढ्यांनी संघाला चिपचे डिझाइन आणि कार्यान्वित करण्यात मदत केली, तर आमची नवीनतम मॉडेल्स ती कशी ऑप्टिमाइझ आणि प्रोग्राम केली जाते याला गती देत आहेत. Jalapeño ची कामगिरी GPT‑OSS 120B, DeepSeek R1 आणि Kimi K2.5 1T मध्ये दिसून येते, ज्यातून आर्किटेक्चर OpenAI च्या आत आणि बाहेर विकसित केलेल्या मॉडेल्समध्ये कार्य करते हे स्पष्ट होते. या तिन्हींमध्ये, Jalapeño ने पीक थ्रुपुटवर प्रति वॅट 1.5 ते 1.9 पट अधिक AI काम आणि तुलनात्मक प्रणालींपेक्षा 1.7 ते 3.6 पट कमी एंड-टू-एंड लेटन्सी दिली. अत्यंत परस्परसंवादी कार्यभारांसाठी, याने 2.1 ते 4.1 पट उच्च कार्यक्षमता प्रदान केली.

Jalapeño हे अधिक व्यापक फुल-स्टॅक फायद्याचेही द्योतक आहे. प्रत्यक्ष वर्कलोडमधून आम्हाला जे शिकायला मिळते त्याचा वापर करून स्टॅकच्या प्रत्येक स्तरात सुधारणा करण्यासाठी OpenAI मॉडेल, उत्पादने, सर्व्हिंग सॉफ्टवेअर, चिप्स, मेमरी, नेटवर्किंग आणि सिस्टीम एकत्रितपणे डिझाइन करू शकते. Jalapeño हे मोजमाप केलेल्या निकालांसह कार्यरत असलेले प्रथम पक्षीय सिलिकॉन आहे, आणि हे अनेक पिढ्यांच्या प्लॅटफॉर्मची सुरुवात आहे. येत्या काही महिन्यांत, आमच्या ग्राहकांसाठी अधिक जलद, अधिक सक्षम आणि अधिक कार्यक्षम उत्पादने वितरित करण्यासाठी आम्ही Jalapeño ची गती वाढवू.

आम्ही Jalapeño चे कार्यप्रदर्शन कसे मोजले

आम्ही समतुल्य वापरकर्ता अनुभवावर कामगिरीचे मूल्यमापन करतो, ज्यामध्ये ग्राहक आणि परस्परसंवादी एजंटना आवश्यक असलेली विलंबता पूर्ण करताना प्रत्येक प्रणाली ऊर्जेच्या प्रति एकक किती उपयुक्त AI कार्य पूर्ण करू शकते हे मोजले जाते. हे विशेषतः एजंट्ससाठी महत्त्वाचे आहे, ज्यांना क्रमाने अनेक पायऱ्या पूर्ण कराव्या लागतात, त्यामुळे विलंब संपूर्ण कार्यभर वाढू शकतो.

Jalapeño प्रत्यक्ष वापरात कसे कार्य करते हे समजून घेण्यासाठी, आम्ही त्याची चाचणी InferenceX वर केली, जो SemiAnalysis कडील एक सार्वजनिक बेंचमार्क आहे आणि AI विनंती सर्व्ह करण्याची संपूर्ण प्रक्रिया मोजतो. उच्च-थ्रुपुट सर्व्हिंगपासून अत्यंत परस्परसंवादी, कमी-लेटन्सी वापरापर्यंतच्या चाचणी केलेल्या ऑपरेटिंग श्रेणीमध्ये आम्ही Jalapeño ची आघाडीच्या व्यावसायिकरित्या उपलब्ध AI प्रणालींशी तुलना केली. Jalapeño ने थ्रुपुट, पॉवर कार्यक्षमता आणि लेटन्सी यांचे अधिक चांगले संयोजन दिले. कामगिरी कधी कधी प्रति चिप नोंदवली जात असली, तरी आमच्या मते अधिक उपयुक्त मानक म्हणजे विद्युत शक्तीच्या प्रति एकक कामगिरी आहे.

Jalapeño ने मागील सर्वोत्तम TBT मध्ये आघाडी वाढवली

Jalapeño प्रति वापरकर्ता अधिक टोकन प्रदान करते

Jalapeño प्रति किलोवॅट अधिक थ्रुपुट प्रदान करते

सर्व तीन सार्वजनिक मॉडेल्समध्ये, Jalapeño ने तपासलेल्या कार्यरत श्रेणीमध्ये प्रति वॅट कामगिरी आणि विलंब यांचे अधिक चांगले संयोजन दिले, ज्यामुळे ते पॅरेटो अत्याधुनिक सीमारेषेवर आले. प्रणालींची सुसंगतपणे तुलना करण्यासाठी, आम्ही प्रत्येक अ‍ॅक्सेलरेटरच्या प्रकाशित चिप पॉवर रेटिंगचा वापर करून निकाल सामान्यीकृत केले. Jalapeño चे मूल्यांकन 700 वॅट आहे, जरी चाचणी केलेल्या कामाच्या भारावर त्याची मोजलेली सातत्यपूर्ण पॉवर 550 वॅट किंवा त्यापेक्षा कमी राहिली.

Jalapeño ने GPT‑OSS 120B, DeepSeek R1 670B आणि Kimi K2.5 1T मध्ये दमदार कामगिरी केली. आम्ही चाचणी केलेल्या सर्वात मोठ्या सार्वजनिक मॉडेल Kimi वर, त्याने तुलनात्मक प्रणालीपेक्षा प्रति वॅट अंदाजे 1.5 पट उच्च सर्वोच्च कामगिरी आणि एंड-टू-एंड लेटन्सी 3.4 पट कमी दिली. आमच्या अंतर्गत चाचणीमध्ये, अत्याधुनिक OpenAI मॉडेल्सवर Jalapeño चा फायदा आणखी वाढला, यावरून असे सूचित होते की वर्कलोड अधिक मोठे आणि मागणीचे होत जातात तसतसे हे आर्किटेक्चर अधिक मौल्यवान बनते.

एकाच चिपमध्ये वेग आणि कार्यक्षमतेसाठी आर्किटेक्चरची रचना

Jalapeño ची सुरुवातीपासून रचना एका प्रश्नापासून करण्यात आली: जर त्याचे प्राथमिक काम आधुनिक आणि भविष्यातील भाषा मॉडेल, विशेषतः इंटरॅक्टिव्ह एजंट्सना सेवा देणे असेल, तर तुम्ही कोणते हार्डवेअर तयार करू? वास्तविक भाषा-मॉडेल वर्कलोड्सभोवती चिप, मेमरी, नेटवर्क, सॉफ्टवेअर आणि रॅक-स्केल प्रणाली यांची एकत्रित रचना केल्यामुळे Jalapeño ला लाभ होतो. भाषा-मॉडेल इन्फरन्स वेगवेगळ्या अडथळ्यांसह अनेक वेगळ्या टप्प्यांतून जाते. प्रणाली प्रॉम्प्टवर प्रक्रिया करते तेव्हा प्रीफिल हा संगणन-गहन टप्पा असतो, तर प्रणाली प्रतिसाद टोकननुसार तयार करते तेव्हा डीकोड हा मेमरी बँडविड्थमुळे अधिक मर्यादित असतो. डेटा कोर आणि चिप्स दरम्यान हलवावा लागल्यास संप्रेषणामुळे विलंब वाढू शकतो, ज्यामुळे काही प्रक्रिया युनिट्स प्रतीक्षा करत असताना निष्क्रिय राहतात. एखाद्या टप्प्यात उत्कृष्ट कामगिरी करणारी प्रणाली डेटा येण्याची वाट पाहताना किंवा वेगवेगळ्या संसाधनांदरम्यान मॉडेलची स्थिती हलवताना तो फायदा गमावू शकते.

डेटाची हालचाल आणि संप्रेषणातील विलंब कमीत कमी करण्यासाठी आम्ही Jalapeño ची रचना केली. याचा अर्थ असा की, प्रतिसाद तयार करताना वापरला जाणारा KV कॅशेसह मॉडेल स्टेट स्पष्टपणे ठेवता येतो आणि स्थानिक राखता येतो. प्रणाली प्रत्येक इन्फरन्स टप्प्यासाठी संगणकीय संसाधने, मेमरी आणि नेटवर्किंग यांचे योग्य संयोजन सक्रिय करते. नेटवर्क हे आर्किटेक्चरचा अविभाज्य भाग आहे. त्याचे विस्तृत डोमेन संपूर्ण कार्यभार एका जोडलेल्या प्रणालीमध्येच ठेवण्यास अनुमती देते, ज्यामुळे डेटाचे स्थानांतरण कमी होते आणि संपूर्ण विनंती सुरुवातीपासून शेवटपर्यंत जलद व कार्यक्षम राहण्यास मदत होते. परिणामी, एक संतुलित आणि परस्परविनिमययोग्य accelerator मिळतो, जो बदलत्या मॉडेल आर्किटेक्चर्सना समर्थन देऊ शकतो, प्रीफिल आणि डिकोड या दोन्हींमध्ये उत्कृष्ट कामगिरी करू शकतो आणि त्यांच्यातील संतुलन बदलत असताना जुळवून घेऊ शकतो. हे एजंटिक वर्कलोड्सचे एक परिभाषित वैशिष्ट्य आहे.

आम्ही चिप डिझाइन करण्यासाठी AI वापरले, आणि चिप अशी डिझाइन केली की AI तिचे प्रोग्रामिंग करू शकेल

Jalapeño च्या विकासात AI ने थेट भूमिका बजावली. अंमलबजावणीच्या पर्यायांचा शोध घेऊन, डिझाइन, मापन आणि पडताळणीच्या चक्रांना कमी करून, आणि मॉडेल वर्कलोड्सवर सातत्याने पुनरावृत्ती करत संघाला सुरुवातीच्या डिझाइनपासून टेपआउटपर्यंत नऊ महिन्यांत पोहोचता आले. AI ने चिपच्या अंकगणितीय सर्किट्सचे ऑप्टिमायझेशन करण्यातही मदत केली, ज्यामुळे संघाला नियोजित वेळापत्रकानुसार चिपमध्ये अधिक संगणकीय कार्यक्षमता सामावता आली.

Jalapeño ची रचना मानव आणि AI दोघांसाठीही स्पष्ट, पूर्वानुमेय प्रोग्रामिंग लक्ष्य म्हणून करण्यात आली होती. अभियंते स्थानिक टेन्सर्स, स्पष्ट संप्रेषण आणि अंदाज करता येणारे समक्रमण यांद्वारे कामाचे वर्णन करू शकतात. त्यानंतर AI संपूर्ण प्रणालीमध्ये ते काम कसे मॅप, स्थानित, शेड्यूल आणि समन्वयित केले जाते हे ऑप्टिमाइझ करू शकते. ती स्पष्ट, पूर्वानुमेय रचना AI ला समांतर प्रोग्रामिंगची पारंपरिकरीत्या कठीण मानली जाणारी समस्या हाताळण्यासाठी एक व्यवहार्य मार्ग देते.

प्रत्येक नवीन मॉडेल कुटुंबाला समर्थन देण्यासाठी अजून नवीन kernels आणि मॉडेल-विशिष्ट ऑप्टिमायझेशन्स आवश्यक असतात. Codex चा GPT‑Astra सोबत वापर करून, संघाने Jalapeño च्या मूळ उत्पादन योजनेचा भाग नसलेल्या तीन ओपन वेट मॉडेल्सना दोन महिन्यांत उच्च कार्यक्षमतेपर्यंत नेले. यातून आर्किटेक्चरची लवचिकता आणि AI च्या मदतीने तुम्ही ते किती वेगाने प्रोग्राम करू शकतो, हे दोन्ही स्पष्ट झाले. निवडक GPT‑OSS attention आणि mixture-of-experts ब्लॉक्ससाठी, AI-निर्मित अंमलबजावण्या विद्यमान मानवी तज्ज्ञांनी लिहिलेल्या अंमलबजावण्यांपेक्षा 1.5 ते 1.8 पट वेगाने चालल्या. ते आकडे निवडलेल्या ब्लॉक्सना लागू होतात, संपूर्ण मॉडेलला नाहीत, परंतु ते एका शक्तिशाली नवीन विकास चक्राकडे निर्देश करतात.

कार्यक्षम आणि Ultra वेगवान अनुमानासाठी पुढील वाटचाल

AI पायाभूत सुविधा मौल्यवान आहे कारण ती वास्तविक जगात उपयुक्त काम करण्यास सक्षम करते. त्याच ऊर्जा आणि हार्डवेअरमधून अधिक उपयुक्त काम करून, Jalapeño आम्हाला अधिक मागणी पूर्ण करण्यास आणि यशस्वी निकाल देण्याचा खर्च कमी करण्यास मदत करू शकते. OpenAI साठी, उपयुक्त काम आणि महसूल सेवा देण्याच्या खर्चापेक्षा अधिक वेगाने वाढू देऊन, परिचालन लाभक्षमता सुधारू शकते. यामुळे व्यापक स्वीकार आणि अधिक चांगल्या मॉडेल्स, उत्पादनं आणि पायाभूत सुविधांमध्ये सातत्याने गुंतवणुकीला आधार मिळू शकतो. अधिक जलद अनुमानामुळे अधिक जलद पुनरावृत्ती आणि नवीन वापरप्रकरणे सक्षम होऊ शकतात.

Jalapeño कार्यक्षम, कमी-लेटन्सी इन्फरन्ससाठी काय शक्य आहे याचा विस्तार करते:

  • पूर्वी फक्त फास्ट मोडमध्ये उपलब्ध असलेल्या कार्यक्षमतेसह Ultra फास्ट मोडमधील अनुमान
  • पूर्वी केवळ बॅच्ड मोडमध्ये उपलब्ध असलेल्या कार्यक्षमतेसह फास्ट मोडमधील अनुमान प्रक्रिया
  • बॅच्ड-मोड इन्फरन्ससाठी उच्च कार्यक्षमता

आम्ही वर्षाच्या अखेरीस OpenAI च्या संगणकीय पायाभूत सुविधांमध्ये Jalapeño तैनात करण्यास सुरुवात करण्याची योजना आखत आहोत. ही अनेक पिढ्यांच्या रोडमॅपमधील पहिली पिढी आहे: Gen 2 चा विकास प्रगत टप्प्यात आहे, आणि Gen 3 आकार घेत आहे. प्रत्येक पिढी तुम्ही जे शिकतो त्यावर उभारणी करेल आणि कार्यक्षमता व गती या दोन्हींमध्ये आणखी प्रगती करेल.

AI साठी वाढती मागणी पूर्ण करण्यासाठी प्रत्येक उपलब्ध स्रोताकडून अधिक संगणन क्षमता आवश्यक असेल. आम्ही प्रशिक्षण आणि इन्फरन्स या दोन्ही कार्यभारांसाठी NVIDIA आणि इतर भागीदारांकडील अ‍ॅक्सेलरेटर व्यापकपणे तैनात करणे सुरू ठेवू. आमचे ध्येय म्हणजे आर्टिफिशियल जनरल इंटेलिजन्सचा संपूर्ण मानवजातीला फायदा होईल याची खात्री करणे.

तैनातीची तयारी करत असताना, आम्ही उत्पादन पात्रता प्रक्रिया सुरू ठेवत आहोत, सॉफ्टवेअर अधिक परिपक्व करत आहोत, Jalapeño मोठ्या प्रमाणावर चालवण्याची तयारी करत आहोत आणि अधिक मॉडेल्सवरील कामगिरीची पडताळणी करत आहोत. आतापर्यंतचे परिणाम दाखवतात की जेव्हा आम्ही संपूर्ण प्रणाली एकत्र डिझाइन करतो, तेव्हा काय शक्य होते: अधिक प्रतिसादक्षम, सक्षम आणि एजंटिक AI अधिक लोकांपर्यंत अधिक कार्यक्षमतेने पोहोचवता येते.

परिशिष्ट

Jalapeño हे GPT‑OSS 120B वरील Pareto अत्याधुनिक आहे

kW-प्रति थ्रुपुट अत्याधुनिक

InferenceX · GPT‑OSS‑120B · नाममात्र 8k/1k · STP · पॅकेज TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño GPT‑OSS ऑपरेटिंग पॉइंट्समध्ये आघाडीवर आहे

कमाल आणि जुळवलेला थ्रुपुट

InferenceX · GPT‑OSS‑120B · नाममात्र आठk/एकk · STP · पॅकेज TDP: Jalapeño 700 W; GB200 1,200 W

उच्च पीक मिश्रित TPS / kW

≈1.9×

85,448 विरुद्ध 44,960 मिश्रित / kW

एंड-टू-एंड विलंबता कमी करा

≈1.7×

1.03 सेकंद विरुद्ध 1.80 सेकंद

किमान TBT कमी करा

≈2.7×

0.69 vs. 1.87 ms (1,459 vs. 535 tok/s/user)

पूर्वीच्या TBT वर अधिक थ्रुपुट

≈53.7×

22,935 विरुद्ध 427 मिश्रित / kW (535,28 tok/s/user वर)

Jalapeño हे DeepSeek R1 670B येथे Pareto अत्याधुनिक आहे

kW-प्रति थ्रुपुट अत्याधुनिक

InferenceX · DeepSeek R1 MXFP4 · नाममात्र 8k/1k · STP · पॅकेज TDP: Jalapeño 700 W; GB300 1,400 W

DeepSeek R1 ऑपरेटिंग पॉइंट्समध्ये Jalapeño आघाडीवर आहे

शिखर आणि जुळवलेला थ्रुपुट

InferenceX · DeepSeek R1 MXFP4 · नाममात्र 8k/1k · STP · पॅकेज TDP: Jalapeño 700 W; GB300 1,400 W

उच्च पीक मिश्रित TPS / kW

≈1.7×

19,641 विरुद्ध 11,781 मिश्रित / kW

कमी एंड-टू-एंड विलंबता

≈3.6×

1.65 से वि. 5.99 से

किमान TBT कमी करा

≈4.1×

1.43 vs. 5.90 ms (700 vs. 169 tok/s/user)

पूर्वीच्या TBT वर अधिक थ्रुपुट

≈104.3×

12,258 विरुद्ध 118 मिश्रित / kW (169.41 tok/s/user वर)

Jalapeño हा Kimi K2.5 1T वरील Pareto अत्याधुनिक आहे

थ्रुपुट-per-kW अत्याधुनिक

InferenceX · Kimi K2.5 MXFP4 · नाममात्र 8k/1k · STP · पॅकेज TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño Kimi K2.5 च्या ऑपरेटिंग पॉइंट्सवर आघाडी आहे

पीक आणि जुळवलेला थ्रुपुट

InferenceX · Kimi K2.5 MXFP4 · नाममात्र 8k/1k · STP · पॅकेज TDP: Jalapeño 700 W; GB300 1,400 W

उच्च पीक मिश्रित TPS / kW

≈1.5×

18,195 विरुद्ध 11,862 मिश्रित / kW

कमी एंड-टू-एंड विलंबता

≈3.4×

1.56 s vs. 5.31 s

किमान TBT

≈3.8×

1.44 vs. 5.48 ms (694 vs. 182 tok/s/user)

पूर्वीच्या TBT वर अधिक थ्रुपुट

≈56.1×

6,744 vs. 120 मिश्रित / kW (182.46 tok/s/user वर)

लेखक

OpenAI