
OpenAIની પ્રથમ કસ્ટમ અનુમાન ચિપ, Jalapeño જાહેર કરાયા પછીથી અમે ચિપ અને તેની આસપાસ બનાવેલી સિસ્ટમનું પરીક્ષણ કરી રહ્યા છીએ. પરિણામો નોંધપાત્ર કાર્યપ્રદર્શન સુધારો દર્શાવે છે: Jalapeño પાવરના પ્રતિ એકમ દીઠ વધુ AI કાર્યભાર સંભાળી શકે છે અને સાથે સાથે પ્રતિભાવ વધુ ઝડપથી પરત આપી શકે છે. Jalapeño એક જ આર્કિટેક્ચર સાથે વધુ હાઇ થ્રૂપુટ અને ઓછી લેટન્સી બંને આપે છે, જ્યારે હાલની હાર્ડવેર સિસ્ટમ્સને ઘણીવાર બંને વચ્ચે સમાધાન કરવું પડે છે.
ગ્રાહકો માટે, માંગ વધતી જાય ત્યારે ઝડપી પ્રતિભાવો, વધુ પ્રતિભાવશીલ એજન્ટો અને વધુ વિશ્વસનીય ઍક્સેસ મળે છે. અમારું મિશન એ સુનિશ્ચિત કરવાનું છે કે આર્ટિફિશિયલ જનરલ ઇન્ટેલિજન્સ સમગ્ર માનવજાતને લાભ આપે. આ લાભો વધુને વધુ સક્ષમ બનતું AI વધુ પરવડે તેવું અને વધુ વ્યાપક રીતે ઉપલબ્ધ બનાવવામાં મદદ કરશે.
OpenAI મોડલ્સે Jalapeñoના વિકાસને પણ ઝડપી બનાવ્યો. અગાઉની પેઢીઓએ ટીમને ચિપ ડિઝાઇન અને કાર્યરત કરવામાં મદદ કરી, જ્યારે અમારા નવીનતમ મોડલ્સ તેને કેવી રીતે ઑપ્ટિમાઇઝ અને પ્રોગ્રામ કરીએ છીએ તે ઝડપી બનાવી રહ્યા છે. Jalapeñoનું કાર્યપ્રદર્શન GPT‑OSS 120B, DeepSeek R1 અને Kimi K2.5 1T સુધી વિસ્તરે છે, જે દર્શાવે છે કે આર્કિટેક્ચર OpenAIની અંદર અને બહાર વિકસાવવામાં આવેલા મોડલ્સમાં કાર્ય કરે છે. ત્રણેયમાં, Jalapeñoએ મહત્તમ થ્રૂપુટ પર પ્રતિ વૉટ 1.5 થી 1.9 ગણું વધુ AI કાર્ય અને તુલનાત્મક સિસ્ટમ્સ કરતાં 1.7 થી 3.6 ગણી ઓછી એન્ડ-ટુ-એન્ડ લેટન્સી આપી. અત્યંત ઇન્ટરેક્ટિવ કાર્યભાર માટે, તેણે 2.1 થી 4.1 ગણું ઉચ્ચ કાર્યપ્રદર્શન આપ્યું.
Jalapeño વધુ વ્યાપક ફુલ-સ્ટૅક લાભનો પણ પુરાવો છે. OpenAI મોડલ્સ, ઉત્પાદનો, સર્વિંગ સૉફ્ટવેર, ચિપ્સ, મેમરી, નેટવર્કિંગ અને સિસ્ટમ્સને એકસાથે ડિઝાઇન કરી શકે છે અને વાસ્તવિક વર્કલોડ્સમાંથી શીખેલી માહિતીનો ઉપયોગ સ્ટૅકના દરેક સ્તરને સુધારવા માટે કરે છે. Jalapeño માપેલા પરિણામો સાથે કાર્યરત પ્રથમ-પક્ષ સિલિકોન છે અને તે બહુ-પેઢીયુક્ત પ્લેટફોર્મની શરૂઆત છે. આગામી મહિનાઓમાં, અમે અમારા ગ્રાહકો માટે વધુ ઝડપી, વધુ સક્ષમ અને વધુ કાર્યક્ષમ ઉત્પાદનો પ્રદાન કરવા માટે Jalapeñoને વેગ આપીશું.
અમે સમાન વપરાશકર્તા અનુભવ પરસ કાર્યપ્રદર્શનનું મૂલ્યાંકન કરીએ છીએ, જેમાં દરેક સિસ્ટમ ગ્રાહકો અને ઇન્ટરેક્ટિવ એજન્ટ્સને જરૂરી લેટન્સી પૂરી કરતી વખતે પાવરના દરેક એકમ દીઠ કેટલું ઉપયોગી AI કાર્ય પૂર્ણ કરી શકે છે તે માપવામાં આવે છે. આ ખાસ કરીને એજન્ટ્સ માટે મહત્વનું છે, જેમને ક્રમમાં ઘણા પગલાં પૂર્ણ કરવા પડે છે, તેથી વિલંબો સમગ્ર કાર્ય દરમિયાન એકઠા થઈને વધી શકે છે.
Jalapeño વાસ્તવિક ઉપયોગમાં કેવી રીતે કામગીરી કરે છે તે સમજવા માટે, અમે તેને InferenceX પર પરીક્ષણ કર્યું, જે SemiAnalysis તરફથી એક સાર્વજનિક બેન્ચમાર્ક છે અને AI વિનંતીને સર્વ કરવાની સંપૂર્ણ પ્રક્રિયાને માપે છે. અમે પરીક્ષણ કરાયેલી કાર્યકારી શ્રેણીમાં, હાઇ-થ્રૂપુટ સર્વિંગથી લઈને અત્યંત ઇન્ટરેક્ટિવ, ઓછી લેટન્સી વાળા ઉપયોગ સુધી, Jalapeñoની તુલના અગ્રણી વ્યાવસાયિક રીતે ઉપલબ્ધ AI સિસ્ટમ્સ સાથે કરી. Jalapeñoએ થ્રૂપુટ, પાવર કાર્યક્ષમતા અને લેટન્સીનું વધુ સારું સંયોજન પ્રદાન કર્યું. ભલે કાર્યપ્રદર્શન કેટલીક વખત ચિપ દીઠ જણાવવામાં આવે છે, તો પણ અમે માનીએ છીએ કે પાવરના એકમ દીઠ કાર્યપ્રદર્શન વધુ ઉપયોગી ધોરણ છે.
ત્રણ જાહેર મોડલ્સમાં, Jalapeñoએ પરીક્ષણ કરાયેલી ઓપરેટિંગ રેન્જમાં પ્રતિ વૉટ કાર્યપ્રદર્શન અને લેટન્સીનું વધુ સારું સંયોજન આપ્યું, જે તેને પેરેટો અગ્રેસર સ્થાને મૂકે છે. સિસ્ટમોની સુસંગત રીતે તુલના કરવા માટે, અમે દરેક એક્સેલરેટરની પ્રકાશિત ચિપ પાવર રેટિંગનો ઉપયોગ કરીને પરિણામોને સામાન્ય કર્યા. Jalapeño 700 વૉટ પર રેટેડ છે, જોકે પરીક્ષણ કરાયેલા વર્કલોડ્સ પર તેની માપવામાં આવેલી સતત પાવર 550 વૉટ કે તેથી ઓછી રહી હતી.
Jalapeñoએ GPT‑OSS 120B, DeepSeek R1 670B અને કિમી K2.5 1Tમાં મજબૂત કામગીરી કરી. અમે પરીક્ષણ કરેલા સૌથી મોટા જાહેર મોડલ કિમી પર, તેણે તુલનાત્મક સિસ્ટમ કરતાં પ્રતિ વૉટ આશરે 1.5 ગણી વધુ પીક કાર્યપ્રદર્શન અને 3.4 ગણી ઓછી એન્ડ-ટુ-એન્ડ લેટન્સી આપી. અમારા આંતરિક પરીક્ષણમાં, અત્યાધુનિક OpenAI મોડલ્સ પર Jalapeñoનો લાભ વધુ વધ્યો, જે સૂચવે છે કે વર્કલોડ્સ વધુ મોટા અને વધુ માંગવાળા બનતાં આર્કિટેક્ચર વધુ મૂલ્યવાન બને છે.
Jalapeñoને શરૂઆતથી જ આ પ્રશ્ન પૂછીને ડિઝાઇન કરાયું હતું: જો તેનું મુખ્ય કાર્ય આધુનિક અને ભવિષ્યના ભાષા મોડલ્સને, ખાસ કરીને ઇન્ટરેક્ટિવ એજન્ટ્સને, સેવા આપવાનું હોય, તો આપણે કયું હાર્ડવેર બનાવીએ? Jalapeñoના લાભો વાસ્તવિક ભાષા-મોડલ વર્કલોડ્સને કેન્દ્રમાં રાખીને ચિપ, મેમરી, નેટવર્ક, સૉફ્ટવેર અને રેક-સ્કેલ સિસ્ટમને એકસાથે ડિઝાઇન કરવાથી મળે છે. ભાષા-મોડલ અનુમાન વિવિધ અડચણો ધરાવતા અનેક અલગ તબક્કાઓમાંથી પસાર થાય છે. પ્રીફિલ, જ્યારે સિસ્ટમ પ્રોમ્પ્ટ પર પ્રક્રિયા કરે છે, ત્યારે કમ્પ્યુટ-સઘન હોય છે, જ્યારે ડિકોડ, સિસ્ટમ દ્વારા પ્રતિભાવ ટોકન-દર-ટોકન જનરેટ કરવામાં આવે, ત્યારે મેમરી બેન્ડવિડ્થ દ્વારા વધુ મર્યાદિત હોય છે. જ્યારે ડેટાને કોર અને ચિપ્સ વચ્ચે ખસેડવો જરૂરી હોચ હોય છે, ત્યારે સંચાર લેટન્સી પણ ઉમેરી શકે છે, જેના કારણે કેટલીક પ્રોસેસિંગ યુનિટ્સ રાહ જોતી વખતે નિષ્ક્રિય રહે છે. કોઈ એક તબક્કામાં શ્રેષ્ઠ કામગીરી કરતી સિસ્ટમ ડેટાની રાહ જોતી વખતે અથવા અલગ-અલગ સંસાધનો વચ્ચે મોડલની સ્થિતિ ખસેડતી વખતે તે લાભ ગુમાવી શકે છે.
અમે Jalapeñoને ડેટાની અવરજવર અને સંચાર વિલંબને ન્યૂનતમ કરવા માટે ડિઝાઇન કર્યું છે. તેનો અર્થ એવો થાય કે પ્રતિભાવ જનરેટ કરતી વખતે વપરાતી KV કૅશ સહિત, મોડલની સ્થિતિને સ્પષ્ટ રીતે નિર્ધારિત સ્થાને મૂકી અને સ્થાનિક રાખી શકાય છે, જ્યારે સિસ્ટમ દરેક અનુમાન તબક્કા માટે કમ્પ્યુટ, મેમરી અને નેટવર્કિંગના યોગ્ય સંયોજનને સક્રિય કરે છે. નેટવર્ક આર્કિટેક્ચરનો અભિન્ન ભાગ છે. તેનું વિશાળ ડોમેન સમગ્ર વર્કલોડને એક જ કનેક્ટેડ સિસ્ટમમાં રહેવાની મંજૂરી આપે છે, જે ડેટાની હિલચાલને ઘટાડે છે અને સંપૂર્ણ વિનંતીને શરૂઆતથી અંત સુધી ઝડપી અને કાર્યક્ષમ રાખવામાં મદદ કરે છે. પરિણામે એક સંતુલિત અને વિનિમયક્ષમ એક્સિલરેટર મળે છે, જે બદલાતા મોડલ આર્કિટેક્ચર્સને સપોર્ટ કરી શકે છે, પ્રીફિલ અને ડિકોડ બંનેમાં શ્રેષ્ઠ કાર્ય કરે છે અને તેમની વચ્ચેનું સંતુલન બદલાય તેમ અનુકૂલિત થઈ શકે છે—જે એજન્ટિક વર્કલોડ્સની એક નિર્ધારક વિશેષતા છે.
AIએ Jalapeñoના વિકાસમાં સીધી ભૂમિકા ભજવી, અમલીકરણોનું અન્વેષણ કરીને, ડિઝાઇન, માપન અને ચકાસણી ચક્રોને ટૂંકાવીને અને મોડલ વર્કલોડ્સ પર સતત પુનરાવર્તન કરીને ટીમને પ્રારંભિક ડિઝાઇનથી ટેપ-આઉટ સુધી નવ મહિનામાં પહોંચવામાં સક્ષમ બનાવી. AIએ ચિપના અંકગણિત સર્કિટ્સને ઑપ્ટિમાઇઝ કરવામાં પણ મદદ કરી, જેના કારણે ટીમ નિર્ધારિત સમયપત્રક મુજબ ચિપમાં વધુ કમ્પ્યુટ કાર્યપ્રદર્શન સમાવી શકી.
Jalapeño માનવો અને AI બંને માટે સ્પષ્ટ અને અનુમાનપાત્ર પ્રોગ્રામિંગ ટાર્ગેટ તરીકે ડિઝાઇન કરવામાં આવ્યું હતું. ઇજનેરો સ્થાનિક ટેન્સર્સ, સ્પષ્ટ સંચાર અને અનુમાનિત સમન્વયન દ્વારા કાર્યનું વર્ણન કરી શકે છે. પછી AI સમગ્ર સિસ્ટમમાં તે કાર્યને કેવી રીતે મૅપ કરવામાં આવે, મૂકવામાં આવે, શેડ્યૂલ કરવામાં આવે અને સંકલિત કરવામાં આવે તેને ઑપ્ટિમાઇઝ કરી શકે છે. એ સ્પષ્ટ, અનુમાનયોગ્ય રચના AIને સમાંતર પ્રોગ્રામિંગની પરંપરાગત રીતે મુશ્કેલ સમસ્યાને હાથ ધરવા માટે વ્યવહારુ માર્ગ આપે છે.
દરેક નવા મોડલ ફેમિલીને સપોર્ટ કરવા માટે હજુ પણ નવા કર્નલ્સ અને મોડલ-વિશિષ્ટ ઑપ્ટિમાઇઝેશનની જરૂર પડે છે. GPT‑Astra સાથે Codexનો ઉપયોગ કરીને, ટીમે Jalapeñoની મૂળ પ્રોડક્શન યોજનાનો ભાગ ન હોય તેવા ત્રણ ઓપન વેઇટ મોડલ્સને બે મહિનામાં ઉચ્ચ કાર્યપ્રદર્શન સુધી પહોંચાડ્યા. આનાથી આર્કિટેક્ચરની લવચીકતા અને AI અમને તેને પ્રોગ્રામ કરવામાં કેટલી ઝડપથી મદદ કરી શકે છે તે બંને દર્શાવવામાં આવ્યું. પસંદ કરાયેલા GPT‑OSS એટેન્શન અને મિક્સચર-ઓફ-એક્સપર્ટ્સ બ્લોક્સ માટે, AI-જનરેટેડ અમલીકરણો હાલના માનવ નિષ્ણાતો દ્વારા લખાયેલા અમલીકરણો કરતાં 1.5 થી 1.8 ગણા ઝડપી ચાલ્યા. આ આંકડાઓ પસંદ કરાયેલા બ્લોક્સને લાગુ પડે છે, સંપૂર્ણ મોડલને નહીં, પરંતુ તેઓ એક શક્તિશાળી નવા ડેવલપમેન્ટ લૂપ તરફ ઈશારો કરે છે.
AI ઇન્ફ્રાસ્ટ્રક્ચર મૂલ્યવાન છે કારણ કે તે વાસ્તવિક દુનિયામાં ઉપયોગી કાર્યને શક્ય બનાવે છે. સમાન પાવર અને હાર્ડવેરમાંથી વધુ ઉપયોગી કાર્ય ઉત્પન્ન કરીને, Jalapeño અમને વધુ માંગને પહોંચી વળવામાં અને સફળ પરિણામ પ્રદાન કરવાનો ખર્ચ ઘટાડવામાં મદદ કરી શકે છે. OpenAI માટે, તે ઉપયોગી કાર્ય અને આવકને સેવા આપવાના ખર્ચ કરતાં વધુ ઝડપથી વધવા દઈને ઓપરેટિંગ લાભ સુધારી શકે છે. તે વધુ વ્યાપક અપનાવટને અને વધુ સારા મોડલ્સ, પ્રોડક્ટ્સ અને ઇન્ફ્રાસ્ટ્રક્ચરમાં સતત રોકાણને પણ ટેકો આપી શકે છે. ઝડપી અનુમાન વધુ ઝડપી પુનરાવર્તન અને નવા ઉપયોગના કેસોને સક્ષમ બનાવી શકે છે.
Jalapeño કાર્યક્ષમ અને ઓછી લેટન્સી ધરાવતા અનુમાન માટે શક્યતાઓને વિસ્તારે છે:
- અગાઉ માત્ર ફાસ્ટ મોડમાં ઉપલબ્ધ કાર્યક્ષમતાઓ સાથે Ultra-ફાસ્ટ-મોડ અનુમાન
- ફાસ્ટ-મોડમાં અનુમાન એવી કાર્યક્ષમતા સાથે જે પહેલાં માત્ર બેચ મોડમાં જ ઉપલબ્ધ હતી
- બેચ-મોડ અનુમાન માટે ઉચ્ચ કાર્યક્ષમતા
અમે વર્ષના અંત સુધીમાં OpenAIના કમ્પ્યુટ ઇન્ફ્રાસ્ટ્રક્ચરમાં Jalapeñoનું ડિપ્લોયમેન્ટ શરૂ કરવાની યોજના બનાવીએ છીએ. આ બહુ-પેઢીવાળા રોડમૅપની પ્રથમ પેઢી છે: Gen 2 વિકાસના ઊંડા તબક્કામાં છે અને Gen 3 આકાર લઈ રહ્યું છે. દરેક પેઢી અમે જે શીખીએ છીએ તેના આધારે વિકાસ કરશે અને કાર્યક્ષમતા તથા ઝડપ બંનેમાં વધુ વધારો કરશે.
AI માટે વધતી માંગને પહોંચી વળવા માટે દરેક ઉપલબ્ધ સ્ત્રોતમાંથી વધુ કમ્પ્યુટ ક્ષમતાની જરૂર પડશે. અમે ટ્રેનિંગ અને અનુમાન બંને વર્કલોડ્સ માટે NVIDIA અને અન્ય ભાગીદારોના ઍક્સેલરેટર્સને વ્યાપક રૂપે ડિપ્લોય કરવાનું ચાલુ રાખીશું. અમારું મિશન એ સુનિશ્ચિત કરવાનું છે કે આર્ટિફિશિયલ જનરલ ઇન્ટેલિજન્સ સમગ્ર માનવજાતને લાભ આપે.
જેમ જેમ અમે ડિપ્લોયમેન્ટ માટે તૈયારી કરી રહ્યા છીએ, તેમ તેમ અમે પ્રોડક્શન ક્વૉલિફિકેશન ચાલુ રાખી રહ્યા છીએ, સૉફ્ટવેરને પરિપક્વ બનાવી રહ્યા છીએ, Jalapeñoને મોટા પાયે સંચાલિત કરવાની તૈયારી કરી રહ્યા છીએ અને વધુ મોડલ્સમાં કાર્યપ્રદર્શનને માન્ય કરી રહ્યા છીએ. અત્યાર સુધીનાં પરિણામો દર્શાવે છે કે જ્યારે અમે સંપૂર્ણ સિસ્ટમ સાથે મળીને ડિઝાઇન કરીએ છીએ, ત્યારે શું શક્ય બને છે: વધુ પ્રતિભાવશીલ, સક્ષમ અને એજન્ટિક AI વધુ કાર્યક્ષમતાથી વધુ લોકો સુધી પહોંચાડવામાં આવે છે.
થ્રૂપુટ-પ્રતિ-કિલોવૉટ અગ્રેસર
InferenceX · GPT‑OSS‑120B · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB200 1,200 W
પીક એન્ડ મેચ થ્રૂપુટ
InferenceX · GPT‑OSS‑120B · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB200 1,200 W
હાઇ પીક મિશ્રિત TPS / કિલોવૉટ
≈1.9×
85,448 સામે 44,960 મિશ્રિત / કિલોવૉટ
ઓછી એન્ડ-ટુ-એન્ડ લેટન્સી
≈1.7×
1.03 સે. સામે 1.80 સે.
ઓછો ન્યૂનતમ TBT
≈2.7×
0.69 સામે 1.87 મિ.સે. (1,459 સામે 535 ટોકન/સેકન્ડ/વપરાશકર્તા)
અગાઉના TBT પર વધુ થ્રૂપુટ
≈53.7×
22,935 સામે 427 મિશ્રિત / કિલોવૉટ (535.28 ટોકન/સેકન્ડ/વપરાશકર્તા પર)
થ્રૂપુટ-પ્રતિ-કિલોવૉટ અગ્રેસર
InferenceX · DeepSeek R1 MXFP4 · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB300 1,400 W
પીક એન્ડ મેચ થ્રૂપુટ
InferenceX · DeepSeek R1 MXFP4 · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB300 1,400 W
હાઇ પીક મિશ્રિત TPS / કિલોવૉટ
≈1.7×
19,641 સામે 11,781 મિશ્રિત / કિલોવૉટ
ઓછી એન્ડ-ટુ-એન્ડ લેટન્સી
≈3.6×
1.65 સે. સામે 5.99 સે.
ઓછો ન્યૂનતમ TBT
≈4.1×
1.43 સામે 5.90 મિ.સે. (700 સામે 169 ટોકન/સેકન્ડ/વપરાશકર્તા)
અગાઉના TBT પર વધુ થ્રૂપુટ
≈104.3×
12,258 સામે 118 મિશ્રિત / કિલોવૉટ (169.41 ટોકન/સેકન્ડ/વપરાશકર્તા પર)
થ્રૂપુટ-પ્રતિ-કિલોવૉટ અગ્રેસર
InferenceX · Kimi K2.5 MXFP4 · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB300 1,400 W
પીક એન્ડ મેચ થ્રૂપુટ
InferenceX · Kimi K2.5 MXFP4 · નજીવું 8k/1k · STP · પેકેજ TDP: Jalapeño 700 W; GB300 1,400 W
હાઇ પીક મિશ્રિત TPS / કિલોવૉટ
≈1.5×
18,195 સામે 11,862 મિશ્રિત / કિલોવૉટ
ઓછી એન્ડ-ટુ-એન્ડ લેટન્સી
≈3.4×
1.56 સે. સામે 5.31 સે.
ઓછો ન્યૂનતમ TBT
≈3.8×
1.44 સામે 5.48 મિ.સે. (694 સામે 182 ટોકન/સેકન્ડ/વપરાશકર્તા)
અગાઉના TBT પર વધુ થ્રૂપુટ
≈56.1×
6,744 સામે 120 મિશ્રિત / કિલોવૉટ (182.46 ટોકન/સેકન્ડ/વપરાશકર્તા પર)


