Jalapeño-യുടെ ആദ്യ ഫലങ്ങൾ AI ഇൻഫറൻസിൽ വ്യവസായത്തിൽ മുൻനിരയിലുള്ള വേഗതയും കാര്യക്ഷമതയും കാണിക്കുന്നു

Jalapeño, OpenAI-യുടെ ആദ്യ കസ്റ്റം ഇൻഫറൻസ് ചിപ്പ് പ്രഖ്യാപിച്ചതിന് ശേഷം, ഞങ്ങൾ ചിപ്പും അതിനെ ചുറ്റിപ്പറ്റി നിർമ്മിച്ച സിസ്റ്റവും പരീക്ഷിച്ചുവരികയാണ്. ഫലങ്ങൾ പ്രകടനത്തിൽ ഗണ്യമായ മുന്നേറ്റം കാണിക്കുന്നു: വൈദ്യുതിയുടെ ഓരോ യൂണിറ്റിനും കൂടുതൽ AI ജോലികൾ കൈകാര്യം ചെയ്യാൻ Jalapeño-യ്ക്ക് കഴിയും, അതോടൊപ്പം പ്രതികരണങ്ങൾ കൂടുതൽ വേഗത്തിൽ നൽകുകയും ചെയ്യും. നിലവിലുള്ള ഹാർഡ്വെയർ സിസ്റ്റങ്ങൾക്ക് പലപ്പോഴും ഇവ രണ്ടിനുമിടയിൽ ഒരു സമവായം നടത്തേണ്ടിവരുമ്പോൾ, ഒരൊറ്റ ആർക്കിടെക്ചറിലൂടെ Jalapeño ഉയർന്ന ത്രൂപുട്ടും കുറഞ്ഞ ലേറ്റൻസിയും നൽകുന്നു.
ഉപഭോക്താക്കൾക്ക്, ആവശ്യം വർധിക്കുമ്പോൾ വേഗത്തിലുള്ള പ്രതികരണങ്ങളും, കൂടുതൽ പ്രതികരണക്ഷമരായ ഏജന്റുമാരും, കൂടുതൽ വിശ്വസനീയമായ ആക്സസും ലഭിക്കും. ആർട്ടിഫിഷ്യൽ ജനറൽ ഇന്റലിജൻസ് മുഴുവൻ മനുഷ്യരാശിക്കും പ്രയോജനപ്പെടുന്നുവെന്ന് ഉറപ്പാക്കുകയാണ് ഞങ്ങളുടെ ദൗത്യം. കൂടുതൽ ശേഷിയാർജിക്കുന്ന AI-യെ കൂടുതൽ താങ്ങാനാവുന്നതും കൂടുതൽ വ്യാപകമായി ലഭ്യമാകുന്നതുമാക്കാൻ ഈ നേട്ടങ്ങൾ സഹായിക്കും.
OpenAI മോഡലുകൾ Jalapeño-യുടെ വികസനവും ത്വരിതപ്പെടുത്തി. മുൻ തലമുറകൾ ചിപ്പ് രൂപകൽപ്പന ചെയ്യാനും പ്രവർത്തനക്ഷമമാക്കാനും ടീമിനെ സഹായിച്ചു, അതേസമയം ഞങ്ങളുടെ ഏറ്റവും പുതിയ മോഡലുകൾ അത് എങ്ങനെ ഒപ്റ്റിമൈസ് ചെയ്യുകയും പ്രോഗ്രാം ചെയ്യുകയും ചെയ്യുന്നുവെന്നത് വേഗത്തിലാക്കുന്നു. GPT‑OSS 120B, DeepSeek R1, Kimi K2.5 1T എന്നിവയിലെല്ലാം Jalapeño-യുടെ പ്രകടനം വ്യാപിക്കുന്നു; OpenAI-ക്കുള്ളിലും പുറത്തും വികസിപ്പിച്ച മോഡലുകളിലുടനീളം ഈ ആർക്കിടെക്ചർ പ്രവർത്തിക്കുന്നുവെന്ന് ഇത് കാണിക്കുന്നു. ഈ മൂന്നിലും, താരതമ്യ സിസ്റ്റങ്ങളേക്കാൾ പരമാവധി ത്രൂപുട്ടിൽ ഒരു വാട്ടിന് 1.5 മുതൽ 1.9 മടങ്ങ് വരെ കൂടുതൽ AI പ്രവർത്തനവും 1.7 മുതൽ 3.6 മടങ്ങ് വരെ കുറഞ്ഞ എൻഡ്-ടു-എൻഡ് ലേറ്റൻസിയും Jalapeño നൽകി. വളരെ ഇന്ററാക്ടീവ് ആയ വർക്ക്ലോഡുകൾക്ക്, ഇത് 2.1 മുതൽ 4.1 മടങ്ങ് വരെ ഉയർന്ന പ്രകടനം നൽകി.
Jalapeño കൂടുതൽ വ്യാപകമായ ഫുൾ-സ്റ്റാക്ക് മുൻതൂക്കത്തിന്റെയും തെളിവാണ്. യഥാർഥ വർക്ക്ലോഡുകളിൽ നിന്ന് ഞങ്ങൾ പഠിക്കുന്ന കാര്യങ്ങൾ ഉപയോഗിച്ച് സ്റ്റാക്കിന്റെ ഓരോ പാളിയും മെച്ചപ്പെടുത്താൻ, മോഡലുകൾ, ഉൽപ്പന്നങ്ങൾ, സേവനം നൽകുന്ന സോഫ്റ്റ്വെയർ, ചിപ്പുകൾ, മെമ്മറി, നെറ്റ്വർക്കിംഗ്, സിസ്റ്റങ്ങൾ എന്നിവ ഒരുമിച്ച് രൂപകൽപ്പന ചെയ്യാൻ OpenAI-ക്ക് കഴിയും. Jalapeño അളവെടുപ്പുകളിലൂടെ സ്ഥിരീകരിച്ച ഫലങ്ങളുള്ള, പ്രവർത്തനക്ഷമമായ സ്വന്തം സിലിക്കണാണ്; ഇത് ഒന്നിലധികം തലമുറകളിലേക്ക് വ്യാപിക്കുന്ന ഒരു പ്ലാറ്റ്ഫോമിന്റെ തുടക്കവുമാണ്. വരാനിരിക്കുന്ന മാസങ്ങളിൽ, ഞങ്ങളുടെ ഉപഭോക്താക്കൾക്കായി കൂടുതൽ വേഗമേറിയതും കൂടുതൽ ശേഷിയുള്ളതും കൂടുതൽ കാര്യക്ഷമമായതുമായ ഉൽപ്പന്നങ്ങൾ നൽകുന്നതിനായി ഞങ്ങൾ Jalapeño-യെ വേഗത്തിൽ വികസിപ്പിക്കും.
ഒരേപോലുള്ള ഉപയോക്തൃ അനുഭവത്തിൽ ഞങ്ങൾ പ്രകടനം വിലയിരുത്തുന്നു; ഉപഭോക്താക്കളും ഇന്ററാക്ടീവ് ഏജന്റുകളും ആവശ്യപ്പെടുന്ന ലേറ്റൻസി പാലിക്കുമ്പോൾ, വൈദ്യുതിയുടെ ഓരോ യൂണിറ്റിനും ഓരോ സിസ്റ്റത്തിനും എത്ര പ്രയോജനകരമായ AI പ്രവർത്തനം പൂർത്തിയാക്കാൻ കഴിയുമെന്ന് അളക്കുന്നു. ക്രമത്തിൽ നിരവധി ഘട്ടങ്ങൾ പൂർത്തിയാക്കേണ്ട ഏജന്റുകൾക്ക് ഇത് പ്രത്യേകിച്ച് പ്രധാനമാണ്, കാരണം വിലംബങ്ങൾ ഒരു മുഴുവൻ ടാസ്കിലുടനീളം കൂടിക്കൂടി വരാം.
Jalapeño പ്രായോഗികമായി എങ്ങനെ പ്രവർത്തിക്കുന്നു എന്ന് മനസ്സിലാക്കാൻ, AI അഭ്യർത്ഥന സർവ് ചെയ്യുന്നതിന്റെ മുഴുവൻ പ്രക്രിയ അളക്കുന്ന SemiAnalysis-ൽ നിന്നുള്ള പൊതു ബെഞ്ച്മാർക്കായ InferenceX-ൽ ഞങ്ങൾ അത് പരീക്ഷിച്ചു. ഉയർന്ന ത്രൂപുട്ട് സേവനം നൽകലിൽ നിന്ന് അതീവ ഇന്ററാക്ടീവ്, കുറഞ്ഞ ലേറ്റൻസിയുള്ള ഉപയോഗം വരെ പരീക്ഷിച്ച പ്രവർത്തന പരിധിയിൽ, വാണിജ്യപരമായി ലഭ്യമായ മുൻനിര AI സിസ്റ്റങ്ങളുമായി ഞങ്ങൾ Jalapeño-യെ താരതമ്യം ചെയ്തു. Jalapeño ത്രൂപുട്ട്, പവർ കാര്യക്ഷമത, ലേറ്റൻസി എന്നിവയുടെ മികച്ച സംയോജനം നൽകി. ചിലപ്പോൾ പ്രകടനം ഓരോ ചിപ്പിനും റിപ്പോർട്ട് ചെയ്യപ്പെടാറുണ്ടെങ്കിലും, കൂടുതൽ പ്രയോജനകരമായ മാനദണ്ഡം വൈദ്യുതശക്തിയുടെ ഓരോ യൂണിറ്റിനുമുള്ള പ്രകടനമാണെന്ന് ഞങ്ങൾ വിശ്വസിക്കുന്നു.
മൂന്ന് പൊതു മോഡലുകളിലുടനീളം, പരീക്ഷിച്ച പ്രവർത്തന ശ്രേണിയിലാകെ ഓരോ വാട്ടിനുമുള്ള പ്രകടനത്തിന്റെയും ലേറ്റൻസിയുടെയും മെച്ചപ്പെട്ട സംയോജനം Jalapeño നൽകി, അതിനെ പാരീറ്റോ അത്യാധുനിക പരിധിയിലെത്തിച്ചു. സിസ്റ്റങ്ങളെ സ്ഥിരതയോടെ താരതമ്യം ചെയ്യുന്നതിനായി, ഓരോ ആക്സിലറേറ്ററിന്റെയും പ്രസിദ്ധീകരിച്ച ചിപ്പ് പവർ റേറ്റിംഗ് ഉപയോഗിച്ച് ഞങ്ങൾ ഫലങ്ങൾ നോർമലൈസ് ചെയ്തു. Jalapeño 700 വാട്ട് എന്ന് റേറ്റുചെയ്തിട്ടുണ്ടെങ്കിലും, പരിശോധന നടത്തിയ വർക്ക്ലോഡുകളിൽ അതിന്റെ അളന്ന സ്ഥിരതയുള്ള പവർ 550 വാട്ടിലോ അതിൽ താഴെയോ ആയിരുന്നു.
GPT‑OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T എന്നിവയിൽ Jalapeño ശക്തമായ പ്രകടനം കാഴ്ചവച്ചു. ഞങ്ങൾ പരീക്ഷിച്ചിട്ടുള്ളതിൽ ഏറ്റവും വലിയ പൊതു മോഡലായ Kimi-യിൽ, താരതമ്യ സംവിധാനത്തേക്കാൾ ഓരോ വാട്ടിനും ഏകദേശം 1.5 മടങ്ങ് ഉയർന്ന പീക്ക് പ്രകടനവും എൻഡ്-ടു-എൻഡ് ലേറ്റൻസി 3.4 മടങ്ങ് കുറവും ഇത് നൽകി. ഞങ്ങളുടെ ആന്തരിക പരിശോധനയിൽ, അത്യാധുനിക OpenAI മോഡലുകളിൽ Jalapeñoയുടെ നേട്ടം കൂടുതൽ വർധിച്ചു; ജോലിഭാരങ്ങൾ വലുതും കൂടുതൽ ആവശ്യകതയുള്ളതുമാകുമ്പോൾ ഈ ആർക്കിടെക്ചറിന്റെ മൂല്യം കൂടുമെന്ന് ഇത് സൂചിപ്പിക്കുന്നു.
ആധുനികവും ഭാവിയിലുമുള്ള ഭാഷാ മോഡലുകൾക്ക്, പ്രത്യേകിച്ച് ഇന്ററാക്ടീവ് ഏജന്റുകൾക്ക്, സേവനം നൽകുക എന്നതായിരുന്നെങ്കിൽ ഞങ്ങൾ എന്ത് ഹാർഡ്വെയറായിരിക്കും നിർമ്മിക്കുക എന്ന ചോദ്യത്തോടെയാണ് Jalapeño ആദ്യം മുതൽ രൂപകൽപ്പന ചെയ്തത്? യഥാർത്ഥ ഭാഷാ-മോഡൽ വർക്ക്ലോഡുകളെ കേന്ദ്രീകരിച്ച് ചിപ്പ്, മെമ്മറി, നെറ്റ്വർക്ക്, സോഫ്റ്റ്വെയർ, റാക്ക്-സ്കെയിൽ സിസ്റ്റം എന്നിവ ഒരുമിച്ച് രൂപകൽപ്പന ചെയ്യുന്നതിലൂടെയാണ് Jalapeño-യുടെ നേട്ടങ്ങൾ ലഭിക്കുന്നത്. ഭാഷാ-മോഡൽ ഇൻഫറൻസ് വ്യത്യസ്ത തടസ്സങ്ങളുള്ള നിരവധി വ്യത്യസ്ത ഘട്ടങ്ങളിലൂടെ കടന്നുപോകുന്നു. സിസ്റ്റം ഒരു പ്രോംപ്റ്റ് പ്രോസസ്സ് ചെയ്യുന്ന പ്രീഫിൽ കംപ്യൂട്ട്-ഇന്റൻസീവാണ്. അതേസമയം, സിസ്റ്റം ടോക്കൺ-ബൈ-ടോക്കൺ ആയി പ്രതികരണം സൃഷ്ടിക്കുന്ന ഡീകോഡ് മെമ്മറി ബാൻഡ്വിഡ്ത്തിനാൽ കൂടുതലായി പരിമിതപ്പെടുന്നു. കോറുകൾക്കും ചിപ്പുകൾക്കുമിടയിൽ ഡാറ്റ കൈമാറ്റം ചെയ്യപ്പെടുമ്പോഴുണ്ടാകുന്ന ആശയവിനിമയം അധിക ലേറ്റൻസി ഉണ്ടാക്കാം. കാത്തിരിക്കേണ്ടിവരുന്നതിനാൽ ചില പ്രോസസ്സിംഗ് യൂണിറ്റുകൾ നിഷ്ക്രിയമായി തുടരാം. ഒരു ഘട്ടത്തിൽ മികവ് പുലർത്തുന്ന ഒരു സിസ്റ്റത്തിന്, ഡാറ്റയ്ക്കായി കാത്തിരിക്കുമ്പോഴോ വ്യത്യസ്ത റിസോഴ്സുകൾക്കിടയിൽ മോഡലിന്റെ അവസ്ഥ നീക്കുമ്പോഴോ ആ നേട്ടം നഷ്ടപ്പെടാം.
ഡാറ്റാ നീക്കവും ആശയവിനിമയ കാലതാമസവും പരമാവധി കുറയ്ക്കുന്നതിനായി ഞങ്ങൾ Jalapeño രൂപകൽപ്പന ചെയ്തു. ഓരോ ഇൻഫറൻസ് ഘട്ടത്തിനും ആവശ്യമായ കംപ്യൂട്ട്, മെമ്മറി, നെറ്റ്വർക്കിംഗ് എന്നിവയുടെ ശരിയായ സംയോജനം സിസ്റ്റം സജീവമാക്കുമ്പോൾ, പ്രതികരണം സൃഷ്ടിക്കുമ്പോൾ ഉപയോഗിക്കുന്ന KV കാഷെ ഉൾപ്പെടെയുള്ള മോഡൽ സ്റ്റേറ്റ് വ്യക്തമായി നിയോഗിക്കാനും പ്രാദേശികമായി നിലനിർത്താനും ഇത് സഹായിക്കുന്നു. നെറ്റ്വർക്ക് ആർക്കിടെക്ചറിന്റെ അവിഭാജ്യ ഘടകമാണ്. ഇതിന്റെ വിസ്തൃതമായ ഡൊമെയിൻ മുഴുവൻ വർക്ക്ലോഡും ഒരൊറ്റ കണക്റ്റഡ് സിസ്റ്റത്തിനുള്ളിൽ നിലനിർത്താൻ അനുവദിക്കുന്നു, ഡാറ്റാ മൂവ്മെന്റ് കുറയ്ക്കുകയും പൂർണ്ണമായ അഭ്യർത്ഥന ആരംഭം മുതൽ അവസാനം വരെ വേഗതയേറിയതും കാര്യക്ഷമവുമായിരിക്കാനായി സഹായിക്കുകയും ചെയ്യുന്നു. ഫലമായി, മാറുന്ന മോഡൽ ആർക്കിടെക്ചറുകളെ പിന്തുണയ്ക്കാനും, പ്രീഫില്ലിലും ഡീകോഡിലും മികവ് പുലർത്താനും, അവ തമ്മിലുള്ള സന്തുലനം മാറുന്നതിനനുസരിച്ച് പൊരുത്തപ്പെടാനും കഴിയുന്ന, സന്തുലിതവും പരസ്പരം മാറ്റിസ്ഥാപിക്കാവുന്നതുമായ ഒരു ആക്സിലറേറ്റർ ലഭിക്കുന്നു; ഇത് ഏജന്റിക് വർക്ക്ലോഡുകളുടെ നിർവചിക്കുന്ന സവിശേഷതയാണ്.
Jalapeño-യുടെ വികസനത്തിൽ AI നേരിട്ട് പങ്കുവഹിച്ചു. ഇംപ്ലിമെന്റേഷനുകൾ പര്യവേക്ഷണം ചെയ്ത്, ഡിസൈൻ, അളക്കൽ, പരിശോധനാ ചക്രങ്ങൾ ചുരുക്കി, മോഡൽ വർക്ക്ലോഡുകളിൽ തുടർച്ചയായി ആവർത്തിച്ച് മെച്ചപ്പെടുത്തലുകൾ നടത്തി, ടീം പ്രാരംഭ രൂപകൽപ്പനയിൽ നിന്ന് ടേപ്പ്-ഔട്ടിലേക്ക് ഒൻപത് മാസത്തിനുള്ളിൽ എത്താൻ സാധിച്ചു. AI ചിപ്പിലെ ഗണിത സർക്യൂട്ടുകൾ ഓപ്റ്റിമൈസ് ചെയ്യാനും സഹായിച്ചു, ഇതിലൂടെ ടീമിന് നിശ്ചിത സമയക്രമത്തിനുള്ളിൽ കൂടുതൽ കണക്കുകൂട്ടൽ പ്രകടനം ചിപ്പിൽ ഉൾക്കൊള്ളിക്കാൻ കഴിഞ്ഞു.
Jalapeño മനുഷ്യർക്കും AI-ക്കും ഒരുപോലെ വ്യക്തവും പ്രവചനീയവുമായ പ്രോഗ്രാമിംഗ് ലക്ഷ്യമായി രൂപകൽപ്പന ചെയ്തതാണ്. എൻജിനീയർമാർക്ക് പ്രാദേശിക ടെൻസറുകൾ, വ്യക്തമായ ആശയവിനിമയം, പ്രവചിക്കാവുന്ന സമകാലീകരണം എന്നിവയിലൂടെ പ്രവർത്തനം വിവരിക്കാം. അതിനുശേഷം, ആ പ്രവൃത്തി സിസ്റ്റം മുഴുവനിലായി എങ്ങനെ മാപ്പ് ചെയ്യപ്പെടുന്നു, വിന്യസിക്കപ്പെടുന്നു, ഷെഡ്യൂൾ ചെയ്യപ്പെടുന്നു, ഏകോപിപ്പിക്കപ്പെടുന്നു എന്നിവ AI-ക്ക് മെച്ചപ്പെടുത്താൻ കഴിയും. വ്യക്തവും പ്രവചിക്കാവുന്നതുമായ ആ ഘടന, സമാന്തര പ്രോഗ്രാമിംഗിലെ പരമ്പരാഗതമായി ബുദ്ധിമുട്ടേറിയ പ്രശ്നത്തെ നേരിടാൻ AI-യ്ക്ക് കൈകാര്യം ചെയ്യാവുന്ന ഒരു മാർഗം നൽകുന്നു.
ഓരോ പുതിയ മോഡൽ കുടുംബത്തിനും പിന്തുണ നൽകാൻ ഇപ്പോഴും പുതിയ കർണലുകളും മോഡൽ-നിർദ്ദിഷ്ട ഒപ്റ്റിമൈസേഷനുകളും ആവശ്യമാണ്. GPT‑Astra‑യുമായി Codex ഉപയോഗിച്ച്, Jalapeñoയുടെ യഥാർത്ഥ ഉൽപ്പാദന പദ്ധതിയുടെ ഭാഗമല്ലാത്ത മൂന്ന് ഓപ്പൺ-വെയിറ്റ് മോഡലുകളെ ടീം രണ്ട് മാസത്തിനുള്ളിൽ ഉയർന്ന പ്രകടനത്തിലേക്ക് എത്തിച്ചു. ഇത് ആർക്കിടെക്ചറിന്റെ വഴക്കവും AI ഉപയോഗിച്ച് അത് എത്ര വേഗത്തിൽ പ്രോഗ്രാം ചെയ്യാൻ സാധിക്കും എന്നതും ഒരേപോലെ തെളിയിച്ചു. തിരഞ്ഞെടുത്ത GPT‑OSS അറ്റൻഷൻ, മിശ്രിത-ഓഫ്-എക്സ്പെർട്സ് ബ്ലോക്കുകൾക്കായി, AI സൃഷ്ടിച്ച നടപ്പാക്കലുകൾ നിലവിലുള്ള മനുഷ്യ വിദഗ്ദ്ധർ എഴുതിയ നടപ്പാക്കലുകളേക്കാൾ 1.5 മുതൽ 1.8 മടങ്ങ് വരെ വേഗത്തിൽ പ്രവർത്തിച്ചു. ആ കണക്കുകൾ തിരഞ്ഞെടുത്ത ബ്ലോക്കുകൾക്കാണ് ബാധകമാകുന്നത്, മുഴുവൻ മോഡലിനല്ല. എന്നാൽ അവ ശക്തമായ ഒരു പുതിയ വികസന ലൂപ്പിലേക്കാണ് വിരൽചൂണ്ടുന്നത്.
AI അടിസ്ഥാനസൗകര്യം മൂല്യമുള്ളതാകുന്നത് അത് സാധ്യമാക്കുന്ന പ്രയോജനകരമായ യഥാർത്ഥ ലോകത്തിലെ പ്രവൃത്തികൾ കൊണ്ടാണ്. അതേ വൈദ്യുതിയും ഹാർഡ്വെയറും ഉപയോഗിച്ച് കൂടുതൽ പ്രയോജനകരമായ പ്രവർത്തനം സൃഷ്ടിക്കുന്നതിലൂടെ, കൂടുതൽ ആവശ്യകത നിറവേറ്റാനും വിജയകരമായ ഫലം ലഭ്യമാക്കുന്നതിനുള്ള ചെലവ് കുറയ്ക്കാനും Jalapeño ഞങ്ങളെ സഹായിക്കും. OpenAI-യെ സംബന്ധിച്ചിടത്തോളം, സേവനം നൽകുന്നതിനുള്ള ചെലവിനേക്കാൾ വേഗത്തിൽ ഉപയോഗപ്രദമായ പ്രവർത്തനവും വരുമാനവും വളരാൻ അനുവദിക്കുന്നതിലൂടെ ഇത് പ്രവർത്തന ലിവറേജ് മെച്ചപ്പെടുത്തും. മികച്ച മോഡലുകൾ, ഉൽപ്പന്നങ്ങൾ, അടിസ്ഥാനസൗകര്യങ്ങൾ എന്നിവയിലെ തുടർച്ചയായ നിക്ഷേപത്തിനും കൂടുതൽ വ്യാപകമായ ഉപയോഗസ്വീകരണത്തിനും ഇത് പിന്തുണ നൽകും. വേഗത്തിലുള്ള ഇൻഫറൻസ് വേഗത്തിലുള്ള പരീക്ഷണങ്ങൾക്കും പുതിയ ഉപയോഗ സാധ്യതകൾക്കും വഴിയൊരുക്കും.
Jalapeño കാര്യക്ഷമവും കുറഞ്ഞ ലേറ്റൻസിയുള്ള ഇൻഫറൻസിനായി സാധ്യമായതിന്റെ പരിധി വിപുലീകരിക്കുന്നു:
- മുമ്പ് ഫാസ്റ്റ് മോഡിൽ മാത്രം സാധ്യമായിരുന്ന കാര്യക്ഷമതയോടെയുള്ള അൾട്രാ-ഫാസ്റ്റ് മോഡ് ഇൻഫറൻസ്
- മുമ്പ് ബാച്ച്ഡ് മോഡിൽ മാത്രം സാധ്യമായിരുന്ന കാര്യക്ഷമതയോടെയുള്ള ഫാസ്റ്റ് മോഡ് ഇൻഫറൻസ്
- ബാച്ച്ഡ് മോഡ് ഇൻഫറൻസിനുള്ള കൂടുതൽ കാര്യക്ഷമത
ഈ വർഷാവസാനത്തോടെ OpenAI-യുടെ കംപ്യൂട്ട് ഇൻഫ്രാസ്ട്രക്ചറിനുള്ളിൽ Jalapeño വിന്യസിക്കാൻ തുടങ്ങാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു. ഇത് ഒരു ബഹുതലമുറ റോഡ്മാപ്പിന്റെ ആദ്യ തലമുറയാണ്: Gen 2 വികസനത്തിന്റെ ആഴത്തിലുള്ള ഘട്ടത്തിലാണ്, കൂടാതെ Gen 3 രൂപംകൊണ്ടുവരികയാണ്. ഓരോ തലമുറയും നാം പഠിക്കുന്ന കാര്യങ്ങളെ അടിസ്ഥാനമാക്കി മുന്നേറുകയും കാര്യക്ഷമതയും വേഗതയും കൂടുതൽ മെച്ചപ്പെടുത്തുകയും ചെയ്യും.
AI-യ്ക്കുള്ള വർധിച്ചുവരുന്ന ആവശ്യം നിറവേറ്റാൻ ലഭ്യമായ എല്ലാ ഉറവിടങ്ങളിൽ നിന്നുമുള്ള കൂടുതൽ കമ്പ്യൂട്ട് ശേഷി ആവശ്യമായിരിക്കും. പരിശീലനത്തിനും ഇൻഫറൻസിനുമുള്ള വർക്ക്ലോഡുകൾക്കായി NVIDIA-യിലും മറ്റ് പങ്കാളികളിലും നിന്നുള്ള ആക്സിലറേറ്ററുകൾ വ്യാപകമായി വിന്യസിക്കുന്നത് ഞങ്ങൾ തുടരും. ആർട്ടിഫിഷ്യൽ ജനറൽ ഇന്റലിജൻസ് മുഴുവൻ മനുഷ്യരാശിക്കും പ്രയോജനപ്പെടുന്നുവെന്ന് ഉറപ്പാക്കുകയാണ് ഞങ്ങളുടെ ദൗത്യം.
വിന്യാസത്തിനായി തയ്യാറെടുക്കുമ്പോൾ, ഞങ്ങൾ ഉൽപ്പാദന യോഗ്യത തുടരുകയും സോഫ്റ്റ്വെയർ പക്വമാക്കുകയും Jalapeño വൻതോതിൽ പ്രവർത്തിപ്പിക്കാൻ തയ്യാറെടുക്കുകയും കൂടുതൽ മോഡലുകളിലുടനീളം പ്രകടനം സാധൂകരിക്കുകയും ചെയ്യുന്നു. പൂർണ സംവിധാനത്തെ ഒരുമിച്ച് രൂപകൽപ്പന ചെയ്യുമ്പോൾ എന്താണ് സാധ്യമാകുന്നതെന്ന് ഇതുവരെയുള്ള ഫലങ്ങൾ കാണിക്കുന്നു: കൂടുതൽ പ്രതികരണശേഷിയുള്ളതും ശേഷിയുള്ളതുമായ ഏജന്റിക് AI കൂടുതൽ ആളുകളിലേക്ക് കൂടുതൽ കാര്യക്ഷമമായി എത്തിക്കുന്നു.
കിലോവാട്ടിനനുസരിച്ചുള്ള ത്രൂപുട്ട് അത്യാധുനികം
InferenceX · GPT‑OSS‑120B · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB200 1,200 W
പരമാവധി ഒത്തുപോകുന്ന ത്രൂപുട്ട്
InferenceX · GPT‑OSS‑120B · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB200 1,200 W
ഉയർന്ന പീക്ക് മിശ്രിതം TPS / കിലോവാട്ട്
≈1.9×
85,448 vs. 44,960 മിശ്രിതം / kW
കുറഞ്ഞ എൻഡ്-ടു-എൻഡ് ലേറ്റൻസി
≈1.7×
1.03 s vs. 1.80 സെക്കൻഡ്
കുറഞ്ഞ മിനിമം TBT
≈2.7×
0.69 നെതിരെ 1.87 ms (ഉപയോക്താവിന് സെക്കൻഡിൽ 1,459 vs. 535 ടോക്കണുകൾ)
മുമ്പത്തെ TBT-യിൽ കൂടുതൽ ത്രൂപുട്ട്
≈53.7×
22,935 vs. 427 മിശ്രിതം / കിലോവാട്ട് (535.28 ടോക്കൺ/സെക്കൻഡ്/ഉപയോക്താവ്)
കിലോവാട്ടിനനുസരിച്ചുള്ള ത്രൂപുട്ട് അത്യാധുനികം
InferenceX · DeepSeek R1 MXFP4 · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB300 1,400 W
പരമാവധി ഒത്തുപോകുന്ന ത്രൂപുട്ട്
InferenceX · DeepSeek R1 MXFP4 · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB300 1,400 W
ഉയർന്ന പീക്ക് മിശ്രിതം TPS / കിലോവാട്ട്
≈1.7×
19,641 vs. 11,781 മിശ്രിതം / കിലോവാട്ട്
കുറഞ്ഞ എൻഡ്-ടു-എൻഡ് ലേറ്റൻസി
≈3.6×
1.65 സെക്കൻഡ് vs. 5.99 സെക്കൻഡ്
കുറഞ്ഞ മിനിമം TBT
≈4.1×
1.43 vs. 5.90 ms (700 vs. 169 ടോക്കൺ/സെക്കൻഡ്/ഉപയോക്താവ്)
മുമ്പത്തെ TBT-യിൽ കൂടുതൽ ത്രൂപുട്ട്
≈104.3×
12,258 vs. 118 മിശ്രിതം / kW (169.41 ടോക്കൺ/സെക്കൻഡ്/ഉപയോക്താവ്)
കിലോവാട്ടിനനുസരിച്ചുള്ള ത്രൂപുട്ട് അത്യാധുനികം
InferenceX · Kimi K2.5 MXFP4 · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB300 1,400 W
പരമാവധി ഒത്തുപോകുന്ന ത്രൂപുട്ട്
InferenceX · Kimi K2.5 MXFP4 · നാമമാത്ര 8k/1k · STP · പാക്കേജ് TDP: Jalapeño 700 W; GB300 1,400 W
ഉയർന്ന പീക്ക് മിശ്രിതം TPS / കിലോവാട്ട്
≈1.5×
18,195 vs. 11,862 മിശ്രിതം / കിലോവാട്ട്
കുറഞ്ഞ എൻഡ്-ടു-എൻഡ് ലേറ്റൻസി
≈3.4×
1.56 s vs. 5.31 സെക്കൻഡ്
കുറഞ്ഞ മിനിമം TBT
≈3.8×
1.44 vs. 5.48 ms (694 vs. 182 ടോക്കൺ/സെക്കൻഡ്/ഉപയോക്താവ്)
മുമ്പത്തെ TBT-യിൽ കൂടുതൽ ത്രൂപുട്ട്
≈56.1×
6,744 vs. 120 മിശ്രിതം / കിലോവാട്ട് (182.46 ടോക്കൺ/സെക്കൻഡ്/ഉപയോക്താവ്)


