முக்கிய உள்ளடக்கத்திற்கு செல்க
OpenAI

Jalapeño இன் முதல் முடிவுகள், AI inference இல் முன்னணி வேகம், செயல்திறனை காட்டுகின்றன

ஏற்றுகிறது…
நீலப்பச்சை சர்க்யூட் போர்டில் பொருத்தப்பட்டுள்ள Jalapeño இன்ஃபரன்ஸ் சிப்பின் நெருக்கக் காட்சி.

OpenAI-இன் முதல் தனிப்பயன் அனுமான சிப்பான Jalapeño-ஐ அறிவித்ததிலிருந்து, அந்த சிப்பையும் அதைச் சுற்றி உருவாக்கப்பட்ட முறைமையையும் நாங்கள் சோதித்து வருகிறோம். முடிவுகள் குறிப்பிடத்தக்க செயல்திறன் முன்னேற்றத்தைக் காட்டுகின்றன: Jalapeño ஒவ்வொரு மின்சக்தி அலகிற்கும் அதிக AI பணிச்சுமையைக் கையாள முடியும்; அதே சமயம் பதில்களையும் மேலும் விரைவாக வழங்குகிறது. தற்போதுள்ள வன்பொருள் முறைமைகள் பெரும்பாலும் இவ்விரண்டிற்கும் இடையே சமநிலையை ஏற்படுத்த வேண்டிய நிலையில், Jalapeño ஒரே கட்டமைப்பில் அதிகமான த்ரூபுட் மற்றும் குறைந்த தாமதம் இரண்டையும் வழங்குகிறது.

வாடிக்கையாளர்களுக்கு, தேவைகள் அதிகரித்தாலும் விரைவான பதில்கள், வேகமாக பதிலளிக்கும் ஏஜென்ட்கள் மற்றும் நம்பகமான அணுகல் கிடைக்கும். பொதுவான செயற்கை நுண்ணறிவு மனிதகுலம் முழுமைக்கும் பயனளிப்பதை உறுதி செய்வதே எங்கள் நோக்கம் ஆகும். இந்த முன்னேற்றங்கள், திறன் மேம்பட்ட AI-ஐ மேலும் மலிவானதும் பரவலாகக் கிடைக்கக்கூடியதும் ஆக்க உதவும்.

OpenAI மாடல்கள் Jalapeño இன் மேம்பாட்டையும் விரைவுபடுத்தின. முந்தைய தலைமுறைகள் சிப்பை வடிவமைத்து செயல்பாட்டுக்கு கொண்டு வர அணிக்கு உதவின. எங்கள் சமீபத்திய மாடல்கள் அதை எவ்வாறு மேம்படுத்தி நிரலாக்குகிறோம் என்பதை விரைவுபடுத்துகின்றன. Jalapeño இன் செயல்திறன் GPT‑OSS 120B, DeepSeek R1 மற்றும் Kimi K2.5 1T ஆகியவற்றிலும் பரப்புகிறது. கட்டமைப்பு OpenAI-க்கு உள்ளேயும் வெளியேயும் உருவாக்கப்பட்ட மாடல்களில் செயல்படுகிறது என்பதை இது காட்டுகிறது. இந்த மூன்றிலும், Jalapeño உச்ச த்ரூபுட்டில் ஒரு வாட்டுக்கு 1.5 முதல் 1.9 மடங்கு அதிக AI பணியையும், ஒப்பீட்டு முறைமைகளைவிட 1.7 முதல் 3.6 மடங்கு குறைவான முனையிலிருந்து முனை வரை தாமதத்தையும் வழங்கியது. மிகவும் ஊடாடும் பணிச்சுமைகளுக்கு, இது 2.1 முதல் 4.1 மடங்கு அதிக செயல்திறனை வழங்கியது.

Jalapeño பரந்த முழு ஸ்டாக் முன்னிலையின் சான்றாகும். மாடல்கள், தயாரிப்புகள், சேவை மென்பொருள், சிப்புகள், நினைவகம், நெட்வொர்க்கிங் மற்றும் முறைமைகளை OpenAI ஒன்றாக வடிவமைக்க முடியும். உண்மையான பணிச்சுமைகளிலிருந்து நாங்கள் கற்றுக்கொள்வதைப் பயன்படுத்தி, ஸ்டாக்கின் ஒவ்வொரு அடுக்கையும் மேம்படுத்துகிறோம். Jalapeño என்பது அளவிடப்பட்ட முடிவுகளுடன் செயல்படும் முதன்மை சிலிக்கான் ஆகும். இது பல தலைமுறைகளுக்கான தளத்தின் தொடக்கம். வரவிருக்கும் மாதங்களில், எங்கள் வாடிக்கையாளர்களுக்கு மேலும் வேகமான, அதிக திறன்மிக்க மற்றும் அதிக செயல்திறன் கொண்ட தயாரிப்புகளை வழங்க Jalapeño ஐ விரிவுபடுத்துவோம்.

Jalapeño இன் செயல்திறனை எவ்வாறு அளவிட்டோம்

ஒத்த பயனர் அனுபவ நிலையில் செயல்திறனை நாங்கள் மதிப்பீடு செய்கிறோம்; வாடிக்கையாளர்களும் ஊடாடும் ஏஜென்ட்களும் தேவைப்படும் தாமத நேரத்தை பூர்த்தி செய்வதுடன், ஒவ்வொரு மின்சக்தி அலகிற்கும் ஒவ்வொரு அமைப்பும் எவ்வளவு பயனுள்ள AI பணிகளை முடிக்க முடியும் என்பதை அளவிடுகிறோம். இது ஏஜெண்டுகளுக்கு குறிப்பாக முக்கியமானது; ஏனெனில் அவை பல படிகளை வரிசையாக முடிக்க வேண்டியிருக்கும், எனவே தாமதங்கள் முழு பணியிலும் அதிகரித்துக் கொண்டே போகலாம்.

நடைமுறையில் Jalapeño எவ்வாறு செயல்படுகிறது என்பதைப் புரிந்துகொள்ள, AI கோரிக்கைக்கு சேவை வழங்கும் முழு செயல்முறையை அளவிடும் SemiAnalysis-இன் பொது பெஞ்ச்மார்க் InferenceX இல் அதைச் சோதித்தோம். சோதிக்கப்பட்ட செயல்பாட்டு வரம்பு முழுவதும், அதிகம் த்ரூபுட் சேவை வழங்கலிலிருந்து மிகவும் ஊடாடக்கூடிய, குறைந்த தாமதப் பயன்பாடு வரை, முன்னணி வணிக ரீதியாகக் கிடைக்கும் AI முறைமைகளுடன் Jalapeño ஐ ஒப்பிட்டோம். த்ரூபுட், மின்சக்தித் திறன் மற்றும் தாமதம் ஆகியவற்றின் சிறந்த ஒருங்கிணைப்பை Jalapeño வழங்கியது. செயல்திறன் சில நேரங்களில் சிப் ஒன்றுக்கு எனத் தெரிவிக்கப்படுகிறதாயினும், மின்திறனின் ஒரு அலகுக்கு கிடைக்கும் செயல்திறனே அதிக பயனுள்ள தரநிலை என்று நாங்கள் நம்புகிறோம்.

முந்தைய சிறந்த TBT-ஐ விட Jalapeño முன்னிலை அதிகரிக்கிறது

Jalapeño ஒவ்வொரு பயனருக்கும் அதிக டோக்கன்களை வழங்குகிறது

Jalapeño ஒரு கிலோவாட்டுக்கு அதிக த்ரூபுட் வழங்குகிறது

மூன்று பொது மாடல்களிலும், சோதிக்கப்பட்ட செயல்பாட்டு வரம்பு முழுவதும் Jalapeño வாட்டுக்கு செயல்திறன் மற்றும் தாமதத்தின் சிறந்த கலவையை வழங்கி, அதிநவீன எல்லையில் இடம்பிடித்தது. அமைப்புகளை ஒரே மாதிரியாக ஒப்பிடுவதற்காக, ஒவ்வொரு ஆக்சிலரேட்டரின் வெளியிடப்பட்ட சிப் மின்சக்தி மதிப்பீட்டைப் பயன்படுத்தி முடிவுகளைச் சீராக்கினோம். Jalapeño 700 வாட் மதிப்பீட்டைக் கொண்டதாகக் குறிப்பிடப்பட்டிருந்தாலும், சோதிக்கப்பட்ட பணிச்சுமைகளில் அதன் அளவிடப்பட்ட தொடர்ச்சியான மின்திறன் 550 வாட் அல்லது அதற்குக் குறைவாகவே இருந்தது.

Jalapeño, GPT‑OSS 120B, DeepSeek R1 670B மற்றும் Kimi K2.5 1T ஆகியவற்றில் வலுவான செயல்திறனைக் காட்டியது. நாங்கள் சோதித்த மிகப்பெரிய பொதுமக்களுக்கு கிடைக்கக்கூடிய மாடலான Kimi-யில், ஒப்பீட்டு அமைப்பைவிட ஒரு வாட் தோராயமாக 1.5 மடங்கு அதிக உச்ச செயல்திறனையும், 3.4 மடங்கு குறைந்த எண்ட்-டு-எண்ட் தாமதத்தையும் வழங்கியது. எங்கள் உள்நிலை சோதனைகளில், அதிநவீன OpenAI மாடல்களில் Jalapeño இன் முன்னிலை மேலும் விரிவடைந்தது; பணிச்சுமைகள் பெரிதாகவும் அதிகக் கோரிக்கையுடனும் வளரும்போது இந்த கட்டமைப்பு அதிக மதிப்புடையதாகிறது என்பதை இது சுட்டிக்காட்டுகிறது.

ஒரே சிப்பிற்குள் வேகம் மற்றும் செயல்திறனுக்காக கட்டமைத்தல்

Jalapeño ஆரம்பத்திலிருந்தே ஒரு கேள்வியை முன்வைத்து வடிவமைக்கப்பட்டது: நவீன மற்றும் எதிர்கால மொழி மாடல்களுக்கு, குறிப்பாக தொடர்பாடும் ஏஜென்ட்களுக்கு சேவை வழங்குவதே அதன் முதன்மைப் பணியாக இருந்தால், நாம் எந்த வன்பொருளை உருவாக்குவோம்? உண்மையான மொழி-மாடல் பணிச்சுமைகளை மையமாகக் கொண்டு சிப், நினைவகம், நெட்வொர்க், மென்பொருள் மற்றும் ரேக் அளவிலான முறைமை ஆகியவற்றை ஒருங்கிணைத்து வடிவமைப்பதிலிருந்து Jalapeño-வின் ஆதாயங்கள் கிடைக்கின்றன. மொழி மாடல் அனுமானம் பல தனித்துவமான கட்டங்களை, வெவ்வேறு இடையூறுகளுடன் கடந்து செல்கிறது. முறைமை ஒரு ப்ராம்ப்ட்டைச் செயலாக்கும் Prefill கட்டம் கணிப்பீட்டு தீவிரமானது; அதேவேளை, முறைமை பதிலை டோக்கன் டோக்கனாக உருவாக்கும் decode கட்டம் நினைவக அலைவரிசையால் கட்டுப்படுத்தப்படுகிறது. தரவு கோர்கள் மற்றும் சிப்புகளுக்கு இடையே நகரும் போது, தகவல்தொடர்பும் தாமதத்தைச் சேர்க்கலாம்; இதனால் சில செயலாக்க அலகுகள் காத்திருக்கும்போது செயலற்ற நிலையில் இருக்கும். ஒரு கட்டத்தில் சிறப்பாக செயல்படும் அமைப்பு, தரவுக்காகக் காத்திருக்கும்போது அல்லது வெவ்வேறு வளங்களுக்கு இடையே மாடலின் நிலையை நகர்த்தும்போது அந்த முன்னிலை இழக்கலாம்.

தரவு நகர்வையும் தொடர்பு தாமதங்களையும் குறைந்தபட்சமாக வைத்திருக்க Jalapeño-வை வடிவமைத்தோம். இதன் பொருள், பதிலை உருவாக்கும் போது பயன்படுத்தப்படும் KV cache உள்ளிட்ட மாடல் நிலையை வெளிப்படையாக இடமளித்து உள்ளூரிலேயே வைத்திருக்க முடியும் என்பதாகும்; அதே வேளையில், ஒவ்வொரு அனுமான கட்டத்திற்கும் சரியான கம்ப்யூட், நினைவகம் மற்றும் நெட்வொர்க்கிங் கலவையை முறைமைச் செயல்படுத்துகிறது. பிணையம் கட்டமைப்பின் இன்றியமையாத பகுதியாகும். அதன் பெரிய டொமைன், முழுப் பணிச்சுமையும் ஒரே இணைக்கப்பட்ட அமைப்பிற்குள் தொடர அனுமதிக்கிறது; இதனால் தரவு நகர்வைக் குறைத்து, முழுக் கோரிக்கையும் ஆரம்பம் முதல் முடிவு வரை வேகமாகவும் திறனுள்ளதாகவும் இருக்க உதவுகிறது. இதன் விளைவாக, மாறிவரும் மாடல் கட்டமைப்புகளை ஆதரிக்கக்கூடிய, ப்ரீஃபில் மற்றும் டிகோடு ஆகிய இரண்டிலும் சிறப்பாகச் செயல்படக்கூடிய, அவற்றுக்கு இடையிலான சமநிலை மாறும்போது அதற்கேற்பத் தழுவிக்கொள்ளக்கூடிய சமநிலையான மற்றும் பரிமாற்றத்தக்க ஆக்சிலரேட்டர் உருவாகிறது; இது ஏஜென்டிக் பணிச்சுமைகளின் வரையறுக்கும் அம்சமாகும்.

நாங்கள் சிப் வடிவமைப்புக்கு AI-ஐ பயன்படுத்தினோம், மேலும் AI அதனை நிரலாக்கக்கூடிய வகையில் அந்தச் சிப்பை வடிவமைத்தோம்

Jalapeño-வின் மேம்பாட்டில் AI நேரடியாக பங்கு பெற்றது. செயல்படுத்தல் முறைகளை ஆராய்ந்து, வடிவமைப்பு, அளவீடு மற்றும் சரிபார்ப்பு சுழற்சிகளை குறைத்து, மாடல் பணிச்சுமைகளில் தொடர்ந்து மறு செயல்பாடுகளை மேற்கொண்டு, குழுவுக்கு ஆரம்ப வடிவமைப்பிலிருந்து டேப்பவுட் வரை ஒன்பது மாதங்களில் முன்னேற உதவியது. AI-யும் சிப்பின் எண்கணிதச் சுற்றுகளை மேம்படுத்த உதவியது. இதனால், குழுவால் திட்டமிட்ட கால அட்டவணைக்குள் சிப்பில் அதிக கணிப்பீட்டு செயல்திறனை ஒருங்கிணைக்க முடிந்தது.

Jalapeño மனிதர்களுக்கும் AI-க்கும் தெளிவான, முன்கணிக்கக்கூடிய நிரலாக்க இலக்காக வடிவமைக்கப்பட்டது. பொறியாளர்கள் உள்ளூர் டென்சர்கள், வெளிப்படையான தகவல்தொடர்பு மற்றும் முன்னறியக்கூடிய ஒத்திசைவு மூலம் பணியை விவரிக்க முடியும். பின்னர், அந்தப் பணி அமைப்பு முழுவதும் எவ்வாறு மேப் செய்யப்படுகிறது, இடமிடப்படுகிறது, அட்டவணைப்படுத்தப்படுகிறது மற்றும் ஒருங்கிணைக்கப்படுகிறது என்பதை AI முன்னேற்றம் செய்கிறது. அந்தத் தெளிவான, கணிக்கத்தக்க கட்டமைப்பு, பாரம்பரியமாக கடினமாகக் கருதப்படும் இணைநிலை நிரலாக்கச் சிக்கலைச் சமாளிக்க AI-க்கு நடைமுறையில் கையாளக்கூடிய ஒரு வழியை வழங்குகிறது.

ஒவ்வொரு புதிய மாடல் குடும்பத்தையும் ஆதரிப்பதற்கு இன்னும் புதிய கர்னல்களும் மாடல்-குறிப்பிட்ட மேம்படுத்தல்களும் தேவைப்படுகின்றன. Codex-ஐ GPT‑Astra உடன் பயன்படுத்தி, Jalapeño-வின் அசல் உற்பத்தித் திட்டத்தின் பகுதியாக இல்லாத மூன்று ஓபன் வேயிட் மாடல்களை குழு இரண்டு மாதங்களுக்குள் உயர் செயல்திறனுக்குக் கொண்டு வந்தது. இது, கட்டமைப்பின் நெகிழ்வுத்தன்மையையும், அதை நிரலாக்குவதில் AI எவ்வளவு வேகமாக நமக்கு உதவ முடியும் என்பதையும் காட்டியது. தேர்ந்தெடுக்கப்பட்ட GPT‑OSS அட்டென்ஷன் மற்றும் நிபுணர்-கலவை பிளாக்குகளுக்கு, AI உருவாக்கிய செயலாக்கங்கள், தற்போதுள்ள மனித நிபுணர்களால் எழுதப்பட்ட செயலாக்கங்களை விட 1.5 முதல் 1.8 மடங்கு வேகமாக இயங்கின. அந்த புள்ளிவிவரங்கள் முழு மாடலுக்கல்ல, தேர்ந்தெடுக்கப்பட்ட பிளாக்குகளுக்குப் பொருந்தும். ஆனால் அவை சக்திவாய்ந்த புதிய மேம்பாட்டுச் சுழற்சியைச் சுட்டிக்காட்டுகின்றன.

திறமையான மற்றும் Ultra-வேகமான கணிப்புக்கான முன்னோக்கிய பாதை

AI உள்கட்டமைப்பு மதிப்புமிக்கது. அது பயனுள்ள நிஜ உலகப் பணிகளைச் செய்ய வழிவகுக்கிறது. அதே மின்சக்தி மற்றும் வன்பொருளிலிருந்து அதிக பயனுள்ள பணியை உருவாக்குவதன் மூலம், Jalapeño அதிக தேவையைப் பூர்த்தி செய்யவும், வெற்றிகரமான முடிவை வழங்குவதற்கான செலவைக் குறைக்கவும் எங்களுக்கு உதவும். OpenAI-க்கு, சேவை வழங்குவதற்கான செலவைவிட பயனுள்ள பணி மற்றும் வருவாய் வேகமாக வளர அனுமதிப்பதன் மூலம், இது செயல்திறன் மேம்பாட்டை அதிகரிக்க உதவும். சிறந்த மாடல்கள், தயாரிப்புகள் மற்றும் உள்கட்டமைப்பில் பரவலான ஏற்றுக்கொள்ளலுக்கும் தொடர்ச்சியான முதலீட்டுக்கும் இது ஆதரவளிக்கும். வேகமான கணிப்பு வேகமான மீள்செயலாக்கத்தையும் புதிய பயன்பாட்டு நிகழ்வுகளையும் சாத்தியமாக்கலாம்.

திறமையான, குறைந்த தாமதநேரம் கொண்ட அனுமானத்திற்கான சாத்தியங்களை Jalapeño விரிவுபடுத்துகிறது:

  • Ultra-வேகமான பயன்முறை கணிப்பு முன்னர் விரைவுப் பயன்முறையில் மட்டுமே கிடைத்த செயல்திறனில்
  • முன்னர் தொகுதிப் பயன்முறையில் மட்டுமே கிடைத்த செயல்திறன்களை வழங்கும் விரைவுப் பயன்முறை அனுமானம்
  • தொகுப்பு-முறை இன்ஃபெரன்ஸுக்கு அதிகம் செயல்திறன்

இந்த ஆண்டு இறுதிக்குள் OpenAI இன் கணினி உள்கட்டமைப்பில் Jalapeño-வை நிலைநிறுத்தத் தொடங்க திட்டமிட்டுள்ளோம். பல தலைமுறைகளைக் கொண்ட ரோட்மேப்பின் முதல் தலைமுறை இது: Gen 2 மேம்பாட்டில் தீவிரமாக உள்ளது, மேலும் Gen 3 உருவம் பெற்று வருகிறது. ஒவ்வொரு தலைமுறையும் நாம் கற்றுக்கொள்வதை அடிப்படையாகக் கொண்டு, செயல்திறனையும் வேகத்தையும் மேலும் மேம்படுத்தும்.

AI வளர்ந்து வரும் தேவையை பூர்த்தி செய்ய, கிடைக்கக்கூடிய ஒவ்வொரு மூலத்திலிருந்தும் கூடுதல் கணக்கீட்டு வளம் தேவைப்படும். பயிற்சி மற்றும் முன்கூட்டிய கணக்கீட்டு பணிகளுக்கான பணிச்சுமைகளுக்காக NVIDIA மற்றும் பிற கூட்டாளர்களிடமிருந்து ஆக்சிலரேட்டர்களை பரவலாகப் பயன்படுத்துவதைத் தொடர்வோம். செயற்கைப் பொது நுண்ணறிவு முழு மனிதகுலத்திற்கும் பயனளிப்பதை உறுதிப்படுத்துவதே எங்கள் நோக்கமாகும்.

வெளியீட்டிற்குத் தயாராகும் நிலையில், உற்பத்தித் தகுதிப்படுத்தலைத் தொடர்ந்து மேற்கொண்டு, மென்பொருளை வளர்த்துக் கொண்டு, Jalapeño-வை பெரிய அளவில் இயக்கத் தயாராகி, மேலும் பல மாடல்களில் செயல்திறனைச் சரிபார்க்கிறோம். முழு அமைப்பையும் ஒன்றாக வடிவமைக்கும்போது என்ன சாத்தியம் என்பதை இதுவரையிலான முடிவுகள் காட்டுகின்றன: மேலும் பலருக்கு, அதிகப் பதிலளிப்புத் திறன் கொண்ட, திறன்மிக்க, ஏஜென்டிக் AI-ஐ மேலும் திறம்பட வழங்க முடியும்.

பின்இணைப்பு

Jalapeño, GPT‑OSS 120B-இல் பரேட்டோ முன்னணியாகும்

kW க்கு அதிகபட்ச THROUGHPUT முன்னிலை

InferenceX · GPT‑OSS‑120B · பெயரளவு 8k/1k · STP · பேக்கேஜ் TDP: Jalapeño 700 W; GB200 1,200 W

GPT‑OSS செயல்பாட்டுப் புள்ளிகள் முழுவதும் Jalapeño முன்னிலை வகிக்கிறது

உச்ச மற்றும் பொருந்தும் த்ரூபுட்

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · package TDP: Jalapeño 700 W; GB200 1,200 W

அதிகம் உச்ச கலப்பு TPS / kW

≈1.9×

85,448 vs. 44,960 கலப்பு / kW

முனையிலிருந்து முனை வரையிலான குறைந்த தாமதம்

≈1.7×

1.03 s vs. 1.80 s

குறைந்தபட்ச TBT-ஐக் குறைக்கவும்

≈2.7×

0.69 vs. 1.87 ms (1,459 vs. 535 tok/s/user)

முந்தைய TBT-இல் அதிக த்ரூபுட்

≈53.7×

22,935 vs. 427 கலப்பு / kW (535.28 tok/s/user)

Jalapeño என்பது DeepSeek R1 670B-இல் பரேட்டோ முன்னணியாகும்

kW க்கு அதிகபட்ச Throughput முன்னணி

InferenceX · DeepSeek R1 MXFP4 · பெயரளவு 8k/1k · STP · தொகுப்பு TDP: Jalapeño 700 W; GB300 1,400 W

DeepSeek R1 செயல்பாட்டு புள்ளிகள் அனைத்திலும் Jalapeño முன்னிலை வகிக்கிறது

உச்ச மற்றும் பொருந்திய த்ரூபுட்

InferenceX · DeepSeek R1 MXFP4 · பெயரளவு 8k/1k · STP · package TDP: Jalapeño 700 W; GB300 1,400 W

அதிகம் உச்ச கலப்பு TPS / kW

≈1.7×

19,641 vs. 11,781 கலப்பு / kW

முனையிலிருந்து முனை வரையிலான குறைந்த தாமதம்

≈3.6×

1.65 s vs. 5.99 s

குறைந்தபட்ச TBT-ஐக் குறைக்கவும்

≈4.1×

1.43 vs. 5.90 ms (700 vs. 169 tok/s/user)

முந்தைய TBT-இல் அதிக த்ரூபுட்

≈104.3×

12,258 vs. 118 கலப்பு / kW (169.41 tok/s/user இல்)

Jalapeño, Kimi K2.5 1T-இல் பரேட்டோ முன்னணியாக உள்ளது

kW க்கு அதிகபட்ச Throughput முன்னணி

InferenceX · Kimi K2.5 MXFP4 · பெயரளவு 8k/1k· STP · தொகுப்பு TDP: Jalapeño 700 W; GB300 1,400 W

Kimi K2.5 இயக்கப் புள்ளிகள் முழுவதும் Jalapeño முன்னிலை வகிக்கிறது

அதிகபட்ச மற்றும் பொருந்திய த்ரூபுட்

InferenceX · Kimi K2.5 MXFP4 · பெயரளவு 8k/1k · STP · தொகுப்பு TDP: Jalapeño 700 W; GB300 1,400 W

அதிகம் உச்ச கலப்பு TPS / kW

≈1.5×

18,195 vs. 11,862 கலப்பு / kW

முனையிலிருந்து முனை வரையிலான குறைந்த தாமதம்

≈3.4×

1.56 s vs. 5.31 s

குறைந்தபட்ச TBT-ஐக் குறைக்கவும்

≈3.8×

1.44 vs. 5.48 ms (694 vs. 182 tok/s/user)

முந்தைய TBT-இல் அதிக த்ரூபுட்

≈56.1×

6,744 vs. 120 கலப்பு / kW (182.46 tok/s/user இல்)

ஆசிரியர்

OpenAI