ప్రధాన కంటెంట్‌కి దాటండి
OpenAI

25 ఆగస్టు, 2026

ఇంజనీరింగ్Company

Jalapeño తొలి ఫలితాలు AI ఇన్‌ఫరెన్స్‌లో ఇండస్ట్రీ-లీడింగ్ స్పీడ్, ఎఫిషియెన్సీని చూపిస్తున్నాయి.

లోడ్ అవుతోంది…
టీల్ రంగు సర్క్యూట్ బోర్డ్‌పై అమర్చబడిన Jalapeño ఇన్ఫెరెన్స్ చిప్ యొక్క క్లోజ్-అప్.

OpenAI తొలి కస్టమ్ ఇన్ఫరెన్స్ చిప్ Jalapeñoను ప్రకటించినప్పటి నుంచి, మేము చిప్‌ను మరియు దాని చుట్టూ నిర్మించిన సిస్టమ్‌ను పరీక్షిస్తున్నాము. ఫలితాలు పనితీరులో గణనీయమైన పురోగతిని చూపిస్తున్నాయి: Jalapeño విద్యుత్ శక్తి యొక్క ప్రతి యూనిట్‌కు మరింత AI పనిభారాన్ని నిర్వహించగలదు, అలాగే ప్రతిస్పందనలను మరింత వేగంగా అందిస్తుంది. Jalapeño ఒకే ఆర్కిటెక్చర్‌తో అధిక థ్రూపుట్ మరియు తక్కువ లేటెన్సీ రెండింటినీ అందిస్తుంది, అయితే ప్రస్తుత హార్డ్‌వేర్ సిస్టమ్‌లు తరచుగా ఈ రెండింటి మధ్య రాజీ చేసుకోవాల్సి వస్తుంది.

కస్టమర్‌లకు, డిమాండ్ పెరిగేకొద్దీ వేగవంతమైన స్పందనలు, మరింత చురుకైన ఏజెంట్లు, మరియు మరింత విశ్వసనీయమైన ప్రాప్యత అందుబాటులో ఉండటం అర్థం. ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ మొత్తం మానవాళికి ప్రయోజనం చేకూర్చేలా చూడడమే మా లక్ష్యం. ఈ పురోగతులు, మరింత సామర్థ్యవంతమైన AIని మరింత అందుబాటులో ఉంచడంలో మరియు మరింత అందుబాటులో ఉండేలా చేయడంలో సహాయపడతాయి.

OpenAI మోడల్‌లు కూడా Jalapeño అభివృద్ధిని వేగవంతం చేశాయి. ప్రారంభ తరాలు చిప్‌ను డిజైన్ చేసి పనిచేసేలా చేయడంలో టీమ్‌కు సహాయపడ్డాయి, కాగా మా తాజా మోడల్‌లు దానిని ఎలా ఆప్టిమైజ్ చేసి ప్రోగ్రామ్ చేయాలో వేగవంతం చేస్తున్నాయి. Jalapeño పనితీరు GPT‑OSS 120B, DeepSeek R1, మరియు Kimi K2.5 1T అంతటా విస్తరించింది. OpenAI లోపల, బయట అభివృద్ధి చేసిన మోడల్‌లలోనూ ఈ ఆర్కిటెక్చర్ పనిచేస్తుందని ఇది చూపిస్తుంది. ఈ మూడింటిలోనూ, గరిష్ట థ్రూపుట్ వద్ద Jalapeño వాట్‌కు 1.5 నుండి 1.9 రెట్లు ఎక్కువ AI పనిని అందించింది మరియు పోలిక వ్యవస్థల కంటే ఎండ్-టు-ఎండ్ లేటెన్సీని 1.7 నుండి 3.6 రెట్లు తగ్గించింది. హై ఇంటరాక్టివ్ వర్క్‌లోడ్‌ల కోసం, ఇది 2.1 నుండి 4.1 రెట్లు అధిక పనితీరును అందించింది.

Jalapeño కూడా విస్తృతమైన ఫుల్-స్టాక్ ప్రయోజనానికి నిదర్శనం. OpenAI నిజమైన పనిభారాల నుంచి నేర్చుకున్న విషయాలను ఉపయోగించి, మోడళ్లు, ఉత్పత్తులు, సర్వింగ్ సాఫ్ట్‌వేర్, చిప్‌లు, మెమరీ, నెట్‌వర్కింగ్, సిస్టమ్‌లను కలిసి స్టాక్ యొక్క ప్రతి లేయర్‌ను మెరుగుపరచడానికి రూపకల్పన చేయగలదు. Jalapeño కొలిచిన ఫలితాలతో పనిచేస్తున్న ఫస్ట్-పార్టీ సిలికాన్, మరియు ఇది బహుళ తరాల ప్లాట్‌ఫారమ్ ప్రారంభం. రాబోయే నెలల్లో, మా కస్టమర్ల కోసం వేగవంతమైన, సామర్థ్యవంతమైన మరియు సమర్థవంతమైన ఉత్పత్తులను అందించేందుకు మేము Jalapeñoను విస్తరింపజేస్తాము.

Jalapeño పనితీరును మేము ఎలా కొలిచాము

కస్టమర్లు మరియు ఇంటరాక్టివ్ ఏజెంట్లకు అవసరమైన జాప్యాన్ని తీర్చుతూ, సమానమైన వినియోగదారు అనుభవం వద్ద ప్రతి సిస్టమ్ విద్యుత్ శక్తి యొక్క ఒక్కో యూనిట్‌కు ఎంత ఉపయోగకరమైన AI పనిని పూర్తి చేయగలదో కొలుస్తూ మేము పనితీరును మూల్యాంకనం చేస్తాము. ఇది ప్రత్యేకంగా ఏజెంట్లకు ముఖ్యమైనది, ఎందుకంటే అవి వరుసగా అనేక దశలను పూర్తి చేయాల్సి ఉంటుంది, కాబట్టి ఆలస్యాలు మొత్తం పనంతటా పేరుకుపోవచ్చు.

Jalapeño ఆచరణలో ఎలా పనిచేస్తుందో అర్థం చేసుకోవడానికి, AI అభ్యర్థనను సర్వ్ చేసే పూర్తి ప్రక్రియను కొలిచే SemiAnalysis నుండి వచ్చిన పబ్లిక్ బెంచ్‌మార్క్ అయిన InferenceX పై మేము దాన్ని పరీక్షించాము. హై-థ్రూపుట్ సర్వింగ్ నుంచి అత్యంత ఇంటరాక్టివ్, తక్కువ-లేటెన్సీ వినియోగం వరకు పరీక్షించిన ఆపరేటింగ్ పరిధిలో వాణిజ్యపరంగా అందుబాటులో ఉన్న ప్రముఖ AI వ్యవస్థలతో Jalapeñoను మేము పోల్చాము. థ్రూపుట్, పవర్ సామర్థ్యం, లేటెన్సీ కలయికలో Jalapeño మెరుగైన ఫలితాన్ని అందించింది. పనితీరు కొన్ని సందర్భాల్లో ఒక్కో చిప్‌కు నివేదించబడినా, మరింత ఉపయోగకరమైన ప్రమాణం విద్యుత్ శక్తి యూనిట్‌కు పనితీరు అని మేము నమ్ముతున్నాము.

మునుపటి అత్యుత్తమ TBT వద్ద Jalapeño ఆధిక్యాన్ని మరింత పెంచింది

Jalapeño ప్రతి వినియోగదారుకు మరిన్ని టోకెన్‌లను అందిస్తుంది

Jalapeño ప్రతి కిలోవాట్‌కు మరింత థ్రూపుట్‌ను అందిస్తుంది

మూడు పబ్లిక్ మోడళ్లన్నింటిలోనూ, పరీక్షించిన ఆపరేటింగ్ పరిధి అంతటా Jalapeño వాట్‌కు పనితీరు మరియు లేటెన్సీ యొక్క మెరుగైన కలయికను అందించి, దానిని Pareto అత్యాధునిక సరిహద్దుపై ఉంచింది. సిస్టమ్‌లను సుసంగతంగా పోల్చడానికి, ప్రతి యాక్సిలరేటర్ యొక్క ప్రచురిత చిప్ పవర్ రేటింగ్‌ను ఉపయోగించి మేము ఫలితాలను సాధారణీకరించాము. Jalapeño 700 వాట్లుగా రేట్ చేయబడింది, అయితే పరీక్షించిన వర్క్‌లోడ్‌లలో దాని కొలిచిన నిరంతర పవర్ 550 వాట్ల వద్ద లేదా అంతకంటే తక్కువగానే ఉంది.

Jalapeño GPT‑OSS 120B, DeepSeek R1 670B మరియు Kimi K2.5 1T అంతటా బలంగా పనిచేసింది. మేము పరీక్షించిన అతిపెద్ద పబ్లిక్ మోడల్ అయిన Kimiలో, ఇది పోలిక వ్యవస్థ కంటే వాట్‌కు గరిష్ట పనితీరును సుమారు 1.5 రెట్లు ఎక్కువగా, ఎండ్-టు-ఎండ్ లేటెన్సీని 3.4 రెట్లు తక్కువగా అందించింది. మా అంతర్గత పరీక్షల్లో, అత్యాధునిక OpenAI మోడల్స్‌పై Jalapeño ప్రయోజనం మరింత విస్తరించింది; పనిభారాలు పెద్దవిగా, మరింత డిమాండ్ చేసేవిగా మారుతున్న కొద్దీ ఆర్కిటెక్చర్ విలువ పెరుగుతుందని ఇది సూచిస్తోంది.

ఒకే చిప్‌లో వేగం మరియు సామర్థ్యం కోసం ఆర్కిటెక్చర్ రూపకల్పన

Jalapeñoను మొదటి నుంచే ఈ ప్రశ్నతో రూపొందించాం: ఆధునిక, భవిష్యత్తు భాషా మోడల్‌లకు, ముఖ్యంగా ఇంటరాక్టివ్ ఏజెంట్‌లకు సేవలందించడమే దాని ప్రధాన పని అయితే మనం ఎలాంటి హార్డ్‌వేర్‌ను నిర్మిస్తాం? నిజమైన భాషా-మోడల్ పనిభారాల చుట్టూ చిప్, మెమరీ, నెట్‌వర్క్, సాఫ్ట్‌వేర్, ర్యాక్-స్థాయి వ్యవస్థను సమగ్రంగా రూపొందించడం వల్లే Jalapeño ప్రయోజనాలు వస్తాయి. భాషా-మోడల్ ఇన్‌ఫరెన్స్ వేర్వేరు అడ్డంకులతో కూడిన అనేక ప్రత్యేక దశల ద్వారా సాగుతుంది. సిస్టమ్ ప్రాంప్ట్‌ను ప్రాసెస్ చేసే ప్రీఫిల్ దశ కంప్యూట్‌ను ఎక్కువగా వినియోగిస్తుంది. సిస్టమ్ ప్రతిస్పందనను టోకెన్ వారీగా రూపొందించే డీకోడ్ దశ మాత్రం మెమరీ బ్యాండ్‌విడ్త్ ద్వారా ఎక్కువగా పరిమితం అవుతుంది. డేటా కోర్లు మరియు చిప్‌ల మధ్య తరలాల్సి వచ్చినప్పుడు కమ్యూనికేషన్ కూడా లేటెన్సీని పెంచగలదు, అవి వేచి ఉండే సమయంలో కొన్ని ప్రాసెసింగ్ యూనిట్‌లు నిష్క్రియంగా ఉండేలా చేస్తుంది. ఒక దశలో అత్యుత్తమంగా పనిచేసే సిస్టమ్, డేటా కోసం వేచి ఉండేటప్పుడు లేదా విభిన్న వనరుల మధ్య మోడల్ స్థితిని తరలించేటప్పుడు ఆ ప్రయోజనాన్ని కోల్పోవచ్చు.

డేటా కదలిక మరియు కమ్యూనికేషన్ ఆలస్యాలను తగ్గించేందుకు మేము Jalapeñoను రూపొందించాము. అంటే, రెస్పాన్స్ రూపొందిస్తున్నప్పుడు ఉపయోగించే KV cacheతో సహా మోడల్ స్థితిని స్పష్టంగా నిర్దిష్ట స్థానంలో ఉంచి, స్థానికంగానే ఉంచవచ్చు. అదే సమయంలో, ప్రతి ఇన్‌ఫరెన్స్ దశ కోసం సిస్టమ్ కంప్యూట్, మెమరీ, మరియు నెట్‌వర్కింగ్ యొక్క సరైన కలయికను సక్రియం చేస్తుంది. నెట్‌వర్క్ ఆర్కిటెక్చర్‌కు అవిభాజ్య భాగం. దాని విస్తృత డొమైన్ మొత్తం వర్క్‌లోడ్‌ను ఒకే అనుసంధానిత వ్యవస్థలో ఉంచడానికి అనుమతిస్తుంది, డేటా తరలింపును తగ్గిస్తుంది మరియు మొత్తం అభ్యర్థన ప్రారంభం నుండి ముగింపు వరకు వేగంగా, సమర్థవంతంగా ఉండేలా సహాయపడుతుంది. ఫలితంగా, మారుతున్న మోడల్ ఆర్కిటెక్చర్‌లకు మద్దతు ఇవ్వగల, ప్రీఫిల్ మరియు డీకోడ్ రెండింటిలోనూ అద్భుతంగా పనిచేయగల, వాటి మధ్య సమతుల్యత మారుతున్న కొద్దీ అనుకూలించగల సమతుల్యమైన, పరస్పరం ప్రత్యామ్నాయంగా ఉపయోగించగల యాక్సిలరేటర్ లభిస్తుంది. ఇది ఏజెంటిక్ వర్క్‌లోడ్‌ల నిర్వచనాత్మక లక్షణం.

చిప్‌ను డిజైన్ చేయడానికి మేము AIని ఉపయోగించాము, అలాగే AI దానిని ప్రోగ్రామ్ చేయగలిగేలా చిప్‌ను డిజైన్ చేశాము

Jalapeño అభివృద్ధిలో AI ప్రత్యక్ష పాత్ర పోషించింది. అమలు విధానాలను అన్వేషించడం, రూపకల్పన, కొలత, ధృవీకరణ చక్రాలను తగ్గించడం, మోడల్ పనిభారాలపై నిరంతరం పునరావృతం చేయడం ద్వారా బృందం ప్రారంభ రూపకల్పన నుంచి తొమ్మిది నెలల్లో టేప్‌అవుట్‌కు చేరింది. AI కూడా చిప్‌లోని అంకగణిత సర్క్యూట్లను మెరుగుపరచడంలో సహాయపడింది. తద్వారా బృందం నిర్ణీత షెడ్యూల్‌లో చిప్‌లో మరింత గణన పనితీరును సరైన సమయానికి అమర్చగలిగింది.

Jalapeñoను మానవులు మరియు AI రెండింటికీ స్పష్టమైన, ఊహించదగిన ప్రోగ్రామింగ్ లక్ష్యంగా రూపొందించారు. ఇంజినీర్లు స్థానిక టెన్సర్లు, స్పష్టమైన కమ్యూనికేషన్ మరియు ఊహించదగిన సమకాలీకరణ ద్వారా పనిని వివరించవచ్చు. AI ఆ తర్వాత ఆ పని సిస్టమ్ అంతటా ఎలా మ్యాప్ చేయబడాలి, స్థానపరచబడాలి, షెడ్యూల్ చేయబడాలి మరియు సమన్వయం చేయబడాలి అనేదాన్ని ఆప్టిమైజ్ చేయగలదు. ఆ స్పష్టమైన, ఊహించదగిన నిర్మాణం, సాంప్రదాయంగా క్లిష్టమైన సమాంతర ప్రోగ్రామింగ్ సమస్యను పరిష్కరించేందుకు AIకి ఆచరణీయమైన మార్గాన్ని అందిస్తుంది.

ప్రతి కొత్త మోడల్ కుటుంబానికి మద్దతు ఇవ్వడానికి ఇప్పటికీ కొత్త కెర్నల్‌లు మరియు మోడల్-నిర్దిష్ట ఆప్టిమైజేషన్‌లు అవసరం. Codex‌ను GPT‑Astraతో ఉపయోగించి, Jalapeño అసలు ప్రొడక్షన్ ప్లాన్‌లో భాగం కాని మూడు ఓపెన్ వెయిట్ మోడల్స్‌ను బృందం రెండు నెలల్లోనే హై పనితీరు స్థాయికి తీసుకువచ్చింది. ఇది ఆర్కిటెక్చర్ యొక్క అనువర్తనశీలతను, అలాగే దానిని ప్రోగ్రామ్ చేయడంలో AI మనకు ఎంత వేగంగా సహాయపడగలదో రెండింటినీ చూపించింది. ఎంపిక చేసిన GPT‑OSS అటెన్షన్ మరియు మిక్చర్-ఆఫ్-ఎక్స్‌పర్ట్స్ బ్లాక్‌లకు, AI రూపొందించిన అమలులు ఇప్పటికే ఉన్న మానవ నిపుణులు రాసిన అమలుల కంటే 1.5 నుండి 1.8 రెట్లు వేగంగా నడిచాయి. ఆ గణాంకాలు పూర్తి మోడల్‌కు కాకుండా ఎంచుకున్న బ్లాక్‌లకు వర్తిస్తాయి, కానీ అవి శక్తివంతమైన కొత్త అభివృద్ధి చక్రం వైపు సూచిస్తున్నాయి.

సమర్థవంతమైన, అల్ట్రా-ఫాస్ట్ ఇన్‌ఫరెన్స్ కోసం ముందున్న మార్గం

AI మౌలిక సదుపాయాలు విలువైనవి, ఎందుకంటే అవి వాస్తవ ప్రపంచంలో ఉపయోగకరమైన పనులు చేయడానికి వీలు కల్పిస్తాయి. అదే విద్యుత్ శక్తి మరియు హార్డ్‌వేర్‌తో మరింత ఉపయోగకరమైన పనిని ఉత్పత్తి చేయడం ద్వారా, Jalapeño ఎక్కువ డిమాండ్‌ను తీర్చడానికి మరియు విజయవంతమైన ఫలితాన్ని అందించడానికి అయ్యే ఖర్చును తగ్గించడానికి మాకు సహాయపడుతుంది. OpenAIకి, ఉపయోగకరమైన పని, ఆదాయం సేవలందించే ఖర్చు కంటే వేగంగా పెరగడానికి వీలు కల్పించడం ద్వారా ఇది నిర్వహణ లీవరేజ్‌ను మెరుగుపరచగలదు. మెరుగైన మోడళ్లు, ఉత్పత్తులు, మౌలిక సదుపాయాల్లో విస్తృత వినియోగానికీ నిరంతర పెట్టుబడులకూ ఇది మద్దతు ఇవ్వగలదు. వేగవంతమైన ఇన్ఫరెన్స్ వేగవంతమైన ఇటరేషన్‌ను మరియు కొత్త వినియోగ సందర్భాలను సాధ్యం చేయగలదు.

సమర్థవంతమైన, తక్కువ-లేటెన్సీ ఇన్ఫరెన్స్ కోసం సాధ్యమయ్యే పరిధిని Jalapeño విస్తరిస్తుంది:

  • ఇంతకు ముందు వేగవంతమైన మోడ్‌లో మాత్రమే అందుబాటులో ఉన్న సామర్థ్యాలతో అల్ట్రా-వేగవంతమైన మోడ్ ఇన్‌ఫరెన్స్
  • ఇంతకుముందు బ్యాచ్‌డ్ మోడ్‌లో మాత్రమే అందుబాటులో ఉన్న సామర్థ్యాలతో వేగవంతమైన మోడ్ ఇన్‌ఫరెన్స్
  • బ్యాచ్‌డ్-మోడ్ ఇన్‌ఫరెన్స్ కోసం హై సామర్థ్యం

ఈ సంవత్సరం చివరి నాటికి OpenAI కంప్యూట్ ఇన్‌ఫ్రాస్ట్రక్చర్‌లో Jalapeñoను డిప్లాయ్ చేయడం ప్రారంభించాలని మేము ప్లాన్ చేస్తున్నాము. ఇది బహుళ తరాల రోడ్‌మ్యాప్‌లో మొదటి తరం: Gen 2 అభివృద్ధిలో బాగా ముందుకు సాగింది, అలాగే Gen 3 రూపుదిద్దుకుంటోంది. ప్రతి తరం మనం నేర్చుకునే విషయాలపై ఆధారపడి, సామర్థ్యాన్ని మరియు వేగాన్ని మరింత ముందుకు తీసుకెళ్తుంది.

AI కోసం పెరుగుతున్న డిమాండ్‌ను తీర్చాలంటే, అందుబాటులో ఉన్న ప్రతి వనరు నుండి మరింత కంప్యూటింగ్ సామర్థ్యం అవసరం. మేము శిక్షణ మరియు ఇన్ఫరెన్స్ వర్క్‌లోడ్‌ల రెండింటికీ NVIDIA మరియు ఇతర భాగస్వాముల యాక్సిలరేటర్లను విస్తృతంగా నియోగించడం కొనసాగిస్తాము. మా లక్ష్యం ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ ద్వారా మొత్తం మానవజాతికి ప్రయోజనం చేకూరేలా చూడడం.

డిప్లాయ్‌మెంట్‌కు సిద్ధమవుతున్నప్పుడు, మేము ప్రొడక్షన్ క్వాలిఫికేషన్‌ను కొనసాగిస్తూ, సాఫ్ట్‌వేర్‌ను మరింత పరిపక్వం చేస్తూ, Jalapeñoను పెద్ద స్థాయిలో నిర్వహించడానికి సిద్ధమవుతూ, మరిన్ని మోడల్స్‌లో పనితీరును ధృవీకరిస్తున్నాం. పూర్తి సిస్టమ్‌ను కలిసి రూపకల్పన చేసినప్పుడు ఏమి సాధ్యమవుతుందో ఇప్పటివరకు వచ్చిన ఫలితాలు చూపిస్తున్నాయి: మరింత ప్రతిస్పందనాత్మకమైన, సామర్థ్యవంతమైన, ఏజెంటిక్ AIని మరింత సమర్థవంతంగా మరింత మందికి అందించడం.

అనుబంధం

GPT‑OSS 120B వద్ద Jalapeño పారెటో ఫ్రాంటియర్‌లో ఉంది

kWకు థ్రూపుట్ అత్యాధునిక సరిహద్దు

InferenceX · GPT‑OSS‑120B · నామమాత్రం 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB200 1,200 W

GPT‑OSS నిర్వహణ పాయింట్‌లలో Jalapeño ముందంజలో ఉంది

గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్

InferenceX · GPT‑OSS‑120B · నామమాత్రం 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB200 1,200 W

హై శిఖరం మిశ్రమ TPS / kW

≈1.9×

85,448 vs. 44,960 మిశ్రమం / kW

తక్కువ ఎండ్-టు-ఎండ్ జాప్యం

≈1.7×

1.03 s వర్సెస్ 1.80 s

కనిష్ట TBTని తగ్గించండి

≈2.7×

0.69 vs. 1.87 ms (1,459 vs. 535 tok/s/user)

మునుపటి TBT వద్ద మరింత థ్రూపుట్

≈53.7×

22,935 vs. 427 మిశ్రమం / kW (535.28 tok/s/user వద్ద)

Jalapeño DeepSeek R1 670B వద్ద అత్యాధునిక పరీటోలో ఉంది

kWకు అత్యాధునిక థ్రూపుట్

InferenceX · DeepSeek R1 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W

DeepSeek R1 ఆపరేటింగ్ పాయింట్లన్నింటిలో Jalapeño ముందంజలో ఉంది

గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్

InferenceX · DeepSeek R1 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W

హై శిఖర మిశ్రమ TPS / kW

≈1.7×

19,641 తులనగా 11,781 మిశ్రమ / kW

తక్కువ ఎండ్-టు-ఎండ్ జాప్యం

≈3.6×

1.65 సెకన్లు vs. 5.99 సెకన్లు

కనిష్ట TBTని తగ్గించండి

≈4.1×

ఒకటి.నాలుగు వర్సెస్ ఐదు.తొమ్మిది ms (700 vs. 169 tok/s/user)

మునుపటి TBT వద్ద మరింత థ్రూపుట్

≈104.3×

12,258 vs. 118 మిశ్రమ / kW (169.41 tok/s/user వద్ద)

Jalapeño Kimi K2.5 1T వద్ద పారెటో ఫ్రంట్‌యిర్‌గా ఉంది

kW-ప్రతి థ్రూపుట్ అత్యాధునిక

InferenceX · Kimi K2.5 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W

Kimi K2.5 ఆపరేటింగ్ పాయింట్లన్నింటిలో Jalapeño ముందంజలో ఉంది

గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్

InferenceX · Kimi K2.5 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W

హై శిఖర మిశ్రమ TPS / kW

≈1.5×

18,195 విరుద్ధంగా 11,862 మిశ్రమం / kW

తక్కువ ఎండ్-టు-ఎండ్ జాప్యం

≈3.4×

1.56 సెకన్లు vs. 5.31 సెకన్లు

కనిష్ట TBTని తగ్గించండి

≈3.8×

1.44 vs. 5.48 ms (694 vs. 182 tok/s/user)

మునుపటి TBT వద్ద మరింత థ్రూపుట్

≈56.1×

6,744 vs 120 మిశ్రమం / kW (182.46 టోకెన్లు/సెకను/యూజర్ వద్ద)

రచయిత

OpenAI