Jalapeño తొలి ఫలితాలు AI ఇన్ఫరెన్స్లో ఇండస్ట్రీ-లీడింగ్ స్పీడ్, ఎఫిషియెన్సీని చూపిస్తున్నాయి.

OpenAI తొలి కస్టమ్ ఇన్ఫరెన్స్ చిప్ Jalapeñoను ప్రకటించినప్పటి నుంచి, మేము చిప్ను మరియు దాని చుట్టూ నిర్మించిన సిస్టమ్ను పరీక్షిస్తున్నాము. ఫలితాలు పనితీరులో గణనీయమైన పురోగతిని చూపిస్తున్నాయి: Jalapeño విద్యుత్ శక్తి యొక్క ప్రతి యూనిట్కు మరింత AI పనిభారాన్ని నిర్వహించగలదు, అలాగే ప్రతిస్పందనలను మరింత వేగంగా అందిస్తుంది. Jalapeño ఒకే ఆర్కిటెక్చర్తో అధిక థ్రూపుట్ మరియు తక్కువ లేటెన్సీ రెండింటినీ అందిస్తుంది, అయితే ప్రస్తుత హార్డ్వేర్ సిస్టమ్లు తరచుగా ఈ రెండింటి మధ్య రాజీ చేసుకోవాల్సి వస్తుంది.
కస్టమర్లకు, డిమాండ్ పెరిగేకొద్దీ వేగవంతమైన స్పందనలు, మరింత చురుకైన ఏజెంట్లు, మరియు మరింత విశ్వసనీయమైన ప్రాప్యత అందుబాటులో ఉండటం అర్థం. ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ మొత్తం మానవాళికి ప్రయోజనం చేకూర్చేలా చూడడమే మా లక్ష్యం. ఈ పురోగతులు, మరింత సామర్థ్యవంతమైన AIని మరింత అందుబాటులో ఉంచడంలో మరియు మరింత అందుబాటులో ఉండేలా చేయడంలో సహాయపడతాయి.
OpenAI మోడల్లు కూడా Jalapeño అభివృద్ధిని వేగవంతం చేశాయి. ప్రారంభ తరాలు చిప్ను డిజైన్ చేసి పనిచేసేలా చేయడంలో టీమ్కు సహాయపడ్డాయి, కాగా మా తాజా మోడల్లు దానిని ఎలా ఆప్టిమైజ్ చేసి ప్రోగ్రామ్ చేయాలో వేగవంతం చేస్తున్నాయి. Jalapeño పనితీరు GPT‑OSS 120B, DeepSeek R1, మరియు Kimi K2.5 1T అంతటా విస్తరించింది. OpenAI లోపల, బయట అభివృద్ధి చేసిన మోడల్లలోనూ ఈ ఆర్కిటెక్చర్ పనిచేస్తుందని ఇది చూపిస్తుంది. ఈ మూడింటిలోనూ, గరిష్ట థ్రూపుట్ వద్ద Jalapeño వాట్కు 1.5 నుండి 1.9 రెట్లు ఎక్కువ AI పనిని అందించింది మరియు పోలిక వ్యవస్థల కంటే ఎండ్-టు-ఎండ్ లేటెన్సీని 1.7 నుండి 3.6 రెట్లు తగ్గించింది. హై ఇంటరాక్టివ్ వర్క్లోడ్ల కోసం, ఇది 2.1 నుండి 4.1 రెట్లు అధిక పనితీరును అందించింది.
Jalapeño కూడా విస్తృతమైన ఫుల్-స్టాక్ ప్రయోజనానికి నిదర్శనం. OpenAI నిజమైన పనిభారాల నుంచి నేర్చుకున్న విషయాలను ఉపయోగించి, మోడళ్లు, ఉత్పత్తులు, సర్వింగ్ సాఫ్ట్వేర్, చిప్లు, మెమరీ, నెట్వర్కింగ్, సిస్టమ్లను కలిసి స్టాక్ యొక్క ప్రతి లేయర్ను మెరుగుపరచడానికి రూపకల్పన చేయగలదు. Jalapeño కొలిచిన ఫలితాలతో పనిచేస్తున్న ఫస్ట్-పార్టీ సిలికాన్, మరియు ఇది బహుళ తరాల ప్లాట్ఫారమ్ ప్రారంభం. రాబోయే నెలల్లో, మా కస్టమర్ల కోసం వేగవంతమైన, సామర్థ్యవంతమైన మరియు సమర్థవంతమైన ఉత్పత్తులను అందించేందుకు మేము Jalapeñoను విస్తరింపజేస్తాము.
కస్టమర్లు మరియు ఇంటరాక్టివ్ ఏజెంట్లకు అవసరమైన జాప్యాన్ని తీర్చుతూ, సమానమైన వినియోగదారు అనుభవం వద్ద ప్రతి సిస్టమ్ విద్యుత్ శక్తి యొక్క ఒక్కో యూనిట్కు ఎంత ఉపయోగకరమైన AI పనిని పూర్తి చేయగలదో కొలుస్తూ మేము పనితీరును మూల్యాంకనం చేస్తాము. ఇది ప్రత్యేకంగా ఏజెంట్లకు ముఖ్యమైనది, ఎందుకంటే అవి వరుసగా అనేక దశలను పూర్తి చేయాల్సి ఉంటుంది, కాబట్టి ఆలస్యాలు మొత్తం పనంతటా పేరుకుపోవచ్చు.
Jalapeño ఆచరణలో ఎలా పనిచేస్తుందో అర్థం చేసుకోవడానికి, AI అభ్యర్థనను సర్వ్ చేసే పూర్తి ప్రక్రియను కొలిచే SemiAnalysis నుండి వచ్చిన పబ్లిక్ బెంచ్మార్క్ అయిన InferenceX పై మేము దాన్ని పరీక్షించాము. హై-థ్రూపుట్ సర్వింగ్ నుంచి అత్యంత ఇంటరాక్టివ్, తక్కువ-లేటెన్సీ వినియోగం వరకు పరీక్షించిన ఆపరేటింగ్ పరిధిలో వాణిజ్యపరంగా అందుబాటులో ఉన్న ప్రముఖ AI వ్యవస్థలతో Jalapeñoను మేము పోల్చాము. థ్రూపుట్, పవర్ సామర్థ్యం, లేటెన్సీ కలయికలో Jalapeño మెరుగైన ఫలితాన్ని అందించింది. పనితీరు కొన్ని సందర్భాల్లో ఒక్కో చిప్కు నివేదించబడినా, మరింత ఉపయోగకరమైన ప్రమాణం విద్యుత్ శక్తి యూనిట్కు పనితీరు అని మేము నమ్ముతున్నాము.
మూడు పబ్లిక్ మోడళ్లన్నింటిలోనూ, పరీక్షించిన ఆపరేటింగ్ పరిధి అంతటా Jalapeño వాట్కు పనితీరు మరియు లేటెన్సీ యొక్క మెరుగైన కలయికను అందించి, దానిని Pareto అత్యాధునిక సరిహద్దుపై ఉంచింది. సిస్టమ్లను సుసంగతంగా పోల్చడానికి, ప్రతి యాక్సిలరేటర్ యొక్క ప్రచురిత చిప్ పవర్ రేటింగ్ను ఉపయోగించి మేము ఫలితాలను సాధారణీకరించాము. Jalapeño 700 వాట్లుగా రేట్ చేయబడింది, అయితే పరీక్షించిన వర్క్లోడ్లలో దాని కొలిచిన నిరంతర పవర్ 550 వాట్ల వద్ద లేదా అంతకంటే తక్కువగానే ఉంది.
Jalapeño GPT‑OSS 120B, DeepSeek R1 670B మరియు Kimi K2.5 1T అంతటా బలంగా పనిచేసింది. మేము పరీక్షించిన అతిపెద్ద పబ్లిక్ మోడల్ అయిన Kimiలో, ఇది పోలిక వ్యవస్థ కంటే వాట్కు గరిష్ట పనితీరును సుమారు 1.5 రెట్లు ఎక్కువగా, ఎండ్-టు-ఎండ్ లేటెన్సీని 3.4 రెట్లు తక్కువగా అందించింది. మా అంతర్గత పరీక్షల్లో, అత్యాధునిక OpenAI మోడల్స్పై Jalapeño ప్రయోజనం మరింత విస్తరించింది; పనిభారాలు పెద్దవిగా, మరింత డిమాండ్ చేసేవిగా మారుతున్న కొద్దీ ఆర్కిటెక్చర్ విలువ పెరుగుతుందని ఇది సూచిస్తోంది.
Jalapeñoను మొదటి నుంచే ఈ ప్రశ్నతో రూపొందించాం: ఆధునిక, భవిష్యత్తు భాషా మోడల్లకు, ముఖ్యంగా ఇంటరాక్టివ్ ఏజెంట్లకు సేవలందించడమే దాని ప్రధాన పని అయితే మనం ఎలాంటి హార్డ్వేర్ను నిర్మిస్తాం? నిజమైన భాషా-మోడల్ పనిభారాల చుట్టూ చిప్, మెమరీ, నెట్వర్క్, సాఫ్ట్వేర్, ర్యాక్-స్థాయి వ్యవస్థను సమగ్రంగా రూపొందించడం వల్లే Jalapeño ప్రయోజనాలు వస్తాయి. భాషా-మోడల్ ఇన్ఫరెన్స్ వేర్వేరు అడ్డంకులతో కూడిన అనేక ప్రత్యేక దశల ద్వారా సాగుతుంది. సిస్టమ్ ప్రాంప్ట్ను ప్రాసెస్ చేసే ప్రీఫిల్ దశ కంప్యూట్ను ఎక్కువగా వినియోగిస్తుంది. సిస్టమ్ ప్రతిస్పందనను టోకెన్ వారీగా రూపొందించే డీకోడ్ దశ మాత్రం మెమరీ బ్యాండ్విడ్త్ ద్వారా ఎక్కువగా పరిమితం అవుతుంది. డేటా కోర్లు మరియు చిప్ల మధ్య తరలాల్సి వచ్చినప్పుడు కమ్యూనికేషన్ కూడా లేటెన్సీని పెంచగలదు, అవి వేచి ఉండే సమయంలో కొన్ని ప్రాసెసింగ్ యూనిట్లు నిష్క్రియంగా ఉండేలా చేస్తుంది. ఒక దశలో అత్యుత్తమంగా పనిచేసే సిస్టమ్, డేటా కోసం వేచి ఉండేటప్పుడు లేదా విభిన్న వనరుల మధ్య మోడల్ స్థితిని తరలించేటప్పుడు ఆ ప్రయోజనాన్ని కోల్పోవచ్చు.
డేటా కదలిక మరియు కమ్యూనికేషన్ ఆలస్యాలను తగ్గించేందుకు మేము Jalapeñoను రూపొందించాము. అంటే, రెస్పాన్స్ రూపొందిస్తున్నప్పుడు ఉపయోగించే KV cacheతో సహా మోడల్ స్థితిని స్పష్టంగా నిర్దిష్ట స్థానంలో ఉంచి, స్థానికంగానే ఉంచవచ్చు. అదే సమయంలో, ప్రతి ఇన్ఫరెన్స్ దశ కోసం సిస్టమ్ కంప్యూట్, మెమరీ, మరియు నెట్వర్కింగ్ యొక్క సరైన కలయికను సక్రియం చేస్తుంది. నెట్వర్క్ ఆర్కిటెక్చర్కు అవిభాజ్య భాగం. దాని విస్తృత డొమైన్ మొత్తం వర్క్లోడ్ను ఒకే అనుసంధానిత వ్యవస్థలో ఉంచడానికి అనుమతిస్తుంది, డేటా తరలింపును తగ్గిస్తుంది మరియు మొత్తం అభ్యర్థన ప్రారంభం నుండి ముగింపు వరకు వేగంగా, సమర్థవంతంగా ఉండేలా సహాయపడుతుంది. ఫలితంగా, మారుతున్న మోడల్ ఆర్కిటెక్చర్లకు మద్దతు ఇవ్వగల, ప్రీఫిల్ మరియు డీకోడ్ రెండింటిలోనూ అద్భుతంగా పనిచేయగల, వాటి మధ్య సమతుల్యత మారుతున్న కొద్దీ అనుకూలించగల సమతుల్యమైన, పరస్పరం ప్రత్యామ్నాయంగా ఉపయోగించగల యాక్సిలరేటర్ లభిస్తుంది. ఇది ఏజెంటిక్ వర్క్లోడ్ల నిర్వచనాత్మక లక్షణం.
Jalapeño అభివృద్ధిలో AI ప్రత్యక్ష పాత్ర పోషించింది. అమలు విధానాలను అన్వేషించడం, రూపకల్పన, కొలత, ధృవీకరణ చక్రాలను తగ్గించడం, మోడల్ పనిభారాలపై నిరంతరం పునరావృతం చేయడం ద్వారా బృందం ప్రారంభ రూపకల్పన నుంచి తొమ్మిది నెలల్లో టేప్అవుట్కు చేరింది. AI కూడా చిప్లోని అంకగణిత సర్క్యూట్లను మెరుగుపరచడంలో సహాయపడింది. తద్వారా బృందం నిర్ణీత షెడ్యూల్లో చిప్లో మరింత గణన పనితీరును సరైన సమయానికి అమర్చగలిగింది.
Jalapeñoను మానవులు మరియు AI రెండింటికీ స్పష్టమైన, ఊహించదగిన ప్రోగ్రామింగ్ లక్ష్యంగా రూపొందించారు. ఇంజినీర్లు స్థానిక టెన్సర్లు, స్పష్టమైన కమ్యూనికేషన్ మరియు ఊహించదగిన సమకాలీకరణ ద్వారా పనిని వివరించవచ్చు. AI ఆ తర్వాత ఆ పని సిస్టమ్ అంతటా ఎలా మ్యాప్ చేయబడాలి, స్థానపరచబడాలి, షెడ్యూల్ చేయబడాలి మరియు సమన్వయం చేయబడాలి అనేదాన్ని ఆప్టిమైజ్ చేయగలదు. ఆ స్పష్టమైన, ఊహించదగిన నిర్మాణం, సాంప్రదాయంగా క్లిష్టమైన సమాంతర ప్రోగ్రామింగ్ సమస్యను పరిష్కరించేందుకు AIకి ఆచరణీయమైన మార్గాన్ని అందిస్తుంది.
ప్రతి కొత్త మోడల్ కుటుంబానికి మద్దతు ఇవ్వడానికి ఇప్పటికీ కొత్త కెర్నల్లు మరియు మోడల్-నిర్దిష్ట ఆప్టిమైజేషన్లు అవసరం. Codexను GPT‑Astraతో ఉపయోగించి, Jalapeño అసలు ప్రొడక్షన్ ప్లాన్లో భాగం కాని మూడు ఓపెన్ వెయిట్ మోడల్స్ను బృందం రెండు నెలల్లోనే హై పనితీరు స్థాయికి తీసుకువచ్చింది. ఇది ఆర్కిటెక్చర్ యొక్క అనువర్తనశీలతను, అలాగే దానిని ప్రోగ్రామ్ చేయడంలో AI మనకు ఎంత వేగంగా సహాయపడగలదో రెండింటినీ చూపించింది. ఎంపిక చేసిన GPT‑OSS అటెన్షన్ మరియు మిక్చర్-ఆఫ్-ఎక్స్పర్ట్స్ బ్లాక్లకు, AI రూపొందించిన అమలులు ఇప్పటికే ఉన్న మానవ నిపుణులు రాసిన అమలుల కంటే 1.5 నుండి 1.8 రెట్లు వేగంగా నడిచాయి. ఆ గణాంకాలు పూర్తి మోడల్కు కాకుండా ఎంచుకున్న బ్లాక్లకు వర్తిస్తాయి, కానీ అవి శక్తివంతమైన కొత్త అభివృద్ధి చక్రం వైపు సూచిస్తున్నాయి.
AI మౌలిక సదుపాయాలు విలువైనవి, ఎందుకంటే అవి వాస్తవ ప్రపంచంలో ఉపయోగకరమైన పనులు చేయడానికి వీలు కల్పిస్తాయి. అదే విద్యుత్ శక్తి మరియు హార్డ్వేర్తో మరింత ఉపయోగకరమైన పనిని ఉత్పత్తి చేయడం ద్వారా, Jalapeño ఎక్కువ డిమాండ్ను తీర్చడానికి మరియు విజయవంతమైన ఫలితాన్ని అందించడానికి అయ్యే ఖర్చును తగ్గించడానికి మాకు సహాయపడుతుంది. OpenAIకి, ఉపయోగకరమైన పని, ఆదాయం సేవలందించే ఖర్చు కంటే వేగంగా పెరగడానికి వీలు కల్పించడం ద్వారా ఇది నిర్వహణ లీవరేజ్ను మెరుగుపరచగలదు. మెరుగైన మోడళ్లు, ఉత్పత్తులు, మౌలిక సదుపాయాల్లో విస్తృత వినియోగానికీ నిరంతర పెట్టుబడులకూ ఇది మద్దతు ఇవ్వగలదు. వేగవంతమైన ఇన్ఫరెన్స్ వేగవంతమైన ఇటరేషన్ను మరియు కొత్త వినియోగ సందర్భాలను సాధ్యం చేయగలదు.
సమర్థవంతమైన, తక్కువ-లేటెన్సీ ఇన్ఫరెన్స్ కోసం సాధ్యమయ్యే పరిధిని Jalapeño విస్తరిస్తుంది:
- ఇంతకు ముందు వేగవంతమైన మోడ్లో మాత్రమే అందుబాటులో ఉన్న సామర్థ్యాలతో అల్ట్రా-వేగవంతమైన మోడ్ ఇన్ఫరెన్స్
- ఇంతకుముందు బ్యాచ్డ్ మోడ్లో మాత్రమే అందుబాటులో ఉన్న సామర్థ్యాలతో వేగవంతమైన మోడ్ ఇన్ఫరెన్స్
- బ్యాచ్డ్-మోడ్ ఇన్ఫరెన్స్ కోసం హై సామర్థ్యం
ఈ సంవత్సరం చివరి నాటికి OpenAI కంప్యూట్ ఇన్ఫ్రాస్ట్రక్చర్లో Jalapeñoను డిప్లాయ్ చేయడం ప్రారంభించాలని మేము ప్లాన్ చేస్తున్నాము. ఇది బహుళ తరాల రోడ్మ్యాప్లో మొదటి తరం: Gen 2 అభివృద్ధిలో బాగా ముందుకు సాగింది, అలాగే Gen 3 రూపుదిద్దుకుంటోంది. ప్రతి తరం మనం నేర్చుకునే విషయాలపై ఆధారపడి, సామర్థ్యాన్ని మరియు వేగాన్ని మరింత ముందుకు తీసుకెళ్తుంది.
AI కోసం పెరుగుతున్న డిమాండ్ను తీర్చాలంటే, అందుబాటులో ఉన్న ప్రతి వనరు నుండి మరింత కంప్యూటింగ్ సామర్థ్యం అవసరం. మేము శిక్షణ మరియు ఇన్ఫరెన్స్ వర్క్లోడ్ల రెండింటికీ NVIDIA మరియు ఇతర భాగస్వాముల యాక్సిలరేటర్లను విస్తృతంగా నియోగించడం కొనసాగిస్తాము. మా లక్ష్యం ఆర్టిఫిషియల్ జనరల్ ఇంటెలిజెన్స్ ద్వారా మొత్తం మానవజాతికి ప్రయోజనం చేకూరేలా చూడడం.
డిప్లాయ్మెంట్కు సిద్ధమవుతున్నప్పుడు, మేము ప్రొడక్షన్ క్వాలిఫికేషన్ను కొనసాగిస్తూ, సాఫ్ట్వేర్ను మరింత పరిపక్వం చేస్తూ, Jalapeñoను పెద్ద స్థాయిలో నిర్వహించడానికి సిద్ధమవుతూ, మరిన్ని మోడల్స్లో పనితీరును ధృవీకరిస్తున్నాం. పూర్తి సిస్టమ్ను కలిసి రూపకల్పన చేసినప్పుడు ఏమి సాధ్యమవుతుందో ఇప్పటివరకు వచ్చిన ఫలితాలు చూపిస్తున్నాయి: మరింత ప్రతిస్పందనాత్మకమైన, సామర్థ్యవంతమైన, ఏజెంటిక్ AIని మరింత సమర్థవంతంగా మరింత మందికి అందించడం.
kWకు థ్రూపుట్ అత్యాధునిక సరిహద్దు
InferenceX · GPT‑OSS‑120B · నామమాత్రం 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB200 1,200 W
గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్
InferenceX · GPT‑OSS‑120B · నామమాత్రం 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB200 1,200 W
హై శిఖరం మిశ్రమ TPS / kW
≈1.9×
85,448 vs. 44,960 మిశ్రమం / kW
తక్కువ ఎండ్-టు-ఎండ్ జాప్యం
≈1.7×
1.03 s వర్సెస్ 1.80 s
కనిష్ట TBTని తగ్గించండి
≈2.7×
0.69 vs. 1.87 ms (1,459 vs. 535 tok/s/user)
మునుపటి TBT వద్ద మరింత థ్రూపుట్
≈53.7×
22,935 vs. 427 మిశ్రమం / kW (535.28 tok/s/user వద్ద)
kWకు అత్యాధునిక థ్రూపుట్
InferenceX · DeepSeek R1 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W
గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్
InferenceX · DeepSeek R1 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W
హై శిఖర మిశ్రమ TPS / kW
≈1.7×
19,641 తులనగా 11,781 మిశ్రమ / kW
తక్కువ ఎండ్-టు-ఎండ్ జాప్యం
≈3.6×
1.65 సెకన్లు vs. 5.99 సెకన్లు
కనిష్ట TBTని తగ్గించండి
≈4.1×
ఒకటి.నాలుగు వర్సెస్ ఐదు.తొమ్మిది ms (700 vs. 169 tok/s/user)
మునుపటి TBT వద్ద మరింత థ్రూపుట్
≈104.3×
12,258 vs. 118 మిశ్రమ / kW (169.41 tok/s/user వద్ద)
kW-ప్రతి థ్రూపుట్ అత్యాధునిక
InferenceX · Kimi K2.5 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W
గరిష్ఠ మరియు సరిపోలిన థ్రూపుట్
InferenceX · Kimi K2.5 MXFP4 · నామినల్ 8k/1k · STP · ప్యాకేజ్ TDP: Jalapeño 700 W; GB300 1,400 W
హై శిఖర మిశ్రమ TPS / kW
≈1.5×
18,195 విరుద్ధంగా 11,862 మిశ్రమం / kW
తక్కువ ఎండ్-టు-ఎండ్ జాప్యం
≈3.4×
1.56 సెకన్లు vs. 5.31 సెకన్లు
కనిష్ట TBTని తగ్గించండి
≈3.8×
1.44 vs. 5.48 ms (694 vs. 182 tok/s/user)
మునుపటి TBT వద్ద మరింత థ్రూపుట్
≈56.1×
6,744 vs 120 మిశ్రమం / kW (182.46 టోకెన్లు/సెకను/యూజర్ వద్ద)


