مرکزی مواد پر جائیں
OpenAI

۲۵ اگست، ۲۰۲۶

انجینئرنگکمپنی

Jalapeño کے ابتدائی نتائج AI inference میں صنعت کی سرکردہ رفتار اور مؤثریت دکھاتے ہیں

لوڈ ہو رہا ہے…
Jalapeño انفرنس چِپ کا کلوز اپ، جو ٹیل رنگ کے سرکٹ بورڈ پر نصب ہے.

Jalapeño، OpenAI کی پہلی کسٹم انفیرنس چپ، کے اعلان کے بعد سے ہم چپ اور اس کے گرد بنائے گئے نظام کی جانچ کر رہے ہیں. نتائج کارکردگی میں ایک نمایاں پیش رفت دکھاتے ہیں: Jalapeño توانائی کی فی اکائی زیادہ مصنوعی ذہانت کا کام انجام دے سکتا ہے، ساتھ ہی جوابات بھی زیادہ تیزی سے واپس دے سکتا ہے. Jalapeño ایک ہی آرکیٹیکچر کے ساتھ زیادہ تھروپٹ اور کم تاخیر، دونوں فراہم کرتا ہے، جبکہ موجودہ ہارڈ ویئر سسٹمز کو اکثر ان دونوں کے درمیان سمجھوتہ کرنا پڑتا ہے.

صارفین کے لیے، اس کا مطلب تیز تر جوابات، زیادہ مستعد ایجنٹس، اور جیسے جیسے طلب بڑھتی ہے، زیادہ قابلِ اعتماد رسائی ہے. ہمارا مشن ہے کہ مصنوعی عمومی ذہانت سے پوری انسانیت کو فائدہ پہنچائیں. یہ بہتریاں بڑھتی ہوئی صلاحیتوں والی AI کو مزید کفایتی اور وسیع پیمانے پر دستیاب بنانے میں مدد کریں گی.

OpenAI ماڈلز نے Jalapeño کی تیاری کو بھی تیز کیا۔ پہلے کی جنریشنز نے ٹیم کو چپ ڈیزائن کرنے اور اسے فعال بنانے میں مدد دی، جبکہ ہمارے تازہ ترین ماڈلز اسے بہتر بنانے اور پروگرام کرنے کے طریقے کو تیز کر رہے ہیں. Jalapeño کی کارکردگی GPT‑OSS 120B، DeepSeek R1، اور Kimi K2.5 1T میں بھی برقرار رہتی ہے، جو ظاہر کرتی ہے کہ یہ آرکیٹیکچر OpenAI کے اندر اور باہر تیار کیے گئے ماڈل میں کام کرتا ہے. ان تینوں میں، Jalapeño نے عروج کے تھروپٹ پر فی واٹ 1.5 سے 1.9 گنا زیادہ AI کام فراہم کیا اور تقابلی سسٹمز کے مقابلے میں اینڈ-ٹو-اینڈ لیٹنسی 1.7 سے 3.6 گنا کم رہی. انتہائی انٹرایکٹو ورک لوڈز کے لیے، اس نے 2.1 سے 4.1 گنا ہائی کارکردگی فراہم کی.

Jalapeño ایک وسیع تر فل-اسٹیک برتری کا بھی ثبوت ہے. OpenAI ماڈلز، پروڈکٹس، سرونگ سافٹ ویئر، چپس، میموری، نیٹ ورکنگ اور سسٹمز کو ایک ساتھ ڈیزائن کر سکتا ہے، اور حقیقی ورک لوڈز سے حاصل ہونے والی معلومات کو اسٹیک کی ہر پرت بہتر بنانے کے لیے استعمال کر سکتا ہے. Jalapeño پیمائش شدہ نتائج کے ساتھ ایک فرسٹ پارٹی سلیکون ہے، اور یہ متعدد نسلوں پر محیط پلیٹ فارم کا آغاز ہے. آنے والے مہینوں میں، ہم Jalapeño کو بڑھائیں گے تاکہ اپنے صارفین کے لیے تیز تر، زیادہ صلاحیت رکھنے والی اور زیادہ کارآمد مصنوعات فراہم کر سکیں.

ہم نے Jalapeño کی کارکردگی کو کیسے ناپا

ہم کارکردگی کا جائزہ ایک یکساں صارف تجربے کے تحت لیتے ہیں، یہ ناپتے ہوئے کہ ہر نظام، گاہکوں اور تعاملی ایجنٹس کو درکار لیٹنسی کو پورا کرتے ہوئے، پاور کی فی اکائی کتنا مفید AI کام مکمل کر سکتا ہے.. یہ خاص طور پر ایجنٹس کے لیے اہم ہے، جنہیں ترتیب وار کئی مراحل مکمل کرنے ہوتے ہیں، اس لیے تاخیر پورے کام کے دوران جمع ہو سکتی ہے..

یہ سمجھنے کے لیے کہ Jalapeño عملی طور پر کیسی کارکردگی دکھاتا ہے، ہم نے اسے InferenceX پر آزمایا، جو SemiAnalysis کا ایک عوامی بینچ مارک ہے اور AI درخواست کو سرو کرنے کے مکمل عمل کی پیمائش کرتا ہے. ہم نے Jalapeño کا موازنہ آزمائی گئی آپریٹنگ رینج میں تجارتی طور پر دستیاب معروف AI سسٹمز سے کیا، ہائی تھروپٹ فراہمی سے لے کر انتہائی انٹرایکٹو، کم تاخیر والے استعمال تک. Jalapeño نے تھروپٹ، توانائی کی کارکردگی اور تاخیر کا بہتر امتزاج فراہم کیا. اگرچہ کارکردگی کبھی کبھی فی چپ کے حساب سے رپورٹ کی جاتی ہے، ہم سمجھتے ہیں کہ زیادہ مفید معیار طاقت کی فی اکائی کارکردگی ہے.

جالاپینو نے سابقہ بہترین TBT میں برتری مزید بڑھا دی

Jalapeño ہر صارف کو زیادہ ٹوکن فراہم کرتا ہے

Jalapeño فی کلوواٹ زیادہ تھروپٹ فراہم کرتا ہے

تینوں عوامی ماڈلز میں، Jalapeño نے آزمائے گئے آپریٹنگ رینج میں فی واٹ کارکردگی اور لیٹنسی کا بہتر امتزاج فراہم کیا، جس سے یہ پیریٹیو فرنٹیئر پر پہنچ گیا. سسٹمز کا یکساں طور پر موازنہ کرنے کے لیے، ہم نے ہر ایکسیلیریٹر کی شائع کردہ چِپ پاور ریٹنگ استعمال کرتے ہوئے نتائج کو نارملائز کیا. Jalapeño کو 700 واٹ پر ریٹ کیا گیا ہے، اگرچہ آزمائے گئے ورک لوڈز پر اس کی ناپی گئی مسلسل پاور 550 واٹ یا اس سے کم رہی.

Jalapeño نے GPT‑OSS 120B، DeepSeek R1 670B، اور Kimi K2.5 1T پر مضبوط کارکردگی دکھائی. Kimi پر، جو ہمارا ٹیسٹ کیا گیا سب سے بڑا عوامی ماڈل ہے، اس نے موازنے کے سسٹم کے مقابلے میں تقریباً 1.5 گنا زیادہ ہائی ترین فی واٹ کارکردگی اور 3.4 گنا کم اینڈ ٹو اینڈ لیٹنسی فراہم کی. ہماری اندرونی ٹیسٹنگ میں، فرنٹیئر OpenAI ماڈلز پر Jalapeño کا فائدہ مزید بڑھ گیا، جس سے ظاہر ہوتا ہے کہ جیسے جیسے ورک لوڈز بڑے اور زیادہ تقاضوں والے ہوتے جاتے ہیں، آرکیٹیکچر کی قدر بڑھتی جاتی ہے.

ایک ہی چِپ میں رفتار اور موثریت کے لیے ڈیزائن کرنا

Jalapeño کو ابتدا ہی سے یہ سوال پوچھ کر ڈیزائن کیا گیا تھا: اگر اس کا بنیادی کام جدید اور مستقبل کے لینگویج ماڈلز، خاص طور پر انٹرایکٹو ایجنٹس، کو سروس فراہم کرنا ہو تو ہم کون سا ہارڈ ویئر بنائیں گے؟ Jalapeño کی بہتری حقیقی لینگویج ماڈل ورک لوڈز کے لیے چپ، میموری، نیٹ ورک، سافٹ ویئر اور ریک اسکیل سسٹم کو ایک ساتھ ڈیزائن کرنے سے حاصل ہوتی ہے. لینگویج ماڈل اِنفرنس کئی الگ الگ مراحل سے گزرتا ہے جن میں کارکردگی کی مختلف رکاوٹیں ہوتی ہیں. جب سسٹم کسی پرومپٹ کو پراسیس کرتا ہے تو ابتدائی پراسیسنگ میں حسابی صلاحیت کی ضرورت زیادہ ہوتی ہے، جبکہ جب سسٹم ٹوکن بہ ٹوکن جواب تیار کرتا ہے تو جواب کی تیاری زیادہ تر میموری بینڈوڈتھ کی وجہ سے محدود ہوتی ہے۔ جب ڈیٹا کو کورز اور چِپس کے درمیان منتقل ہونا پڑتا ہے تو کمیونیکیشن بھی تاخیر میں اضافہ کر سکتی ہے، جس سے کچھ پروسیسنگ یونٹس انتظار کے دوران بیکار رہتے ہیں. ایک مرحلے میں بہترین کارکردگی دکھانے والا سسٹم، ڈیٹا کا انتظار کرتے ہوئے یا مختلف وسائل کے درمیان ماڈل کی حالت منتقل کرتے ہوئے، یہ برتری کھو سکتا ہے.

ہم نے Jalapeño کو اس طرح ڈیزائن کیا ہے کہ ڈیٹا کی نقل و حرکت اور مواصلاتی تاخیر کو کم سے کم کیا جا سکے. اس کا مطلب ہے کہ ماڈل کی حالت، بشمول جواب تیار کرتے وقت استعمال ہونے والا KV کیش، کو واضح طور پر مخصوص جگہ پر رکھا اور مقامی رکھا جا سکتا ہے، جبکہ سسٹم ہر انفیرنس مرحلے کے لیے کمپیوٹ، میموری اور نیٹ ورکنگ کے درست امتزاج کو فعال کرتا ہے. نیٹ ورک، آرکیٹیکچر کا ایک لازمی جزو ہے. اس کا وسیع ڈومین پورے ورک لوڈ کو ایک ہی مربوط نظام کے اندر رہنے کی اجازت دیتا ہے، جس سے ڈیٹا کی منتقلی کم سے کم ہوتی ہے اور مکمل درخواست کو شروع سے آخر تک تیز اور مؤثر رہنے میں مدد ملتی ہے. نتیجہ ایک متوازن اور قابلِ تبادلہ ایکسلریٹر ہے جو بدلتے ہوئے ماڈل آرکیٹیکچرز کو سپورٹ کر سکتا ہے، پری فل اور ڈیکوڈ، دونوں میں بہترین کارکردگی دکھا سکتا ہے، اور ان کے درمیان توازن بدلنے کے ساتھ خود کو ڈھال سکتا ہے، جو ایجنٹک ورک لوڈز کی ایک نمایاں خصوصیت ہے.

ہم نے چِپ کو ڈیزائن کرنے کے لیے AI کا استعمال کیا، اور چِپ کو اس طرح ڈیزائن کیا کہ AI اسے پروگرام کر سکے

AI نے Jalapeño کی ترقی میں براہِ راست کردار ادا کیا، جس سے ٹیم نے امپلیمنٹیشنز کا جائزہ لے کر، ڈیزائن، پیمائش اور تصدیق کے عمل کو مختصر کیا، اور ماڈل ورک لوڈز پر مسلسل تکرار کرتے ہوئے ابتدائی ڈیزائن سے ٹیپ آؤٹ تک نو ماہ میں پہنچا. AI نے چِپ کے حسابی سرکٹس کو بہتر بنانے میں بھی مدد کی، جس سے ٹیم مقررہ وقت کے اندر چِپ میں زیادہ کمپیوٹ کارکردگی سمو سکی.

Jalapeño کو انسانوں اور AI دونوں کے لیے ایک واضح، قابلِ پیش گوئی پروگرامنگ ہدف کے طور پر ڈیزائن کیا گیا ہے. انجینئرز کام کو مقامی ٹینسرز، صریح مواصلت، اور قابلِ پیش گوئی ہم آہنگی کے ذریعے بیان کر سکتے ہیں. اس کے بعد AI اس کام کو پورے سسٹم میں کس طرح میپ، رکھا، شیڈول اور مربوط کیا جاتا ہے، بہتر بنا سکتا ہے. وہ واضح، قابلِ پیش گوئی ساخت AI کو متوازی پروگرامنگ کے روایتی طور پر مشکل مسئلے سے نمٹنے کا ایک قابلِ عمل طریقہ فراہم کرتی ہے.

ہر نئے ماڈل خاندان کو سپورٹ کرنے کے لیے اب بھی نئے kernels اور ماڈل کے لیے مخصوص آپٹمائزیشنز درکار ہوتے ہیں. Codex کو GPT‑Astra کے ساتھ استعمال کرتے ہوئے، ٹیم نے تین اوپن ویٹ ماڈلز کو، جو Jalapeño کے اصل پروڈکشن منصوبے کا حصہ نہیں تھے، دو ماہ کے اندر ہائی کارکردگی تک پہنچا دیا. اس سے آرکیٹیکچر کی لچک بھی ظاہر ہوئی اور وہ رفتار بھی جس سے AI اسے پروگرام کرنے میں ہماری مدد کر سکتی ہے. منتخب GPT‑OSS اٹینشن اور mixture-of-experts بلاکس کے لیے، AI سے تیار کردہ عمل درآمد موجودہ انسانی ماہرین کے لکھے ہوئے عمل درآمد کے مقابلے میں 1.5 سے 1.8 گنا تیز چلے. یہ اعداد و شمار منتخب بلاکس پر لاگو ہوتے ہیں، مکمل ماڈل پر نہیں، لیکن یہ ایک طاقتور نئے development loop کی طرف اشارہ کرتے ہیں.

مؤثر، انتہائی تیز رفتار اِنفرنس کے لیے آگے کا راستہ

AI انفراسٹرکچر اس لیے قیمتی ہے کیونکہ یہ حقیقی دنیا کے مفید کام کو ممکن بناتا ہے. اسی توانائی اور ہارڈ ویئر سے زیادہ مفید کام پیدا کر کے، Jalapeño ہمیں زیادہ طلب پوری کرنے اور کامیاب نتیجہ فراہم کرنے کی لاگت کم کرنے میں مدد دے سکتا ہے. OpenAI کے لیے، یہ مفید کام اور آمدنی کو خدمات فراہم کرنے کی لاگت سے زیادہ تیزی سے بڑھنے دے کر آپریٹنگ لیوریج بہتر کر سکتا ہے. یہ بہتر ماڈلز، مصنوعات اور انفراسٹرکچر کو وسیع تر اپنانے اور ان میں مسلسل سرمایہ کاری کی معاونت بھی کر سکتا ہے. زیادہ تیز انفرنس، زیادہ تیز اعادے اور استعمال کے نئے کیسز کو ممکن بنا سکتا ہے.

Jalapeño مؤثر، کم تاخیر والے انفیرنس کے لیے ممکنات کا دائرہ وسیع کرتا ہے:

  • Ultra فاسٹ موڈ میں وہی کارکردگی جو پہلے صرف فاسٹ موڈ میں دستیاب تھی
  • فاسٹ موڈ میں انفرنس، وہی کارکردگی جو پہلے صرف بیچڈ موڈ میں دستیاب تھی
  • بیچڈ موڈ انفرنس کے لیے زیادہ ہائی کارکردگی

ہم سال کے آخر تک OpenAI کے کمپیوٹ انفراسٹرکچر میں Jalapeño کی تعیناتی شروع کرنے کا پلان رکھتے ہیں. یہ ملٹی جنریشن روڈ میپ کی پہلی جنریشن ہے: Gen 2 ڈیولپمنٹ کے کافی آگے کے مرحلے میں ہے اور Gen 3 شکل اختیار کر رہی ہے. ہر جنریشن، ہم جو کچھ سیکھیں گے، اس کی بنیاد پر آگے بڑھے گی اور کارکردگی اور رفتار دونوں کو مزید بہتر بنائے گی.

AI کی بڑھتی ہوئی طلب کو پورا کرنے کے لیے ہر دستیاب ذریعہ سے مزید کمپیوٹنگ وسائل درکار ہوں گے. ہم ٹریننگ اور انفیرینس ورک لوڈز دونوں کے لیے NVIDIA اور دیگر پارٹنرز کے ایکسیلیریٹرز کو وسیع پیمانے پر تعینات کرنا جاری رکھیں گے. ہمارا مشن ہے کہ مصنوعی عمومی ذہانت سے پوری انسانیت کو فائدہ پہنچائیں.

ڈیپلائمنٹ کی تیاری کے ساتھ ساتھ، ہم پروڈکشن کوالیفیکیشن کا عمل جاری رکھے ہوئے ہیں، سافٹ ویئر کو مزید پختہ کر رہے ہیں، Jalapeño کو بڑے پیمانے پر چلانے کی تیاری کر رہے ہیں، اور مزید ماڈلز میں کارکردگی کی توثیق کر رہے ہیں. اب تک کے نتائج ظاہر کرتے ہیں کہ جب ہم پورے سسٹم کو مل کر ڈیزائن کرتے ہیں تو کیا ممکن ہے: زیادہ لوگوں تک زیادہ مؤثر طریقے سے زیادہ جواب دہ، زیادہ صلاحیت رکھنے والی اور ایجنٹک AI پہنچانا.

ضمیمہ

Jalapeño، GPT‑OSS 120B پر پیریٹو فرنٹیئر ہے

فی کلو واٹ تھروپٹ فرنٹیئر

InferenceX · GPT‑OSS‑120B · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño GPT‑OSS کے آپریٹنگ پوائنٹس میں سبقت رکھتا ہے

عروج اور ہم آہنگ شدہ تھروپٹ

InferenceX · GPT‑OSS‑120B · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W; GB200 1,200 W

ہائی پیک مخلوط TPS / kW

≈1.9×

85,448 بمقابلہ 44,960 مخلوط / kW

کم سے کم اینڈ ٹو اینڈ لیٹنسی

≈1.7×

1.03 سیکنڈ بمقابلہ 1.80 سیکنڈ

کم از کم TBT

≈2.7×

0.69 بمقابلہ 1.87 ملی سیکنڈ (1,459 بمقابلہ 535 ٹوکنز فی سیکنڈ فی صارف)

پچھلے TBT پر زیادہ تھروپٹ

≈53.7×

22,935 بمقابلہ 427 مخلوط / kW (535.28 ٹوکنز/سیکنڈ/صارف)

Jalapeño، DeepSeek R1 670B میں پریٹو فرنٹیئر ہے

فی کلو واٹ تھروپٹ فرنٹیئر

InferenceX · DeepSeek R1 MXFP4 · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W؛ GB300 1,400 W

Jalapeño، DeepSeek R1 کے آپریٹنگ پوائنٹس پر سبقت رکھتا ہے

عروج اور ہم آہنگ شدہ تھروپٹ

InferenceX · DeepSeek R1 MXFP4 · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W؛ GB300 1,400 W

ہائی پیک مخلوط TPS / kW

≈1.7×

19,641 بمقابلہ 11,781 مکسڈ / kW

کم سے کم اینڈ ٹو اینڈ لیٹنسی

≈3.6×

1.65 s بمقابلہ 5.99 s

کم از کم TBT

≈4.1×

1.43 بمقابلہ 5.90 ms (700 بمقابلہ 169 ٹوکنز/سیکنڈ/صارف)

پچھلے TBT پر زیادہ تھروپٹ

≈104.3×

12,258 بمقابلہ 118 مخلوط / kW (169.41 ٹوکنز/سیکنڈ/صارف پر)

Jalapeño، Kimi K2.5 1T میں پریٹو فرنٹیئر ہے

فی کلو واٹ تھروپٹ فرنٹیئر

InferenceX · Kimi K2.5 MXFP4 · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño، Kimi K2,5 کے مختلف آپریٹنگ پوائنٹس پر سبقت رکھتا ہے

عروج اور ہم آہنگ شدہ تھروپٹ

InferenceX · Kimi K2.5 MXFP4 · برائے نام 8k/1k · STP · پیکیج TDP: Jalapeño 700 W; GB300 1,400 W

ہائی پیک مخلوط TPS / kW

≈1.5×

18,195 بمقابلہ 11,862 مخلوط / kW

کم سے کم اینڈ ٹو اینڈ لیٹنسی

≈3.4×

1.56 s بمقابلہ 5.31 s

کم از کم TBT

≈3.8×

1.44 بمقابلہ 5.48 ms (694 بمقابلہ 182 ٹوکنز/سیکنڈ/صارف)

پچھلے TBT پر زیادہ تھروپٹ

≈56.1×

6,744 بمقابلہ 120 مخلوط / kW (182.46 ٹوکنز/سیکنڈ/صارف پر)

مصنف

OpenAI