تخطي إلى المحتوى الرئيسي
OpenAI

25 أغسطس 2026

الهندسةالشركة

تُظهر النتائج الأولى لـ Jalapeño سرعة وكفاءة رائدتين في القطاع في استدلال الذكاء الاصطناعي

جاري التحميل...
لقطة مقربة لشريحة Jalapeño الخاصة بالاستدلال المثبتة على لوحة دارات بلون أزرق مخضر.

منذ الإعلان عن Jalapeño، أول شريحة استدلال مخصصة من OpenAI، نقوم باختبار الشريحة والنظام المبني حولها. تُظهر النتائج تقدمًا كبيرًا في الأداء: إذ يمكن لـ Jalapeño معالجة قدر أكبر من أعمال الذكاء الاصطناعي لكل وحدة طاقة، مع تقديم الاستجابات بسرعة أكبر أيضًا. يقدّم Jalapeño إنتاجية أعلى وزمن استجابة أقل ضمن بنية واحدة، في حين تضطر أنظمة الأجهزة الحالية غالبًا إلى المفاضلة بينهما.

بالنسبة للعملاء، قد يعني ذلك استجابات أسرع، وموظفي دعم أكثر تجاوبًا، ووصولًا أكثر موثوقية مع تزايد الطلب. وتتمثل رسالتنا في ضمان أن يعود الذكاء الاصطناعي العام بالنفع على البشرية جمعاء. ستساعد هذه المكاسب في جعل الذكاء الاصطناعي ذي القدرات المتزايدة أكثر توفيرًا وأكثر إتاحة على نطاق واسع.

سرّعت نماذج OpenAI أيضًا تطوير Jalapeño. ساعدت الأجيال السابقة الفريق في تصميم الشريحة وتشغيلها الأولي، بينما تسرّع أحدث نماذجنا طريقة تحسينها وبرمجتها. يمتد أداء Jalapeño ليشمل GPT‑OSS 120B وDeepSeek R1 وKimi K2.5 1T، مما يثبت أن البنية تعمل عبر نماذج طورت داخل OpenAI وخارجها. عبر النماذج الثلاثة جميعها، قدمت Jalapeño عند ذروة الإنتاجية أعمال الذكاء الاصطناعي أكثر لكل واط بمقدار 1,5 إلى 1,9 مرة، وزمن استجابة شاملًا أقل بمقدار 1,7 إلى 3,6 مرة مقارنة بأنظمة المقارنة. بالنسبة إلى أعباء العمل عالية التفاعلية، حقق أداءً أعلى بمقدار 2,1 إلى 4,1 مرة.

يُعد Jalapeño أيضًا دليلًا على ميزة أوسع نطاقًا عبر كامل المكدس التقني. يمكن لـOpenAI تصميم النماذج والمنتجات وبرامج التقديم والشرائح والذاكرة والشبكات والأنظمة معًا، والاستفادة مما نتعلمه من أحمال العمل الفعلية لتحسين كل طبقة من طبقات المنظومة. Jalapeño هو شريحة سيليكون مطوّرة داخليًا مع نتائج مُقاسة، ويمثل بداية منصة متعددة الأجيال. خلال الأشهر المقبلة، سنكثّف العمل على Jalapeño لتقديم منتجات أسرع وأكثر قدرة وكفاءة لعملائنا.

كيف قسنا أداء Jalapeño

نقيّم الأداء عند تجربة مستخدم متكافئة، من خلال قياس مقدار مهام الذكاء الاصطناعي المفيدة التي يمكن لكل نظام إنجازها لكل وحدة من القدرة، مع الالتزام بزمن الاستجابة الذي يتطلبه العملاء والوكلاء التفاعليون. يكتسب هذا أهمية خاصة بالنسبة إلى الوكلاء، الذين يحتاجون إلى إكمال خطوات عديدة بالتسلسل، لذلك يمكن أن تتراكم التأخيرات عبر المهمة بأكملها.

لفهم كيفية أداء Jalapeño عمليًا، اختبرناه على InferenceX، وهو معيار قياس عام من SemiAnalysis يقيس العملية الكاملة لخدمة طلب ذكاء اصطناعي. قارنا Jalapeño بأنظمة الذكاء الاصطناعي الرائدة المتاحة تجاريًا عبر نطاق التشغيل المختبرة، بدءًا من التقديم عالي الإنتاجية وصولًا إلى الاستخدام التفاعلي منخفض الكمون. حقق Jalapeño مزيجًا أفضل من الإنتاجية وكفاءة الطاقة وزمن الاستجابة. على الرغم من أنه يتم أحيانًا الإبلاغ عن الأداء لكل شريحة، فإننا نعتقد أن المعيار الأكثر فائدة هو الأداء لكل وحدة طاقة.

يوسع Jalapeño الفارق عند أفضل رقم قياسي سابق في TBT

يوفر Jalapeño رموزًا أكثر لكل مستخدم

يوفر Jalapeño إنتاجية أعلى لكل كيلوواط

عبر النماذج العامة الثلاثة جميعها، قدّم Jalapeño مزيجًا أفضل من الأداء لكل واط وزمن الاستجابة ضمن نطاق التشغيل المختبَر، ما وضعه على حدّ باريتو. لمقارنة الأنظمة على نحو متسق، قمنا بتطبيع النتائج باستخدام تصنيف قدرة الشريحة المنشور لكل مسرّع. تبلغ القدرة الاسمية لـJalapeño ‏700 واط، مع أن قدرته المستدامة المقاسة ظلت عند 550 واط أو أقل في أعباء العمل المختبَرة.

أظهر Jalapeño أداءً قويًا على GPT‑OSS 120B وDeepSeek R1 670B وKimi K2.5 1T. ومع Kimi، وهو أكبر نموذج عام اختبرناه، حقق أداء ذروة لكل واط أعلى بنحو مرة ونصف وزمن استجابة من البداية إلى النهاية أقل بنحو ثلاث مرات وأربعة أعشار مقارنةً بالنظام المقارن. في اختباراتنا الداخلية، اتسع تفوق Jalapeño أكثر مع نماذج OpenAI الرائدة، ما يشير إلى أن قيمة هذه البنية تزداد كلما أصبحت أعباء العمل أكبر وأكثر تطلبًا.

تصميم معماري يحقق السرعة والكفاءة ضمن شريحة واحدة

صُمّم Jalapeño منذ البداية انطلاقًا من سؤال: ما العتاد الذي كنا سنبنيه لو كانت مهمته الأساسية تشغيل نماذج اللغة الحديثة والمستقبلية، ولا سيما الوكلاء التفاعليين؟ تنبع مكاسب Jalapeño من تصميم الشريحة والذاكرة والشبكة والبرمجيات والنظام على مستوى الرف معًا حول أحمال عمل حقيقية لنموذج لغوي. يمر استدلال نموذج اللغة بعدة مراحل متميزة، لكل منها اختناقات مختلفة. تتطلب مرحلة التعبئة المسبقة، حين يعالج النظام مطالبة، قدرًا كبيرًا من الحوسبة، بينما تكون مرحلة فك الترميز، حين يولد النظام الاستجابة رمزًا تلو الآخر، مقيدة أكثر بعرض نطاق الذاكرة. يمكن أن يؤدي الاتصال أيضًا إلى زيادة زمن الانتقال عندما يتعين نقل البيانات بين الأنوية والرقائق، مما يترك بعض وحدات المعالجة خاملة أثناء انتظارها. قد يفقد نظام يتفوق في مرحلة واحدة هذه الميزة أثناء انتظار البيانات أو نقل حالة النموذج بين موارد مختلفة.

صمّمنا Jalapeño لتقليل نقل البيانات وتأخيرات الاتصال إلى أدنى حد. وهذا يعني أنه يمكن وضع حالة النموذج صراحةً والحفاظ عليها محليًا، بما في ذلك ذاكرة التخزين المؤقت KV المستخدمة أثناء إنشاء الاستجابة، بينما يفعّل النظام التركيبة المناسبة من القدرة الحاسوبية والذاكرة والشبكات لكل مرحلة من مراحل الاستدلال. تُعدّ الشبكة جزءًا لا يتجزأ من البنية المعمارية. يتيح نطاقه الواسع بقاء عبء العمل بالكامل ضمن نظام واحد مترابط، مما يقلّل من نقل البيانات ويساعد على بقاء الطلب الكامل سريعًا وفعّالًا من البداية إلى النهاية. والنتيجة هي مسرع متوازن وقابل للتداول يمكنه دعم بنيات النماذج المتغيرة، والتفوق في مرحلتي التعبئة المسبقة وفك الترميز، والتكيف مع تغير التوازن بينهما، وهي سمة مميزة لأحمال العمل الوكيلة.

استخدمنا الذكاء الاصطناعي لتصميم الرقاقة، وصممنا الرقاقة بحيث يتمكن الذكاء الاصطناعي من برمجتها

لعب الذكاء الاصطناعي دورًا مباشرًا في تطوير Jalapeño، مما مكّن الفريق من الانتقال من التصميم الأولي إلى إتمام التصميم للتصنيع خلال تسعة أشهر عبر استكشاف أساليب التنفيذ، وتقصير دورات التصميم والقياس والتحقق، والتكرار المستمر على أحمال عمل نموذج. ساعد الذكاء الاصطناعي أيضًا في تحسين الدوائر الحسابية للشريحة، مما أتاح للفريق استيعاب قدر أكبر من أداء الحوسبة داخل الشريحة في الموعد المحدد.

صُمِّم Jalapeño ليكون هدفًا برمجيًا واضحًا وقابلًا للتنبؤ لكلٍّ من البشر والذكاء الاصطناعي. يمكن للمهندسين توصيف أعباء العمل باستخدام موترات محلية، واتصالات صريحة، ومزامنة قابلة للتنبؤ. يمكن للذكاء الاصطناعي بعد ذلك تحسين طريقة تعيين ذلك العمل ووضعه وجدولته وتنسيقه عبر النظام. تمنح هذه البنية الواضحة والقابلة للتنبؤ الذكاء الاصطناعي طريقة قابلة للتطبيق عمليًا للتعامل مع مشكلة البرمجة المتوازية الصعبة تقليديًا.

لا يزال دعم كل مجموعة نماذج جديدة يتطلب نوى جديدة وتحسينات خاصة بكل نموذج. وباستخدام Codex مع GPT‑Astra، تمكّن الفريق من رفع أداء ثلاثة نماذج بأوزان مفتوحة لم تكن ضمن خطة الإنتاج الأصلية لـ Jalapeño إلى مستوى عالٍ خلال شهرين. أثبت ذلك كلاً من مرونة البنية المعمارية والسرعة التي يمكن أن يساعدنا بها الذكاء الاصطناعي في برمجتها. وبالنسبة إلى كتل الانتباه ومزيج الخبراء المختارة في GPT‑OSS، كانت التطبيقات التي أنشأها الذكاء الاصطناعي أسرع بمقدار ١٫٥ إلى ١٫٨ مرة من التطبيقات الحالية التي كتبها خبراء بشريون. تنطبق هذه الأرقام على الكتل المحددة، وليس على النموذج الكامل، لكنها تشير إلى دورة تطوير جديدة وفعالة.

الطريق نحو استدلال فائق السرعة والكفاءة

تُعدّ البنية التحتية للذكاء الاصطناعي قيّمة لأنها تُمكّن من إنجاز أعمال مفيدة في العالم الحقيقي. ومن خلال إنتاج عمل أكثر فائدة باستخدام الطاقة والأجهزة نفسها، يمكن أن يساعدنا Jalapeño على تلبية قدر أكبر من الطلب وخفض تكلفة تحقيق نتيجة ناجحة. وبالنسبة إلى OpenAI، يمكن أن يؤدي ذلك إلى تحسين الرافعة التشغيلية عبر إتاحة نمو العمل المفيد والإيرادات بوتيرة أسرع من تكلفة تقديم الخدمة. كما يمكن أن يدعم اتساع نطاق الاعتماد واستمرار الاستثمار في نماذج ومنتجات وبنية تحتية أفضل. يمكن للاستدلال الأسرع أن يتيح تكرارًا أسرع وحالات استخدام جديدة.

يتوسع Jalapeño الإمكانات المتاحة للاستدلال الفعال منخفض زمن الاستجابة:

  • الاستدلال في وضع Ultra السريع بكفاءة كانت متاحة سابقًا فقط في الوضع السريع
  • استدلال في "الوضع السريع" بكفاءة لم تكن متاحة سابقًا إلا في وضع الدُفعات
  • كفاءة أعلى للاستدلال في وضع المعالجة المجمعة

نخطط لبدء نشر Jalapeño ضمن البنية التحتية للحوسبة لدى OpenAI بحلول نهاية العام. إنه الجيل الأول من خارطة طريق تمتد عبر أجيال متعددة: فالجيل الثاني في مرحلة متقدمة من التطوير، والجيل الثالث بدأ يتبلور. وسيبني كل جيل على ما نتعلمه، وسيواصل تعزيز الكفاءة والسرعة.

ستتطلب تلبية الطلب المتزايد على الذكاء الاصطناعي مزيدًا من قدرات الحوسبة من كل مصدر متاح. وسنواصل نشر المسرّعات من NVIDIA وشركاء آخرين على نطاق واسع لكلٍّ من أعباء عمل التدريب والاستنتاج. وتتمثل رسالتنا في ضمان أن يعود الذكاء الاصطناعي العام بالنفع على البشرية جمعاء.

بينما نستعد للنشر، نواصل تأهيل الإنتاج، وتطوير البرمجيات، والاستعداد لتشغيل Jalapeño على نطاق واسع، والتحقق من الأداء عبر المزيد من النماذج. توضح النتائج حتى الآن ما يمكن تحقيقه عندما نصمم النظام بأكمله معًا: ذكاء اصطناعي أكثر استجابة وقدرة وذكاء اصطناعي وكيلي، يصل إلى عدد أكبر من الناس بكفاءة أعلى.

الملحق

يحقق Jalapeño حدّ باريتو عند تشغيل GPT‑OSS 120B

الحدّ الأقصى لمعدل الإنتاجية لكل كيلوواط

InferenceX · GPT‑OSS‑120B · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 W؛ GB200 1200 W

يتصدر Jalapeño عبر مختلف نقاط تشغيل GPT‑OSS

ذروة معدل الإنتاجية ومعدلات الإنتاجية المتطابقة

InferenceX · GPT‑OSS‑120B · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 W؛ GB200 1200 W

ذروة أعلى للرموز المختلطة في الثانية/كيلوواط

≈1.9×

85448 مقابل 44960 مختلط /كيلوواط

زمن استجابة أقل من البداية إلى النهاية

≈1,7×

1.03 ثانية مقابل 1.80 ثانية

حد أدنى أقل لزمن TBT

≈2.7×

0.69 مقابل 1.87 ms (1,459 مقابل 535 رمز/ثانية/مستخدم)

معدل إنتاجية أعلى عند مستوى TBT السابق

≈53.7×

22935 مقابل 427 مختلط / كيلوواط (عند 535.28 رمز/ثانية/مستخدم)

يحقق Jalapeño حدّ باريتو عند تشغيل DeepSeek R1 670B

الحدّ الأقصى لمعدل الإنتاجية لكل كيلوواط

InferenceX · DeepSeek R1 MXFP4 · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 W؛ GB300 1400 W

يتصدر Jalapeño عبر مختلف نقاط تشغيل DeepSeek R1

ذروة معدل الإنتاجية ومعدلات الإنتاجية المتطابقة

InferenceX · DeepSeek R1 MXFP4 · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 W؛ GB300 1400 W

ذروة أعلى للرموز المختلطة في الثانية/كيلوواط

≈1,7×

19641 مقابل 11781 مختلط/كيلوواط

زمن استجابة أقل من البداية إلى النهاية

≈3,6×

1.65 ثانية مقابل 5.99 ثانية

حد أدنى أقل لزمن TBT

≈4.1×

1,43 مقابل 5,90 مللي ثانية (700 مقابل 169 رمز/ثانية/مستخدم)

معدل إنتاجية أعلى عند مستوى TBT السابق

≈104,3×

12258 مقابل 118 مختلط/كيلوواط (عند 169,41 رمز/ثانية/مستخدم)

يحقق Jalapeño حدّ باريتو عند تشغيل Kimi K2.5 1T

الحدّ الأقصى لمعدل الإنتاجية لكل كيلوواط

InferenceX · Kimi K2.5 MXFP4 · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 واط؛ GB300 1400 واط

يتصدر Jalapeño عبر مختلف نقاط تشغيل Kimi K2.5

ذروة معدل الإنتاجية ومعدلات الإنتاجية المتطابقة

InferenceX · Kimi K2.5 MXFP4 · الاسمي 8k/1k · STP · TDP للحزمة: Jalapeño 700 واط؛ GB300 1400 واط

ذروة أعلى للرموز المختلطة في الثانية/كيلوواط

≈1.5×

18195 مقابل 11862 مختلط/كيلوواط

زمن استجابة أقل من البداية إلى النهاية

≈3,4×

1,56 ثانية مقابل 5,31 ثانية

حد أدنى أقل لزمن TBT

≈3,8×

1,44 مقابل 5,48 مللي ثانية (694 مقابل 182 رمز/ثانية/مستخدم)

معدل إنتاجية أعلى عند مستوى TBT السابق

≈56.1×

6744 مقابل 120 مختلط/كيلوواط (عند 182,46 رمز/ثانية/مستخدم)

المؤلف

OpenAI