
از زمان معرفی Jalapeño، نخستین تراشه استنتاج سفارشی OpenAI، ما در حال آزمایش این تراشه و سامانهای بودهایم که بر پایه آن ساخته شده است. نتایج نشان دهنده پیشرفتی چشمگیر در عملکرد هستند: Jalapeño میتواند به ازای هر واحد توان، بار کاری بیشتری از هوش مصنوعی را انجام دهد و در عین حال پاسخها را سریعتر ارائه دهد. Jalapeño با یک معماری، هم توان عملیاتی بالاتر و هم تأخیر کمتر را ارائه میدهد، در حالی که سامانههای سخت افزاری موجود اغلب ناچارند میان این دو تجارت کنند.
برای مشتریان، این میتواند به معنای پاسخهای سریعتر، کارشناسان پشتیبانی پاسخگوتر، و دسترسی قابل اعتمادتر با افزایش تقاضا باشد. مأموریت ما این است که هوش عمومی مصنوعی (AGI) به سود همهٔ بشریت باشد. این پیشرفتها کمک میکنند هوش مصنوعیِ هرچه توانمندتر، مقرون به صرفهتر و برای عموم در دسترستر شود.
مدلهای OpenAI نیز توسعه Jalapeño را تسریع کردند. نسلهای پیشین به تیم در طراحی و راه اندازی تراشه کمک کردند، در حالی که جدید ترین مدلهای ما در حال تسریع شیوه بهینه سازی و برنامه نویسی آن هستند. عملکرد Jalapeño در GPT‑OSS ۱۲۰B، DeepSeek R۱ و Kimi K۲.۵ ۱T نیز دیده میشود و نشان میدهد که این معماری در مدلهای توسعه یافته در داخل و خارج از OpenAI کار میکند. Jalapeño در هر سه مورد، در اوج توان عملیاتی، ۱.۵ تا ۱.۹ برابر کار AI بیشتری به ازای هر وات ارائه داد و تأخیر سرتاسری آن نسبت به سامانههای مقایسهای ۱.۷ تا ۳.۶ برابر کمتر بود. برای حجمهای کاری بسیار تعاملی، عملکردی ۲.۱ تا ۴.۱ برابر بالاتر ارائه داد.
Jalapeño همچنین گواهی بر یک مزیت گستردهتر در پشتهٔ کامل است. OpenAI میتواند مدلها، محصولات، نرم افزارهای ارائه سرویس، تراشهها، حافظه، شبکه سازی و سامانهها را به صورت یکپارچه طراحی کند و از آموختههای خود از بارهای کاری واقعی برای بهبود هر لایه از پشته استفاده کند. Jalapeño یک تراشهٔ اختصاصیِ عملیاتی با نتایج اندازه گیریشده است و آغاز یک پلتفرم چند نسلی به شمار میرود. در ماههای پیشِ رو، مقیاس Jalapeño را افزایش خواهیم داد تا محصولاتی سریعتر، توانمندتر و کارآمدتر برای مشتریان خود ارائه کنیم.
ما عملکرد را در شرایط یک تجربهٔ کاربری همسان ارزیابی میکنیم و میسنجیم که هر سیستم به ازای هر واحد توان، در عین برآورده کردن تأخیری که مشتریان و عاملهای تعاملی نیاز دارند، چه مقدار کار مفید هوش مصنوعی میتواند انجام دهد. این موضوع به ویژه برای عاملها اهمیت دارد، چون آنها باید مراحل زیادی را به ترتیب کامل کنند؛ بنابراین تأخیرها میتوانند در طول یک وظیفهٔ کامل روی هم انباشته شوند.
برای درک اینکه Jalapeño در عمل چگونه عمل میکند، آن را روی InferenceX آزمایش کردیم؛ یک بنچمارک عمومی از SemiAnalysis که کل فرآیند سرویس دهی به یک درخواست هوش مصنوعی را اندازه گیری میکند. Jalapeño را در سراسر دامنه عملیاتی آزمایش شده، از ارائه خدمات با توان عملیاتی بالا تا استفاده بسیار تعاملی با تأخیر کم، با سامانههای پیشرو AI که به صورت تجاری در دسترس هستند مقایسه کردیم. Jalapeño ترکیب بهتری از توان عملیاتی، بهرهوری انرژی و تأخیر ارائه داد. اگرچه گاهی عملکرد به ازای هر تراشه گزارش میشود، ما معتقدیم معیار مفیدتر، عملکرد به ازای هر واحد توان مصرفی است.
در هر سه مدل عمومی، Jalapeño در سراسر دامنه عملیاتی آزمایششده، ترکیب بهتری از عملکرد به ازای هر وات و تأخیر ارائه داد و آن را بر مرز پیشروی پارتو قرار داد. برای مقایسهٔ یکسان سامانهها، نتایج را با استفاده از توان نامی منتشرشدهٔ تراشهٔ هر شتاب دهنده به هنجار کردیم. Jalapeño دارای توان نامی ۷۰۰ وات است، هرچند توان پایدار اندازه گیری شدهٔ آن در بارهای کاری آزمایش شده در سطح ۵۵۰ وات یا کمتر باقی ماند.
Jalapeño در میان GPT‑OSS ۱۲۰B، DeepSeek R۱ ۶۷۰ میلیارد و Kimi K۲.۵ ۱ تریلیون عملکرد خوبی داشت. در Kimi، بزرگ ترین مدل عمومی که آزمایش کردیم، در مقایسه با سیستم مقایسهای، تقریباً ۱.۵ برابر عملکرد اوج بالاتر به ازای هر وات و ۳.۴ برابر تأخیر سرتاسری کمتر ارائه داد. در آزمایشهای داخلی ما، مزیت Jalapeño در مدلهای پیشروی OpenAI حتی بیشتر شد، که نشان میدهد با بزرگتر و پرتقاضاتر شدن بارهای کاری، ارزش این معماری افزایش مییابد.
Jalapeño از همان ابتدا با این پرسش طراحی شد: اگر وظیفه اصلی سخت افزاری که میساختیم، ارائه سرویس به مدلهای زبانی مدرن و آینده، به ویژه عاملهای تعاملی، بود، چه سخت افزاری میساختیم؟ بهبودهای Jalapeño از طراحی همزمان تراشه، حافظه، شبکه، نرم افزار و سامانه در مقیاس رک، بر محور بارهای کاری واقعی مدلهای زبانی، حاصل میشود. استنتاج مدل زبانی از چندین مرحلهٔ متمایز با گلوگاههای متفاوت عبور میکند. مرحله پیش پر کردن، زمانی که سامانه یک اعلان را پردازش میکند، محاسباتبر است؛ در حالی که رمزگشایی، زمانی که سامانه پاسخ را توکن به توکن تولید میکند، بیشتر به پهنای باند حافظه محدود میشود. ارتباطات نیز میتواند باعث افزایش تأخیر شود؛ زمانی که دادهها باید بین هستهها و تراشهها جابجا شوند، برخی واحدهای پردازشی در حین انتظار بیکار میمانند. سامانهای که در یک مرحله عملکرد بسیار خوبی دارد، ممکن است هنگام انتظار برای دادهها یا جابجایی وضعیت مدل میان منابع مختلف، این مزیت را از دست بدهد.
ما Jalapeño را به گونهای طراحی کردیم که جابجایی دادهها و تأخیرهای ارتباطی را به حداقل برساند. این یعنی وضعیت مدل، از جمله کش KV که هنگام تولید پاسخ استفاده میشود، میتواند به طور صریح جانمایی و محلی نگه داشته شود، در حالی که سامانه برای هر مرحله استنتاج، ترکیب مناسب محاسبات، حافظه و شبکه را فعال میکند. شبکه بخش جدایی ناپذیری از معماری است. دامنه وسیع آن امکان میدهد کل بار کاری درون یک سیستم متصل واحد باقی بماند، جابجایی داده به حداقل برسد و کل درخواست از ابتدا تا انتها سریع و کارآمد بماند. نتیجه، شتاب دهندهای متوازن و قابل تعویض است که میتواند از معماریهای در حال تغییر مدل پشتیبانی کند، هم در پیش پر کردن و هم در رمزگشایی عملکردی عالی داشته باشد و با تغییر توازن میان آنها سازگار شود؛ ویژگیای تعیین کننده در بارهای کاری عامل محور.
هوش مصنوعی نقشی مستقیم در توسعه Jalapeño داشت و با کاوش در پیاده سازیها، کوتاه کردن چرخههای طراحی، اندازه گیری و تأیید، و تکرار مداوم روی بارهای کاری مدل، به تیم امکان داد در نه ماه از طراحی اولیه به tapeout برسد. هوش مصنوعی همچنین به بهینه سازی مدارهای حسابی تراشه کمک کرد و به تیم امکان داد طبق برنامه، توان پردازشی بیشتری را در تراشه بگنجاند.
Jalapeño به عنوان یک هدف برنامه نویسی روشن و قابل پیشبینی، هم برای انسانها و هم برای هوش مصنوعی، طراحی شده است. مهندسان میتوانند کار را از طریق تانسورهای محلی، ارتباط صریح و همگام سازی قابل پیشبینی توصیف کنند. سپس هوش مصنوعی میتواند نحوهٔ نگاشت، جای گذاری، زمانبندی و هماهنگ سازی آن کار را در سراسر سیستم بهینه کند. آن ساختار روشن و پیش بینی پذیر، راهی قابل مدیریت در اختیار هوش مصنوعی میگذارد تا به مسئلهٔ به طور سنتی دشوارِ برنامه نویسی موازی بپردازد.
پشتیبانی از هر خانواده مدل جدید همچنان به کرنلهای جدید و بهینه سازیهای ویژه مدل نیاز دارد. تیم با استفاده از Codex همراه با GPT‑Astra، سه الگوهای وزن باز را که بخشی از برنامه تولید اولیه Jalapeño نبودند، ظرف دو ماه به عملکرد بالا رساند. این امر هم انعطاف پذیری معماری را نشان داد و هم سرعتی را که هوش مصنوعی میتواند با آن به ما در برنامه نویسی آن کمک کند. برای بلوکهای منتخب توجه و ترکیب متخصصان GPT‑OSS، پیاده سازیهای تولید شده توسط هوش مصنوعی ۱.۵ تا ۱.۸ برابر سریعتر از پیاده سازیهای موجودِ نوشته شده توسط متخصصان انسانی اجرا شدند. این ارقام مربوط به بلوکهای انتخاب شده هستند، نه کل مدل، اما به چرخهای قدرتمند و جدید برای توسعه اشاره دارند.
زیر ساخت هوش مصنوعی ارزشمند است، زیرا انجام کارهای مفید در دنیای واقعی را امکان پذیر میکند. با تولید کار مفیدتر از همان توان مصرفی و سخت افزار، Jalapeño میتواند به ما کمک کند به تقاضای بیشتری پاسخ دهیم و هزینهٔ ارائهٔ یک نتیجهٔ موفق را کاهش دهیم. برای OpenAI، این امر میتواند با فراهم کردن امکان رشد سریعتر کار مفید و درآمد نسبت به هزینه خدمت رسانی، اهرم عملیاتی را بهبود دهد. همچنین میتواند از پذیرش گستردهتر و سرمایه گذاری مستمر در مدلها، محصولات و زیر ساختهای بهتر پشتیبانی کند. استنتاج سریعتر میتواند تکرار سریعتر و موارد استفاده جدید را امکان پذیر کند.
Jalapeño مرزهای امکان را برای استنتاج کارآمد و کم تأخیر گسترش میدهد:
- استنتاج در حالت فوق سرد با بهره وریهایی که پیشتر فقط در حالت سریع در دسترس بودند
- استنتاج در حالت سریع با بهره وریهایی که پیشتر فقط در حالت دستهای در دسترس بودند
- کارایی بالاتر برای استنتاج در حالت دستهای
برنامه داریم تا پایان سال، استقرار Jalapeño را در زیرساخت محاسباتی OpenAI آغاز کنیم. این نخستین نسل از یک نقشه راه چند نسلی است: نسل ۲ در مراحل پیشرفتهٔ توسعه است و نسل ۳ در حال شکل گیری است. هر نسل بر آموختههای ما بنا خواهد شد و کارایی و سرعت را بیش از پیش ارتقاء خواهد داد.
پاسخگویی به تقاضای رو به رشد برای هوش مصنوعی، مستلزم بهره گیری از توان محاسباتی بیشتر از هر منبع در دسترس خواهد بود. ما به استقرار گستردهٔ شتاب دهندهها از NVIDIA و سایر شرکاء، هم برای بارهای کاری آموزش و هم برای بارهای کاری استنتاج، ادامه خواهیم داد. ماموریت ما این است که اطمینان حاصل کنیم که هوش مصنوعی عمومی به نفع همهٔ بشریت باشد.
همزمان با آماده شدن برای استقرار، همچنان در حال تأیید صلاحیت تولید، بلوغ بخشی نرم افزار، آماده سازی برای بهره برداری از Jalapeño در مقیاس گسترده و اعتبار سنجی عملکرد در میان مدلهای بیشتر هستیم. نتایج تا اینجا نشان میدهد که وقتی کل سیستم را با هم طراحی میکنیم، چه چیزی ممکن است: هوش مصنوعی پاسخگوتر، توانمندتر و AI عامل محور به صورت کارآمدتر به افراد بیشتری ارائه شود.
توان عملیاتی به ازای هر کیلو وات پیشرو
InferenceX · GPT‑OSS‑۱۲۰ میلیارد · nominal ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۲۰۰ ۱۲۰۰ وات
اوج و توان عملیاتی همسان
InferenceX · GPT‑OSS‑۱۲۰ میلیارد · nominal ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۲۰۰ ۱۲۰۰ وات
اوج ترکیبی بالاتر TPS بر کیلو وات
≈۱.۹×
۸۵,۴۴۸ در برابر ۴۴,۹۶۰ ترکیبی / کیلو وات
تأخیر سرتاسری کمتر
≈۱.۷×
۱.۰۳ ثانیه در برابر ۱.۸۰ ثانیه
کاهش حداقل TBT
≈۲.۷×
۰.۶۹ در برابر ۱.۸۷ میلی ثانیه (۱,۴۵۹ در برابر ۵۳۵ توکن/ثانیه/کاربر)
توان عملیاتی بیشتر با TBT قبلی
≈۵۳.۷×
۲۲٬۹۳۵ در برابر ۴۲۷ ترکیبی / kW (در ۵۳۵.۲۸ tok/s/user)
توان عملیاتی به ازای هر کیلو وات پیشرو
InferenceX · DeepSeek R۱ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱,۴۰۰ وات
اوج و توان عملیاتی همسان
InferenceX · DeepSeek R۱ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱,۴۰۰ وات
TPS / kW اوج ترکیبی بالاتر
≈۱٫۷×
۱۹,۶۴۱ در برابر ۱۱,۷۸۱ ترکیبی / کیلو وات
تأخیر سرتاسری کمتر
≈۳.۶×
۱.۶۵ ثانیه در برابر ۵.۹۹ ثانیه
کاهش حداقل TBT
≈۴.۱×
۱٫۴۳ در برابر ۵٫۹۰ میلی ثانیه (۷۰۰ در برابر ۱۶۹ توکن/ثانیه/کاربر)
توان عملیاتی بیشتر در TBT قبلی
≈۱۰۴.۳×
۱۲۵۸ در برابر ۱۱۸ مختلط / کیلو وات (در ۱۶۹.۴۱ tok/s/user)
توان عملیاتی به ازای کیلو وات پیشرو
InferenceX · Kimi K۲.۵ MXFP۴ · اسمی ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱۴۰۰ وات
اوج و توان عملیاتیِ همسان
InferenceX · Kimi K۲.۵ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ W؛ GB۳۰۰ ۱,۴۰۰ وات
اوج ترکیبی بالاتر TPS / kW
≈۱.۵×
۱۸,۱۹۵ در برابر ۱۱,۸۶۲ مختلط / kW
تأخیر سرتاسری کمتر
≈۳.۴×
۱.۵۶ ثانیه در برابر ۵.۳۱ ثانیه
کاهش حداقل TBT
≈۳.۸×
۱٫۴۴ در برابر ۵٫۴۸ میلی ثانیه (۶۹۴ در برابر ۱۸۲ توکن/ثانیه/کاربر)
توان عملیاتی بیشتر با TBT قبلی
≈۵۶.۱×
۶,۷۴۴ در برابر ۱۲۰ ترکیبی / کیلو وات (در ۱۸۲.۴۶ توکن/ثانیه/کاربر)


