پرش به محتوای اصلی
OpenAI

۳ شهریور ۱۴۰۵

مهندسیشرکت

نخستین نتایج Jalapeño نشان دهنده سرعت و کارایی پیشرو در صنعت در استنتاج هوش مصنوعی است

در حال بارگذاری…
نمای نزدیک از تراشه استنتاج Jalapeño که روی یک برد مدار سبزآبی نصب شده است.

از زمان معرفی Jalapeño، نخستین تراشه استنتاج سفارشی OpenAI، ما در حال آزمایش این تراشه و سامانه‌ای بوده‌ایم که بر پایه آن ساخته شده است. نتایج نشان دهنده پیشرفتی چشمگیر در عملکرد هستند: Jalapeño می‌تواند به ازای هر واحد توان، بار کاری بیشتری از هوش مصنوعی را انجام دهد و در عین حال پاسخ‌ها را سریع‌تر ارائه دهد. Jalapeño با یک معماری، هم توان عملیاتی بالاتر و هم تأخیر کمتر را ارائه می‌دهد، در حالی که سامانه‌های سخت افزاری موجود اغلب ناچارند میان این دو تجارت کنند.

برای مشتریان، این می‌تواند به معنای پاسخ‌های سریع‌تر، کارشناسان پشتیبانی پاسخگوتر، و دسترسی قابل اعتمادتر با افزایش تقاضا باشد. مأموریت ما این است که هوش عمومی مصنوعی (AGI) به سود همهٔ بشریت باشد. این پیشرفت‌ها کمک می‌کنند هوش مصنوعیِ هرچه توانمندتر، مقرون به صرفه‌تر و برای عموم در دسترس‌تر شود.

مدل‌های OpenAI نیز توسعه Jalapeño را تسریع کردند. نسل‌های پیشین به تیم در طراحی و راه اندازی تراشه کمک کردند، در حالی که جدید ترین مدل‌های ما در حال تسریع شیوه بهینه سازی و برنامه نویسی آن هستند. عملکرد Jalapeño در GPT‑OSS ۱۲۰B، DeepSeek R۱ و Kimi K۲.۵ ۱T نیز دیده می‌شود و نشان می‌دهد که این معماری در مدل‌های توسعه یافته در داخل و خارج از OpenAI کار می‌کند. Jalapeño در هر سه مورد، در اوج توان عملیاتی، ۱.۵ تا ۱.۹ برابر کار AI بیشتری به ازای هر وات ارائه داد و تأخیر سرتاسری آن نسبت به سامانه‌های مقایسه‌ای ۱.۷ تا ۳.۶ برابر کمتر بود. برای حجم‌های کاری بسیار تعاملی، عملکردی ۲.۱ تا ۴.۱ برابر بالاتر ارائه داد.

Jalapeño همچنین گواهی بر یک مزیت گسترده‌تر در پشتهٔ کامل است. OpenAI می‌تواند مدل‌ها، محصولات، نرم افزارهای ارائه سرویس، تراشه‌ها، حافظه، شبکه سازی و سامانه‌ها را به صورت یکپارچه طراحی کند و از آموخته‌های خود از بارهای کاری واقعی برای بهبود هر لایه از پشته استفاده کند. Jalapeño یک تراشهٔ اختصاصیِ عملیاتی با نتایج اندازه گیری‌شده است و آغاز یک پلتفرم چند نسلی به شمار می‌رود. در ماه‌های پیشِ رو، مقیاس Jalapeño را افزایش خواهیم داد تا محصولاتی سریع‌تر، توانمندتر و کارآمدتر برای مشتریان خود ارائه کنیم.

چگونه عملکرد Jalapeño را اندازه گیری کردیم

ما عملکرد را در شرایط یک تجربهٔ کاربری همسان ارزیابی می‌کنیم و می‌سنجیم که هر سیستم به ازای هر واحد توان، در عین برآورده کردن تأخیری که مشتریان و عامل‌های تعاملی نیاز دارند، چه مقدار کار مفید هوش مصنوعی می‌تواند انجام دهد. این موضوع به ویژه برای عامل‌ها اهمیت دارد، چون آن‌ها باید مراحل زیادی را به ترتیب کامل کنند؛ بنابراین تأخیرها می‌توانند در طول یک وظیفهٔ کامل روی هم انباشته شوند.

برای درک اینکه Jalapeño در عمل چگونه عمل می‌کند، آن را روی InferenceX آزمایش کردیم؛ یک بنچمارک عمومی از SemiAnalysis که کل فرآیند سرویس دهی به یک درخواست هوش مصنوعی را اندازه گیری می‌کند. Jalapeño را در سراسر دامنه عملیاتی آزمایش شده، از ارائه خدمات با توان عملیاتی بالا تا استفاده بسیار تعاملی با تأخیر کم، با سامانه‌های پیشرو AI که به صورت تجاری در دسترس هستند مقایسه کردیم. Jalapeño ترکیب بهتری از توان عملیاتی، بهره‌وری انرژی و تأخیر ارائه داد. اگرچه گاهی عملکرد به ازای هر تراشه گزارش می‌شود، ما معتقدیم معیار مفیدتر، عملکرد به ازای هر واحد توان مصرفی است.

هالوپینو برتری خود را در بهترینِ پیشین TBT افزایش می‌دهد

Jalapeño به‌ازای هر کاربر توکن‌های بیشتری ارائه می‌دهد

Jalapeño به ازای هر کیلو وات توان عملیاتی بیشتری ارائه می‌دهد

در هر سه مدل عمومی، Jalapeño در سراسر دامنه عملیاتی آزمایش‌شده، ترکیب بهتری از عملکرد به ازای هر وات و تأخیر ارائه داد و آن را بر مرز پیشروی پارتو قرار داد. برای مقایسهٔ یکسان سامانه‌ها، نتایج را با استفاده از توان نامی منتشرشدهٔ تراشهٔ هر شتاب دهنده به هنجار کردیم. Jalapeño دارای توان نامی ۷۰۰ وات است، هرچند توان پایدار اندازه گیری شدهٔ آن در بارهای کاری آزمایش شده در سطح ۵۵۰ وات یا کمتر باقی ماند.

Jalapeño در میان GPT‑OSS ۱۲۰B، DeepSeek R۱ ۶۷۰ میلیارد و Kimi K۲.۵ ۱ تریلیون عملکرد خوبی داشت. در Kimi، بزرگ ترین مدل عمومی که آزمایش کردیم، در مقایسه با سیستم مقایسه‌ای، تقریباً ۱.۵ برابر عملکرد اوج بالاتر به ازای هر وات و ۳.۴ برابر تأخیر سرتاسری کمتر ارائه داد. در آزمایش‌های داخلی ما، مزیت Jalapeño در مدل‌های پیشروی OpenAI حتی بیشتر شد، که نشان می‌دهد با بزرگ‌تر و پرتقاضاتر شدن بارهای کاری، ارزش این معماری افزایش می‌یابد.

طراحی معماری با هدف سرعت و بهره وری در یک تراشه واحد

Jalapeño از همان ابتدا با این پرسش طراحی شد: اگر وظیفه اصلی سخت افزاری که می‌ساختیم، ارائه سرویس به مدل‌های زبانی مدرن و آینده، به ویژه عامل‌های تعاملی، بود، چه سخت افزاری می‌ساختیم؟ بهبودهای Jalapeño از طراحی همزمان تراشه، حافظه، شبکه، نرم افزار و سامانه در مقیاس رک، بر محور بارهای کاری واقعی مدل‌های زبانی، حاصل می‌شود. استنتاج مدل زبانی از چندین مرحلهٔ متمایز با گلوگاه‌های متفاوت عبور می‌کند. مرحله پیش پر کردن، زمانی که سامانه یک اعلان را پردازش می‌کند، محاسبات‌بر است؛ در حالی که رمزگشایی، زمانی که سامانه پاسخ را توکن به توکن تولید می‌کند، بیشتر به پهنای باند حافظه محدود می‌شود. ارتباطات نیز می‌تواند باعث افزایش تأخیر شود؛ زمانی که داده‌ها باید بین هسته‌ها و تراشه‌ها جابجا شوند، برخی واحدهای پردازشی در حین انتظار بیکار می‌مانند. سامانه‌ای که در یک مرحله عملکرد بسیار خوبی دارد، ممکن است هنگام انتظار برای داده‌ها یا جابجایی وضعیت مدل میان منابع مختلف، این مزیت را از دست بدهد.

ما Jalapeño را به گونه‌ای طراحی کردیم که جابجایی داده‌ها و تأخیرهای ارتباطی را به حداقل برساند. این یعنی وضعیت مدل، از جمله کش KV که هنگام تولید پاسخ استفاده می‌شود، می‌تواند به طور صریح جانمایی و محلی نگه داشته شود، در حالی که سامانه برای هر مرحله استنتاج، ترکیب مناسب محاسبات، حافظه و شبکه را فعال می‌کند. شبکه بخش جدایی ناپذیری از معماری است. دامنه وسیع آن امکان می‌دهد کل بار کاری درون یک سیستم متصل واحد باقی بماند، جابجایی داده به حداقل برسد و کل درخواست از ابتدا تا انتها سریع و کارآمد بماند. نتیجه، شتاب دهنده‌ای متوازن و قابل تعویض است که می‌تواند از معماری‌های در حال تغییر مدل پشتیبانی کند، هم در پیش پر کردن و هم در رمزگشایی عملکردی عالی داشته باشد و با تغییر توازن میان آن‌ها سازگار شود؛ ویژگی‌ای تعیین کننده در بارهای کاری عامل محور.

ما از هوش مصنوعی برای طراحی تراشه استفاده کردیم و تراشه را طوری طراحی کردیم که هوش مصنوعی بتواند آن را برنامه نویسی کند

هوش مصنوعی نقشی مستقیم در توسعه Jalapeño داشت و با کاوش در پیاده سازی‌ها، کوتاه کردن چرخه‌های طراحی، اندازه گیری و تأیید، و تکرار مداوم روی بارهای کاری مدل، به تیم امکان داد در نه ماه از طراحی اولیه به tapeout برسد. هوش مصنوعی همچنین به بهینه سازی مدارهای حسابی تراشه کمک کرد و به تیم امکان داد طبق برنامه، توان پردازشی بیشتری را در تراشه بگنجاند.

Jalapeño به عنوان یک هدف برنامه نویسی روشن و قابل پیشبینی، هم برای انسان‌ها و هم برای هوش مصنوعی، طراحی شده است. مهندسان می‌توانند کار را از طریق تانسورهای محلی، ارتباط صریح و همگام سازی قابل پیشبینی توصیف کنند. سپس هوش مصنوعی می‌تواند نحوهٔ نگاشت، جای گذاری، زمان‌بندی و هماهنگ سازی آن کار را در سراسر سیستم بهینه کند. آن ساختار روشن و پیش بینی پذیر، راهی قابل مدیریت در اختیار هوش مصنوعی می‌گذارد تا به مسئلهٔ به طور سنتی دشوارِ برنامه نویسی موازی بپردازد.

پشتیبانی از هر خانواده مدل جدید همچنان به کرنل‌های جدید و بهینه سازی‌های ویژه مدل نیاز دارد. تیم با استفاده از Codex همراه با GPT‑Astra، سه الگوهای وزن باز را که بخشی از برنامه تولید اولیه Jalapeño نبودند، ظرف دو ماه به عملکرد بالا رساند. این امر هم انعطاف پذیری معماری را نشان داد و هم سرعتی را که هوش مصنوعی می‌تواند با آن به ما در برنامه نویسی آن کمک کند. برای بلوک‌های منتخب توجه و ترکیب متخصصان GPT‑OSS، پیاده سازی‌های تولید شده توسط هوش مصنوعی ۱.۵ تا ۱.۸ برابر سریع‌تر از پیاده سازی‌های موجودِ نوشته شده توسط متخصصان انسانی اجرا شدند. این ارقام مربوط به بلوک‌های انتخاب شده هستند، نه کل مدل، اما به چرخه‌ای قدرتمند و جدید برای توسعه اشاره دارند.

مسیر پیشِ رو برای استنتاج کارآمد و فوق سریع

زیر ساخت هوش مصنوعی ارزشمند است، زیرا انجام کارهای مفید در دنیای واقعی را امکان پذیر می‌کند. با تولید کار مفیدتر از همان توان مصرفی و سخت افزار، Jalapeño می‌تواند به ما کمک کند به تقاضای بیشتری پاسخ دهیم و هزینهٔ ارائهٔ یک نتیجهٔ موفق را کاهش دهیم. برای OpenAI، این امر می‌تواند با فراهم کردن امکان رشد سریع‌تر کار مفید و درآمد نسبت به هزینه خدمت رسانی، اهرم عملیاتی را بهبود دهد. همچنین می‌تواند از پذیرش گسترده‌تر و سرمایه گذاری مستمر در مدل‌ها، محصولات و زیر ساخت‌های بهتر پشتیبانی کند. استنتاج سریع‌تر می‌تواند تکرار سریع‌تر و موارد استفاده جدید را امکان پذیر کند.

Jalapeño مرزهای امکان را برای استنتاج کارآمد و کم تأخیر گسترش می‌دهد:

  • استنتاج در حالت فوق سرد با بهره وری‌هایی که پیش‌تر فقط در حالت سریع در دسترس بودند
  • استنتاج در حالت سریع با بهره وری‌هایی که پیش‌تر فقط در حالت دسته‌ای در دسترس بودند
  • کارایی بالاتر برای استنتاج در حالت دسته‌ای

برنامه داریم تا پایان سال، استقرار Jalapeño را در زیرساخت محاسباتی OpenAI آغاز کنیم. این نخستین نسل از یک نقشه راه چند نسلی است: نسل ۲ در مراحل پیشرفتهٔ توسعه است و نسل ۳ در حال شکل گیری است. هر نسل بر آموخته‌های ما بنا خواهد شد و کارایی و سرعت را بیش از پیش ارتقاء خواهد داد.

پاسخگویی به تقاضای رو به رشد برای هوش مصنوعی، مستلزم بهره گیری از توان محاسباتی بیشتر از هر منبع در دسترس خواهد بود. ما به استقرار گستردهٔ شتاب دهنده‌ها از NVIDIA و سایر شرکاء، هم برای بارهای کاری آموزش و هم برای بارهای کاری استنتاج، ادامه خواهیم داد. ماموریت ما این است که اطمینان حاصل کنیم که هوش مصنوعی عمومی به نفع همهٔ بشریت باشد.

همزمان با آماده شدن برای استقرار، همچنان در حال تأیید صلاحیت تولید، بلوغ بخشی نرم افزار، آماده سازی برای بهره برداری از Jalapeño در مقیاس گسترده و اعتبار سنجی عملکرد در میان مدل‌های بیشتر هستیم. نتایج تا اینجا نشان می‌دهد که وقتی کل سیستم را با هم طراحی می‌کنیم، چه چیزی ممکن است: هوش مصنوعی پاسخگوتر، توانمندتر و AI عامل محور به صورت کارآمدتر به افراد بیشتری ارائه شود.

ضمیمه

Jalapeño در GPT‑OSS ۱۲۰ میلیارد پیشرو پارتو است

توان عملیاتی به ازای هر کیلو وات پیشرو

InferenceX · GPT‑OSS‑۱۲۰ میلیارد · nominal ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۲۰۰ ۱۲۰۰ وات

Jalapeño در سراسر نقاط عملیاتی GPT‑OSS پیشتاز است

اوج و توان عملیاتی همسان

InferenceX · GPT‑OSS‑۱۲۰ میلیارد · nominal ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۲۰۰ ۱۲۰۰ وات

اوج ترکیبی بالاتر TPS بر کیلو وات

≈۱.۹×

۸۵,۴۴۸ در برابر ۴۴,۹۶۰ ترکیبی / کیلو وات

تأخیر سرتاسری کمتر

≈۱.۷×

۱.۰۳ ثانیه در برابر ۱.۸۰ ثانیه

کاهش حداقل TBT

≈۲.۷×

۰.۶۹ در برابر ۱.۸۷ میلی ثانیه (۱,۴۵۹ در برابر ۵۳۵ توکن/ثانیه/کاربر)

توان عملیاتی بیشتر با TBT قبلی

≈۵۳.۷×

۲۲٬۹۳۵ در برابر ۴۲۷ ترکیبی / kW (در ۵۳۵.۲۸ tok/s/user)

Jalapeño در DeepSeek R۱ ۶۷۰ میلیارد بر مرز پیشرو پارتو قرار دارد

توان عملیاتی به ازای هر کیلو وات پیشرو

InferenceX · DeepSeek R۱ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱,۴۰۰ وات

Jalapeño در تمام نقاط عملیاتی DeepSeek R۱ پیشتاز است

اوج و توان عملیاتی همسان

InferenceX · DeepSeek R۱ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱,۴۰۰ وات

TPS / kW اوج ترکیبی بالاتر

≈۱٫۷×

۱۹,۶۴۱ در برابر ۱۱,۷۸۱ ترکیبی / کیلو وات

تأخیر سرتاسری کمتر

≈۳.۶×

۱.۶۵ ثانیه در برابر ۵.۹۹ ثانیه

کاهش حداقل TBT

≈۴.۱×

۱٫۴۳ در برابر ۵٫۹۰ میلی ثانیه (۷۰۰ در برابر ۱۶۹ توکن/ثانیه/کاربر)

توان عملیاتی بیشتر در TBT قبلی

≈۱۰۴.۳×

۱۲۵۸ در برابر ۱۱۸ مختلط / کیلو وات (در ۱۶۹.۴۱ tok/s/user)

Jalapeño در Kimi K۲.۵ ۱ تریلیلون روی مرز پیشروی پارتو قرار دارد

توان عملیاتی به ازای کیلو وات پیشرو

InferenceX · Kimi K۲.۵ MXFP۴ · اسمی ۸k/۱k · STP · بسته TDP: Jalapeño ۷۰۰ وات؛ GB۳۰۰ ۱۴۰۰ وات

Jalapeño در تمام نقاط عملیاتی Kimi K۲.۵ پیشتاز است

اوج و توان عملیاتیِ همسان

InferenceX · Kimi K۲.۵ MXFP۴ · اسمی ۸ هزار/۱ هزار · STP · بسته TDP: Jalapeño ۷۰۰ W؛ GB۳۰۰ ۱,۴۰۰ وات

اوج ترکیبی بالاتر TPS / kW

≈۱.۵×

۱۸,۱۹۵ در برابر ۱۱,۸۶۲ مختلط / kW

تأخیر سرتاسری کمتر

≈۳.۴×

۱.۵۶ ثانیه در برابر ۵.۳۱ ثانیه

کاهش حداقل TBT

≈۳.۸×

۱٫۴۴ در برابر ۵٫۴۸ میلی ثانیه (۶۹۴ در برابر ۱۸۲ توکن/ثانیه/کاربر)

توان عملیاتی بیشتر با TBT قبلی

≈۵۶.۱×

۶,۷۴۴ در برابر ۱۲۰ ترکیبی / کیلو وات (در ۱۸۲.۴۶ توکن/ثانیه/کاربر)

نویسنده

OpenAI