Jalapeño-ийн анхны үр дүн нь AI-ын дүгнэлтэд салбартаа тэргүүлэх хурд, үр ашгийг харуулж байна

OpenAI-ийн анхны тусгай инференс чип болох Jalapeño-г танилцуулснаас хойш бид уг чип болон түүнийг тойрон бүтээсэн системийг туршиж байна. Үр дүн нь гүйцэтгэлийн мэдэгдэхүйц ахицыг харуулж байна: Jalapeño нь эрчим хүчний нэгж тутамд илүү олон Хиймэл оюун ухааны ажлыг боловсруулахаас гадна хариуг илүү хурдан буцааж чадна. Одоо байгаа техник хангамжийн системүүд ихэвчлэн энэ хоёрын хооронд сонголт хийх шаардлагатай байдаг бол Jalapeño нь нэг архитектураар илүү өндөр нэвтрүүлэх чадамж болон бага хоцролтыг зэрэг хангадаг.
Хэрэглэгчдэд энэ нь илүү хурдан хариу авах, илүү хурдан хариу үйлдэл үзүүлэх агентууд, мөн эрэлт нэмэгдэхийн хэрээр илүү найдвартай хандалт гэсэн үг юм. Бидний эрхэм зорилго бол хиймэл ерөнхий оюун ухаан бүх хүн төрөлхтөнд ашиг тусаа өгөхийг баталгаажуулах явдал юм. Эдгээр ахиц дэвшил нь улам бүр чадварлаг болж буй хиймэл оюун ухааныг илүү хямд, илүү өргөн хүртээмжтэй болгоход тусална.
OpenAI-ийн загварууд Jalapeño-ийн хөгжүүлэлтийг мөн хурдасгасан. Өмнөх үеийн загварууд багт чипийг зохион бүтээж, ажилд оруулахад тусалсан бол манай хамгийн сүүлийн үеийн загварууд түүнийг хэрхэн оновчлон, програмчлахыг хурдасгаж байна. Jalapeño-ийн гүйцэтгэл GPT‑OSS 120B, DeepSeek R1, Kimi K2.5 1T загваруудад өргөн хүрээг хамарч байгаа нь энэхүү архитектур OpenAI-ийн дотор болон гадна хөгжүүлсэн загваруудад ажилладгийг харуулж байна. Эдгээр гурвууланд нь Jalapeño нь оргил нэвтрүүлэх чадамжийн үед ватт тутамд 1.5–1.9 дахин их хиймэл оюун ухаан ажил гүйцэтгэж, харьцуулах системүүдээс төгсгөлөөс төгсгөл хүртэлх хоцролт нь 1.7–3.6 дахин бага байв. Өндөр интерактив ачааллуудын хувьд энэ нь 2.1–4.1 дахин өндөр гүйцэтгэл үзүүлсэн.
Jalapeño нь мөн илүү өргөн хүрээний бүрэн стек давуу талыг харуулж байна. OpenAI нь загвар, бүтээгдэхүүн, үйлчилгээний програм хангамж, чип, санах ой, сүлжээ болон системүүдийг хамтад нь загварчилж, бодит ачааллуудаас сурсан зүйлсээ ашиглан стекийн давхарга бүрийг сайжруулах боломжтой. Jalapeño нь бодит хэмжилтийн үр дүн бүхий OpenAI-ийн өөрийн чип бөгөөд олон үе дамжин хөгжих платформын эхлэл юм. Ойрын саруудад бид хэрэглэгчдэдээ илүү хурдан, илүү чадварлаг, илүү үр ашигтай бүтээгдэхүүн хүргэхийн тулд Jalapeño-г өргөжүүлнэ.
Бид ижил түвшний хэрэглэгчийн туршлагын нөхцөлд гүйцэтгэлийг үнэлж, харилцагчид болон интерактив агентуудад шаардлагатай саатлын хугацааг хангахын зэрэгцээ систем бүр эрчим хүчний нэгж тутамд хэр хэмжээний ашигтай хиймэл оюун ухааны ажил гүйцэтгэж чадахыг хэмждэг. Энэ нь ялангуяа олон алхмыг дарааллаар нь гүйцэтгэх шаардлагатай агентуудын хувьд чухал бөгөөд саатал нь бүхэл бүтэн даалгаврын туршид хуримтлагдаж болзошгүй.
Jalapeño бодит хэрэглээнд хэрхэн ажиллаж байгааг ойлгохын тулд бид хиймэл оюун ухааны хүсэлтийг боловсруулах бүхий л үйл явцыг хэмждэг SemiAnalysis-ийн нийтэд нээлттэй InferenceX бенчмарк дээр туршсан. Бид Jalapeño-г өндөр нэвтрүүлэх чадамжтай үйлчилгээнээс эхлээд өндөр интерактив, бага сааталтай хэрэглээ хүртэлх туршсан ажиллагааны хүрээнд арилжааны тэргүүлэх хиймэл оюун ухааны системүүдтэй харьцуулсан. Jalapeño нь нэвтрүүлэх чадамж, эрчим хүчний үр ашиг, саатлын илүү сайн хослолыг үзүүлсэн. Гүйцэтгэлийг заримдаа чип тутамд тайлагнадаг ч илүү хэрэгтэй стандарт нь эрчим хүчний нэгж тутамд ногдох гүйцэтгэл гэж бид үзэж байна.
Нийтэд нээлттэй гурван загварын хувьд Jalapeño нь туршсан ажиллагааны хүрээнд ватт тутам дахь гүйцэтгэл болон саатлын илүү сайн хослолыг үзүүлж, Парето хил хязгаар дээр байрлав. Системүүдийг тууштай харьцуулахын тулд бид хурдасгуур бүрийн нийтэлсэн чипийн чадлын үзүүлэлтийг ашиглан үр дүнг нормчилсон. Jalapeño нь 700 ваттын нэрлэсэн чадалтай боловч туршсан ажлын ачааллууд дээр хэмжсэн тогтвортой эрчим хүчний хэрэглээ нь 550 ватт буюу түүнээс бага байсан.
Jalapeño нь GPT‑OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T загваруудад өндөр гүйцэтгэл үзүүлсэн. Бидний туршсан хамгийн том олон нийтэд нээлттэй загвар болох Kimi дээр, харьцуулах системээс ватт тутамд ойролцоогоор 1.5 дахин өндөр оргил гүйцэтгэл, эхнээс нь дуусталх хоцролт 3.4 дахин бага үзүүлсэн. Бидний дотоод туршилтаар Jalapeñoгийн давуу тал хил хязгаарын OpenAI загварууд дээр улам нэмэгдсэн нь ажлын ачаалал нэмэгдэж, илүү шаардлага өндөр болохын хэрээр энэ архитектурын үнэ цэн нэмэгдэж байгааг харуулж байна.
Jalapeño-г анхнаас нь дараах асуултаар загварчилсан: хэрэв түүний үндсэн үүрэг нь орчин үеийн болон ирээдүйн хэлний загваруудад, ялангуяа интерактив агентуудад үйлчилгээ үзүүлэх байсан бол бид ямар техник хангамж бүтээх байсан бэ? Jalapeño-гийн давуу тал нь чип, санах ой, сүлжээ, программ хангамж, рэкийн хэмжээний системийг бодит хэлний загварын ажлын ачаалалд тулгуурлан хамтад нь загварчилснаас гардаг. Хэлний загварын инференс нь өөр өөр саад бэрхшээлтэй хэд хэдэн ялгаатай үе шатаар дамждаг. Систем нь өгөгдлийг боловсруулдаг prefill үе шат нь их тооцоолол шаарддаг бол систем хариултыг токен бүрээр үүсгэдэг decode үе шат нь санах ойн зурвасын өргөнөөр илүү хязгаарлагддаг. Өгөгдөл цөмүүд болон чипүүдийн хооронд шилжих шаардлагатай үед харилцаа холбоо мөн саатал үүсгэж, зарим боловсруулалтын нэгжийг хүлээж байх зуур нь сул зогсоож болно. Нэг үе шатанд онцгой сайн ажилладаг систем нь өгөгдөл хүлээх эсвэл загварын төлөвийг өөр өөр нөөцийн хооронд шилжүүлэх үед тэр давуу талаа алдаж болно.
Бид Jalapeño-г өгөгдөл дамжуулалт болон харилцаа холбооны саатлыг хамгийн бага байлгахаар зохион бүтээсэн. Энэ нь систем инференсийн үе шат бүрд тооцоолол, санах ой, сүлжээний зөв хослолыг идэвхжүүлэхийн зэрэгцээ хариу үүсгэхэд ашигладаг KV кэшийг багтаасан загварын төлөвийг тодорхой байршуулж, дотоодод нь хадгалах боломжтой гэсэн үг. Сүлжээ нь архитектурын салшгүй хэсэг юм. Түүний өргөн хүрээ нь ачааллыг бүхэлд нь нэг холбогдсон систем дотор байлгаж, өгөгдлийн шилжилтийг багасган, бүрэн хүсэлтийг эхнээс нь дуустал хурдан, үр ашигтай байхад тусалдаг. Үр дүнд нь өөрчлөгдөж буй загварын архитектуруудыг дэмжих, prefill болон decode аль алинд нь өндөр гүйцэтгэл үзүүлэх, мөн тэдгээрийн хоорондын тэнцвэр өөрчлөгдөхөд дасан зохицох чадвартай, агентлагийн ажлын ачааллын онцлог шинж болох тэнцвэртэй, харилцан орлуулж болох хурдасгуур бий болдог.
Хиймэл оюун ухаан нь Jalapeño-г хөгжүүлэхэд шууд үүрэг гүйцэтгэж, хэрэгжүүлэлтийн хувилбаруудыг судалж, загварчлал, хэмжилт, баталгаажуулалтын давталтуудыг богиносгон, загварын ачааллууд дээр тасралтгүй давтан сайжруулалт хийснээр багт анхны загвараас "tapeout" хүртэл есөн сарын дотор шилжих боломж олгосон. Хиймэл оюун ухаан нь мөн чипийн арифметик хэлхээнүүдийг оновчлоход тусалж, багт төлөвлөсөн хугацаанд чипэд илүү их тооцооллын гүйцэтгэлийг багтаах боломж олгосон.
Jalapeño-г хүн болон хиймэл оюун ухаан аль алинд нь ойлгомжтой, урьдчилан таамаглах боломжтой програмчлалын зорилтот платформ байхаар зохион бүтээсэн. Инженерүүд локал тензор, тодорхой харилцаа холбоо болон урьдчилан таамаглах боломжтой синхрончлол ашиглан ажлыг тодорхойлох боломжтой. Дараа нь хиймэл оюун ухаан нь тухайн ажлыг систем даяар хэрхэн хуваарилах, байршуулах, хуваарьлах болон уялдуулахыг оновчтой болгох боломжтой. Энэхүү тодорхой, урьдчилан таамаглах боломжтой бүтэц нь уламжлалт байдлаар бэрхшээлтэй байсан зэрэгцээ програмчлалын асуудлыг шийдвэрлэх боломжтой арга замыг хиймэл оюун ухаанд олгодог.
Шинэ загварын гэр бүл бүрийг дэмжихэд шинэ цөмүүд болон загварт тусгайлан тохируулсан оновчлолууд шаардлагатай хэвээр байна. Баг Codex-ийг GPT‑Astra‑тай ашиглан, Jalapeño-гийн анхны үйлдвэрлэлийн төлөвлөгөөнд байгаагүй нээлттэй жинтэй гурван загварыг хоёр сарын дотор өндөр гүйцэтгэлд хүргэсэн. Энэ нь архитектурын уян хатан байдал болон хиймэл оюун ухаан үүнийг програмчлахад бидэнд туслах хурдыг хоёуланг нь харуулсан. Сонгосон GPT‑OSS анхаарал болон мэргэжилтнүүдийн холимог блокуудын хувьд хиймэл оюун ухаанаар үүсгэсэн хэрэгжүүлэлтүүд нь хүний мэргэжилтнүүдийн бичсэн одоо байгаа хэрэгжүүлэлтүүдээс 1.5–1.8 дахин хурдан ажилласан. Эдгээр тоо нь бүрэн загварт бус, сонгосон блокуудад хамаарах боловч хөгжүүлэлтийн хүчирхэг шинэ давталтыг илтгэж байна.
Хиймэл оюун ухааны дэд бүтэц нь бодит ертөнцөд хэрэгтэй ажлыг хийх боломж олгодог учраас үнэ цэнтэй. Ижил эрчим хүч болон техник хангамжийг ашиглан илүү их үр ашигтай ажил гүйцэтгэснээр Jalapeño нь илүү их эрэлт хэрэгцээг хангаж, амжилттай үр дүн хүргэх зардлыг бууруулахад тусална. OpenAI-ийн хувьд энэ нь хэрэгтэй ажил болон орлого үйлчилгээ үзүүлэх өртгөөс илүү хурдан өсөх боломж олгож, үйл ажиллагааны хөшүүргийг сайжруулж чадна. Мөн илүү өргөн хэрэглээ болон илүү сайн загвар, бүтээгдэхүүн, дэд бүтцэд үргэлжлүүлэн хөрөнгө оруулахыг дэмжиж чадна. Илүү хурдан дүгнэлт гаргах нь илүү хурдан давталт хийх болон шинэ хэрэглээний тохиолдлуудыг боломжтой болгодог.
Jalapeño нь үр ашигтай, саатал багатай инференсийн боломжийг өргөжүүлнэ:
- Өмнө нь зөвхөн хурдан горимд боломжтой байсан үр ашигтай байдлаар ultra хурдан горимын дүгнэлт
- Өмнө нь зөвхөн багц горимд боломжтой байсан үр ашигтай хурдан горимын дүгнэлт
- Багц горимын гаргалгааны өндөр үр ашиг
Бид энэ оны эцэс гэхэд Jalapeño-г OpenAI-ийн тооцооллын дэд бүтцэд нэвтрүүлж эхлэхээр төлөвлөж байна. Энэ нь олон үеийг хамарсан замын зураглалын эхний үе юм: Gen 2 эрчимтэй хөгжүүлэгдэж байгаа бол Gen 3 бүрэлдэн тогтож байна. Үе бүр бидний сурсан зүйл дээр тулгуурлаж, үр ашиг болон хурдыг цаашид ахиулна.
Хиймэл оюун ухааны өсөн нэмэгдэж буй эрэлтийг хангахад боломжит бүх эх үүсвэрээс илүү их тооцоолох хүчин чадал шаардлагатай болно. Бид сургалт болон инференсийн ажлын ачаалалд NVIDIA болон бусад түншийн хурдасгууруудыг цаашид ч өргөнөөр ашиглана. Бидний эрхэм зорилго бол хиймэл ерөнхий оюун ухаан бүх хүн төрөлхтөнд ашиг тусаа өгөхийг баталгаажуулах явдал юм.
Байршуулалтад бэлтгэхийн зэрэгцээ бид үйлдвэрлэлийн баталгаажуулалтыг үргэлжлүүлж, программ хангамжийг боловсронгуй болгож, Jalapeño-г өргөн цар хүрээнд ажиллуулах бэлтгэл хангаж, илүү олон загварын гүйцэтгэлийг баталгаажуулж байна. Одоогийн үр дүн нь бид бүхэл системийг хамтад нь зохион бүтээхэд юу боломжтойг харуулж байна: илүү шуурхай хариу үйлдэлтэй, чадварлаг, агент AI-ийг илүү олон хүнд илүү үр ашигтайгаар хүргэх боломжтой.
КВТ ТУТАМД НОГДОХ ДАМЖУУЛАХ ЧАДВАРЫН ХЯЗГААР
InferenceX · GPT‑OSS‑120B · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB200 1,200 Вт
ОРГИЛ БА ТОХИРСОН НЭВТРҮҮЛЭХ ЧАДАМЖ
InferenceX · GPT‑OSS‑120B · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB200 1,200 Вт
Илүү өндөр оргил холимог TPS / кВт
≈1.9×
85,448 ба 44,960 холимог / кВт
Төгсгөлөөс төгсгөл хүртэлх бага саатал
≈1.7×
1.03 сек vs 1.80 сек
Хамгийн бага TBT буурсан
≈2.7×
0.69 vs. 1.87 ms (1,459 vs. 535 tok/s/user)
Өмнөх TBT-тэй харьцуулахад илүү өндөр нэвтрүүлэх чадамж
≈53.7×
22,935 vs. 427 холимог / kW (535.28 ток/с/хэрэглэгч үед)
КВТ ТУТАМД НОГДОХ ДАМЖУУЛАХ ЧАДВАРЫН ХЯЗГААР
InferenceX · DeepSeek R1 MXFP4 · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB300 1,400 Вт
ОРГИЛ БА ТОХИРСОН НЭВТРҮҮЛЭХ ЧАДАМЖ
InferenceX · DeepSeek R1 MXFP4 · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB300 1,400 Вт
Илүү өндөр оргил холимог TPS / кВт
≈1.7×
19,641 vs. 11,781 холимог / kW
Төгсгөлөөс төгсгөл хүртэлх бага саатал
≈3.6×
1.65 сек vs. 5.99 сек
Хамгийн бага TBT буурсан
≈4.1×
1.43 ба 5.90 мс (700 ба 169 ток/с/хэрэглэгч)
Өмнөх TBT-тэй харьцуулахад илүү өндөр нэвтрүүлэх чадамж
≈104.3×
12,258 ба 118 холимог / кВт (169.41 токен/сек/хэрэглэгч үед)
КВТ ТУТАМД НОГДОХ ДАМЖУУЛАХ ЧАДВАРЫН ХЯЗГААР
InferenceX · Kimi K2.5 MXFP4 · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB300 1,400 Вт
ОРГИЛ БА ТОХИРСОН НЭВТРҮҮЛЭХ ЧАДАМЖ
InferenceX · Kimi K2.5 MXFP4 · нэрлэсэн 8k/1k · STP · багцын TDP: Jalapeño 700 Вт; GB300 1,400 Вт
Илүү өндөр оргил холимог TPS / кВт
≈1.5×
18,195 ба 11,862 холимог токен/сек/кВт
Төгсгөлөөс төгсгөл хүртэлх бага саатал
≈3.4×
1.56 сек vs. 5.31 сек
Хамгийн бага TBT буурсан
≈3.8×
1.44 vs. 5.48 ms (694 vs. 182 ток/с/хэрэглэгч)
Өмнөх TBT-тэй харьцуулахад илүү өндөр нэвтрүүлэх чадамж
≈56.1×
6,744 vs. 120 холимог / kW (182.46 tok/s/user дээр)


