Asil awal Jalapeño nuduhake kacepetan lan efisiensi inferensi AI sing unggul ing industri

Wiwit ngumumaké Jalapeño, chip inferensi kustom pisanan saka OpenAI, wis ditliti chip lan sistem sing dibangun ing sakupenge. Asilé nuduhaké paningkatan kinerja sing signifikan: Jalapeño saged nglayani langkung kathah tugas AI saben unit daya, lan ugi maringi wangsulan kanthi langkung rikat. Jalapeño maringi kapasitas pangolahan langkung inggil lan latensi langkung asor kanthi satunggal arsitektur, nalika sistem piranti keras ingkang sampun wonten asring kedah nglampahi kompromi antawisipun kalih punika.
Kanggo para pelanggan, iki bisa ateges respon sing luwih cepet, agen sing luwih responsif, lan akses sing luwih dipercaya nalika panjaluk saya tambah. Misi kita yaiku kanggo mesthekake yen kecerdasan umum gawean menehi manfaat kanggo kabeh umat manungsa. Keuntungan iki bakal mbantu nggawe AI sing tak mumpuni dadi luwih terjangkau lan luwih kasedhiya kanthi luwih kasedhiya.
Model OpenAI uga nyepetake pangembangan Jalapeño. Generasi sadurunge mbantu tim ngrancang lan ngoperasikake chip kasebut, dene model paling anyar kita nyepetake cara kita ngoptimalake lan memrogram chip kasebut. Kinerja Jalapeño nyakup GPT‑OSS 120B, DeepSeek R1, lan Kimi K2.5 1T, nuduhake manawa arsitektur kasebut bisa digunakake ing macem-macem model sing dikembangake ing njero lan njaba OpenAI. Ing katelune, Jalapeño nyedhiyakake karya AI 1.5 nganti 1.9 kaping luwih akeh saben watt ing kapasitas pangolahan puncak lan latensi saka wiwitan nganti pungkasan 1,7 nganti 3,6 kaping luwih endhek tinimbang sistem pembanding. Kanggo beban kerja sing interaktif banget, iki ngasilake kinerja 2,1 nganti 4,1 kali luwih dhuwur.
Jalapeño uga dadi bukti anané kaunggulan tumpukan lengkap sing luwih jembar. OpenAI bisa ngrancang model, produk, piranti lunak panyajian, chip, memori, jaringan, lan sistem kanthi bebarengan, kanthi nggunakake apa sing kita sinaoni saka beban kerja nyata kanggo ningkatake saben lapisan tumpukan. Jalapeño lagi nggarap silikon pihak pertama kanthi asil sing diukur, lan iki minangka wiwitan saka platform multigenerasi. Ing sawetara wulan ngarep, kita bakal ningkatake Jalapeño kanggo ngirim produk sing luwih cepet, luwih mumpuni, lan luwih efisien kanggo para pelanggan.
Ngevaluasi kinerja adhedhasar pengalaman pangguna sing padha, kanthi ngukur sepira akeh karya AI sing migunani sing bisa dirampungake saben sistem saben unit daya, nalika tetep nyukupi latensi sing dibutuhake pelanggan lan agen interaktif. Iki penting utamane kanggo agen, sing kudu ngrampungake akeh langkah kanthi urut, mula wektu tundha bisa saya numpuk sajrone sakabehe tugas.
Kanggo mangerteni kepiye kinerja Jalapeño ing praktik, kita nguji ing InferenceX, sawijining patokan umum saka SemiAnalysis sing ngukur sakabèhé proses nglayani panjaluk AI. Kita mbandhingake Jalapeño karo sistem AI komersial unggulan sing kasedhiya ing pasar sajrone rentang operasi sing diuji, saka panyajian kanthi kapasitas pangolahan Dipikir Nemen nganti panggunaan sing interaktif banget lan latensi rendah. Jalapeño nyedhiyakake kombinasi kapasitas pangolahan, efisiensi daya, lan latensi sing luwih apik. Sanajan kinerja kadhangkala dilapuraké saben chip, kita yakin yèn standar sing luwih migunani yaiku kinerja saben satuan daya.
Ing sakabèhé telung model publik, Jalapeño nyedhiyakake kombinasi kinerja saben watt lan latensi sing luwih apik ing saindhenging rentang operasi sing diuji, saéngga dumunung ing wates tercanggih Pareto. Kanggo mbandhingake sistem-sistem kasebut kanthi konsisten, kita nganormalisasi asil nganggo rating daya chip sing wis dipublikasikake kanggo saben akselerator. Jalapeño dinilai 700 watt, sanajan daya terus-terusan sing diukur tetep ana ing utawa ing sangisore 550 watt ing beban kerja sing dites.
Jalapeño nuduhake kinerja sing kuwat ing GPT‑OSS 120B, DeepSeek R1 670B, lan Kimi K2.5 1T. Ing Kimi, model umum paling gedhé sing dites, model iki ngasilake kinerja puncak per watt kira-kira 1,5 kali luwih dhuwur lan latensi saka wiwitan nganti pungkasan 3,4 kali luwih endhek tinimbang sistem pambanding. Ing pangujian internal kita, kauntungan Jalapeño saya amba ing model tercanggih OpenAI, sing nuduhake manawa arsitektur iki saya aji nalika beban kerja saya gedhé lan luwih nuntut.
Jalapeño dirancang wiwit wiwitan kanthi takon: perangkat keras apa sing bakal digawe yen tugas utamane yaiku nglayani model basa modern lan mbesuk, utamane agen interaktif? Keuntungan Jalapeño asale saka ngrancang chip, memori, jaringan, piranti lunak, lan sistem skala rak bebarengan ing sekitar beban kerja model basa nyata. Inferensi model basa ngliwati sawetara fase sing béda kanthi hambatan sing béda-béda. Prefill, nalika sistem ngolah pituduh, mbutuhake komputasi intensif, dene dekode, nalika sistem ngasilake token respon demi token, luwih diwatesi dening bandwidth memori. Komunikasi uga bisa nambah latensi nalika data kudu pindhah antarane inti lan chip, saengga sawetara unit pangolahan ora aktif nalika ngenteni. Sistem sing unggul ing siji fase bisa kelangan kaunggulan kasebut nalika ngenteni data utawa mindhah status model antarane sumber daya sing beda.
Kita ngrancang Jalapeño kanggo nyuda wektu tundha pamindhahan data lan komunikasi. Iki tegese status model, kalebu cache KV sing digunakake nalika ngasilake tanggapan, bisa diselehake kanthi eksplisit lan tetep lokal nalika sistem ngaktifake kombinasi komputasi, memori, lan jaringan sing pas kanggo saben fase inferensi. Jaringan minangka bagean integral saka arsitektur. Domain sing amba ngidini kabèh beban kerja tetep ana ing siji sistem sing kasambung, nyuda pamindhahan data lan mbantu panjaluk sakabèhé tetep cepet lan efisien saka wiwitan nganti pungkasan. Asilé yaiku akselerator sing seimbang lan bisa digabungake sing bisa ndhukung arsitektur model sing owah, unggul ing prefill lan decode, lan adaptasi nalika keseimbangan antarane owah, minangka fitur sing nemtokake beban kerja agentik.
AI nduwèni peran langsung ing pangembangan Jalapeño, ngidini tim pindhah saka desain awal menyang tape-out sajrone sangang sasi kanthi njajaki implementasi, nyepetake siklus desain, pangukuran, lan verifikasi, lan terus nindakaké iterasi tumrap beban kerja model. AI uga mbantu ngoptimalake rangkaian aritmetika ing chip kasebut, saéngga tim bisa nglebokake kinerja komputasi sing luwih gedhé menyang chip kasebut miturut jadwal.
Jalapeño dirancang minangka sasaran pamrograman sing cetha lan bisa dipredhiksi kanggo manungsa lan AI. Insinyur bisa njlèntrèhaké pakaryan liwat tensor lokal, komunikasi eksplisit, lan sinkronisasi sing bisa diprediksi. AI banjur bisa ngoptimalake carane pakaryan kasebut dipetakake, diselehake, dijadwalake, lan dikoordinasikake ing saindhenging sistem. Struktur sing cetha lan bisa dipredhiksi kuwi menehi AI cara sing luwih gampang ditangani kanggo ngrampungake masalah pamrograman paralel sing sacara tradisional angel.
Ndhukung saben kulawarga model anyar isih mbutuhake kernel anyar lan optimasi khusus model. Nggunakake Codex karo GPT‑Astra, tim kasebut nggawa telung model bobot mbukak sing ora kalebu ing rencana produksi asli Jalapeño menyang kinerja dhuwur sajrone rong wulan. Iki nuduhaké loro-loroné: keluwesan arsitèktur kasebut lan sepira cepeté AI bisa mbantu ngrogram arsitèktur mau. Kanggo blok perhatian GPT‑OSS lan campuran pakar sing dipilih, implementasi sing digawe AI mlaku 1,5 nganti 1,8 kali luwih cepet tinimbang implementasi sing ditulis dening manungsa-pakar sing wis ana. Angka-angka kasebut ditrapake kanggo blok sing dipilih, dudu model lengkap, nanging nuduhake puteran pangembangan anyar sing kuat.
Infrastruktur AI iku aji amarga bisa ndhukung pakaryan migunani ing donya nyata. Kanthi ngasilake luwih akeh karya sing migunani saka daya lan piranti keras sing padha, Jalapeño bisa mbantu kita nglayani panjaluk sing luwih akeh lan nyuda biaya kanggo ngasilake asil sing sukses. Kanggo OpenAI, iki bisa ningkatake leverage operasional kanthi ngidini gaweyan migunani lan pendapatan tuwuh luwih cepet tinimbang biaya kanggo nglayani. Iki uga bisa ndhukung panggunaan luwih amba lan investasi terus-terusan ing model, produk, lan infrastruktur sing luwih apik. Inferensi sing luwih cepet bisa ngidini iterasi luwih cepet lan kasus panggunaan anyar.
Jalapeño nggedhekake apa sing bisa ditindakake kanggo inferensi sing efisien lan latensi rendah:
- Inferensi mode cepet pol-polan ing efisiensi sing sadurunge mung kasedhiya ing mode cepet
- Inferensi mode cepet kanthi tingkat efisiensi sing sadurungé mung kasedhiya ing mode batch
- Efisiensi sing luwih dhuwur kanggo inferensi mode batch
Kita ngrencanakake kanggo miwiti masang Jalapeño ing infrastruktur komputasi OpenAI ing pungkasan taun. Iki minangka generasi pertama saka peta jalan multigenerasi: Gen 2 lagi dikembangake kanthi jero, lan Gen 3 lagi wiwit kawangun. Saben generasi bakal mbangun adhedhasar apa sing disinaoni lan luwih ningkatake efisiensi lan kacepetan.
Kanggo nyukupi panjaluk AI sing saya mundhak, dibutuhake daya komputasi luwih akeh saka saben sumber sing kasedhiya. Kita bakal terus nerapake akselerator saka NVIDIA lan mitra liyane kanthi wiyar kanggo beban kerja pelatihan lan inferensi. Misi kita yaiku kanggo mesthekake yen kecerdasan umum gawean menehi manfaat kanggo kabeh umat manungsa.
Nalika nyiapake panggelaran, terus ditindakake kualifikasi produksi, piranti lunak disempurnakake, disiapake kanggo ngoperasikake Jalapeño kanthi skala gedhe, lan kinerja divalidasi ing luwih akeh model. Asil-asil nganti saiki nuduhake apa sing bisa ditindakake nalika kita ngrancang sistem lengkap bebarengan: AI sing luwih responsif, mumpuni, lan agentif sing dikirim kanthi luwih efisien kanggo luwih akeh wong.
KAPASITAS PANGOLAHAN-per-kW TERCANGGIH
InferenceX · GPT‑OSS‑120B · nominal 8 ewu/1 ewu · STP · paket TDP: Jalapeño 700 W; GB200 1.200 W
KAPASITAS PANGOLAHAN PUNCAK LAN SELARAS
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · paket TDP: Jalapeño 700 W; GB200 1.200 W
TPS campuran puncak sing luwih dhuwur/kW
≈1.9×
85.448 vs. 44.960 campuran/kW
Latensi saka wiwitan nganti pungkasan sing luwih endhek
≈1,7×
1,03 dtk vs. 1,80 dtk
TBT minimal luwih endhek
≈2,7×
0,69 vs. 1,87 ms (1,459 vs. 535 tok/dtk/pangguna)
Kapasitas pangolahan luwih akeh ing TBT sadurunge
≈53,7×
22.935 vs. 427 campuran/kW (ing 535,28 tok/dtk/pangguna)
KAPASITAS PANGOLAHAN-per-kW TERCANGGIH
InferenceX · DeepSeek R1 MXFP4 · nominal 8 ewu/1 ewu · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W
KAPASITAS PANGOLAHAN PUNCAK LAN SELARAS
InferenceX · DeepSeek R1 MXFP4 · nominal 8 ewu/1 ewu · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W
TPS/kW campuran puncak Dipikir Nemen
≈1,7×
19,641 vs. 11,781 campuran/kW
Latensi saka wiwitan nganti pungkasan sing luwih endhek
≈3,6×
1,65 dtk vs. 5,99 dtk
TBT minimal luwih endhek
≈4.1×
1,43 vs. 5,90 ms (700 vs. 169 tok/dtk/pangguna)
Kapasitas pangolahan luwih akeh ing TBT sadurunge
≈104,3×
12.258 vs. 118 campuran/kW (ing 169,41 tok/dtk/pangguna)
KAPASITAS PANGOLAHAN-per-kW TERCANGGIH
InferenceX · Kimi K2.5 MXFP4 · nominal 8 ewu/1 ewu · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W
KAPASITAS PANGOLAHAN PUNCAK LAN SELARAS
InferenceX · Kimi K2.5 MXFP4 · nominal 8 ewu/1 ewu · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W
Puncak campuran TPS/kW luwih Dipikir Nemen
≈1,5×
18.195 vs. 11.862 campuran/kW
Latensi saka wiwitan nganti pungkasan sing luwih endhek
≈3,4×
1,56 dtk vs. 5,31 dtk
TBT minimal luwih endhek
≈3.8×
1,44 vs. 5,48 ms (694 vs. 182 tok/dtk/pangguna)
Kapasitas pangolahan luwih akeh ing TBT sadurunge
≈56,1×
6.744 vs. 120 campuran/kW (ing 182,46 tok/dtk/pangguna)


