Langsung ke konten utama
OpenAI

Hasil awal Jalapeño menunjukkan kecepatan dan efisiensi terdepan di industri dalam inferensi AI

Memuat…
Tampilan jarak dekat chip inferensi Jalapeño yang terpasang pada papan sirkuit berwarna teal.

Sejak mengumumkan Jalapeño, chip inferensi khusus pertama OpenAI, kami telah menguji chip tersebut dan sistem yang dibangun di sekelilingnya. Hasilnya menunjukkan peningkatan performa yang signifikan: Jalapeño dapat menangani lebih banyak beban kerja AI per unit daya sekaligus memberikan respons dengan lebih cepat. Jalapeño menghadirkan throughput yang lebih tinggi dan latensi yang lebih rendah dalam satu arsitektur, sementara sistem perangkat keras yang ada sering kali harus membuat kompromi antara keduanya.

Bagi pelanggan, hal itu dapat berarti respons yang lebih cepat, agen yang lebih tanggap, dan akses yang lebih andal seiring meningkatnya permintaan. Misi kami adalah memastikan bahwa kecerdasan umum buatan (AGI) bermanfaat bagi seluruh umat manusia. Kemajuan ini akan membantu menjadikan AI yang semakin canggih lebih terjangkau dan lebih tersedia secara luas.

Model OpenAI juga mempercepat pengembangan Jalapeño. Generasi sebelumnya membantu tim merancang dan menginisialisasi chip tersebut, sementara model terbaru kami mempercepat cara kami mengoptimalkan dan memprogramnya. Performa Jalapeño mencakup GPT‑OSS 120B, DeepSeek R1, dan Kimi K2.5 1T, yang menunjukkan bahwa arsitektur ini berfungsi pada model yang dikembangkan baik di dalam maupun di luar OpenAI. Pada ketiganya, Jalapeño menghasilkan pekerjaan AI per watt 1,5 hingga 1,9 kali lebih banyak pada throughput puncak dan latensi end-to-end 1,7 hingga 3,6 kali lebih rendah daripada sistem pembanding. Untuk beban kerja yang sangat interaktif, model ini memberikan performa 2,1 hingga 4,1 kali lebih tinggi.

Jalapeño juga merupakan bukti adanya keunggulan full-stack yang lebih luas. OpenAI dapat merancang model, produk, perangkat lunak penyajian layanan, chip, memori, jaringan, dan sistem secara bersama-sama, dengan menggunakan apa yang kami pelajari dari beban kerja nyata untuk meningkatkan setiap lapisan tumpukan. Jalapeño menggunakan silikon pihak pertama yang berfungsi dengan hasil terukur, dan ini merupakan awal dari platform multigenerasi. Dalam beberapa bulan mendatang, kami akan meningkatkan skala Jalapeño untuk menghadirkan produk yang lebih cepat, lebih mumpuni, dan lebih efisien bagi pelanggan kami.

Cara kami mengukur performa Jalapeño

Kami mengevaluasi performa pada pengalaman pengguna yang setara, dengan mengukur seberapa banyak pekerjaan AI yang bermanfaat yang dapat diselesaikan setiap sistem per satuan daya sambil memenuhi latensi yang dibutuhkan pelanggan dan agen interaktif. Hal ini sangat penting bagi agen, yang perlu menyelesaikan banyak langkah secara berurutan, sehingga penundaan dapat terakumulasi di sepanjang keseluruhan tugas.

Untuk memahami bagaimana performa Jalapeño dalam praktik, kami mengujinya menggunakan InferenceX, sebuah tolok ukur publik dari SemiAnalysis yang mengukur proses lengkap dalam melayani permintaan AI. Kami membandingkan Jalapeño dengan sistem AI komersial terkemuka yang tersedia di seluruh rentang pengoperasian yang diuji, dari penyajian throughput tinggi hingga penggunaan yang sangat interaktif dengan latensi rendah. Jalapeño menghadirkan kombinasi throughput, efisiensi daya, dan latensi yang lebih baik. Meskipun performa terkadang dilaporkan per chip, kami percaya tolok ukur yang lebih berguna adalah performa per satuan daya.

Jalapeño memperlebar keunggulan di TBT terbaik sebelumnya

Jalapeño memberikan lebih banyak token per pengguna

Jalapeño menghasilkan throughput lebih tinggi per kilowatt

Di ketiga model publik, Jalapeño memberikan kombinasi performa per watt dan latensi yang lebih baik di seluruh rentang operasi yang diuji, sehingga menempatkannya pada batas terdepan Pareto. Untuk membandingkan sistem secara konsisten, kami menormalisasi hasil menggunakan nilai daya chip yang dipublikasikan untuk masing-masing akselerator. Jalapeño berperingkat 700 watt, meskipun daya berkelanjutan terukurnya tetap pada atau di bawah 550 watt pada beban kerja yang diuji.

Jalapeño berperforma kuat pada GPT‑OSS 120B, DeepSeek R1 670B, dan Kimi K2.5 1T. Pada Kimi, model publik terbesar yang kami uji, Jalapeño menghasilkan performa puncak per watt sekitar 1,5 kali lebih tinggi dan latensi menyeluruh 3,4 kali lebih rendah dibandingkan sistem pembanding. Dalam pengujian internal kami, keunggulan Jalapeño semakin besar pada model OpenAI terdepan, yang menunjukkan bahwa arsitektur ini menjadi lebih bernilai seiring beban kerja bertambah besar dan lebih menuntut.

Merancang arsitektur untuk kecepatan dan efisiensi dalam satu chip

Sejak awal, Jalapeño dirancang dengan satu pertanyaan: perangkat keras seperti apa yang akan kami buat jika fungsi utamanya adalah menjalankan model bahasa modern dan masa depan, terutama agen interaktif? Keunggulan Jalapeño berasal dari perancangan chip, memori, jaringan, perangkat lunak, dan sistem skala rak secara terpadu berdasarkan beban kerja model bahasa nyata. Inferensi model bahasa melewati beberapa fase berbeda dengan hambatan yang berbeda. Prefill, saat sistem memproses prompt, bersifat intensif komputasi, sedangkan decode, saat sistem menghasilkan respons token demi token, lebih dibatasi oleh bandwidth memori. Komunikasi juga dapat menambah latensi ketika data harus berpindah antar-inti dan antar-chip, sehingga beberapa unit pemrosesan menganggur saat menunggu. Sistem yang unggul pada satu fase dapat kehilangan keunggulan tersebut saat menunggu data atau memindahkan status model di antara sumber daya yang berbeda.

Kami merancang Jalapeño untuk meminimalkan perpindahan data dan penundaan komunikasi. Artinya, status model, termasuk cache KV yang digunakan saat menghasilkan respons, dapat ditempatkan secara eksplisit dan dipertahankan secara lokal, sementara sistem mengaktifkan kombinasi komputasi, memori, dan jaringan yang tepat untuk setiap tahap inferensi. Jaringan merupakan bagian integral dari arsitektur. Domainnya yang luas memungkinkan seluruh beban kerja tetap berada dalam satu sistem yang terhubung, meminimalkan perpindahan data dan membantu keseluruhan permintaan tetap cepat dan efisien dari awal hingga akhir. Hasilnya adalah akselerator yang seimbang dan dapat dipertukarkan, yang dapat mendukung arsitektur model yang berubah, unggul dalam prefill maupun decode, dan beradaptasi seiring berubahnya keseimbangan di antara keduanya, sebuah ciri khas beban kerja agen.

Kami menggunakan AI untuk merancang chip, dan merancang chip agar AI dapat memrogramnya

AI berperan langsung dalam pengembangan Jalapeño, memungkinkan tim beralih dari desain awal ke tahap tape-out dalam sembilan bulan dengan mengeksplorasi implementasi, memperpendek siklus desain, pengukuran, dan verifikasi, serta terus mengiterasi beban kerja model. AI juga membantu mengoptimalkan rangkaian aritmetika chip tersebut, sehingga memungkinkan tim memasukkan lebih banyak performa komputasi ke dalam chip sesuai jadwal.

Jalapeño dirancang sebagai target pemrograman yang jelas dan dapat diprediksi, baik bagi manusia maupun AI. Insinyur dapat mendeskripsikan pekerjaan melalui tensor lokal, komunikasi eksplisit, dan sinkronisasi yang dapat diprediksi. AI kemudian dapat mengoptimalkan bagaimana pekerjaan tersebut dipetakan, ditempatkan, dijadwalkan, dan dikoordinasikan di seluruh sistem. Struktur yang jelas dan dapat diprediksi itu memberi AI cara yang mudah dikelola untuk mengatasi masalah pemrograman paralel yang umumnya sulit.

Mendukung setiap keluarga model baru tetap memerlukan kernel baru dan optimasi khusus model. Dengan menggunakan Codex bersama GPT‑Astra, tim tersebut membawa tiga model bobot terbuka yang tidak termasuk dalam rencana produksi awal Jalapeño ke performa tinggi dalam waktu dua bulan. Hal ini menunjukkan fleksibilitas arsitektur tersebut sekaligus kecepatan AI dalam membantu pemrograman. Untuk blok perhatian dan campuran-ahli GPT‑OSS tertentu, implementasi yang dihasilkan AI berjalan 1,5 hingga 1,8 kali lebih cepat daripada implementasi yang sudah ada dan ditulis oleh pakar manusia. Angka-angka tersebut berlaku untuk blok yang dipilih, bukan seluruh model, tetapi hal itu mengarah pada siklus pengembangan baru yang kuat.

Jalan ke depan menuju inferensi yang efisien dan sangat cepat

Infrastruktur AI bernilai karena pekerjaan nyata yang bermanfaat yang dimungkinkannya. Dengan menghasilkan lebih banyak pekerjaan yang bermanfaat menggunakan daya dan perangkat keras yang sama, Jalapeño dapat membantu kami melayani lebih banyak permintaan sekaligus menurunkan biaya untuk menghasilkan output yang berhasil. Bagi OpenAI, hal itu dapat meningkatkan leverage operasional dengan memungkinkan pekerjaan bermanfaat dan pendapatan tumbuh lebih cepat daripada biaya layanan. Hal itu juga dapat mendukung adopsi yang lebih luas dan investasi berkelanjutan dalam model, produk, dan infrastruktur yang lebih baik. Inferensi yang lebih cepat dapat memungkinkan iterasi yang lebih cepat dan kasus penggunaan baru.

Jalapeño memperluas apa yang mungkin untuk inferensi yang efisien dan berlatensi rendah:

  • Inferensi mode sangat cepat dengan efisiensi yang sebelumnya hanya tersedia dalam mode cepat
  • Inferensi mode cepat dengan efisiensi yang sebelumnya hanya tersedia dalam mode batch
  • Efisiensi lebih tinggi untuk inferensi mode batch

Kami berencana mulai menerapkan Jalapeño dalam infrastruktur komputasi OpenAI pada akhir tahun ini. Ini adalah generasi pertama dari peta jalan multigenerasi: Gen 2 sedang dikembangkan secara intensif, dan Gen 3 mulai terbentuk. Setiap generasi akan membangun berdasarkan apa yang kami pelajari dan lebih meningkatkan efisiensi serta kecepatan.

Memenuhi permintaan AI yang terus meningkat akan membutuhkan lebih banyak daya komputasi dari setiap sumber yang tersedia. Kami akan terus menerapkan akselerator secara luas dari NVIDIA dan mitra lainnya untuk beban kerja pelatihan maupun inferensi. Misi kami adalah memastikan bahwa kecerdasan umum buatan (AGI) bermanfaat bagi seluruh umat manusia.

Sambil mempersiapkan penerapan, kami terus melakukan kualifikasi produksi, menyempurnakan perangkat lunak, mempersiapkan pengoperasian Jalapeño dalam skala besar, dan memvalidasi performanya pada lebih banyak model. Hasil sejauh ini menunjukkan apa yang dapat dicapai ketika kami merancang keseluruhan sistem secara terpadu: AI yang lebih responsif, lebih mumpuni, dan lebih agentik, yang dapat dihadirkan secara lebih efisien kepada lebih banyak orang.

Lampiran

Jalapeño berada di pareto terdepan pada GPT‑OSS 120B

THROUGHPUT per-kW TERDEPAN

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP paket: Jalapeño 700 W; GB200 1.200 W

Jalapeño memimpin di berbagai titik operasi GPT‑OSS

THROUGHPUT PUNCAK DAN SETARA

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP paket: Jalapeño 700 W; GB200 1.200 W

TPS campuran puncak lebih tinggi / kW

≈1,9×

85.448 vs. 44.960 campuran / kW

Latensi end-to-end yang lebih rendah

≈1,7×

1,03 dtk vs. 1,80 dtk

TBT minimum lebih rendah

≈2,7×

0,69 vs. 1,87 ms (1.459 vs. 535 tok/dtk/pengguna)

Throughput lebih tinggi pada TBT sebelumnya

≈53,7×

22.935 vs. 427 campuran / kW (pada 535,28 tok/dtk/pengguna)

Jalapeño berada di pareto terdepan pada DeepSeek R1 670B

THROUGHPUT per-kW TERDEPAN

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W

Jalapeño unggul di semua titik operasi DeepSeek R1

THROUGHPUT PUNCAK DAN SETARA

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W

TPS campuran puncak lebih tinggi / kW

≈1,7×

19.641 vs. 11.781 campuran / kW

Latensi end-to-end yang lebih rendah

≈3,6×

1,65 dtk vs. 5,99 dtk

TBT minimum lebih rendah

≈4,1×

1,43 vs. 5,90 ms (700 vs. 169 tok/dtk/pengguna)

Throughput lebih tinggi pada TBT sebelumnya

≈104,3×

12.258 vs. 118 campuran / kW (pada 169,41 tok/dtk/pengguna)

Jalapeño berada di pareto terdepan pada Kimi K2.5 1T

THROUGHPUT per-kW TERDEPAN

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W

Jalapeño unggul di seluruh titik operasi Kimi K2.5

THROUGHPUT PUNCAK DAN SETARA

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · paket TDP: Jalapeño 700 W; GB300 1.400 W

TPS campuran puncak lebih tinggi / kW

≈1,5×

18.195 vs. 11.862 campuran / kW

Latensi end-to-end yang lebih rendah

≈3,4×

1,56 dtk vs. 5,31 dtk

TBT minimum lebih rendah

≈3,8×

1,44 vs. 5,48 ms (694 vs. 182 tok/dtk/pengguna)

Throughput lebih tinggi pada TBT sebelumnya

≈56,1×

6.744 vs. 120 campuran / kW (pada 182,46 tok/dtk/pengguna)

Penulis

OpenAI