Langkau ke kandungan utama
OpenAI

Keputusan awal Jalapeño menunjukkan kelajuan dan kecekapan yang menerajui industri dalam inferens AI

Memuat…
Pandangan dekat cip inferens Jalapeño yang dipasang pada papan litar berwarna hijau kebiruan.

Sejak mengumumkan Jalapeño, cip inferens tersuai pertama OpenAI, kami telah menguji cip tersebut dan sistem yang dibina di sekelilingnya. Keputusan menunjukkan kemajuan prestasi yang ketara: Jalapeño boleh mengendalikan lebih banyak beban kerja AI bagi setiap unit kuasa sambil turut memberikan respons dengan lebih cepat. Jalapeño memberikan kedua-dua daya pemprosesan yang lebih tinggi dan kependaman yang lebih rendah dengan satu seni bina, sedangkan sistem perkakasan sedia ada sering perlu membuat kompromi antara kedua-duanya.

Bagi pelanggan, ini bermakna respons yang lebih pantas, ejen yang lebih responsif dan akses yang lebih boleh dipercayai seiring peningkatan permintaan. Misi kami adalah untuk memastikan kecerdasan am buatan memberikan manfaat kepada seluruh umat manusia. Peningkatan ini akan membantu menjadikan AI yang semakin berkeupayaan lebih mampu milik dan tersedia dengan lebih meluas.

Model OpenAI turut mempercepatkan pembangunan Jalapeño. Generasi terdahulu membantu pasukan mereka bentuk dan menghidupkan cip tersebut, manakala model terbaharu kami mempercepatkan cara kami mengoptimumkan dan memprogramkannya. Prestasi Jalapeño merangkumi GPT‑OSS 120B, DeepSeek R1 dan Kimi K2.5 1T, menunjukkan bahawa seni binanya berfungsi merentas model yang dibangunkan di dalam dan di luar OpenAI. Merentas ketiga-tiganya, Jalapeño memberikan 1.5 hingga 1.9 kali lebih banyak kerja AI bagi setiap watt pada daya pemprosesan puncak dan kependaman hujung ke hujung 1.7 hingga 3.6 kali lebih rendah berbanding sistem perbandingan. Bagi beban kerja yang sangat interaktif, ia memberikan prestasi 2.1 hingga 4.1 kali lebih tinggi.

Jalapeño juga merupakan bukti kelebihan full-stack yang lebih luas. OpenAI boleh mereka bentuk model, produk, perisian pelayan, cip, memori, rangkaian dan sistem bersama-sama, menggunakan apa yang kami pelajari daripada beban kerja sebenar untuk memperbaiki setiap lapisan tumpukan. Jalapeño ialah silikon pihak pertama yang berfungsi dengan hasil yang diukur dan ini merupakan permulaan kepada platform berbilang generasi. Dalam beberapa bulan akan datang, kami akan mempertingkatkan Jalapeño untuk menyampaikan produk yang lebih pantas, lebih berkeupayaan dan lebih cekap kepada pelanggan kami.

Cara kami mengukur prestasi Jalapeño

Kami menilai prestasi pada pengalaman pengguna yang setara dengan mengukur jumlah kerja AI yang berguna yang dapat diselesaikan oleh setiap sistem bagi setiap unit kuasa sambil memenuhi kependaman yang diperlukan oleh pelanggan dan ejen interaktif. Perkara ini amat penting khususnya bagi ejen yang perlu menyelesaikan banyak langkah secara berurutan, maka kelewatan boleh terkumpul merentasi keseluruhan tugas.

Untuk memahami bagaimana Jalapeño berprestasi dalam amalan, kami mengujinya pada InferenceX, penanda aras awam daripada SemiAnalysis yang mengukur keseluruhan proses melayani permintaan AI. Kami membandingkan Jalapeño dengan sistem AI terkemuka yang tersedia secara komersial merentasi julat operasi yang diuji, daripada penyajian daya pemprosesan tinggi kepada penggunaan yang sangat interaktif dan berkependaman rendah. Jalapeño menawarkan gabungan daya pemprosesan, kecekapan kuasa dan kependaman yang lebih baik. Walaupun prestasi kadangkala dilaporkan bagi setiap cip, kami percaya bahawa piawaian yang lebih berguna ialah prestasi bagi setiap unit kuasa.

Jalapeño melebarkan kelebihan pada TBT terbaik sebelumnya

Jalapeño menyampaikan lebih banyak token bagi setiap pengguna

Jalapeño memberikan daya pemprosesan yang lebih tinggi bagi setiap kilowatt

Merentasi ketiga-tiga model awam, Jalapeño memberikan kombinasi prestasi per watt dan kependaman yang lebih baik merentasi julat operasi yang diuji, sekali gus meletakkannya pada perbatasan Pareto. Untuk membandingkan sistem secara konsisten, kami menormalkan hasil menggunakan penarafan kuasa cip yang diterbitkan bagi setiap pemecut. Jalapeño dinilai pada 700 watt, walaupun kuasa berterusan yang diukur kekal pada atau di bawah 550 watt dalam beban kerja yang diuji.

Jalapeño menunjukkan prestasi yang kukuh merentas GPT‑OSS 120B, DeepSeek R1 670B dan Kimi K2.5 1T. Pada Kimi, model awam terbesar yang kami uji, ia memberikan prestasi puncak per watt kira-kira 1.5 kali lebih tinggi dan kependaman hujung-ke-hujung 3.4 kali lebih rendah berbanding sistem perbandingan. Dalam ujian dalaman kami, kelebihan Jalapeño semakin melebar pada model OpenAI perbatasan, menunjukkan bahawa seni bina ini menjadi lebih bernilai apabila beban kerja semakin besar dan lebih mencabar.

Mereka bentuk seni bina untuk kelajuan dan kecekapan dalam satu cip tunggal

Jalapeño direka bentuk dari awal dengan mengajukan soalan: perkakasan apakah yang akan kami bina jika tugas utamanya ialah menyajikan model bahasa moden dan masa depan, terutamanya ejen interaktif? Kelebihan Jalapeño terhasil daripada mereka bentuk cip, memori, rangkaian, perisian dan sistem berskala rak secara bersama berdasarkan beban kerja model bahasa sebenar. Inferens model bahasa melalui beberapa fasa berbeza dengan kekangan yang berlainan. Prapengisian, apabila sistem memproses prom, adalah intensif pengkomputeran, manakala penyahkodan, apabila sistem menjana respons token demi token, lebih dikekang oleh lebar jalur memori. Komunikasi juga boleh menambah kependaman apabila data perlu bergerak antara teras dan cip, menyebabkan sesetengah unit pemprosesan tidak digunakan sementara menunggu. Sistem yang cemerlang pada satu fasa boleh kehilangan kelebihan itu sementara menunggu data atau memindahkan keadaan model antara sumber yang berbeza.

Kami mereka bentuk Jalapeño untuk meminimumkan pemindahan data dan kelewatan komunikasi. Ini bermakna keadaan model, termasuk cache KV yang digunakan semasa menjana respons, boleh ditempatkan secara eksplisit dan dikekalkan secara setempat sementara sistem mengaktifkan gabungan pengkomputeran, memori dan rangkaian yang sesuai bagi setiap fasa inferens. Rangkaian merupakan bahagian penting dalam seni bina. Domainnya yang besar membolehkan keseluruhan beban kerja kekal dalam satu sistem yang bersambung, meminimumkan pergerakan data dan membantu keseluruhan permintaan kekal pantas dan cekap dari awal hingga akhir. Hasilnya ialah pemecut yang seimbang dan boleh ditukar ganti, yang dapat menyokong seni bina model yang berubah-ubah, cemerlang dalam kedua-dua prefill dan decode, serta menyesuaikan diri apabila keseimbangan antara kedua-duanya berubah, suatu ciri yang menentukan beban kerja agentik.

Kami menggunakan AI untuk mereka bentuk cip tersebut dan mereka bentuk cip tersebut supaya AI dapat memprogramkannya

AI memainkan peranan langsung dalam pembangunan Jalapeño, membolehkan pasukan beralih daripada reka bentuk awal kepada tapeout dalam tempoh sembilan bulan dengan meneroka pelaksanaan, memendekkan kitaran reka bentuk, pengukuran dan pengesahan, serta mengulangi beban kerja model secara berterusan. AI juga membantu mengoptimumkan litar aritmetik cip tersebut, membolehkan pasukan menyepadukan lebih banyak prestasi pengkomputeran ke dalam cip mengikut jadual.

Jalapeño direka bentuk sebagai sasaran pengaturcaraan yang jelas dan boleh diramal untuk manusia dan AI. Jurutera boleh menerangkan kerja melalui tensor tempatan, komunikasi eksplisit dan penyegerakan yang boleh diramal. AI kemudiannya boleh mengoptimumkan cara kerja tersebut dipetakan, ditempatkan, dijadualkan dan diselaraskan merentas sistem. Struktur yang jelas dan boleh diramal itu memberikan AI cara yang boleh diurus untuk menangani masalah pengaturcaraan selari yang secara tradisinya sukar.

Menyokong setiap keluarga model baharu masih memerlukan kernel baharu dan pengoptimuman khusus model. Dengan menggunakan Codex bersama GPT‑Astra, pasukan itu mencapai prestasi tinggi bagi tiga model berat terbuka yang tidak termasuk dalam rancangan pengeluaran asal Jalapeño dalam tempoh dua bulan. Perkara ini menunjukkan fleksibiliti seni bina tersebut serta kepantasan AI dalam membantu kita memprogramkannya. Bagi blok perhatian dan campuran pakar GPT‑OSS terpilih, pelaksanaan yang dijana AI berjalan 1.5 hingga 1.8 kali lebih pantas daripada pelaksanaan sedia ada yang ditulis oleh pakar manusia. Angka tersebut terpakai pada blok yang dipilih, bukan keseluruhan model, tetapi angka tersebut menunjukkan arah kepada gelung pembangunan baharu yang kuat.

Laluan ke hadapan untuk inferens yang cekap dan ultra-pantas

Infrastruktur AI bernilai kerana kerja dunia sebenar yang berguna yang dibolehkannya. Dengan menghasilkan lebih banyak kerja yang berguna menggunakan kuasa dan perkakasan yang sama, Jalapeño dapat membantu kami memenuhi lebih banyak permintaan dan mengurangkan kos untuk menyampaikan hasil yang berjaya. Bagi OpenAI, hal itu dapat meningkatkan kecekapan operasi dengan membolehkan kerja bernilai dan hasil berkembang lebih pantas daripada kos untuk memberikan perkhidmatan. Hal itu juga dapat menyokong penggunaan yang lebih meluas dan pelaburan berterusan dalam model, produk dan infrastruktur yang lebih baik. Inferens yang lebih pantas dapat membolehkan iterasi yang lebih pantas dan kes penggunaan baharu.

Jalapeño memperluas apa yang mungkin untuk inferens yang cekap dan berlatensi rendah:

  • Inferens mod ultra-pantas pada kecekapan yang sebelum ini hanya tersedia dalam mod pantas
  • Inferens mod pantas pada tahap kecekapan yang sebelum ini hanya tersedia dalam mod kelompok
  • Kecekapan lebih tinggi untuk inferens mod kelompok

Kami merancang untuk mula menggunakan Jalapeño dalam infrastruktur pengiraan OpenAI menjelang akhir tahun ini. Ia ialah generasi pertama dalam pelan hala tuju berbilang generasi: Gen 2 sedang giat dibangunkan dan Gen 3 mula terbentuk. Setiap generasi akan membina berdasarkan apa yang kita pelajari dan terus meningkatkan kecekapan serta kelajuan.

Memenuhi permintaan yang semakin meningkat terhadap AI akan memerlukan lebih banyak kuasa pengkomputeran daripada setiap sumber yang tersedia. Kami akan terus mengedarkan pemecut daripada NVIDIA dan rakan kongsi lain secara meluas untuk beban kerja latihan dan inferens. Misi kami adalah untuk memastikan kecerdasan am buatan memberikan manfaat kepada seluruh umat manusia.

Semasa kami bersiap sedia untuk pelaksanaan, kami meneruskan kelayakan pengeluaran, mematangkan perisian, membuat persediaan untuk mengendalikan Jalapeño pada skala besar dan mengesahkan prestasi merentas lebih banyak model. Hasil setakat ini menunjukkan perkara yang boleh dicapai apabila kami mereka bentuk keseluruhan sistem bersama-sama: AI yang lebih responsif, berkeupayaan dan AI agentic, disampaikan dengan lebih cekap kepada lebih ramai orang.

Lampiran

Jalapeño ialah perbatasan Pareto dalam GPT‑OSS 120B

PERBATASAN DAYA PEMPROSESAN-per-kW

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB200 1,200 W

Jalapeño mendahului merentas titik operasi GPT‑OSS

DAYA PEMPROSESAN PUNCAK DAN DIPADANKAN

InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB200 1,200 W

TPS campuran puncak / kW lebih tinggi

≈1.9×

85,448 berbanding 44,960 campuran / kW

Kependaman hujung ke hujung yang lebih rendah

≈1.7×

1.03 s lwn. 1.80 s

Kurangkan TBT minimum

≈2.7×

0.69 berbanding 1.87 ms (1,459 berbanding 535 tok/s/pengguna)

Lebih banyak daya pemprosesan pada TBT sebelumnya

≈53.7×

22,935 lwn. 427 campuran / kW (pada 535.28 tok/s/pengguna)

Jalapeño berada pada perbatasan Pareto di DeepSeek R1 670B

PERBATASAN DAYA PEMPROSESAN-per-kW

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño mendahului pada semua titik operasi DeepSeek R1

DAYA PEMPROSESAN PUNCAK DAN DIPADANKAN

InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB300 1,400 W

TPS campuran puncak / kW lebih tinggi

≈1.7×

19,641 berbanding 11,781 campuran / kW

Kependaman hujung ke hujung yang lebih rendah

≈3.6×

1.65 s berbanding 5.99 s

Kurangkan TBT minimum

≈4.1×

1.43 lwn. 5.90 ms (700 lwn. 169 tok/s/pengguna)

Lebih banyak daya pemprosesan pada TBT sebelumnya

≈104.3×

12,258 berbanding 118 campuran / kW (pada 169.41 tok/s/pengguna)

Jalapeño berada di perbatasan Pareto pada Kimi K2.5 1T

PERBATASAN DAYA PEMPROSESAN-per-kW

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño mendahului di seluruh titik operasi Kimi K2.5

DAYA PEMPROSESAN PUNCAK DAN DIPADANKAN

InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · pakej TDP: Jalapeño 700 W; GB300 1,400 W

TPS campuran puncak / kW lebih tinggi

≈1.5×

18 195 berbanding 11 862 campuran / kW

Kependaman hujung ke hujung yang lebih rendah

≈3.4×

1.56 s berbanding 5.31 s

Kurangkan TBT minimum

≈3.8×

1.44 lwn. 5.48 ms (694 lwn. 182 tok/s/pengguna)

Lebih banyak daya pemprosesan pada TBT sebelumnya

≈56.1×

6,744 lwn. 120 campuran / kW (pada 182,46 tok/s/pengguna)

Penulis

OpenAI