Jalapeño'nun ilk sonuçları yapay zeka çıkarımında sektör lideri hız ve verimlilik sunduğunu gösterir

OpenAI'ın ilk özel çıkarım çipi Jalapeño'yu duyurduğumuzdan bu yana çipi ve çipin etrafında oluşturulan sistemi test ediyoruz. Sonuçlar performansta önemli bir ilerlemeye işaret ediyor: Jalapeño, birim güç başına daha fazla yapay zeka işlemi gerçekleştirirken yanıtları da daha hızlı sunabiliyor. Mevcut donanım sistemleri genellikle bu iki özellikten biri için diğerinden ödün vermek zorunda kalırken Jalapeño, tek bir mimariyle hem daha yüksek işlem kapasitesi hem de daha düşük gecikme sunuyor.
Müşteriler için bu, talep arttıkça daha hızlı yanıtlar, daha hızlı tepki veren ajanlar ve daha güvenilir erişim anlamına gelebilir. Misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almaktır. Bu kazanımlar, giderek daha yetenekli hale gelen yapay zekanın daha uygun maliyetli olmasına ve daha geniş kitlelere sunulmasına yardımcı olacak.
OpenAI modelleri de Jalapeño'nun geliştirilmesini hızlandırdı. Önceki nesil modeller, ekibin çipi tasarlayıp devreye almasına yardımcı oldu. En yeni modellerimiz ise çipi optimize etme ve programlama süreçlerimizi hızlandırıyor. Jalapeño; GPT‑OSS 120B, DeepSeek R1 ve Kimi K2.5 1T modellerinin tamamında güçlü performans gösteriyor. Bu da mimarinin hem OpenAI bünyesinde hem de OpenAI dışında geliştirilen modellerde çalıştığını gösteriyor. Jalapeño, üç modelin tamamında karşılaştırılan sistemlere kıyasla maksimum işlem kapasitesinde watt başına 1,5 ila 1,9 kat daha fazla yapay zeka işlemi gerçekleştirirken 1,7 ila 3,6 kat daha düşük uçtan uca gecikme sundu. Yüksek etkileşim gerektiren iş yüklerinde ise 2,1 ila 4,1 kat daha yüksek performans sundu.
Jalapeño, teknoloji altyapısının tamamını kapsayan yaklaşımın sağladığı daha geniş avantajı da ortaya koyuyor. OpenAI, gerçek iş yüklerinden öğrendiklerimizi teknoloji yığınının her katmanını iyileştirmek için kullanıp modelleri, ürünleri, model sunma yazılımlarını, çipleri, belleği, ağ altyapısını ve sistemleri birlikte tasarlayabilir. Jalapeño, OpenAI'ın geliştirdiği, çalışır durumdaki ve performansı gerçek ölçümlerle doğrulanmış bir çiptir. Aynı zamanda çok nesilli bir platformun başlangıcıdır. Önümüzdeki aylarda Jalapeño'yu daha geniş ölçekte devreye alarak müşterilerimize daha hızlı, daha yetenekli ve daha verimli ürünler sunacağız.
Performansı eşdeğer kullanıcı deneyimi koşullarında değerlendiriyoruz. Bunun için her sistemin, müşterilerin ve etkileşimli ajanların ihtiyaç duyduğu gecikme düzeyini karşılarken birim güç başına ne kadar faydalı yapay zeka işi gerçekleştirebildiğini ölçüyoruz. Bu durum, art arda birçok adımı tamamlaması gereken ajanlar için özellikle önemlidir. Gecikmeler görevin tamamı boyunca birikerek artabilir.
Jalapeño'nun gerçek kullanımda nasıl performans gösterdiğini anlamak için çipi, SemiAnalysis'ın herkese açık InferenceX kıyaslamasında test ettik. Bu kıyaslama, bir yapay zeka isteğini karşılamaya yönelik tüm süreci ölçüyor. Jalapeño'yu, yüksek işlem kapasitesinden yüksek etkileşimli ve düşük gecikmeli kullanıma uzanan çalışma aralığının tamamında, piyasada bulunan önde gelen yapay zeka sistemleriyle karşılaştırdık. Jalapeño, işlem kapasitesi, güç verimliliği ve gecikme açısından daha iyi bir denge sundu. Performans bazen çip başına raporlansa da daha yararlı ölçütün birim güç başına performans olduğuna inanıyoruz.
Herkese açık üç modelin tamamında Jalapeño, test edilen çalışma aralığı boyunca watt başına performans ve gecikme açısından daha iyi bir denge sunarak Pareto sınırında yer aldı. Sistemleri tutarlı biçimde karşılaştırmak için sonuçları, her hızlandırıcı için yayınlanan çip güç değerini kullanarak normalleştirdik. Jalapeño'nun nominal güç değeri 700 watt olsa da test edilen iş yüklerinde ölçülen sürekli güç tüketimi 550 watt veya altında kaldı.
Jalapeño, GPT‑OSS 120B, DeepSeek R1 670B ve Kimi K2.5 1T modellerinin tamamında güçlü performans gösterdi. Kimi, test ettiğimiz herkese açık en büyük modeldi. Jalapeño bu modelde karşılaştırılan sisteme göre watt başına yaklaşık 1,5 kat daha yüksek maksimum performans ve 3,4 kat daha düşük uçtan uca gecikme sundu. Şirket içi testlerimizde Jalapeño'nun en üst seviye OpenAI modellerindeki üstünlüğü daha da arttı. Bu sonuç, iş yükleri daha büyük ve daha zorlu hale geldikçe mimarinin daha fazla değer sağladığına işaret ediyor.
Jalapeño daha en başından şu soru temel alınarak tasarlandı: Temel görevi modern ve gelecekteki dil modellerini, özellikle de etkileşimli ajanları çalıştırmak olsaydı nasıl bir donanım geliştirirdik? Jalapeño'nun sağladığı kazanımlar; çipin, belleğin, ağın, yazılımın ve sunucu rafı ölçeğindeki sistemin gerçek dil modeli iş yükleri temel alınarak birlikte tasarlanmasından kaynaklanıyor. Dil modeli çıkarımı, farklı darboğazlara sahip birkaç ayrı aşamadan geçer. Sistem promptu işlerken gerçekleşen prefill aşaması yoğun bilgi işlem gerektirirken, sistemin yanıtı her seferinde bir token oluşturarak ürettiği kod çözme aşaması daha çok bellek bant genişliğiyle sınırlıdır. Verilerin çekirdekler ve çipler arasında taşınması gerektiğinde iletişim de gecikmeye yol açabilir ve bazı işlem birimleri beklerken boşta kalabilir. Bir aşamada üstün performans gösteren sistem, veri beklerken veya model durumunu farklı kaynaklar arasında taşırken bu avantajını kaybedebilir.
Jalapeño'yu, veri hareketini ve iletişim gecikmelerini en aza indirecek şekilde tasarladık. Bu sayede, yanıt oluşturulurken kullanılan KV önbelleği de dahil olmak üzere model durumu açıkça konumlandırılıp yerel olarak tutulabilir. Sistem de her çıkarım aşaması için doğru bilgi işlem, bellek ve ağ bileşimini etkinleştirebilir. Ağ, mimarinin ayrılmaz bir parçasıdır. Ağın geniş kapsamı, iş yükünün tamamının birbirine bağlı tek bir sistemde kalmasını sağlar. Böylece veri hareketi en aza indirilir ve isteğin tamamı baştan sona hızlı ve verimli şekilde işlenir. Sonuçta, değişen model mimarilerini destekleyebilen, hem prefill hem de kod çözme aşamalarında üstün performans gösteren ve bu aşamalar arasındaki denge değiştikçe uyum sağlayabilen dengeli ve esnek bir hızlandırıcı ortaya çıkar. Bu uyum yeteneği, ajan tabanlı iş yüklerinin ayırt edici bir özelliğidir.
Yapay zeka, farklı uygulama seçeneklerini araştırmayı, tasarım, ölçüm ve doğrulama döngülerini kısaltmayı ve model iş yüklerinde sürekli yineleme yapmayı mümkün kılarak Jalapeño'nun geliştirilmesinde doğrudan rol oynadı. Böylece ekip, ilk tasarımdan tapeout aşamasına dokuz ayda geçebildi. Yapay zeka ayrıca çipin aritmetik devrelerinin optimize edilmesine yardımcı olarak ekibin planlanan sürede çipe daha fazla bilgi işlem performansı kazandırmasını sağladı.
Jalapeño, hem insanlar hem de yapay zeka için açık ve öngörülebilir bir programlama hedefi olarak tasarlandı. Mühendisler gerçekleştirilecek işi yerel tensörler, açıkça tanımlanmış iletişim ve öngörülebilir senkronizasyonla tarif edebilir. Yapay zeka daha sonra bu işin sistem genelinde nasıl eşleneceğini, konumlandırılacağını, zamanlanacağını ve koordine edileceğini optimize edebilir. Bu açık ve öngörülebilir yapı, yapay zekaya geleneksel olarak zor olan paralel programlama sorununu yönetilebilir şekilde ele alma olanağı tanır.
Her yeni model ailesinin desteklenmesi için yine de yeni kernel geliştirilmesi ve modele özgü optimizasyonlar yapılması gerekir. Ekip, GPT‑Astra ile Codex'i kullanarak Jalapeño'nun ilk canlı kullanım planında yer almayan üç açık ağırlıklı modeli iki ay içinde yüksek performans düzeyine ulaştırdı. Bu, hem mimarinin esnekliğini hem de yapay zekanın bu mimariyi programlamamıza ne kadar hızlı yardımcı olabildiğini gösterdi. Seçilen GPT‑OSS dikkat ve uzmanlar karışımı bloklarında yapay zeka tarafından oluşturulan uygulamalar, insan uzmanların yazdığı mevcut uygulamalardan 1,5 ila 1,8 kat daha hızlı çalıştı. Bu değerler modelin tamamı için değil, seçilen bloklar için geçerli olsa da yeni ve güçlü bir geliştirme döngüsüne işaret ediyor.
Yapay zeka altyapısının değeri, gerçek dünyada faydalı çalışmalar yapılmasını sağlamasından gelir. Aynı güç ve donanımla daha fazla faydalı iş gerçekleştiren Jalapeño, daha fazla talebi karşılamamıza ve başarılı sonuçlar sunma maliyetini düşürmemize yardımcı olabilir. Bu, OpenAI açısından faydalı işlerin ve gelirin hizmet sunma maliyetinden daha hızlı artmasını sağlayarak faaliyet kaldıracını iyileştirebilir. Ayrıca daha geniş çapta benimsenmeyi ve daha iyi modellere, ürünlere ve altyapıya yatırımın sürmesini destekleyebilir. Daha hızlı çıkarım, yineleme süreçlerini hızlandırabilir ve yeni kullanım alanlarının önünü açabilir.
Jalapeño, verimli ve düşük gecikmeli çıkarımda mümkün olanın sınırlarını genişletiyor:
- Daha önce yalnızca hızlı modda elde edilebilen verimlilik düzeylerinde ultra hızlı mod çıkarımı
- Daha önce yalnızca toplu işleme modunda elde edilebilen verimlilik düzeylerinde hızlı mod çıkarımı
- Toplu işleme modunda daha yüksek çıkarım verimliliği
Jalapeño'yu yıl sonuna kadar OpenAI'ın bilgi işlem altyapısında devreye almaya başlamayı planlıyoruz. Bu, çok nesilli bir yol haritasının ilk nesli. Gen 2'nin geliştirme çalışmaları ileri bir aşamada, Gen 3 ise şekillenmeye başlıyor. Her nesil, öğrendiklerimiz üzerine inşa edilecek ve hem verimliliği hem de hızı daha da artıracak.
Yapay zekaya yönelik artan talebi karşılamak için mevcut tüm kaynaklardan daha fazla bilgi işlem gücü sağlanması gerekecek. NVIDIA ve diğer iş ortaklarının hızlandırıcılarını hem eğitim hem de çıkarım iş yükleri için yaygın şekilde devreye almaya devam edeceğiz. Misyonumuz, genel yapay zekanın tüm insanlığa fayda sağlamasını güvence altına almaktır.
Devreye alma hazırlıkları kapsamında canlı kullanım yeterlilik çalışmalarını sürdürüyor, yazılımı olgunlaştırıyor, Jalapeño'yu büyük ölçekte çalıştırmaya hazırlanıyor ve daha fazla modeldeki performansını doğruluyoruz. Şimdiye kadarki sonuçlar, tüm sistemi birlikte tasarladığımızda daha duyarlı, yetenekli ve ajan tabanlı yapay zekayı daha fazla kişiye daha verimli biçimde sunmanın mümkün olduğunu gösteriyor.
kW BAŞINA İŞLEM KAPASİTESİ PARETO SINIRI
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB200 1.200 W
MAKSİMUM VE EŞLENEN HIZDAKİ İŞLEM KAPASİTESİ
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB200 1.200 W
Daha yüksek maksimum karma token/sn/kullanıcı / kW
≈1,9 kat
85.448'e karşı 44.960 karma token / kW
Daha düşük uçtan uca gecikme
≈1,7 kat
1,03 sn'ye karşı 1,80 sn
Daha düşük minimum TBT
≈2,7 kat
0,69'a karşı 1,87 ms (1.459'a karşı 535 tok/sn/kullanıcı)
Önceki TBT değerinde daha yüksek işlem kapasitesi
≈53,7 kat
22.935'e karşı 427 karma token / kW (535,28 tok/sn/kullanıcı hızında)
kW BAŞINA İŞLEM KAPASİTESİ PARETO SINIRI
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB300 1.400 W
MAKSİMUM VE EŞLENEN HIZDAKİ İŞLEM KAPASİTESİ
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB300 1.400 W
Daha yüksek maksimum karma token/sn/kullanıcı / kW
≈1,7 kat
19.641'e karşı 11.781 karma token / kW
Daha düşük uçtan uca gecikme
≈3,6 kat
1,65 sn'ye karşı 5,99 sn
Daha düşük minimum TBT
≈4,1 kat
1,43'e karşı 5,90 ms (700 ve 169 tok/sn/kullanıcı)
Önceki TBT değerinde daha yüksek işlem kapasitesi
≈104,3 kat
12.258'e karşı 118 karma token / kW (169,41 token/sn/kullanıcı hızında)
kW BAŞINA İŞLEM KAPASİTESİ PARETO SINIRI
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB300 1.400 W
MAKSİMUM VE EŞLENEN HIZDAKİ İŞLEM KAPASİTESİ
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · paket TDP'si: Jalapeño 700 W; GB300 1.400 W
Daha yüksek maksimum karma token/sn/kullanıcı / kW
≈1,5 kat
18.195'e karşı 11.862 karma / kW
Daha düşük uçtan uca gecikme
≈3,4 kat
1,56 sn'ye karşı 5,31 sn
Daha düşük minimum TBT
≈3,8 kat
1,44'e karşı 5,48 ms (694 ve 182 tok/sn/kullanıcı)
Önceki TBT değerinde daha yüksek işlem kapasitesi
≈56,1 kat
6.744'e karşı 120 karma token / kW (182,46 tok/sn/kullanıcı hızında)


