Pierwsze wyniki Jalapeño wskazują na najwyższą w branży szybkość i wydajność w inferencji AI

Od ogłoszenia Jalapeño, pierwszego autorskiego układu inferencyjnego OpenAI, testujemy ten układ i system zbudowany wokół niego. Wyniki pokazują znaczący wzrost wydajności: Jalapeño może przetwarzać więcej zadań AI na jednostkę mocy, a jednocześnie szybciej zwraca odpowiedzi. Jalapeño zapewnia wyższą przepustowość i mniejsze opóźnienia w ramach jednej architektury, natomiast istniejące systemy sprzętowe często wymagają kompromisu między tymi dwoma parametrami.
Dla klientów może to oznaczać szybsze odpowiedzi, bardziej responsywne agenty oraz bardziej niezawodny dostęp wraz ze wzrostem zapotrzebowania. Naszą misją jest zapewnienie, aby ogólna sztuczna inteligencja przynosiła korzyści całej ludzkości. Te postępy przyczynią się do tego, że coraz bardziej zaawansowana sztuczna inteligencja będzie przystępniejsza cenowo i szerzej dostępna.
Modele OpenAI również przyspieszyły rozwój Jalapeño. Wcześniejsze generacje pomogły zespołowi zaprojektować i uruchomić układ, a nasze najnowsze modele przyspieszają jego optymalizację i programowanie. Jalapeño zapewnia wysoką wydajność w modelach GPT‑OSS 120B, DeepSeek R1 i Kimi K2.5 1T, co pokazuje, że architektura sprawdza się w modelach opracowanych zarówno w OpenAI, jak i innych. We wszystkich trzech przypadkach Jalapeño zapewnił od 1,5 do 1,9 razy więcej pracy AI na wat przy maksymalnej przepustowości oraz 1,7-3,6 razy niższe opóźnienia całkowite niż systemy porównawcze. W przypadku wysoce interaktywnych obciążeń zapewnił od 2,1 do 4,1 razy wyższą wydajność.
Jalapeño jest również dowodem na szerszą przewagę obejmującą cały stos technologiczny. OpenAI jest w stanie projektować modele, produkty, oprogramowanie do obsługi, układy, pamięć, sieci i systemy, wykorzystując wiedzę zdobytą dzięki rzeczywistym obciążeniom w celu ulepszania każdego elementu stosu. Jalapeño to działający układ krzemowy opracowany we własnym zakresie, z potwierdzonymi wynikami pomiarów, stanowiąc początek platformy, która będzie rozwijana przez wiele generacji. W kolejnych miesiącach będziemy zwiększać tempo prac nad Jalapeño, aby dostarczać naszym klientom szybsze, bardziej funkcjonalne i wydajniejsze produkty.
Wydajność oceniamy przy porównywalnym doświadczeniu użytkownika, mierząc, ile użytecznej pracy AI każdy system może wykonać na jednostkę mocy, spełniając jednocześnie wymagania dotyczące opóźnień stawiane przez klientów i agenty interaktywne. Ma to szczególne znaczenie w przypadku agentów, które muszą wykonać wiele kroków po kolei, przez co opóźnienia mogą się kumulować w ramach całego zadania.
Aby zrozumieć, jak Jalapeño sprawdza się w praktyce, przetestowaliśmy go w InferenceX, publicznie dostępnym benchmarku opracowanym przez SemiAnalysis, który mierzy pełny proces obsługi żądań AI. Porównaliśmy Jalapeño z wiodącymi dostępnymi komercyjnie systemami AI w całym testowanym zakresie pracy – od obsługi o wysokiej przepustowości po wysoce interaktywne zastosowania o niskich opóźnieniach. Jalapeño zapewnił lepsze połączenie przepustowości, efektywności energetycznej i niskich opóźnień. Choć wydajność bywa czasem podawana w przeliczeniu na układ, uważamy, że bardziej użytecznym standardem jest wydajność na jednostkę mocy.
We wszystkich trzech publicznie dostępnych modelach, Jalapeño zapewnił lepszą kombinację wydajności na wat (W) oraz opóźnień w badanym zakresie parametrów pracy, co wyznacza granicę Pareto. Aby porównać systemy w spójny sposób, znormalizowaliśmy wyniki, wykorzystując opublikowane znamionowe wartości mocy układu dla każdego akceleratora. Moc znamionowa Jalapeño wynosi 700 W, chociaż jego zmierzona moc ciągła w testowanych obciążeniach utrzymywała się na poziomie 550 W lub mniej.
Jalapeño osiągnął dobre wyniki w przypadku modeli GPT‑OSS 120B, DeepSeek R1 670B oraz Kimi K2.5 1T. W przypadku Kimi, największego publicznie dostępnego modelu, który testowaliśmy, zapewniał około 1,5-krotnie wyższą szczytową wydajność na wat i 3,4-krotnie niższe opóźnienie całkowite niż system porównawczy. W naszych wewnętrznych testach przewaga Jalapeño była jeszcze większa w przypadku pionierskich modeli OpenAI, co sugeruje, że architektura zyskuje na wartości wraz ze wzrostem skali i wymagań obciążeń.
Układ Jalapeño zaprojektowaliśmy od podstaw, zadając sobie pytanie: jaki sprzęt zbudowalibyśmy, gdyby jego głównym zadaniem miała być obsługa współczesnych i przyszłych modeli językowych, zwłaszcza agentów interaktywnych? Zalety Jalapeño wynikają z jednoczesnego projektowania układu, pamięci, sieci, oprogramowania i systemu w skali szafy serwerowej, który w założeniu jest przeznaczony do obsługi rzeczywistych obciążeń modeli językowych. Inferencja modeli językowych przebiega przez kilka odrębnych faz z różnymi wąskimi gardłami. Wstępne wypełnianie, podczas którego system przetwarza polecenie, wymaga dużej mocy obliczeniowej, natomiast dekodowanie, podczas którego system generuje odpowiedź token po tokenie, jest bardziej ograniczone przepustowością pamięci. Komunikacja może również zwiększać opóźnienia, gdy dane muszą być przenoszone między rdzeniami i układami scalonymi, przez co niektóre jednostki przetwarzające pozostają bezczynne podczas oczekiwania. System, który doskonale radzi sobie w jednej fazie, może stracić tę przewagę, czekając na dane lub przenosząc stan modelu między różnymi zasobami.
Jalapeño zaprojektowaliśmy tak, aby zminimalizować przemieszczanie danych i opóźnienia komunikacyjne. Oznacza to, że stan modelu, w tym pamięć podręczna KV używana podczas generowania odpowiedzi, można jawnie umieścić i obsługiwać lokalnie, podczas gdy system aktywuje odpowiednią kombinację zasobów obliczeniowych, pamięci i sieci dla każdej fazy inferencji. Sieć jest integralną częścią architektury. Dzięki rozległej domenie całym obciążeniem roboczym można zarządzać w ramach jednego połączonego systemu, minimalizując przenoszenie danych i zapewniając, że całe żądanie jest realizowanie szybko i wydajnie. Rezultatem takiej strategii jest zrównoważony i uniwersalny akcelerator, który może obsługiwać zmieniające się architektury modeli, oferować wysoką wydajność zarówno podczas wstępnego wypełniania, jak i dekodowania oraz dostosowywać się do zmian równowagi między tymi zadaniami, co jest cechą definiującą obciążenia agentowe.
AI odegrała bezpośrednią rolę w rozwoju Jalapeño, umożliwiając zespołowi przejście od wstępnego projektu do tapeout w ciągu dziewięciu miesięcy dzięki badaniu różnych implementacji, skróceniu cykli projektowania, pomiarów i weryfikacji oraz ciągłemu udoskonalaniu obciążeń modeli. Sztuczna inteligencja pomogła również zoptymalizować obwody arytmetyczne układu, dzięki czemu zespołowi udało się zgodnie z harmonogramem zwiększyć jego wydajność obliczeniową.
Jalapeño zaprojektowano jako przejrzysty i przewidywalny cel programistyczny zarówno dla ludzi, jak i AI. Inżynierowie mogą opisywać pracę za pomocą lokalnych tensorów, jawnej komunikacji i przewidywalnej synchronizacji. Sztuczna inteligencja może następnie optymalizować sposób mapowania, rozmieszczania, planowania i koordynowania tej pracy w całym systemie. Ta przejrzysta, przewidywalna struktura daje sztucznej inteligencji realny sposób na zmierzenie się z tradycyjnie trudnym problemem programowania równoległego.
Obsługa każdej nowej rodziny modeli nadal wymaga nowych jąder i optymalizacji dla danego modelu. Korzystając z Codex i GPT‑Astra, zespół w ciągu dwóch miesięcy doprowadził do wysokiej wydajności trzy modele o otwartych wagach, które nie były częścią pierwotnego planu produkcyjnego Jalapeño. To pokazało zarówno elastyczność architektury, jak i szybkość, z jaką AI może pomóc nam ją zaprogramować. W przypadku wybranych bloków mechanizmu uwagi i opracowanych przez ekspertów w GPT‑OSS implementacje wygenerowane przez AI działały 1,5–1,8 raza szybciej od istniejących implementacji napisanych przez ekspertów. Te liczby dotyczą wybranych bloków, a nie pełnego modelu, ale wskazują na nową, silną pętlę rozwoju.
Infrastruktura AI jest istotna, ponieważ umożliwia użyteczną pracę w rzeczywistym świecie. Wykonując więcej użytecznej pracy przy tym samym poborze mocy i na tym samym sprzęcie, układ Jalapeño może pomóc nam obsłużyć większe zapotrzebowanie i obniżyć koszt uzyskania pomyślnego wyniku. W OpenAI może to zwiększyć zdolności operacyjne, zapewniając większy wzrost przychodów i korzyści z użytecznej pracy w odniesieniu do kosztów obsługi. Może to również wspierać rozszerzenie zastosowań i wpływać na dalsze inwestycje w lepsze modele, produkty i infrastrukturę. Szybsze wnioskowanie może umożliwić szybsze iteracje i rozwinąć nowe zastosowania.
Układ Jalapeño poszerza granice możliwości w zakresie wydajnego wnioskowania o niskich opóźnieniach:
- Wnioskowanie w trybie ultraszybkim przy wydajności dostępnej wcześniej tylko w trybie szybkim
- Wnioskowanie w trybie szybkim przy wydajności dostępnej wcześniej tylko w trybie wsadowym
- Wyższa wydajność wnioskowania w trybie wsadowym
Planujemy rozpocząć wdrażanie układu Jalapeño w infrastrukturze obliczeniowej OpenAI do końca roku. Będzie to pierwsza generacja w planie rozwoju przewidzianym na wiele generacji: generacja 2. jest na zaawansowanym etapie prac rozwojowych, a generacja 3. właśnie się kształtuje. Każda kolejna generacja będzie bazować na zdobytej wiedzy i dalej zwiększać efektywność i szybkość pracy.
Zaspokojenie rosnącego zapotrzebowania na usługi AI będzie wymagać większej mocy obliczeniowej z każdego dostępnego źródła. Będziemy nadal szeroko wdrażać akceleratory firmy NVIDIA i innych partnerów podczas trenowania modeli oraz wnioskowania. Naszą misją jest zapewnienie, aby ogólna sztuczna inteligencja przynosiła korzyści całej ludzkości.
W ramach przygotowań do wdrożenia kontynuujemy kwalifikację produkcyjną, rozwijamy oprogramowanie, przygotowujemy się do obsługi układów Jalapeño na dużą skalę i weryfikujemy wydajność w większej liczbie modeli. Dotychczasowe wyniki pokazują, co jest możliwe, gdy wspólnie projektujemy cały system – jesteśmy w stanie opracowywać bardziej responsywną, zaawansowaną i agentową sztuczną inteligencję, z której korzystać będzie większa liczba użytkowników.
WYZNACZA NOWY POZIOM PRZEPUSTOWOŚCI NA kW
InferenceX · GPT‑OSS‑120B · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB200 1 200 W
PRZEPUSTOWOŚĆ SZCZYTOWA I WYRÓWNANA
InferenceX · GPT‑OSS‑120B · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB200 1 200 W
Wyższa szczytowa wej. i wyj. TPS/kW
≈1,9×
Wej. i wyj. 85 448 względem 44 960/kW
Niższe opóźnienie całkowite
≈1,7×
1,03 s w porównaniu z 1,80 s
Niższy min CMT
≈2,7×
0,69 względem 1,87 ms (1459 względem 535 tok/s/użytkownika)
Większa przepustowość przy dotychczas najlepszym czasie między tokenami (CMT)
≈53,7×
Wej. i wyj. 22 935 względem 427/kW (przy 535,28 tok./s/użytkownika)
WYZNACZA NOWY POZIOM PRZEPUSTOWOŚCI NA kW
InferenceX · DeepSeek R1 MXFP4 · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB300 1,400 W
PRZEPUSTOWOŚĆ SZCZYTOWA I WYRÓWNANA
InferenceX · DeepSeek R1 MXFP4 · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB300 1,400 W
Wyższa szczytowa wej. i wyj. TPS/kW
≈1,7×
Wej. i wyj. 19 641 względem 11 781/kW
Niższe opóźnienie całkowite
≈3,6×
1,65 s względem 5,99 s
Niższy min CMT
≈4,1×
1,43 względem 5,90 ms (700 względem 169 tok./s/użytk.)
Większa przepustowość przy dotychczas najlepszym czasie między tokenami (CMT)
≈104,3×
Wej. i wyj. 12 258 względem 118/kW (przy 169,41 tok./s/użytkownika)
WYZNACZA NOWY POZIOM PRZEPUSTOWOŚCI NA kW
InferenceX · Kimi K2,5 MXFP4 · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB300 1 400 W
PRZEPUSTOWOŚĆ SZCZYTOWA I WYRÓWNANA
InferenceX · Kimi K2,5 MXFP4 · nominalne 8k/1k · STP · TDP pakietu: Jalapeño 700 W; GB300 1 400 W
Wyższa szczytowa wej. i wyj. TPS/kW
≈1,5×
Wej. i wyj. 18 195 względem 11 862/kW
Niższe opóźnienie całkowite
≈3,4×
1,56 s względem 5,31 s
Niższy min CMT
≈3,8×
1,44 względem 5,48 ms (694 vs. 182 tok./s/użytk.)
Większa przepustowość przy dotychczas najlepszym czasie między tokenami (CMT)
≈56,1×
Wej. i wyj. 6744 względem 120/kW (przy 182,46 tok./s/użytkownika)


