
De când am anunțat Jalapeño, primul cip de inferență personalizat al OpenAI, am testat cipul și sistemul construit în jurul acestuia. Rezultatele arată un progres semnificativ în materie de performanță: Jalapeño poate deservi un volum mai mare de sarcini AI per unitate de putere, returnând totodată răspunsuri mai rapid. Jalapeño oferă atât un randament mai mare, cât și o latență mai mică, folosind o singură arhitectură, în timp ce sistemele hardware existente trebuie adesea să facă un compromis între cele două.
Pentru clienți, acest lucru poate însemna răspunsuri mai rapide, agenți mai receptivi și acces mai fiabil pe măsură ce cererea crește. Misiunea noastră este să ne asigurăm că inteligența generală artificială aduce beneficii întregii omeniri. Aceste progrese vor ajuta ca AI, pe măsură ce devine tot mai capabilă, să fie mai accesibilă și mai disponibilă pe scară largă.
Modelele OpenAI au accelerat, de asemenea, dezvoltarea Jalapeño. Generațiile anterioare au ajutat echipa să proiecteze cipul și să-l pună în funcțiune, în timp ce cele mai recente modele ale noastre accelerează modul în care îl optimizăm și îl programăm. Performanța Jalapeño se extinde pe GPT‑OSS 120B, DeepSeek R1 și Kimi K2.5 1T, demonstrând că arhitectura funcționează pentru modele dezvoltate atât în interiorul, cât și în afara OpenAI. În toate cele trei cazuri, Jalapeño a oferit de 1,5 până la 1,9 ori mai mult volum de lucru AI per watt la randament maxim și o latență de la un capăt la altul de 1,7 până la 3,6 ori mai mică decât sistemele de comparație. Pentru sarcinile de lucru foarte interactive, a oferit performanțe de 2,1 până la 4,1 ori mai ridicate.
Jalapeño demonstrează, de asemenea, un avantaj mai amplu la nivelul întregii stive tehnologice. OpenAI poate proiecta împreună modele, produse, software de servire, cipuri, memorie, rețele și sisteme, folosind ceea ce învățăm din sarcini de lucru reale pentru a îmbunătăți fiecare nivel al stivei. Jalapeño este un cip propriu funcțional, cu rezultate măsurate, și reprezintă începutul unei platforme dezvoltate pentru mai multe generații. În lunile următoare, vom intensifica producția Jalapeño pentru a livra clienților noștri produse mai rapide, mai performante și mai eficiente.
Evaluăm performanța în condițiile unei experiențe echivalente pentru utilizator, măsurând cât volum de lucru AI util poate realiza fiecare sistem per unitate de putere, respectând în același timp cerințele de latență ale clienților și agenților interactivi. Acest lucru contează în special pentru agenți, care trebuie să parcurgă mulți pași în ordine, astfel încât întârzierile se pot acumula pe parcursul unei întregi sarcini.
Pentru a înțelege cum se comportă Jalapeño în practică, l-am testat pe InferenceX, un test de referință public de la SemiAnalysis, care măsoară întregul proces de deservire a unei solicitări AI. Am comparat Jalapeño cu sisteme AI de top disponibile comercial în întregul interval de funcționare testat, de la deservirea cu randament ridicat până la utilizarea extrem de interactivă, cu latență redusă. Jalapeño a oferit o combinație mai bună de randament, eficiență energetică și latență. Deși performanța este uneori raportată per cip, considerăm că standardul mai util este performanța per unitate de putere.
Pentru toate cele trei modele publice, Jalapeño a oferit o combinație mai bună între performanța per watt și latență în întregul interval de operare testat, poziționându-se pe frontiera Pareto. Pentru a compara sistemele în mod consecvent, am normalizat rezultatele folosind puterea nominală publicată a cipului pentru fiecare accelerator. Jalapeño are o putere nominală de 700 de wați, deși puterea susținută măsurată a rămas la sau sub 550 de wați în sarcinile de lucru testate.
Jalapeño a avut performanțe solide pe GPT‑OSS 120B, DeepSeek R1 670B și Kimi K2.5 1T. Pe Kimi, cel mai mare model public pe care l-am testat, a oferit o performanță de vârf per watt cu aproximativ 1,5 ori mai ridicată și o latență de la un capăt la altul de 3,4 ori mai mică decât sistemul de comparație. În testările noastre interne, avantajul Jalapeño s-a extins și mai mult pe modelele OpenAI de vârf, sugerând că arhitectura devine mai valoroasă pe măsură ce sarcinile de lucru devin mai mari și mai solicitante.
Jalapeño a fost proiectat încă de la început pornind de la întrebarea: ce hardware am construi dacă rolul său principal ar fi să deservească modele lingvistice moderne și viitoare, mai ales agenți interactivi? Câștigurile oferite de Jalapeño provin din proiectarea integrată a cipului, memoriei, rețelei, software-ului și sistemului la scară de rack, în jurul sarcinilor reale de lucru ale modelelor lingvistice. Inferența modelelor lingvistice trece prin mai multe etape distincte, fiecare cu propriile blocaje. Etapa de procesare inițială a promptului, în care sistemul procesează un prompt, necesită multe resurse de calcul, în timp ce etapa de decodare, în care sistemul generează răspunsul token cu token, este limitată mai mult de lățimea de bandă a memoriei. Comunicarea poate adăuga, de asemenea, latență atunci când datele trebuie transferate între nuclee și cipuri, lăsând unele unități de procesare inactive în timp ce așteaptă. Un sistem care excelează într-o etapă poate pierde acest avantaj în timp ce așteaptă date sau transferă starea modelului între resurse diferite.
Am conceput Jalapeño pentru a minimiza transferul datelor și întârzierile de comunicare. Aceasta înseamnă că starea modelului, inclusiv cache-ul KV utilizat în timpul generării unui răspuns, poate fi poziționată în mod explicit și păstrată local, în timp ce sistemul activează combinația potrivită de resurse de calcul, memorie și rețea pentru fiecare fază de inferență. Rețeaua este parte integrantă a arhitecturii. Domeniul său extins permite ca întreaga sarcină de lucru să rămână într-un singur sistem interconectat, reducând la minimum transferul de date și contribuind la menținerea vitezei și eficienței întregii solicitări, de la început până la sfârșit. Rezultatul este un accelerator echilibrat și flexibil, capabil să susțină arhitecturi de modele în schimbare, să exceleze atât la procesarea inițială a promptului, cât și la decodare și să se adapteze pe măsură ce se modifică raportul dintre acestea, o caracteristică definitorie a sarcinilor de lucru agentive.
AI a jucat un rol direct în dezvoltarea Jalapeño, permițând echipei să treacă de la proiectarea inițială la finalizarea designului pentru fabricație în doar nouă luni, prin explorarea mai multor implementări, scurtarea ciclurilor de proiectare, măsurare și verificare și iterarea continuă pe baza sarcinilor de lucru ale modelelor. AI a contribuit, de asemenea, la optimizarea circuitelor aritmetice ale cipului, permițând echipei să integreze o putere de calcul mai mare în cip, fără a afecta calendarul de dezvoltare.
Jalapeño a fost conceput ca o platformă de programare clară și predictibilă, atât pentru oameni, cât și pentru AI. Inginerii pot descrie sarcinile folosind tensori locali, comunicare explicită și sincronizare predictibilă. AI poate apoi optimiza modul în care acel volum de lucru este mapat, plasat, programat și coordonat în întregul sistem. Această structură clară și predictibilă oferă AI o modalitate gestionabilă de a aborda problema, în mod tradițional dificilă, a programării paralele.
Susținerea fiecărei noi familii de modele necesită în continuare nuclee noi și optimizări specifice modelului. Folosind Codex cu GPT‑Astra, echipa a reușit ca, în decurs de două luni, să aducă la un nivel ridicat de performanță trei modele cu ponderi deschise, care nu făceau parte din planul inițial de producție al Jalapeño. Acest lucru a demonstrat atât flexibilitatea arhitecturii, cât și viteza cu care AI ne poate ajuta să o programăm. Pentru anumite blocuri de atenție și de combinație de experți GPT‑OSS, implementările generate de AI au rulat de 1,5 până la 1,8 ori mai rapid decât implementările existente scrise de experți umani. Aceste cifre se aplică blocurilor selectate, nu întregului model, dar indică un nou ciclu de dezvoltare puternic.
Infrastructura de AI este valoroasă datorită activităților utile din lumea reală pe care le face posibile. Prin producerea unei cantități mai mari de muncă utile din aceeași putere și același hardware, Jalapeño ne poate ajuta să satisfacem o cerere mai mare și să reducem costul livrării unui rezultat reușit. Pentru OpenAI, acest lucru poate îmbunătăți levierul operațional, permițând ca volumul de activitate utilă și veniturile să crească mai rapid decât costul de furnizare a serviciilor. De asemenea, poate susține adoptarea pe scară mai largă și investițiile continue în modele, produse și infrastructură mai bune. Inferența mai rapidă poate permite iterații mai rapide și noi cazuri de utilizare.
Jalapeño extinde posibilitățile inferenței eficiente, cu latență redusă:
- Inferență în modul Ultra-rapid la eficiențe disponibile anterior doar în modul rapid
- Inferență în modul rapid, la niveluri de eficiență disponibile anterior doar în modul de procesare în loturi
- Eficiență mai mare pentru inferența în modul de procesare în loturi
Planificăm să începem implementarea Jalapeño în infrastructura de calcul a OpenAI până la sfârșitul anului. Este prima generație a unei foi de parcurs pe mai multe generații: Gen 2 se află într-un stadiu avansat de dezvoltare, iar Gen 3 începe să prindă contur. Fiecare generație se va baza pe ceea ce învățăm și va îmbunătăți în continuare atât eficiența, cât și viteza.
Satisfacerea cererii tot mai mari pentru AI va necesita mai multă putere de calcul din fiecare sursă disponibilă. Vom continua să implementăm pe scară largă acceleratoare de la NVIDIA și de la alți parteneri pentru sarcini de antrenament și inferență. Misiunea noastră este să ne asigurăm că inteligența generală artificială aduce beneficii întregii omeniri.
Pe măsură ce ne pregătim pentru implementare, continuăm calificarea pentru producție, maturizăm software-ul, ne pregătim să operăm Jalapeño la scară largă și validăm performanța pe mai multe modele. Rezultatele de până acum arată ce este posibil atunci când proiectăm întregul sistem împreună: AI mai receptivă, mai capabilă și mai agentivă, oferită mai eficient unui număr mai mare de persoane.
RANDAMENT-per-kW DE VÂRF
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP-ul pachetului: Jalapeño 700 W; GB200 1.200 W
RANDAMENT MAXIM ȘI CORESPUNZĂTOR
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP-ul pachetului: Jalapeño 700 W; GB200 1.200 W
Vârf mixt mai ridicat de TPS/kW
≈1,9×
85.448 vs. 44.960 mixt/kW
Latență mai mică de la un capăt la altul
≈1,7×
1,03 s vs. 1,80 s
TBT minim mai mic
≈2,7×
0,69 vs. 1,87 ms (1.459 vs. 535 tok/s/utilizator)
Randament mai mare la TBT-ul anterior
≈53,7×
22.935 vs. 427 mixt/kW (la 535,28 tok/s/utilizator)
RANDAMENT-per-kW DE VÂRF
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP al pachetului: Jalapeño 700 W; GB300 1.400 W
RANDAMENT MAXIM ȘI CORESPUNZĂTOR
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP al pachetului: Jalapeño 700 W; GB300 1.400 W
Vârf mixt mai ridicat de TPS/kW
≈1,7×
19.641 vs. 11.781 mixt/kW
Latență mai mică de la un capăt la altul
≈3,6×
1,65 s vs. 5,99 s
TBT minim mai mic
≈4,1×
1,43 vs. 5,90 ms (700 vs. 169 tok/s/utilizator)
Randament mai mare la TBT-ul anterior
≈104,3×
12.258 vs. 118 mixt/kW (la 169,41 tok/s/utilizator)
RANDAMENT-per-kW DE VÂRF
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · pachet TDP: Jalapeño 700 W; GB300 1.400 W
RANDAMENT MAXIM ȘI CORESPUNZĂTOR
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · pachet TDP: Jalapeño 700 W; GB300 1.400 W
Vârf mixt mai ridicat de TPS/kW
≈1,5×
18.195 vs. 11.862 mixt/kW
Latență mai mică de la un capăt la altul
≈ 3,4 ×
1,56 s vs. 5,31 s
TBT minim mai mic
≈3,8×
1,44 vs. 5,48 ms (694 vs. 182 tok/s/utilizator)
Randament mai mare la TBT-ul anterior
≈56,1×
6.744 vs. 120 mixte/kW (la 182,46 tok/s/utilizator)


