Rezultatet e para të Jalapeño-s tregojnë shpejtësi e efikasitet lider në inferencën e IA-së

Që kur njoftuam Jalapeño, çipin e parë të personalizuar të OpenAI për inferencë, kemi testuar çipin dhe sistemin e ndërtuar rreth tij. Rezultatet tregojnë një përparim të ndjeshëm në performancë: Jalapeño mund të ofrojë më shumë punë me AI për njësi fuqie, duke kthyer njëkohësisht përgjigjet më shpejt. Jalapeño ofron si kapacitet më të lartë pune, ashtu edhe vonesë më të ulët me një arkitekturë të vetme, ndërsa sistemet ekzistuese harduerike shpesh duhet të bëjnë një kompromis midis të dyjave.
Për klientët, kjo mund të nënkuptojë përgjigje më të shpejta, agjentë më reagues dhe akses më të besueshëm ndërsa kërkesa rritet. Misioni ynë është të sigurojmë që i gjithë njerëzimi të përfitojë nga inteligjenca e përgjithshme artificiale. Këto përmirësime do të ndihmojnë që inteligjenca artificiale gjithnjë e më e aftë të bëhet më e përballueshme dhe më gjerësisht e disponueshme.
Modelet e OpenAI-së përshpejtuan gjithashtu zhvillimin e Jalapeño-s. Gjeneratat e mëparshme e ndihmuan ekipin të projektonte dhe të vinte në funksion çipin, ndërsa modelet tona më të fundit po përshpejtojnë mënyrën se si e optimizojmë dhe programojmë atë. Performanca e Jalapeño-s shtrihet në GPT‑OSS 120B, DeepSeek R1 dhe Kimi K2.5 1T, duke treguar se arkitektura funksionon me modele të zhvilluara si brenda, ashtu edhe jashtë OpenAI. Në të treja rastet, Jalapeño ofroi 1,5 deri në 1,9 herë më shumë punë me AI për vat në kapacitetin maksimal të punës dhe një vonesë nga fillimi në fund 1,7 deri në 3,6 herë më të ulët se sistemet e krahasimit. Për ngarkesat e punës shumë interaktive, ai ofroi performancë 2,1 deri në 4,1 herë më të lartë.
Jalapeño është gjithashtu dëshmi e një avantazhi më të gjerë të paketës së plotë. OpenAI mund të projektojë së bashku modelet, produktet, softuerin për ofrimin e shërbimeve, çipat, memorien, rrjetin dhe sistemet, duke përdorur atë që mësojmë nga ngarkesat reale të punës për të përmirësuar çdo shtresë të paketës. Jalapeño është silikoni i zhvilluar nga OpenAI për përdorim të drejtpërdrejtë, me rezultate të matshme, dhe është fillimi i një platforme të zhvilluar përgjatë disa gjeneratave. Në muajt në vijim, do të rrisim prodhimin e Jalapeño-s për të ofruar produkte më të shpejta, më të afta dhe më efikase për klientët tanë.
Ne e vlerësojmë performancën në një përvojë të barasvlershme për përdoruesin, duke matur se sa punë të dobishme me IA mund të kryejë secili sistem për njësi fuqie, duke përmbushur njëkohësisht kërkesat për vonesën që kanë klientët dhe agjentët interaktivë. Kjo është veçanërisht e rëndësishme për agjentët, të cilët duhet të kryejnë shumë hapa njëri pas tjetrit, ndaj vonesat mund të akumulohen gjatë gjithë një detyre.
Për të kuptuar se si performon Jalapeño në praktikë, e testuam në InferenceX, një standard publik vlerësimi nga SemiAnalysis që mat të gjithë procesin e ofrimit të një kërkese për IA. Ne e krahasuam Jalapeño-n me sistemet kryesore të AI-së të disponueshme komercialisht përgjatë gamës së testuar të funksionimit, nga ofrimi me kapacitet të lartë pune deri te përdorimi shumë interaktiv me vonesë të ulët. Jalapeño ofroi një kombinim më të mirë të kapacitetit të punës, efikasitetit të energjisë dhe vonesës. Megjithëse performanca ndonjëherë raportohet për çip, ne besojmë se standardi më i dobishëm është performanca për njësi fuqie.
Në të tre modelet publike, Jalapeño ofroi një kombinim më të mirë të performancës për vat dhe latencës në të gjithë intervalin e testuar të funksionimit, duke e vendosur në avangardën e Pareto-s. Për t’i krahasuar sistemet në mënyrë të njëtrajtshme, i normalizuam rezultatet duke përdorur vlerësimin e publikuar të fuqisë së çipit për secilin përshpejtues. Jalapeño është vlerësuar në 700 vat, megjithëse fuqia e tij e matur gjatë funksionimit të qëndrueshëm mbeti në ose nën 550 vat në ngarkesat e punës të testuara.
Jalapeño performoi fuqishëm në GPT‑OSS 120B, DeepSeek R1 670B dhe Kimi K2.5 1T. Në Kimi, modeli më i madh publik që testuam, ai ofroi rreth 1,5 herë performancë maksimale më të lartë për vat dhe një vonesë nga fillimi në fund 3,4 herë më të ulët se sistemi i krahasimit. Në testimin tonë të brendshëm, avantazhi i Jalapeño-s u zgjerua më tej në modelet më të përparuara të OpenAI-së, duke sugjeruar se arkitektura bëhet edhe më e vlefshme ndërsa ngarkesat e punës rriten dhe bëhen më kërkuese.
Jalapeño u projektua që në fillim duke u nisur nga pyetja: çfarë pajisjeje do të ndërtonim nëse qëllimi i saj kryesor do të ishte ofrimi i modeleve moderne dhe të ardhshme të gjuhës, veçanërisht i agjentëve interaktivë? Përfitimet e Jalapeño vijnë nga projektimi së bashku i çipit, memories, rrjetit, softuerit dhe sistemit në shkallë rafti për ngarkesa pune reale të modeleve gjuhësore. Inferenca e modeleve gjuhësore kalon nëpër disa faza të veçanta me pengesa të ndryshme. Prefill, kur sistemi përpunon një kërkesë, kërkon shumë fuqi llogaritëse, ndërsa decode, kur sistemi gjeneron përgjigjen token pas tokeni, kufizohet më shumë nga gjerësia e brezit të memories. Komunikimi mund të shtojë gjithashtu vonesë kur të dhënat duhet të lëvizin midis bërthamave dhe çipave, duke lënë disa njësi përpunimi joaktive ndërsa presin. Një sistem që shkëlqen në një fazë mund ta humbasë këtë avantazh ndërsa pret të dhënat ose zhvendos gjendjen e modelit midis burimeve të ndryshme.
Ne e projektuam Jalapeño-n për të minimizuar lëvizjen e të dhënave dhe vonesat e komunikimit. Kjo do të thotë se gjendja e modelit, përfshirë memorien specifike KV të përdorur gjatë gjenerimit të një përgjigjeje, mund të vendoset dhe të mbahet në mënyrë eksplicite në nivel lokal, ndërsa sistemi aktivizon kombinimin e duhur të fuqisë llogaritëse, memories dhe rrjetit për secilën fazë të inferencës. Rrjeti është pjesë thelbësore e arkitekturës. Gjerësia e madhe e domenit të tij lejon që e gjithë ngarkesa e punës të mbetet brenda një sistemi të vetëm të ndërlidhur, duke minimizuar lëvizjen e të dhënave dhe duke ndihmuar që e gjithë kërkesa të mbetet e shpejtë dhe efikase nga fillimi deri në fund. Rezultati është një përshpejtues i ekuilibruar dhe fleksibël që mund të mbështesë arkitektura modelesh në ndryshim, të shkëlqejë si në prefill, ashtu edhe në decode, dhe të përshtatet ndërsa ndryshon ekuilibri midis tyre, një veçori përcaktuese e ngarkesave të punës agjentike.
IA-ja luajti një rol të drejtpërdrejtë në zhvillimin e Jalapeño-s, duke i mundësuar ekipit të kalonte nga projektimi fillestar te tapeout-i brenda nëntë muajve, përmes eksplorimit të implementimeve, shkurtimit të cikleve të projektimit, matjes dhe verifikimit, si dhe përsëritjes së vazhdueshme bazuar në ngarkesat e punës së modeleve. IA-ja ndihmoi gjithashtu në optimizimin e qarqeve aritmetike të çipit, duke i mundësuar ekipit të përfshinte më shumë performancë llogaritëse në çip brenda afatit të planifikuar.
Jalapeño u projektua si një objektiv i qartë dhe i parashikueshëm programimi si për njerëzit, ashtu edhe për IA-në. Inxhinierët mund ta përshkruajnë punën përmes tensorëve lokalë, komunikimit të përcaktuar qartë dhe sinkronizimit të parashikueshëm. Më pas, AI-ja mund të optimizojë mënyrën se si kjo punë shpërndahet, vendoset, planifikohet dhe koordinohet në të gjithë sistemin. Kjo strukturë e qartë dhe e parashikueshme i jep AI-së një mënyrë të menaxhueshme për të trajtuar problemin tradicionalisht të vështirë të programimit paralel.
Mbështetja për çdo familje të re modelesh kërkon ende kernelë të rinj dhe optimizime specifike për modelin. Duke përdorur Codex me GPT‑Astra, ekipi arriti t’i çonte tre modele me peshë të hapur, të cilat nuk ishin pjesë e planit fillestar të prodhimit të Jalapeño-s, në një nivel të lartë performance brenda dy muajsh. Kjo demonstroi si fleksibilitetin e arkitekturës, ashtu edhe shpejtësinë me të cilën IA-ja mund të na ndihmojë ta programojmë atë. Për blloqe të përzgjedhura të vëmendjes dhe të përzierjes së ekspertëve të GPT‑OSS, implementimet e gjeneruara nga IA funksionuan 1,5 deri në 1,8 herë më shpejt se implementimet ekzistuese të shkruara nga ekspertët njerëzorë. Këto shifra vlejnë për blloqet e përzgjedhura, jo për modelin e plotë, por ato tregojnë drejt një cikli të ri dhe të fuqishëm zhvillimi.
Infrastruktura e AI-së është e vlefshme për shkak të punës së dobishme në botën reale që mundëson. Duke prodhuar më shumë punë të dobishme me të njëjtën sasi energjie dhe të njëjtin harduer, Jalapeño mund të na ndihmojë të përballojmë më shumë kërkesa dhe të ulim koston e ofrimit të një rezultati të suksesshëm. Për OpenAI-n, kjo mund të përmirësojë levën operacionale duke mundësuar që puna e dobishme dhe të ardhurat të rriten më shpejt se kostoja e ofrimit të shërbimit. Gjithashtu, mund të mbështesë një adoptim më të gjerë dhe investime të vazhdueshme në modele, produkte dhe infrastrukturë më të mira. Inferenca më e shpejtë mund të mundësojë përsëritje më të shpejta dhe raste të reja përdorimi.
Jalapeño zgjeron mundësitë për inferencë efikase me vonesë të ulët:
- Inferencë në modalitet ultra të shpejtë me efikasitet që më parë ishte i disponueshëm vetëm në modalitetin e shpejtë
- Inferencë në modalitet të shpejtë me efikasitet që më parë ishte i disponueshëm vetëm në modalitetin grupor
- Efikasitet më i lartë për inferencën në modalitet grupor
Planifikojmë të fillojmë vendosjen e Jalapeño-s në infrastrukturën e llogaritjes së OpenAI-së deri në fund të vitit. Ky është gjenerata e parë e një plani shumëgjeneratash: Gen 2 është në një fazë të avancuar zhvillimi, ndërsa Gen 3 po merr formë. Çdo gjeneratë do të bazohet në atë që mësojmë dhe do të përmirësojë më tej si efikasitetin, ashtu edhe shpejtësinë.
Përballimi i kërkesës në rritje për IA do të kërkojë më shumë fuqi llogaritëse nga çdo burim i disponueshëm. Ne do të vazhdojmë të përdorim gjerësisht përshpejtuesit nga NVIDIA dhe partnerë të tjerë si për ngarkesat e punës për trajnimin, ashtu edhe për ato për inferencën. Misioni ynë është të sigurojmë që inteligjenca e përgjithshme artificiale të sjellë përfitime për të gjithë njerëzimin.
Ndërsa përgatitemi për vendosjen në përdorim, po vazhdojmë kualifikimin e prodhimit, po përmirësojmë softuerin, po përgatitemi ta operojmë Jalapeño-n në shkallë të gjerë dhe po vërtetojmë performancën në më shumë modele. Rezultatet e deritanishme tregojnë se çfarë është e mundur kur e projektojmë të gjithë sistemin së bashku: IA më e përgjegjshme, më e aftë dhe më agjentike, e ofruar në mënyrë më efikase për më shumë njerëz.
KAPACITET PUNE PËR kW - AVANGARDË
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700 W; GB200 1 200 W
KAPACITETI MAKSIMAL DHE I PËRPUTHUR I PUNËS
InferenceX · GPT‑OSS‑120B · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700 W; GB200 1 200 W
Më i lartë TPS i përzier maksimal për kW
≈1,9×
85 448 kundrejt 44 960 të përziera / kW
Më e ulët vonesa nga fillimi deri në fund
≈1,7×
1,03 s kundrejt 1,80 s
TBT minimale më e ulët
≈2,7×
0,69 kundrejt 1,87 ms (1459 kundrejt 535 tok/s/përdorues)
Më shumë kapacitet përpunimi në TBT-në e mëparshme
≈53.7×
22 935 kundrejt 427 të përziera / kW (në 535,28 tok/s/përdorues)
KAPACITET PUNE PËR kW - AVANGARDË
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700 W; GB300 1 400 W
KAPACITETI MAKSIMAL DHE I PËRPUTHUR I PUNËS
InferenceX · DeepSeek R1 MXFP4 · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700 W; GB300 1 400 W
Më i lartë TPS i përzier maksimal për kW
≈1,7×
19 641 kundrejt 11 781 të përziera / kW
Më e ulët vonesa nga fillimi deri në fund
≈3,6×
1,65 s kundrejt 5,99 s
TBT minimale më e ulët
≈4.1×
1,43 kundrejt 5,90 ms (700 kundrejt 169 tok/s/përdorues)
Më shumë kapacitet përpunimi në TBT-në e mëparshme
≈104,3×
12 258 kundrejt 118 të përziera/kW (në 169,41 tok/s/përdorues)
KAPACITET PUNE PËR kW - AVANGARDË
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700W; GB300 1 400W
KAPACITETI MAKSIMAL DHE I PËRPUTHUR I PUNËS
InferenceX · Kimi K2.5 MXFP4 · nominal 8k/1k · STP · TDP i paketës: Jalapeño 700W; GB300 1 400W
Më i lartë TPS i përzier maksimal për kW
≈1,5×
18 195 kundrejt 11 862 të përziera / kW
Më e ulët vonesa nga fillimi deri në fund
≈3.4×
1,56 s kundrejt 5,31 s
TBT minimale më e ulët
≈3,8×
1,44 kundrejt 5,48 ms (694 kundrejt 182 tok/s/përdorues)
Më shumë kapacitet përpunimi në TBT-në e mëparshme
≈56,1×
6744 kundrejt 120 të përziera / kW (në 182,46 tok/s/përdorues)


