Pāriet uz galveno saturu
OpenAI

2026. gada 25. augusts

InženierijaUzņēmums

Jalapeño pirmie rezultāti: nozarē vadoša mākslīgā intelekta (MI) secināšana ātrumā un efektivitātē

Notiek ielāde…
Tuvplāns ar Jalapeño secināšanas mikroshēmu, kas uzstādīta uz zilzaļas iespiedshēmas plates.

Kopš paziņojām par Jalapeño, OpenAI pirmo pielāgoto secināšanas mikroshēmu, mēs testējam šo mikroshēmu un ap to izveidoto sistēmu. Rezultāti liecina par būtisku veiktspējas uzlabojumu: Jalapeño var apstrādāt lielāku MI darba apjomu uz vienu jaudas vienību un vienlaikus sniegt atbildes ātrāk. Jalapeño vienā arhitektūrā nodrošina gan lielāku caurlaidspēju, gan mazāku latentumu, savukārt esošajām aparatūras sistēmām bieži jāmeklē kompromiss starp šiem abiem rādītājiem.

Klientiem tas var nozīmēt ātrākas atbildes, atsaucīgākus aģentus un uzticamāku piekļuvi, pieaugot pieprasījumam. Mūsu misija ir panākt, lai mākslīgais vispārējais intelekts sniegtu labumu visai cilvēcei. Šie uzlabojumi palīdzēs padarīt arvien spējīgāku MI plašāk pieejamu un lētāku.

OpenAI modeļi arī paātrināja Jalapeño izstrādi. Iepriekšējās paaudzes palīdzēja komandai izstrādāt un iedarbināt mikroshēmu, savukārt mūsu jaunākie modeļi paātrina tās optimizēšanu un programmēšanu. Jalapeño nodrošina augstu veiktspēju GPT‑OSS 120B, DeepSeek R1 un Kimi K2.5 1T modeļos, apliecinot, ka arhitektūra darbojas gan ar OpenAI, gan citu izstrādātāju modeļiem. Visos trīs gadījumos Jalapeño pie maksimālās caurlaidspējas nodrošināja 1,5 līdz 1,9 reizes lielāku MI darba apjomu uz vienu vatu un 1,7 līdz 3,6 reizes mazāku pilna cikla latentumu nekā salīdzinājuma sistēmas. Ļoti interaktīvās darba slodzēs tas nodrošināja 2,1 līdz 4,1 reizi augstāku veiktspēju.

Jalapeño arī parāda plašāku pilna steka priekšrocību. OpenAI var kopā izstrādāt modeļus, produktus, apkalpošanas programmatūru, mikroshēmas, atmiņu, tīklu un sistēmas, izmantojot to, ko mācāmies no reālām darba slodzēm, lai uzlabotu katru steka līmeni. Jalapeño ir funkcionējošs, pašu izstrādāts silīcija risinājums ar izmērītiem rezultātiem, un tas ir vairāku paaudžu platformas sākums. Nākamajos mēnešos mēs paplašināsim Jalapeño ieviešanu, lai klientiem nodrošinātu ātrākus, spējīgākus un efektīvākus produktus.

Kā mēs mērījām Jalapeño veiktspēju

Mēs vērtējam veiktspēju, nodrošinot līdzvērtīgu lietotāja pieredzi un mērot, cik daudz lietderīga mākslīgā intelekta (MI) darba katra sistēma spēj paveikt uz vienu jaudas vienību, vienlaikus nodrošinot tādu latentumu, kāds nepieciešams klientiem un interaktīvajiem aģentiem. Tas ir īpaši svarīgi aģentiem, kuriem secīgi jāveic daudzas darbības, tāpēc aizkaves var uzkrāties visa uzdevuma gaitā.

Lai saprastu, kā Jalapeño darbojas praksē, mēs to testējām publiski pieejamajā SemiAnalysis etalontestā InferenceX, kurā mēra pilnu MI pieprasījuma apkalpošanas procesu. Mēs salīdzinājām Jalapeño ar vadošajām komerciāli pieejamajām MI sistēmām visā testētajā darbības diapazonā, no augstas caurlaidspējas apkalpošanas līdz ļoti interaktīvai izmantošanai ar zemu latentumu. Jalapeño nodrošināja labāku caurlaidspējas, energoefektivitātes un latentuma kombināciju. Lai gan veiktspēja dažkārt tiek norādīta uz vienu mikroshēmu, mēs uzskatām, ka lietderīgāks standarts ir veiktspēja uz jaudas vienību.

Jalapeño palielina pārsvaru pie līdz šim labākā TBT

Jalapeño nodrošina vairāk tekstvienību uz vienu lietotāju

Jalapeño nodrošina lielāku caurlaidspēju uz katru kilovatu

Visos trīs publiski pieejamajos modeļos Jalapeño visā testētajā darbības diapazonā nodrošināja labāku veiktspējas uz vatu un latentuma kombināciju, tādējādi ierindojoties uz Pareto robežas. Lai sistēmas salīdzinātu konsekventi, mēs normalizējām rezultātus, izmantojot katra paātrinātāja publicēto mikroshēmas jaudas nominālvērtību. Jalapeño nominālā jauda ir 700 vati, lai gan testētajās darba slodzēs tā izmērītā ilgstošā jauda saglabājās 550 vatu līmenī vai zem tā.

Jalapeño uzrādīja augstu veiktspēju GPT‑OSS 120B, DeepSeek R1 670B un Kimi K2.5 1T modeļos. Kimi, lielākajā mūsu testētajā publiski pieejamajā modelī, Jalapeño nodrošināja aptuveni 1,5 reizes augstāku maksimālo veiktspēju uz vatu un 3,4 reizes mazāku pilna cikla latentumu nekā salīdzinājuma sistēma. Mūsu iekšējos testos Jalapeño priekšrocība OpenAI robežšķirtnes modeļos vēl vairāk palielinājās, kas liecina, ka arhitektūra kļūst vērtīgāka, darba slodzēm kļūstot lielākām un prasīgākām.

Arhitektūras izstrāde ātrumam un efektivitātei vienā mikroshēmā

Jalapeño jau no paša sākuma tika izstrādāts, uzdodot jautājumu: kādu aparatūru mēs veidotu, ja tās galvenais uzdevums būtu apkalpot mūsdienu un nākotnes valodas modeļus, it īpaši interaktīvus aģentus? Jalapeño veiktspējas ieguvumi rodas no mikroshēmas, atmiņas, tīkla, programmatūras un statņu mēroga sistēmas kopīgas izstrādes, balstoties uz reālām valodas modeļu darba slodzēm. Valodas modeļu secināšana noris vairākās atšķirīgās fāzēs ar dažādiem ierobežojumiem. Priekšielādes fāzē, kad sistēma apstrādā uzvedni, tiek patērēts daudz skaitļošanas resursu, savukārt dekodēšanas fāzē, kad sistēma ģenerē atbildi tekstvienību pa tekstvienībai, sistēmu vairāk ierobežo atmiņas joslas platums. Datu apmaiņa var arī palielināt aizturi, ja dati jāpārvieto starp kodoliem un mikroshēmām, atstājot dažas apstrādes vienības dīkstāvē, kamēr tās gaida. Sistēma, kas izceļas vienā posmā, var zaudēt šo priekšrocību, gaidot datus vai pārvietojot modeļa stāvokli starp dažādiem resursiem.

Mēs izstrādājām Jalapeño tā, lai samazinātu datu pārvietošanu un komunikācijas aizkaves līdz minimumam. Tas nozīmē, ka modeļa stāvokli, tostarp atslēgas-vērtības (KV) kešatmiņu, ko izmanto atbildes ģenerēšanas laikā, var precīzi izvietot un glabāt lokāli, kamēr sistēma katram secināšanas posmam aktivizē atbilstošu skaitļošanas jaudas, atmiņas un tīkla resursu kombināciju. Tīkls ir neatņemama arhitektūras sastāvdaļa. Tā plašais tvērums ļauj visai darba slodzei palikt vienā savienotā sistēmā, samazinot datu pārvietošanu un palīdzot nodrošināt, ka pilnais pieprasījums no sākuma līdz beigām tiek apstrādāts ātri un efektīvi. Rezultāts ir līdzsvarots un universāli izmantojams paātrinātājs, kas var atbalstīt mainīgas modeļu arhitektūras, izcili darboties gan priekšielādes, gan dekodēšanas posmā un pielāgoties līdzsvara izmaiņām, kas ir aģentu darba slodžu raksturīga iezīme.

Mēs izmantojām mākslīgo intelektu (MI), lai izstrādātu mikroshēmu, un izstrādājām mikroshēmu tā, lai MI to varētu programmēt

MI bija tieša nozīme Jalapeño izstrādē: tas ļāva komandai deviņos mēnešos pāriet no sākotnējā projekta līdz mikroshēmas projekta nodošanai ražošanā, izpētot dažādus realizācijas variantus, saīsinot projektēšanas, mērīšanas un verifikācijas ciklus un nepārtraukti pilnveidojot modeļu darba slodzes. MI arī palīdzēja optimizēt mikroshēmas aritmētiskās shēmas, ļaujot komandai grafikā paredzētajā laikā mikroshēmā ietilpināt lielāku skaitļošanas veiktspēju.

Jalapeño tika izstrādāts kā skaidrs un paredzams programmēšanas mērķis gan cilvēkiem, gan MI. Inženieri var aprakstīt darbu, izmantojot lokālos tenzorus, eksplīcītu komunikāciju un prognozējamu sinhronizāciju. Pēc tam mākslīgais intelekts var optimizēt to, kā šis darbs tiek kartēts, izvietots, ieplānots un koordinēts visā sistēmā. Šī skaidrā, paredzamā struktūra sniedz mākslīgajam intelektam praktiski izmantojamu veidu, kā risināt tradicionāli sarežģīto paralēlās programmēšanas problēmu.

Lai atbalstītu katru jaunu modeļu saimi, joprojām ir nepieciešami jauni kodoli un konkrētam modelim pielāgotas optimizācijas. Izmantojot Codex ar GPT‑Astra, komanda divu mēnešu laikā panāca augstu veiktspēju trim modeļiem ar atvērtiem svariem, kas nebija iekļauti Jalapeño sākotnējā ražošanas plānā. Tas apliecināja gan arhitektūras elastību, gan to, cik ātri mākslīgais intelekts var palīdzēt mums to programmēt. Atlasītiem GPT‑OSS uzmanības un ekspertu kombinācijas blokiem mākslīgā intelekta ģenerētie risinājumi darbojās 1,5 līdz 1,8 reizes ātrāk nekā esošie cilvēku ekspertu rakstītie risinājumi. Šie skaitļi attiecas uz atlasītajiem blokiem, nevis uz visu modeli, taču tie norāda uz jaudīgu jaunu izstrādes ciklu.

Ceļš uz efektīvu, īpaši ātru secināšanu

Mākslīgā intelekta (MI) infrastruktūra ir vērtīga, jo tā ļauj veikt noderīgu darbu reālajā pasaulē. Ar to pašu jaudu un aparatūru paveicot vairāk lietderīga darba, Jalapeño var mums palīdzēt apmierināt lielāku pieprasījumu un samazināt veiksmīga rezultāta nodrošināšanas izmaksas. Tas var uzlabot OpenAI darbības sviru, ļaujot noderīgam darbam un ieņēmumiem augt straujāk nekā apkalpošanas izmaksām. Tas var arī veicināt plašāku izmantošanu un turpmākus ieguldījumus labākos modeļos, produktos un infrastruktūrā. Ātrāka secināšana var paātrināt iterācijas un pavērt jaunus lietojuma veidus.

Jalapeño paplašina efektīvas secināšanas ar zemu latentumu iespējas:

  • Secināšana īpaši ātrajā režīmā ar efektivitāti, kas iepriekš bija pieejama tikai ātrajā režīmā
  • Secināšana ātrajā režīmā ar efektivitāti, kas iepriekš bija pieejama tikai pakešapstrādes režīmā
  • Augstāka pakešapstrādes režīma secināšanas efektivitāte

Mēs plānojam līdz gada beigām sākt izvērst Jalapeño OpenAI skaitļošanas infrastruktūrā. Tā ir vairāku paaudžu ceļveža pirmā paaudze: Gen 2 izstrāde jau ir krietni pavirzījusies, un Gen 3 sāk iegūt aprises. Katra paaudze balstīsies uz mūsu gūtajām atziņām un vēl vairāk uzlabos gan efektivitāti, gan ātrumu.

Lai apmierinātu augošo pieprasījumu pēc MI, būs nepieciešama lielāka skaitļošanas jauda no visiem pieejamajiem avotiem. Mēs turpināsim plaši izvietot NVIDIA un citu partneru paātrinātājus gan apmācības, gan secināšanas darba slodzēm. Mūsu misija ir panākt, lai mākslīgais vispārējais intelekts sniegtu labumu visai cilvēcei.

Gatavojoties ieviešanai, mēs turpinām kvalificēšanu ražošanas videi, pilnveidojam programmatūru, gatavojamies Jalapeño darbināt plašā mērogā un pārbaudām veiktspēju plašākā modeļu klāstā. Līdzšinējie rezultāti parāda, kas ir iespējams, kad visu sistēmu izstrādājam kā vienotu veselumu: atsaucīgāks, spējīgāks un autonomāks MI tiek efektīvāk padarīts pieejams lielākam cilvēku skaitam.

Pielikums

Jalapeño atrodas uz Pareto robežas GPT‑OSS 120B līmenī

CAURLAIDSPĒJAS UZ kW ROBEŽLĪKNE

InferenceX · GPT‑OSS‑120B · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB200 1200 W

Jalapeño ir līderis visos GPT‑OSS darbības punktos

MAKSIMĀLĀ CAURLAIDSPĒJA UN CAURLAIDSPĒJA PIE SASKAŅOTA ĀTRUMA

InferenceX · GPT‑OSS‑120B · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB200 1200 W

Lielāks maksimālais jaukto tekstvienību skaits sekundē uz kilovatu

≈1,9×

85 448 pret 44 960 jauktām tekstvienībām sekundē uz kilovatu

Mazāks latentums no sākuma līdz beigām

≈1,7×

1,03 s pret 1,80 s

Mazāks minimālais TBT

≈2,7×

0,69 pret 1,87 ms (1459 pret 535 tekstvienībām sekundē vienam lietotājam)

Lielāka caurlaidspēja pie iepriekšējā TBT

≈53,7×

22 935 pret 427 jauktām tekstvienībām sekundē uz kilovatu (ja ātrums ir 535,28 tekstvienības sekundē vienam lietotājam)

Jalapeño atrodas uz Pareto robežas DeepSeek R1 670B gadījumā

CAURLAIDSPĒJAS UZ kW EFEKTIVITĀTES ROBEŽA

InferenceX · DeepSeek R1 MXFP4 · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB300 1400 W

Jalapeño ir vadībā visos DeepSeek R1 darbības punktos

MAKSIMĀLĀ CAURLAIDSPĒJA UN CAURLAIDSPĒJA PIE SASKAŅOTA ĀTRUMA

InferenceX · DeepSeek R1 MXFP4 · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB300 1400 W

Lielāks maksimālais jaukto tekstvienību skaits sekundē uz kilovatu

≈1,7×

19 641 pret 11 781 jauktām tekstvienībām sekundē uz kilovatu

Mazāks pilna cikla latentums

≈3,6×

1,65 s pret 5,99 s

Mazāks minimālais TBT

≈4,1×

1,43 pret 5,90 ms (700 pret 169 tekstvienībām sekundē vienam lietotājam)

Lielāka caurlaidspēja pie iepriekšējās TBT vērtības

≈104,3×

12 258 pret 118 jauktām tekstvienībām sekundē uz kilovatu (ja ātrums ir 169,41 tekstvienība sekundē vienam lietotājam)

Jalapeño atrodas uz Pareto robežas Kimi K2.5 1T gadījumā

CAURLAIDSPĒJAS UZ kW ROBEŽLĪKNE

InferenceX · Kimi K2.5 MXFP4 · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB300 1400 W

Jalapeño ir līderis visos Kimi K2.5 darbības punktos

MAKSIMĀLĀ CAURLAIDSPĒJA UN CAURLAIDSPĒJA PIE SASKAŅOTA ĀTRUMA

InferenceX · Kimi K2.5 MXFP4 · nomināli 8k/1k · STP · pakotnes TDP: Jalapeño 700 W; GB300 1400 W

Lielāks maksimālais jaukto tekstvienību skaits sekundē uz kilovatu

≈1,5×

18 195 pret 11 862 jauktām tekstvienībām sekundē uz kilovatu

Mazāks pilna cikla latentums

≈3,4×

1,56 s salīdzinājumā ar 5,31 s

Mazāks minimālais TBT

≈3,8×

1,44 pret 5,48 ms (694 pret 182 tekstvienībām sekundē vienam lietotājam)

Lielāka caurlaidspēja pie iepriekšējā TBT

≈56,1×

6744 pret 120 jauktām tekstvienībām sekundē uz kilovatu (ja ātrums ir 182,46 tekstvienības sekundē vienam lietotājam)

Autors

OpenAI