Ruka hadi kwenye maudhui kuu
OpenAI

25 Agosti 2026

UhandisiKampuni

Matokeo ya kwanza ya Jalapeño yanaonyesha kasi na ufanisi vinavyoongoza sekta katika inferensi ya AI

Inapakia…
Picha ya karibu ya chipu ya inferensi ya Jalapeño iliyowekwa kwenye bodi ya saketi ya rangi ya kijani-kibluu.

Tangu kutangaza Jalapeño, chipu maalum ya kwanza ya OpenAI ya inferensi, tumekuwa tukijaribu chipu hiyo na mfumo uliojengwa kuizunguka. Matokeo yanaonyesha maendeleo makubwa ya utendaji: Jalapeño inaweza kushughulikia kazi zaidi za AI kwa kila kipimo cha nishati huku pia ikirejesha majibu kwa haraka zaidi. Jalapeño hutoa utendaji wa juu zaidi na muda mfupi wa kusubiri kwa usanifu mmoja, ilhali mifumo iliyopo ya vifaa mara nyingi hulazimika kufanya mabadilishano kati ya hayo mawili.

Kwa wateja, hilo linaweza kumaanisha majibu ya haraka zaidi, wahudumu wanaoitikia kwa haraka zaidi, na upatikanaji wa kuaminika zaidi kadiri mahitaji yanavyoongezeka. Dhamira yetu ni kuhakikisha kwamba akili unde ya ujumla inanufaisha binadamu wote. Manufaa haya yatasaidia kufanya AI yenye uwezo unaozidi kuongezeka iwe nafuu zaidi na ipatikane kwa upana zaidi.

Miundo ya OpenAI pia iliharakisha maendeleo ya Jalapeño. Vizazi vya awali viliisaidia timu kubuni na kuanzisha chipu, huku miundo yetu ya hivi karibuni ikiharakisha jinsi tunavyoiboresha na kuipangia programu. Utendaji wa Jalapeño unaenea katika GPT‑OSS 120B, DeepSeek R1, na Kimi K2.5 1T, ukionyesha kwamba usanifu huu hufanya kazi katika miundo iliyotengenezwa ndani na nje ya OpenAI. Katika zote tatu, Jalapeño ilitoa kazi ya AI kwa kila wati mara 1.5 hadi 1.9 zaidi katika kiwango cha juu cha utendaji na ucheleweshaji wa mwisho hadi mwisho uliokuwa chini kwa mara 1.7 hadi 3.6 kuliko mifumo ya kulinganisha. Kwa mizigo ya kazi yenye mwingiliano mkubwa sana, ilitoa utendaji uliokuwa juu mara 2.1 hadi 4.1.

Jalapeño pia ni ushahidi wa faida pana zaidi ya mfumo kamili wa teknolojia. OpenAI inaweza kubuni miundo, bidhaa, programu za kutoa huduma, vipaza sauti, kumbukumbu, mitandao, na mifumo kwa pamoja, ikitumia tunayojifunza kutoka kwa kazi halisi za uchakataji kuboresha kila tabaka la mfumo. Jalapeño ni silicon ya kampuni yenyewe inayofanya kazi na matokeo yaliyopimwa, na ni mwanzo wa jukwaa la vizazi vingi. Katika miezi ijayo, tutaongeza kasi ya Jalapeño ili kutoa bidhaa za haraka zaidi, zenye uwezo zaidi, na zenye ufanisi zaidi kwa wateja wetu.

Jinsi tulivyopima utendaji wa Jalapeño

Tunatathmini utendaji katika uzoefu linganifu wa mtumiaji, tukipima kiasi cha kazi muhimu ya AI ambacho kila mfumo unaweza kukamilisha kwa kila kitengo cha nguvu ya umeme huku ukitimiza viwango vya ucheleweshaji vinavyohitajika na wateja pamoja na mawakala ingiliani. Hili ni muhimu hasa kwa mawakala, ambao wanahitaji kukamilisha hatua nyingi kwa mfuatano, hivyo ucheleweshaji unaweza kujilimbikiza katika jukumu zima.

Ili kuelewa jinsi Jalapeño inavyofanya kazi katika matumizi halisi, tuliijaribu kwenye InferenceX, kipimo cha umma kutoka SemiAnalysis kinachopima mchakato mzima wa kuhudumia ombi la AI. Tulilinganisha Jalapeño na mifumo inayoongoza ya AI inayopatikana kibiashara katika anuwai ya utendakazi iliyojaribiwa, kuanzia utoaji wa huduma wenye utendaji wa juu hadi matumizi yenye maingiliano mengi na ucheleweshaji mdogo. Jalapeño ilitoa mchanganyiko bora zaidi wa utendaji, ufanisi wa nishati, na ucheleweshaji. Ingawa utendaji wakati mwingine huripotiwa kwa kila chipu, tunaamini kuwa kigezo chenye manufaa zaidi ni utendaji kwa kila kitengo cha nguvu.

Jalapeño inaongeza uongozi kwenye TBT bora zaidi ya awali

Jalapeño hutoa tokeni zaidi kwa kila mtumiaji

Jalapeño hutoa utendaji zaidi kwa kila kilowati

Katika miundo yote mitatu ya umma, Jalapeño ilitoa mchanganyiko bora wa utendaji kwa kila wati na ucheleweshaji katika kiwango cha uendeshaji kilichojaribiwa, na kuiweka kwenye Pareto inayoongoza. Ili kulinganisha mifumo kwa uthabiti, tulisawazisha matokeo kwa kutumia ukadiriaji wa nguvu wa chipu uliochapishwa wa kila kichapuzi. Jalapeño imekadiriwa kuwa na wati 700, ingawa nguvu yake endelevu iliyopimwa ilisalia kuwa wati 550 au chini yake katika mizigo ya kazi iliyojaribiwa.

Jalapeño ilifanya vizuri katika GPT‑OSS 120B, DeepSeek R1 670B, na Kimi K2.5 1T. Kwenye Kimi, muundo mkubwa zaidi wa umma tulioujaribu, ilitoa utendaji wa kilele kwa kila wati ulio juu kwa takriban mara 1.5 na muda wa kusubiri wa kuanzia mwisho hadi mwisho ulio chini kwa mara 3.4 kuliko mfumo wa kulinganisha. Katika majaribio yetu ya ndani, faida ya Jalapeño iliongezeka zaidi kwenye miundo ya OpenAI inayoongoza, ikipendekeza kuwa usanifu huo unakuwa wa thamani zaidi kadiri mizigo ya kazi inavyokuwa mikubwa na yenye mahitaji makubwa zaidi.

Kubuni usanifu kwa ajili ya kasi na ufanisi ndani ya chipu moja

Jalapeño ilibuniwa tangu mwanzo kwa kuuliza: tungeunda maunzi ya aina gani ikiwa jukumu lake kuu lingekuwa kuhudumia miundo ya lugha ya kisasa na ya siku zijazo, hasa mawakala shirikishi? Mafanikio ya Jalapeño yanatokana na kubuni chipu, kumbukumbu, mtandao, programu, na mfumo wa kiwango cha rack kwa pamoja kwa kuzingatia kazi halisi za miundo ya lugha. Inferensi ya muundo wa lugha hupitia awamu kadhaa tofauti zenye vikwazo tofauti. Ujazaji wa awali, ambapo mfumo huchakata dokezo, huhitaji sana uwezo wa ukokotoaji, ilhali usimbuaji, ambapo mfumo huzalisha jibu tokeni baada ya tokeni, huwekewa kikomo zaidi na kipimo data cha kumbukumbu. Mawasiliano yanaweza pia kuongeza muda wa kusubiri data inapolazimika kuhamishwa kati ya viini na chipu, na kuacha baadhi ya vitengo vya uchakataji bila kazi vinaposubiri. Mfumo unaofanya vizuri katika awamu moja unaweza kupoteza faida hiyo unapongoja data au kuhamisha hali ya muundo kati ya rasilimali tofauti.

Tuliunda Jalapeño ili kupunguza kadri iwezekanavyo uhamishaji wa data na ucheleweshaji wa mawasiliano. Hii inamaanisha kuwa hali ya muundo, ikijumuisha akiba ya KV inayotumiwa wakati wa kutengeneza jibu, inaweza kuwekwa kwa uwazi na kuhifadhiwa ndani huku mfumo ukiwezesha mchanganyiko unaofaa wa ukokotoaji, kumbukumbu na mitandao kwa kila awamu ya inferensi. Mtandao ni sehemu muhimu ya usanifu. Kikoa chake kikubwa huruhusu mzigo mzima wa kazi kusalia ndani ya mfumo mmoja uliounganishwa, hivyo kupunguza uhamishaji wa data na kusaidia ombi lote kubaki la haraka na ufanisi kutoka mwanzo hadi mwisho. Matokeo yake ni kichapuzi chenye uwiano na kinachoweza kubadilika, kinachoweza kuhimili usanifu wa miundo unaobadilika, kufanya vyema katika kujaza mapema na kutafsiri, na kuzoea kadiri uwiano kati ya shughuli hizo unavyobadilika—sifa bainifu ya mzigo wa kazi wa kiwakilishi.

Tulitumia AI kubuni chipu, na tukaibuni chipu hiyo ili AI iweze kuiwekea programu

AI ilichangia moja kwa moja katika maendeleo ya Jalapeño, ikiwezesha timu kusonga kutoka usanifu wa awali hadi tapeout ndani ya miezi tisa kwa kuchunguza utekelezaji mbalimbali, kufupisha mizunguko ya usanifu, upimaji na uthibitishaji, na kuendelea kurudia kuboresha mizigo ya kazi ya muundo. AI pia ilisaidia kuboresha saketi za arithmetiki za chipu, ikiiwezesha timu kujumuisha utendaji zaidi wa ukokotoaji katika chipu kwa wakati uliopangwa.

Jalapeño iliundwa kuwa lengo la upangaji programu lililo wazi na linalotabirika kwa wanadamu na AI. Wahandisi wanaweza kuelezea kazi kupitia tensori za ndani, mawasiliano yaliyo wazi, na usawazishaji unaotabirika. Kisha, AI inaweza kuboresha jinsi kazi hiyo inavyopangiwa, kuwekwa, kupangiwa ratiba, na kuratibiwa katika mfumo mzima. Muundo huo ulio wazi na unaotabirika huipa AI njia rahisi ya kukabiliana na tatizo la programu sambamba ambalo kwa kawaida limekuwa gumu.

Kusaidia kila familia mpya ya miundo bado kunahitaji keneli mpya na uboreshaji mahususi kwa muundo. Kwa kutumia Codex pamoja na GPT‑Astra, timu ilifikisha miundo mitatu yenye uwezo uliotolewa hadharani ambayo haikuwa sehemu ya mpango wa awali wa uzalishaji wa Jalapeño kwenye utendaji wa juu ndani ya miezi miwili. Hili lilionyesha unyumbufu wa usanifu na kasi ambayo AI inaweza kutusaidia kuandaa programu yake. Kwa bloki zilizochaguliwa za umakini na mchanganyiko wa wataalamu za GPT‑OSS, utekelezaji uliozalishwa na AI uliendesha kwa kasi mara 1.5 hadi 1.8 kuliko utekelezaji uliopo ulioandikwa na wataalamu wa binadamu. Takwimu hizo zinatumika kwa bloki zilizochaguliwa, si kwa muundo mzima, lakini zinaashiria mzunguko mpya wenye nguvu wa maendeleo.

Njia iliyo mbele kwa utoaji wa matokeo wenye ufanisi na wa Ultra-haraka sana

Miundombinu ya AI ina thamani kwa sababu ya kazi muhimu katika ulimwengu halisi inayowezesha. Kwa kuzalisha kazi yenye manufaa zaidi kwa kutumia nishati na maunzi yaleyale, Jalapeño inaweza kutusaidia kukidhi mahitaji zaidi na kupunguza gharama ya kutoa matokeo yenye mafanikio. Kwa OpenAI, hilo linaweza kuboresha ufanisi wa uendeshaji kwa kuruhusu kazi yenye manufaa na mapato kukua kwa kasi zaidi kuliko gharama ya kuhudumia. Pia linaweza kuunga mkono matumizi mapana zaidi na uwekezaji unaoendelea katika miundo, bidhaa na miundombinu bora zaidi. Inferensi ya haraka zaidi inaweza kuwezesha urudiaji wa haraka zaidi na hali mpya za matumizi.

Jalapeño hupanua mipaka ya yanayowezekana kwa inferensi yenye ufanisi na ucheleweshaji mdogo:

  • Utoaji wa maelekezo wa hali ya ultra-haraka kwa ufanisi uliokuwa ukipatikana hapo awali katika hali ya haraka pekee
  • Utoaji wa hitimisho katika hali ya haraka kwa ufanisi uliokuwa ukipatikana hapo awali tu katika hali ya kuchakata kwa vikundi
  • Ufanisi wa juu zaidi kwa utambuzi wa kundi

Tunapanga kuanza kusambaza Jalapeño ndani ya miundombinu ya ukokotoaji ya OpenAI kufikia mwisho wa mwaka. Ni kizazi cha kwanza cha mpango wa mwelekeo wa vizazi vingi: Gen 2 iko katika hatua za kina za uendelezaji, na Gen 3 inaanza kuchukua sura. Kila kizazi kitatumia tunayojifunza kama msingi na kuboresha zaidi ufanisi na kasi.

Kukidhi mahitaji yanayoongezeka ya AI kutahitaji uwezo zaidi wa uchakataji kutoka kwa kila chanzo kinachopatikana. Tutaendelea kueneza viongezaji kutoka NVIDIA na washirika wengine kwa ajili ya mizigo ya kazi ya mafunzo na utabiri. Dhamira yetu ni kuhakikisha kwamba akili unde ya ujumla inanufaisha binadamu wote.

Tunapojiandaa kwa ajili ya upelekaji, tunaendelea na uthibitishaji wa uzalishaji, kuendeleza programu, kujiandaa kuendesha Jalapeño kwa kiwango kikubwa, na kuthibitisha utendaji katika mifano mingi zaidi. Matokeo hadi sasa yanaonyesha kinachowezekana tunapobuni mfumo mzima pamoja: AI ya kiwakala, yenye kuitikia zaidi na uwezo mkubwa zaidi, inayowasilishwa kwa ufanisi zaidi kwa watu wengi zaidi.

Kiambatisho

Jalapeño ni Pareto inayoongoza katika GPT‑OSS 120B

MPAKA WA UTENDAJI KWA KILA kW

InferenceX · GPT‑OSS‑120B · 8k/1k ya kawaida · STP · TDP ya kifurushi: Jalapeño 700 W; GB200 1,200 W

Jalapeño inaongoza katika usanidi mbalimbali wa uendeshaji wa GPT‑OSS

UTENDAJI WA KILELE NA ULIOOANISHWA

InferenceX · GPT‑OSS‑120B · 8k/1k ya kawaida · STP · TDP ya kifurushi: Jalapeño 700 W; GB200 1,200 W

TPS ya kilele mchanganyiko cha juu / kW

≈1.9×

85,448 dhidi ya 44,960 mchanganyiko / kW

Ucheleweshaji mdogo zaidi wa mwisho hadi mwisho

≈1.7×

1.03 s dhidi ya 1.80 s

Punguza kiwango cha chini cha TBT

≈2.7×

0.69 dhidi ya 1.87 ms (1,459 dhidi ya 535 tok/s/user)

Utendaji zaidi katika TBT ya awali

≈53.7×

22,935 dhidi ya 427 mchanganyiko / kW (kwa Toki 535.28/sekunde/mtumiaji)

Jalapeño iko kwenye Pareto inayoongoza katika DeepSeek R1 670B

UTENDAJI kwa kW MPAKA

InferenceX · DeepSeek R1 MXFP4 · ya kawaida 8k/1k · STP · TDP ya kifurushi: Jalapeño 700 W; GB300 1,400 W

Jalapeño inaongoza katika nukta zote za uendeshaji za DeepSeek R1

UTENDAJI WA KILELE NA ULIOOANISHWA

InferenceX · DeepSeek R1 MXFP4 · ya kawaida 8k/1k · STP · TDP ya kifurushi: Jalapeño 700 W; GB300 1,400 W

Kilele cha Juu zaidi cha mchanganyiko cha TPS / kW

≈1.7×

19,641 dhidi ya 11,781 mseto / kW

Ucheleweshaji mdogo zaidi wa mwisho hadi mwisho

≈3.6×

1.65 s dhidi ya 5.99 s

Punguza kiwango cha chini cha TBT

≈4.1×

1.43 dhidi ya 5.90 ms (700 dhidi ya 169 tok/s/user)

Utendaji zaidi katika TBT ya awali

≈104.3×

12,258 dhidi ya 118 mchanganyiko / kW (kwa 169,41 tok/s/mtumiaji)

Jalapeño iko kwenye Pareto inayoongoza katika Kimi K2.5 1T

MPAKA WA UTENDAJI KWA KILA kW

InferenceX · Kimi K2.5 MXFP4 · 8k/1k ya kawaida · STP · TDP ya kifurushi: Jalapeño 700 W; GB300 1,400 W

Jalapeño inaongoza katika pointi zote za uendeshaji za Kimi K2.5

UTENDAJI WA KILELE NA ULIOOANISHWA

InferenceX · Kimi K2.5 MXFP4 · 8k/1k ya kawaida · STP · TDP ya kifurushi: Jalapeño 700 W; GB300 1,400 W

Kilele cha juu zaidi cha TPS mchanganyiko / kW

≈1.5×

18,195 dhidi ya 11,862 mchanganyiko / kW

Ucheleweshaji mdogo zaidi wa mwisho hadi mwisho

≈3.4×

1.56 s dhidi ya 5.31 s

Punguza kiwango cha chini cha TBT

≈3.8×

1.44 dhidi ya 5.48 ms (694 dhidi ya 182 toki/sekunde/mtumiaji)

Utendaji zaidi kwa TBT ya awali

≈56.1×

6,744 dhidi ya 120 mchanganyiko / kW (kwa 182.46 tok/s/mtumiaji)

Mwandishi

OpenAI