Siirry pääsisältöön
OpenAI

25. elokuuta 2026

TekniikkaYritys

Jalapeñon ensimmäiset tulokset osoittavat alan johtavaa nopeutta ja tehokkuutta tekoälypäättelyssä

Ladataan...
Lähikuva Jalapeño-päättelysirusta, joka on asennettu sinivihreälle piirilevylle.

Jalapeñon, OpenAI:n ensimmäisen räätälöidyn päättelysirun, julkistamisen jälkeen olemme testanneet sirua ja sitä ympäröivää järjestelmää. Tulokset osoittavat merkittävän suorituskykyparannuksen: Jalapeño voi palvella enemmän tekoälytehtäviä tehoyksikköä kohti, ja palauttaa vastaukset nopeammin. Jalapeño tarjoaa yhdellä arkkitehtuurilla sekä suuremman suoritustehon että pienemmän viiveen, kun nykyisissä laitteistojärjestelmissä on usein tehtävä kompromissi näiden välillä.

Asiakkaille tämä voi tarkoittaa nopeampia vastauksia, paremmin reagoivia asiakaspalvelijoita ja luotettavampaa palvelun saatavuutta kysynnän kasvaessa. Tehtävämme on varmistaa, että yleinen tekoäly hyödyttää koko ihmiskuntaa. Nämä edistysaskeleet auttavat tekemään yhä kyvykkäämmästä tekoälystä edullisemman ja laajemmin saatavilla olevan.

OpenAI-mallit vauhdittivat myös Jalapeñon kehitystä. Aiemmat sukupolvet auttoivat tiimiä sirun suunnittelussa ja kehittämisessä, kun taas uusimmat mallimme nopeuttavat sen optimointia ja ohjelmointia. Jalapeñon suorituskyky ulottuu GPT‑OSS 120B:hen, DeepSeek R1:een ja Kimi K2.5 1T:hen, mikä osoittaa, että arkkitehtuuri toimii sekä OpenAI:n sisällä että sen ulkopuolella kehitetyissä malleissa. Kaikissa kolmessa Jalapeño tuotti huippusuoritusteholla wattia kohti 1,5–1,9 kertaa enemmän tekoälytyötä, ja sen päästä päähän -viive oli 1,7–3,6 kertaa pienempi kuin vertailujärjestelmien. Erittäin interaktiivisissa työkuormissa se tarjosi 2,1–4,1 kertaa korkeamman suorituskyvyn.

Jalapeño on myös osoitus laajemmasta täyden pinon edusta. OpenAI voi suunnitella mallit, tuotteet, palveluohjelmistot, sirut, muistin, verkotuksen ja järjestelmät yhdessä sekä hyödyntää todellisista työkuormista oppimaamme parantaakseen pinon jokaista kerrosta. Jalapeño on toimiva, itse kehitetty piiri, josta on saatu mitattuja tuloksia, ja se on monen sukupolven alustan alku. Tulevien kuukausien aikana vauhditamme Jalapeñon kehitystä, jotta voimme toimittaa asiakkaillemme nopeampia, suorituskykyisempiä ja tehokkaampia tuotteita.

Näin mittasimme Jalapeñon suorituskykyä

Arvioimme suorituskykyä vastaavalla käyttökokemuksella mittaamalla, kuinka paljon hyödyllistä tekoälytyötä kukin järjestelmä pystyy suorittamaan tehoyksikköä kohti samalla, kun se täyttää asiakkaiden ja vuorovaikutteisten agenttien edellyttämät viivevaatimukset. Tällä on merkitystä erityisesti agenteille, joiden on suoritettava monta vaihetta peräkkäin, joten viiveet voivat kasautua koko tehtävän mittaan.

Ymmärtääksemme, miten Jalapeño suoriutuu käytännössä, testasimme sitä InferenceX:llä, SemiAnalysisin julkisella vertailutestillä, joka mittaa tekoälypyynnön käsittelyn koko prosessia. Vertailimme Jalapeñoa johtaviin kaupallisesti saatavilla oleviin tekoälyjärjestelmiin koko testatun toiminta-alueen laajuudessa, suuren läpimenon palvelusta erittäin vuorovaikutteiseen, pienen viiveen käyttöön. Jalapeño tarjosi paremman yhdistelmän suoritustehoa, energiatehokkuutta ja viivettä. Vaikka suorituskyky ilmoitetaan joskus sirua kohden, uskomme, että hyödyllisempi mittari on suorituskyky tehoyksikköä kohden.

Jalapeño kasvattaa johtoaan aiempaan ennätykseen yltäneessä TBT:ssä

Jalapeño tarjoaa enemmän tokeneita käyttäjää kohti

Jalapeño tarjoaa enemmän suoritustehoa kilowattia kohden

Kaikissa kolmessa julkisessa mallissa Jalapeño tarjosi testatulla toiminta-alueella paremman yhdistelmän wattia kohti suorituskykyä ja viivettä, jolloin se sijoittui Pareto-rajalle. Jotta järjestelmiä voitaisiin vertailla yhdenmukaisesti, normalisoimme tulokset kunkin kiihdyttimen julkaistun sirun teholuokituksen perusteella. Jalapeñon nimellistehoksi on ilmoitettu 700 wattia, vaikka sen mitattu jatkuva teho pysyi testatuissa työkuormissa enintään 550 watissa.

Jalapeño suoriutui erinomaisesti GPT‑OSS 120B:llä, DeepSeek R1 670B:llä ja Kimi K2.5 1T:llä. Kimi-mallilla, joka oli suurin testaamamme julkinen malli, se tarjosi noin 1,5 kertaa korkeamman huippusuorituskyvyn wattia kohti ja 3,4 kertaa pienemmän päästä päähän -viiveen kuin vertailujärjestelmä. Sisäisissä testeissämme Jalapeñon etu kasvoi entisestään edistyneillä OpenAI-malleilla, mikä viittaa siihen, että arkkitehtuurista tulee arvokkaampi työkuormien kasvaessa suuremmiksi ja vaativammiksi.

Nopeuteen ja tehokkuuteen tähtäävä arkkitehtuurisuunnittelu yhdellä sirulla

Jalapeño suunniteltiin alusta alkaen kysymällä: millaista laitteistoa rakentaisimme, jos sen ensisijainen tehtävä olisi palvella nykyisiä ja tulevia kielimalleja, erityisesti vuorovaikutteisia agentteja? Jalapeñon edut syntyvät siitä, että siru, muisti, verkko, ohjelmisto ja kehikkotason järjestelmä suunnitellaan yhdessä todellisten kielimallien työkuormien ympärille. Kielimallien päättely etenee useiden erillisten vaiheiden kautta, joilla on erilaisia pullonkauloja. Esitäyttö, jossa järjestelmä käsittelee kehotteen, on laskentatehoa vaativaa, kun taas dekoodaus, jossa järjestelmä tuottaa vastaustokenin kerrallaan, on enemmän muistin kaistanleveyden rajoittama. Viestintä voi myös lisätä viivettä, kun tietoa täytyy siirtää ytimien ja sirujen välillä, jolloin jotkin prosessointiyksiköt jäävät käyttämättömiksi odottaessaan. Järjestelmä, joka on erinomainen yhdessä vaiheessa, voi menettää tämän edun odottaessaan tietoa tai siirtäessään mallin tilaa eri resurssien välillä.

Suunnittelimme Jalapeñon minimoimaan datan siirtoa ja viestintäviiveitä. Tämä tarkoittaa, että mallin tila, mukaan lukien vastauksen luomisessa käytetty KV-välimuisti, voidaan sijoittaa nimenomaisesti ja pitää paikallisena, samalla kun järjestelmä aktivoi oikean yhdistelmän laskentaa, muistia ja verkkoyhteyksiä kutakin päättelyn vaihetta varten. Verkko on olennainen osa arkkitehtuuria. Sen laaja toimialue mahdollistaa koko työkuorman pysymisen yhdessä yhtenäisessä järjestelmässä, mikä minimoi tietojen siirtämisen ja auttaa pitämään koko pyynnön nopeana ja tehokkaana alusta loppuun. Tuloksena on tasapainoinen ja vaihdettavissa oleva kiihdytin, joka voi tukea muuttuvia malli-arkkitehtuureja, toimia erinomaisesti sekä esitäyttö- että dekoodausvaiheessa ja mukautua niiden välisen tasapainon muuttuessa, mikä on agenttisten työkuormien määrittävä ominaisuus.

Käytimme tekoälyä sirun suunnitteluun ja suunnittelimme sirun sellaiseksi, että tekoäly voisi ohjelmoida sen

Tekoälyllä oli suora rooli Jalapeñon kehityksessä: sen ansiosta tiimi pystyi siirtymään alkuperäisestä suunnittelusta loppuvaiheeseen yhdeksässä kuukaudessa tutkimalla toteutusvaihtoehtoja, lyhentämällä suunnittelu-, mittaus- ja varmennussyklejä sekä iteroimalla jatkuvasti mallikuormien parissa. Tekoäly auttoi myös optimoimaan sirun aritmeettisia piirejä, minkä ansiosta tiimi pystyi sisällyttämään siruun enemmän laskentatehoa aikataulussa.

Jalapeño suunniteltiin selkeäksi ja ennakoitavaksi ohjelmointikohteeksi sekä ihmisille että tekoälylle. Insinöörit voivat kuvata työtä paikallisten tensorien, eksplisiittisen viestinnän ja ennakoitavan synkronoinnin avulla. Tekoäly voi tämän jälkeen optimoida, miten kyseinen työ kartoitetaan, sijoitetaan, ajoitetaan ja koordinoidaan koko järjestelmässä. Tämä selkeä ja ennakoitava rakenne tarjoaa tekoälylle hallittavan tavan ratkaista perinteisesti vaikean rinnakkaisohjelmoinnin ongelman.

Jokaisen uuden malliperheen tukeminen vaatii edelleen uusia ytimiä ja mallikohtaisia optimointeja. Käyttämällä Codexia GPT‑Astran kanssa tiimi sai kahdessa kuukaudessa korkeaan suorituskykyyn kolme avoimen painokertoimen mallia, jotka eivät kuuluneet Jalapeñon alkuperäiseen tuotantosuunnitelmaan. Tämä osoitti sekä arkkitehtuurin joustavuuden että sen, kuinka nopeasti tekoäly voi auttaa meitä ohjelmoimaan sitä. Valituissa GPT‑OSS:n attention- ja mixture-of-experts-lohkoissa tekoälyn tuottamat toteutukset toimivat 1,5–1,8 kertaa nopeammin kuin nykyiset ihmisasiantuntijoiden laatimat toteutukset. Nämä luvut koskevat valittuja lohkoja, eivät koko mallia, mutta ne viittaavat tehokkaaseen uuteen kehityssilmukkaan.

Polku kohti tehokasta, ultranopeaa päättelyä

Tekoälyinfrastruktuuri on arvokas siksi, että se mahdollistaa hyödyllistä käytännön työtä. Tuottamalla enemmän hyödyllistä työtä samalla teholla ja laitteistolla Jalapeño voi auttaa meitä vastaamaan suurempaan kysyntään ja alentamaan onnistuneen tuloksen tuottamisen kustannuksia. OpenAI:lle tämä voi parantaa toiminnallista vipuvaikutusta mahdollistamalla hyödyllisen työn ja liikevaihdon kasvun palvelukustannuksia nopeammin. Se voi myös tukea laajempaa käyttöönottoa ja jatkuvia investointeja parempiin malleihin, tuotteisiin ja infrastruktuuriin. Nopeampi päättely voi mahdollistaa nopeamman iteroinnin ja uusia käyttötapauksia.

Jalapeño laajentaa tehokkaan, matalan viiveen päättelyn mahdollisuuksia:

  • Ultra-nopean tilan tehokas päättely, joka oli aiemmin saatavilla vain nopeassa tilassa
  • Nopea tila -päättelyä tehokkuuksilla, jotka aiemmin olivat mahdollisia vain eräajotilassa
  • Parempi tehokkuus eräajotilan päättelyssä

Suunnittelemme aloittavamme Jalapeñon käyttöönoton OpenAI:n laskentainfrastruktuurissa vuoden loppuun mennessä. Se on usean sukupolven kattavan etenemissuunnitelman ensimmäinen sukupolvi: Gen 2:n kehitys on jo pitkällä, ja Gen 3 alkaa hahmottua. Jokainen sukupolvi rakentuu oppimamme varaan ja parantaa entisestään sekä tehokkuutta että nopeutta.

AI:n kasvavaan kysyntään vastaaminen edellyttää lisää laskentakapasiteettia kaikista saatavilla olevista lähteistä. Jatkamme NVIDIAn ja muiden kumppaneiden kiihdyttimien laajamittaista käyttöönottoa sekä koulutus- että päättelytyökuormissa. Tehtävämme on varmistaa, että yleinen tekoäly hyödyttää koko ihmiskuntaa.

Käyttöönottoa valmistellessamme jatkamme tuotantokelpoisuuden varmistamista, kypsytämme ohjelmistoa, valmistaudumme käyttämään Jalapeñoa laajassa mittakaavassa ja validoimme suorituskykyä useissa malleissa. Tähänastiset tulokset osoittavat, mikä on mahdollista, kun suunnittelemme koko järjestelmän yhdessä: nopeammin reagoiva, kyvykkäämpi ja agenttinen tekoäly, joka toimitetaan tehokkaammin yhä useammille ihmisille.

Lisäys

Jalapeño on edistynyt pareto GPT‑OSS 120B:ssa

Suoritusteho per kW edistynyt

InferenceX · GPT‑OSS‑120B · nimellinen 8k/1k · STP · paketin TDP: Jalapeño 700 W; GB200 1 200 W

Jalapeño on kärjessä kaikissa GPT‑OSS:n toimintapisteissä

HUIPPU- JA YHTENÄINEN SUORITUSTEHO

InferenceX · GPT‑OSS‑120B · nimellinen 8k/1k · STP · paketin TDP: Jalapeño 700 W; GB200 1 200 W

Korkeampi sekatyyppinen huippu-TPS / kW

≈1,9×

85 448 vs. 44 960 yhdistetty / kW

Alhaisempi päästä päähän -viive

≈1,7×

1,03 s vs. 1,80 s

Pienennä TBT:n vähimmäisarvoa

≈2,7×

0,69 vs. 1,87 ms (1 459 vs. 535 tok/s/käyttäjä)

Enemmän suoritustehoa aiemmalla TBT:llä

≈53,7×

22 935 vs. 427 sekoitettu / kW (535,28 tok/s/käyttäjä)

Jalapeño on edistynyt pareto DeepSeek R1 670B:ssa

SUORITUSTEHO per kW EDISTYNYT

InferenceX · DeepSeek R1 MXFP4 · nimellinen 8k/1k · STP · paketin TDP: Jalapeño 700 W; GB300 1,400 W

Jalapeño johtaa kaikissa DeepSeek R1:n toimintapisteissä

HUIPPU- JA YHTENÄINEN SUORITUSTEHO

InferenceX · DeepSeek R1 MXFP4 · nimellinen 8k/1k · STP · paketin TDP: Jalapeño 700 W; GB300 1,400 W

Korkeampi huippu yhdistetty TPS / kW

≈1,7×

19 641 vs. 11 781 yhdistetty / kW

Pienempi kokonaisviive

≈3,6×

1,65 s vs. 5,99 s

Pienennä TBT:n vähimmäisarvoa

≈4,1×

1,43 vs. 5,90 ms (700 vs. 169 tok/s/käyttäjä)

Enemmän suoritustehoa aiemmalla TBT:llä

≈104,3×

12 258 vs. 118 sekakuormitus / kW (nopeudella 169,41 tok/s/käyttäjä)

Jalapeño on edistynyt pareto Kimi K2.5 1T:ssa

Suoritusteho per kW edistynyt

InferenceX · Kimi K2.5 MXFP4 · nimellinen 8 000/1 000 · STP · paketin TDP: Jalapeño 700 W; GB300 1 400 W

Jalapeño johtaa kaikissa Kimi K2.5:n toimintapisteissä

HUIPPU- JA YHTENÄINEN SUORITUSTEHO

InferenceX · Kimi K2.5 MXFP4 · nimellinen 8 000/1 000 · STP · paketin TDP: Jalapeño 700 W; GB300 1 400 W

Korkeampi huippu yhdistetty TPS / kW

≈1,5×

18 195 vs. 11 862 yhdistetty / kW

Alhaisempi päästä päähän -viive

≈3,4×

1,56 s vs. 5,31 s

Pienennä TBT:n vähimmäisarvoa

≈3,8×

1,44 vs. 5,48 ms (694 vs. 182 tok/s/käyttäjä)

Enemmän suoritustehoa aiemmalla TBT:llä

≈56,1×

6 744 vs. 120 yhdistetty / kW (nopeudella 182,46 tok/s/käyttäjä)

Tekijä

OpenAI