
OpenAI-дың алғашқы арнайы инференс чипі Jalapeño-ны таныстырғалы бері біз чипті және оның негізінде жасалған жүйені сынақтан өткізіп келеміз. Нәтижелер өнімділіктің елеулі ілгерілеуін көрсетеді: Jalapeño қуат бірлігіне шаққанда көбірек AI жұмыс жүктемесін орындай алады, әрі жауаптарды жылдамырақ қайтарады. Қолданыстағы аппараттық жүйелер көбіне осы екеуінің арасында ымыраға келуге мәжбүр болса, Jalapeño бір архитектурада жоғарырақ өткізу қабілеті мен төменірек кідірісті қатар қамтамасыз етеді.
Клиенттер үшін бұл сұраныс артқан сайын жауаптардың жылдамырақ берілуін, агенттердің жеделірек әрекет етуін және қолжетімділіктің сенімдірек болуын білдіруі мүмкін. Біздің миссиямыз жалпы жасанды интеллекттің бүкіл адамзатқа пайда әкелуін қамтамасыз ету. Бұл жетістіктер барған сайын қабілеті артып келе жатқан жасанды интеллектіні анағұрлым арзан әрі кеңінен қолжетімді етуге көмектеседі.
OpenAI модельдері Jalapeño-ның дамуын да жеделдетті. Алдыңғы буындар командаға чипті жобалауға және іске қосуға көмектесті, ал ең жаңа модельдеріміз оны оңтайландыру мен бағдарламалауды жеделдетуде. Jalapeño GPT‑OSS 120B, DeepSeek R1 және Kimi K2.5 1T модельдерінде де өнімділік көрсетіп, архитектураның OpenAI ішінде де, одан тыс жерде де әзірленген модельдермен жұмыс істейтінін дәлелдейді. Үш модельдің барлығында Jalapeño өткізу қабілеті ең жоғары болғанда бір ваттқа шаққанда 1,5-тен 1,9-ға дейін көбірек ЖИ жұмысын орындады және салыстырмалы жүйелерге қарағанда басынан аяғына дейінгі кідірісі 1,7-ден 3,6-ға дейін төмен болды. Өзара әрекеттесуі жоғары жүктемелерде ол 2,1–4,1 есе жоғары өнімділік көрсетті.
Jalapeño кеңірек толық стек бойынша артықшылықтың дәлелі болып табылады. OpenAI модельдерді, өнімдерді, қызмет көрсетуге арналған бағдарламалық жасақтаманы, чиптерді, жадты, желіні және жүйелерді бірге жобалай алады әрі нақты жұмыс жүктемелерінен үйренгенімізді стектің әрбір қабатын жақсартуға пайдалана алады. Jalapeño — өлшенген нәтижелері бар өзіміздің әзірлеген кремний және көп буынды платформаның бастауы. Алдағы айларда біз клиенттерімізге жылдамырақ, мүмкіндіктері кеңірек және тиімдірек өнімдерді ұсыну үшін Jalapeño-ны қарқынды түрде дамытамыз.
Біз өнімділікті бірдей пайдаланушы тәжірибесі жағдайында бағалаймыз: әрбір жүйе тұтынушылар мен интерактивті агенттер талап ететін кідіріс деңгейін сақтай отырып, қуат бірлігіне шаққанда қаншалықты пайдалы жасанды интеллект жұмысын орындай алатынын өлшейміз. Бұл әсіресе көптеген қадамдарды рет-ретімен орындауы қажет агенттер үшін маңызды, өйткені кідірістер бүкіл тапсырма бойында жиналып, ұлғая түсуі мүмкін.
Jalapeño-ның іс жүзінде қалай жұмыс істейтінін түсіну үшін біз оны SemiAnalysis ұсынған InferenceX — ЖИ сұрауын өңдеу мен жауап берудің толық процесін өлшейтін ашық бенчмарк арқылы сынақтан өткіздік. Jalapeño-ны сынақтан өткен жұмыс ауқымы бойынша — өткізу қабілеті жоғары қызмет көрсетуден бастап интерактивтілігі жоғары, кідірісі төмен пайдалануға дейін — нарықтағы жетекші жасанды интеллект жүйелерімен салыстырдық. Jalapeño өткізу қабілеті, қуат тиімділігі және кідіріс жағынан жақсы үйлесім көрсетті. Кейде өнімділік бір чипке шаққанда көрсетілсе де, біздің ойымызша, өнімділікті қуат бірлігіне шаққандағы стандарт әлдеқайда пайдалы.
Үш ашық модельдің барлығында Jalapeño сынақтан өткен жұмыс істеу ауқымы бойынша ваттқа шаққандағы өнімділік пен кідірістің жақсы үйлесімін көрсетті де, Парето озық шебіне енді. Жүйелерді бірізді түрде салыстыру үшін біз нәтижелерді әрбір жылдамдатқыштың жарияланған чип қуатының номиналды көрсеткіші бойынша қалыпқа келтірдік. Jalapeño құрылғысының номиналды қуаты 700 ватт деп көрсетілген, алайда сыналған жұмыс жүктемелерінде оның өлшенген тұрақты қуаты 550 ватт деңгейінде немесе одан төмен болды.
Jalapeño GPT‑OSS 120B, DeepSeek R1 670B және Kimi K2.5 1T модельдерінде жоғары нәтиже көрсетті. Біз сынаған ең ірі ашық модель — Kimi-де ол салыстыру жүйесімен салыстырғанда ваттқа шаққандағы ең жоғары өнімділікті шамамен 1,5 есе арттырып, басынан аяғына дейінгі кідірісті 3,4 есе азайтты. Ішкі сынақтарымызда Jalapeño-ның артықшылығы OpenAI-дың озық модельдерінде одан әрі айқындала түсті, бұл жұмыс жүктемелері ұлғайып, талаптары артқан сайын архитектураның құндылығы да өсетінін көрсетеді.
Jalapeño ең басынан-ақ мына сұраққа сүйене отырып жобаланды: егер оның негізгі міндеті заманауи және болашақтағы тілдік модельдерге, әсіресе интерактивті агенттерге қызмет көрсету болса, біз қандай аппараттық құрал жасар едік? Jalapeño-ның артықшылықтары чипті, жадты, желіні, бағдарламалық жасақтаманы және серверлік сөре ауқымындағы жүйені нақты тілдік модель жүктемелеріне сай бірге жобалаудан туындайды. Тілдік модель инференсі әртүрлі тар орындары бар бірнеше бөлек кезеңнен өтеді. Жүйе көмексөзді өңдейтін алдын ала толтыру (prefill) кезеңі есептеу ресурстарын көп қажет етеді, ал жүйе жауапты токен бойынша жасайтын декодтау (decode) кезеңі жад өткізу қабілетіне көбірек тәуелді. Деректер ядролар мен чиптер арасында тасымалдануы қажет болғанда, байланыс та кідірісті арттыруы мүмкін, өйткені кейбір өңдеу блоктары күту кезінде бос тұрып қалады. Бір кезеңде үздік нәтиже көрсететін жүйе деректерді күту немесе модель күйін әртүрлі ресурстар арасында тасымалдау кезінде сол артықшылықтан айырылып қалуы мүмкін.
Біз Jalapeño-ны деректерді тасымалдауды және байланыс кідірістерін барынша азайту үшін әзірледік. Бұл жауапты жасау кезінде пайдаланылатын KV кэшін қоса алғанда, модель күйін нақты орналастырып, жергілікті жерде сақтауға болатынын білдіреді; осы ретте жүйе инференстің әр кезеңі үшін есептеу ресурстарының, жадтың және желінің дұрыс үйлесімін іске қосады. Желі архитектураның ажырамас бөлігі болып табылады. Оның ауқымды домені бүкіл жұмыс жүктемесінің бір байланысқан жүйе ішінде қалуына мүмкіндік береді, деректердің жылжуын барынша азайтып, толық сұраудың басынан аяғына дейін жылдам әрі тиімді болып қалуына көмектеседі. Нәтижесінде өзгеріп отыратын модель архитектураларын қолдай алатын, алдын ала толтыруда да, декодтауда да үздік жұмыс істейтін және агенттерге негізделген жұмыс жүктемелеріне тән осы екеуінің арасындағы тепе-теңдік өзгерген сайын бейімделетін теңгерімді әрі өзара алмастырылатын үдеткіш алынады.
Жасанды интеллект Jalapeño-ны әзірлеуде тікелей рөл атқарып, іске асыру нұсқаларын зерттеу, жобалау, өлшеу және тексеру циклдерін қысқартып, модель жүктемелерін үздіксіз жетілдіру арқылы командаға бастапқы жобалаудан «tapeout» кезеңіне дейін тоғыз айда жетуге мүмкіндік берді. Жасанды интеллект чиптің арифметикалық схемаларын оңтайландыруға да көмектесіп, командаға белгіленген мерзімде чипке көбірек есептеу өнімділігін сыйғызуға мүмкіндік берді.
Jalapeño адамдарға да, ЖИ-ге де түсінікті әрі болжамды бағдарламалау нысанасы ретінде жасалған. Инженерлер жұмысты жергілікті тензорлар, айқын коммуникация және болжамды синхрондау арқылы сипаттай алады. Содан кейін ЖИ бұл жұмыстың бүкіл жүйе бойынша ресурстарға қалай тағайындалатынын, орналастырылатынын, жоспарланатынын және үйлестірілетінін оңтайландыра алады. Осындай айқын әрі болжамды құрылым ЖИ-ге дәстүрлі түрде қиын саналатын параллель бағдарламалау мәселесін шешудің қолжетімді жолын ұсынады.
Әрбір жаңа модель топтамасын қолдау үшін әлі де жаңа ядролар мен модельге тән оңтайландырулар қажет. Codex-ті GPT‑Astra‑мен бірге пайдалана отырып, команда Jalapeño-ның бастапқы өндірістік жоспарына кірмеген үш ашық салмақты модельді екі ай ішінде жоғары өнімділік деңгейіне жеткізді. Бұл архитектураның икемділігін де, жасанды интеллекттің оны қаншалықты жылдам бағдарламалауға көмектесе алатынын да көрсетті. GPT‑OSS‑тің таңдалған назар аудару және сарапшылар қоспасы блоктарында жасанды интеллект жасаған іске асырулар адам-сарапшылар жазған қолданыстағы іске асыруларға қарағанда 1,5-тен 1,8 есеге дейін жылдамырақ жұмыс істеді. Бұл көрсеткіштер толық модельге емес, таңдалған блоктарға қатысты, бірақ олар қуатты жаңа әзірлеу цикліне жол ашады.
Жасанды интеллект инфрақұрылымы құнды, өйткені ол нақты өмірде пайдалы жұмыстарды орындауға мүмкіндік береді. Сол қуат пен аппараттық құралдарды пайдалана отырып, Jalapeño көбірек пайдалы жұмыс жасап, бізге сұранысты көбірек қанағаттандыруға және сәтті нәтижеге қол жеткізу құнын төмендетуге көмектеседі. OpenAI үшін бұл пайдалы жұмыс пен кірістің қызмет көрсету шығынынан жылдамырақ өсуіне мүмкіндік беріп, операциялық тиімділікті арттыра алады. Бұл сонымен қатар қолданылу аясын кеңейтуге және жақсырақ модельдерге, өнімдерге және инфрақұрылымға инвестицияны жалғастыруға ықпал етеді. Жылдам болжам жасау жылдамырақ қайталауға және жаңа пайдалану жағдайларын іске асыруға мүмкіндік береді.
Jalapeño тиімді әрі кідірісі төмен инференс үшін мүмкіндіктер аясын кеңейтеді:
- Бұған дейін тек жылдам режимде қолжетімді болған тиімділік деңгейіндегі аса жылдам режим инференсі
- Бұрын тек пакеттік режимде ғана қолжетімді болған тиімділік деңгейінде жылдам режимде болжам жасау
- Топтамалық режимде инференстің тиімділігі жоғары
Jalapeño-ны жыл соңына дейін OpenAI-дың есептеу инфрақұрылымында енгізуді бастауды жоспарлап отырмыз. Бұл — бірнеше буынды қамтитын жол картасының алғашқы буыны: 2-ші буын әзірлеудің белсенді кезеңінде, ал 3-ші буын қалыптасып келеді. Әр буын үйренгенімізге сүйеніп, тиімділік пен жылдамдықты одан әрі арттыра түседі.
Жасанды интеллектке өсіп келе жатқан сұранысты қанағаттандыру үшін қолжетімді әрбір көзден көбірек есептеу қуаты қажет болады. Біз оқыту және болжам жасау жұмыс жүктемелері үшін NVIDIA және басқа серіктестердің жеделдеткіштерін кеңінен енгізуді жалғастырамыз. Біздің миссиямыз жалпы жасанды интеллекттің бүкіл адамзатқа пайда әкелуін қамтамасыз ету.
Өрістетуге дайындала отырып, біз өндірістік біліктілікті растауды жалғастырып, бағдарламалық жасақтаманы жетілдіріп, Jalapeño-ны ауқымды түрде пайдалануға дайындалып, көбірек модельдердегі өнімділікті тексеріп жатырмыз. Осы уақытқа дейінгі нәтижелер толық жүйені бірге жобалағанда не мүмкін болатынын көрсетеді: анағұрлым жедел, қабілетті және агенттік ЖИ көбірек адамға тиімдірек жеткізіледі.
кВт-қа шаққандағы ОЗЫҚ ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · GPT‑OSS‑120B · номиналды 8k/1k · STP · пакеттің TDP мәні: Jalapeño — 700 Вт; GB200 — 1 200 Вт
ЕҢ ЖОҒАРЫ ЖӘНЕ СӘЙКЕСТЕНДІРІЛГЕН ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · GPT‑OSS‑120B · номиналды 8k/1k · STP · пакеттің TDP мәні: Jalapeño — 700 Вт; GB200 — 1 200 Вт
Аралас жүктемедегі ең жоғары TPS/кВт көрсеткіші жоғарырақ
≈1,9 есе
85 448 және 44 960 аралас TPS/кВт
Толық тізбектің кідірісі аз
≈1,7 есе
1,03 с және 1,80 с
Минималды TBT мәні төменірек
≈2,7 есе
0,69 және 1,87 мс (бір пайдаланушыға 1 459 және 535 токен/с)
Алдыңғы TBT деңгейінде жоғары өткізу қабілеті
≈53,7 есе
22 935 және 427 аралас / кВт (Бір пайдаланушыға 535,28 токен/с)
кВт-қа шаққандағы ОЗЫҚ ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · DeepSeek R1 MXFP4 · номиналды 8k/1k · STP · пакет TDP: Jalapeño 700 Вт; GB300 1 400 Вт
ЕҢ ЖОҒАРЫ ЖӘНЕ СӘЙКЕСТЕНДІРІЛГЕН ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · DeepSeek R1 MXFP4 · номиналды 8k/1k · STP · пакет TDP: Jalapeño 700 Вт; GB300 1 400 Вт
Аралас жүктемедегі ең жоғары TPS/кВт көрсеткіші жоғарырақ
≈1,7 есе
19 641 және 11 781 аралас / кВт
Толық тізбектің кідірісі аз
≈3,6 есе
1,65 с пен 5,99 с
Минималды TBT мәні төменірек
≈4,1 есе
1,43 және 5,90 мс (бір пайдаланушыға 700 және 169 токен/с)
Алдыңғы TBT деңгейінде жоғары өткізу қабілеті
≈104,3 есе
12 258 және 118 аралас / кВт (пайдаланушыға 169,41 токен/с кезінде)
кВт-қа шаққандағы ОЗЫҚ ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · Kimi K2.5 MXFP4 · номиналды 8k/1k · STP · пакеттің TDP мәні: Jalapeño — 700 Вт; GB300 — 1 400 Вт
ЕҢ ЖОҒАРЫ ЖӘНЕ СӘЙКЕСТЕНДІРІЛГЕН ӨТКІЗУ ҚАБІЛЕТІ
InferenceX · Kimi K2.5 MXFP4 · номиналды 8k/1k · STP · пакеттің TDP мәні: Jalapeño — 700 Вт; GB300 — 1 400 Вт
Аралас жүктемедегі ең жоғары TPS/кВт көрсеткіші жоғарырақ
≈1,5 есе
18 195 пен 11 862 аралас / кВт
Толық тізбектің кідірісі аз
≈3,4 есе
1,56 с және 5,31 с
Минималды TBT мәні төменірек
≈3,8 есе
1,44 және 5,48 мс (бір пайдаланушыға 694 және 182 токен/с)
Алдыңғы TBT деңгейінде жоғары өткізу қабілеті
≈56,1 есе
6 744 қарсы 120 аралас / кВт (182,46 токен/с/пайдаланушы кезінде)


