Jalapeño-ի առաջին արդյունքները ցույց են տալիս առաջատար արագություն և արդյունավետություն ԱԲ-ում

OpenAI-ի առաջին պատվերով մշակված ինֆերենսի չիպը՝ Jalapeño-ն, ներկայացնելուց ի վեր մենք փորձարկում ենք չիպը և դրա շուրջ կառուցված համակարգը։ Արդյունքները ցույց են տալիս արտադրողականության զգալի առաջընթաց․ Jalapeño-ն կարող է հզորության յուրաքանչյուր միավորի հաշվով սպասարկել ավելի մեծ AI աշխատանքային բեռ՝ միաժամանակ պատասխաններն ավելի արագ վերադարձնելով։ Jalapeño-ն մեկ ճարտարապետությամբ ապահովում է և՛ ավելի Հզոր թողունակություն, և՛ ավելի ցածր հապաղում, մինչդեռ գործող ապարատային համակարգերը հաճախ ստիպված են փոխզիջում կատարել այս երկուսի միջև։
Հաճախորդների համար դա կարող է նշանակել ավելի արագ պատասխաններ, ավելի օպերատիվ գործակալներ և պահանջարկի աճին զուգահեռ ավելի հուսալի հասանելիություն։ Մեր առաքելությունն է՝ ապահովել, որ արհեստական բանականությունն օգտակար լինի ողջ մարդկությանը: Այս առաջընթացը կօգնի, որ աստիճանաբար ավելի կարողունակ արհեստական բանականությունը դառնա ֆինանսապես ավելի մատչելի և ավելի լայնորեն հասանելի։
OpenAI-ի մոդելները նույնպես արագացրել են Jalapeño-ի մշակումը։ Նախորդ սերնդի մոդելներն օգնեցին թիմին նախագծել և գործարկման բերել չիպը, մինչդեռ մեր նորագույն մոդելներն արագացնում են դրա օպտիմալացման և ծրագրավորման գործընթացը։ Jalapeño-ի արդյունավետությունը դրսևորվում է GPT‑OSS 120B, DeepSeek R1 և Kimi K2.5 1T մոդելների դեպքում՝ ցույց տալով, որ ճարտարապետությունն աշխատում է ինչպես OpenAI-ի ներսում, այնպես էլ դրանից դուրս մշակված մոդելների հետ։ Բոլոր երեք մոդելների դեպքում Jalapeño-ն առավելագույն թողունակության պայմաններում մեկ վատտի դիմաց կատարել է 1,5-ից 1,9 անգամ ավելի շատ AI աշխատանք և համեմատական համակարգերի համեմատ, ունեցել է 1,7-ից 3,6 անգամ ավելի ցածր ծայրից ծայր հապաղում։ Խիստ ինտերակտիվ աշխատանքային բեռնվածությունների համար այն ապահովել է 2,1-ից 4,1 անգամ ավելի հզոր կատարողականություն։
Jalapeño-ն նաև վկայում է ավելի լայն ամբողջական շերտային առավելության մասին։ OpenAI-ն կարող է համատեղ նախագծել մոդելներ, արտադրանքներ, սպասարկման ծրագրային ապահովում, չիպեր, հիշողություն, ցանցային ենթակառուցվածք և համակարգեր՝ իրական ծանրաբեռնվածություններից ստացված գիտելիքները օգտագործելով՝ շերտ առ շերտ բարելավելով ամբողջական համակարգը։ Jalapeño-ն գործող սեփական արտադրության սիլիցիումային չիպ է՝ չափված արդյունքներով, և այն բազմասերունդ հարթակի սկիզբն է։ Առաջիկա ամիսներին մենք կմեծացնենք Jalapeño-ի հզորությունը՝ մեր հաճախորդներին ավելի արագ, ավելի ունակ և ավելի արդյունավետ արտադրանքներ տրամադրելու համար։
Մենք կատարողականությունը գնահատում ենք համարժեք օգտվողի փորձառության պայմաններում՝ չափելով, թե յուրաքանչյուր համակարգ որքան օգտակար AI աշխատանք կարող է կատարել հզորության յուրաքանչյուր միավորի հաշվով՝ միաժամանակ ապահովելով ուշացման այն մակարդակը, որը պահանջում են հաճախորդներն ու ինտերակտիվ գործակալները։ Սա հատկապես կարևոր է գործակալների համար, որոնք պետք է հաջորդաբար կատարեն բազմաթիվ քայլեր, ուստի ուշացումները կարող են կուտակվել ամբողջ առաջադրանքի ընթացքում։
Հասկանալու համար, թե ինչպես է Jalapeño-ն գործում գործնականում, մենք այն փորձարկել ենք InferenceX-ի վրա՝ SemiAnalysis-ի հանրային չափանիշում, որը չափում է արհեստական բանականության հարցման սպասարկման ամբողջական գործընթացը։ Մենք համեմատեցինք Jalapeño-ն առևտրային հասանելի առաջատար արհեստական բանականության համակարգերի հետ՝ փորձարկված գործառնական ողջ տիրույթում՝ Հզոր թողունակությամբ սպասարկումից մինչև բարձր ինտերակտիվությամբ և ցածր հապաղմամբ օգտագործում։ Jalapeño-ն ապահովեց թողունակության, էներգաարդյունավետության և հապաղման ավելի լավ համադրություն։ Թեև արտադրողականությունը երբեմն ներկայացվում է մեկ չիպի հաշվով, մենք կարծում ենք, որ ավելի օգտակար չափանիշն է արտադրողականությունը մեկ էներգիայի միավորի հաշվով։
Բոլոր երեք հանրային մոդելներում Jalapeño-ն փորձարկված գործառնական տիրույթում ապահովել է մեկ վատտի հաշվով արդյունավետության և ուշացման ավելի լավ համադրություն՝ այն տեղադրելով Պարետոյի առաջադեմ սահմանագծին։ Համակարգերը հետևողականորեն համեմատելու համար մենք նորմավորեցինք արդյունքները՝ օգտագործելով յուրաքանչյուր արագացուցչի չիպի հզորության հրապարակված անվանական ցուցանիշը։ «Jalapeño»-ի անվանական հզորությունը 700 Վտ է, թեև փորձարկված աշխատանքային ծանրաբեռնվածությունների ժամանակ դրա չափված կայուն հզորությունը մնացել է 550 Վտ-ի մակարդակում կամ դրանից ցածր։
Jalapeño-ն հզոր կատարողականություն է ցուցաբերել GPT‑OSS 120B, DeepSeek R1 670B և Kimi K2.5 1T մոդելների դեպքում։ Kimi-ի՝ մեր փորձարկած ամենամեծ հանրային մոդելի դեպքում, այն ապահովել է մեկ վատտի հաշվով մոտ 1,5 անգամ ավելի հզոր գագաթնակետային կատարողականություն և համեմատական համակարգից 3,4 անգամ ավելի ցածր ծայրից ծայր ուշացում։ Մեր ներքին փորձարկումներում Jalapeño-ի առավելությունն ավելի է մեծացել առաջադեմ OpenAI մոդելների դեպքում, ինչը ենթադրում է, որ ճարտարապետությունն ավելի արժեքավոր է դառնում, քանի որ ծանրաբեռնվածություններն աճում և ավելի պահանջկոտ են դառնում։
Jalapeño-ն ի սկզբանե նախագծվել է հետևյալ հարցադրումով՝ ի՞նչ սարքավորում կկառուցեինք, եթե դրա հիմնական գործառույթը լիներ ժամանակակից և ապագա լեզվական մոդելների, հատկապես ինտերակտիվ ագենտների սպասարկումը։ Jalapeño-ի առավելությունները պայմանավորված են նրանով, որ չիպը, հիշողությունը, ցանցը, ծրագրային ապահովումը և դարակային մասշտաբի համակարգը միասին են նախագծվել՝ իրական լեզվական մոդելների աշխատանքային բեռների համար։ Լեզվական մոդելների ինֆերենսն անցնում է մի քանի հստակ փուլերով, որոնց սահմանափակող գործոնները տարբեր են։ Նախալցման փուլը, երբ համակարգը մշակում է հարցումը, հաշվարկային ռեսուրսատար է, մինչդեռ ապակոդավորման փուլը, երբ համակարգը գեներացնում է պատասխանը թոքեն առ թոքեն, ավելի շատ սահմանափակվում է հիշողության թողունակությամբ։ Հաղորդակցությունը կարող է նաև ուշացում ավելացնել, երբ տվյալները պետք է տեղափոխվեն միջուկների և չիպերի միջև՝ ստիպելով մշակման որոշ միավորների սպասելու ընթացքում մնալ անգործուն։ Մի փուլում գերազանցող համակարգը կարող է կորցնել այդ առավելությունը՝ տվյալներին սպասելիս կամ մոդելի վիճակը տարբեր ռեսուրսների միջև տեղափոխելիս։
Մենք նախագծել ենք Jalapeño-ն՝ տվյալների տեղաշարժը և հաղորդակցության ուշացումները նվազագույնի հասցնելու համար։ Սա նշանակում է, որ մոդելի վիճակը, ներառյալ պատասխանի ստեղծման ընթացքում օգտագործվող KV քեշը, կարող է հստակ տեղաբաշխվել և պահպանվել տեղում, մինչ համակարգը յուրաքանչյուր ինֆերենսի փուլի համար ակտիվացնում է հաշվարկային հզորության, հիշողության և ցանցային հնարավորությունների ճիշտ համադրությունը։ Ցանցը ճարտարապետության անբաժանելի մասն է։ Դրա մեծ տիրույթը թույլ է տալիս, որ ամբողջ աշխատանքային բեռը մնա մեկ կապակցված համակարգի ներսում՝ նվազագույնի հասցնելով տվյալների տեղափոխումը և օգնելով, որ ամբողջական հարցումը սկզբից մինչև վերջ մնա արագ ու արդյունավետ։ Արդյունքում ստացվում է հավասարակշռված և փոխարինելի արագացուցիչ, որը կարող է աջակցել մոդելների փոփոխվող ճարտարապետություններին, գերազանց գործել թե՛ նախալցման, թե՛ ապակոդավորման փուլերում և հարմարվել դրանց միջև հավասարակշռության փոփոխությանը, ինչը գործակալային ծանրաբեռնվածությունների բնորոշ հատկանիշն է։
Արհեստական բանականությունը անմիջական դեր է ունեցել Jalapeño-ի մշակման մեջ՝ հնարավորություն տալով թիմին ինը ամսում անցնել սկզբնական նախագծումից մինչև tapeout՝ ուսումնասիրելով կիրառման տարբերակները, կրճատելով նախագծման, չափման և ստուգման ցիկլերը և շարունակաբար կատարել մոդելների ծանրաբեռնվածությունների վերանայում։ Արհեստական բանականությունը նաև օգնեց օպտիմալացնել չիպի թվաբանական սխեմաները՝ թիմին հնարավորություն տալով պլանավորված ժամկետում չիպում ներառել ավելի մեծ հաշվողական կատարողականություն։
Jalapeño-ն նախագծվել է որպես հստակ և կանխատեսելի ծրագրավորման թիրախ՝ թե՛ մարդկանց, թե՛ արհեստական բանականության համար։ Ինժեներները կարող են նկարագրել աշխատանքը տեղային տենզորների, հստակ հաղորդակցության և կանխատեսելի համաժամացման միջոցով։ Այնուհետև AI-ը կարող է օպտիմալացնել, թե ինչպես է այդ աշխատանքը քարտեզագրվում, տեղաբաշխվում, պլանավորվում և համակարգվում ամբողջ համակարգում։ Այդ հստակ, կանխատեսելի կառուցվածքը արհեստական բանականությանը տալիս է գործնականում կառավարելի միջոց՝ լուծելու զուգահեռ ծրագրավորման ավանդաբար դժվար խնդիրը։
Յուրաքանչյուր նոր մոդելային ընտանիքի աջակցումը դեռ պահանջում է նոր միջուկներ և մոդելին հատուկ օպտիմալացումներ։ Codex-ը GPT‑Astra‑ի հետ օգտագործելով՝ թիմը երկու ամսում հզոր կատարողականության հասցրեց երեք բաց քաշի մոդելներ, որոնք Jalapeño-ի սկզբնական արտադրական պլանի մաս չէին։ Սա ցույց տվեց ինչպես ճարտարապետության ճկունությունը, այնպես էլ այն արագությունը, որով AI-ը կարող է օգնել մեզ ծրագրավորել այն։ GPT‑OSS‑ի ուշադրության և փորձագետների խառնուրդի ընտրված բլոկների համար ԱԻ-ով գեներացված իրականացումները 1,5-ից 1,8 անգամ ավելի արագ էին աշխատում, քան փորձագետ մարդկանց կողմից գրված առկա իրականացումները։ Այդ ցուցանիշները վերաբերում են ընտրված բլոկներին, ոչ թե ամբողջ մոդելին, սակայն դրանք մատնանշում են զարգացման հզոր նոր ցիկլ։
ԱԲ ենթակառուցվածքը արժեքավոր է, քանի որ հնարավորություն է տալիս իրական աշխարհում օգտակար աշխատանք կատարել։ Էներգիայի և սարքավորումների նույն ռեսուրսներով ավելի շատ օգտակար աշխատանք կատարելով՝ Jalapeño-ն կարող է օգնել մեզ սպասարկել ավելի մեծ պահանջարկ և նվազեցնել հաջող արդյունք ապահովելու ծախսը։ OpenAI-ի համար դա կարող է բարելավել գործառնական լծակավորումը՝ հնարավորություն տալով, որ օգտակար աշխատանքն ու եկամուտը աճեն ավելի արագ, քան սպասարկման ծախսերը։ Այն կարող է նաև նպաստել ավելի լայն ընդունմանը և շարունակական ներդրումներին ավելի լավ մոդելներում, արտադրանքներում և ենթակառուցվածքում։ Ավելի արագ հաշվարկը կարող է հնարավորություն տալ ավելի արագ կրկնությունների և նոր կիրառման դեպքերի։
Jalapeño-ն ընդլայնում է արդյունավետ, ցածր ուշացումով ինֆերենսի հնարավորի սահմանները։
- Ultra-արագ ռեժիմի ինֆերենս՝ նախկինում հասանելի միայն արագ ռեժիմի արդյունավետությամբ
- «Արագ ռեժիմ»-ով ինֆերենս՝ նախկինում միայն փաթեթային ռեժիմում հասանելի արդյունավետությամբ
- Ավելի հզոր Փաթեթային ռեժիմի ինֆերենսի արդյունավետություն
Մենք նախատեսում ենք մինչև տարեվերջ սկսել Jalapeño-ի տեղակայումը OpenAI-ի հաշվողական ենթակառուցվածքում։ Այն բազմասերունդ ճանապարհային քարտեզի առաջին սերունդն է։ 2-րդ սերունդն ինտենսիվ մշակման փուլում է, իսկ 3-րդ սերունդը ձևավորվում է։ Յուրաքանչյուր սերունդ կհիմնվի մեր սովորածի վրա և էլ ավելի կբարձրացնի թե՛ արդյունավետությունը, թե՛ արագությունը։
Արհեստական բանականության նկատմամբ աճող պահանջարկը բավարարելու համար անհրաժեշտ կլինի ավելի մեծ հաշվողական հզորություն՝ յուրաքանչյուր հասանելի աղբյուրից։ Մենք կշարունակենք լայնորեն տեղակայել NVIDIA-ի և այլ գործընկերների արագացուցիչները՝ ինչպես ուսուցման, այնպես էլ ինֆերանսի աշխատանքային ծանրաբեռնվածությունների համար։ Մեր առաքելությունն է՝ ապահովել, որ արհեստական բանականությունն օգտակար լինի ողջ մարդկությանը:
Տեղակայմանը պատրաստվելիս մենք շարունակում ենք արտադրական որակավորման գործընթացը, զարգացնում ենք ծրագրակազմը, նախապատրաստվում ենք Jalapeño-ի մասշտաբային շահագործմանը և ստուգում ենք կատարողականը ավելի շատ մոդելների շրջանակում։ Մինչ այժմ ստացված արդյունքները ցույց են տալիս, թե ինչ է հնարավոր, երբ ամբողջ համակարգը միասին ենք նախագծում։ Ավելի արագ արձագանքող, ավելի կարողունակ և գործուն ԱԲ, որն ավելի արդյունավետ է հասանելի դառնում ավելի շատ մարդկանց։
ԹՈՂՈՒՆԱԿՈՒԹՅՈՒՆ՝ մեկ կՎտ-ի հաշվով, ԱՌԱՋԱԴԵՄ
InferenceX · GPT‑OSS‑120B · անվանական 8k/1k · STP · փաթեթի TDP: Jalapeño 700 W; GB200 1200 W
Պիկային և համապատասխան թողունակություն
InferenceX · GPT‑OSS‑120B · անվանական 8k/1k · STP · փաթեթի TDP: Jalapeño 700 W; GB200 1,200 W
Ավելի հզոր գագաթնակետային խառը TPS / ԿՎտ
≈1,9×
85,448՝ 44,960-ի համեմատ՝ խառը / kW
Նվազագույն ծայրից ծայր ուշացում
≈1,7×
1,03 վրկ. ավելի արագ, քան 1,80 վրկ.
Նվազագույն TBT
≈2,7×
0,69՝ 1,87 մվ-ի դիմաց (1 459՝ 535 թոքեն/վ/օգտատեր-ի դիմաց)
Ավելի մեծ թողունակություն՝ նախորդ TBT-ի դեպքում
≈53,7×
22 935 vs. 427 խառը / կՎտ (535,28 թոք/վրկ/օգտատեր արագությամբ)
ԹՈՂՈՒՆԱԿՈՒԹՅՈՒՆ՝ մեկ կՎտ-ի հաշվով, ԱՌԱՋԱԴԵՄ
InferenceX · DeepSeek R1 MXFP4 · անվանական 8k/1k · STP · փաթեթի TDP: Jalapeño 700 W; GB300 1,400 W
Պիկային և համապատասխանեցված թողունակություն
InferenceX · DeepSeek R1 MXFP4 · անվանական 8k/1k · STP · փաթեթի TDP: Jalapeño 700 W; GB300 1,400 W
Ավելի հզոր գագաթնակետային խառը TPS / kW
≈1,7×
19 641 ընդդեմ 11 781 խառը / կՎտ
Ավելի ցածր ծայրից ծայր ուշացում
≈3,6×
1,65 վ ընդդեմ 5,99 վ
Նվազագույն TBT
≈4.1×
1.43՝ 5.90 մվ-ի համեմատ (700՝ 169 թոք/վրկ/օգտատերի համեմատ)
Ավելի մեծ թողունակություն՝ նախորդ TBT-ի դեպքում
≈104,3×
12 258 ընդդեմ 118 խառը / kW (169,41 tok/s/user-ի դեպքում)
ԹՈՂՈՒՆԱԿՈՒԹՅՈՒՆ՝ մեկ կՎտ-ի հաշվով, ԱՌԱՋԱԴԵՄ
InferenceX · Kimi K2.5 MXFP4 · անվանական 8k/1k · STP · փաթեթի TDP՝ Jalapeño 700 W; GB300 1,400 W
Պիկային և համապատասխանեցված թողունակություն
InferenceX · Kimi K2.5 MXFP4 · անվանական 8k/1k · STP · փաթեթի TDP՝ Jalapeño 700 W; GB300 1,400 W
Ավելի հզոր գագաթնակետային խառը TPS / kW
≈1.5×
18 195 և 11 862 թվերի համեմատ խառը / կՎտ
Ավելի ցածր ամբողջական հապաղում
≈3.4×
1,56 վրկ համեմատ 5,31 վրկ
Նվազագույն TBT
≈3,8×
1,44 մվրկ. և 5,48 մվրկ. (694 և 182 թոքեն/վրկ/օգտատեր)
Ավելի մեծ թողունակություն՝ նախորդ TBT-ի դեպքում
≈56.1×
6744 ընդդեմ 120 խառը / կՎտ (182,46 tok վրկ-ով մեկ օգտատերի դեպքում)


