გადადით მთავარ შინაარსზე
OpenAI

Jalapeño-ის პირველადი შედეგები AI ინფერენსში ინდუსტრიაში წამყვან სიჩქარესა და ეფექტიანობას აჩვენებს

იტვირთება…
Jalapeño-ს ინფერენსის ჩიპის ახლო ხედი, რომელიც დამონტაჟებულია მომწვანო-ლურჯ ბეჭდურ პლატაზე.

მას შემდეგ, რაც გამოვაცხადეთ Jalapeño, OpenAI-ის პირველი მორგებული ინფერენსის ჩიპი, ვტესტავთ ჩიპსა და მის გარშემო შექმნილ სისტემას. შედეგები აჩვენებენ წარმადობის მნიშვნელოვან გაუმჯობესებას: Jalapeño-ს შეუძლია სიმძლავრის ერთეულზე მეტი AI სამუშაოს შესრულება და ამავდროულად პასუხების უფრო სწრაფად დაბრუნება. Jalapeño ერთი არქიტექტურით უზრუნველყოფს როგორც უფრო მაღალ მწარმოებლურობას, ისე ნაკლებ შეყოვნებას, მაშინ როდესაც არსებულ აპარატურულ სისტემებს ხშირად ამ ორს შორის კომპრომისზე წასვლა უწევთ.

მომხმარებლებისთვის ეს შეიძლება ნიშნავდეს უფრო სწრაფ პასუხებს, უფრო ოპერატიულ აგენტებს და მოთხოვნის ზრდასთან ერთად უფრო საიმედო წვდომას. ჩვენი მისიაა უზრუნველვყოთ, რომ ზოგადმა ხელოვნურმა ინტელექტმა სარგებელი მოუტანოს მთელ კაცობრიობას. ეს მიღწევები ხელს შეუწყობს, რომ ხელოვნური ინტელექტი, რომელიც სულ უფრო მეტი შესაძლებლობით გამოირჩევა, ფინანსურად უფრო ხელმისაწვდომი და ფართოდ გავრცელებული გახდეს.

OpenAI-ს მოდელებმა ასევე დააჩქარეს Jalapeño-ს შემუშავება. ადრინდელი თაობები გუნდს ჩიპის დაპროექტებასა და ამუშავებაში დაეხმარა, ხოლო ჩვენი უახლესი მოდელები აჩქარებს მის ოპტიმიზაციასა და პროგრამირებას. Jalapeño-ს წარმადობა ვრცელდება GPT‑OSS 120B, DeepSeek R1 და Kimi K2.5 1T მოდელებზე, რაც აჩვენებს, რომ არქიტექტურა მუშაობს როგორც OpenAI-ში, ისე მის გარეთ შემუშავებულ მოდელებთან. სამივე შემთხვევაში, Jalapeño-მ პიკური მწარმოებლურობის დროს ვატზე 1,5-დან 1,9-ჯერ მეტი AI-სამუშაო შეასრულა და შედარებით სისტემებთან შედარებით მთლიანი შეყოვნება 1,7-დან 3,6-ჯერ ნაკლები იყო. მაღალი ინტერაქტიულობის მქონე დატვირთვებისთვის მან 2,1-დან 4,1-ჯერ უფრო მაღალი წარმადობა უზრუნველყო.

Jalapeño ასევე წარმოადგენს სრულ-სტექიანი უპირატესობის დასტურს. OpenAI-ს შეუძლია ერთად დააპროექტოს მოდელები, პროდუქტები, მომსახურების პროგრამული უზრუნველყოფა, ჩიპები, მეხსიერება, ქსელები და სისტემები, რეალური სამუშაო დატვირთვებიდან მიღებული ცოდნის გამოყენებით, რათა სტეკის თითოეული შრე გააუმჯობესოს. Jalapeño არის საკუთარი წარმოების სილიკონი, რომელიც მუშაობს გაზომილი შედეგებით და წარმოადგენს მრავალთაობიანი პლატფორმის დასაწყისს. მომდევნო თვეებში ჩვენ Jalapeño-ს განვითარებას დავაჩქარებთ, რათა ჩვენს მომხმარებლებს უფრო სწრაფი, უფრო მძლავრი და უფრო ეფექტიანი პროდუქტები მივაწოდოთ.

როგორ გავზომეთ Jalapeño-ს წარმადობა

ჩვენ ვაფასებთ წარმადობას შესაბამისი მომხმარებლის გამოცდილების პირობებში და ვზომავთ, რამდენი სასარგებლო AI სამუშაოს შესრულება შეუძლია თითოეულ სისტემას სიმძლავრის ერთეულზე, იმ დაყოვნების მოთხოვნების დაკმაყოფილებისას, რომლებიც მომხმარებლებსა და ინტერაქტიულ აგენტებს სჭირდებათ. ეს განსაკუთრებით მნიშვნელოვანია აგენტებისთვის, რომლებსაც მრავალი ნაბიჯის თანმიმდევრულად შესრულება სჭირდებათ, ამიტომ დაყოვნებები შეიძლება მთელი ამოცანის განმავლობაში დაგროვდეს.

იმის გასაგებად, თუ როგორ მუშაობს Jalapeño პრაქტიკაში, ის გამოვცადეთ InferenceX-ზე, SemiAnalysis-ის საჯარო ბენჩმარკზე, რომელიც AI-მოთხოვნის მომსახურების სრულ პროცესს ზომავს. Jalapeño შევადარეთ წამყვან კომერციულად ხელმისაწვდომ AI-სისტემებს გამოცდილი ოპერაციული დიაპაზონის მასშტაბით — მაღალი მწარმოებლურობის მომსახურებიდან მაღალინტერაქციული, დაბალი შეყოვნების გამოყენებამდე. Jalapeño-მ უზრუნველყო მწარმოებლურობის, ენერგოეფექტიანობისა და შეყოვნების უკეთესი კომბინაცია. მიუხედავად იმისა, რომ წარმადობას ზოგჯერ თითო ჩიპზე ანგარიშობენ, მიგვაჩნია, რომ უფრო სასარგებლო საზომია წარმადობა სიმძლავრის ერთეულზე.

Jalapeño წინა საუკეთესო TBT-სთან შედარებით უპირატესობას ზრდის

Jalapeño თითო მომხმარებელზე მეტ ტოკენს უზრუნველყოფს

Jalapeño თითო კილოვატზე მეტ მწარმოებლურობას უზრუნველყოფს

სამივე საჯარო მოდელის ფარგლებში Jalapeño-მ ტესტირებული სამუშაო დიაპაზონის მასშტაბით ერთ ვატზე წარმადობისა და დაყოვნების უკეთესი კომბინაცია აჩვენა, რითაც პარეტოს მოწინავე ზღვარზე მოექცა. სისტემების თანმიმდევრულად შესადარებლად, შედეგების ნორმალიზაცია მოვახდინეთ თითოეული ამაჩქარებლისთვის გამოქვეყნებული ჩიპის ნომინალური სიმძლავრის მაჩვენებლის გამოყენებით. Jalapeño-ს ნომინალური სიმძლავრე 700 ვატია, თუმცა გამოცდილი დატვირთვებისას მისი გაზომილი უწყვეტი სიმძლავრე 550 ვატზე ან მის ქვემოთ დარჩა.

Jalapeño-მ მაღალი წარმადობა აჩვენა GPT‑OSS 120B-ზე, DeepSeek R1 670B-ზე და Kimi K2.5 1T-ზე. Kimi-ზე, ყველაზე დიდ საჯაროდ ხელმისაწვდომ მოდელზე, რომელიც გამოვცადეთ, მან შედარების სისტემასთან შედარებით ერთ ვატზე დაახლოებით 1,5-ჯერ უფრო მაღალი პიკური წარმადობა და სრულ ციკლში 3,4-ჯერ ნაკლები დაყოვნება უზრუნველყო. ჩვენს შიდა ტესტირებაში Jalapeño-ს უპირატესობა მოწინავე OpenAI-ის მოდელებზე კიდევ უფრო გაიზარდა, რაც მიუთითებს, რომ არქიტექტურა უფრო ღირებული ხდება, რადგან დატვირთვები იზრდება და უფრო მოთხოვნადი ხდება.

არქიტექტურის შექმნა სისწრაფისა და ეფექტიანობისთვის ერთ ჩიპში

Jalapeño თავიდანვე შეიქმნა ამ კითხვით: რა აპარატურას ავაგებდით, თუ მისი მთავარი დანიშნულება თანამედროვე და მომავალი ენობრივი მოდელების, განსაკუთრებით ინტერაქციული აგენტების, მომსახურება იქნებოდა? Jalapeño-ს უპირატესობები განპირობებულია ჩიპის, მეხსიერების, ქსელის, პროგრამული უზრუნველყოფისა და რექ-მასშტაბიანი სისტემის ერთობლივად დაპროექტებით რეალური ენობრივი მოდელების სამუშაო დატვირთვების გათვალისწინებით. ენობრივი მოდელების ინფერენსი რამდენიმე განსხვავებულ ფაზას მოიცავს, რომლებსაც სხვადასხვა შემზღუდავი ფაქტორი აქვს. ავტომატურად შევსება, როდესაც სისტემა მოთხოვნას ამუშავებს, გამოთვლით რესურსებს ინტენსიურად მოიხმარს, ხოლო დეკოდირება, როდესაც სისტემა პასუხს ტოკენ-ტოკენ წარმოქმნის, უფრო მეტად მეხსიერების გამტარუნარიანობით არის შეზღუდული. კომუნიკაციამ ასევე შეიძლება გაზარდოს დაყოვნება, როდესაც მონაცემებმა ბირთვებსა და ჩიპებს შორის უნდა იმოძრაოს, რის შედეგადაც ზოგიერთი დამუშავების ერთეული ლოდინისას უმოქმედოდ რჩება. სისტემამ, რომელიც ერთ ეტაპზე განსაკუთრებულად ეფექტიანია, შეიძლება ეს უპირატესობა დაკარგოს მონაცემების მოლოდინისას ან სხვადასხვა რესურსს შორის მოდელის მდგომარეობის გადატანისას.

Jalapeño ისე დავაპროექტეთ, რომ მონაცემთა გადაადგილება და კომუნიკაციის შეფერხებები მინიმუმამდე შემცირდეს. ეს ნიშნავს, რომ მოდელის მდგომარეობა, მათ შორის პასუხის გენერირებისას გამოყენებული KV-ქეში, შეიძლება მკაფიოდ განთავსდეს და ლოკალურად დარჩეს, მაშინ როცა სისტემა ინფერენსის თითოეული ფაზისთვის ააქტიურებს გამოთვლითი სიმძლავრის, მეხსიერებისა და ქსელის სწორ კომბინაციას. ქსელი არქიტექტურის განუყოფელი ნაწილია. მისი დიდი დომენი საშუალებას იძლევა, რომ მთელი სამუშაო დატვირთვა დარჩეს ერთ დაკავშირებულ სისტემაში, რაც ამცირებს მონაცემთა გადაადგილებას და ეხმარება სრულ მოთხოვნას, თავიდან ბოლომდე სწრაფი და ეფექტიანი დარჩეს. შედეგად ვიღებთ დაბალანსებულ და ურთიერთჩანაცვლებად ამაჩქარებელს, რომელსაც შეუძლია მხარი დაუჭიროს ცვალებად მოდელის არქიტექტურებს, გამორჩეული იყოს როგორც პრეფილის, ისე დეკოდირების პროცესებში და მოერგოს მათ შორის ბალანსის ცვლილებას — აგენტური სამუშაო დატვირთვების განმსაზღვრელ მახასიათებელს.

ჩიპის დასაპროექტებლად ხელოვნური ინტელექტი გამოვიყენეთ და ჩიპი ისე დავაპროექტეთ, რომ ხელოვნურ ინტელექტს მისი დაპროგრამება შეეძლოს

AI-მ პირდაპირი როლი შეასრულა Jalapeño-ს განვითარებაში, რაც გუნდს საშუალება მისცა, დანერგვის ვარიანტების შესწავლით, პროექტირების, გაზომვისა და შემოწმების ციკლების შემოკლებითა და მოდელის სამუშაო დატვირთვებზე უწყვეტი იტერაციით, საწყისი პროექტირებიდან წარმოებაში გაშვების ეტაპზე ცხრა თვეში გადასულიყო. AI-მ ასევე ხელი შეუწყო ჩიპის არითმეტიკული სქემების ოპტიმიზაციას, რაც გუნდს საშუალებას აძლევდა დაგეგმილ ვადებში ჩიპში მეტი გამოთვლითი წარმადობა მოეთავსებინა.

Jalapeño შეიქმნა როგორც მკაფიო და პროგნოზირებადი პროგრამირების სამიზნე, როგორც ადამიანებისთვის, ისე ხელოვნური ინტელექტისთვის. ინჟინრებს შეუძლიათ სამუშაოს აღწერა ლოკალური ტენზორების, მკაფიო კომუნიკაციისა და პროგნოზირებადი სინქრონიზაციის მეშვეობით. შემდეგ AI-ს შეუძლია მოახდინოს იმის ოპტიმიზაცია, თუ როგორ ხდება ამ სამუშაოს ასახვა, განთავსება, დაგეგმვა და კოორდინაცია მთელ სისტემაში. ეს მკაფიო, პროგნოზირებადი სტრუქტურა ხელოვნურ ინტელექტს აძლევს პრაქტიკულად მართვად გზას, რომ გაუმკლავდეს პარალელური პროგრამირების ტრადიციულად რთულ პრობლემას.

თითოეული ახალი მოდელების ოჯახის მხარდაჭერა კვლავ მოითხოვს ახალ ბირთვებსა და მოდელისთვის სპეციფიკურ ოპტიმიზაციებს. Codex-ის GPT‑Astra‑სთან გამოყენებით, გუნდმა Jalapeño-ს თავდაპირველ წარმოების გეგმაში არშემავალი სამი ღია წონებიანი მოდელი ორ თვეში მაღალი წარმადობის დონემდე მიიყვანა. ამან წარმოაჩინა როგორც არქიტექტურის მოქნილობა, ასევე ის სისწრაფე, რომლითაც ხელოვნურ ინტელექტს შეუძლია დაგვეხმაროს მის პროგრამირებაში. არჩეული GPT‑OSS‑ის ყურადღებისა და ექსპერტთა ბლოკების ნარევისთვის, AI-ის მიერ გენერირებული იმპლემენტაციები 1,5-დან 1,8-ჯერ სწრაფად მუშაობდა არსებულ, ადამიანი ექსპერტების მიერ დაწერილ იმპლემენტაციებთან შედარებით. ეს მაჩვენებლები შერჩეულ ბლოკებს ეხება და არა სრულ მოდელს, თუმცა ისინი განვითარების მძლავრ ახალ ციკლზე მიუთითებენ.

ეფექტიანი და ულტრა სწრაფი ინფერენსის გზა

ხელოვნური ინტელექტის ინფრასტრუქტურა ღირებულია, რადგან ის შესაძლებელს ხდის სასარგებლო რეალური სამუშაოს შესრულებას. იმავე ენერგიისა და აპარატურის გამოყენებით, უფრო მეტი სასარგებლო სამუშაოს შესრულებით, Jalapeño დაგვეხმარება მეტი მოთხოვნის დაკმაყოფილებაში და წარმატებული შედეგის მიწოდების ღირებულების შემცირებაში. OpenAI-სთვის ეს შეიძლება საოპერაციო სარგებლის გაუმჯობესების საშუალება იყოს, რადგან შესაძლებელი ხდება სასარგებლო სამუშაოსა და შემოსავალს მომსახურების ხარჯზე უფრო სწრაფად ზრდა. ამას ასევე შეუძლია ხელი შეუწყოს უფრო ფართო დანერგვასა და უკეთეს მოდელებში, პროდუქტებსა და ინფრასტრუქტურაში ინვესტირების გაგრძელებას. უფრო სწრაფი გამოთვლა შეიძლება გახდეს უფრო სწრაფი იტერაციისა და ახალი გამოყენების შემთხვევების შესაძლებლობა.

Jalapeño აფართოებს ეფექტური, დაბალი დაყოვნების მქონე ინფერენსის შესაძლებლობებს:

  • ულტრა-სწრაფი რეჟიმის ინფერენსი იმ ეფექტიანობით, რომელიც ადრე მხოლოდ სწრაფ რეჟიმში იყო ხელმისაწვდომი
  • სწრაფი რეჟიმით გამოთვლა იმ ეფექტიანობით, რომელიც ადრე მხოლოდ ჯგუფურ რეჟიმში იყო ხელმისაწვდომი
  • მაღალი ეფექტიანობა პაკეტური რეჟიმის ინფერენსისთვის

ვგეგმავთ, რომ წლის ბოლომდე OpenAI-ის გამოთვლით ინფრასტრუქტურაში დავიწყოთ Jalapeño-ს დანერგვა. ეს მრავალთაობიანი საგზაო რუკის პირველი თაობაა: მეორე თაობა განვითარების შორს წასულ ეტაპზეა, ხოლო მესამე თაობა ფორმირების პროცესშია. ყოველი თაობა დაეფუძნება ჩვენს მიღებულ ცოდნას და კიდევ უფრო გააუმჯობესებს როგორც ეფექტიანობას, ისე სიჩქარეს.

AI-ზე მზარდი მოთხოვნის დაკმაყოფილება მოითხოვს მეტ გამოთვლით რესურსს ყველა ხელმისაწვდომი წყაროდან. ჩვენ გავაგრძელებთ NVIDIA-სა და სხვა პარტნიორების ამაჩქარებლების ფართო დანერგვას როგორც მოდელების გაწვრთნაში, ისე ინფერესის სამუშაო დატვირთვებში. ჩვენი მისიაა უზრუნველვყოთ, რომ ზოგადმა ხელოვნურმა ინტელექტმა სარგებელი მოუტანოს მთელ კაცობრიობას.

რადგან დანერგვისთვის ვემზადებით, ვაგრძელებთ წარმოებისთვის კვალიფიკაციის პროცესს, ვხვეწთ პროგრამულ უზრუნველყოფას, ვემზადებით Jalapeño-ს ფართო მასშტაბით ოპერირებისთვის და ვადასტურებთ წარმადობას უფრო მეტ მოდელზე. ამ დრომდე მიღებული შედეგები აჩვენებს, რა არის შესაძლებელი, როცა სრულ სისტემას ერთად ვქმნით: უფრო რეაგირებადი, უფრო ძლიერი და აგენტური ხელოვნური ინტელექტი, რომელიც უფრო ეფექტიანად მიეწოდება უფრო მეტ ადამიანს.

დანართი

Jalapeño პარეტოს მოწინავე პოზიციებზეა GPT‑OSS 120B-ის შემთხვევაში

მწარმოებლურობა კვტ-ზე მოწინავე

InferenceX · GPT‑OSS‑120B · ნომინალური 8000/1000 · STP · პაკეტი TDP: Jalapeño 700 ვტ; GB200 1200 ვტ

Jalapeño ლიდერობს GPT‑OSS‑ის ოპერაციულ მაჩვენებლებში

პიკური და შესაბამისი მწარმოებლურობა

InferenceX · GPT‑OSS‑120B · ნომინალური 8000/1000 · STP · პაკეტი TDP: Jalapeño 700 ვტ; GB200 1200 ვტ

უფრო მაღალი პიკური შერეული TPS / კვტ

≈1,9×

85 448 შედარებით 44 960 შერეულთან / კვტ

უფრო დაბალი მთლიანი შეყოვნება

≈1,7×

1,03 ს წმ შედარებით 1,80 წმ-თან

უფრო დაბალი მინ. TBT

≈2,7×

0,69 შედარებით 1,87 მმ-თან (1459 შედარებით 535 ტოკენი/წმ/მომხმარებელთან)

მეტი მწარმოებლურობა წინა TBT-ის პირობებში

≈53,7×

22 935 შედარებით 427 შერეულთან / კვტ (535,28 ტოკ/წმ/მომხმარებელი)

Jalapeño პარეტოს მოწინავე პოზიციაზეა DeepSeek R1 670B-თან შედარებით

მწარმოებლურობა კვტ-ზე მოწინავე

InferenceX · DeepSeek R1 MXFP4 · ნომინალური 8000/1000 · STP · პაკეტი TDP: Jalapeño 700 ვტ; GB300 1400 ვტ

Jalapeño ლიდერობს DeepSeek R1-ის ყველა სამუშაო წერტილში

პიკური და შესაბამისი მწარმოებლურობა

InferenceX · DeepSeek R1 MXFP4 · ნომინალური 8000/1000 · STP · პაკეტი TDP: Jalapeño 700 ვტ; GB300 1400 ვტ

უფრო მაღალი პიკური შერეული TPS / კვტ

≈1,7×

19 641 და 11 781 შერეული / კვტ

უფრო დაბალი მთლიანი შეყოვნება

≈3,6×

1,65 წმ და 5,99 წმ

უფრო დაბალი მინ. TBT

≈4,1×

1,43 შედარებით 5.90 მწმ-თან (700 შედარებით 169 ტოკ/წმ/მომხმარებელთან)

მეტი მწარმოებლურობა წინა TBT-ის პირობებში

≈104,3×

12 258 შედარებით 118 შერეულთან / კვტ (169,41ტოკ/წმ/მომხმარებელი)

Jalapeño Kimi K2.5 1T-ის მოწინავე პოზიციაზეა

მწარმოებლურობა კვტ-ზე მოწინავე

InferenceX · Kimi K2.5 MXFP4 · ნომინალური 8000/1000 · STP · პაკეტის TDP: Jalapeño 700 ვტ; GB300 1400 ვტ

Jalapeño ლიდერობს Kimi K2.5-ის ყველა სამუშაო წერტილში

პიკური და შესაბამისი მწარმოებლურობა

InferenceX · Kimi K2.5 MXFP4 · ნომინალური 8000/1000 · STP · პაკეტის TDP: Jalapeño 700 ვტ; GB300 1 400 ვტ

უფრო მაღალი პიკური შერეული TPS / კვტ

≈1,5×

18,195 და 11,862 შერეული / კვტ

უფრო დაბალი მთლიანი შეყოვნება

≈3,4×

1,56 წმ. 5,31 წმ-თან შედარებით.

უფრო დაბალი მინ. TBT

≈3,8×

1,44 შედარებით 5,48 მწმ-თან - (694 შედარებით 182 ტოკ/წმ/მომხმარებელთან)

მეტი მწარმოებლურობა წინა TBT-ის პირობებში

≈56,1×

6 744 და 120 შერეული / კვტ (182,46 ტოკ/წმ/მომხმარებელზე)

ავტორი

OpenAI