
Από τότε που ανακοινώσαμε το Jalapeño, το πρώτο προσαρμοσμένο inference chip της OpenAI, δοκιμάζουμε το chip και το σύστημα που έχει κατασκευαστεί γύρω από αυτό. Τα αποτελέσματα δείχνουν μια σημαντική βελτίωση στις επιδόσεις: το Jalapeño μπορεί να εξυπηρετεί μεγαλύτερο φόρτο εργασίας τεχνητής νοημοσύνης ανά μονάδα ισχύος, ενώ παράλληλα επιστρέφει απαντήσεις πιο γρήγορα. Το Jalapeño προσφέρει τόσο υψηλότερη ρυθμαπόδοση όσο και χαμηλότερη λανθάνουσα καθυστέρηση με μία αρχιτεκτονική, ενώ τα υπάρχοντα συστήματα υλικού συχνά πρέπει να κάνουν συμβιβασμό μεταξύ των δύο.
Για τους πελάτες, αυτό μπορεί να σημαίνει ταχύτερες απαντήσεις, εκπροσώπους που ανταποκρίνονται πιο άμεσα και πιο αξιόπιστη πρόσβαση καθώς αυξάνεται η ζήτηση. Αποστολή μας είναι να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί όλη την ανθρωπότητα. Αυτές οι βελτιώσεις θα συμβάλουν στο να γίνει η ολοένα πιο ικανή τεχνητή νοημοσύνη πιο προσιτή οικονομικά και ευρύτερα διαθέσιμη.
Τα μοντέλα της OpenAI επιτάχυναν επίσης την ανάπτυξη του Jalapeño. Οι προηγούμενες γενιές βοήθησαν την ομάδα να σχεδιάσει και να θέσει σε λειτουργία το chip, ενώ τα νεότερα μοντέλα μας επιταχύνουν τον τρόπο με τον οποίο το βελτιστοποιούμε και το προγραμματίζουμε. Η απόδοση του Jalapeño εκτείνεται στα GPT‑OSS 120B, DeepSeek R1 και Kimi K2.5 1T, δείχνοντας ότι η αρχιτεκτονική λειτουργεί σε μοντέλα που αναπτύχθηκαν τόσο εντός όσο και εκτός της OpenAI. Και στα τρία, το Jalapeño παρείχε 1,5 έως 1,9 φορές περισσότερη εργασία ΤΝ ανά watt στη μέγιστη ρυθμαπόδοση και 1,7 έως 3,6 φορές χαμηλότερη καθυστέρηση από άκρο σε άκρο από τα συστήματα σύγκρισης. Για φόρτους εργασίας με υψηλή διαδραστικότητα, προσέφερε 2,1 έως 4,1 φορές υψηλότερες επιδόσεις.
Το Jalapeño αποτελεί επίσης απόδειξη ενός ευρύτερου πλεονεκτήματος σε ολόκληρη τη στοίβα. Η OpenAI μπορεί να σχεδιάζει μαζί μοντέλα, προϊόντα, λογισμικό εξυπηρέτησης, chip, μνήμη, δικτύωση και συστήματα, χρησιμοποιώντας όσα μαθαίνουμε από πραγματικούς φόρτους εργασίας για να βελτιώνουμε κάθε επίπεδο της στοίβας. Το Jalapeño αποτελεί λειτουργικό ιδιόκτητο chip με μετρημένα αποτελέσματα και σηματοδοτεί την αρχή μιας πλατφόρμας πολλαπλών γενεών. Τους προσεχείς μήνες, θα κλιμακώσουμε το Jalapeño για να προσφέρουμε πιο γρήγορα, πιο ικανά και πιο αποδοτικά προϊόντα στους πελάτες μας.
Αξιολογούμε την απόδοση με βάση μια ισοδύναμη εμπειρία χρήστη, μετρώντας πόσο χρήσιμο έργο ΤΝ μπορεί να ολοκληρώσει κάθε σύστημα ανά μονάδα ισχύος, ενώ καλύπτει τις απαιτήσεις χρόνου απόκρισης των πελατών και των διαδραστικών πρακτόρων. Αυτό έχει ιδιαίτερη σημασία για τους πράκτορες, οι οποίοι πρέπει να ολοκληρώνουν πολλά βήματα διαδοχικά, οπότε οι καθυστερήσεις μπορούν να συσσωρεύονται σε ολόκληρη την εργασία.
Για να κατανοήσουμε πώς αποδίδει το Jalapeño στην πράξη, το δοκιμάσαμε στο InferenceX, έναν δημόσιο δείκτη αναφοράς της SemiAnalysis που μετρά ολόκληρη τη διαδικασία εξυπηρέτησης ενός αιτήματος ΤΝ. Συγκρίναμε το Jalapeño με κορυφαία εμπορικά διαθέσιμα συστήματα ΤΝ σε όλο το εύρος λειτουργίας που δοκιμάστηκε, από εξυπηρέτηση υψηλής ρυθμαπόδοσης έως ιδιαίτερα διαδραστική χρήση χαμηλής καθυστέρησης. Το Jalapeño προσέφερε καλύτερο συνδυασμό ρυθμαπόδοσης, ενεργειακής αποδοτικότητας και καθυστέρησης. Παρότι η απόδοση αναφέρεται μερικές φορές ανά chip, πιστεύουμε ότι το πιο χρήσιμο μέτρο σύγκρισης είναι η απόδοση ανά μονάδα ισχύος.
Και στα τρία δημόσια διαθέσιμα μοντέλα, το Jalapeño πέτυχε καλύτερο συνδυασμό απόδοσης ανά watt και καθυστέρησης σε όλο το εύρος λειτουργίας που υποβλήθηκε σε δοκιμές, με αποτέλεσμα να βρίσκεται στο μέτωπο Pareto. Για να συγκρίνουμε τα συστήματα με συνεπή τρόπο, κανονικοποιήσαμε τα αποτελέσματα χρησιμοποιώντας τη δημοσιευμένη ονομαστική ισχύ του chip κάθε επιταχυντή. Το Jalapeño έχει ονομαστική ισχύ 700 watt, αν και η μετρημένη διαρκής ισχύς του παρέμεινε στα 550 watt ή χαμηλότερα στους φόρτους εργασίας που δοκιμάστηκαν.
Το Jalapeño είχε ισχυρή απόδοση στα GPT‑OSS 120B, DeepSeek R1 670B και Kimi K2.5 1T. Στο Kimi, το μεγαλύτερο δημόσιο μοντέλο που δοκιμάσαμε, προσέφερε περίπου 1,5 φορές υψηλότερη μέγιστη απόδοση ανά watt και 3,4 φορές χαμηλότερη καθυστέρηση από άκρο σε άκρο από το σύστημα σύγκρισης. Στις εσωτερικές δοκιμές μας, το πλεονέκτημα του Jalapeño διευρύνθηκε ακόμη περισσότερο στα κορυφαία μοντέλα OpenAI, γεγονός που υποδηλώνει ότι η αρχιτεκτονική γίνεται πιο πολύτιμη καθώς οι φόρτοι εργασίας μεγαλώνουν και γίνονται πιο απαιτητικοί.
Το Jalapeño σχεδιάστηκε εξαρχής με το εξής ερώτημα: τι υλικό θα κατασκευάζαμε, αν κύρια αποστολή του ήταν η εξυπηρέτηση σύγχρονων και μελλοντικών γλωσσικών μοντέλων, ιδιαίτερα διαδραστικών πρακτόρων; Τα οφέλη του Jalapeño προέρχονται από τον από κοινού σχεδιασμό του chip, της μνήμης, του δικτύου, του λογισμικού και του συστήματος σε κλίμακα rack, με βάση πραγματικούς φόρτους εργασίας γλωσσικών μοντέλων. Η εξαγωγή συμπερασμάτων από γλωσσικά μοντέλα περνά από αρκετές διακριτές φάσεις με διαφορετικά σημεία συμφόρησης. Η προσυμπλήρωση, όταν το σύστημα επεξεργάζεται μια προτροπή, απαιτεί εντατικούς υπολογισμούς, ενώ η αποκωδικοποίηση, όταν το σύστημα δημιουργεί την απόκριση token προς token, περιορίζεται περισσότερο από το εύρος ζώνης της μνήμης. Η επικοινωνία μπορεί επίσης να προσθέσει καθυστέρηση όταν τα δεδομένα πρέπει να μετακινηθούν μεταξύ πυρήνων και chip, αφήνοντας ορισμένες μονάδες επεξεργασίας αδρανείς όσο περιμένουν. Ένα σύστημα που υπερέχει σε μία φάση μπορεί να χάσει αυτό το πλεονέκτημα ενώ περιμένει δεδομένα ή μεταφέρει την κατάσταση του μοντέλου μεταξύ διαφορετικών πόρων.
Σχεδιάσαμε το Jalapeño έτσι ώστε να ελαχιστοποιεί τη μετακίνηση δεδομένων και τις καθυστερήσεις επικοινωνίας. Αυτό σημαίνει ότι η κατάσταση του μοντέλου, συμπεριλαμβανομένης της μνήμης cache KV που χρησιμοποιείται κατά τη δημιουργία μιας απάντησης, μπορεί να τοποθετείται ελεγχόμενα και να διατηρείται τοπικά, ενώ το σύστημα ενεργοποιεί τον κατάλληλο συνδυασμό υπολογιστικών πόρων, μνήμης και δικτύωσης για κάθε φάση της εξαγωγής συμπερασμάτων. Το δίκτυο αποτελεί αναπόσπαστο μέρος της αρχιτεκτονικής. Το ευρύ πεδίο του επιτρέπει σε ολόκληρο τον φόρτο εργασίας να παραμένει μέσα σε ένα συνδεδεμένο σύστημα, ελαχιστοποιώντας τη μετακίνηση δεδομένων και βοηθώντας το πλήρες αίτημα να παραμένει γρήγορο και αποδοτικό από την αρχή έως το τέλος. Το αποτέλεσμα είναι ένας ισορροπημένος και εναλλάξιμος επιταχυντής, ο οποίος μπορεί να υποστηρίζει μεταβαλλόμενες αρχιτεκτονικές μοντέλων, να υπερέχει τόσο στην προσυμπλήρωση όσο και στην αποκωδικοποίηση και να προσαρμόζεται καθώς αλλάζει η ισορροπία μεταξύ τους, ένα καθοριστικό χαρακτηριστικό των φορτίων εργασίας πρακτόρων.
Η ΤΝ διαδραμάτισε άμεσο ρόλο στην ανάπτυξη του Jalapeño, επιτρέποντας στην ομάδα να περάσει από τον αρχικό σχεδιασμό στην οριστικοποίησή του (tapeout) μέσα σε εννέα μήνες, διερευνώντας διαφορετικές υλοποιήσεις, συντομεύοντας τους κύκλους σχεδιασμού, μέτρησης και επαλήθευσης και βελτιστοποιώντας διαρκώς τους φόρτους εργασίας των μοντέλων. Η τεχνητή νοημοσύνη βοήθησε επίσης στη βελτιστοποίηση των αριθμητικών κυκλωμάτων του chip, επιτρέποντας στην ομάδα να ενσωματώσει περισσότερη υπολογιστική απόδοση στο chip εντός χρονοδιαγράμματος.
Το Jalapeño σχεδιάστηκε ως ένας σαφής και προβλέψιμος στόχος προγραμματισμού τόσο για ανθρώπους όσο και για την τεχνητή νοημοσύνη. Οι μηχανικοί μπορούν να περιγράφουν τις υπολογιστικές εργασίες χρησιμοποιώντας τοπικούς τανυστές, ρητά καθορισμένη επικοινωνία και προβλέψιμο συγχρονισμό. Στη συνέχεια, η τεχνητή νοημοσύνη μπορεί να βελτιστοποιήσει τον τρόπο με τον οποίο αυτή η εργασία αντιστοιχίζεται, τοποθετείται, προγραμματίζεται και συντονίζεται σε ολόκληρο το σύστημα. Αυτή η σαφής, προβλέψιμη δομή δίνει στην ΤΝ έναν διαχειρίσιμο τρόπο για να αντιμετωπίσει το παραδοσιακά δύσκολο πρόβλημα του παράλληλου προγραμματισμού.
Η υποστήριξη κάθε νέας οικογένειας μοντέλων εξακολουθεί να απαιτεί νέους πυρήνες και βελτιστοποιήσεις ειδικές για κάθε μοντέλο. Χρησιμοποιώντας το Codex με το GPT‑Astra, η ομάδα έφερε τρία μοντέλα ανοικτής στάθμισης που δεν περιλαμβάνονταν στο αρχικό σχέδιο παραγωγής του Jalapeño σε υψηλές επιδόσεις μέσα σε δύο μήνες. Αυτό κατέδειξε τόσο την ευελιξία της αρχιτεκτονικής όσο και την ταχύτητα με την οποία η τεχνητή νοημοσύνη μπορεί να μας βοηθήσει να την προγραμματίσουμε. Για επιλεγμένα μπλοκ προσοχής και μείγματος ειδικών του GPT‑OSS, οι υλοποιήσεις που δημιουργήθηκαν από ΤΝ εκτελέστηκαν 1,5 έως 1,8 φορές ταχύτερα από τις υπάρχουσες υλοποιήσεις που είχαν γράψει ειδικοί. Αυτά τα στοιχεία ισχύουν για τα επιλεγμένα μπλοκ, όχι για ολόκληρο το μοντέλο, αλλά υποδεικνύουν έναν ισχυρό νέο κύκλο ανάπτυξης.
Η υποδομή τεχνητής νοημοσύνης είναι πολύτιμη λόγω του χρήσιμου έργου που επιτρέπει στον πραγματικό κόσμο. Παράγοντας περισσότερο χρήσιμο έργο με την ίδια ισχύ και το ίδιο υλικό, το Jalapeño μπορεί να μας βοηθήσει να εξυπηρετούμε μεγαλύτερη ζήτηση και να μειώσουμε το κόστος παροχής ενός επιτυχημένου αποτελέσματος. Για την OpenAI, αυτό μπορεί να βελτιώσει τη λειτουργική μόχλευση, επιτρέποντας στη χρήσιμη εργασία και τα έσοδα να αυξάνονται ταχύτερα από το κόστος εξυπηρέτησης. Μπορεί επίσης να στηρίξει την ευρύτερη υιοθέτηση και τη συνεχή επένδυση σε καλύτερα μοντέλα, προϊόντα και υποδομές. Η ταχύτερη εξαγωγή συμπερασμάτων μπορεί να επιτρέψει ταχύτερους κύκλους επανάληψης και νέες περιπτώσεις χρήσης.
Το Jalapeño διευρύνει τα όρια του εφικτού για αποδοτική εξαγωγή συμπερασμάτων με χαμηλή καθυστέρηση:
- Εξαγωγή συμπερασμάτων σε εξαιρετικά γρήγορη λειτουργία με αποδοτικότητα που προηγουμένως ήταν διαθέσιμη μόνο στη γρήγορη λειτουργία
- Εξαγωγή συμπερασμάτων σε γρήγορη λειτουργία με αποδοτικότητα που προηγουμένως ήταν διαθέσιμη μόνο σε λειτουργία δέσμης
- Υψηλότερη αποδοτικότητα για εξαγωγή συμπερασμάτων σε λειτουργία δέσμης
Σχεδιάζουμε να αρχίσουμε να εντάσσουμε το Jalapeño στην υπολογιστική υποδομή της OpenAI έως το τέλος του έτους. Πρόκειται για την πρώτη γενιά ενός οδικού χάρτη πολλών γενεών: το Gen 2 βρίσκεται σε προχωρημένο στάδιο ανάπτυξης, ενώ το Gen 3 αρχίζει να παίρνει μορφή. Κάθε γενιά θα αξιοποιεί όσα μαθαίνουμε και θα βελτιώνει περαιτέρω τόσο την αποδοτικότητα όσο και την ταχύτητα.
Η κάλυψη της αυξανόμενης ζήτησης για ΤΝ θα απαιτήσει περισσότερη υπολογιστική ισχύ από κάθε διαθέσιμη πηγή. Θα συνεχίσουμε να χρησιμοποιούμε ευρέως επιταχυντές της NVIDIA και άλλων συνεργατών τόσο για φόρτους εργασίας εκπαίδευσης όσο και για φόρτους εξαγωγής συμπερασμάτων. Αποστολή μας είναι να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί όλη την ανθρωπότητα.
Καθώς προετοιμαζόμαστε για τη θέση του σε λειτουργία, συνεχίζουμε τις δοκιμές καταλληλότητας για παραγωγική χρήση, την περαιτέρω ωρίμανση του λογισμικού και την προετοιμασία για τη λειτουργία του Jalapeño σε μεγάλη κλίμακα, ενώ παράλληλα επαληθεύουμε τις επιδόσεις του σε περισσότερα μοντέλα. Τα μέχρι στιγμής αποτελέσματα δείχνουν τι είναι δυνατό όταν σχεδιάζουμε ολόκληρο το σύστημα μαζί: ΤΝ που αποκρίνεται ταχύτερα, διαθέτει περισσότερες δυνατότητες, συμπεριλαμβανομένων πιο προηγμένων δυνατοτήτων πράκτορα, και παρέχεται πιο αποδοτικά σε περισσότερους ανθρώπους.
ΜΕΤΩΠΟ ΡΥΘΜΑΠΟΔΟΣΗΣ ανά kW
InferenceX. GPT‑OSS‑120B. ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB200 1.200 W
ΜΕΓΙΣΤΗ ΚΑΙ ΑΝΤΙΣΤΟΙΧΙΣΜΕΝΗ ΡΥΘΜΑΠΟΔΟΣΗ
InferenceX. GPT‑OSS‑120B. ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB200 1.200 W
Υψηλότερο μέγιστο TPS μικτού φόρτου / kW
≈1,9×
85,448 έναντι 44,960 μικτού φόρτου / kW
Χαμηλότερη καθυστέρηση από άκρο σε άκρο
≈1,7×
1,03 δευτ. έναντι 1,80 δευτ.
Χαμηλότερο ελάχιστο TBT
≈2,7×
0,69 έναντι 1,87 ms (1.459 έναντι 535 tok/δ./χρήστης)
Μεγαλύτερη ρυθμαπόδοση στο προηγούμενο TBT
≈53,7×
22.935 έναντι 427 μικτού φόρτου / kW (στα 535,28 tok/δ./χρήστη)
ΜΕΤΩΠΟ ΡΥΘΜΑΠΟΔΟΣΗΣ ανά kW
InferenceX, DeepSeek R1 MXFP4, ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB300 1.400 W
ΜΕΓΙΣΤΗ ΚΑΙ ΑΝΤΙΣΤΟΙΧΙΣΜΕΝΗ ΡΥΘΜΑΠΟΔΟΣΗ
InferenceX, DeepSeek R1 MXFP4, ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB300 1.400 W
Υψηλότερο μέγιστο TPS μικτού φόρτου / kW
≈1,7×
19.641 έναντι 11.781 μικτού φόρτου/kW
Χαμηλότερη καθυστέρηση από άκρο σε άκρο
≈3,6×
1,65 δ έναντι 5,99 δ
Χαμηλότερο ελάχιστο TBT
≈4,1×
0,43 έναντι 0,90 ms (700 έναντι 169 tok/δ./χρήστη)
Μεγαλύτερη ρυθμαπόδοση στο προηγούμενο TBT
≈104,3×
12.258 έναντι 118 μικτού φόρτου / kW (στα 169,41 tok/δ./χρήστη)
ΜΕΤΩΠΟ ΡΥΘΜΑΠΟΔΟΣΗΣ ανά kW
InferenceX. Kimi K2,5 MXFP4. ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB300 1.400 W
ΜΕΓΙΣΤΗ ΚΑΙ ΑΝΤΙΣΤΟΙΧΙΣΜΕΝΗ ΡΥΘΜΑΠΟΔΟΣΗ
InferenceX. Kimi K2,5 MXFP4. ονομαστικά 8.000/1.000. STP. TDP πακέτου: Jalapeño 700 W, GB300 1.400 W
Υψηλότερο μέγιστο TPS μικτού φόρτου / kW
≈1,5×
18.195 έναντι 11.862 μικτού φόρτου/kW
Χαμηλότερη καθυστέρηση από άκρο σε άκρο
≈3,4×
1,56 δ. έναντι 5,31 δ.
Χαμηλότερο ελάχιστο TBT
≈3,8×
1,44 έναντι 5,48 ms (694 έναντι 182 tok/δ./χρήστη)
Μεγαλύτερη ρυθμαπόδοση στο προηγούμενο TBT
≈56,1×
6.744 έναντι 120 μικτού φόρτου/ kW (στα 182,46 tok/s./χρήστη)


