Μετάβαση στο κύριο περιεχόμενο
OpenAI

29 Ιουλίου 2026

ΜηχανικήΕταιρεία

Πώς το GPT‑5.6 συνδυάζει κορυφαία ευφυΐα και αποδοτικότητα

Φόρτωση…

Σχεδιάσαμε την οικογένεια μοντέλων GPT‑5.6 ώστε να εξισορροπεί τις δυνατότητες και το κόστος σε όλο το φάσμα εργασιών για τις οποίες χρησιμοποιούνται τα μοντέλα μας. Το κορυφαίο μοντέλο μας, GPT‑5.6 Sol, με συλλογιστική Max, ξεπερνά το Claude Fable 5 στον δείκτη Artificial Analysis Coding Agent Index με λιγότερο από το μισό κόστος. Το Terra αποδίδει εξίσου καλά με το GPT‑5.5 στις δοκιμές ευφυΐας με τη μισή τιμή, ενώ το Luna είναι το ταχύτερο και οικονομικότερο μοντέλο μας, με τιμή κατά 80% χαμηλότερη από το κόστος του Sol. Για να επιτύχουν αυτή την αποδοτικότητα, οι ερευνητικές και τεχνικές ομάδες μας πραγματοποίησαν σημαντικές βελτιστοποιήσεις σε κάθε βασικό επίπεδο της στοίβας μας. Αυτές οι βελτιώσεις καλύπτουν τα μοντέλα μας, την εξαγωγή συμπερασμάτων (τον τρόπο με τον οποίο εκτελούμε μοντέλα για να παράγουμε έξοδο) και τον μηχανισμό πρακτόρων μας, που χρησιμοποιείται τόσο από το Codex όσο και από το ChatGPT Work.

Καθώς τα τελευταία τέσσερα χρόνια κλιμακώσαμε τα μοντέλα μας για 1 δισεκατομμύριο ενεργούς χρήστες και περισσότερες από 2 εκατομμύρια επιχειρήσεις, η αποδοτικότητα υπήρξε καθοριστική για τη διάδοση των οφελών της ευφυΐας σε όλους. Αποστολή μας είναι να διασφαλίσουμε ότι η τεχνητή γενική νοημοσύνη ωφελεί ολόκληρη την ανθρωπότητα. Όλα αυτά τα χρόνια εργαζόμαστε για να επιτυγχάνουμε συνεχώς μεγαλύτερες βελτιστοποιήσεις σε ολόκληρη τη στοίβα μας, ώστε να προσφέρουμε τα μοντέλα με τις υψηλότερες επιδόσεις σε κάθε σημείο της καμπύλης κόστους-ευφυΐας. Με το GPT‑5.6 πετύχαμε την υψηλότερη έως σήμερα αποδοτικότητα ευφυΐας ανά token, καθώς είναι εκπαιδευμένο ώστε να ολοκληρώνει περισσότερη εργασία ανά token. Κατά την εκπαίδευση, βελτιστοποιούμε τόσο την επιτυχή ολοκλήρωση της εργασίας όσο και την αποδοτικότητα, διαμορφώνοντας το μοντέλο ώστε να ακολουθεί πιο άμεση πορεία για την εκτέλεσή της.

Αυτή η δημοσίευση εξετάζει πέρα από τα μοντέλα μας τον τρόπο με τον οποίο σχεδιάσαμε με γνώμονα την αποδοτικότητα, μέσω εξελίξεων σε δύο ακόμη βασικά μέρη της στοίβας: 1) την εξαγωγή συμπερασμάτων, βελτιστοποιώντας διαδικασίες όπως η εξισορρόπηση φορτίου, η κερδοσκοπική αποκωδικοποίηση, η αποθήκευση στην κρυφή μνήμη και η βελτιστοποίηση πυρήνων, ώστε να παράγουμε περισσότερη έξοδο με το ίδιο υλικό, και 2) τον μηχανισμό πρακτόρων μας, με καλύτερη διαχείριση της διόγκωσης του θεματικού πλαισίου, της χρήσης εργαλείων και των επαναλαμβανόμενων εργασιών. Θα παρουσιάσουμε επίσης τον ρόλο του GPT‑5.6 Sol στην αυτόνομη υλοποίηση αρκετών από αυτά τα οφέλη. Παρότι κάθε μεμονωμένη βελτίωση μπορεί να φαίνεται περιορισμένη, τα οφέλη αυτά συσσωρεύονται και μας επιτρέπουν να προσφέρουμε κορυφαίες επιδόσεις τόσο στην ευφυΐα όσο και στην αποδοτικότητα.

Διάγραμμα που παρουσιάζει την αποδοτικότητα του GPT-5.6 στον μηχανισμό πρακτόρων, στην ενορχήστρωση API και στην εξαγωγή συμπερασμάτων του μοντέλου, με λιγότερα δεδομένα δικτύου, μικρότερο φόρτο CPU και μεγαλύτερη έξοδο GPU.

Επιτάχυνση της εξαγωγής συμπερασμάτων με το GPT‑5.6 Sol

Σε έναν κόσμο με περιορισμένους υπολογιστικούς πόρους, όπου η ζήτηση για μοντέλα αυξάνεται ταχύτερα από τη διαθέσιμη ισχύ, η αποδοτικότητα αποτελεί βασικό στοιχείο του σχεδιασμού κάθε συστήματος. Αυτό ισχύει ιδιαίτερα για τη στοίβα εξαγωγής συμπερασμάτων μας, η οποία εκτελεί εκπαιδευμένα μοντέλα για να παράγει απαντήσεις. Πρωταρχικός μας στόχος είναι να εξυπηρετούμε περισσότερα token με το ίδιο υλικό, διατηρώντας παράλληλα την ευφυΐα, τον χρόνο απόκρισης, τη διαθεσιμότητα και την αξιοπιστία που αναμένουν οι χρήστες.

Για να το πετύχουμε, πρέπει να βελτιστοποιήσουμε ολόκληρο το σύστημα. Ένα μοντέλο μπορεί να είναι πολύ αποδοτικό μεμονωμένα, αλλά να παραμένει δαπανηρό στην εξυπηρέτηση αν τα αιτήματα κατανέμονται ανεπαρκώς, το υλικό μένει αδρανές ή η μετακίνηση δεδομένων επιβραδύνει τους υπολογισμούς. Οι βελτιώσεις σε κάθε επίπεδο λειτουργούν σωρευτικά, με οφέλη από τη βελτιστοποίηση της δρομολόγησης (πού αποστέλλονται τα αιτήματα), του προγραμματισμού (πότε αποστέλλονται), των πυρήνων (λογισμικό που εκτελείται σε GPU), της κρυφής μνήμης (εργασία που αποθηκεύεται και επαναχρησιμοποιείται) και της υλοποίησης του μοντέλου (η σειρά εκτέλεσης του κώδικα GPU). Το GPT‑5.6 Sol στο Codex διαδραμάτισε καθοριστικό ρόλο σε όλες αυτές τις βελτιστοποιήσεις.

Το πρώτο σημαντικό παράδειγμα είναι η εξισορρόπηση φορτίου. Σε παγκόσμιο επίπεδο, δρομολογούμε τα αιτήματα βάσει παραγόντων όπως η γεωγραφική περιοχή, η διαθέσιμη ισχύς και ο τύπος επιταχυντή (το είδος GPU ή εξειδικευμένου τσιπ που εκτελεί το μοντέλο). Εντός μιας συστοιχίας, κατανέμουμε την εργασία στις παρουσίες του μοντέλου βάσει του φορτίου, του μήκους του θεματικού πλαισίου, της διαθεσιμότητας της κρυφής μνήμης και άλλων χαρακτηριστικών του αιτήματος. Στη συνέχεια, εντός κάθε παρουσίας, η εργασία πρέπει να επιμερίζεται αποδοτικά μεταξύ των επιταχυντών, των υποδικτύων του μοντέλου και των υπολογιστικών πυρήνων. Το GPT‑5.6 Sol στο Codex μάς βοηθά να αναλύουμε την κίνηση παραγωγής, να εντοπίζουμε πηγές ανισορροπίας που είχαν παραβλεφθεί, να δοκιμάζουμε νέες στρατηγικές δρομολόγησης και να προσαρμόζουμε συνεχώς αυτές τις ευρετικές μεθόδους. Αυτές και μόνο οι βελτιώσεις στην εξισορρόπηση φορτίου μείωσαν δραστικά το κόστος εξυπηρέτησης των μοντέλων μας.

Χρησιμοποιήσαμε επίσης το GPT‑5.6 Sol για να βελτιστοποιήσουμε το εμπρόσθιο πέρασμα του μοντέλου: τον υπολογισμό που μετατρέπει τις εισόδους σε προβλέψεις του επόμενου token. Ακόμη και όταν οι επιμέρους λειτουργίες είναι γρήγορες, η υπερβολική μετακίνηση μνήμης, ο συγχρονισμός και η ανεπαρκής διάταξη δεδομένων μπορούν να αφήσουν τις GPU αδρανείς. Για να το αποφύγει αυτό, το GPT‑5.6 Sol εντόπισε εργασίες που μπορούσαν να προϋπολογιστούν, να παραλειφθούν ή να παραλληλοποιηθούν. Με το Codex, το GPT‑5.6 Sol επανέγραψε και βελτιστοποίησε αυτόνομα τους πυρήνες παραγωγής μας, δηλαδή τον βασικό κώδικα που εκτελεί τις μαθηματικές πράξεις από τις οποίες αποτελείται το μοντέλο. Αυτό λειτούργησε εν μέρει επειδή έχουμε εκπαιδεύσει το GPT‑5.6 να γράφει και να βελτιώνει αποτελεσματικά πυρήνες σε Triton(ανοίγει σε νέο παράθυρο) και Gluon(ανοίγει σε νέο παράθυρο), δύο γλώσσες προγραμματισμού GPU ανοικτού κώδικα που συντηρεί η OpenAI. Αυτές οι προσπάθειες, σε συνδυασμό με τις ευρύτερες βελτιώσεις πυρήνων από το GPT‑5.6 Sol, μείωσαν το συνολικό κόστος εξυπηρέτησης κατά 20%. Έχουμε επίσης επενδύσει σημαντικά σε εργαλεία επαλήθευσης, όπως το εργαλείο ανοικτού κώδικα FpSan(ανοίγει σε νέο παράθυρο) (Ελεγκτής αριθμών κινητής υποδιαστολής), για να μας βοηθούν να επαληθεύουμε την ορθότητα των πυρήνων που γράφει το GPT‑5.6 Sol.

Η κερδοσκοπική αποκωδικοποίηση είναι ένας ακόμη τρόπος βελτίωσης της ταχύτητας και της αποδοτικότητας. Η τεχνική εκτελεί ένα μικρότερο προσχέδιο μοντέλου (ή «μοντέλο πρόβλεψης») παράλληλα με το κύριο μοντέλο, προτείνοντας αρκετά token ώστε το κύριο μοντέλο να τα επαληθεύσει παράλληλα. Όταν αυτές οι προτάσεις γίνονται αποδεκτές, το σύστημα μπορεί να παράγει πολλά token εξόδου από ένα μόνο πέρασμα του κύριου μοντέλου, μειώνοντας τους δαπανηρούς διαδοχικούς υπολογισμούς. Το GPT‑5.6 Sol βελτίωσε το δικό του προσχέδιο μοντέλου σχεδιάζοντας και εκτελώντας εκατοντάδες πειράματα στην αρχιτεκτονική του και δοκιμάζοντας αλλαγές στο μέγεθος, τη δομή και τις δυνατότητές του. Επιπλέον, το GPT‑5.6 Sol ξεκίνησε και παρακολούθησε τη διαδικασία εκπαίδευσης του μοντέλου πρόβλεψης, παρεμβαίνοντας αυτόνομα όταν προέκυπταν προβλήματα, όπως βλάβες υλικού και αστάθεια στην εκπαίδευση. Οι βελτιώσεις που προέκυψαν αύξησαν την αποδοτικότητα παραγωγής token κατά περισσότερο από 15%.

Κατά την επεξεργασία token εισόδου που δεν βρίσκονται στην κρυφή μνήμη, το μοντέλο δημιουργεί την κρυφή μνήμη ζευγών κλειδιού-τιμής (KV) σε ένα πέρασμα υψηλών υπολογιστικών απαιτήσεων. Κατά την παραγωγή εξόδου, διαβάζει επανειλημμένα από αυτή την κρυφή μνήμη και την επεκτείνει. Η βέλτιστη διαμόρφωση εξυπηρέτησης —όπως η ομαδοποίηση, ο κατακερματισμός και η διαχείριση KV— εξαρτάται σε μεγάλο βαθμό από τον φόρτο εργασίας: το μήκος της προτροπής και της εξόδου, το μέγεθος της παρτίδας, το ποσοστό επιτυχίας της κρυφής μνήμης, τα χαρακτηριστικά των ερωτημάτων και άλλα. Ωστόσο, το εύρος των πιθανών διαμορφώσεων ήταν προηγουμένως υπερβολικά μεγάλο για συστηματική προσαρμογή, αναγκάζοντας τους μηχανικούς να βασίζονται σε γενικές ευρετικές μεθόδους. Με το GPT‑5.6 Sol στο Codex, μπορέσαμε να αναλύσουμε φόρτους εργασίας παραγωγής, να δημιουργήσουμε και να αξιολογήσουμε υποψήφιες διαμορφώσεις και να υπερβελτιστοποιήσουμε τη διαμόρφωση της μηχανής και του μοντέλου για κάθε σενάριο. Έτσι καθίσταται πρακτικό ένα νέο επίπεδο βελτιστοποίησης ειδικά για κάθε φόρτο εργασίας, που εξασφαλίζει περισσότερη ωφέλιμη εξαγωγή συμπερασμάτων από το ίδιο υλικό.

Η βελτιστοποίηση της εξαγωγής συμπερασμάτων είναι ένας συνεχής βρόχος ανατροφοδότησης. Μετράμε τη συμπεριφορά στην παραγωγή, εντοπίζουμε τα μεγαλύτερα κενά, εφαρμόζουμε αλλαγές και επαληθεύουμε ότι βελτιώνουν ολόκληρο το σύστημα και όχι μόνο μια μεμονωμένη δοκιμή επιδόσεων. Το GPT‑5.6 Sol και το Codex επιταχύνουν κάθε στάδιο αυτού του βρόχου. Αυτό σημαίνει ότι η ομάδα μας μπορεί να εξερευνά περισσότερες ιδέες, να ανταποκρίνεται ταχύτερα στις μεταβαλλόμενες απαιτήσεις και να δημιουργεί μια στοίβα εξαγωγής συμπερασμάτων με μικρότερο χρόνο απόκρισης, μεγαλύτερη ισχύ και χαμηλότερο κόστος για τους χρήστες.

Πώς ο μηχανισμός πρακτόρων μας απλοποιεί τις επαναλαμβανόμενες εργασίες

Το ChatGPT Work και το Codex ολοκληρώνουν σύνθετες εργασίες μέσω μιας σειράς αιτημάτων προς το μοντέλο και κλήσεων εργαλείων. Σε μία μόνο ενέργεια —από το αίτημα του χρήστη έως την τελική απάντηση— το Codex μπορεί να εξετάσει πηγαίο κώδικα, να αναζητήσει το ιστορικό αναπτύξεων, να διαβάσει αναφορές συμβάντων, να επεξεργαστεί ένα αρχείο και να εκτελέσει δοκιμές. Κάθε βήμα μπορεί να απαιτεί ένα αίτημα.

Η προετοιμασία του θεματικού πλαισίου, η μετάδοση δεδομένων, η εκτέλεση εξαγωγής συμπερασμάτων, η κλήση εργαλείων και η εκκίνηση διεργασιών απαιτούν χρόνο και υπολογιστικούς πόρους. Αν μια εργασία απαιτεί 30 αιτήματα προς το μοντέλο, ένα επιπλέον δευτερόλεπτο ανά αίτημα συσσωρεύεται. Η βελτίωση της συνολικής απόδοσης απαιτεί μείωση των επαναλαμβανόμενων εργασιών σε ολόκληρο το σύστημα, όχι μόνο επιτάχυνση του μοντέλου.

Μια εργασία χρήστη εισέρχεται στο μοντέλο, το οποίο μπορεί επανειλημμένα να καλεί ένα εργαλείο, να λαμβάνει αποτέλεσμα και να λαμβάνει μια νέα απόφαση, προτού ολοκληρώσει την εργασία.

Μία ενέργεια του χρήστη μπορεί να περιλαμβάνει πολλές επαναλήψεις του μοντέλου και των εργαλείων. Κάθε κόστος εντός της επαναλαμβανόμενης περιοχής μπορεί να προκύψει πολλές φορές.

Αυτοί οι πολλαπλασιαστικοί παράγοντες καθόρισαν τον σχεδιασμό του μηχανισμού πρακτόρων μας, ενός επιπέδου ενορχήστρωσης σε Rust που συνδέει τα μοντέλα και τα εργαλεία μας με το περιβάλλον του χρήστη. Στη συνέχεια θα δούμε πώς η αποφυγή της διόγκωσης του θεματικού πλαισίου, η φόρτωση εργαλείων και η επαναχρησιμοποίηση εργασιών κάνουν κάθε αίτημα πιο αποδοτικό.

Αποφυγή διόγκωσης του θεματικού πλαισίου

Καθώς οι πράκτορες αποκτούν πρόσβαση σε περισσότερα εργαλεία, δεξιότητες, πρόσθετα και ιστορικό συνομιλιών, τα θεματικά πλαίσια μπορούν εύκολα να διευρυνθούν. Αυτό αυξάνει το κόστος, αποσπά το μοντέλο και προκαλεί περιττή συλλογιστική. Ο μηχανισμός μπορεί να μειώσει αυτή την επιβάρυνση μέσω αναβαλλόμενης ανακάλυψης, ώστε οι ενσωματώσεις, τα προσαρμοσμένα εργαλεία MCP, οι δεξιότητες και τα πρόσθετα να εμφανίζονται μόνο όταν χρειάζονται. Ο μηχανισμός εμποδίζει επίσης μεμονωμένα εργαλεία και ενσωματώσεις MCP να καταναλώνουν απρόβλεπτα το θεματικό πλαίσιο. Η έξοδος των εργαλείων περιορίζεται από προεπιλογή στα 10.000 token, εκτός αν το μοντέλο ζητήσει διαφορετικό όριο.

Διατήρηση ακριβών προθεμάτων για την αποθήκευση προτροπών στην κρυφή μνήμη

Όπως αναφέρθηκε προηγουμένως, ένας βρόχος πράκτορα μπορεί, στο πλαίσιο μίας μόνο ενέργειας, να στείλει στις GPU πολλές φορές τις ίδιες οδηγίες, το ιστορικό συνομιλίας, τους ορισμούς εργαλείων και προηγούμενα αποτελέσματα. Η επεξεργασία αυτών των επαναλαμβανόμενων εισόδων είναι δαπανηρή, γι’ αυτό η αποθήκευση προτροπών στην κρυφή μνήμη επαναχρησιμοποιεί τον υπολογισμό που αντιστοιχεί σε ένα πρόθεμα προτροπής το οποίο έχει ήδη υποβληθεί σε επεξεργασία. Για να διατηρήσει αυτό το πρόθεμα, ο μηχανισμός αντιμετωπίζει όλο το ιστορικό που είναι ορατό στο μοντέλο ως δεδομένα μόνο για προσθήκη: τα νέα μηνύματα, τα αποτελέσματα εργαλείων και οι ενημερώσεις του περιβάλλοντος προστίθενται στο τέλος αντί να εισάγονται σε προηγούμενο θεματικό πλαίσιο. Τα εργαλεία παρουσιάζονται επίσης με καθορισμένη σειρά, ενώ οι ρυθμίσεις χρόνου εκτέλεσης, όπως οι πολιτικές έγκρισης, εφαρμόζονται κατά την εκτέλεση αντί να ενσωματώνονται στους ορισμούς των εργαλείων. Αυτή η σχεδιαστική επιλογή συμβάλλει στα υψηλά συνολικά ποσοστά επιτυχίας της κρυφής μνήμης προτροπών στο Codex και στο ChatGPT Work.

Τρία αιτήματα συγκρίνουν τα byte που αποστέλλονται μέσω μόνιμης σύνδεσης με το ολοένα μεγαλύτερο θεματικό πλαίσιο που βλέπει το μοντέλο και με το πρόθεμα που μπορεί να επαναχρησιμοποιηθεί από την κρυφή μνήμη.

Η σταδιακή μεταφορά αλλάζει όσα διακινούνται μέσω του δικτύου, ενώ η αποθήκευση προτροπών στην κρυφή μνήμη αλλάζει όσα μπορεί να αποφύγει να υπολογίσει ξανά το μοντέλο. Τα πλάτη είναι εννοιολογικά και το πρόσθετο επίπεδο συμπίεσης δεν απεικονίζεται.

Αποδοτικότητα σε όλο το φάσμα ευφυΐας

Τα οφέλη αποδοτικότητας που προσφέραμε με το GPT‑5.6 είναι αποτέλεσμα πολυετών, σωρευτικών βελτιώσεων σε ολόκληρη τη στοίβα, από την έρευνα και την εξαγωγή συμπερασμάτων έως τον μηχανισμό πρακτόρων μας. Ο ρόλος του GPT‑5.6 στην υλοποίηση πολλών από αυτές τις βελτιώσεις μάς κάνει αισιόδοξους ότι ο ρυθμός των βελτιστοποιήσεων θα επιταχυνθεί. Θα συνεχίσουμε να προχωρούμε σε μεγαλύτερες βελτιστοποιήσεις σε τομείς όπως η βελτιστοποίηση πυρήνων, παράλληλα με θεμελιώδεις βελτιώσεις στη στοίβα μας. Προσβλέπουμε στη μεταφορά αυτών των συνεχών, παρασκηνιακών βελτιώσεων στους χρήστες και τους πελάτες μας, με τη μορφή ευρύτερα διαθέσιμης και οικονομικά αποδοτικής ευφυΐας.

Ιδιαίτερες ευχαριστίες στους Matthew Ferrari, Philippe Tillet, Ahmed Ibrahim, Joe Gershenson και Steve Coffey, μέλη του τεχνικού προσωπικού, για τη συμβολή τους σε αυτή τη δημοσίευση.

Συντάκτης

Matthew Ferrari, Phil Tillet, Ahmed Ibrahim, Joe Gershenson, Steve Coffey