Παρουσιάζουμε τα GPT‑6 Sol και Luna
Περισσότεροι τρόποι να αξιοποιείτε κορυφαία ευφυΐα στην καθημερινή σας εργασία.
Νωρίτερα αυτόν τον μήνα, παρουσιάσαμε το GPT‑6 Astra, το πιο ευφυές και ευθυγραμμισμένο μοντέλο στον κόσμο. Παρότι τα πιο απαιτητικά και σημαντικά έργα εξακολουθούν να χρειάζονται όλο το βάθος του Astra, η εργασία γίνεται σε διαφορετικές κλίμακες, ρυθμούς και προϋπολογισμούς.
Γι’ αυτό επεκτείνουμε το σύμπαν του GPT‑6 με τα GPT‑6 Sol και GPT‑6 Luna. Το GPT‑6 Astra εγκαινίασε μια νέα γενιά ευφυΐας — αυτά τα μοντέλα διευρύνουν την πρόσβαση στα οφέλη της, προωθώντας τα όρια της οικονομικής αποδοτικότητας. Εκπαιδεύσαμε τα GPT‑6 Sol και Luna με μεθόδους παρόμοιες με εκείνες του GPT‑6 Astra, μεταφέροντας σε ταχύτερα και οικονομικότερα μοντέλα τις προόδους που στηρίζουν τις κορυφαίες επιδόσεις του Astra στην επαγγελματική εργασία, την πραγματολογική ακρίβεια, τον προγραμματισμό, τη χρήση υπολογιστή και την ευθυγράμμιση.
Τα μοντέλα GPT‑6 ηγούνται σε όλο το φάσμα κόστους–ευφυΐας, συνδυάζοντας εξαιρετικές δυνατότητες σε κάθε βαθμίδα με υποδομή που τις παρέχει αποδοτικά και σε μεγάλη κλίμακα. Οι βελτιώσεις στην προσωρινή αποθήκευση και την εξαγωγή συμπερασμάτων μάς επιτρέπουν να παρέχουμε αυτά τα μοντέλα με χαμηλότερο κόστος. Μεταφέρουμε άμεσα αυτή την εξοικονόμηση στους χρήστες και τους πελάτες, μειώνοντας κατά 50% τις τιμές API για τα Sol και Luna σε σύγκριση με τις προωθητικές τιμές των GPT‑5.6. Συνολικά, αυτές οι βελτιώσεις καθιστούν την προηγμένη ΤΝ πρακτική για περισσότερες καθημερινές εργασίες και εφαρμογές μεγάλης κλίμακας.
Μοντέλο | Είσοδος | Έξοδος | Μείωση τιμής |
GPT‑6 Sol | 4 $ → 2 $ | 20 $ → 10 $ | 50% φθηνότερο |
GPT‑6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ | 50% φθηνότερο |
Οι τιμές είναι ανά 1 εκατομμύριο token.
Το GPT‑6 Astra παραμένει το καλύτερο μοντέλο μας σε όλους τους τομείς. Επιλέξτε το όταν θέλετε τα καλύτερα αποτελέσματα και μια εμπειρία χωρίς συμβιβασμούς.
Τα GPT‑6 Sol και Luna αναβαθμίζουν την ευφυΐα και την οικονομική αποδοτικότητα των μοντέλων που ήδη γνωρίζετε και χρησιμοποιείτε, στις δυνατότητες που είναι πιο χρήσιμες για την ολοκλήρωση σύνθετων εργασιών.
Το GPT‑6 Sol μπορεί να αναλάβει δύσκολες εργασίες, προσφέροντάς σας μεγαλύτερα περιθώρια επαναλήψεων χάρη στα υψηλότερα όρια χρήσης και το χαμηλότερο κόστος, καθώς και περισσότερη ευφυΐα και καλύτερα αποτελέσματα από ανταγωνιστικά μοντέλα παρόμοιας τιμής.
Στο AutomationBench, μια δοκιμή επιχειρηματικών ροών εργασίας σε διάφορες εφαρμογές, το GPT‑6 Sol με πολύ υψηλή προσπάθεια ξεπερνά το Claude Opus 5 με μέγιστη προσπάθεια, με μόλις το 9% του κόστους του Opus 5 ανά εργασία. Με υψηλή προσπάθεια, το GPT‑6 Luna βελτιώνεται έναντι του προκατόχου του κατά 5,4 ποσοστιαίες μονάδες, με 58% χαμηλότερο κόστος ανά εργασία.
Στο AutomationBench 1.0.6(ανοίγει σε νέο παράθυρο), οι πράκτορες ΤΝ δοκιμάζονται σε ολοκληρωμένες ροές εργασίας με 47 εργαλεία στους τομείς των πωλήσεων, του μάρκετινγκ, των λειτουργιών, της υποστήριξης, των οικονομικών και του ανθρώπινου δυναμικού. Το σημείο δεδομένων για το Claude Fable 5.1 υποεκτιμά το πραγματικό του κόστος, καθώς παραλείπει το κόστος των εφεδρικών κλήσεων στο Opus 5, οι οποίες πραγματοποιήθηκαν στο ~40% των εργασιών.
Το GPT‑6 Sol ξεπερνά επίσης το Claude Fable 5.1 με πολύ χαμηλότερο κόστος και υπερισχύει ακόμη και του GPT‑6 Astra με χαμηλή προσπάθεια.
Μοντέλο (και προσπάθεια) | Βαθμολογία | Κόστος ανά εργασία |
|---|---|---|
GPT‑6 Sol (πολύ υψηλό) | 33,2% | 0,27 $ |
GPT‑6 Astra (χαμηλό) | 30,3% | 3,9x του GPT‑6 Sol |
Claude Opus 5 (Max) | 26,9% | 11,1x του GPT‑6 Sol |
Claude Fable 5.1 με εφεδρικό Opus 5 (Max) | 31,4% | >8,9x του GPT‑6 Sol (το κόστος της εφεδρικής χρήσης δεν αναφέρθηκε) |
Στο Agents’ Last Exam, το οποίο αξιολογεί πράκτορες σε σύνθετες επαγγελματικές ροές εργασίας, το GPT‑6 Sol με μέγιστη προσπάθεια πετυχαίνει 56,4%, υψηλότερα από την καλύτερη βαθμολογία του Claude Opus 5 στην αξιολόγηση, με 60% χαμηλότερο κόστος ανά εργασία.
Στο Agents’ Last Exam V1(ανοίγει σε νέο παράθυρο), οι πράκτορες ΤΝ αξιολογούνται σε μακράς διάρκειας, οικονομικά πολύτιμες εργασίες που καλύπτουν 55 υποκλάδους και τους περισσότερους σημαντικούς τομείς επαγγελματικής εργασίας που εκτελείται σε υπολογιστή.
Η χρησιμότητα μιας απάντησης εξαρτάται από την ακρίβεια των στοιχείων και συνεχίζουμε να βελτιώνουμε την πραγματολογική αξιοπιστία. Στην εσωτερική μας αξιολόγηση πραγματολογικής ακρίβειας, η οποία βασίζεται σε αποταυτοποιημένες πραγματικές συνομιλίες όπου οι χρήστες επισήμαναν λάθη των μοντέλων μας, το GPT‑6 Sol κάνει περίπου τα μισά λάθη από τον προκάτοχό του, πλησιάζοντας την αξιοπιστία του Astra με πολύ χαμηλότερο κόστος. Το GPT‑6 Luna βελτιώνεται επίσης σημαντικά· στα υψηλότερα επίπεδα προσπάθειας ισοφαρίζει το GPT‑5.6 Sol με περίπου το ένα εκατοστό του κόστους του.
Εδώ αξιολογούμε την πραγματολογική ακρίβεια σε αποταυτοποιημένες συνομιλίες του ChatGPT, όπου οι χρήστες είχαν επισημάνει ένα πραγματολογικό σφάλμα προηγούμενου μοντέλου. Αυτές οι συνομιλίες, που ευνοούν την πρόκληση σφαλμάτων, δεν αντιπροσωπεύουν την τυπική χρήση, όπου τα πραγματολογικά σφάλματα είναι σπανιότερα. Οι βαθμολογίες δεν έχουν προσαρμοστεί ως προς το μήκος· ωστόσο, οι δοκιμές μας σε διαφορετικά επίπεδα αναλυτικότητας έδειξαν σχεδόν μηδενική εξάρτηση από το μήκος της απάντησης.
Φέτος, οι πράκτορες προγραμματισμού άρχισαν να αναλαμβάνουν εργασίες μεγαλύτερης πολυπλοκότητας, έκτασης και διάρκειας από ποτέ. Στην OpenAI, η εσωτερική μας χρήση έχει αυξηθεί εκθετικά. Με αποτίμηση βάσει των τιμών API, η ημερήσια χρήση token έχει ξεπεράσει τα 600 $ για τον διάμεσο ερευνητή και τα 7.000 $ για τους ερευνητές στο 90ό εκατοστημόριο (Επιτάχυνση της έρευνας: Η εικόνα μέσα από την OpenAI). Καθώς οι πράκτορες προγραμματισμού αναλαμβάνουν μεγαλύτερες και πιο απαιτητικές εργασίες, το κόστος της συνεχούς χρήσης αποκτά μεγαλύτερη σημασία. Τα GPT‑6 Sol και Luna συνδυάζουν ισχυρές επιδόσεις στον προγραμματισμό με χαμηλότερες τιμές API, δίνοντας στους προγραμματιστές περισσότερο περιθώριο επαναλήψεων και στις ομάδες τη σιγουριά να αναθέτουν πιο φιλόδοξες εργασίες στο Codex.
Στο FrontierCode, το οποίο αξιολογεί αν οι πράκτορες προγραμματισμού παράγουν αλλαγές έτοιμες να συγχωνευθούν σε πραγματικές βάσεις κώδικα, το GPT‑6 Sol βελτιώνεται σημαντικά έναντι του GPT‑5.6 Sol και ισοφαρίζει το Claude Fable 5.1 με πολύ υψηλή προσπάθεια, με πολύ χαμηλότερο κόστος.
Στο FrontierCode 1.1 Main(ανοίγει σε νέο παράθυρο), οι πράκτορες ΤΝ γράφουν κώδικα που βαθμολογείται όχι μόνο ως προς την ορθότητα, αλλά και ως προς τη «δυνατότητα συγχώνευσης»: π.χ. την ποιότητα των δοκιμών, την τήρηση του εύρους, το ύφος κώδικα και τη συμμόρφωση με τα πρότυπα της βάσης κώδικα.
Στο DeepSWE v1.1, το οποίο δοκιμάζει τις επιδόσεις σε σύνθετες εργασίες μηχανικής λογισμικού σε πραγματικές βάσεις κώδικα, το GPT‑6 Sol με μέγιστη προσπάθεια πετυχαίνει 68,8%, μόλις 1,1 ποσοστιαίες μονάδες κάτω από την καλύτερη βαθμολογία του Claude Fable 5 στην αξιολόγηση — 69,9% με πολύ υψηλή προσπάθεια — με περίπου 80% χαμηλότερο κόστος ανά εργασία.
Το GPT‑6 Luna με μέγιστη προσπάθεια πετυχαίνει 66,6%, επίδοση συγκρίσιμη με τα Claude Opus 5 και Fable 5 με μεσαία προσπάθεια. Σε αυτές τις συγκρίσεις, το Luna κοστίζει 93% λιγότερο ανά εργασία από το Opus 5 και 96% λιγότερο από το Fable 5.
Στο DeepSWE 1.1(ανοίγει σε νέο παράθυρο), οι πράκτορες ΤΝ επιλύουν πρωτότυπες, μακράς διάρκειας εργασίες μηχανικής λογισμικού.
Παρότι το GPT‑6 Astra παραμένει το καλύτερο μοντέλο στον κόσμο για χρήση υπολογιστή, τα GPT‑6 Sol και Luna προσφέρουν πιο οικονομικά αποδοτικές επιδόσεις από τους προκατόχους τους. Στο OSWorld 2.0 offline, το GPT‑6 Sol με πολύ υψηλή προσπάθεια πετυχαίνει παρόμοια βαθμολογία με το Claude Opus 5 με μεσαία προσπάθεια — 60,5% έναντι 60,3% — με περίπου 80% χαμηλότερο κόστος ανά εργασία. Το GPT‑6 Luna (Max) ξεπερνά το GPT‑5.6 Sol (Μεσαίο) με το ένα δέκατο του κόστους του.
Στο OSWorld 2.0(ανοίγει σε νέο παράθυρο), οι πράκτορες ΤΝ επιχειρούν μακράς διάρκειας ροές χρήσης υπολογιστή, οι οποίες καλύπτουν καθημερινές και επαγγελματικές εργασίες. Αναφέρουμε τη μερική ανταμοιβή στο σύνολο εκτός σύνδεσης από την έκδοση v2026.08.08.
Μεταφέραμε επίσης το βελτιωμένο ύφος επικοινωνίας του GPT‑6 Astra στα Sol και Luna, κάτι που πιστεύουμε ότι θα είναι ιδιαίτερα αισθητό στις τεχνικές συζητήσεις και στις συζητήσεις προγραμματισμού. Περιμένετε μεγαλύτερη σαφήνεια, λιγότερο δυσνόητη ορολογία, λιγότερες παράξενες διατυπώσεις και περιττές λεπτομέρειες, καθώς και συνολικά λίγο συντομότερες απαντήσεις χωρίς απώλεια ουσίας.
Παρότι το ύφος είναι υποκειμενικό, εδώ προτιμούμε την απάντηση του GPT‑6 Sol. Δεν βγάζει τόσο γρήγορα συμπεράσματα, αφιερώνει λιγότερο χρόνο στην επανάληψη λεπτομερειών που ίσως είναι προφανείς για το άτομο που ρωτά (π.χ. ότι ο ιστότοπος έχει τέσσερις σελίδες), χρησιμοποιεί λιγότερο αόριστη γλώσσα (π.χ. «αίσθηση bento», «αναδιαμόρφωση… γύρω από αυτό το σύστημα»), αναφέρει πιο ανοιχτά τι έλεγξε και τι όχι και δεν κοινοποιεί άσκοπα λεπτομέρειες υλοποίησης, όπως την προτροπή του εργαλείου εικόνας.
Παράλληλα με τις χαμηλότερες τιμές token, βοηθάμε τους προγραμματιστές που δημιουργούν εφαρμογές με το GPT‑6 να εξοικονομούν περισσότερα από το περιβάλλον που επαναχρησιμοποιούν οι εφαρμογές τους. Βελτιώσαμε την προσωρινή αποθήκευση προτροπών για το GPT‑6, ώστε να επιτυγχάνει από προεπιλογή υψηλότερα ποσοστά επιτυχίας στην κρυφή μνήμη, βοηθώντας τους πράκτορες να επαναχρησιμοποιούν περισσότερο περιβάλλον, να αποκρίνονται ταχύτερα και να επωφελούνται από έκπτωση 90% στις αναγνώσεις αποθηκευμένων token εισόδου.
Οι προγραμματιστές έχουν επίσης περισσότερους τρόπους να μετρούν και να βελτιστοποιούν τις επιδόσεις της προσωρινής αποθήκευσης:
Παρακολούθηση και διάγνωση. Ο Πίνακας προσωρινής αποθήκευσης προτροπών(ανοίγει σε νέο παράθυρο) δείχνει πόσα δεδομένα εισόδου αποθηκεύονται και πώς αυτό μεταβάλλεται με την πάροδο του χρόνου. Το εργαλείο διαγνωστικών(ανοίγει σε νέο παράθυρο) εξηγεί ποιες ευκαιρίες προσωρινής αποθήκευσης χάθηκαν και τι πρέπει να διορθωθεί.
Προσαρμόστε την προσπάθεια συλλογιστικής και τη διαθεσιμότητα εργαλείων χωρίς να διακόπτετε την προσωρινή αποθήκευση. Αυξήστε την προσπάθεια συλλογιστικής(ανοίγει σε νέο παράθυρο) για δυσκολότερες εργασίες ή μειώστε την για απλούστερες επακόλουθες ερωτήσεις και ενεργοποιήστε ή απενεργοποιήστε εργαλεία(ανοίγει σε νέο παράθυρο) καθώς αλλάζουν οι ανάγκες του πράκτορά σας. Και οι δύο ρυθμίσεις διατηρούν πλέον το προηγούμενο περιβάλλον για επαναχρησιμοποίηση από την κρυφή μνήμη.
Βελτιστοποιήστε ποια προθέματα αποθηκεύονται. Τα ρητά σημεία διακοπής επιτρέπουν στους προγραμματιστές να επιλέγουν πού τελειώνουν τα αποθηκευμένα προθέματα προτροπών. Έτσι, οι προγραμματιστές αποκτούν μεγαλύτερο έλεγχο στην επαναχρησιμοποίηση της κρυφής μνήμης και μπορούν να βελτιώσουν τις επιδόσεις.
Το GitHub αναφέρει ότι, τους τελευταίους μήνες, αυτές οι βελτιώσεις μείωσαν κατά περισσότερο από 50% το ποσοστό των token προτροπής που απαιτούν νέα επεξεργασία, σε δισεκατομμύρια αιτήματα προς μοντέλα της OpenAI, βοηθώντας το Copilot να αποκρίνεται ταχύτερα.
Τα GPT‑6 Sol και Luna βασίζονται στις εργασίες ευθυγράμμισης που παρουσιάστηκαν με το Astra, το πιο ευθυγραμμισμένο μοντέλο μας μέχρι σήμερα. Στις αξιολογήσεις ευθυγράμμισής μας, τόσο το Sol όσο και το Luna παρουσιάζουν βελτιώσεις έναντι των αντίστοιχων GPT‑5.6, μεταξύ άλλων χαμηλότερα ποσοστά παραπλανητικών ισχυρισμών σχετικά με τις εργασίες προγραμματισμού τους.
Οι παρακάτω αξιολογήσεις δοκιμάζουν σκόπιμα δύσκολες καταστάσεις και δεν μετρούν τα ποσοστά αποτυχίας κατά την τυπική χρήση. Δείτε την κάρτα συστήματος(ανοίγει σε νέο παράθυρο) για τα πλήρη αποτελέσματα.
Τα GPT‑6 Sol και GPT‑6 Luna είναι διαθέσιμα από σήμερα στο ChatGPT Work και το Codex για όλους τους χρήστες Plus, Pro, Business, Enterprise και Edu. Οι χρήστες Free και Go μπορούν να αποκτήσουν πρόσβαση στο GPT‑6 Luna από την εφαρμογή για υπολογιστές. Αυτά τα μοντέλα δεν είναι ακόμη διαθέσιμα στο Chat. Στο API της OpenAI, είναι διαθέσιμα ως gpt-6-sol και gpt-6-luna.
Για να διατηρήσουμε την υπηρεσία σταθερή για όλους, σκοπεύουμε να διαθέσουμε αυτά τα μοντέλα σταδιακά στο ChatGPT κατά τη διάρκεια της ημέρας. Αν δεν βλέπετε τα νέα μοντέλα στο ChatGPT Work ή το Codex, δοκιμάστε ξανά αργότερα.
Οι αξιολογήσεις του GPT πραγματοποιήθηκαν στο ερευνητικό μας περιβάλλον ή μέσω του API μας, το οποίο ενδέχεται να παρέχει ελαφρώς διαφορετικά αποτελέσματα από το ChatGPT παραγωγής λόγω διαφορών στις προτροπές συστήματος, στα διαθέσιμα εργαλεία κ.λπ. Οι αξιολογήσεις ανταγωνιστικών μοντέλων αντλήθηκαν από δημόσια διαθέσιμες αναφορές. Αναφέρθηκαν βαθμολογίες για το Claude Fable 5 όταν δεν υπήρχαν διαθέσιμες βαθμολογίες για το Claude Fable 5.1.


