GPT-6.1Sol
Near-Astra intelligence for a fifth of the price
Παρουσιάζουμε το GPT‑6.1 Sol, μια αναβάθμιση του GPT‑6 Sol με εξαιρετικά υψηλές επιδόσεις στον προγραμματισμό βάσει πράκτορα, καθώς και στη χρήση υπολογιστή και στις επαγγελματικές εργασίες. Φέρνει το Sol πιο κοντά στο GPT‑6 Astra σε απαιτητικές εργασίες, στο ένα πέμπτο των κανονικών τιμών του Astra για token εισόδου και εξόδου, δίνοντας στους προγραμματιστές μεγαλύτερα περιθώρια να δημιουργούν και να εκτελούν ικανούς πράκτορες με τον ίδιο προϋπολογισμό.
Το GPT‑6.1 Sol προσφέρει επιδόσεις κοντά στο Astra με την τιμολόγηση του Sol, καθιστώντας το το μοντέλο με την καλύτερη σχέση κόστους-επιδόσεων που διατίθεται σήμερα. Η είσοδος από την κρυφή μνήμη κοστίζει μόλις 0,10 $ ανά εκατομμύριο token —έκπτωση 95% σε σχέση με την κανονική τιμή εισόδου— καθιστώντας το πιο οικονομικό για εργασίες πρακτόρων που χρειάζεται να επαναχρησιμοποιούν το πλαίσιο σε διαδοχικά αιτήματα.
Το GPT‑6 Astra παραμένει συνολικά το πιο ικανό από τα κορυφαία μοντέλα μας. Το GPT‑6.1 Sol προσφέρει μια νέα ισορροπία δυνατοτήτων και κόστους για σημαντικές εργασίες που οι χρήστες θέλουν να εκτελούν συχνότερα, καθώς και για πελάτες του API που δημιουργούν και εκτελούν εφαρμογές σε μεγάλη κλίμακα.

Το GPT‑6.1 Sol προσφέρει σημαντικές βελτιώσεις σε σχέση με το GPT‑6 Sol σε σύνθετες επαγγελματικές εργασίες, από τη σύνταξη και την αποσφαλμάτωση κώδικα έως την κατανόηση εγγράφων και την εκτέλεση επιχειρηματικών ροών εργασίας πολλών βημάτων. Σε αρκετές από αυτές τις αξιολογήσεις, πλησιάζει τις επιδόσεις του GPT‑6 Astra με σημαντικά χαμηλότερο κόστος.
Στο DeepSWE v1.1, που αξιολογεί σύνθετες εργασίες μηχανικής λογισμικού σε πραγματικές βάσεις κώδικα, το GPT‑6.1 Sol ισοφαρίζει το GPT‑6 Astra με περίπου το ένα πέμπτο του κόστους, ενώ ξεπερνά την καλύτερη βαθμολογία του GPT‑6 Sol κατά 6,4 ποσοστιαίες μονάδες, με χαμηλότερη προσπάθεια συλλογιστικής και κόστος.
Στο DeepSWE 1.1(ανοίγει σε νέο παράθυρο), οι πράκτορες τεχνητής νοημοσύνης επιλύουν πρωτότυπες εργασίες μηχανικής λογισμικού που απαιτούν πολλά διαδοχικά βήματα.
Στο GDP.pdf, που μετρά πόσο σωστά απαντούν τα μοντέλα σε επαγγελματικά ερωτήματα χρησιμοποιώντας σύνθετα έγγραφα PDF με πίνακες, γραφήματα, διαγράμματα και λεπτομέρειες στα ψιλά γράμματα, το GPT‑6.1 Sol ξεπερνά σε βαθμολογία το Opus 5.5 με εφεδρικές επιλογές, με λιγότερο από το μισό κόστος ανά εργασία σε όλες τις ρυθμίσεις συλλογιστικής που δοκιμάστηκαν. Πλησιάζει επίσης τις κορυφαίες επιδόσεις του GPT‑6 Astra με περίπου το ένα πέμπτο του κόστους ανά εργασία.
Στο GDP.pdf(ανοίγει σε νέο παράθυρο), τα μοντέλα πρέπει να απαντούν σε πραγματικά αιτήματα σχετικά με σύνθετα αρχεία PDF που προέρχονται από επαγγελματικές ροές εργασίας στους τομείς των χρηματοοικονομικών, της υγείας, των νομικών υπηρεσιών και σε επτά ακόμη επαγγελματικούς τομείς.
Στο AutomationBench, που μετρά αν οι πράκτορες ολοκληρώνουν σωστά επιχειρηματικές ροές εργασίας πολλών βημάτων, το GPT‑6.1 Sol ξεπερνά το Opus 5.5 κατά 2,2 ποσοστιαίες μονάδες με την προσπάθεια συλλογιστικής στη ρύθμιση «Μεσαίο», με περίπου το ένα τρίτο του κόστους. Η βαθμολογία αυτή είναι επίσης κατά 4,8 ποσοστιαίες μονάδες υψηλότερη από εκείνη του GPT‑6 Sol στην ίδια ρύθμιση.
In AutomationBench 1.0.6(ανοίγει σε νέο παράθυρο), AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of fallbacks, which occurred on ~40% of tasks.
Το GPT‑6.1 Sol σημειώνει επίσης σημαντική πρόοδο σε εργασίες που απαιτούν αλληλεπίδραση με εφαρμογές υπολογιστή. Στο σύνολο εκτός σύνδεσης του OSWorld 2.0, που αξιολογεί πράκτορες σε απαιτητικές ροές εργασίας χρήσης υπολογιστή, το GPT‑6.1 Sol ξεπερνά το GPT‑6 Sol κατά επτά ποσοστιαίες μονάδες με μέγιστη προσπάθεια συλλογιστικής και λιγότερο από το μισό κόστος. Απέχει μόλις 2,1 ποσοστιαίες μονάδες από τη βαθμολογία του Astra με μέγιστη προσπάθεια συλλογιστικής, με περίπου το ένα έβδομο του κόστους ανά εργασία.
In OSWorld 2.0(ανοίγει σε νέο παράθυρο), AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Στο Terminal-Bench Science 0.1, που αξιολογεί επιστημονικές ροές εργασίας όπως ανάλυση δεδομένων, προσομοίωση και απόδειξη θεωρημάτων, το GPT‑6.1 Sol υπερδιπλασιάζει τη βαθμολογία του GPT‑6 Sol με μέγιστη προσπάθεια συλλογιστικής και λιγότερο από το μισό κόστος ανά εργασία. Με μέγιστη προσπάθεια, το GPT‑6.1 Sol κοστίζει κατά μέσο όρο 5,47 $ ανά εργασία, έναντι 23,21 $ για το Opus 5.5 και 23,80 $ για το Astra, προσφέροντας σημαντικές επιστημονικές δυνατότητες με κόστος χαμηλότερο κατά περισσότερο από 75% σε σχέση με καθένα από τα δύο μοντέλα.
Το GPT‑6 Astra εξακολουθεί να πετυχαίνει την υψηλότερη βαθμολογία μεταξύ των μοντέλων που δοκιμάστηκαν, με 68,1%, και θα πρέπει να χρησιμοποιείται για τις δυσκολότερες εργασίες επιστημονικής έρευνας.
Στο Terminal-Bench Science 0.1(ανοίγει σε νέο παράθυρο), οι πράκτορες ολοκληρώνουν ροές εργασίας επιστημονικής έρευνας χρησιμοποιώντας κώδικα και εργαλεία τερματικού, μεταξύ άλλων για ανάλυση δεδομένων, εκτέλεση προσομοιώσεων και προσαρμογή μοντέλων.
Το GPT‑6.1 Sol βελτιώνει επίσης την πραγματολογική ακρίβεια σε δύσκολες προτροπές. Με πολύ υψηλή προσπάθεια συλλογιστικής, το ποσοστό πραγματολογικών σφαλμάτων του είναι 4,1%, μειωμένο από το 4,5% του GPT‑6 Sol και πιο κοντά στο 4,0% του Astra στην ίδια ρύθμιση, ενώ κοστίζει περίπου 83% λιγότερο ανά εργασία από το Astra.
Αυτή η αξιολόγηση μετρά το ποσοστό απαντήσεων με τουλάχιστον ένα πραγματολογικό σφάλμα σε συνομιλίες από τις οποίες έχουν αφαιρεθεί τα αναγνωριστικά στοιχεία και στις οποίες οι χρήστες επισήμαναν σφάλμα ενός προηγούμενου μοντέλου. Αυτές οι σκόπιμα δύσκολες προτροπές δεν είναι αντιπροσωπευτικές της συνήθους χρήσης.
Αξιολογούμε την πραγματολογική ακρίβεια σε συνομιλίες του ChatGPT από τις οποίες έχουν αφαιρεθεί τα αναγνωριστικά στοιχεία και στις οποίες οι χρήστες είχαν επισημάνει πραγματολογικό σφάλμα ενός προηγούμενου μοντέλου. Αυτές οι συνομιλίες που οδηγούν σε σφάλματα δεν είναι αντιπροσωπευτικές της συνήθους χρήσης, όπου τα πραγματολογικά σφάλματα είναι σπανιότερα.
Το GPT‑6.1 Sol παρουσιάζει σημαντικές βελτιώσεις έναντι του GPT‑6 Sol στις αξιολογήσεις ευθυγράμμισης που διεξάγουμε, πλησιάζοντας το GPT‑6 Astra.
Το GPT‑6.1 Sol είναι πιο διαφανές ως προς τους περιορισμούς του και πιο αξιόπιστο στην τήρηση της πρόθεσης του χρήστη και των περιορισμών ασφαλείας. Σε απαιτητικές αξιολογήσεις, παρουσιάζει χαμηλότερα ποσοστά αστοχίας από το GPT‑6 Sol ως προς τη διαφάνεια για εργαλεία αναζήτησης που δεν λειτουργούν, την τήρηση ρητών περιορισμών και την αποφυγή μη εξουσιοδοτημένων αποτελεσμάτων κατά την εκτέλεση εργασιών από πράκτορες. Δεν παρατηρήσαμε απόπειρες παράκαμψης αυτοματοποιημένου ελεγκτή ασφαλείας, όπως και στα GPT‑6 Astra και GPT‑6 Sol.
Οι παρακάτω αξιολογήσεις εξετάζουν σκόπιμα απαιτητικές καταστάσεις και δεν μετρούν τα ποσοστά αστοχίας στη συνήθη χρήση.
Το GPT‑6.1 Sol είναι διαθέσιμο από σήμερα σε όλους τους χρήστες Plus, Pro, Business, Enterprise και Edu στο ChatGPT Work και στο Codex. Αυτά τα μοντέλα δεν είναι ακόμη διαθέσιμα στο Chat. Οι προγραμματιστές μπορούν επίσης να έχουν πρόσβαση σε αυτό μέσω του API της OpenAI ως gpt-6.1-sol. Οι κανονικές τιμές του στο API είναι 2 $ ανά εκατομμύριο token εισόδου, 0,10 $ ανά εκατομμύριο token εισόδου από την κρυφή μνήμη και 10 $ ανά εκατομμύριο token εξόδου.
Παράλληλα, παρουσιάζουμε το GPT‑6 Astra Ultrafast, το ταχύτερο κορυφαίο μοντέλο στον κόσμο, με έως και οκταπλάσια ταχύτητα από το GPT‑6 Astra, καθώς και το GPT‑6.1 Sol Ultrafast. Αυτά είναι διαθέσιμα μέσω του API, καθώς και στο ChatGPT Work και στο Codex για τους χρήστες της νέας βαθμίδας Pro, που προσφέρει τα υψηλότερα όρια χρήσης, με 500 $/μήνα. Με το GPT‑6.1 Sol Ultrafast, οι προγραμματιστές μπορούν να αποκτήσουν ευφυΐα κοντά στο Astra με έως και οκταπλάσια ταχύτητα, δαπανώντας στο API περίπου όσα δαπανούσαν προηγουμένως για το GPT‑6 Astra.
Συντάκτης
Οι αξιολογήσεις του GPT πραγματοποιήθηκαν στο ερευνητικό μας περιβάλλον ή μέσω του API μας, όπου τα αποτελέσματα ενδέχεται να διαφέρουν ελαφρώς από εκείνα του ChatGPT που διατίθεται στο κοινό, λόγω διαφορών στις προτροπές συστήματος, στα διαθέσιμα εργαλεία, στα επίπεδα προσπάθειας κ.λπ. Οι αξιολογήσεις των ανταγωνιστικών μοντέλων προέρχονται από δημόσια διαθέσιμες αναφορές.

