Μετάβαση στο κύριο περιεχόμενο
OpenAI

13 Αυγούστου 2026

Εφαρμοσμένη TN

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

Φόρτωση…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

Ενσωματώσαμε το GPT‑5.6 στον μηχανισμό μας και το χαμηλό επίπεδο συλλογιστικής μάς έδωσε τα καλύτερα αποτελέσματα. Αναγνώριζε πότε απλώς δεν υπήρχαν δεδομένα, δεν ακολουθούσε λανθασμένες ενδείξεις και έφτανε στη σωστή απάντηση με λιγότερα token.
— Izzy Miller, Επικεφαλής έρευνας AI, Hex(ανοίγει σε νέο παράθυρο)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 από 3
Το Luna διατηρεί το 98% της ακρίβειας εξαγωγής του GPT‑5.5 με το ένα δέκατο όγδοο του κόστους. Έτσι, οι πράκτορές μας κατανοούν έγγραφα με υψηλή ποιότητα και κόστος που καθιστά πρακτική τη χρήση τους σε πολύ περισσότερες ροές εργασίας.
— Serhii Shchoholiev, Επικεφαλής μηχανικής πρακτόρων, Hypha(ανοίγει σε νέο παράθυρο)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(ανοίγει σε νέο παράθυρο) across model turns and using native compaction(ανοίγει σε νέο παράθυρο) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(ανοίγει σε νέο παράθυρο) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(ανοίγει σε νέο παράθυρο) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

Όταν χρησιμοποιούνται μαζί, η διαφορά μπορεί να είναι εντυπωσιακή. Για παράδειγμα, στο ARC-AGI-3, το GPT‑5.6 Sol πέτυχε 13,3% με τον τυπικό μηχανισμό. Ωστόσο, μετά την ενεργοποίηση της διατήρησης συλλογιστικής και της συμπύκνωσης, η βαθμολογία εκτινάχθηκε στο 38,3% — με περίπου 6 φορές λιγότερα token εξόδου. Χωρίς αλλαγές στο μοντέλο, αλλά με σχεδόν τριπλάσιες επιδόσεις. Μπορείτε να διαβάσετε περισσότερα στην έρευνά μας για τον μηχανισμό του ARC-AGI-3.

Προγραμματική κλήση εργαλείων

Οι ροές εργασίας πρακτόρων περιλαμβάνουν συχνά δύο είδη εργασίας:

  1. Εργασίες που απαιτούν κρίση
  2. Εργασίες που απαιτούν κυρίως μετακίνηση, φιλτράρισμα και συνδυασμό δεδομένων

Όταν ένας πράκτορας ανακτά 100 γνωστοποιήσεις, τις φιλτράρει κατά ημερομηνία και εντοπίζει σχετικές συναλλαγές, το μοντέλο δεν θα πρέπει να επεξεργάζεται με συλλογιστική κάθε ενδιάμεσο αποτέλεσμα στο θεματικό πλαίσιό του. Η Προγραμματική Κλήση Εργαλείων επιτρέπει στο GPT‑5.6 να γράφει JavaScript για να ενορχηστρώνει εργαλεία, να εκτελεί ανεξάρτητες κλήσεις παράλληλα και να επεξεργάζεται τα αποτελέσματά τους έξω από το θεματικό πλαίσιο. Έτσι, το μοντέλο επικεντρώνεται σε αυτό που απαιτεί ευφυΐα: την άσκηση κρίσης.

Στη χρηματοοικονομική έρευνα, το δύσκολο είναι η αξιόπιστη άντληση γνωστοποιήσεων, ο συντονισμός εργαλείων και η επεξεργασία των αριθμητικών δεδομένων. Στις αξιολογήσεις μας, το GPT‑5.6 με Προγραμματική Κλήση Εργαλείων πέτυχε την ποιότητα των κριτηρίων μας χρησιμοποιώντας 21% λιγότερα token εισόδου. Αυτή είναι η διαφορά ανάμεσα σε έναν πράκτορα που μπορεί να συζητά για χρηματοοικονομική έρευνα και σε έναν που μπορεί πράγματι να τη διεξάγει.
— Alex Wang, Εφαρμοσμένη τεχνητή νοημοσύνη, Rogo(ανοίγει σε νέο παράθυρο)

Πολλοί πράκτορες

Σε σύνθετες εργασίες που μπορούν να παραλληλοποιηθούν, η κατανομή ενεργειών και συλλογιστικής σε πολλαπλές ροές εργασίας πρακτόρων επιτρέπει ταχύτερη ολοκλήρωση και υψηλότερο επίπεδο ευφυΐας. Σε αυτές τις διαμορφώσεις, ο κύριος πράκτορας είναι υπεύθυνος για την ενορχήστρωση των υποπρακτόρων και την ανάθεση εργασιών σε αυτούς. Οι υποπράκτορες επιδιώκουν παράλληλα τους στόχους τους και, στο τέλος, επιστρέφουν τα αποτελέσματά τους στον κύριο πράκτορα για την τελική σύνθεση. Οι ομάδες μπορούν να αρχίσουν να αξιοποιούν εγγενώς πολλούς πράκτορες, ενεργοποιώντας τη λειτουργία πολλών πρακτόρων(ανοίγει σε νέο παράθυρο) στο Responses API. Με αυτόν τον τρόπο λειτουργεί και η ρύθμιση δυνατοτήτων Ultra στο ChatGPT.

1 από 2
Η Qualia χρησιμοποιεί ομάδες πρακτόρων για ερευνητικά προβλήματα ανοιχτού τύπου και το GPT‑5.6 Sol απλώς λειτούργησε. Παρουσίασε αισθητή βελτίωση σε σχέση με το GPT‑5.5, ολοκλήρωσε τις εργασίες ταχύτερα από σχεδόν κάθε άλλο μοντέλο που δοκιμάσαμε και γρήγορα έγινε το μοντέλο OpenAI που επιλέγουμε σταθερά.
— E Chi, Ιδρυτής, Quadrillion(ανοίγει σε νέο παράθυρο)

Παρότι το GPT‑5.6 αντιλαμβάνεται καλά ποιος είναι ο κατάλληλος αριθμός υποπρακτόρων και πότε πρέπει να τους δημιουργήσει, η συμπεριφορά πολλών πρακτόρων μπορεί να καθοδηγηθεί σε μεγάλο βαθμό. Οι οδηγίες προς το μοντέλο σχετικά με το πότε πρέπει να καλεί υποπράκτορες μπορούν να αυξήσουν την πιθανότητα δημιουργίας τους μόνο όταν η πρόσθετη δαπάνη token θα προσφέρει καλύτερες επιδόσεις.

Προσωρινή αποθήκευση προτροπών

Σε ολόκληρη την οικογένεια μοντέλων, το TTL της προσωρινής αποθήκευσης προτροπών αυξήθηκε σε τουλάχιστον 30 λεπτά και τα σημεία διακοπής cache μπορούν πλέον να ορίζονται ντετερμινιστικά μέσα στο θεματικό πλαίσιο ενός μοντέλου. Έτσι, οι νεοφυείς επιχειρήσεις μπόρεσαν να βελτιώσουν σημαντικά το ποσοστό επιτυχιών της cache.

Προσθέσαμε σημεία διακοπής cache και κλειδιά ανά χώρο εργασίας σε μια κοινόχρηστη προτροπή 29.000 token και μειώσαμε τη μη αποθηκευμένη είσοδο κατά 28%. Το χρονικό παράθυρο cache των 30 λεπτών ήταν επίσης καθοριστικό: οι πράκτορές μας μπορούσαν να επαναχρησιμοποιούν το ίδιο πλαίσιο μεταξύ εκτελέσεων, αντί να ξεκινούν από την αρχή.
— Lorenzo Gentile, Μηχανικός τεχνητής νοημοσύνης, Ploy(ανοίγει σε νέο παράθυρο)

Εκτός από τον ορισμό σημείων διακοπής cache, η συνεχιζόμενη χρήση ενός κατάλληλου prompt_cache_key(ανοίγει σε νέο παράθυρο) αυξάνει την πιθανότητα τα αιτήματα να δρομολογούνται στην ίδια μηχανή συναγωγής που είχε εξυπηρετήσει προηγουμένως το ίδιο πρόθεμα, μειώνοντας έτσι την καθυστέρηση.

Συμπέρασμα

Αυτό που ξεχωρίζει σε όλα αυτά τα παραδείγματα είναι το πόσο έχουν αλλάξει τα οικονομικά δεδομένα της δημιουργίας πρακτόρων.

Περιπτώσεις χρήσης που κάποτε απαιτούσαν ένα κορυφαίο μοντέλο σε κάθε βήμα μπορούν πλέον να επιτύχουν παρόμοια ή καλύτερα αποτελέσματα με ελάχιστο κόστος, χρησιμοποιώντας μικρότερα μοντέλα, προσαρμόζοντας το επίπεδο συλλογιστικής και κάνοντας αποδοτικές αρχιτεκτονικές επιλογές.

Ανυπομονούμε να δούμε τι θα δημιουργήσετε!

  • 2026
  • Πλατφόρμα API

Σχετικά με τους συντάκτες

Αυτός ο οδηγός δημιουργήθηκε από τους Samarth Madduru(ανοίγει σε νέο παράθυρο), Prashant Mital(ανοίγει σε νέο παράθυρο), Dave Leo(ανοίγει σε νέο παράθυρο) και Julien Reiman(ανοίγει σε νέο παράθυρο), με βάση την εμπειρία τους από τη στενή συνεργασία με νεοφυείς επιχειρήσεις που ανέπτυσσαν εφαρμογές στο GPT‑5.6, από τις αρχικές δοκιμές έως την παραγωγή.