Μετάβαση στο κύριο περιεχόμενο
OpenAI

29 Ιουλίου 2026

ΈρευναΔημοσίευση

Πώς δύο ρυθμίσεις τριπλασίασαν τη βαθμολογία μας στο ARC-AGI-3

Φόρτωση…

Βίντεο σε γρήγορη κίνηση με το GPT‑5.6 Sol να προσπαθεί να λύσει γρίφους του σημείου αναφοράς ARC-AGI-3, με τον επίσημο μηχανισμό (αριστερά) και τον δικό μας μηχανισμό του Responses API (δεξιά), ο οποίος διατηρεί τη συλλογιστική και ενεργοποιεί τη συμπύκνωση. Στον πίνακα κατάταξης για αυτό το παιχνίδι(ανοίγει σε νέο παράθυρο), κανένα κορυφαίο μοντέλο δεν λύνει κάποιο επίπεδο πέρα από το πρώτο. Με τον μηχανισμό μας, το GPT‑5.6 Sol λύνει και τα έξι.

Όταν είδαμε για πρώτη φορά τις χαμηλές επιδόσεις του GPT‑5.6 Sol στο σημείο αναφοράς ARC-AGI-3(ανοίγει σε νέο παράθυρο), προβληματιστήκαμε.

Το GPT‑5.6 Sol έχει λύσει μακροχρόνια ανοικτά προβλήματα των μαθηματικών, όπως την εικασία διπλής κάλυψης κύκλων(ανοίγει σε νέο παράθυρο), και έχει κερδίσει παιχνίδια όπως το Pokémon FireRed. Ωστόσο, στο ARC-AGI-3, ένα σημείο αναφοράς με δισδιάστατα παιχνίδια γρίφων, το GPT‑5.6 Sol σημείωσε μόλις 7,8%, ενώ το GPT‑5.5 μετά βίας μπορούσε να παίξει, καταγράφοντας το πενιχρό 0,4%.

Ήταν τα δισδιάστατα παιχνίδια γρίφων ασυνήθιστα δύσκολα για τα μοντέλα μας; Ή συνέβαινε κάτι άλλο;

Τα σημεία αναφοράς σπάνια μετρούν τα μοντέλα AI μεμονωμένα. Μετρούν επίσης λιγότερο εμφανείς επιλογές σχετικά με τις ρυθμίσεις API, τον σχεδιασμό του μηχανισμού και τις προτροπές. Στην περίπτωση του ARC-AGI-3, διαπιστώσαμε ότι η ενεργοποίηση δύο ρυθμίσεων API που χρησιμοποιούμε στο ChatGPT και το Codex—της διατήρησης συλλογιστικής και της συμπύκνωσης—τριπλασίασε τη βαθμολογία και μείωσε κατά 6 φορές τα διακριτικά εξόδου στο δημόσιο σύνολο εργασιών.

Με τον επίσημο μηχανισμό, το GPT‑5.6 Sol σημείωσε 13,3% στο δημόσιο σύνολο ARC-AGI-3. Με διατήρηση της συλλογιστικής και συμπύκνωση, σημείωσε 38,3%. Οι βαθμολογίες μετρούν τη Σχετική Αποδοτικότητα Ανθρώπινων Ενεργειών (RHAE(ανοίγει σε νέο παράθυρο))μια μέτρηση που συγκρίνει την απόδοση του μοντέλου με ένα ανθρώπινο σημείο αναφοράς. Βάσει των επίσημων αρχείων παιχνιδιού(ανοίγει σε νέο παράθυρο), εκτιμούμε ότι ο μέσος άνθρωπος που συμμετείχε στη δοκιμή σημείωσε 48%. Τα μοντέλα δεν ενημερώνονται για τον τρόπο βαθμολόγησης και δεν μπορούν να δουν τη βαθμολογία τους κατά τη διάρκεια της δοκιμήςοι ενέργειες επιστρέφουν μόνο μια αναπαράσταση κειμένου για κάθε καρέ και το επίπεδο στο οποίο βρίσκονται.

ARC-AGI-3

Το ARC-AGI-3 είναι ένα σημείο αναφοράς σχεδιασμένο να μετρά πόσο καλά μαθαίνουν και συλλογίζονται οι πράκτορες AI. Οι πράκτορες εξερευνούν άγνωστα δισδιάστατα παιχνίδια και συμπεραίνουν πώς λειτουργούν χωρίς ρητές οδηγίες. Μπορείτε να παίξετε 25 δοκιμαστικά παιχνίδια στη διεύθυνση arcprize.org/tasks(ανοίγει σε νέο παράθυρο).

Το ARC-AGI-3 χρησιμοποιεί σκόπιμα έναν γενικό μηχανισμό, χωρίς εργαλεία ή ειδικές δυνατότητες. Το σκεπτικό της ARC ήταν ότι ένας απλός μηχανισμός αναδεικνύει καλύτερα τις αδυναμίες των μοντέλων και καθιστά δικαιότερες τις συγκρίσεις μεταξύ τους. Αντίθετα, οι εμπορικοί προγραμματιστές βελτιστοποιούν τους μηχανισμούς σύμφωνα με τις δυνατότητες και τις ιδιαιτερότητες κάθε μοντέλου.

Στα παιχνίδια, το GPT‑5.6 Sol έχει κερδίσει το Pokémon FireRed με έναν μηχανισμό που χρησιμοποιεί αποκλειστικά όραση (όπως μεταδόθηκε από το GPT_Plays_Pokemon(ανοίγει σε νέο παράθυρο)), το Slay the Spire μέσω της χρήσης υπολογιστή από το Codex (όπως μεταδόθηκε από την EpochAI(ανοίγει σε νέο παράθυρο)) και τα πρώτα στάδια του Baba Is You (όπως κοινοποιήθηκε από τους Piotr Migdał & Piotr Grabowski(ανοίγει σε νέο παράθυρο)). Τι ήταν τόσο διαφορετικό στο ARC-AGI-3;

Το GPT-5.6 Sol στο Codex ολοκληρώνει μια τυχαιοποιημένη ημερήσια πρόκληση στο Slay the Spire 2.

Ο Ethan Mollick παρουσιάζει(ανοίγει σε νέο παράθυρο) το GPT‑5.6 Sol στο Codex να ολοκληρώνει μια τυχαιοποιημένη ημερήσια πρόκληση στο Slay the Spire 2, ένα παιχνίδι που κυκλοφόρησε μετά το χρονικό όριο γνώσεων του GPT‑5.6 Sol.

Με αφορμή την ανάλυση της ARC για τις αδυναμίες του GPT‑5.5(ανοίγει σε νέο παράθυρο), εξετάσαμε ορισμένες από τις προσπάθειες του GPT‑5.6 Sol. Όπως και η ARC, διαπιστώσαμε ότι το μοντέλο δεν φαινόταν ιδιαίτερα ευφυές. Αφιέρωνε πολύ χρόνο σε κάθε ενέργεια και δυσκολευόταν να προχωρήσει.

Όταν όμως εξετάσαμε το ζήτημα βαθύτερα, διαπιστώσαμε ότι μεγάλο μέρος της σύγχυσης δεν οφειλόταν στο ίδιο το μοντέλο, αλλά στις ρυθμίσεις του μηχανισμού.

Αρχικά, παρατηρήσαμε ότι μετά από κάθε ενέργεια στο παιχνίδι απορριπτόταν όλη η ιδιωτική συλλογιστική. Αυτό σήμαινε ότι σε κάθε ενέργεια το GPT‑5.6 Sol έπρεπε να κατανοήσει το παιχνίδι από την αρχή, χωρίς να μπορεί να θυμηθεί τις προηγούμενες σκέψεις του. Το μοντέλο μπορούσε ακόμη να βλέπει ένα αρχείο των προηγούμενων κινήσεων και σύντομες συνοδευτικές σημειώσεις, αλλά όχι τα σχέδια, τις διαπιστώσεις ή τις σκέψεις που οδήγησαν σε αυτές.

Έπειτα, είδαμε ότι ο μηχανισμός χρησιμοποιούσε ένα κυλιόμενο παράθυρο περικοπής, με αποτέλεσμα οι παλαιότερες ενέργειες να παύουν να είναι ορατές καθώς μεγάλωνε το ιστορικό. Επομένως, το GPT‑5.6 Sol όχι μόνο δεν μπορούσε να θυμηθεί τις προηγούμενες σκέψεις του, αλλά έχανε και τη μνήμη των προηγούμενων ενεργειών του.

Αυτά τα δύο χαρακτηριστικά του μηχανισμού—η απόρριψη της συλλογιστικής και η κυλιόμενη περικοπή—εξηγούσαν γιατί το GPT‑5.6 Sol δυσκολευόταν να μαθαίνει με την πάροδο του χρόνου.

Οι πράκτορες αποδίδουν καλύτερα όταν θυμούνται τι έχουν κάνει

Τα μοντέλα μας εκπαιδεύονται να σκέφτονται μέσω ιδιωτικών μηνυμάτων συλλογιστικής προτού δώσουν απαντήσεις ή πραγματοποιήσουν κλήσεις εργαλείων. Αυτά τα ιδιωτικά μηνύματα σκέψης διατηρούνται ως μέρος του ιστορικού της συνομιλίας. Αν μια συνομιλία γίνει υπερβολικά μεγάλη, τη συνοψίζουμε και συνεχίζουμε.

Διάγραμμα που δείχνει πώς η συλλογιστική του μοντέλου, οι κλήσεις εργαλείων, το ιστορικό συνομιλίας και η συμπύκνωση θεματικού πλαισίου συνεργάζονται σε μια εργασία μεγάλης διάρκειας.

Έτσι εκπαιδεύονται τα μοντέλα μας και έτσι χρησιμοποιούνται στο ChatGPT και το Codex. Για να προσεγγίσουμε καλύτερα τη διαμόρφωση παραγωγής μας, υλοποιήσαμε τον μηχανισμό του ARC-AGI-3 με το Responses API(ανοίγει σε νέο παράθυρο). Το API μας διευκολύνει τη διαχείριση του θεματικού πλαισίου: για το GPT‑5.6, η διαβίβαση του αναγνωριστικού της προηγούμενης απόκρισης διατηρεί αυτόματα τη συλλογιστική μεταξύ κλήσεων εργαλείων και γύρων συνομιλίας.

Με τη διατήρηση της συλλογιστικής, παρατηρήσαμε δύο μεγάλες αλλαγές. Πρώτον, το GPT‑5.6 Sol αφιέρωνε λιγότερο χρόνο στη σκέψη πριν από κάθε ενέργεια, επειδή δεν χρειαζόταν πλέον να ερμηνεύει το παιχνίδι από την αρχή σε κάθε γύρο. Δεύτερον, όταν μπορούσε να θυμάται τις προηγούμενες σκέψεις του, το GPT‑5.6 Sol μάθαινε πολύ καλύτερα με την πάροδο του χρόνου και εφάρμοζε συνεκτικές στρατηγικές.

Η επόμενη βελτίωση προέκυψε από την αντικατάσταση της κυλιόμενης περικοπής με τη συμπύκνωση(ανοίγει σε νέο παράθυρο), μια ακόμη ρύθμιση του Responses API.

Ο μηχανισμός του ARC-AGI-3 αντιμετωπίζει τα όρια του θεματικού πλαισίου με κυλιόμενη περικοπή. Όταν το θεματικό πλαίσιο της συνομιλίας υπερβαίνει τους 175.000 χαρακτήρες, τα παλαιότερα μηνύματα απορρίπτονται.

Η κυλιόμενη περικοπή έχει δύο μειονεκτήματα. Πρώτον, το μοντέλο χάνει παλαιότερες παρατηρήσεις και ενέργειες. Δεύτερον, εκτελεί μεγάλο μέρος των εργασιών με πιο γεμάτο θεματικό πλαίσιο, γεγονός που μπορεί να μειώσει ελαφρώς την απόδοση.

Όταν ενεργοποιήσαμε τη συμπύκνωση στο ARC-AGI-3, το GPT‑5.6 Sol μπορούσε να διατηρεί καλύτερα όσα είχε μάθει για κάθε παιχνίδι σε εκτενέστερες εκτελέσεις και πέτυχε υψηλότερη βαθμολογία με λιγότερα διακριτικά εξόδου.

Για να δείξουμε το αποτέλεσμα της διατήρησης της συλλογιστικής και της ενεργοποίησης της συμπύκνωσης, ακολουθεί μια κινούμενη απεικόνιση του θεματικού πλαισίου 175K του GPT‑5.6 Sol καθώς λύνει μια σειρά γρίφων ARC-AGI-3 με κάθε μηχανισμό.

Οι δύο κεντρικές στήλες απεικονίζουν πώς χρησιμοποιείται διαφορετικά το θεματικό πλαίσιο του μοντέλου από κάθε μηχανισμό. Χάρη στην καλύτερη μνήμη των προηγούμενων ενεργειών του, το GPT‑5.6 Sol σκέφτεται λιγότερο ανά ενέργεια και προχωρά πολύ πιο γρήγορα. Σημείωση: η υλοποίησή μας χρησιμοποιεί όριο 175.000 διακριτικών αντί για χαρακτήρες, όμως το αποτέλεσμα είναι αρκετά παρόμοιο, καθώς η συντριπτική πλειονότητα του κειμένου αποτελείται από πλέγματα ενεργειών, τα οποία ο αναλυτής διακριτικών μας αντιστοιχίζει σε αναλογία 1:1.

Μαζί, η διατήρηση της συλλογιστικής και η συμπύκνωση επιτρέπουν στο GPT‑5.6 Sol (max) να πετυχαίνει περίπου τριπλάσια βαθμολογία με 6 φορές λιγότερα διακριτικά εξόδου.

Συμπεράσματα και συστάσεις

Ελπίζουμε αυτά τα πειράματα να υπενθυμίζουν ότι οι αξιολογήσεις σπάνια μετρούν τα μοντέλα μεμονωμένα—μετρούν επίσης ένα σύνολο λιγότερο εμφανών επιλογών σχετικά με τις ρυθμίσεις API, τον σχεδιασμό του μηχανισμού και τις προτροπές. Δεν είναι η πρώτη φορά που μας εκπλήσσουν οι χαμηλές βαθμολογίες σε ένα δημόσιο σημείο αναφοράς και στη συνέχεια ανακαλύπτουμε ότι το σύστημα εκτέλεσης της αξιολόγησης χρησιμοποιούσε έναν γενικό μηχανισμό που απέρριπτε τα μηνύματα συλλογιστικής.

Αν αναπτύσσετε εφαρμογές με το API και θέλετε να μεγιστοποιήσετε την απόδοση, συνιστούμε να χρησιμοποιείτε τις ίδιες ρυθμίσεις που εφαρμόζουμε στα δικά μας προϊόντα:

  • Χρησιμοποιήστε το Responses API και όχι το παλαιότερο Chat Completions API
  • Διατηρήστε τη συλλογιστική
  • Χρησιμοποιήστε συμπύκνωση

Και αν συγκρίνετε μοντέλα, συνιστούμε να βασίζεστε σε αξιολογήσεις που χρησιμοποιούν τις παραπάνω ρυθμίσεις, καθώς αντιστοιχούν καλύτερα στην πραγματική χρήση στο ChatGPT και το Codex.

Ευχαριστούμε την ARC για την πολυετή δημιουργική εργασία της στην αξιολόγηση της AGI και για την ανάλυσή της, η οποία μας ενέπνευσε να εξετάσουμε το ζήτημα πιο προσεκτικά.

Αν θέλετε να δοκιμάσετε τις δικές σας ικανότητες απέναντι σε κορυφαία μοντέλα, παίξτε τα δημόσια παιχνίδια στη διεύθυνση arcprize.org/tasks(ανοίγει σε νέο παράθυρο).

Συντάκτης

Ilan Bigio, Ted Sanders