Asana: κόστος μοντέλων 76× χαμηλότερο με το GPT‑6.1 Sol
Χρησιμοποιώντας το GPT‑6 Astra στο Codex, η Asana έκανε τον πράκτορα περιήγησής της 76 φορές φθηνότερο και 5 φορές ταχύτερο σε δοκιμές, για να προσφέρει στους πελάτες της πιο ικανά μοντέλα.

76×
Χαμηλότερο εκτιμώμενο κόστος μοντέλου με τη βελτιστοποιημένη ροή εργασίας του GPT-6.1 Sol
5×
Ταχύτερες εκτελέσεις περιήγησης με τη βελτιστοποιημένη ροή εργασίας του GPT-6.1 Sol
0,47 $
Μέσο εκτιμώμενο κόστος μοντέλου με τη βελτιστοποιημένη ροή εργασίας του GPT-6.1 Sol
Με το GPT‑6 Astra στο Codex να εκτελεί πειράματα, η Asana βελτιστοποίησε τη ροή εργασίας του πράκτορα περιήγησής της στο GPT‑6.1 Sol, πετυχαίνοντας 76 φορές χαμηλότερο κόστος και 5 φορές ταχύτερη εκτέλεση.
Η Asana βοηθά τους πελάτες της να αυτοματοποιούν εργασίες σε επιχειρησιακές εφαρμογές μέσω του StackAI(ανοίγει σε νέο παράθυρο), μιας πλατφόρμας που εξαγόρασε(ανοίγει σε νέο παράθυρο). Με το StackAI, οι πελάτες μπορούν να δημιουργούν ροές εργασίας που περιηγούνται σε ιστοτόπους, συμπληρώνουν φόρμες και συλλέγουν πληροφορίες, χωρίς να γράφουν κώδικα. Στην κλίμακα της Asana, ακόμη και μικρές ανεπάρκειες σε αυτές τις ροές εργασίας έχουν αθροιστικά σημαντικό αντίκτυπο.
Ο δρ. Frank Hidalgo, τεχνικός διευθυντής του StackAI στην Asana, έθεσε ως στόχο να κάνει τον πράκτορα περιήγησης ταχύτερο και οικονομικότερο στη λειτουργία του. Ανέθεσε στο GPT‑6 Astra στο Codex να διερευνήσει τη λειτουργία του πράκτορα, να δοκιμάσει βελτιώσεις και να συγκρίνει τα αποτελέσματα. Μια εργασία που, όπως εκτιμά, θα απαιτούσε έναν με δύο μήνες χωρίς αυτοματοποίηση, ολοκληρώθηκε σε περίπου μία εβδομάδα.
Η μελέτη της Asana με 144 εκτελέσεις(ανοίγει σε νέο παράθυρο) δοκίμασε το GPT‑6.1 Sol και τρία ακόμη κορυφαία μοντέλα, που εδώ ονομάζονται Μοντέλα A, B και C. Η βελτιστοποιημένη ροή εργασίας που προέκυψε στο GPT‑6.1 Sol είχε μέσο εκτιμώμενο κόστος μοντέλου 0,47 $ και χρόνο περίπου τέσσερα λεπτά ανά εκτέλεση: 76 φορές φθηνότερη και 5 φορές ταχύτερη από την αρχική διαμόρφωση παραγωγής με το Μοντέλο B.
«Έτσι λειτουργούν στην πράξη οι ομάδες ανθρώπων και πρακτόρων. Ένας μηχανικός λογισμικού έδωσε την κατεύθυνση, το GPT-6 Astra εκτέλεσε τα πειράματα και τα αποτελέσματα πέρασαν μέσω του Command στην παραγωγή. Αυτό δείχνει πώς η Asana κάνει πράξη τη συνεργασία ανθρώπων και πρακτόρων.»
Για να προχωρήσει γρήγορα, ο Hidalgo χρησιμοποίησε πρώτα το GPT‑6 Astra στο Codex για να χαρτογραφήσει τη βάση κώδικα και να εξηγήσει πώς ο πράκτορας δημιουργούσε κάθε αίτημα προς το μοντέλο. Το GPT‑6 Astra διαπίστωσε ότι ο πράκτορας αποθήκευε στην κρυφή μνήμη τις σταθερές οδηγίες και τους ορισμούς εργαλείων του, αλλά όχι το αυξανόμενο ιστορικό κειμένων σελίδων και στιγμιοτύπων οθόνης που συνέλεγε. Έτσι, κάθε αίτημα έστελνε ξανά αυτό το ιστορικό με πλήρη χρέωση.
Ο πράκτορας αφαιρούσε επίσης παλαιότερα στιγμιότυπα οθόνης και περιέκοπτε κείμενο σχεδόν σε κάθε βήμα. Κάθε αλλαγή τροποποιούσε το ιστορικό, οπότε η αποθήκευσή του στην κρυφή μνήμη δεν θα αρκούσε από μόνη της. Επιπλέον, η απώλεια αυτών των πληροφοριών μπορούσε να αναγκάσει τον πράκτορα να επισκεφθεί ξανά σελίδες που είχε ήδη διαβάσει.
Ο Hidalgo εξέτασε τις διορθώσεις που πρότεινε το GPT‑6 Astra και επέλεξε τρεις για δοκιμή:
Επέκταση της αποθήκευσης στην κρυφή μνήμη και στο ιστορικό περιήγησης του πράκτορα
Αύξηση της ποσότητας κειμένου που μπορούσε να διατηρεί
Μαζική αφαίρεση στιγμιοτύπων οθόνης αντί για αφαίρεση σε κάθε βήμα
Το GPT‑6 Astra ξεκίνησε με γρήγορες δοκιμές για να εντοπίσει ποιες μεταβλητές είχαν σημασία. Επειδή ο κώδικας δεν είχε σχεδιαστεί για ελεγχόμενα πειράματα, στη συνέχεια τον αναδόμησε ώστε ένα κοινό frontend και backend να υποστηρίζουν πολλές ροές εργασίας παράλληλα, καθεμία με τις δικές της ρυθμίσεις.
Το Astra διεξήγαγε ολόκληρη τη μελέτη: όρια ιστορικού 120.000 και 480.000 χαρακτήρων και έξι πολιτικές κρυφής μνήμης και στιγμιοτύπων οθόνης, καθεμία από τις οποίες δοκιμάστηκε τρεις φορές σε καθένα από τα τέσσερα μοντέλα (βλ. πίνακα παρακάτω). Η πολιτική με την καλύτερη απόδοση επέτρεπε τη συγκέντρωση 20 στιγμιοτύπων οθόνης και έπειτα κρατούσε μόνο το πιο πρόσφατο. Έτσι, το παλαιότερο ιστορικό παρέμενε αμετάβλητο για μεγαλύτερα διαστήματα μεταξύ των αφαιρέσεων. Σε συνδυασμό με το μεγαλύτερο όριο ιστορικού, αυτή αποτέλεσε τη βελτιστοποιημένη ροή εργασίας. Κάθε διαμόρφωση εκτελούσε την ίδια εργασία: συλλογή έξι πεδίων για καθένα από 32 βιβλία ενός δημόσιου δοκιμαστικού καταλόγου, αντιπροσωπευτική των εργασιών που εκτελούν ορισμένοι πελάτες της Asana στο StackAI.
Μοντέλο | Περιγραφή | Τιμή |
|---|---|---|
Μοντέλο A | Ένα μικρότερο, οικονομικότερο μοντέλο από άλλο κορυφαίο εργαστήριο, που κυκλοφόρησε το φθινόπωρο του 2025 | Στη μισή τιμή του GPT‑6.1 Sol |
Μοντέλο B | Το μοντέλο που χρησιμοποιήθηκε αρχικά στην παραγωγή, από το ίδιο εργαστήριο με το Μοντέλο A. Κυκλοφόρησε το καλοκαίρι του 2026 | Ίδια τιμή με το GPT‑6.1 Sol |
Μοντέλο C | Μια ενημερωμένη έκδοση του Μοντέλου B, που κυκλοφόρησε το φθινόπωρο του 2026 | Ίδια τιμή με το GPT‑6.1 Sol |
GPT‑6.1 Sol | Το μοντέλο της OpenAI |
Το GPT‑6 Astra εκτέλεσε τις ροές εργασίας και εξέτασε τα αιτήματα, τις καταγραφές χρήσης και τα αποτελέσματα, ενώ ξεχωριστές συνεδρίες του μοντέλου έλεγξαν την εργασία. Τα αιτήματα, τα ίχνη δεδομένων και τα αποτελέσματα κάθε συνεδρίας καταγράφηκαν στο Command(ανοίγει σε νέο παράθυρο), την πλατφόρμα παράδοσης λογισμικού της Asana, ώστε η ομάδα να μπορεί να εξετάσει εκ των υστέρων ολόκληρη τη μελέτη. Μέσα από το Command, τα ευρήματα μετατράπηκαν σε δελτία εργασιών και έπειτα σε pull requests, και οι αλλαγές πέρασαν στην παραγωγή.
«Αν το έκανα με το χέρι, θα χρειαζόμουν έναν με δύο μήνες. Με το GPT-6 Astra στο Codex, χρειάστηκε περίπου μία εβδομάδα: όριζα έναν στόχο με το /goal πριν κοιμηθώ και εξέταζα τα αποτελέσματα το πρωί.»
Για το Μοντέλο B, η βελτιστοποίηση μείωσε το εκτιμώμενο κόστος μοντέλου από τουλάχιστον 36,21 $ (ορισμένες αρχικές εκτελέσεις έφτασαν το όριο βημάτων πριν ολοκληρωθούν) σε 1,24 $ ανά εκτέλεση: κόστος 29 φορές χαμηλότερο. Η βελτιστοποιημένη ροή εργασίας στο GPT‑6.1 Sol ήταν ακόμη 2,6 φορές φθηνότερη, στα 0,47 $. Κάθε εκτέλεση της βελτιστοποιημένης ροής εργασίας ολοκλήρωσε την εργασία και επέστρεψε τη σωστή απάντηση.
Μέσοι όροι 3 εκτελέσεων. ≥: η διαμόρφωση αναφοράς περιλαμβάνει εκτελέσεις που έφτασαν το όριο, επομένως ο μέσος όρος της αποτελεί κατώτατο όριο.
Οι δύο συντελεστές στα δεξιά δείχνουν τη σύγκριση με τη βελτιστοποιημένη διαμόρφωση του Μοντέλου B. Το Μοντέλο B δοκιμάστηκε στη φάση 1, ενώ το Μοντέλο C και το Sol 6.1 στη φάση 2 της ίδιας μελέτης (διακεκομμένη γραμμή).
Εξετάζοντας μόνο το GPT‑6.1 Sol με το μεγαλύτερο όριο ιστορικού, η νέα πολιτική κρυφής μνήμης και στιγμιοτύπων οθόνης μείωσε το κόστος στο ένα τέταρτο, από 1,97 $ σε 0,47 $ ανά εκτέλεση. Κάθε κλήση ήταν περίπου 3 φορές φθηνότερη, επειδή το 89% της εισόδου προερχόταν από την κρυφή μνήμη και χρεωνόταν στο 5% της τιμής των μη αποθηκευμένων δεδομένων. Οι εκτελέσεις έγιναν επίσης ταχύτερες: από τουλάχιστον 22,5 λεπτά με την αρχική διαμόρφωση στο Μοντέλο B, σε περίπου τέσσερα λεπτά με τη βελτιστοποιημένη ροή εργασίας στο GPT‑6.1 Sol.
Μέσος όρος 3 εκτελέσεων, με γραμμές τυπικής απόκλισης. ≥: ο μέσος όρος περιλαμβάνει εκτέλεση που έφτασε το όριο ή δεν ολοκληρώθηκε, επομένως η πραγματική τιμή είναι τουλάχιστον ίση με αυτήν.
Οι ράβδοι χρησιμοποιούν μπλε αποχρώσεις. Αξιολογήστε την επίδραση της κρυφής μνήμης σε σύγκριση με τη ράβδο του μεγαλύτερου ορίου των 480 χιλ. χαρακτήρων.
Οι δείκτες εκτελέσεων και οι γραμμές τυπικής απόκλισης ανακατασκευάστηκαν κατά προσέγγιση από την αρχική εικόνα· οι αρχικές τιμές των εκτελέσεων και οι τυπικές αποκλίσεις δεν ήταν διαθέσιμες.
Μέσος όρος 3 εκτελέσεων, με γραμμές τυπικής απόκλισης. ≥: ο μέσος όρος περιλαμβάνει εκτέλεση που έφτασε το όριο ή δεν ολοκληρώθηκε, επομένως η πραγματική τιμή είναι τουλάχιστον ίση με αυτήν.
Οι ράβδοι χρησιμοποιούν μπλε αποχρώσεις. Αξιολογήστε την επίδραση της κρυφής μνήμης σε σύγκριση με τη ράβδο του μεγαλύτερου ορίου των 480 χιλ. χαρακτήρων.
Οι δείκτες εκτελέσεων και οι γραμμές τυπικής απόκλισης ανακατασκευάστηκαν κατά προσέγγιση από την αρχική εικόνα· οι αρχικές τιμές των εκτελέσεων και οι τυπικές αποκλίσεις δεν ήταν διαθέσιμες.
Η έρευνα έδειξε επίσης πώς η διαχείριση του ιστορικού επηρέαζε το αν ο πράκτορας έδινε τελικά απάντηση. Ο περισσότερος χώρος για τη διατήρηση του ιστορικού περιήγησης στο GPT‑6.1 Sol αύξησε τις εκτελέσεις που έδωσαν απάντηση από τρεις στις 18 με το μικρότερο όριο ιστορικού σε 18 στις 18 με το μεγαλύτερο όριο, όλες με τη σωστή απάντηση. Για τον Hidalgo, η επιχειρηματική αξία έγκειται στην πρόσβαση των πελατών σε ταχύτερα και πιο ικανά μοντέλα, διατηρώντας παράλληλα το λειτουργικό κόστος σε βιώσιμα επίπεδα.
«Παλαιότερα, το κόστος περιόριζε τα μοντέλα που μπορούσαμε να προσφέρουμε στους πελάτες για αυτούς τους φόρτους εργασίας. Κάνοντας τον πράκτορα πιο αποδοτικό, μπορούμε να προσφέρουμε στους πελάτες ένα καλύτερο, ταχύτερο μοντέλο, μειώνοντας παράλληλα το λειτουργικό μας κόστος.»
Η Asana έχει διαθέσει τις αλλαγές στην περιήγηση του StackAI και αναπτύσσει εργαλεία που διευκολύνουν την επανάληψη παρόμοιων πειραμάτων. Σταδιακά, η ομάδα σχεδιάζει να ενσωματώσει αυτές τις δοκιμές στις αξιολογήσεις της πλατφόρμας, ώστε οι πελάτες και οι εσωτερικές ομάδες να μπορούν να συγκρίνουν το κόστος, τον χρόνο εκτέλεσης και την ποιότητα των απαντήσεων όταν ρυθμίζουν τους πράκτορές τους.
«Ο περιοριστικός παράγοντας δεν είναι πια η ταχύτητα παράδοσης, αλλά η ανθρώπινη προσοχή. Πλησιάζουμε σε έναν κόσμο όπου κάθε μηχανικός λογισμικού είναι υπεύθυνος προϊόντος που συντονίζει έναν στόλο πρακτόρων.»
Η Asana χρησιμοποιεί πλέον το GPT‑6 Astra στο Codex για να δοκιμάζει λειτουργίες του προϊόντος πριν από την κυκλοφορία τους: το Astra περιηγείται στην πλατφόρμα, δοκιμάζει διαφορετικές εισόδους και αναφέρει σφάλματα στους υπεύθυνους διασφάλισης ποιότητας. Ο Hidalgo το βλέπει ως τη βάση για έναν νέο κύκλο ανάπτυξης λογισμικού, με πολλές συνεδρίες πρακτόρων στο cloud να δοκιμάζουν λειτουργίες παράλληλα.
Η πλήρης μελέτη είναι διαθέσιμη στα ιστολόγια της Asana(ανοίγει σε νέο παράθυρο) και του StackAI(ανοίγει σε νέο παράθυρο).


