Μετάβαση στο κύριο περιεχόμενο
OpenAI

6 Οκτωβρίου 2026

Δημοσίευση

Εξελίσσοντας τη χρήση υπολογιστών με την Ironclad

Πώς μια ερευνητική συνεργασία στη διαχείριση συμβάσεων μας βοηθά να εκπαιδεύουμε και να αξιολογούμε πράκτορες τεχνητής νοημοσύνης σε σύνθετες επαγγελματικές εργασίες.

Φόρτωση…

Όταν παρουσιάσαμε το GPT‑6 Astra, δείξαμε πόσο έχουν προοδεύσει τα μοντέλα μας στη χρήση υπολογιστών για επαγγελματικές εργασίες, από την προετοιμασία εγγράφων έως τη δοκιμή ιστοτόπων. Ο επόμενος στόχος μας είναι να κάνουμε τους πράκτορες πιο ικανούς και αποδοτικούς στη χρήση εξειδικευμένου λογισμικού για την επίλυση σύνθετων επιχειρηματικών προβλημάτων. Διερευνούμε πώς μπορούμε να εκπαιδεύσουμε τα μοντέλα ώστε να κατανοούν τους επιχειρησιακούς κανόνες μιας εταιρείας, να εκτελούν ροές εργασίας πολλών βημάτων και να επαληθεύουν ότι η δουλειά τους ανταποκρίνεται στις αρχικές απαιτήσεις.

Για να επιταχύνουμε αυτή την έρευνα, συνεργαζόμαστε απευθείας με έναν μικρό αριθμό εταιρειών λογισμικού που γνωρίζουν καλύτερα αυτές τις ροές εργασίας. Μαζί, εντοπίζουμε απαιτητικές εργασίες υψηλής αξίας και τις μετατρέπουμε σε ερευνητικά προβλήματα για την εκπαίδευση και την αξιολόγηση των μοντέλων μας, με τελικό στόχο να γίνουν πιο ικανά και χρήσιμα σε πραγματικές επιχειρηματικές εφαρμογές.

Ο πρώτος μας συνεργάτης είναι η Ironclad, μια κορυφαία εταιρεία στη διαχείριση συμβάσεων με τεχνητή νοημοσύνη. Σε στενή συνεργασία με την ομάδα της Ironclad, αναπτύξαμε εργασίες που απαιτούν από τους πράκτορες να διαμορφώνουν συμφωνίες, εγκρίσεις και επαναχρησιμοποιήσιμους νομικούς όρους, και δείξαμε πρόοδο σε αυτές τις σύνθετες ροές εργασίας. Η τεχνογνωσία της Ironclad συνέβαλε καθοριστικά στον ορισμό του τι συνιστά επιτυχία και στην άμεση ενσωμάτωση πραγματικών αναγκών των πελατών στην ανάπτυξη κορυφαίων μοντέλων. Είμαστε ευγνώμονες για τη συνεργασία και ενθουσιασμένοι που μοιραζόμαστε όσα πετύχαμε μαζί.

Το GPT‑6 Astra είναι το πρώτο κορυφαίο μοντέλο μας που εκπαιδεύτηκε σε εργασίες του Ironclad. Στην ερευνητική μας αξιολόγηση, η μέση βαθμολογία του ήταν κατά 32% υψηλότερη από εκείνη του GPT‑5.6 Sol, ενώ ο εκτιμώμενος χρόνος ανά προσπάθεια ήταν κατά 48% μικρότερος.1

Μετατρέποντας τις ροές διαχείρισης συμβάσεων σε εργασίες εκπαίδευσης

Σκεφτείτε μια ομάδα νομικών λειτουργιών που οργανώνει μια διαδικασία αγοράς λογισμικού. Το οικονομικό τμήμα μπορεί να χρειάζεται να εγκρίνει αγορές πάνω από ένα ορισμένο ποσό, το τμήμα ασφάλειας να εξετάζει ορισμένα αιτήματα και το νομικό τμήμα να ελέγχει μη τυποποιημένους όρους. Το άτομο που οργανώνει τη διαδικασία πρέπει να μετατρέψει αυτή τη σύντομη λίστα σε φόρμα υποβολής αιτημάτων, πρότυπα εγγράφων, κανόνες έγκρισης και καταχώριση της τελικής συμφωνίας.

Ένας πράκτορας τεχνητής νοημοσύνης που εκτελεί την ίδια εργασία πρέπει να έχει διαρκώς υπόψη του αυτές τις απαιτήσεις καθώς χρησιμοποιεί το λογισμικό. Για παράδειγμα, πρέπει να ρυθμίσει την έγκριση από το οικονομικό τμήμα για ποσά πάνω από το όριο δαπανών και να ελέγξει ότι τα αιτήματα πάνω και κάτω από αυτό δρομολογούνται σωστά. Η σωστή εκτέλεση μεμονωμένων βημάτων δεν αρκεί: η ολοκληρωμένη διαδικασία πρέπει να λειτουργεί σε όλες τις περιπτώσεις για τις οποίες σχεδιάστηκε.

Εργαζόμενοι της Ironclad και άτομα που χρησιμοποιούν το Ironclad στην OpenAI βοήθησαν τους ερευνητές μας να εντοπίσουν 11 εργασίες από τον νομικό και τον εμπορικό τομέα, καθώς και από τον τομέα των προμηθειών. Σε αυτές περιλαμβάνονταν εργασίες όπως η διαμόρφωση συμφωνιών εμπιστευτικότητας, η δημιουργία διαδικασιών έγκρισης προμηθειών και η ενημέρωση μιας επαναχρησιμοποιήσιμης νομικής ρήτρας ώστε να ανταποκρίνεται στη δικαιοδοσία που επιλέγει ο αιτών. Εκτιμούμε ότι ένας έμπειρος χρήστης θα χρειαζόταν κατά μέσο όρο περίπου 30 έως 40 λεπτά για κάθε εργασία.

Αξιολογήσαμε κάθε εργασία με βάση 8 έως 50 κριτήρια, ανάλογα με την πολυπλοκότητά της. Έτσι μπορέσαμε να δούμε ποια μέρη εκτέλεσε σωστά ένα μοντέλο και πού υστέρησε. Η Ironclad παρείχε επίσης φιλοξενούμενα περιβάλλοντα λογισμικού του προϊόντος της, όπου τα μοντέλα μπορούσαν να εξασκηθούν σε αυτές τις εργασίες. Οι ερευνητές μας ανέπτυξαν συνθετικές εργασίες εκπαίδευσης2 με βάση αντιπροσωπευτικές ροές εργασίας και χρησιμοποίησαν ενισχυτική μάθηση για να βοηθήσουν τα μοντέλα να βελτιωθούν μέσω εξάσκησης και ανατροφοδότησης. Αυτός ο συνδυασμός —εργασίες επιλεγμένες μαζί με ανθρώπους που γνωρίζουν το αντικείμενο, λεπτομερή κριτήρια και ένα περιβάλλον εξάσκησης για τα μοντέλα— διασφαλίζει ότι βελτιώνουμε τις επιδόσεις σε πραγματικές εργασίες που έχουν τη μεγαλύτερη σημασία για τους πελάτες μας.

Οι επιδόσεις του Astra

Συγκρίναμε το Astra και το GPT‑5.6 Sol με τη συλλογιστική στη ρύθμιση Max για το Astra και στη ρύθμιση Υψηλό για το Sol, τις ρυθμίσεις στις οποίες κάθε μοντέλο πέτυχε την υψηλότερη βαθμολογία του. Στις 11 ερευνητικές εργασίες, η μέση βαθμολογία του Astra ήταν 55,0%, έναντι 41,6% για το GPT‑5.6 Sol, ενώ ο εκτιμώμενος μέσος χρόνος ανά προσπάθεια μειώθηκε από 37,0 λεπτά για το Sol σε 19,2 λεπτά για το Astra.3 Ένα εσωτερικό μοντέλο που χρησιμοποιήθηκε στην ανάπτυξη του Astra πέτυχε ακόμη υψηλότερη βαθμολογία, 63,7%, σε αυτές τις εργασίες, και στόχος μας είναι να ενσωματώσουμε αυτές τις επιπλέον βελτιώσεις σε μελλοντικά μοντέλα.

Δείκτης

GPT‑5.6 Sol
Συλλογιστική: Υψηλό

GPT‑6 Astra
Συλλογιστική: Max

Μέση βαθμολογία βάσει κριτηρίων

41,6%

55,0%

Εκτιμώμενος μέσος χρόνος ανά προσπάθεια

37,0 λεπτά

19,2 λεπτά

Το Astra κάλυψε περισσότερες απαιτήσεις των εργασιών σε λιγότερο χρόνο προσομοίωσης ανά προσπάθεια. Τα δύο βίντεο που ακολουθούν δείχνουν πώς τα μοντέλα εκτέλεσαν την ίδια ερευνητική εργασία. Το Astra (πρώτο βίντεο) κάλυψε περίπου το 94% των κριτηρίων της εργασίας σε εκτιμώμενο χρόνο 20 λεπτών, ενώ το GPT‑5.6 Sol (δεύτερο βίντεο) κάλυψε περίπου το 85% σε εκτιμώμενο χρόνο 32 λεπτών.

Το GPT‑6 Astra κάλυψε περίπου το 94% των κριτηρίων της εργασίας σε εκτιμώμενο χρόνο 20 λεπτών.

Το GPT‑5.6 Sol κάλυψε περίπου το 85% των κριτηρίων της εργασίας σε εκτιμώμενο χρόνο 32 λεπτών.

Τι σημαίνει αυτή η συνεργασία για την Ironclad

Ο ρόλος της Ironclad σε αυτή την προσπάθεια αντανακλά μια πρόκληση που οι πελάτες της γνωρίζουν καλά: μια διαδικασία διαχείρισης συμβάσεων πρέπει να χειρίζεται εξαιρέσεις, τηρώντας παράλληλα τους κανόνες στους οποίους βασίζεται μια επιχείρηση. Αν ένας πράκτορας πάψει να λαμβάνει υπόψη έναν από αυτούς τους κανόνες στη μέση μιας εργασίας, περιορίζεται το εύρος των εργασιών που μια εταιρεία λογισμικού μπορεί να του αναθέσει με σιγουριά. Αυτό αναδεικνύει γιατί η ανθρώπινη εποπτεία παραμένει σημαντική καθώς οι πράκτορες βελτιώνονται σε σύνθετες εργασίες διαχείρισης συμβάσεων, αλλά και γιατί μια ολοκληρωμένη πλατφόρμα διαχείρισης συμβάσεων παραμένει απαραίτητη. Η συνεργασία με τους ερευνητές μας δίνει στην Ironclad τη δυνατότητα να εντάξει αυτά τα προβλήματα στην ανάπτυξη του μοντέλου που στηρίζει την τεχνολογία, ώστε να μπορούμε να τα μελετήσουμε από κοινού.

Καθώς τα μοντέλα αποκτούν περισσότερες δυνατότητες, η Ironclad έχει την ευκαιρία να τα αξιοποιήσει σε περισσότερα από τα δικά της προϊόντα. Για τις νομικές και επιχειρησιακές ομάδες, αυτό θα μπορούσε να σημαίνει ότι η τεχνητή νοημοσύνη αναλαμβάνει μεγαλύτερο μέρος της δουλειάς που απαιτεί η διαχείριση σύνθετων συμβάσεων, διατηρώντας τους μηχανισμούς ελέγχου στους οποίους βασίζονται αυτές οι ομάδες.

“Για να είναι πραγματικά χρήσιμη σε σύνθετους τομείς της διαχείρισης συμβάσεων, η τεχνητή νοημοσύνη πρέπει να κάνει περισσότερα από το να ολοκληρώνει μεμονωμένες ενέργειες. Οι πράκτορες πρέπει να κατανοούν ολόκληρο τον κύκλο ζωής των συμβάσεων, καθώς και πώς συνδέονται οι επιχειρησιακές ροές εργασίας, διατηρώντας παράλληλα τους μηχανισμούς ελέγχου στους οποίους βασίζονται οι ομάδες. Η συνεργασία μας με την OpenAI εντάσσει αυτές τις πραγματικές προκλήσεις στην ερευνητική διαδικασία και συμβάλλει στην εξέλιξη της τεχνολογίας.”
—Sunita Verma, Διευθύντρια Τεχνολογίας, Ironclad

Συνεργαστείτε μαζί μας για την εξέλιξη της τεχνητής νοημοσύνης σε σύνθετες επαγγελματικές εργασίες

Προσκαλούμε έναν μικρό αριθμό εταιρειών λογισμικού να συνεργαστούν απευθείας με τις ομάδες έρευνας και μηχανικής μας σε σημαντικές επαγγελματικές εργασίες που οι σημερινοί πράκτορες δεν μπορούν ακόμη να ολοκληρώσουν αξιόπιστα. Αν η ομάδα σας έχει μια τέτοια εργασία, θα θέλαμε να δούμε ένα συγκεκριμένο παράδειγμα: τι ζητάτε από τον πράκτορα να κάνει, στοιχεία που δείχνουν πού αποτυγχάνει και πώς θα κρίνατε ένα επιτυχημένο αποτέλεσμα. Οι συνεργάτες θα πρέπει επίσης να μπορούν να συνεισφέρουν άτομα που γνωρίζουν σε βάθος την εργασία, ένα ασφαλές περιβάλλον δοκιμών και δεδομένα που μπορούν να χρησιμοποιηθούν με ασφάλεια για έρευνα. Αυτά μας δίνουν μια αφετηρία για να διερευνήσουμε την αποτυχία και να μετρήσουμε αν το μοντέλο βελτιώνεται.

Αν η ομάδα σας πληροί αυτές τις προϋποθέσεις, υποβάλετε αίτηση για να διερευνήσουμε μια ερευνητική συνεργασία.

Συντάκτης

OpenAI

Υποσημειώσεις

  1. 1

    Αυτά τα αποτελέσματα αφορούν τις 11 ερευνητικές εργασίες και όχι όλες τις ροές εργασίας του Ironclad. Οι χρόνοι είναι εκτιμήσεις προσομοίωσης που βασίζονται σε υποθετικές ταχύτητες επεξεργασίας και παραγωγής εξόδου των μοντέλων, όχι μετρημένη εξοικονόμηση χρόνου για τους πελάτες.

  2. 2

    Δημιουργήσαμε προσομοιωμένες εργασίες από συμβάσεις που είναι δημόσια διαθέσιμες στη βάση δεδομένων EDGAR της SEC, αφού εφαρμόσαμε φίλτρα σχεδιασμένα για την αφαίρεση προσωπικών πληροφοριών. Δεν χρησιμοποιήσαμε δεδομένα πελατών της OpenAI, εσωτερικές συμβάσεις της OpenAI ή μη δημόσια δεδομένα ή συμβάσεις πελατών της Ironclad για εκπαίδευση ή αξιολόγηση.

  3. 3

    Δείτε την παραπάνω υποσημείωση για την ερευνητική αξιολόγηση.