Ενημέρωση 31ης Ιουλίου 2026: Το υποστηριζόμενο ηχητικό αρχείο που δημιουργήθηκε με το GPT‑Live μέσω της Φωνητικής λειτουργίας ChatGPT και του OpenAI API περιλαμβάνει πλέον υδατογράφηση SynthID. Το δημόσιο εργαλείο επαλήθευσής μας μπορεί πλέον να εντοπίζει σήματα προέλευσης της OpenAI σε υποστηριζόμενα αρχεία ήχου, ενώ έχουμε εισαγάγει πρόσβαση σε API για επαλήθευση, ώστε οι προγραμματιστές και οι οργανισμοί να μπορούν να ενσωματώνουν ελέγχους προέλευσης στις δικές τους ροές εργασίας. Αυτές οι ενημερώσεις βασίζονται στην προσέγγιση ασφάλειας που περιγράφεται παρακάτω και στο ευρύτερο έργο μας για να καταστήσουμε το περιεχόμενο που δημιουργείται από την OpenAI πιο εύκολο να αναγνωριστεί.
Παρουσιάζουμε το GPT‑Live, μια νέα γενιά φωνητικών μοντέλων που κάνουν τη συνομιλία με την AI να μοιάζει πολύ περισσότερο με πραγματική συζήτηση.
Το GPT‑Live βασίζεται σε αρχιτεκτονική full-duplex, που σημαίνει ότι μπορεί να ακούει και να μιλά ταυτόχρονα. Στη διάρκεια των συνομιλιών, το GPT‑Live μπορεί να δείχνει ότι παρακολουθεί με φράσεις όπως «μμ-χμμ» ή «ναι», να συμμετέχει σε γρήγορες εναλλαγές ή απλώς να μένει σιωπηλό όταν χρειάζεστε λίγο χρόνο για να σκεφτείτε. Το αποτέλεσμα είναι μια φωνητική εμπειρία με την οποία η συνομιλία γίνεται αναπάντεχα εύκολη.
Το GPT‑Live είναι επίσης το εξυπνότερο φωνητικό μοντέλο μας μέχρι σήμερα. Για ερωτήσεις που απαιτούν αναζήτηση στον ιστό, βαθύτερη συλλογιστική ή πιο σύνθετη εργασία, αναθέτει τη δουλειά στο πιο πρόσφατο κορυφαίο μοντέλο μας στο παρασκήνιο και επαναφέρει το αποτέλεσμα στη συνομιλία όταν είναι έτοιμο. Όσο εργάζεται, το GPT‑Live μπορεί να συνεχίζει να μιλά μαζί σας και να διατηρεί τη ροή της συζήτησης. Κατά την κυκλοφορία, το GPT‑Live θα χρησιμοποιεί το GPT‑5.5 στο παρασκήνιο. Καθώς κυκλοφορούμε νέα κορυφαία μοντέλα, θα ενημερώνουμε συνεχώς το μοντέλο που χρησιμοποιεί το GPT‑Live.
Αυτές οι εξελίξεις τροφοδοτούν μια νέα εμπειρία Φωνητικής λειτουργίας ChatGPT, πιο ευφυή και φυσική στη χρήση. Με την πάροδο του χρόνου, πιστεύουμε ότι αυτή η έρευνα θα ξεκλειδώσει επίσης τη δυνατότητα χρήσης της φωνής για όλο και πιο σύνθετες, μεγαλύτερης διάρκειας και πιο πρακτορικές εργασίες.
Αρχίζουμε σήμερα να διαθέτουμε δύο εκδόσεις του GPT‑Live – GPT‑Live‑1 και GPT‑Live‑1 mini – σε χρήστες του ChatGPT σε όλο τον κόσμο. Σχεδιάζουμε επίσης να τις φέρουμε σύντομα στο API, ενώ προγραμματιστές και επιχειρήσεις μπορούν να εγγραφούν για να ειδοποιηθούν χρησιμοποιώντας αυτήν τη φόρμα.
Μπαίνοντας σε μια νέα εποχή αλληλεπίδρασης ανθρώπου-AI
Το όραμά μας είναι να καταστήσουμε δυνατή μια πραγματικά φυσική αλληλεπίδραση ανθρώπου–AI: έναν κόσμο όπου η συνεργασία με την AI μοιάζει τόσο ρευστή και άμεση όσο η συνεργασία με έναν άλλο άνθρωπο, ενώ η συλλογιστική και η εκτέλεση σύνθετων εργασιών γίνονται απρόσκοπτα στο παρασκήνιο.
Προηγούμενες προσεγγίσεις
Οι παλαιότερες γενιές φωνητικών συστημάτων AI μας έφεραν πιο κοντά σε αυτό το όραμα, αλλά με σημαντικούς συμβιβασμούς.
Διαδοχικά συστήματα φωνής
Τα διαδοχικά συστήματα φωνής βασίζονται σε μια σειρά μοντέλων που λειτουργούν το ένα μετά το άλλο για την επεξεργασία κάθε εναλλαγής. Η αρχική Φωνητική λειτουργία ChatGPT συνέδεε τρία μοντέλα μεταξύ τους: ένα μοντέλο μετατροπής ομιλίας σε κείμενο για τη μεταγραφή της ομιλίας σας, ένα μεγάλο γλωσσικό μοντέλο για την παραγωγή απάντησης και ένα μοντέλο μετατροπής κειμένου σε ομιλία για τη μετατροπή της ξανά σε ομιλία. Αυτή η προσέγγιση μας επέτρεψε να μιλήσουμε για πρώτη φορά με κορυφαία μοντέλα AI, αλλά η πολυπλοκότητα είχε τίμημα: πληροφορίες μπορούσαν να χαθούν μεταξύ των μοντέλων και οι απαντήσεις ήταν αργές και άκαμπτες.
Διαδοχικό φωνητικό σύστημα
Αργές και αφύσικες απαντήσεις, μεγάλες παύσεις
Φωνητικά μοντέλα με διακριτές εναλλαγές
Τα φωνητικά μοντέλα με διακριτές εναλλαγές, όπως η προηγμένη φωνητική λειτουργία ChatGPT, επεξεργάζονταν και παρήγαν ήχο μέσα σε ένα μόνο μοντέλο, μειώνοντας την καθυστέρηση και κάνοντας τις συνομιλίες πιο ομαλές — αλλά εξακολουθούσαν να λειτουργούν με διακριτές σειρές. Το μοντέλο έπρεπε να περιμένει να σταματήσει να μιλά ο χρήστης πριν απαντήσει, με αποτέλεσμα μια άκαμπτη εναλλαγή. Επιπλέον, επειδή η ανίχνευση της σειράς βασίζεται στη σιωπή, ακόμη και μια σύντομη παύση ή θόρυβος στο παρασκήνιο μπορούσε να εκληφθεί ως τέλος της σειράς — με αποτέλεσμα το μοντέλο να διακόπτει σε αφύσικες στιγμές.
Μοντέλο φωνητικής συνομιλίας με εναλλαγή συνομιλητή
Ελαφρώς ταχύτερες και πιο ομαλές αποκρίσεις, αλλά η αλληλεπίδραση με το μοντέλο εξακολουθεί να μοιάζει άκαμπτη
Η νέα μας προσέγγιση
Το GPT‑Live αντιμετωπίζει αυτούς τους περιορισμούς μέσω δύο αρχιτεκτονικών αλλαγών.
Συνεχής αλληλεπίδραση
Πρώτον, δημιουργήσαμε το GPT‑Live για συνεχή αλληλεπίδραση, χρησιμοποιώντας αρχιτεκτονική full-duplex. Αντί να επεξεργάζεται μια ακολουθία ξεχωριστών μηνυμάτων, το GPT‑Live επεξεργάζεται συνεχώς την είσοδο ενώ παράγει έξοδο. Έτσι, το μοντέλο μπορεί να παίρνει αποφάσεις αλληλεπίδρασης πολλές φορές το δευτερόλεπτο: αν θα μιλήσει, θα συνεχίσει να ακούει, θα κάνει παύση, θα διακόψει ή θα καλέσει ένα εργαλείο.
Αυτό επιτρέπει στο μοντέλο να συμμετέχει σε πιο φυσικές εναλλαγές, να διατηρεί καλύτερη αίσθηση του χρόνου και ακόμη και να εκτελεί ζωντανή μετάφραση.
Συνεχής αλληλεπίδραση
Γρήγορες, φυσικές, εκφραστικές απαντήσεις και πιο ενεργητική ακρόαση
Ανάθεση για πιο σύνθετες εργασίες
Δεύτερον, αποσυνδέσαμε το GPT‑Live — το οποίο χειρίζεται τη συνεχή αλληλεπίδραση — από τις πιο σύνθετες εργασίες. Όταν μια ερώτηση απαιτεί αναζήτηση, συλλογιστική ή πιο πρακτορικές δυνατότητες, το GPT‑Live μπορεί να αναθέσει την εργασία σε ένα άλλο μοντέλο, όπως το GPT‑5.5. Αυτό του επιτρέπει να συνεχίζει τη συνομιλία, ακόμη και καθώς χειρίζεται πολλαπλές εργασίες στο παρασκήνιο.
Αυτή η αρχιτεκτονική αλλαγή επιτρέπει επίσης στο GPT‑Live να χρησιμοποιεί συνεχώς τα πιο πρόσφατα μοντέλα και πράκτορες, συνδυάζοντας κορυφαία ευφυΐα με φυσική αλληλεπίδραση.
Ανάθεση για βαθύτερη εργασία
Το GPT-Live παρέχει γρήγορες, φυσικές απαντήσεις, ενώ το GPT-5.5 χειρίζεται την αναζήτηση στο παρασκήνιο
Αξιολογήσεις
Δημιουργήσαμε νέες αξιολογήσεις με ανθρώπους για να μετρήσουμε την ευχάριστη εμπειρία και τη ροή της συνομιλίας. Σε αυτές τις συγκρίσεις πρόσωπο με πρόσωπο, τα GPT‑Live‑1 και GPT‑Live‑1 mini προτιμώνται σαφώς έναντι της προηγμένης φωνητικής λειτουργίας σε αντίστοιχες συνομιλίες 5–10 λεπτών που μετρούν τη συνολική προτίμηση, την εναλλαγή σειράς ομιλίας, τις διακοπές, τη ροή της συζήτησης και το πόσο φυσική ένιωθε κάθε αλληλεπίδραση.
- GPQA: Το GPT‑Live‑1 υπερτερεί σημαντικά της προηγμένης φωνητικής λειτουργίας στο GPQA, το οποίο εξετάζει επιστημονική συλλογιστική επιπέδου ειδικού στη βιολογία, τη χημεία και τη φυσική.
- BrowseComp: Το GPT‑Live‑1 παρουσιάζει ισχυρή βελτίωση έναντι της προηγμένης φωνητικής λειτουργίας στο BrowseComp, το οποίο εξετάζει την πρακτορική αναζήτηση στον ιστό και την ικανότητα εύρεσης δύσκολα εντοπίσιμων πληροφοριών.
- τ³-Voice Telecom (εσωτερική παραλλαγή)**: Το GPT‑Live‑1 υπερτερεί της προηγμένης φωνητικής λειτουργίας στο τ³-Voice Telecom, το οποίο δοκιμάζει φωνητικούς πράκτορες σε ρεαλιστικές, πολυστροφικές εργασίες υποστήριξης τηλεπικοινωνιών.
* Τα GPT‑Live‑1 (Γρήγορο) και GPT‑Live‑1 mini χρησιμοποιούν στο παρασκήνιο το μοντέλο GPT‑5.5 Γρήγορο, ενώ τα GPT‑Live‑1 Μεσαίο και GPT‑Live‑1 Υψηλό χρησιμοποιούν το μοντέλο GPT‑5.5 Thinking με μεσαία και υψηλή προσπάθεια συλλογιστικής.
** Χρησιμοποιήσαμε ένα προσαρμοσμένο μοντέλο χρήστη, που τροφοδοτείται από τα πιο πρόσφατα μοντέλα συλλογιστικής μας, γι' αυτήν την αξιολόγηση.
Μια νέα εμπειρία Φωνητικής λειτουργίας ChatGPT
Κάθε εβδομάδα, πάνω από 150 εκατομμύρια άνθρωποι μιλούν στο ChatGPT χρησιμοποιώντας λειτουργίες όπως η Φωνητική λειτουργία και η Υπαγόρευση. Τη χρησιμοποιούν για καθημερινή βοήθεια χωρίς χέρια, για εξάσκηση σε γλώσσες, για να αφηγηθούν παραμύθια πριν τον ύπνο ή απλώς για να συζητήσουν στη διαδρομή τους.
Από σήμερα, όταν πατάτε το κουμπί Φωνής για να μιλήσετε με το ChatGPT, θα έχετε μια βελτιωμένη εμπειρία με την υποστήριξη του GPT‑Live — με πιο φυσικές συνομιλίες, εξυπνότερες απαντήσεις, καλύτερη ακρόαση και οπτικές αποκρίσεις.
Πιο φυσικές συνομιλίες
Η συνομιλία με το ChatGPT θα πρέπει πλέον να μοιάζει πολύ περισσότερο με πραγματική συζήτηση. Μπορείτε να διακόψετε με μια ερώτηση, να κάνετε παύση για να συγκεντρώσετε τις σκέψεις σας ή να ζητήσετε από το ChatGPT να μιλά πιο αργά. Αναγνωρίζει φυσικά όσα λέτε με φράσεις όπως «μμ-χμμ» ή «το ’πιασα», ώστε να ξέρετε ότι σας παρακολουθεί. Έχουμε επίσης ανανεώσει τις εννέα ξεχωριστές φωνές στο ChatGPT για το GPT‑Live.
Εξυπνότερες απαντήσεις
Η Φωνητική λειτουργία ChatGPT μπορεί πλέον να αξιοποιεί τα πιο πρόσφατα κορυφαία μοντέλα μας, προσφέροντάς σας εξυπνότερες απαντήσεις όταν τις χρειάζεστε. Μπορείτε επίσης να επιλέξετε το επίπεδο συλλογιστικής που ταιριάζει στις ανάγκες σας: Instant για γρήγορες απαντήσεις ή Medium και High όταν θέλετε το ChatGPT να αφιερώσει περισσότερο χρόνο στη σκέψη.
Καλύτερη ακρόαση
Αν χρειαστείτε λίγο χρόνο για να σκεφτείτε, η Φωνητική λειτουργία ChatGPT πλέον περιμένει αντί να πετάγεται και να σας διακόπτει. Αν της ζητήσετε να μείνει σιωπηλή και να ακούσει, θα το κάνει. Και όταν υπάρχει θόρυβος στο παρασκήνιο, όπως διερχόμενη κίνηση ή κοντινές συζητήσεις, το ChatGPT εστιάζει καλύτερα στη φωνή σας αντί να αποσπάται.
Οπτικές απαντήσεις με μια ματιά
Ορισμένες απαντήσεις είναι πιο χρήσιμες όταν μπορείτε να τις δείτε. Ενώ μιλάτε, το ChatGPT μπορεί πλέον να εμφανίζει πλούσιες οπτικές κάρτες για θέματα όπως ο καιρός, οι μετοχές, τα αθλητικά και άλλα. Η Φωνητική λειτουργία συνεχίζει επίσης να υποστηρίζει αναζήτηση, μνήμη, εικόνες και μεταφορτώσεις αρχείων.



Το αποτέλεσμα είναι μια εμπειρία Φωνητικής λειτουργίας ChatGPT που μοιάζει πιο φυσική, είναι πιο ικανή και πιο χρήσιμη στην καθημερινή ζωή.
Ασφάλεια σχεδιασμένη για φωνή
Το GPT‑Live σχεδιάστηκε ώστε να είναι ασφαλές από προεπιλογή. Βασίζεται στις προόδους ασφάλειας των πιο πρόσφατων μοντέλων μας, προσθέτοντας παράλληλα ειδική εκπαίδευση ασφάλειας σε βασικούς τομείς κινδύνου και νέες διασφαλίσεις σχεδιασμένες ειδικά για τη φωνή.
Διευρυμένες δοκιμές ασφάλειας
Για να αντικατοπτρίσουμε καλύτερα τον τρόπο με τον οποίο οι άνθρωποι χρησιμοποιούν τη φωνή σε πραγματικές συνθήκες, ξεκινήσαμε διευρύνοντας τις δοκιμές ασφάλειας ώστε να περιλαμβάνουν νέες αξιολογήσεις που είναι εγγενείς στον ήχο. Δημιουργήσαμε επίσης συνθετικές αξιολογήσεις που χρησιμοποιούν παραγόμενο ήχο για να εστιάσουν πιο εντατικά σε βασικούς τομείς ασφάλειας, αξιοποιώντας όσα μάθαμε από την προηγμένη φωνητική λειτουργία. Αυτοί οι τομείς περιλαμβάνουν τον αυτοτραυματισμό, την ψύχωση και τη μανία, την συναισθηματική εξάρτηση από την AI, τη βία και το σεξουαλικό περιεχόμενο. Εσωτερικοί ειδικοί υπέβαλαν επίσης το μοντέλο σε red-teaming για κινδύνους που αφορούν αποκλειστικά τη φωνή.
Στις δοκιμές μας, το GPT‑Live είχε επίδοση συγκρίσιμη ή καλύτερη από την προηγμένη φωνητική λειτουργία σε σχεδόν όλους τους τομείς που αξιολογήσαμε. Μπορείτε να διαβάσετε περισσότερα για τις δοκιμές και τις διασφαλίσεις μας στην κάρτα συστήματος(ανοίγει σε νέο παράθυρο) του GPT‑Live.
Ενσωματωμένες διασφαλίσεις
Επειδή οι φωνητικές συνομιλίες εξελίσσονται σε πραγματικό χρόνο, δημιουργήσαμε επίσης διασφαλίσεις που μπορούν να ενεργούν ενώ το μοντέλο μιλά. Όταν το σύστημα εντοπίζει δυνητικά μη ασφαλή έξοδο, μπορεί να κατευθύνει το μοντέλο προς μια ασφαλέστερη απάντηση, να εμφανίσει πρόσθετα μηνύματα ή πόρους ασφάλειας ή, σε περιπτώσεις υψηλότερου κινδύνου, να τερματίσει τη φωνητική συνομιλία. Για συνομιλίες που αφορούν αυτοτραυματισμό, προσαρμόσαμε τις ροές υποστήριξης του ChatGPT για τη φωνή, συμπεριλαμβανομένης της προσφοράς υποστήριξης από γραμμές βοήθειας κρίσης ελεγμένες από ειδικούς.
Σχεδιάσαμε πρόσθετες προστασίες για την υποστήριξη εφήβων χρηστών και εκπαιδεύσαμε απευθείας στο μοντέλο συμπεριφορά κατάλληλη για την ηλικία, ώστε να μειωθεί ο κίνδυνος ακατάλληλων απαντήσεων. Οι γονείς μπορούν να επιλέξουν αν ο έφηβός τους μπορεί να χρησιμοποιεί τη Φωνητική λειτουργία ChatGPT μέσω των γονικών ελέγχων, ενώ οι συνδεδεμένοι γονείς μπορεί να ειδοποιούνται σε καταστάσεις υψηλότερου κινδύνου που περιλαμβάνουν ενδείξεις πιθανού αυτοτραυματισμού ή πρόθεσης αυτοκτονίας.
Μαθαίνοντας από τη χρήση στον πραγματικό κόσμο
Εισάγουμε επίσης πιο μακροπρόθεσμη μέτρηση και παρακολούθηση μετά την κυκλοφορία, εστιασμένες στη συναισθηματική εξάρτηση, ώστε να συνεχίσουμε να βελτιώνουμε την κατανόησή μας και να τελειοποιούμε τις διασφαλίσεις. Βασιζόμενοι στην προηγούμενη έρευνά μας σχετικά με την συναισθηματική χρήση και τη συναισθηματική ευημερία, αυτό θα μας βοηθήσει να εντοπίζουμε αναδυόμενα μοτίβα και να βελτιώνουμε τον τρόπο με τον οποίο το σύστημα ανταποκρίνεται σε συναισθηματικά ευαίσθητες αλληλεπιδράσεις.
Τέλος, το GPT‑Live έχει σχεδιαστεί για συνομιλία, όχι για μίμηση φωνής. Χρησιμοποιεί ένα σύνολο προκαθορισμένων φωνών στο ChatGPT, με διασφαλίσεις που το εμποδίζουν να μιμείται τη φωνή ενός πραγματικού ανθρώπου.
Δεσμευόμαστε να υποστηρίζουμε την ασφάλεια και την ευημερία και θα συνεχίσουμε να ενισχύουμε αυτές τις προστασίες καθώς μαθαίνουμε από τη χρήση στον πραγματικό κόσμο.
Διαθεσιμότητα & περιορισμοί
Το GPT‑Live διατίθεται τώρα σταδιακά σε χρήστες του ChatGPT παγκοσμίως σε iOS, Android και ChatGPT.com(ανοίγει σε νέο παράθυρο). Το GPT‑Live‑1 θα γίνει το προεπιλεγμένο μοντέλο που τροφοδοτεί τη Φωνητική λειτουργία ChatGPT για χρήστες Go, Plus και Pro, ενώ το GPT‑Live‑1 mini θα γίνει το προεπιλεγμένο για τους δωρεάν χρήστες. Περισσότερες λεπτομέρειες διαθεσιμότητας μπορείτε να βρείτε στο Κέντρο Βοήθειας(ανοίγει σε νέο παράθυρο) μας.
Έχουμε βελτιστοποιήσει το GPT‑Live για ορισμένες από τις πιο δημοφιλείς γλώσσες στο ChatGPT. Για ορισμένες γλώσσες, το μοντέλο μπορεί να έχει μη φυσική προφορά ή κενά στην ευχέρεια. Εργαζόμαστε ενεργά για να βελτιώσουμε την εμπειρία σε όλες τις γλώσσες.
Κατά την κυκλοφορία, το GPT‑Live δεν θα υποστηρίζει φωνή με βίντεο ή κοινή χρήση οθόνης στο ChatGPT, αλλά εργαζόμαστε για να παρουσιάσουμε σύντομα αυτές τις δυνατότητες. Μπορείτε ακόμη να έχετε πρόσβαση σε παλαιότερες εκδόσεις της Φωνητικής λειτουργίας ChatGPT, συμπεριλαμβανομένων της Standard και της προηγμένης φωνητικής λειτουργίας, όπου αυτές οι δυνατότητες είναι διαθέσιμες.


