Μετάβαση στο κύριο περιεχόμενο
OpenAI

20 Μαρτίου 2025

ΈκδοσηΠροϊόν

Παρουσιάζουμε μοντέλα ήχου επόμενης γενιάς στο API

Μια νέα σουίτα μοντέλων ήχου για την ενίσχυση φωνητικών πρακτόρων, τώρα διαθέσιμη σε προγραμματιστές παγκοσμίως.

Εικόνα κεντρικού θέματος blog για τα μοντέλα ήχου επόμενης γενιάς της OpenAI
Φόρτωση…

Ενημέρωση στις 28 Αυγούστου 2025: Ανακοινώσαμε τη γενική διαθεσιμότητα του Realtime API. Μάθετε περισσότερα εδώ.


Τους τελευταίους μήνες, έχουμε επενδύσει στην προώθηση της νοημοσύνης, των δυνατοτήτων και της χρησιμότητας των πρακτόρων που βασίζονται σε κείμενο—ή συστημάτων που ολοκληρώνουν ανεξάρτητα εργασίες εκ μέρους των χρηστών—με κυκλοφορίες όπως ο εκπρόσωπος, η έρευνα σε βάθος, οι πράκτορες που χρησιμοποιούν υπολογιστή και το Responses API με ενσωματωμένα εργαλεία. Ωστόσο, για να είναι οι πράκτορες πραγματικά χρήσιμοι, οι άνθρωποι πρέπει να μπορούν να έχουν βαθύτερες, πιο διαισθητικές αλληλεπιδράσεις με τους πράκτορες πέρα από το απλό κείμενο—χρησιμοποιώντας φυσική προφορική γλώσσα για να επικοινωνούν αποτελεσματικά.

Σήμερα, λανσάρουμε νέα μοντέλα μετατροπής ομιλίας σε κείμενο και κειμένου σε ομιλία στο API—επιτρέποντας τη δημιουργία πιο ισχυρών, προσαρμόσιμων και έξυπνων φωνητικών πρακτόρων που προσφέρουν πραγματική αξία. Τα πιο πρόσφατα μοντέλα μας για μετατροπή ομιλίας σε κείμενο θέτουν ένα νέο σημείο αναφοράς στην κορυφαία απόδοση, υπερβαίνοντας τις υπάρχουσες λύσεις σε ακρίβεια και αξιοπιστία—ειδικά σε απαιτητικά σενάρια που περιλαμβάνουν προφορές, θορυβώδη περιβάλλοντα και διαφορετικές ταχύτητες ομιλίας. Αυτές οι βελτιώσεις αυξάνουν την αξιοπιστία της απομαγνητοφώνησης, καθιστώντας τα μοντέλα ιδιαίτερα κατάλληλα για περιπτώσεις χρήσης όπως τα τηλεφωνικά κέντρα εξυπηρέτησης πελατών, η απομαγνητοφώνηση σημειώσεων συσκέψεων και άλλα.

Για πρώτη φορά, οι προγραμματιστές μπορούν επίσης να δώσουν οδηγίες στο μοντέλο μετατροπής κειμένου σε ομιλία να μιλήσει με έναν συγκεκριμένο τρόπο—για παράδειγμα, «μίλα όπως μιλάει ένας εκπρόσωπος εξυπηρέτησης πελατών που δείχνει κατανόηση»—ξεκλειδώνοντας ένα νέο επίπεδο προσαρμογής για φωνητικούς πράκτορες. Αυτό επιτρέπει ένα ευρύ φάσμα προσαρμοσμένων εφαρμογών, από πιο ενσυναισθητικές και δυναμικές φωνές εξυπηρέτησης πελατών έως εκφραστική αφήγηση για δημιουργικές εμπειρίες αφήγησης.

Λανσάραμε το πρώτο μας μοντέλο ήχου το 2022 και από τότε, έχουμε δεσμευτεί να βελτιώνουμε τη νοημοσύνη, την ακρίβεια και την αξιοπιστία αυτών των μοντέλων. Με αυτά τα νέα μοντέλα ήχου, οι προγραμματιστές μπορούν να δημιουργήσουν πιο ακριβή και ανθεκτικά συστήματα μετατροπής ομιλίας σε κείμενο και εκφραστικές, με χαρακτήρα φωνές μετατροπής κειμένου σε ομιλία—όλα εντός του API.

Ήρεμος
Σέρφερ
Επαγγελματικά
Μεσαιωνικός ιππότης
Λάτρης τίτλων αληθινού εγκλήματος
Ιστορία για καληνύχτα

Μάθετε περισσότερα για τα πιο πρόσφατα μοντέλα ήχου μας

Νέα μοντέλα μετατροπής ομιλίας σε κείμενο

Παρουσιάζουμε τα νέα μοντέλα gpt-4o-transcribe και gpt-4o-mini-transcribe με βελτιώσεις στο ποσοστό σφαλμάτων λέξεων και καλύτερη αναγνώριση γλώσσας και ακρίβεια, σε σύγκριση με τα αρχικά μοντέλα Whisper.

To gpt-4o-transcribe επιδεικνύει βελτιωμένη απόδοση στο Ποσοστό Σφάλματος Λέξεων (WER) σε σχέση με τα υπάρχοντα μοντέλα Whisper σε πολλαπλούς καθιερωμένους δείκτες αξιολόγησης, αντανακλώντας σημαντική πρόοδο στην τεχνολογία μας μετατροπής ομιλίας σε κείμενο. Αυτές οι εξελίξεις προέρχονται άμεσα από στοχευμένες καινοτομίες στην ενισχυτική μάθηση και εκτεταμένη ενδιάμεση εκπαίδευση με ποικίλα και υψηλής ποιότητας σύνολα δεδομένων ήχου.

Ως αποτέλεσμα, αυτά τα νέα μοντέλα μετατροπής ομιλίας σε κείμενο μπορούν να αποτυπώνουν καλύτερα τις αποχρώσεις της ομιλίας, να μειώνουν τις εσφαλμένες αναγνωρίσεις και να αυξάνουν την αξιοπιστία της μεταγραφής, ειδικά σε απαιτητικά σενάρια που περιλαμβάνουν προφορές, θορυβώδη περιβάλλοντα και διαφορετικές ταχύτητες ομιλίας. Αυτά τα μοντέλα είναι πλέον διαθέσιμα στο API μετατροπής ομιλίας σε κείμενο(ανοίγει σε νέο παράθυρο).

Το Ποσοστό Σφάλματος Λέξεων (WER) μετρά την ακρίβεια των μοντέλων αναγνώρισης ομιλίας υπολογίζοντας το ποσοστό των λανθασμένα μεταγραμμένων λέξεων σε σύγκριση με μια μεταγραφή αναφοράς—όσο χαμηλότερο είναι το WER, τόσο το καλύτερο, καθώς αυτό σημαίνει λιγότερα σφάλματα. Τα πιο πρόσφατα μοντέλα μετατροπής ομιλίας σε κείμενο που αναπτύσσουμε επιτυγχάνουν χαμηλότερο WER σε όλες τις αξιολογήσεις, συμπεριλαμβανομένου του FLEURS (αξιολόγηση μάθησης με λίγα παραδείγματα των καθολικών αναπαραστάσεων ομιλίας)—ενός πολυγλωσσικού δείκτη αξιολόγησης ομιλίας που καλύπτει πάνω από 100 γλώσσες, χρησιμοποιώντας δείγματα ήχου που έχουν μεταγραφεί χειροκίνητα. Αυτά τα αποτελέσματα καταδεικνύουν μεγαλύτερη ακρίβεια μεταγραφής και πιο ανθεκτική κάλυψη γλωσσών. Όπως φαίνεται εδώ, τα μοντέλα μας υπερέχουν σταθερά έναντι του Whisper v2 και του Whisper v3 σε όλες τις γλωσσικές αξιολογήσεις.

Στο FLEURS, τα μοντέλα μας επιτυγχάνουν χαμηλότερο WER και ισχυρή πολυγλωσσική απόδοση. Όσο χαμηλότερο είναι το WER, τόσο το καλύτερο και με λιγότερα σφάλματα. Όπως φαίνεται εδώ, τα μοντέλα μας ανταγωνίζονται ή υπερέχουν άλλων κορυφαίων μοντέλων στις περισσότερες κύριες γλώσσες.

Νέο μοντέλο μετατροπής κειμένου σε φωνή

Επίσης, παρουσιάζουμε ένα νέο μοντέλο gpt-4o-mini-tts με βελτιωμένη δυνατότητα καθοδήγησης. Για πρώτη φορά, οι προγραμματιστές μπορούν να «καθοδηγήσουν» το μοντέλο όχι μόνο στο τι να πει αλλά και πώς να το πει—επιτρέποντας πιο εξατομικευμένες εμπειρίες για περιπτώσεις χρήσης που κυμαίνονται από την εξυπηρέτηση πελατών έως τη δημιουργική αφήγηση. Το μοντέλο είναι διαθέσιμο στο API μετατροπής κειμένου σε ομιλία(ανοίγει σε νέο παράθυρο). Σημειώστε ότι αυτά τα μοντέλα μετατροπής κειμένου σε ομιλία περιορίζονται σε τεχνητές, προκαθορισμένες φωνές, τις οποίες παρακολουθούμε για να διασφαλίσουμε ότι αντιστοιχούν σταθερά στις συνθετικές προκαθορισμένες ρυθμίσεις.

Οι τεχνικές καινοτομίες πίσω από τα μοντέλα

Προεκπαίδευση με αυθεντικά σύνολα δεδομένων ήχου

Τα νέα μας μοντέλα ήχου βασίζονται στις αρχιτεκτονικές GPT‑4o και GPT‑4o‑mini και έχουν προεκπαιδευτεί εκτενώς σε εξειδικευμένα, ηχοκεντρικά σύνολα δεδομένων, τα οποία είναι εξαιρετικά σημαντικά για τη βελτιστοποίηση της απόδοσης του μοντέλου. Αυτή η στοχευμένη προσέγγιση παρέχει βαθύτερη κατανόηση των αποχρώσεων της ομιλίας και επιτρέπει εξαιρετική απόδοση σε εργασίες που σχετίζονται με τον ήχο.

Προηγμένες μεθοδολογίες απόσταξης

Έχουμε βελτιώσει τις τεχνικές απόσταξης, επιτρέποντας τη μεταφορά γνώσης από τα μεγαλύτερα ηχητικά μας μοντέλα σε μικρότερα, πιο αποδοτικά μοντέλα. Αξιοποιώντας προηγμένες μεθοδολογίες αυτο-εκπαίδευσης, τα σύνολα δεδομένων απόσταξής μας αποτυπώνουν αποτελεσματικά ρεαλιστικές δυναμικές συνομιλίας, αναπαράγοντας αυθεντικές αλληλεπιδράσεις χρήστη-βοηθού. Αυτό βοηθά τα μικρότερα μοντέλα μας να προσφέρουν εξαιρετική ποιότητα συνομιλίας και ανταπόκριση.

Παράδειγμα ενισχυτικής μάθησης

Για τα μοντέλα μετατροπής ομιλίας σε κείμενο, έχουμε ενσωματώσει ένα παράδειγμα με έντονη χρήση της ενισχυτικής μάθησης (RL), αυξάνοντας την ακρίβεια μεταγραφής σε επίπεδα αιχμής. Αυτή η μεθοδολογία βελτιώνει δραματικά την ακρίβεια και μειώνει τις παραισθήσεις, καθιστώντας τις λύσεις μας για μετατροπή ομιλίας σε κείμενο εξαιρετικά ανταγωνιστικές σε σύνθετα σενάρια αναγνώρισης ομιλίας.

Αυτές οι εξελίξεις αντιπροσωπεύουν πρόοδο στον τομέα της μοντελοποίησης ήχου, συνδυάζοντας καινοτόμες μεθοδολογίες με πρακτικές βελτιώσεις για βελτιωμένη απόδοση σε εφαρμογές ομιλίας.

Διαθεσιμότητα API

Αυτά τα νέα μοντέλα ήχου είναι τώρα διαθέσιμα σε όλους τους προγραμματιστές – περισσότερες πληροφορίες για την ανάπτυξη με ήχο εδώ(ανοίγει σε νέο παράθυρο). Για προγραμματιστές που ήδη δημιουργούν εμπειρίες συνομιλίας με μοντέλα που βασίζονται σε κείμενο, η προσθήκη των μοντέλων μας για μετατροπή ομιλίας σε κείμενο και κειμένου σε ομιλία είναι ο απλούστερος τρόπος για να δημιουργήσετε έναν φωνητικό πράκτορα. Κυκλοφορούμε μια ενσωμάτωση με το Agents SDK(ανοίγει σε νέο παράθυρο) που απλοποιεί αυτή τη διαδικασία ανάπτυξης. Για προγραμματιστές που επιθυμούν να δημιουργήσουν εμπειρίες ομιλία σε ομιλία χαμηλής καθυστέρησης, συνιστούμε να χρησιμοποιήσετε τα μοντέλα ομιλία σε ομιλία στο Realtime API.

Επόμενα βήματα

Στο μέλλον, σκοπεύουμε να συνεχίσουμε να επενδύουμε στη βελτίωση της ευφυΐας και της ακρίβειας των μοντέλων ήχου μας και να εξερευνούμε τρόπους που θα επιτρέπουν στους προγραμματιστές να φέρνουν τις δικές τους προσαρμοσμένες φωνές, ώστε να δημιουργούν ακόμη πιο εξατομικευμένες εμπειρίες με τρόπους που ευθυγραμμίζονται με τα πρότυπα ασφαλείας μας. Επιπλέον, συνεχίζουμε να συμμετέχουμε σε συζητήσεις με υπεύθυνους χάραξης πολιτικής, ερευνητές, προγραμματιστές και δημιουργούς σχετικά με τις προκλήσεις και τις ευκαιρίες που μπορούν να παρουσιάσουν οι συνθετικές φωνές. Είμαστε ενθουσιασμένοι που θα δούμε τις καινοτόμες και δημιουργικές εφαρμογές που θα αναπτύξουν οι προγραμματιστές χρησιμοποιώντας αυτές τις βελτιωμένες δυνατότητες ήχου. Θα επενδύσουμε επίσης σε άλλες μορφές—συμπεριλαμβανομένου του βίντεο—για να δώσουμε τη δυνατότητα στους προγραμματιστές να δημιουργούν πολυτροπικές εμπειρίες πρακτόρων.

Επανάληψη ζωντανής μετάδοσης

Συντάκτες

OpenAI

Επικεφαλής Έρευνας

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Συνεισφέροντες

Έρευνα

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Μηχανική

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Προϊόν

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Ηγετική ομάδα χορηγών

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry