Îți prezentăm modelele audio de ultimă generație din API
O nouă suită de modele audio pentru a alimenta agenții vocali, acum disponibilă pentru dezvoltatorii din întreaga lume.

Actualizare din 28 august 2025: am anunțat disponibilitatea generală a API-ului Realtime. Află mai multe aici.
În ultimele câteva luni, am investit în avansarea inteligenței, capacităților și utilității agenților bazați pe text — sisteme care îndeplinesc independent sarcini pentru utilizatori — prin lansări precum Operator, Cercetare Aprofundată, Agenți de Utilizare a Computerului și API-ul Responses cu instrumente integrate. Totuși, pentru ca agenții să fie cu adevărat utili, oamenii trebuie să poată avea interacțiuni mai profunde și mai intuitive cu agenții, dincolo de simplul text - folosind limbajul vorbit natural pentru a comunica eficient.
Astăzi, lansăm noi modele audio de conversie vorbire-în-text și text-în-vorbire în API — făcând posibilă crearea unor agenți vocali mai puternici, personalizabili și inteligenți, care oferă valoare reală. Modelele noastre cele mai recente de conversie a vorbirii în text au stabilit un nou standard de vârf, depășind soluțiile existente în ceea ce privește precizia și fiabilitatea — mai ales în scenarii dificile care implică accente, medii zgomotoase și viteze variabile ale vorbirii. Aceste îmbunătățiri sporesc fiabilitatea transcrierii, ceea ce face ca modelele să fie deosebit de potrivite pentru cazuri de utilizare precum centrele de asistență pentru clienți, transcrierea notelor de ședință și multe altele.
Pentru prima dată, dezvoltatorii pot, de asemenea, să instruiască modelul de text-în-vorbire să vorbească într-un mod specific — de exemplu, „vorbește ca un agent empatic de asistență pentru clienți” — deblocând un nou nivel de personalizare pentru agenții vocali. Acest lucru permite o gamă largă de aplicații personalizate, de la voci mai empatice și dinamice pentru serviciul de asistență clienți până la narațiuni expresive pentru experiențe creative de povestire.
Am lansat primul nostru model audio în 2022 și, de atunci, ne-am angajat să îmbunătățim inteligența, precizia și fiabilitatea acestor modele. Cu aceste noi modele audio, dezvoltatorii pot construi sisteme de conversie vorbire-în-text mai precise și mai robuste și voci de sinteză vocală mai expresive și pline de personalitate — toate în cadrul API-ului.
Introducem noi modele gpt-4o-transcribe și gpt-4o-mini-transcribe, cu îmbunătățiri ale ratei de eroare a cuvintelor, o recunoaștere mai bună a limbii și o acuratețe mai ridicată, comparativ cu modelele originale Whisper.
gpt-4o-transcribe demonstrează o îmbunătățire a performanței ratei de eroare a cuvintelor (WER) față de modelele Whisper existente, pe mai multe repere consacrate, reflectând progrese semnificative în tehnologia noastră de transcriere a vorbirii în text. Aceste progrese provin direct din inovații țintite în învățarea prin consolidare și dintr-un antrenament intermediar extins cu seturi de date audio diverse și de înaltă calitate.
Ca urmare, aceste noi modele de transcriere vocală pot surprinde mai bine nuanțele vorbirii, pot reduce recunoașterile greșite și pot crește fiabilitatea transcrierii, mai ales în scenarii dificile care implică accente, medii zgomotoase și viteze de vorbire variabile. Aceste modele sunt disponibile acum în API-ul de conversie a vorbirii în text(se deschide într-o fereastră nouă).
Rata de eroare a cuvintelor (WER) măsoară precizia modelelor de recunoaștere a vorbirii prin calcularea procentului de cuvinte transcrise incorect comparativ cu o transcriere de referință — un WER mai mic este mai bun și înseamnă mai puține erori. Cele mai recente modele ale noastre de conversie a vorbirii în text obțin un WER mai mic în cadrul testelor de performanță, inclusiv FLEURS (Evaluarea învățării cu câteva exemple a reprezentărilor universale ale vorbirii) — un test de performanță multilingv de vorbire care acoperă peste 100 de limbi, folosind mostre audio transcrise manual. Aceste rezultate demonstrează o acuratețe mai mare a transcrierii și o acoperire lingvistică mai robustă. Așa cum se arată aici, modelele noastre depășesc constant Whisper v2 și Whisper v3 în toate evaluările lingvistice.
Pe FLEURS, modelele noastre oferă un WER mai mic și performanțe multilingve puternice. Cu cât WER este mai mic, cu atât este mai bun și înseamnă mai puține erori. Așa cum se arată aici, modelele noastre se potrivesc cu sau depășesc alte modele de top în majoritatea limbilor importante.
De asemenea, lansăm un nou model gpt-4o-mini-tts cu o manevrabilitate mai bună. Pentru prima dată, dezvoltatorii pot „instrui” modelul nu doar ce să spună, ci cum să o spună — permițând experiențe mai personalizate pentru cazuri de utilizare, de la asistență pentru clienți până la povestirea creativă. Modelul este disponibil în API-ul de conversie text-în-vorbire(se deschide într-o fereastră nouă). Reține că aceste modele de text-în-vorbire sunt limitate la voci artificiale, prestabilite, pe care le monitorizăm pentru a ne asigura că se potrivesc consecvent cu presetările sintetice.
Noile noastre modele audio se bazează pe arhitecturile GPT‑4o și GPT‑4o‑mini și sunt antrenate în prealabil pe seturi de date specializate, centrate pe audio, care au fost esențiale în optimizarea performanței modelului. Această abordare țintită oferă o perspectivă mai profundă asupra nuanțelor vorbirii și permite performanțe excepționale în sarcinile legate de audio.
Am îmbunătățit tehnicile noastre de distilare, permițând transferul de cunoștințe de la cele mai mari modele audio ale noastre la modele mai mici și mai eficiente. Folosind metodologii avansate de auto-redare, seturile noastre de date de distilare surprind eficient dinamici conversaționale realiste, replicând interacțiuni autentice utilizator-asistent. Acest lucru ajută modelele noastre mai mici să ofere o excelentă calitate conversațională și capacitate de reacție.
Pentru modelele noastre de conversie a vorbirii în text, am integrat o paradigmă puternic axată pe învățare prin consolidare (RL), ridicând acuratețea transcrierii la niveluri de vârf. Această metodologie îmbunătățește dramatic precizia și reduce halucinațiile, făcând soluțiile noastre de conversie a vorbirii în text excepțional de competitive în scenarii complexe de recunoaștere a vorbirii.
Aceste evoluții reprezintă un progres în domeniul modelării audio, combinând metodologii inovatoare cu îmbunătățiri practice pentru a spori performanța în aplicațiile de vorbire.
Aceste noi modele audio sunt disponibile acum pentru toți dezvoltatorii – mai multe despre cum să construiești cu audio aici(se deschide într-o fereastră nouă). Pentru dezvoltatorii care creează deja experiențe conversaționale cu modele bazate pe text, adăugarea modelelor noastre de conversie vorbire-în-text și text-în-vorbire este cea mai simplă modalitate de a construi un agent vocal. Lansăm o integrare cu SDK pentru agenți(se deschide într-o fereastră nouă), care simplifică acest proces de dezvoltare. Pentru dezvoltatorii care doresc să creeze experiențe de tip vorbire-în-vorbire cu latență redusă, vă recomandăm să folosiți modelele noastre de tip vorbire-în-vorbire în API-ul Realtime.
Privind spre viitor, plănuim să continuăm să investim în îmbunătățirea inteligenței și preciziei modelelor noastre audio și să explorăm modalități de a permite dezvoltatorilor să-și aducă propriile voci personalizate pentru a crea experiențe și mai personalizate, în moduri care se aliniază cu standardele noastre de siguranță. În plus, continuăm să purtăm conversații cu factorii de decizie politică, cercetători, dezvoltatori și creatori despre provocările și oportunitățile pe care le pot prezenta vocile sintetice. Suntem entuziasmați să vedem aplicațiile inovatoare și creative pe care dezvoltatorii le vor construi folosind aceste capabilități audio îmbunătățite. De asemenea, vom investi în alte modalități — incluzând video — pentru a le permite dezvoltatorilor să creeze experiențe agentive multimodale.
Autori
Cercetători
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Contribuitori
Cercetare
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Inginerie
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragoș Oprică, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produs
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Susținători ai conducerii
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry