Ti presentiamo i modelli audio di nuova generazione nell’API
Una nuova suite di modelli audio per potenziare gli agenti vocali, ora disponibile per gli sviluppatori di tutto il mondo.

Aggiornamento del 28/08/2025: abbiamo annunciato la disponibilità generale dell'API Realtime. Scopri di più qui.
Negli ultimi mesi abbiamo investito nello sviluppo dell'intelligenza, delle capacità e dell'utilità degli agenti basati su testo, sistemi in grado di portare a termine compiti in autonomia per conto degli utenti, con rilasci come Operator, Deep Research, agenti IA informatici e l'API Responses con strumenti integrati. Tuttavia, affinché gli agenti siano davvero utili, le persone devono poter avere interazioni più profonde e intuitive con gli agenti, oltre il semplice testo, usando il linguaggio parlato naturale per comunicare efficacemente.
Oggi introduciamo nell'API nuovi modelli audio di speech-to-text e text-to-speech, che consentono di costruire agenti vocali più intelligenti, personalizzabili e performanti. I nostri modelli più recenti di speech-to-text stabiliscono un nuovo punto di riferimento all'avanguardia, superando le soluzioni esistenti in termini di accuratezza e affidabilità, soprattutto in scenari difficili che coinvolgono accenti, ambienti rumorosi e velocità di parlato variabili. Questi miglioramenti aumentano l'affidabilità della trascrizione, rendendo i modelli particolarmente adatti a casi d'uso come i call center per l'assistenza clienti, la trascrizione degli appunti presi durante le riunioni e altro ancora.
Per la prima volta, gli sviluppatori possono anche istruire il modello di text-to-speech a parlare in un modo specifico, ad esempio “parla come un agente del servizio clienti empatico“, aggiungendo un nuovo livello di personalizzazione per gli agenti vocali. Questo consente un'ampia gamma di applicazioni personalizzate, dalle voci più empatiche e dinamiche per il servizio clienti a una narrazione espressiva per esperienze di storytelling creativo.
Abbiamo lanciato il nostro primo modello audio nel 2022 e da allora ci siamo impegnati a migliorare l’intelligenza, la precisione e l’affidabilità di questi modelli. Con questi nuovi modelli audio, gli sviluppatori possono creare sistemi speech-to-text più accurati e validi e voci text-to-speech ricche di personalità, tutto all'interno dell'API.
Presentiamo i nuovi modelli gpt-4o-transcribe e gpt-4o-mini-transcribe, che offrono un tasso di Word Error Rate più basso e una maggiore accuratezza nel riconoscimento delle lingue rispetto ai modelli Whisper originali.
gpt-4o-transcribe dimostra un miglioramento delle prestazioni in termini di Word Error Rate (WER) rispetto ai modelli Whisper esistenti su diversi benchmark consolidati, riflettendo progressi significativi nella nostra tecnologia di riconoscimento vocale. Questi progressi derivano direttamente da innovazioni mirate nell'apprendimento per rinforzo e da un ampio addestramento intermedio con set di dati audio diversificati e di alta qualità.
Di conseguenza, questi nuovi modelli di riconoscimento vocale riescono a cogliere meglio le sfumature del parlato, ridurre gli errori di trascrizione e aumentare l'affidabilità, soprattutto in scenari complessi con accenti diversi, ambienti rumorosi e velocità di parlato variabili. Questi modelli sono ora disponibili nell'API di riconoscimento vocale(si apre in una nuova finestra).
Il Word Error Rate (WER) misura l'accuratezza dei modelli di riconoscimento vocale calcolando la percentuale di parole trascritte in modo errato rispetto a una trascrizione di riferimento: un WER più basso è migliore e significa meno errori. I nostri più recenti modelli di speech-to-text ottengono valori di WER più bassi nei benchmark, incluso FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), un benchmark multilingue per il parlato che copre oltre 100 lingue e utilizza campioni audio trascritti manualmente. Questi risultati dimostrano maggiore accuratezza nella trascrizione e una copertura linguistica più solida. Come mostrato qui, i nostri modelli superano costantemente Whisper v2 e Whisper v3 in tutte le valutazioni linguistiche.
Su FLEURS, i nostri modelli offrono un WER più basso e prestazioni multilingue eccellenti. Un WER più basso è migliore e comporta meno errori. Come mostrato qui, i nostri modelli eguagliano o superano altri modelli leader nella maggior parte delle lingue principali.
Stiamo anche lanciando un nuovo modello gpt-4o-mini-tts con una migliore manovrabilità. Per la prima volta, gli sviluppatori possono “istruire“ il modello non solo su cosa dire ma su come dirlo, consentendo esperienze più personalizzate per casi d'uso che vanno dal servizio clienti alla narrazione creativa. Il modello è disponibile nell'API text-to-speech (si apre in una nuova finestra). Tieni presente che questi modelli di text-to-speech sono limitati a voci artificiali preimpostate, che monitoriamo per garantire che corrispondano sempre ai preset sintetici.
I nostri nuovi modelli audio si basano sulle architetture GPT‑4o e GPT‑4o‑mini e sono ampiamente preaddestrati su dataset specializzati in ambito audio, fondamentali per ottimizzarne le prestazioni. Questo approccio mirato offre una comprensione più approfondita delle sfumature del discorso e consente prestazioni eccezionali nelle attività legate all'audio.
Abbiamo migliorato le nostre tecniche di distillazione, permettendo il trasferimento di conoscenze dai nostri modelli audio più grandi a modelli più piccoli e più efficienti. Grazie a metodologie avanzate di self-play, i dataset di distillazione riescono a rappresentare fedelmente le dinamiche delle conversazioni reali tra utente e assistente. Questo aiuta i nostri modelli più piccoli a fornire qualità conversazionale e reattività eccellenti.
Per i nostri modelli di riconoscimento vocale, abbiamo integrato un paradigma fortemente basato sull'apprendimento per rinforzo (RL), portando l'accuratezza della trascrizione ai livelli più avanzati attualmente disponibili. Questa metodologia migliora notevolmente la precisione e riduce le allucinazioni, rendendo le nostre soluzioni di riconoscimento vocale eccezionalmente competitive anche negli scenari più complessi.
Questi sviluppi rappresentano un progresso nel campo della modellazione audio, combinando metodologie innovative con miglioramenti pratici per prestazioni migliorate nelle applicazioni di sintesi vocale.
Questi nuovi modelli audio sono ora disponibili per tutti gli sviluppatori: qui(si apre in una nuova finestra) è possibile trovare maggiori informazioni su come sviluppare con l'audio. Per gli sviluppatori che stanno già creando esperienze conversazionali con modelli basati su testo, aggiungere i nostri modelli di riconoscimento vocale e sintesi vocale è il modo più semplice per creare un agente vocale. Stiamo rilasciando un'integrazione con l'Agents SDK(si apre in una nuova finestra) che semplifica il processo di sviluppo. Per gli sviluppatori che vogliono creare esperienze da voce a voce a bassa latenza, consigliamo di utilizzare i nostri modelli da voce a voce tramite l'API Realtime.
Guardando al futuro, prevediamo di continuare a investire nel miglioramento dell'intelligenza e dell'accuratezza dei nostri modelli audio ed esplorare modi per consentire agli sviluppatori di integrare le proprie voci personalizzate per creare esperienze ancora più su misura, in linea con i nostri standard di sicurezza. Inoltre, stiamo continuando a dialogare con responsabili politici, ricercatori, sviluppatori e creativi in merito alle sfide e alle opportunità che le voci sintetiche possono offrire. Siamo entusiasti di vedere le applicazioni innovative e creative che gli sviluppatori costruiranno utilizzando queste capacità audio migliorate. Investiremo anche in altre modalità, incluso il video, per consentire agli sviluppatori di creare esperienze agentiche multimodali.
Autori
Responsabili della ricerca
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Collaboratori
Ricerca
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Ingegneria
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Prodotto
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Sponsor di leadership
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry