Vai al contenuto principale
OpenAI

20 marzo 2025

VersioneProdotto

Ti presentiamo i modelli audio di nuova generazione nell’API

Una nuova suite di modelli audio per potenziare gli agenti vocali, ora disponibile per gli sviluppatori di tutto il mondo.

Immagine principale del blog sui modelli audio di nuova generazione di OpenAI
Caricamento in corso...

Aggiornamento del 28/08/2025: abbiamo annunciato la disponibilità generale dell'API Realtime. Scopri di più qui.


Negli ultimi mesi abbiamo investito nello sviluppo dell'intelligenza, delle capacità e dell'utilità degli agenti basati su testo, sistemi in grado di portare a termine compiti in autonomia per conto degli utenti, con rilasci come Operator, Deep Research, agenti IA informatici e l'API Responses con strumenti integrati. Tuttavia, affinché gli agenti siano davvero utili, le persone devono poter avere interazioni più profonde e intuitive con gli agenti, oltre il semplice testo, usando il linguaggio parlato naturale per comunicare efficacemente.

Oggi introduciamo nell'API nuovi modelli audio di speech-to-text e text-to-speech, che consentono di costruire agenti vocali più intelligenti, personalizzabili e performanti. I nostri modelli più recenti di speech-to-text stabiliscono un nuovo punto di riferimento all'avanguardia, superando le soluzioni esistenti in termini di accuratezza e affidabilità, soprattutto in scenari difficili che coinvolgono accenti, ambienti rumorosi e velocità di parlato variabili. Questi miglioramenti aumentano l'affidabilità della trascrizione, rendendo i modelli particolarmente adatti a casi d'uso come i call center per l'assistenza clienti, la trascrizione degli appunti presi durante le riunioni e altro ancora.

Per la prima volta, gli sviluppatori possono anche istruire il modello di text-to-speech a parlare in un modo specifico, ad esempio “parla come un agente del servizio clienti empatico“, aggiungendo un nuovo livello di personalizzazione per gli agenti vocali. Questo consente un'ampia gamma di applicazioni personalizzate, dalle voci più empatiche e dinamiche per il servizio clienti a una narrazione espressiva per esperienze di storytelling creativo.

Abbiamo lanciato il nostro primo modello audio nel 2022 e da allora ci siamo impegnati a migliorare l’intelligenza, la precisione e l’affidabilità di questi modelli. Con questi nuovi modelli audio, gli sviluppatori possono creare sistemi speech-to-text più accurati e validi e voci text-to-speech ricche di personalità, tutto all'interno dell'API.

Calmo
Surfista
Professionale
Cavaliere medievale
Appassionato di true crime
Favola della buonanotte

Scopri di più sui nostri ultimi modelli audio

Nuovi modelli di riconoscimento vocale

Presentiamo i nuovi modelli gpt-4o-transcribe e gpt-4o-mini-transcribe, che offrono un tasso di Word Error Rate più basso e una maggiore accuratezza nel riconoscimento delle lingue rispetto ai modelli Whisper originali.

gpt-4o-transcribe dimostra un miglioramento delle prestazioni in termini di Word Error Rate (WER) rispetto ai modelli Whisper esistenti su diversi benchmark consolidati, riflettendo progressi significativi nella nostra tecnologia di riconoscimento vocale. Questi progressi derivano direttamente da innovazioni mirate nell'apprendimento per rinforzo e da un ampio addestramento intermedio con set di dati audio diversificati e di alta qualità.

Di conseguenza, questi nuovi modelli di riconoscimento vocale riescono a cogliere meglio le sfumature del parlato, ridurre gli errori di trascrizione e aumentare l'affidabilità, soprattutto in scenari complessi con accenti diversi, ambienti rumorosi e velocità di parlato variabili. Questi modelli sono ora disponibili nell'API di riconoscimento vocale(si apre in una nuova finestra).

Il Word Error Rate (WER) misura l'accuratezza dei modelli di riconoscimento vocale calcolando la percentuale di parole trascritte in modo errato rispetto a una trascrizione di riferimento: un WER più basso è migliore e significa meno errori. I nostri più recenti modelli di speech-to-text ottengono valori di WER più bassi nei benchmark, incluso FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), un benchmark multilingue per il parlato che copre oltre 100 lingue e utilizza campioni audio trascritti manualmente. Questi risultati dimostrano maggiore accuratezza nella trascrizione e una copertura linguistica più solida. Come mostrato qui, i nostri modelli superano costantemente Whisper v2 e Whisper v3 in tutte le valutazioni linguistiche.

Su FLEURS, i nostri modelli offrono un WER più basso e prestazioni multilingue eccellenti. Un WER più basso è migliore e comporta meno errori. Come mostrato qui, i nostri modelli eguagliano o superano altri modelli leader nella maggior parte delle lingue principali.

Nuovo modello di sintesi vocale

Stiamo anche lanciando un nuovo modello gpt-4o-mini-tts con una migliore manovrabilità. Per la prima volta, gli sviluppatori possono “istruire“ il modello non solo su cosa dire ma su come dirlo, consentendo esperienze più personalizzate per casi d'uso che vanno dal servizio clienti alla narrazione creativa. Il modello è disponibile nell'API text-to-speech (si apre in una nuova finestra). Tieni presente che questi modelli di text-to-speech sono limitati a voci artificiali preimpostate, che monitoriamo per garantire che corrispondano sempre ai preset sintetici.

Innovazioni tecniche dietro i modelli

Pre-addestramento con dataset audio autentici

I nostri nuovi modelli audio si basano sulle architetture GPT‑4o e GPT‑4o‑mini e sono ampiamente preaddestrati su dataset specializzati in ambito audio, fondamentali per ottimizzarne le prestazioni. Questo approccio mirato offre una comprensione più approfondita delle sfumature del discorso e consente prestazioni eccezionali nelle attività legate all'audio.

Metodologie avanzate di distillazione

Abbiamo migliorato le nostre tecniche di distillazione, permettendo il trasferimento di conoscenze dai nostri modelli audio più grandi a modelli più piccoli e più efficienti. Grazie a metodologie avanzate di self-play, i dataset di distillazione riescono a rappresentare fedelmente le dinamiche delle conversazioni reali tra utente e assistente. Questo aiuta i nostri modelli più piccoli a fornire qualità conversazionale e reattività eccellenti.

Approccio dell'apprendimento per rinforzo

Per i nostri modelli di riconoscimento vocale, abbiamo integrato un paradigma fortemente basato sull'apprendimento per rinforzo (RL), portando l'accuratezza della trascrizione ai livelli più avanzati attualmente disponibili. Questa metodologia migliora notevolmente la precisione e riduce le allucinazioni, rendendo le nostre soluzioni di riconoscimento vocale eccezionalmente competitive anche negli scenari più complessi.

Questi sviluppi rappresentano un progresso nel campo della modellazione audio, combinando metodologie innovative con miglioramenti pratici per prestazioni migliorate nelle applicazioni di sintesi vocale.

Disponibilità dell'API

Questi nuovi modelli audio sono ora disponibili per tutti gli sviluppatori: qui(si apre in una nuova finestra) è possibile trovare maggiori informazioni su come sviluppare con l'audio. Per gli sviluppatori che stanno già creando esperienze conversazionali con modelli basati su testo, aggiungere i nostri modelli di riconoscimento vocale e sintesi vocale è il modo più semplice per creare un agente vocale. Stiamo rilasciando un'integrazione con l'Agents SDK(si apre in una nuova finestra) che semplifica il processo di sviluppo. Per gli sviluppatori che vogliono creare esperienze da voce a voce a bassa latenza, consigliamo di utilizzare i nostri modelli da voce a voce tramite l'API Realtime.

Prossimi passi

Guardando al futuro, prevediamo di continuare a investire nel miglioramento dell'intelligenza e dell'accuratezza dei nostri modelli audio ed esplorare modi per consentire agli sviluppatori di integrare le proprie voci personalizzate per creare esperienze ancora più su misura, in linea con i nostri standard di sicurezza. Inoltre, stiamo continuando a dialogare con responsabili politici, ricercatori, sviluppatori e creativi in merito alle sfide e alle opportunità che le voci sintetiche possono offrire. Siamo entusiasti di vedere le applicazioni innovative e creative che gli sviluppatori costruiranno utilizzando queste capacità audio migliorate. Investiremo anche in altre modalità, incluso il video, per consentire agli sviluppatori di creare esperienze agentiche multimodali.

Registrazione della diretta

Autori

OpenAI

Responsabili della ricerca

Christina Kim, Junhua Mao, Yi Shen, Yu Zhang

Collaboratori

Ricerca

Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia

Ingegneria

Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian

Prodotto

Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao

Sponsor di leadership

Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry