Apresentamos os modelos de áudio de próxima geração na API
Um novo conjunto de modelos de áudio para agentes de voz, agora disponível para programadores de todo o mundo.

Atualização de 28 de agosto de 2025: anunciámos a disponibilidade geral da API Realtime. Descobre mais aqui.
Nos últimos meses, investimos no avanço da inteligência, das capacidades e da utilidade de agentes baseados em texto — ou sistemas que executam tarefas de forma independente em nome dos utilizadores — com lançamentos como Operador, Pesquisa Aprofundada, Agentes de Utilização do Computador e a API Responses com ferramentas integradas. No entanto, para que os agentes sejam verdadeiramente úteis, as pessoas têm de poder ter interações mais profundas e intuitivas com eles, que vão para além do texto — utilizando a linguagem falada natural para comunicar eficazmente.
Hoje, estamos a lançar novos modelos de áudio de conversão de voz em texto e de texto em voz na API, possibilitando a criação de agentes de voz mais poderosos, personalizáveis e inteligentes que oferecem valor real. Os nossos mais recentes modelos de conversão de fala em texto estabelecem um novo padrão de excelência, superando as soluções existentes em termos de precisão e fiabilidade — especialmente em cenários desafiantes que envolvem sotaques, ambientes ruidosos e velocidades de fala variáveis. Estas melhorias aumentam a fiabilidade da transcrição, tornando os modelos especialmente adequados para casos de utilização como centros de atendimento ao cliente, transcrição de notas de reuniões e muito mais.
Pela primeira vez, os programadores também podem instruir o modelo de conversão de texto em voz a falar de uma forma específica — por exemplo, "fala como um agente de atendimento ao cliente atencioso" —, desbloqueando um novo nível de personalização para os agentes de voz. Isto possibilita uma vasta gama de aplicações personalizadas, desde vozes de atendimento ao cliente mais empáticas e dinâmicas até narrações expressivas para experiências de narrativas criativas.
Lançámos o nosso primeiro modelo de áudio em 2022 e, desde então, temos vindo a dedicar-nos a melhorar a inteligência, a precisão e a fiabilidade destes modelos. Com estes novos modelos de áudio, os programadores podem criar sistemas de conversão de voz em texto mais precisos e robustos, bem como vozes expressivas e cheias de personalidade para conversão de texto em voz — tudo dentro da API.
Estamos a lançar os novos modelos gpt-4o-transcribe e gpt-4o-mini-transcribe com melhorias na taxa de erro de palavras e melhor reconhecimento e precisão da língua, em comparação com os modelos originais do Whisper.
O gpt-4o-transcribe demonstra um desempenho melhorado na Taxa de Erro de Palavras (WER) em comparação com os modelos Whisper existentes em vários benchmarks estabelecidos, refletindo um progresso significativo na nossa tecnologia de conversão de voz em texto. Estes avanços resultam diretamente de inovações direcionadas para a aprendizagem por reforço e do extenso treino intermédio com conjuntos de dados áudio diversos e de alta qualidade.
Como resultado, estes novos modelos de conversão de fala em texto conseguem captar melhor as nuances da fala, reduzir os erros de reconhecimento e aumentar a fiabilidade da transcrição, especialmente em cenários desafiantes que envolvem sotaques, ambientes ruidosos e velocidades de fala variáveis. Estes modelos já estão disponíveis na API de conversão de voz em texto(abre numa nova janela).
A Taxa de Erro de Palavras (WER) mede a precisão dos modelos de reconhecimento de fala ao calcular a percentagem de palavras transcritas incorretamente em comparação com uma transcrição de referência — quanto mais baixa for a WER, melhor, uma vez que significa menos erros. Os nossos modelos mais recentes de conversão de fala em texto conseguem WER mais baixas em diversos benchmarks, incluindo o FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) — um benchmark de fala multilingue que abrange mais de 100 línguas utilizando amostras de áudio transcritas manualmente. Estes resultados demonstram uma maior precisão na transcrição e uma cobertura linguística mais robusta. Como demonstrado aqui, os nossos modelos superam consistentemente o Whisper v2 e o Whisper v3 nas avaliações de todos os idiomas.
No FLEURS, os nossos modelos apresentam uma taxa de erros de palavras (WER, na sigla em inglês) mais baixa e um forte desempenho multilingue. Quanto menor for a WER, melhor, uma vez que significa menos erros. Como demonstrado aqui, os nossos modelos igualam ou superam outros modelos líderes na maioria das principais linguagens.
Também estamos a lançar um novo modelo gpt-4o-mini-tts com melhor capacidade de orientação. Pela primeira vez, os programadores podem "instruir" o modelo não só sobre o que dizer, mas também sobre como dizer, possibilitando experiências mais personalizadas para casos de utilização que vão desde o atendimento ao cliente à narrativa criativa. O modelo está disponível na API de conversão de texto em voz(abre numa nova janela). Note-se que estes modelos de conversão de texto em voz estão limitados a vozes artificiais predefinidas, que monitorizamos para garantir que correspondem consistentemente às predefinições sintéticas.
Os nossos novos modelos de áudio baseiam-se nas arquiteturas GPT‑4o e GPT‑4o‑mini e foram extensivamente pré-treinados em conjuntos de dados especializados e centrados em áudio, que têm sido cruciais para otimizar o desempenho do modelo. Esta abordagem direcionada proporciona uma compreensão mais profunda das nuances da fala e possibilita um desempenho excecional em tarefas relacionadas com áudio.
Melhorámos as nossas técnicas de destilação, permitindo a transferência de conhecimento dos nossos maiores modelos de áudio para modelos mais pequenos e mais eficientes. Aproveitando metodologias avançadas de self-play, os nossos conjuntos de dados de destilação capturam eficazmente a dinâmica conversacional realista, replicando interações genuínas entre utilizador e assistente. Isto ajuda os nossos modelos mais pequenos a proporcionar uma excelente qualidade de conversação e capacidade de resposta.
Para os nossos modelos de conversão de voz em texto, integrámos um paradigma fortemente baseado na aprendizagem por reforço (RL), elevando a precisão da transcrição a níveis de excelência. Esta metodologia melhora drasticamente a precisão e reduz as alucinações, tornando as nossas soluções de conversão de voz em texto excecionalmente competitivas em cenários complexos de reconhecimento de voz.
Estes desenvolvimentos representam um avanço no campo da modelação de áudio, combinando metodologias inovadoras com melhorias práticas para um desempenho melhorado em aplicações de fala.
Estes novos modelos de áudio já estão disponíveis para todos os programadores – sabe mais sobre como criar com áudio aqui(abre numa nova janela). Para os programadores que já criam experiências de conversação com modelos baseados em texto, adicionar os nossos modelos de conversão de voz em texto e de texto em voz é a forma mais simples de criar um agente de voz. Estamos a lançar uma integração com o Agents SDK(abre numa nova janela) que simplifica este processo de desenvolvimento. Para os programadores que pretendam criar experiências de conversão de voz em voz com baixa latência, recomendamos a utilização dos nossos modelos de conversão de voz em voz na API Realtime.
Olhando para o futuro, planeamos continuar a investir na melhoria da inteligência e precisão dos nossos modelos de áudio e explorar formas de permitir que os programadores tragam as suas próprias vozes personalizadas para criar experiências ainda mais personalizadas, de formas que estejam alinhadas com as nossas normas de segurança. Além disso, continuamos em diálogo com decisores políticos, investigadores, programadores e criativos sobre os desafios e as oportunidades que as vozes sintéticas podem apresentar. Estamos ansiosos para ver as aplicações inovadoras e criativas que os programadores criarão utilizando estes recursos de áudio melhorados. Também vamos investir noutras modalidades — incluindo o vídeo — para permitir que os programadores criem experiências agênticas multimodais.
Autores
Líderes de investigação
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Contribuidores
Investigação
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Engenharia
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produto
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Patrocinadores de liderança
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry