Apresentamos os modelos de áudio de última geração na API
Um novo conjunto de modelos de áudio para agentes de voz, agora disponível para desenvolvedores em todo o mundo.

Atualização em 28 de agosto de 2025: Anunciamos a disponibilidade geral da API em tempo real. Saiba mais aqui.
Nos últimos meses, investimos no aprimoramento da inteligência, das capacidades e da utilidade de agentes baseados em texto — ou sistemas que realizam tarefas de forma independente em nome dos usuários — com lançamentos como Operator, Deep Research, Computer-Using Agents e a API Responses com ferramentas integradas. No entanto, para que os agentes sejam realmente úteis, as pessoas precisam ser capazes de ter interações mais profundas e intuitivas com eles, que vão além do texto — usando a linguagem falada natural para se comunicar de forma eficaz.
Hoje, estamos lançando novos modelos de áudio de conversão de fala em texto e de texto em fala na API, possibilitando a criação de agentes de voz mais poderosos, personalizáveis e inteligentes que oferecem valor real. Nossos mais recentes modelos de conversão de fala em texto estabelecem um novo padrão de excelência, superando as soluções existentes em precisão e confiabilidade — especialmente em cenários desafiadores que envolvem sotaques, ambientes ruidosos e velocidades de fala variáveis. Essas melhorias aumentam a confiabilidade da transcrição, tornando os modelos especialmente adequados para casos de uso como centrais de atendimento ao cliente, transcrição de atas de reuniões e muito mais.
Pela primeira vez, os desenvolvedores também podem instruir o modelo de conversão de texto em fala a falar de uma maneira específica — por exemplo, "falar como um agente de atendimento ao cliente atencioso" — desbloqueando um novo nível de personalização para agentes de voz. Isso possibilita uma ampla gama de aplicações personalizadas, desde vozes de atendimento ao cliente mais empáticas e dinâmicas até narrações expressivas para experiências criativas de contar histórias.
Lançamos nosso primeiro modelo de áudio em 2022 e, desde então, temos nos dedicado a aprimorar a inteligência, a precisão e a confiabilidade desses modelos. Com esses novos modelos de áudio, os desenvolvedores podem criar sistemas de conversão de fala em texto mais precisos e robustos, além de vozes expressivas e cheias de personalidade para a síntese de voz — tudo dentro da API.
Estamos lançando os novos modelos gpt-4o-transcribe e gpt-4o-mini-transcribe com melhorias na taxa de erro de palavras e melhor reconhecimento e precisão da linguagem, em comparação com os modelos Whisper originais.
gpt-4o-transcribe demonstra um desempenho aprimorado na Taxa de Erro de Palavras (WER) em comparação com os modelos Whisper existentes em vários benchmarks estabelecidos, refletindo um progresso significativo em nossa tecnologia de conversão de fala em texto. Esses avanços decorrem diretamente de inovações direcionadas ao aprendizado por reforço e do extenso treinamento intermediário com conjuntos de dados de áudio diversos e de alta qualidade.
Como resultado, esses novos modelos de conversão de fala em texto conseguem captar melhor as nuances da fala, reduzir erros de reconhecimento e aumentar a confiabilidade da transcrição, especialmente em cenários desafiadores que envolvem sotaques, ambientes ruidosos e velocidades de fala variáveis. Esses modelos já estão disponíveis na API de conversão de fala em texto(abre em uma nova janela).
A Taxa de Erro de Palavras (WER, na sigla em inglês) mede a precisão dos modelos de reconhecimento de fala, calculando a porcentagem de palavras transcritas incorretamente em comparação com uma transcrição de referência — uma WER menor é melhor e significa menos erros. Nossos modelos mais recentes de conversão de fala em texto alcançam taxas de erro de palavras (WER) mais baixas em diversos benchmarks, incluindo o FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) — um benchmark de fala multilíngue que abrange mais de 100 idiomas usando amostras de áudio transcritas manualmente. Esses resultados demonstram maior precisão na transcrição e uma cobertura linguística mais robusta. Como demonstrado aqui, nossos modelos superam consistentemente o Whisper v2 e o Whisper v3 em todas as avaliações de linguagem.
Na plataforma FLEURS, nossos modelos oferecem menor WER e um forte desempenho multilíngue. Uma WER mais baixa é melhor e significa menos erros. Como demonstrado aqui, nossos modelos igualam ou superam outros modelos líderes na maioria das principais linguagens.
Também estamos lançando um novo gpt-4o-mini-tts modelo com melhor controlabilidade. Pela primeira vez, os desenvolvedores podem "instruir" o modelo não apenas sobre o que dizer, mas também sobre como dizer, possibilitando experiências mais personalizadas para casos de uso que vão desde o atendimento ao cliente até a narrativa criativa. O modelo está disponível na text-to-speech API(abre em uma nova janela). Note que esses modelos de conversão de texto em fala são limitados a vozes artificiais predefinidas, que monitoramos para garantir que correspondam consistentemente às predefinições sintéticas.
Nossos novos modelos de áudio são baseados nas arquiteturas GPT‑4o e GPT‑4o‑mini e foram extensivamente pré-treinados em conjuntos de dados especializados e centrados em áudio, que foram cruciais para otimizar o desempenho do modelo. Essa abordagem direcionada oferece uma compreensão mais profunda das nuances da fala e possibilita um desempenho excepcional em tarefas relacionadas ao áudio.
Aprimoramos nossas técnicas de destilação, permitindo a transferência de conhecimento de nossos maiores modelos de áudio para modelos menores e mais eficientes. Aproveitando metodologias avançadas de jogo autônomo, nossos conjuntos de dados de destilação capturam com eficácia a dinâmica conversacional realista, replicando interações genuínas entre usuário e assistente. Isso ajuda nossos modelos menores a oferecerem modeloexcelente qualidade de conversação e capacidade de resposta.
Para nossos modelos de conversão de fala em texto, integramos um paradigma com forte ênfase em aprendizado por reforço (RL), elevando a precisão da transcrição a níveis de última geração. Essa metodologia melhora drasticamente a precisão e reduz as alucinações, tornando nossas soluções de conversão de fala em texto excepcionalmente competitivas em cenários complexos de reconhecimento de fala.
Esses avanços representam um progresso na área de modelagem de áudio, combinando metodologias inovadoras com melhorias práticas para um desempenho aprimorado em aplicações de fala.
Esses novos modelos de áudio já estão disponíveis para todos os desenvolvedores – saiba mais sobre como desenvolver com áudio aqui(abre em uma nova janela). Para desenvolvedores que já criam experiências conversacionais com modelos baseados em texto, adicionar nossos modelos de conversão de fala em texto e de texto em fala é a maneira mais simples de construir um agente de voz. Estamos lançando uma integração com o SDK de Agentes(abre em uma nova janela) que simplifica esse processo de desenvolvimento. Para desenvolvedores que desejam criar experiências de conversão de fala em fala com baixa latência, recomendamos o uso de nossos modelos de conversão de fala em fala na API em Tempo Real.
Olhando para o futuro, planejamos continuar investindo na melhoria da inteligência e precisão de nossos modelos de áudio e explorando maneiras de permitir que os desenvolvedores tragam suas próprias vozes personalizadas para criar experiências ainda mais personalizadas, de forma que estejam alinhadas aos nossos padrões de segurança. Além disso, continuamos em diálogo com legisladores, pesquisadores, desenvolvedores e criativos sobre os desafios e as oportunidades que as vozes sintéticas podem apresentar. Estamos ansiosos para ver os aplicativos inovadores e criativos que os desenvolvedores criarão usando esses recursos de áudio aprimorados. Também investiremos em outras modalidades — incluindo vídeo — para permitir que os desenvolvedores criem experiências interativas multimodais.
Autores
Pesquisas
Christina Kim, Junhua Mao, Yi Shen, Yu Zhang
Colaboradores
Pesquisa
Alex Paino, Bowen Cheng, Chengxu Zhuang, Chris Koch, Damian Mrowca, Erik Ritter, Jacob Menick, James Betker, Ji Lin, Jamie Kiros, Jiahui Yu, Liang Zhou, Liyu Chen, Kevin Lu, Madeline Boyd, Michael Lampe, Mike Heaton, Nanxin Chen, Nitish Keskar, Saachi Jain, Sam Toizer, Somay Jain, Tao Xu, Tomer Kaplan, Wei Han, Xiangning Chen, Ye Jia
Engenharia
Alina Wu, Andres Garcia Garcia, Arshi Bhatnagar, Avital Oliver, Brendan Quinn, Christina Huang, David Fang, Dragos Oprica, Dominik Kundel, Edede Oiwoh, Iaroslav Tverdokhlib, Jiacheng Feng, Jay Chen, Jenia Varavva, Jordan Sitkin, Joseph Florencio, Lien Mamitsuka, Mada Aflak, Manoli Liodakis, Mark Hudnall, Noah MacCallum, Ola Okelola, Peter Bakkum, Rohan Mehta, Romain Huet, Wanning Jiang, Wayne Chang, Yilei Qian
Produto
Anubha Srivastava, Jackie Shannon, Jeff Harris, Reah Miyara, Xiaolin Hao
Patrocinadores de liderança
Aidan Clark, Andrew Gibiansky, David Sasaki, Kevin Weil, Liam Fedus, Mark Chen, Nick Ryder, Nick Turley, Olivier Godement, Prafulla Dhariwal, Shengjia Zhao, Shuchao Bi, Sherwin Wu, Sulman Choudhry