OpenAI

8 de julho de 2026

ProdutoLançamento

Apresentamos o GPT‑Live

Uma nova geração de modelos de voz para interação humano-IA natural, agora a alimentar o ChatGPT Modo Voz.

A carregar…

Atualização de 31 de julho de 2026: O áudio suportado gerado com o GPT‑Live através do ChatGPT Modo Voz e da API da OpenAI passa agora a incluir marca de água SynthID. A nossa ferramenta pública de verificação consegue agora detetar sinais de proveniência da OpenAI em ficheiros de áudio suportados, e introduzimos acesso à API para verificação, para que programadores e organizações possam incorporar verificações de proveniência nos seus próprios fluxos de trabalho. Estas atualizações baseiam-se na abordagem de segurança descrita abaixo e no nosso trabalho mais amplo para tornar o conteúdo gerado pela OpenAI mais fácil de identificar.

Estamos a lançar o GPT‑Live, uma nova geração de modelos de voz que tornam falar com IA muito mais parecido com ter uma conversa real.

O GPT‑Live assenta numa arquitetura full-duplex, o que significa que consegue ouvir e falar ao mesmo tempo. Durante as conversas, o GPT‑Live consegue mostrar que está atento com expressões como “hum-hum” ou “sim”, participar em trocas rápidas ou simplesmente ficar em silêncio quando precisa de um momento para pensar. O resultado é uma experiência de voz com que é surpreendentemente fácil conversar.

O GPT‑Live é também o nosso modelo de voz mais inteligente até agora. Para perguntas que exigem pesquisa na web, raciocínio mais profundo ou trabalho mais complexo, delega nos bastidores para o nosso mais recente modelo de fronteira e traz o resultado de volta à conversa quando estiver pronto. Enquanto trabalha, o GPT‑Live consegue continuar a conversar consigo e manter o fluxo da conversa. No lançamento, o GPT‑Live usará o GPT‑5.5 em segundo plano. À medida que lançarmos novos modelos de fronteira, atualizaremos continuamente o modelo usado pelo GPT‑Live.

Estes avanços dão origem a uma nova experiência do ChatGPT Modo Voz, mais inteligente e natural de usar. Com o tempo, acreditamos que esta investigação também permitirá usar a voz para trabalho cada vez mais complexo, mais prolongado e com maior capacidade de agente.

Estamos a começar a disponibilizar hoje duas versões do GPT‑Live — GPT‑Live‑1 e GPT‑Live‑1 mini — aos utilizadores do ChatGPT em todo o mundo. Também planeamos disponibilizá-las em breve na API, e programadores e empresas podem inscrever-se para receber notificações através deste formulário.

Entrar numa nova era de interação entre humanos e IA

A nossa visão é permitir uma interação verdadeiramente natural entre humanos e IA: um mundo em que colaborar com IA seja tão fluido e reativo como trabalhar com outra pessoa, enquanto o raciocínio e a execução de tarefas complexas decorrem de forma integrada em segundo plano.

Abordagens anteriores

As gerações anteriores de sistemas de IA por voz aproximaram-nos dessa visão, mas com compromissos importantes.

Sistemas de voz em cascata

Os sistemas de voz em cascata dependem de uma série de modelos que atuam um após o outro para processar cada intervenção. O ChatGPT Modo Voz original encadeava três modelos: um modelo de fala para texto para transcrever a sua fala, um grande modelo de linguagem para produzir uma resposta e um modelo de texto para fala para a converter novamente em fala. Esta abordagem permitiu-nos falar pela primeira vez com modelos de IA de fronteira, mas a complexidade teve um custo: podia perder-se informação entre modelos, e as respostas eram lentas e pouco naturais.

Sistema de voz em cascata

Respostas lentas e pouco naturais, pausas longas

Transcrição
Exemplo de conversa com o Modo Voz Padrão, usando GPT-5.5 Instantâneo

Modelos de voz por turnos

Modelos de voz por turnos, como o Modo de voz avançado do ChatGPT, processavam e geravam áudio num único modelo, reduzindo a latência e tornando as conversas mais fluidas — mas continuavam a funcionar por turnos discretos. O modelo tinha de esperar que o utilizador deixasse de falar antes de responder, o que resultava numa troca rígida. Além disso, como a deteção de turnos se baseia no silêncio, até uma breve pausa ou ruído de fundo podia ser interpretado como o fim do turno, levando o modelo a interromper em momentos pouco naturais.

Modelo de voz por turnos

Respostas ligeiramente mais rápidas e fluidas, mas a troca com o modelo ainda parece rígida

Transcrição
Exemplo de conversa com o Modo Voz Avançado do ChatGPT

A nossa nova abordagem

O GPT‑Live resolve estas limitações através de duas alterações arquiteturais.

Interação contínua

Primeiro, criámos o GPT‑Live para interação contínua usando uma arquitetura full-duplex. Em vez de processar uma sequência de mensagens separadas, o GPT‑Live processa continuamente a entrada enquanto gera a saída. Assim, o modelo pode tomar decisões de interação muitas vezes por segundo: falar, continuar a ouvir, fazer uma pausa, interromper ou invocar uma ferramenta.

Isto permite ao modelo participar em trocas mais naturais, manter uma melhor noção do tempo e até fazer tradução em direto.

Interação contínua

Respostas rápidas, naturais e expressivas, com escuta mais ativa

Transcrição
Exemplo de conversa com GPT-Live-1, usando GPT-5.5 Instantâneo

Delegação para trabalho mais profundo

Em segundo lugar, separámos o GPT‑Live — que trata da interação contínua — do trabalho mais profundo. Quando uma pergunta exige pesquisa, raciocínio ou capacidades mais agênticas, o GPT‑Live pode delegar a tarefa noutro modelo, como o GPT‑5.5. Isto permite-lhe manter a conversa a decorrer, mesmo enquanto trata de várias tarefas em segundo plano.

Esta alteração arquitetural também permite ao GPT‑Live usar continuamente os modelos e agentes mais recentes, combinando inteligência de fronteira com interação natural.

Delegação para trabalho mais aprofundado

O GPT-Live dá respostas rápidas e naturais, enquanto o GPT-5.5 trata da pesquisa em segundo plano

Transcrição
Exemplo de conversa com GPT-Live-1, usando GPT-5.5 Instantâneo

Avaliações

Criámos novas avaliações humanas para medir a agradabilidade e o fluxo da conversa. Nestas comparações diretas, o GPT‑Live‑1 e o GPT‑Live‑1 mini são claramente preferidos ao Modo de voz avançado em conversas equivalentes de 5 a 10 minutos que medem a preferência geral, a alternância de turnos, as interrupções, o fluxo da conversa e o quão natural cada interação pareceu.

  • GPQA: o GPT‑Live‑1 supera substancialmente o Modo de voz avançado no GPQA, que testa raciocínio científico de nível especializado em biologia, química e física.
  • BrowseComp: o GPT‑Live‑1 apresenta fortes ganhos face ao Modo de voz avançado no BrowseComp, que testa pesquisa web com capacidades de agente e a capacidade de encontrar informação difícil de localizar.
  • τ³-Voice Telecom (variante interna)**: o GPT‑Live‑1 supera o Modo de voz avançado no τ³-Voice Telecom, que testa agentes de voz em tarefas realistas de apoio de telecomunicações com vários turnos.

* O GPT‑Live‑1 (instantâneo) e o GPT‑Live‑1 mini usam o modelo GPT‑5.5 Instantâneo em segundo plano, enquanto o GPT‑Live‑1 Médio e o GPT‑Live‑1 Elevado usam o modelo GPT‑5.5 Thinking com esforço de raciocínio médio e elevado.

** Usámos um modelo de utilizador personalizado, alimentado pelos nossos modelos de raciocínio mais recentes, para esta avaliação.

Uma nova experiência do ChatGPT Modo Voz

Todas as semanas, mais de 150 milhões de pessoas falam com o ChatGPT usando funcionalidades como Voz e Ditado. Usam-no para obter ajuda no dia a dia sem usar as mãos, praticar línguas, contar histórias para adormecer ou simplesmente conversar durante o trajeto.

A partir de hoje, quando tocar no botão Voz para falar com o ChatGPT, terá uma experiência melhorada, alimentada pelo GPT‑Live, com conversas mais naturais, respostas mais inteligentes, melhor escuta e respostas visuais.

Conversas mais naturais

Falar com o ChatGPT deverá agora parecer muito mais uma conversa real. Pode interromper com uma pergunta, fazer uma pausa para organizar as ideias ou pedir ao ChatGPT para falar mais devagar. Ele reconhece naturalmente o que está a dizer com expressões como “mhmm” ou “percebi”, para que saiba que está a acompanhar. Também remasterizámos as nove vozes distintas no ChatGPT para o GPT‑Live.

Respostas mais inteligentes

O ChatGPT Modo Voz pode agora recorrer aos nossos modelos de fronteira mais recentes, dando-lhe respostas mais inteligentes quando precisa delas. Também pode escolher o nível de raciocínio adequado às suas necessidades: Instant para respostas rápidas, ou Medium e High quando quiser que o ChatGPT passe mais tempo a pensar.

Melhor escuta

Se fizer uma pausa para pensar, o ChatGPT Modo Voz agora espera em vez de se adiantar e interromper. Se lhe pedir para ficar em silêncio e ouvir, ele fá-lo-á. E quando há ruído de fundo, como trânsito a passar ou conversas por perto, o ChatGPT consegue concentrar-se melhor na sua voz em vez de se distrair.

Respostas visuais num relance

Algumas respostas são mais úteis quando as pode ver. Enquanto fala, o ChatGPT pode agora mostrar cartões visuais ricos sobre temas como meteorologia, ações, desporto e muito mais. A Voz continua também a suportar pesquisa, memória, imagens e carregamentos de ficheiros.

O resultado é uma experiência do ChatGPT Modo Voz mais natural, mais capaz e mais útil no dia a dia.

Segurança concebida para voz

O GPT‑Live foi concebido para ser seguro por predefinição. Baseia-se nos avanços de segurança dos nossos modelos mais recentes, acrescentando formação de segurança dedicada nas principais áreas de risco e novas proteções concebidas especificamente para voz.

Testes de segurança alargados

Para refletir melhor a forma como as pessoas usam voz em contextos reais, começámos por alargar os nossos testes de segurança para incluir novas avaliações nativas de áudio. Também criámos avaliações sintéticas que usam áudio gerado para se concentrarem mais intensivamente em áreas-chave de segurança, com base no que aprendemos com o Modo de voz avançado. Essas áreas incluem automutilação, psicose e mania, dependência emocional da IA, violência e conteúdos sexuais. Especialistas internos também fizeram red teaming ao modelo para riscos específicos da voz.

Nos nossos testes, o GPT‑Live teve um desempenho comparável ou superior ao Modo de voz avançado em quase todas as áreas avaliadas. Pode ler mais sobre os nossos testes e proteções no system card(abre numa nova janela) do GPT‑Live.

Proteções integradas

Como as conversas por voz decorrem em tempo real, também criámos proteções que podem atuar enquanto o modelo está a falar. Quando o sistema deteta uma saída potencialmente insegura, pode orientar o modelo para uma resposta mais segura, apresentar mensagens ou recursos de segurança adicionais, ou terminar a conversa por voz em casos de maior risco. Para conversas relacionadas com automutilação, adaptámos os fluxos de apoio do ChatGPT à voz, incluindo a oferta de apoio de linhas de crise validado por especialistas.

Concebemos proteções adicionais para apoiar utilizadores adolescentes e treinámos diretamente no modelo comportamentos adequados à idade, para reduzir o risco de respostas inadequadas. Os pais podem escolher se o seu adolescente pode usar o ChatGPT Modo Voz através dos controlos parentais, e os pais associados podem ser notificados em situações de maior risco que envolvam sinais de possível automutilação ou intenção suicida.

Aprender com a utilização no mundo real

Estamos também a implementar medição a mais longo prazo e monitorização pós-lançamento centradas na dependência emocional, para continuarmos a melhorar a nossa compreensão e a aperfeiçoar as proteções. Com base na nossa investigação anterior sobre utilização afetiva e bem-estar emocional, isto ajudar-nos-á a identificar padrões emergentes e a melhorar a forma como o sistema responde em interações emocionalmente sensíveis.

Por fim, o GPT‑Live foi concebido para conversar, não para imitar vozes. Usa um conjunto de vozes predefinidas no ChatGPT, com proteções para impedir que imite a voz de uma pessoa real.

Estamos empenhados em apoiar a segurança e o bem-estar, e continuaremos a reforçar estas proteções à medida que aprendemos com a utilização no mundo real.

Disponibilidade e limitações

O GPT‑Live está agora a ser disponibilizado a utilizadores do ChatGPT em todo o mundo no iOS, Android e ChatGPT.com(abre numa nova janela). O GPT‑Live‑1 passará a ser o modelo predefinido que alimenta o ChatGPT Modo Voz para utilizadores Go, Plus e Pro, e o GPT‑Live‑1 mini passará a ser o predefinido para utilizadores Free. Pode encontrar mais detalhes sobre disponibilidade no nosso Centro de Apoio(abre numa nova janela).

Otimizámos o GPT‑Live para algumas das línguas mais populares no ChatGPT. Em certas línguas, o modelo poderá ter um sotaque não nativo ou lacunas de fluência. Estamos a trabalhar ativamente para melhorar a experiência em todas as línguas.

No lançamento, o GPT‑Live não suportará voz com vídeo nem partilha de ecrã no ChatGPT, mas estamos a trabalhar para introduzir estas capacidades em breve. Ainda pode aceder a versões anteriores do ChatGPT Modo Voz, incluindo Standard e Modo de voz avançado, onde estas funcionalidades estão disponíveis.

Autor

OpenAI