Pular para o conteúdo principal
OpenAI

10 de setembro de 2026

ProdutoLançamento

Crie experiências de voz mais naturais com GPT‑Live‑1 na API

O GPT‑Live‑1 leva as conversas naturais e full-duplex do ChatGPT à API, com mais controle sobre como os agentes de voz falam e agem.

Carregando…

Estamos lançando o GPT‑Live‑1 na API, oferecendo aos desenvolvedores um modelo de voz potente e natural para criar apps com recursos de voz e fluxos de trabalho empresariais. Apresentado inicialmente no ChatGPT, o GPT‑Live‑1 é capaz de ouvir e falar ao mesmo tempo e, como demonstrado com o Codex e o ChatGPT Work⁠(abre em uma nova janela), pode delegar raciocínio mais aprofundado e ações aos modelos e às ferramentas com os quais é combinado.

Para o lançamento do GPT‑Live‑1 na API, nos concentramos em novos recursos que permitem aos desenvolvedores orientar e personalizar experiências de voz de acordo com seus usuários, fluxos de trabalho e objetivos. Um dos principais pontos fortes do GPT‑Live‑1, a capacidade de lidar com interrupções de forma fluida, já traz resultados para as empresas: nas primeiras avaliações, a Speak constatou que o GPT‑Live‑1 dava aos alunos mais tempo para pensar antes de o tutor de idiomas responder, reduzindo as interrupções em quase 80% em comparação com os sistemas anteriores baseados em turnos.

Principais pontos fortes do GPT‑Live‑1 na API:

  • Gerenciamento de interrupções: Lida melhor com interrupções por meio de um único modelo que raciocina sobre o áudio de entrada e de saída em conjunto, evitando a latência e as transições frágeis das arquiteturas STT–LLM–TTS em cadeia.

  • Delegação de raciocínio e chamadas de ferramentas: O GPT‑Live‑1 pode delegar raciocínio e chamadas de ferramentas a um modelo de texto no backend, como o GPT‑6 Astra, ou a um modelo de terceiros.

  • Tom, ritmo e estilo: Permite que os desenvolvedores definam o tom, o ritmo e o estilo de conversa de um agente por meio do prompt do sistema.

  • Gerenciamento silencioso de contexto e ruído de fundo: Lida melhor com ruídos de fundo e silêncios sem interromper a conversa nem narrar cada etapa em voz alta.

  • Confiabilidade em sessões longas: Melhora a retenção de contexto e a qualidade das conversas em interações prolongadas.

  • Suporte a telefonia: Permite implantar agentes de voz full duplex em chamadas telefônicas, desde reservas em restaurantes até o suporte ao cliente.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Esta demonstração tem duração limitada. Ao usá-la, você concorda com os Termos da OpenAI e declara estar ciente da nossa Política de Privacidade.

Simplifique a arquitetura dos seus agentes de voz e reduza a latência

Os agentes de voz tradicionais combinam conversão de fala em texto, um modelo de raciocínio e conversão de texto em fala. Cada transição aumenta a latência e cria mais oportunidades de perder o timing, o contexto ou o ritmo natural da conversa. Muitas vezes, cabe aos desenvolvedores coordenar essas etapas, inclusive o que acontece quando alguém interrompe, faz uma pausa ou muda de direção.

O GPT‑Live‑1 ouve e fala em um único modelo, simplificando a camada de voz. Ele pode responder a interrupções e sinais de compreensão no momento em que ocorrem, enquanto delega o raciocínio mais aprofundado ao backend. Isso permite que a conversa continue enquanto o trabalho acontece em segundo plano.

“Em comparação com nossa implementação em cascata, o GPT‑Live‑1 simplificou nossa base de código em 80% e eliminou 23 mil linhas de código. Isso viabilizou conversas naturais e em tempo real com pacientes & liberou nossa equipe para melhorar a experiência, desde o agendamento de consultas até a orientação durante o atendimento.”
—Tony Stoyanov, cofundador e diretor de tecnologia

Os desenvolvedores escolhem os modelos, as ferramentas e o harness do agente por trás da conversa. Por exemplo, eles podem combinar o GPT‑Live‑1 com um modelo como o Luna para tarefas de alto volume, como agendamentos ou atualizações de pedidos, e usar um modelo como o Astra para questões complexas de clientes que exigem raciocínio. Essa flexibilidade permite adequar a profundidade do raciocínio, a velocidade e o custo a cada tarefa.

O GPT‑Live‑1 fornece nativamente transcrições de reconhecimento automático de fala (ASR) e o texto das respostas. Ele também oferece boa compreensão alfanumérica e suporte à priorização de palavras-chave. Embora o GPT‑Live‑1 não seja um modelo baseado em turnos, ele oferece suporte nativo à detecção de turnos, para que os desenvolvedores possam continuar criando soluções com limites explícitos entre as falas.

Mensuração da vantagem do full duplex

Nas nossas avaliações, o GPT‑Live‑1 melhora o desempenho no Full Duplex Bench em 30 pontos percentuais em relação ao GPT‑Realtime‑2.1, com grandes avanços na latência entre falas e no comportamento interativo. Combinado com o GPT‑6 Astra com esforço de raciocínio médio, ele também ocupa o 1º lugar no Tau3, que mede a inteligência de agentes de voz de ponta em tarefas executadas do início ao fim.

Avalia tarefas de atendimento ao cliente por voz nos setores aéreo, de varejo e de telecomunicações. Pass@1 mede o sucesso nas tarefas; o resultado geral atribui o mesmo peso a cada setor.


* Backend do GPT Live: Astra (médio).

Avalia o suporte bancário por voz com recuperação de conhecimento e ferramentas de conta. Pass@1 é a proporção das 97 tarefas de banking_knowledge concluídas com sucesso.


* Backend do GPT Live: Astra (médio).

Avalia como o modelo lida com pausas, alternância de falas, interrupções e sinais de acompanhamento do ouvinte.

Testa as reações a falas ao fundo, falas dirigidas a outra pessoa, sinais de acompanhamento do ouvinte e interrupções.

Mede a rapidez com que o agente começa a responder depois que o usuário termina sua fala.

Testa o uso de ferramentas a partir de solicitações faladas que contêm pausas naturais, hesitações e autocorreções. Pass@1 avalia a sequência de chamadas de ferramentas.


* Backend do GPT Live: Terra (baixo).

Avalia a resposta falada a solicitações que usam ferramentas e contêm pausas, hesitações e autocorreções. Mede o quanto a resposta corresponde à intenção de referência.


* Backend do GPT Live: Terra (baixo).

O que os clientes estão dizendo

1 de 4
“Adicionar o GPT‑Live‑1 ao Yelp Host e ao Hatch melhorou a alternância de falas e a precisão em relação à nossa arquitetura de voz tradicional. Quando o Yelp Host usa o GPT‑Live‑1 para atender ligações, como reservas e pedidos de comida, observamos melhorias significativas nas taxas de atendimento. As pessoas também estão falando frases mais completas e naturais, o que mostra que a experiência do outro lado da linha é realmente diferente.”
—Alex Levy, diretor de tecnologia

Novas opções de voz

Os desenvolvedores precisam de vozes que combinem com seus produtos e soem naturais para quem os utiliza. Com o GPT‑Live‑1, estamos ampliando nosso pequeno conjunto de vozes em tempo real para oferecer uma seleção mais abrangente de sotaques, dialetos e idiomas, dando aos desenvolvedores mais opções para definir como seus assistentes soam.

Ouça as novas vozes

Continuaremos ampliando as opções de voz e a disponibilidade de idiomas nos próximos meses.

Preços e disponibilidade

O GPT‑Live‑1 está disponível na API a partir de hoje⁠(abre em uma nova janela) por US$ 0,05 por minuto para a camada de voz do front-end. Combine-o com o modelo de backend e a estrutura de execução de agentes que atendam ao seu produto e crie uma experiência de voz que possa crescer com o trabalho que precisa realizar.

Conectando GPT-Live-1 ao Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Conectando GPT-Live-1 ao Codex. Este trecho mostra como um aplicativo passa o contexto da conversa para o Codex e retorna a resposta ao GPT-Live-1. A configuração da conexão e o gerenciamento da delegação foram omitidos.

Para ter acesso a vozes personalizadas, fale com vendas para saber mais sobre os critérios de elegibilidade e o processo de solicitação.

Outra forma de criar fluxos de trabalho por voz com o GPT‑Live‑1 é usar o OpenAI Presence, que usa o modelo para oferecer interações por voz em tempo real. O Presence ajuda empresas a implantar agentes de IA confiáveis que podem responder a perguntas, resolver problemas, usar sistemas da empresa, realizar ações aprovadas e encaminhar casos para pessoas quando necessário. Entre em contato com seu diretor de contas da OpenAI para saber mais.