Saltar para o conteúdo principal
OpenAI

10 de setembro de 2026

ProdutoLançamento

Crie experiências de voz mais naturais com o GPT‑Live‑1 na API

O GPT‑Live‑1 traz as conversas naturais e full-duplex do ChatGPT para a API, com mais controlo sobre a forma como os agentes de voz falam e agem.

A carregar…

Estamos a lançar o GPT‑Live‑1 na API, disponibilizando aos programadores um modelo de voz potente e natural para criar aplicações com voz e fluxos de trabalho empresariais. Apresentado inicialmente no ChatGPT, o GPT‑Live‑1 consegue ouvir e falar em simultâneo e, como demonstrado com o Codex e o ChatGPT Work⁠(abre numa nova janela), pode delegar raciocínios e ações mais aprofundados aos modelos e às ferramentas aos quais está associado.

Para o lançamento do GPT‑Live‑1 na API, concentrámo-nos em novas capacidades que permitem aos programadores orientar e personalizar as experiências de voz em função dos seus utilizadores, fluxos de trabalho e objetivos. Uma das principais vantagens do GPT‑Live‑1, a gestão fluida de interrupções, já está a gerar impacto empresarial: nas primeiras avaliações, a Speak constatou que o GPT‑Live‑1 deu aos alunos mais tempo para refletir antes de o tutor de idiomas responder, reduzindo em quase 80% as interrupções em comparação com os sistemas anteriores baseados em turnos.

Principais pontos fortes do GPT‑Live‑1 na API:

  • Gestão de interrupções: Melhora a gestão de interrupções através de um único modelo que processa em conjunto o áudio recebido e emitido, evitando a latência e as transições frágeis das arquiteturas STT–LLM–TTS em cadeia.

  • Delegação de raciocínio e chamadas de ferramentas: O GPT‑Live‑1 pode delegar o raciocínio e as chamadas de ferramentas a um modelo de texto de back-end, como o GPT‑6 Astra ou um modelo de terceiros.

  • Tom, ritmo e estilo: Permite aos programadores definir o tom, o ritmo e o estilo de conversa de um agente através do prompt de sistema.

  • Gestão silenciosa do contexto & ruído de fundo: Gere melhor o ruído de fundo e o silêncio sem interromper a conversa nem narrar cada passo em voz alta.

  • Fiabilidade em sessões longas: Melhora a retenção do contexto e a qualidade da conversa em interações prolongadas.

  • Suporte para telefonia: Permite implementar agentes de voz full-duplex em chamadas telefónicas, desde reservas em restaurantes ao apoio ao cliente.

Try GPT-Live-1

Start a session and speak naturally. Interrupt, laugh, change your mind - try it at home or in a loud space like a coffee shop or city street.
See what it can do
  • Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
  • Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
  • Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.

Esta demonstração tem um limite de tempo. Ao utilizá-la, concordas com os Termos da OpenAI e tomas conhecimento da nossa Política de Privacidade.

Simplifique a arquitetura do seu agente de voz e reduza a latência de voz

Os agentes de voz tradicionais combinam conversão de voz em texto, um modelo de raciocínio e conversão de texto em voz. Cada transição aumenta a latência e cria mais oportunidades para perder o timing, o contexto ou o ritmo natural da conversa. Muitas vezes, cabe aos programadores coordenar estas etapas, incluindo o que acontece quando alguém interrompe, faz uma pausa ou muda de rumo.

O GPT‑Live‑1 ouve e fala através de um único modelo, simplificando a camada de voz. Consegue reagir de imediato a interrupções e confirmações, enquanto delega o raciocínio mais aprofundado para o back-end. Assim, a conversa pode prosseguir enquanto o trabalho decorre em segundo plano.

“Comparativamente à nossa implementação em cascata, o GPT‑Live‑1 simplificou a nossa base de código em 80% e eliminou 23 mil linhas de código. Isto permitiu conversas naturais e em tempo real com os pacientes & libertou a nossa equipa para melhorar a experiência, desde a marcação de consultas à orientação nos cuidados de saúde.”
— Tony Stoyanov, Cofundador e Diretor de Tecnologia

Os programadores escolhem os modelos, as ferramentas e o harness de agente por detrás da conversa. Por exemplo, podem combinar o GPT‑Live‑1 com um modelo como o Luna para tarefas de grande volume, como agendamentos ou atualizações de pedidos, e utilizar um modelo como o Astra para questões complexas de clientes que exijam raciocínio. Esta flexibilidade permite aos programadores adequar a profundidade do raciocínio, a velocidade e o custo a cada tarefa.

O GPT‑Live‑1 fornece nativamente transcrições de ASR e o texto das respostas. Oferece também uma sólida compreensão de conteúdos alfanuméricos e suporta a ponderação de palavras-chave. Embora o GPT‑Live‑1 não seja um modelo baseado em turnos, suporta nativamente a deteção de turnos, permitindo aos programadores continuar a desenvolver com base em limites de turno explícitos.

Medir a vantagem do full-duplex

Nas nossas avaliações, o GPT‑Live‑1 melhora o desempenho no Full Duplex Bench em 30 pontos percentuais face ao GPT‑Realtime‑2.1, com grandes ganhos na latência da alternância de turnos e no comportamento interativo. Combinado com o GPT‑6 Astra, com um nível médio de esforço de raciocínio, também ocupa o 1.º lugar no Tau3, que mede a inteligência de fronteira de agentes de voz em tarefas completas.

Avalia tarefas de apoio ao cliente por voz nos domínios da aviação, comércio a retalho e telecomunicações. O Pass@1 mede o sucesso das tarefas; o título dá igual peso a cada domínio.


* Backend do GPT Live: Astra (médio).

Avalia o suporte bancário por voz com recuperação de conhecimento e ferramentas de conta. Pass@1 é a fração de 97 tarefas banking_knowledge concluídas com sucesso.


* Backend do GPT Live: Astra (médio).

Avalia a gestão de pausas, a alternância de turnos na conversa, as interrupções e os sinais de acompanhamento.

Testa reações à fala em segundo plano, à fala dirigida a outra pessoa, aos sinais de acompanhamento do ouvinte e às interrupções.

Mede a rapidez com que o agente começa a responder depois de o utilizador terminar de falar.

Testa a utilização de ferramentas a partir de pedidos falados que contêm pausas naturais, hesitações e autocorreções. O Pass@1 avalia a sequência de chamadas da ferramenta.


* Backend do GPT Live: Terra (baixo).

Avalia a resposta falada a pedidos que utilizam ferramentas e que contêm pausas, hesitações e autocorreções. Avalia em que medida a resposta corresponde à intenção de referência.


* Backend do GPT Live: Terra (baixo).

O que dizem os clientes

1 de 4
“A integração do GPT‑Live‑1 no Yelp Host e no Hatch melhorou a alternância entre intervenientes e a precisão face à nossa arquitetura de voz tradicional. Quando o Yelp Host utiliza o GPT‑Live‑1 para atender chamadas, como reservas e pedidos de comida, observamos melhorias significativas nas taxas de tratamento de chamadas. Além disso, as pessoas que ligam usam frases mais completas e naturais, o que nos mostra que a experiência do outro lado da linha é verdadeiramente diferente.”
—Alex Levy, Diretor de Tecnologia

Novas opções de voz

Os programadores precisam de vozes adequadas aos seus produtos e que soem naturais para quem os utiliza. Com o GPT‑Live‑1, passamos de um pequeno conjunto de vozes em tempo real para uma seleção mais ampla de sotaques, dialetos e idiomas, dando aos programadores mais opções para definir a sonoridade dos seus assistentes.

Ouça as novas vozes

Continuaremos a expandir as opções de voz e a disponibilidade de idiomas nos próximos meses.

Preços & disponibilidade

O GPT‑Live‑1 já está disponível hoje na API⁠(abre numa nova janela) por 0,05 USD por minuto para a camada de voz de front-end. Combine-o com o modelo de back-end e o harness de agente adequados ao seu produto e crie uma experiência de voz capaz de acompanhar a escala do trabalho necessário.

Ligar o GPT-Live-1 ao Codex

1
import { Codex } from "@openai/codex-sdk";
2

3
const thread = new Codex().startThread({
4
workingDirectory: "./repo",
5
sandboxMode: "read-only",
6
approvalPolicy: "never",
7
});
8

9
async function answer(live, delegationId, context) {
10
const { finalResponse } = await thread.run(
11
`Answer the latest question using this repo.
12
Reply in two short spoken sentences.\n${context}`
13
);
14

15
live.send({
16
type: "session.commentary.append",
17
delegation_id: delegationId,
18
content: finalResponse,
19
});
20
}

Ligar o GPT-Live-1 ao Codex. Este excerto mostra como uma aplicação transmite o contexto da conversa ao Codex e devolve a respetiva resposta ao GPT-Live-1. A configuração da ligação e a gestão da delegação são omitidas.

Para aceder a vozes personalizadas, contacte a equipa comercial e saiba mais sobre os critérios de elegibilidade e o processo de pedido.

Outra forma de criar fluxos de trabalho de voz com base no GPT‑Live‑1 é através do OpenAI Presence, que usa o modelo para proporcionar interações de voz em tempo real. O Presence ajuda as empresas a implementar agentes de IA de confiança, capazes de responder a perguntas, resolver problemas, usar sistemas da empresa, realizar ações aprovadas e encaminhar os casos para pessoas quando necessário. Contacte o seu gestor de conta da OpenAI para saber mais.