Crie experiências de voz mais naturais com GPT‑Live‑1 na API
O GPT‑Live‑1 leva as conversas naturais e full-duplex do ChatGPT à API, com mais controle sobre como os agentes de voz falam e agem.
Estamos lançando o GPT‑Live‑1 na API, oferecendo aos desenvolvedores um modelo de voz potente e natural para criar apps com recursos de voz e fluxos de trabalho empresariais. Apresentado inicialmente no ChatGPT, o GPT‑Live‑1 é capaz de ouvir e falar ao mesmo tempo e, como demonstrado com o Codex e o ChatGPT Work(abre em uma nova janela), pode delegar raciocínio mais aprofundado e ações aos modelos e às ferramentas com os quais é combinado.
Para o lançamento do GPT‑Live‑1 na API, nos concentramos em novos recursos que permitem aos desenvolvedores orientar e personalizar experiências de voz de acordo com seus usuários, fluxos de trabalho e objetivos. Um dos principais pontos fortes do GPT‑Live‑1, a capacidade de lidar com interrupções de forma fluida, já traz resultados para as empresas: nas primeiras avaliações, a Speak constatou que o GPT‑Live‑1 dava aos alunos mais tempo para pensar antes de o tutor de idiomas responder, reduzindo as interrupções em quase 80% em comparação com os sistemas anteriores baseados em turnos.
Principais pontos fortes do GPT‑Live‑1 na API:
Gerenciamento de interrupções: Lida melhor com interrupções por meio de um único modelo que raciocina sobre o áudio de entrada e de saída em conjunto, evitando a latência e as transições frágeis das arquiteturas STT–LLM–TTS em cadeia.
Delegação de raciocínio e chamadas de ferramentas: O GPT‑Live‑1 pode delegar raciocínio e chamadas de ferramentas a um modelo de texto no backend, como o GPT‑6 Astra, ou a um modelo de terceiros.
Tom, ritmo e estilo: Permite que os desenvolvedores definam o tom, o ritmo e o estilo de conversa de um agente por meio do prompt do sistema.
Gerenciamento silencioso de contexto e ruído de fundo: Lida melhor com ruídos de fundo e silêncios sem interromper a conversa nem narrar cada etapa em voz alta.
Confiabilidade em sessões longas: Melhora a retenção de contexto e a qualidade das conversas em interações prolongadas.
Suporte a telefonia: Permite implantar agentes de voz full duplex em chamadas telefônicas, desde reservas em restaurantes até o suporte ao cliente.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Esta demonstração tem duração limitada. Ao usá-la, você concorda com os Termos da OpenAI e declara estar ciente da nossa Política de Privacidade.
Os agentes de voz tradicionais combinam conversão de fala em texto, um modelo de raciocínio e conversão de texto em fala. Cada transição aumenta a latência e cria mais oportunidades de perder o timing, o contexto ou o ritmo natural da conversa. Muitas vezes, cabe aos desenvolvedores coordenar essas etapas, inclusive o que acontece quando alguém interrompe, faz uma pausa ou muda de direção.
O GPT‑Live‑1 ouve e fala em um único modelo, simplificando a camada de voz. Ele pode responder a interrupções e sinais de compreensão no momento em que ocorrem, enquanto delega o raciocínio mais aprofundado ao backend. Isso permite que a conversa continue enquanto o trabalho acontece em segundo plano.
Os desenvolvedores escolhem os modelos, as ferramentas e o harness do agente por trás da conversa. Por exemplo, eles podem combinar o GPT‑Live‑1 com um modelo como o Luna para tarefas de alto volume, como agendamentos ou atualizações de pedidos, e usar um modelo como o Astra para questões complexas de clientes que exigem raciocínio. Essa flexibilidade permite adequar a profundidade do raciocínio, a velocidade e o custo a cada tarefa.
O GPT‑Live‑1 fornece nativamente transcrições de reconhecimento automático de fala (ASR) e o texto das respostas. Ele também oferece boa compreensão alfanumérica e suporte à priorização de palavras-chave. Embora o GPT‑Live‑1 não seja um modelo baseado em turnos, ele oferece suporte nativo à detecção de turnos, para que os desenvolvedores possam continuar criando soluções com limites explícitos entre as falas.
Nas nossas avaliações, o GPT‑Live‑1 melhora o desempenho no Full Duplex Bench em 30 pontos percentuais em relação ao GPT‑Realtime‑2.1, com grandes avanços na latência entre falas e no comportamento interativo. Combinado com o GPT‑6 Astra com esforço de raciocínio médio, ele também ocupa o 1º lugar no Tau3, que mede a inteligência de agentes de voz de ponta em tarefas executadas do início ao fim.
Avalia tarefas de atendimento ao cliente por voz nos setores aéreo, de varejo e de telecomunicações. Pass@1 mede o sucesso nas tarefas; o resultado geral atribui o mesmo peso a cada setor.
* Backend do GPT Live: Astra (médio).
Avalia o suporte bancário por voz com recuperação de conhecimento e ferramentas de conta. Pass@1 é a proporção das 97 tarefas de banking_knowledge concluídas com sucesso.
* Backend do GPT Live: Astra (médio).
Avalia como o modelo lida com pausas, alternância de falas, interrupções e sinais de acompanhamento do ouvinte.
Testa as reações a falas ao fundo, falas dirigidas a outra pessoa, sinais de acompanhamento do ouvinte e interrupções.
Mede a rapidez com que o agente começa a responder depois que o usuário termina sua fala.
Testa o uso de ferramentas a partir de solicitações faladas que contêm pausas naturais, hesitações e autocorreções. Pass@1 avalia a sequência de chamadas de ferramentas.
* Backend do GPT Live: Terra (baixo).
Avalia a resposta falada a solicitações que usam ferramentas e contêm pausas, hesitações e autocorreções. Mede o quanto a resposta corresponde à intenção de referência.
* Backend do GPT Live: Terra (baixo).
Os desenvolvedores precisam de vozes que combinem com seus produtos e soem naturais para quem os utiliza. Com o GPT‑Live‑1, estamos ampliando nosso pequeno conjunto de vozes em tempo real para oferecer uma seleção mais abrangente de sotaques, dialetos e idiomas, dando aos desenvolvedores mais opções para definir como seus assistentes soam.
Continuaremos ampliando as opções de voz e a disponibilidade de idiomas nos próximos meses.
O GPT‑Live‑1 está disponível na API a partir de hoje(abre em uma nova janela) por US$ 0,05 por minuto para a camada de voz do front-end. Combine-o com o modelo de backend e a estrutura de execução de agentes que atendam ao seu produto e crie uma experiência de voz que possa crescer com o trabalho que precisa realizar.
Para ter acesso a vozes personalizadas, fale com vendas para saber mais sobre os critérios de elegibilidade e o processo de solicitação.
Outra forma de criar fluxos de trabalho por voz com o GPT‑Live‑1 é usar o OpenAI Presence, que usa o modelo para oferecer interações por voz em tempo real. O Presence ajuda empresas a implantar agentes de IA confiáveis que podem responder a perguntas, resolver problemas, usar sistemas da empresa, realizar ações aprovadas e encaminhar casos para pessoas quando necessário. Entre em contato com seu diretor de contas da OpenAI para saber mais.

