Crie experiências de voz mais naturais com o GPT‑Live‑1 na API
O GPT‑Live‑1 traz as conversas naturais e full-duplex do ChatGPT para a API, com mais controlo sobre a forma como os agentes de voz falam e agem.
Estamos a lançar o GPT‑Live‑1 na API, disponibilizando aos programadores um modelo de voz potente e natural para criar aplicações com voz e fluxos de trabalho empresariais. Apresentado inicialmente no ChatGPT, o GPT‑Live‑1 consegue ouvir e falar em simultâneo e, como demonstrado com o Codex e o ChatGPT Work(abre numa nova janela), pode delegar raciocínios e ações mais aprofundados aos modelos e às ferramentas aos quais está associado.
Para o lançamento do GPT‑Live‑1 na API, concentrámo-nos em novas capacidades que permitem aos programadores orientar e personalizar as experiências de voz em função dos seus utilizadores, fluxos de trabalho e objetivos. Uma das principais vantagens do GPT‑Live‑1, a gestão fluida de interrupções, já está a gerar impacto empresarial: nas primeiras avaliações, a Speak constatou que o GPT‑Live‑1 deu aos alunos mais tempo para refletir antes de o tutor de idiomas responder, reduzindo em quase 80% as interrupções em comparação com os sistemas anteriores baseados em turnos.
Principais pontos fortes do GPT‑Live‑1 na API:
Gestão de interrupções: Melhora a gestão de interrupções através de um único modelo que processa em conjunto o áudio recebido e emitido, evitando a latência e as transições frágeis das arquiteturas STT–LLM–TTS em cadeia.
Delegação de raciocínio e chamadas de ferramentas: O GPT‑Live‑1 pode delegar o raciocínio e as chamadas de ferramentas a um modelo de texto de back-end, como o GPT‑6 Astra ou um modelo de terceiros.
Tom, ritmo e estilo: Permite aos programadores definir o tom, o ritmo e o estilo de conversa de um agente através do prompt de sistema.
Gestão silenciosa do contexto & ruído de fundo: Gere melhor o ruído de fundo e o silêncio sem interromper a conversa nem narrar cada passo em voz alta.
Fiabilidade em sessões longas: Melhora a retenção do contexto e a qualidade da conversa em interações prolongadas.
Suporte para telefonia: Permite implementar agentes de voz full-duplex em chamadas telefónicas, desde reservas em restaurantes ao apoio ao cliente.
Try GPT-Live-1
See what it can do
- Talk over it—naturally. Ask for help, then interrupt mid-response to change the question or add detail.
- Take it with you. Try a conversation while walking outside or with everyday background noise, and see how it stays with you.
- Make it playful. Laugh, hesitate, use short acknowledgments, or briefly talk to someone nearby—then continue the conversation.
Esta demonstração tem um limite de tempo. Ao utilizá-la, concordas com os Termos da OpenAI e tomas conhecimento da nossa Política de Privacidade.
Os agentes de voz tradicionais combinam conversão de voz em texto, um modelo de raciocínio e conversão de texto em voz. Cada transição aumenta a latência e cria mais oportunidades para perder o timing, o contexto ou o ritmo natural da conversa. Muitas vezes, cabe aos programadores coordenar estas etapas, incluindo o que acontece quando alguém interrompe, faz uma pausa ou muda de rumo.
O GPT‑Live‑1 ouve e fala através de um único modelo, simplificando a camada de voz. Consegue reagir de imediato a interrupções e confirmações, enquanto delega o raciocínio mais aprofundado para o back-end. Assim, a conversa pode prosseguir enquanto o trabalho decorre em segundo plano.
Os programadores escolhem os modelos, as ferramentas e o harness de agente por detrás da conversa. Por exemplo, podem combinar o GPT‑Live‑1 com um modelo como o Luna para tarefas de grande volume, como agendamentos ou atualizações de pedidos, e utilizar um modelo como o Astra para questões complexas de clientes que exijam raciocínio. Esta flexibilidade permite aos programadores adequar a profundidade do raciocínio, a velocidade e o custo a cada tarefa.
O GPT‑Live‑1 fornece nativamente transcrições de ASR e o texto das respostas. Oferece também uma sólida compreensão de conteúdos alfanuméricos e suporta a ponderação de palavras-chave. Embora o GPT‑Live‑1 não seja um modelo baseado em turnos, suporta nativamente a deteção de turnos, permitindo aos programadores continuar a desenvolver com base em limites de turno explícitos.
Nas nossas avaliações, o GPT‑Live‑1 melhora o desempenho no Full Duplex Bench em 30 pontos percentuais face ao GPT‑Realtime‑2.1, com grandes ganhos na latência da alternância de turnos e no comportamento interativo. Combinado com o GPT‑6 Astra, com um nível médio de esforço de raciocínio, também ocupa o 1.º lugar no Tau3, que mede a inteligência de fronteira de agentes de voz em tarefas completas.
Avalia tarefas de apoio ao cliente por voz nos domínios da aviação, comércio a retalho e telecomunicações. O Pass@1 mede o sucesso das tarefas; o título dá igual peso a cada domínio.
* Backend do GPT Live: Astra (médio).
Avalia o suporte bancário por voz com recuperação de conhecimento e ferramentas de conta. Pass@1 é a fração de 97 tarefas banking_knowledge concluídas com sucesso.
* Backend do GPT Live: Astra (médio).
Avalia a gestão de pausas, a alternância de turnos na conversa, as interrupções e os sinais de acompanhamento.
Testa reações à fala em segundo plano, à fala dirigida a outra pessoa, aos sinais de acompanhamento do ouvinte e às interrupções.
Mede a rapidez com que o agente começa a responder depois de o utilizador terminar de falar.
Testa a utilização de ferramentas a partir de pedidos falados que contêm pausas naturais, hesitações e autocorreções. O Pass@1 avalia a sequência de chamadas da ferramenta.
* Backend do GPT Live: Terra (baixo).
Avalia a resposta falada a pedidos que utilizam ferramentas e que contêm pausas, hesitações e autocorreções. Avalia em que medida a resposta corresponde à intenção de referência.
* Backend do GPT Live: Terra (baixo).
Os programadores precisam de vozes adequadas aos seus produtos e que soem naturais para quem os utiliza. Com o GPT‑Live‑1, passamos de um pequeno conjunto de vozes em tempo real para uma seleção mais ampla de sotaques, dialetos e idiomas, dando aos programadores mais opções para definir a sonoridade dos seus assistentes.
Continuaremos a expandir as opções de voz e a disponibilidade de idiomas nos próximos meses.
O GPT‑Live‑1 já está disponível hoje na API(abre numa nova janela) por 0,05 USD por minuto para a camada de voz de front-end. Combine-o com o modelo de back-end e o harness de agente adequados ao seu produto e crie uma experiência de voz capaz de acompanhar a escala do trabalho necessário.
Para aceder a vozes personalizadas, contacte a equipa comercial e saiba mais sobre os critérios de elegibilidade e o processo de pedido.
Outra forma de criar fluxos de trabalho de voz com base no GPT‑Live‑1 é através do OpenAI Presence, que usa o modelo para proporcionar interações de voz em tempo real. O Presence ajuda as empresas a implementar agentes de IA de confiança, capazes de responder a perguntas, resolver problemas, usar sistemas da empresa, realizar ações aprovadas e encaminhar os casos para pessoas quando necessário. Contacte o seu gestor de conta da OpenAI para saber mais.

