
Parloa 创立初期,联合创始人 Stefan Ostwald 曾在一家保险公司的呼叫中心待了一天,当时他的团队正在那里开发早期语音体验。他坐在客服人员身旁,听着同样的对话一遍遍上演:重置密码、咨询保单、办理常规变更。他意识到,其中许多工作都可以自动化。
这段经历之后,总部位于柏林的 Parloa(在新窗口中打开) 开始构建基于规则的语音智能体,以自动处理大量客户互动。
随着 ChatGPT 问世,该公司逐步转向构建如今的 AI 智能体管理平台(AMP)。该平台基于包括 GPT‑5.4 在内的新一代模型。
AMP 让企业能够大规模设计、部署和管理客户服务互动。团队无需规划僵化的意图和流程,而是用自然语言定义行为、连接内部系统,并利用内置模拟与评估快速迭代。
Parloa 端到端处理这些互动,涵盖从简单路由到复杂多步骤请求的各种任务。其重点是在生产环境中保持一致性,因为性能、延迟和边缘情况都至关重要。为此,Parloa 会在部署模型前,持续使用真实客户场景进行测试。
“模型只有在生产环境中切实可用才有意义。我们与 OpenAI 密切合作,让模型达到实时对话所需的速度和可靠性。”
Parloa 的智能体管理平台(AMP)面向业务用户和领域专家,让他们无需编写代码即可构建 AI 智能体。
O’Reilly 表示:“借助 AMP,不同业务部门的领域专家可以亲自构建智能体并连接 API,整个过程更精简、更简单。”
从整体来看,AMP 可帮助品牌管理 AI 智能体的整个生命周期。它为非技术团队提供更简单的方式,让他们在智能体上线前定义其行为。领域专家无需编写代码或规划僵化的意图树,只需用自然语言设定智能体的角色、指令、工具和边界。这些配置将成为向模型提供提示以及系统在生产环境中如何运行的基础。
定义完成后,智能体会在部署前接受测试。Parloa 使用 GPT‑5.4 等模型模拟客户对话,其中一个模型扮演来电者,另一个运行已配置的智能体。团队可以直接检查这些互动,在逼真场景中测试变更,并在上线前反复迭代。
随后,同一批模型会结合确定性检查和“LLM 评审”评分来评估这些对话。由此可以判断智能体是否遵循指令、正确使用工具,并按预期完成任务。




在实时对话期间,AMP 的编排层会将智能体配置和对话上下文作为提示提供给 OpenAI 模型,以生成回复、通过 RAG 检索信息,或触发工具与客户的后端系统交互。每当最新一代模型在实际性能上展现出明显提升,Parloa 都会持续用其更新这一层。
对话结束后,由 OpenAI 提供支持的独立工作流会总结互动、识别客户意图,并根据既定规则评估表现。
随着智能体日益复杂,维护单一的整体式提示也变得更加困难。细微的改动也可能引发意外的副作用。为解决这一问题,Parloa 引入了模块化方法。身份验证、预订变更或账户更新等任务可以拆分为不同的子智能体,从而提高指令遵循能力,也让系统更易于持续演进。
与此同时,平台还会在可靠性最为关键的环节引入确定性控制。企业可以定义结构化 API 链和基于事件的逻辑,确保关键步骤按正确顺序执行,在对话灵活性与可预测的执行结果之间取得平衡。
在智能体上线前,Parloa 会使用 GPT‑4.1、GPT‑5‑mini 等模型模拟逼真的客户互动,再结合“LLM 评审”和确定性规则对这些互动进行评估。这样一来,团队便可测试边缘情况、快速迭代,并在客户遭遇故障前验证系统表现。
Parloa 的客户主要是大型企业;对这些企业而言,一致性与能力同等重要。
高级应用科学家 Matthäus Deutsch 表示:“每当新模型发布,我们都会用整套基准测试对其进行检验。”“对我们来说,系统不仅要在理论基准测试中有效,更要在真实用例中切实可用,这一点至关重要。”
Parloa 不依赖抽象的基准测试,而是复刻真实的生产智能体,并让其经过模拟和评估流程。这些测试会衡量在逼真条件下遵循指令的可靠性、调用 API 的一致性、延迟和整体表现。
这些评估用于确定哪些模型已可投入生产。只有在真实客户场景中表现可靠的模型才会部署。
Deutsch 表示:“企业客户确实面临迁移成本。”“系统一旦在生产环境中稳定运行,他们就会维持现状,只有在收益明确时才会切换。”
因此,即使在大规模运行时,系统在生产环境中的行为也可预测。在数百万次客户互动中,绝大多数对话都能顺畅解决问题。即使通话被转接给人工客服,也很少是因为系统失败。在一次部署中,一家全球旅游公司将请求转接人工客服的数量降低了 80%。
这种评估优先的理念已成为 Parloa 的核心差异化优势,使其能够快速推进,同时不牺牲生产环境中的可靠性。
相比文字聊天,语音会带来一套不同的限制条件。每次互动都要经过一条低延迟管线:语音转文本、模型推理和文本转语音。
在这条管线中,延迟至关重要。模型层哪怕只有轻微延迟,叠加后也会让来电者感到明显停顿,因此会影响模型的选择和优化方式。
Parloa 与 OpenAI 密切合作,围绕延迟、回复质量和指令遵循能力优化实时用例的性能。团队会在类似生产环境的条件下持续评估新一代模型并进行压力测试,然后才将其用于实时客户互动。
Parloa 会独立评估语音技术栈的每个组件:
- 测试语音转文本系统时会考察词错误率,尤其关注保单编号或账户标识符等敏感输入。
- 通过盲听测试评估文本转语音模型,以判断真实用户听到的语音是否自然。随后,还会将这些结果与真实客户互动进行对照,确保系统在生产环境中的表现始终一致。
- 目前正在评估语音到语音模型能否投入生产,重点考察延迟、准确性和成本。
这些系统从一开始就是为全球部署而构建的。基准测试覆盖多种语言,客户的业务遍及全球各个地区。这种严格的多语言标准既体现了 Parloa 的欧洲根基,也反映了企业客户的期望:他们要求系统在不同市场均保持一致表现,而非只适用于某一种语言或某一个地区。
如今,Parloa 的智能体每年处理来自零售、旅游和保险等行业的数百万次对话,支持从客服自动化到电视购物等创收流程的各类用例。
Parloa 认为,客户服务将演变为完全多模态的体验。
一段对话可能始于电话,随后在聊天中继续,其间还会出现链接或交互元素。AMP 不会将每个步骤视为独立流程,而是将其作为一次完整互动来处理。未来,AI 智能体在客户旅程中的地位可能会像网站和移动应用一样重要。
随着企业逐步提高客户互动的自动化比例,Parloa 正致力于让 AI 智能体具备足够的可靠性、灵活性和可信度,从而在全球范围内大规模运行。


