跳至主要內容
OpenAI

2026年5月7日

新創公司

Parloa 打造客戶樂於交談的服務智慧體

Parloa 運用 OpenAI 模型,為企業模擬、評估及執行語音客服系統。

Parloa
公司規模: 新創公司
地區: 歐洲與英國, 全球
產業: 科技
產品: API
載入中…

Parloa 創立初期,共同創辦人 Stefan Ostwald 曾在一間保險公司的客服中心待上一整天;當時,他的團隊正在為該中心打造早期的語音體驗。他坐在客服人員身旁,聽著同樣的對話一再上演:重設密碼、詢問保單,以及辦理例行變更。他意識到,這些工作大多可以自動化。

有了這次經驗後,總部位於柏林的 Parloa(在新視窗中開啟) 開始打造規則式語音智慧體,將大量客戶互動自動化。

隨著 ChatGPT 問世,該公司轉而打造如今的 AI 智慧體管理平台 (AMP),採用包括 GPT‑5.4 在內的新一代模型。

AMP 讓企業能大規模設計、部署及管理客服互動。團隊不必規劃僵化的意圖與流程,而是以自然語言定義行為、連接內部系統,並透過內建的模擬與評估快速反覆改進。

Parloa 端到端處理這些互動,從簡單的轉接到複雜的多步驟要求都能應付。正式環境中的一致表現是重點,效能、延遲和邊緣案例缺一不可。為了維持一致表現,Parloa 會持續以真實客戶情境測試模型,再進行部署。

「模型只有在正式環境中確實可用,才有意義。我們與 OpenAI 密切合作,致力讓模型兼具速度與可靠性,足以支援即時對話。」
—Ciaran O’Reilly Ibañez,Parloa 工程經理

為企業建置人員設計 AMP

Parloa 的智慧體管理平台(AMP)專為企業使用者和領域專家設計,讓他們無須編寫程式碼也能打造 AI 智慧體。

O’Reilly 表示:「有了 AMP,不同業務單位的領域專家就能親自打造智慧體、連接 API,整個過程更精簡、更容易。」

整體而言,AMP 讓品牌能管理 AI 智慧體的完整生命週期,也為非技術團隊提供更簡單的方式,讓團隊能在智慧體正式上線前定義行為。領域專家不必編寫程式碼或規劃僵化的意圖樹,而是以自然語言設定智慧體的角色、指示、工具及界線。上述設定會成為模型提示詞以及系統在正式環境中運作方式的基礎。

完成定義後,智慧體會在部署前接受測試。Parloa 使用 GPT‑5.4 等模型模擬客戶對話,由一個模型扮演來電者,另一個則執行設定好的智慧體。團隊可直接檢視這些互動、在逼真的情境中測試變更,並在上線前反覆改進。

接著,再由相同模型結合確定性檢查與 LLM 評審評分,評估這些對話。這能顯示智慧體是否遵循指示、正確使用工具,並依預期完成任務。

在即時對話期間,AMP 的協調層會將智慧體設定與對話脈絡作為提示詞提供給 OpenAI 模型,讓模型產生回應、透過 RAG 擷取資訊,或觸發工具與客戶的後端系統互動。當新一代模型在實際效能上展現明顯提升時,Parloa 會將新模型導入協調層,持續更新所採用的模型。

對話結束後,由 OpenAI 驅動的獨立工作流程會摘要互動內容、分類客戶意圖,並依照既定規則評估表現。

隨著智慧體日益複雜,維護單一而龐大的提示詞也變得更困難。即使微小的變更,也可能引發非預期的副作用。為了解決這項問題,Parloa 導入了模組化方法。驗證身分、變更預訂或更新帳戶等任務,可拆分給不同的子智慧體處理,藉此改善指示遵循能力,也讓系統日後更容易演進。

同時,平台也在可靠性最關鍵之處加入確定性控制。企業可定義結構化的 API 鏈與事件式邏輯,確保關鍵步驟依正確順序執行,在對話彈性與可預測的執行結果之間取得平衡。

Parloa 使用 GPT‑4.1、GPT‑5‑mini 等模型,在智慧體上線前模擬逼真的客戶互動,再結合 LLM 評審與確定性規則加以評估。因此,團隊能測試邊緣案例、快速反覆改進,並先驗證效能,避免客戶直接面對系統故障。

評估優先的方法

Parloa 主要服務大型企業;對這些企業而言,一致性與能力同等重要。

資深應用科學家 Matthäus Deutsch 表示:「每當新模型推出,我們都會使用整套基準測試加以檢驗。對我們而言,系統不能只在理論性的基準測試中奏效,在實際使用情境中也必須真正可行,這點非常重要。」

Parloa 不依賴抽象的基準測試,而是重現正式環境中實際運作的智慧體,並透過模擬與評估流程加以測試。這些測試會衡量真實條件下的指示遵循可靠性、API 呼叫一致性、延遲及整體效能。

這些評估會決定哪些模型已可投入正式環境。只有在各種真實客戶情境中皆表現可靠的模型才會部署。

Deutsch 表示:「企業客戶確實必須承擔移轉成本。系統一旦在正式環境中順利運作,他們就會維持系統穩定,只有在效益明確時才會更換。」

因此,即使規模擴大,系統在正式環境中的運作仍可預測。在數百萬次客戶互動中,大多數對話都能順暢解決問題。即使通話轉接給真人客服,通常也不是因為系統失敗才升級處理。在其中一項部署中,某家全球旅遊公司將要求轉接真人客服的次數降低了 80%。

這種評估優先的思維已成為 Parloa 的核心差異化優勢,讓 Parloa 能快速推進,同時不犧牲正式環境中的可靠性。

打造全球規模的語音服務

語音面臨的限制與文字對話截然不同。每次互動都會經過低延遲管線:語音轉文字、模型推理,再將文字轉為語音。

因此,延遲是這條管線的關鍵考量。即使模型層只有些微延遲,累積後也會讓來電者明顯感到停頓,進而影響模型的選擇與最佳化方式。

Parloa 與 OpenAI 密切合作,針對即時使用情境最佳化效能,重點包括延遲、回應品質及指示遵循能力。團隊會持續在類似正式環境的條件下評估並壓力測試新版模型,完成評估與壓力測試後,才會將新版模型導入即時客戶互動。

Parloa 會分別評估語音技術堆疊的各個元件:

  • 語音轉文字系統會接受字詞錯誤率測試,尤其重視保單號碼或帳戶識別碼等敏感輸入。
  • 文字轉語音模型會透過盲聽測試,評估真實使用者聽到的語音是否自然。接著,這些結果會與真實客戶互動交叉檢驗,確保在正式環境中的表現一致。
  • 目前正評估語音到語音模型是否已可投入正式環境,重點在於延遲、準確度及成本。

這些系統從一開始就是為全球部署而打造。基準測試涵蓋多種語言,而客戶的業務遍及全球各地。這種嚴謹的多語言要求,既反映 Parloa 的歐洲根基,也呼應企業客戶的期望:他們要求在不同市場都能維持一致表現,而非僅限於單一語言或地區。

如今,Parloa 的智慧體處理零售、旅遊、保險等產業的數百萬次對話,支援的使用情境從客服自動化,到電視購物等創造營收的流程。

以持續演進的技術因應多變的客戶旅程

Parloa 認為,客戶服務正朝完整的多模態體驗演進。

對話可能從電話開始,接著轉至文字對話,過程中還會加入連結或互動元素。AMP 不會將每個步驟視為獨立流程,而是將整個過程當成單一互動處理。長遠來看,AI 智慧體在客戶旅程中的核心地位,可能會媲美網站和行動應用程式。

隨著企業將愈來愈多客戶互動自動化,Parloa 專注於讓 AI 智慧體具備足夠的可靠性與彈性,並贏得使用者信任,才能在全球規模下運作。