
Parloa 成立初期,聯合創辦人 Stefan Ostwald 曾在一家保險公司的電話服務中心待了一天;當時,他的團隊正在開發早期的語音體驗。他坐在客戶服務人員旁邊,聽着同類對話一再重複:重設密碼、查詢保單、處理例行變更。他意識到,當中大部分工作都可以自動化。
在這次體驗後,總部位於柏林的 Parloa(在新視窗中開啟) 開始建立以規則為本的語音智能代理,將大量客戶互動自動化。
隨着 ChatGPT 面世,公司進一步發展出現今的 AI Agent Management Platform(AMP,AI 智能代理管理平台),建基於包括 GPT‑5.4 在內的新一代模型。
AMP 讓企業能夠大規模設計、部署和管理客戶服務互動。團隊毋須勾劃僵化的意圖與流程,而是以自然語言定義行為、連接內部系統,並透過內置模擬和評估快速反覆改進。
Parloa 端到端處理這些互動,涵蓋簡單分流以至複雜的多步驟請求。重點是在生產環境中保持一致,而效能、延遲和特殊情況都至關重要。為達成這個目標,Parloa 會在部署前持續以真實客戶情境測試模型。
「模型只有在生產環境中真正可用,才有價值。我們與 OpenAI 緊密合作,務求令模型速度和可靠性足以支援實時對話。」
Parloa 的智能代理管理平台(AMP)讓業務用戶和領域專家無需編寫程式碼,也能建立 AI 智能代理。
O’Reilly 表示:「透過 AMP,不同業務部門的領域專家可以親自建立智能代理並連接 API,整個過程更精簡、更簡單。」
概括而言,AMP 讓品牌能夠管理 AI 智能代理的完整生命週期。平台為非技術團隊提供更簡單的方式,讓他們在智能代理正式上線前定義其應有的行為。領域專家毋須編寫程式碼或勾劃僵化的意圖樹,只需以自然語言設定智能代理的角色、指示、工具和界限。這些設定會決定如何向模型提供提示,以及系統在生產環境中如何運作。
定義完成後,智能代理會在部署前接受測試。Parloa 使用 GPT‑5.4 等模型模擬客戶對話,由一個模型扮演來電者,另一個則運行已設定的智能代理。團隊可以直接檢視這些互動、在逼真的情境中測試變更,並在上線前反覆改進。
其後,同一批模型會結合確定性檢查與 LLM 評審評分,評估這些對話。由此可判斷智能代理有否遵從指示、正確使用工具,以及按預期完成任務。




在實時對話期間,AMP 的協調層會將智能代理設定和對話情境提供予 OpenAI 模型,以產生回應、透過 RAG 檢索資料,或觸發工具與客戶的後端系統互動。每當最新一代模型在實際應用中展現明顯提升,Parloa 都會持續更新這一層所使用的模型。
對話結束後,另一些由 OpenAI 驅動的工作流程會總結互動、分類客戶意圖,並按照既定規則評估效能。
隨着智能代理日益複雜,維護單一而龐大的提示詞也變得更困難。即使是微小變更,也可能引發意料之外的副作用。為解決這個問題,Parloa 引入了模組化方法。身份驗證、更改預訂或更新帳戶等任務可分拆為不同的子智能代理,從而提升指示遵從能力,亦令系統日後更易演進。
與此同時,平台在可靠性最關鍵之處加入確定性控制。企業可定義結構化 API 鏈和事件式邏輯,確保關鍵步驟按正確次序執行,在靈活對話與可預測的執行之間取得平衡。
Parloa 使用 GPT‑4.1、GPT‑5‑mini 等模型,在智能代理正式上線前模擬逼真的客戶互動,再結合 LLM 評審和確定性規則評估這些互動。團隊因而能夠測試特殊情況、快速反覆改進,在客戶實際使用前驗證效能,避免他們遇到系統故障。
Parloa 的客戶主要是大型企業;對這些企業而言,一致性與能力同樣重要。
資深應用科學家 Matthäus Deutsch 表示:「每當有新模型推出,我們都會用整套基準測試加以評估。對我們而言,系統不僅要在理論基準測試中奏效,更要能應付真實應用情境。」
Parloa 不依賴抽象的基準測試,而是重現實際生產環境中的智能代理,並透過模擬和評估流程測試它們。這些測試會在逼真條件下衡量指示遵從的可靠性、API 調用的一致性、延遲和整體效能。
這些評估用於判斷哪些模型已可投入生產環境。只有在各種真實客戶情境中都表現可靠的模型才會部署。
Deutsch 表示:「企業客戶確實要承擔遷移成本。系統一旦在生產環境中穩定運作,他們便會維持現狀,只有在效益明確時才會改用其他模型。」
因此,即使大規模運作,系統在生產環境中的行為仍然可預測。在數以百萬計的客戶互動中,大部分對話都能順利解決問題。即使通話轉交真人客戶服務人員,也很少是因系統處理失敗。在其中一項部署中,一家環球旅遊公司將要求轉接真人客戶服務人員的次數減少了 80%。
這種評估優先的思維已成為 Parloa 的核心優勢,讓公司在不犧牲生產環境可靠性的情況下迅速推進。
相較文字聊天,語音帶來一套不同的限制。每次互動都會經過低延遲流程:語音轉文字、模型推理和文字轉語音。
這套流程令延遲成為關鍵因素。模型層即使只有輕微延遲,累積起來也會令來電者明顯感到停頓,因而影響模型的選擇和優化方式。
Parloa 與 OpenAI 緊密合作,針對實時應用情境優化效能,重點改善延遲、回應質素和指示遵從能力。團隊會在貼近生產環境的測試環境持續評估模型的新版本並進行壓力測試,然後才將其用於實時客戶互動。
Parloa 會獨立評估語音技術堆疊的每個組件:
- 語音轉文字系統會接受字詞錯誤率測試,尤其針對保單號碼或帳戶識別碼等敏感輸入。
- 文字轉語音模型會透過盲聽測試,評估實際用戶聽起來覺得語音有多自然。其後,這些結果會與真實客戶互動核對,確保在生產環境中的表現一致。
- 目前正評估語音到語音模型是否已可投入生產環境,重點考慮延遲、準確度和成本。
這些系統從一開始就是為全球部署而設。基準測試涵蓋多種語言,客戶的業務遍及全球不同地區。這種對多語言表現的嚴格要求,既反映 Parloa 的歐洲根基,也回應企業客戶的期望:他們要求系統在不同市場均有一致表現,而非只限於單一語言或地區。
現時,Parloa 的智能代理在零售、旅遊和保險等行業處理數以百萬計的對話,支援服務自動化以至電視購物等創收流程的各種應用情境。
Parloa 認為,客戶服務將演變成全面的多模態體驗。
對話可能從電話開始,延續至聊天,期間亦可加入連結或互動元素。AMP 不會將每個步驟視為獨立流程,而是將整個過程當作一次互動處理。長遠而言,AI 智能代理對客戶旅程的重要性或會媲美網站和流動應用程式。
隨着企業將愈來愈多客戶互動自動化,Parloa 致力令 AI 智能代理具備足夠的可靠性、靈活性和可信度,以支援全球規模的營運。


