跳到主要內容
OpenAI

2026年9月21日

初創企業

V7 如何賦予 AI 智能代理機構記憶

V7 將公司檔案轉化為智能代理情境,而 GPT‑6 Astra 在最困難的圖譜查詢測試中達到 89% 準確率。

黑色石墨微距紋理上的白色 V7 標誌。
公司規模: 初創公司
地區: 歐洲及英國
行業: 金融

成果

89%

GPT-6 Astra 在最困難查詢中的準確率

成果

78%

使用 GPT-5.6 Luna 降低每份文件的成本

成果

+11.6 個百分點

使用 GPT-5.6 Luna 提高準確率

正在載入...

現今的模型能推理複雜任務,卻不會自動理解這些任務背後的業務情境。哪一份基金報告才是最新版本?同一實體在三個系統中分別使用甚麼名稱?

這些情境散落在文件、資料室、試算表、電郵和內部工具中,既零散、未經梳理,智能代理亦無法看見。對金融、保險及房地產團隊而言,工作流程中的檢索準確度不容妥協。

Rizzoli 與 Edwardsson 共同開發出廣受使用的電腦視覺無障礙應用程式後,於 2018 年創立 V7(在新視窗中開啟),協助企業讓 AI 系統了解其業務運作方式。V7 Go 是用於建立關鍵任務工作流程的智能代理平台,並將深藏的情境整理成智能代理可查詢及據以行動的記憶。

V7 Go 使用 GPT‑5.6 Luna 從數百萬個檔案擷取資訊,並整理至情境圖譜。圖譜連接實體、關係及引用證據,為 MCP 搜尋及可重複運行、橫跨數百個步驟的工作流程提供支援。在工作流程方面,V7 Go 使用 GPT‑5.6 Terra 和 Sol,針對人類需數十小時才能完成的複雜多步驟指示進行推理及使用工具。V7 亦開始在要求最高的情境圖譜查詢中使用 GPT‑6 Astra,包括橫跨數千份文件的財務分析。

V7 表示,透過情境、模型和工具協同運作,智能代理可在數分鐘內完成包含 50 至 100 個步驟的工作流程,準確率達 99.9%,同時為每項決策保留可審計記錄。

「要解決金融和保險業的複雜企業應用場景,AI 對企業運作方式的理解,必須達到它從互聯網學習所得的水平。」
—Alberto Rizzoli,V7 聯合創辦人兼行政總裁

為智能代理提供理解整個業務所需的情境

情境圖譜解決了一個特定問題。智能代理每次收到請求都要重新探索情境,因而需要進行數十次搜尋,耗費時間與 Token,並經常遺漏隱藏於關係之中的關鍵資訊。

數據抵達後,V7 Go 會連接 SharePoint 和 Google Drive 等儲存庫,掃描當中的實體、關係、事實、屬性及指標,再填充一個圖譜;相比長情境方法,查詢這個圖譜的成本和速度可改善一個數量級。

情境圖譜為智能代理提供可直接查詢、結構清晰且保持最新的記錄。新檔案抵達時,V7 Go 會識別公司、基金、人物或本體中的任何實體,然後將每項事實連接至新建或現有記錄,並保留指向原始來源的引用證據。如果圖譜所含資訊不足,V7 Go 仍可透過 RAG 搜尋底層文件。

V7 亦測試了情境結構所帶來的影響。HERB 是一項評估如何找出並連接散落於企業系統中資訊的基準測試;V7 的純檢索系統表現較官方基線高 69%,並令無法回答查詢的幻覺減少 38%。V7 Go 利用這些連結來源的情境,確保複雜工作流程以各公司的自有資訊為依據。

V7 Go 將這些有組織的情境用於私募股權交易篩選及保險核保等工作流程。在以下示範中,工作流程從名為「機密資料備忘錄」(CIM)的交易文件擷取資訊,整理關鍵財務數據、交易條款及管理層詳情,並引用風險欄位,最後由 V7 Go 生成篩選摘要。

情境圖譜讓模型可以運用公司的歷史資料,而毋須每次重新學習。對於長時間運行的智能代理,V7 Go 會將近期互動保留在模型的活躍情境中,並把較舊的資料儲存於圖譜,供有需要時擷取。

這些共享情境已加快 V7 客戶處理文件密集型工作的速度:

  • 資產管理公司篩選交易的速度可較以往快 21 倍,將原需一整天的流程縮短至僅 15 分鐘

  • 某金融服務團隊將審查時間由超過 100 小時縮短至不足 10 小時,每項任務節省 12,000 美元專家費用

  • 保險團隊讓智能代理掌握所有過往索償及現有保單的歷史知識後,理賠處理錯誤較人工基線減少 13.5%

「採用 GPT-5.6 Terra 後,我們得以移除許多中間工作流程階段;這些階段以往只是為了簡化模型的任務而設。更強大的模型加上更多情境,讓我們節省了數天的交付工作,而且往往首次建立工作流程便能取得正確結果。」
—Simon Edwardsson,V7 聯合創辦人兼技術總監

選擇 OpenAI,確保複雜工作流程順利運作

複雜的多步驟工作流程有賴模型可靠地遵循冗長指示、運行工具、解讀結果,並完成一連串步驟。上游的一個錯誤,便可能造成高昂代價,並損害對 AI 系統的信任。V7 Go 引導模型完成長週期任務,涵蓋確定性程式碼、交接予較小型模型、檔案生成步驟及整合,並為每次運行保留可審計記錄。

在 AI 生成的工作流程中,V7 Go 會將每個步驟分配至高速、中階和智能層級。GPT‑5.6 Luna 負責結構化擷取及其他高負載工作,而 GPT‑5.6 Terra 或 Sol 則支援對話、Go Agent 路徑,以及需要更多推理或工具使用的步驟。

V7 以持續維護的基準測試套件評估新模型,涵蓋引用準確度、數百種文件類型的擷取質素、答案正確性、指示遵循、延遲、成本及真實企業工作流程。在 V7 最重視的行為表現上,OpenAI 勝過大多數模型。OpenAI 亦在數小時內批准並落實 V7 的容量提升需求,而 V7 使用的其他供應商則需數星期。

「我們選擇 OpenAI 作為預設方案,因為它在 V7 Go 所倚賴的多步驟工具工作流程中表現最佳。在我們的情境圖譜基準測試中,GPT-5.6 Sol 將工具調用錯誤率由 GPT-5.5 的 2.7% 降至 0.2%。」
—Simon Edwardsson,V7 聯合創辦人兼技術總監

在 V7 最新的任務執行框架中,涉及多次外部調用的關鍵工作流程如今最多可快 50% 完成。V7 亦量度到 GPT‑5.6 Luna 帶來另一項效率提升:每份文件的成本較 GPT‑5.4 mini 低 78%。V7 亦將文件密集的 V7 Go 工作負載由 Chat Completions API 遷移至 Responses API。測試顯示,這項轉變令部分大量使用 PDF 的工作流程減少約 5% Token 用量,並提高快取可靠性。

V7 亦以最困難的查詢測試 GPT‑6 Astra。GPT‑5.6 Sol 在 V7 多項現有基準測試中的表現已趨飽和,因此公司利用數千份文件中較雜亂的真實數據,建立了一套更具挑戰性的圖譜查詢問題。測試數據集涵蓋四個難度級別。V7 報告指,在極高難度級別中,GPT‑5.6 Sol 得分為 78%,而 GPT‑6 Astra 的準確率則達 89%。兩個模型在簡單、中等及困難級別的得分均接近 100%。

將企業知識帶進 ChatGPT 和 Codex

V7 Go 已透過其 MCP 伺服器提供情境圖譜查詢及資料匯入功能,客戶可從 ChatGPT 及其他兼容用戶端使用。客戶亦可在 Codex 中透過 MCP 建立 V7 Go 工作流程。配合更簡化的工作流程設計,建立一個中等長度工作流程所需的時間,已由約一小時縮短至約 20 分鐘。

V7 的長遠目標是讓這種共享記憶更主動發揮作用。團隊正開發可在情境圖譜中的事實改變時自動啟動、標示不一致之處,並提示哪些分析需要重新審視的工作流程。例如,基金報告經重列後,V7 Go 可標示仍沿用舊數字的工作。

Rizzoli 表示:「我們的目標是協助企業重整工具和流程,迎接 AI 時代,以工作流程解決關鍵任務,並建立勝過人類的記憶能力。」「真正能從 AI 獲得價值的金融機構,不會是擁有最多智能代理的機構。而會是擁有最佳情境的機構。」