
成果
89%
GPT-6 Astra 處理最困難查詢的準確率
成果
78%
GPT-5.6 Luna 降低每份文件的成本
成果
+11.6 個百分點
GPT-5.6 Luna 提升準確率
現今的模型可以透過推理解決複雜任務,卻不會自動理解這些任務背後的業務情境。哪一份基金報告才是最新版?同一實體在三個系統中分別如何命名?
這些情境散落在文件、資料室、試算表、電子郵件與內部工具中,彼此分散、尚未釐清,智慧體也無從掌握。對金融、保險與房地產團隊而言,工作流程中的檢索準確度不容妥協。
Rizzoli 和 Edwardsson 曾共同打造一款廣泛使用的電腦視覺無障礙應用程式,之後於 2018 年創立 V7(在新視窗中開啟),協助公司讓 AI 系統理解自身業務的運作方式。V7 Go 是用來建立關鍵任務工作流程的智慧體平台,能將深藏各處的情境整理成智慧體可查詢並據以行動的記憶。
V7 Go 使用 GPT‑5.6 Luna 從數百萬個檔案擷取資訊,並整理至情境圖譜。該圖譜會串聯實體、關係與引用證據,支援 MCP 搜尋,以及可涵蓋數百個步驟且能重複執行的工作流程。在工作流程方面,V7 Go 使用 GPT‑5.6 Terra 和 Sol,依照複雜的多步驟指示進行推理與使用工具,完成原本需要人類耗費數十小時的工作。V7 也開始將 GPT‑6 Astra 用於要求最高的情境圖譜查詢,包括跨數千份文件進行財務分析。
V7 表示,結合情境、模型與工具後,智慧體可在數分鐘內完成 50 至 100 個步驟的工作流程,準確率達 99.9%,並為每項決策保留可稽核的紀錄。
「要解決金融與保險領域的棘手企業應用情境,AI 必須像從網際網路學習一樣,深入掌握企業的運作方式。」
情境圖譜解決了一個明確的問題。智慧體每次收到請求都必須重新探索情境,因而需要搜尋數十次,耗費時間與 Token,還經常遺漏深藏在各種關聯中的關鍵資訊。
資料送達後,V7 Go 會連接 SharePoint、Google Drive 等儲存庫,掃描其中的實體、關係、事實、屬性與指標,再填入圖譜;其查詢成本與速度都比長情境方法改善一個數量級。
情境圖譜為智慧體提供可直接查詢、結構化且持續更新的紀錄。新檔案送達時,V7 Go 會識別公司、基金、人員或本體中的任何實體,再將每項事實連結至新紀錄或現有紀錄,並保留指向原始來源的引用證據。如果圖譜沒有足夠資訊,V7 Go 仍可透過 RAG 搜尋底層文件。
V7 也測試了情境的結構對結果有多大影響。HERB 是一項用於尋找並串聯分散於企業系統中資訊的基準測試。在這項測試中,V7 僅使用檢索的系統比官方基準高出 69%,並將無法回答的查詢所產生的幻覺減少 38%。V7 Go 運用這些與來源相連的情境,讓複雜工作流程以各公司自身的資訊為依據。
V7 Go 將這些經過整理的情境用於私募股權交易篩選、保險核保等工作流程。在下方示範中,工作流程會從一份名為「機密資訊備忘錄」(CIM) 的交易文件擷取資訊,整理關鍵財務數據、交易條款與管理團隊詳細資料,引用風險欄位,最後由 V7 Go 產生篩選摘要。
有了情境圖譜,模型便能運用公司的歷史資料,不必每次都重新學習。對長時間運作的智慧體,V7 Go 會將近期互動保留在模型的作用中情境內,並把較舊的內容存入圖譜,以便需要時擷取。
這套共享情境已開始加速 V7 客戶處理大量文件的工作:
資產管理公司篩選交易的速度可提升至原先的 21 倍,將原本需要一整天的流程縮短至僅 15 分鐘
某金融服務團隊將審查時間從超過 100 小時縮短至不到 10 小時,每項任務可節省 12,000 美元的專家成本
保險團隊讓智慧體取得過往所有理賠案件與現有保單的歷史知識後,相較於人工基準,理賠處理錯誤減少了 13.5%
「有了 GPT-5.6 Terra,我們已能移除許多中間工作流程階段;這些階段過去只是為了讓模型更容易處理任務而設。更強大的模型與更多情境,不僅為我們省下數天的交付工作,還經常讓工作流程第一次建置就能正確運作。」
複雜的多步驟工作流程仰賴模型可靠地遵循冗長指示、執行工具、解讀結果,並完成一連串步驟。上游的一個錯誤,就可能造成高昂代價,並破壞人們對 AI 系統的信任。V7 Go 引導模型完成長期任務,涵蓋確定性程式碼、將工作交接給較小型模型、檔案生成步驟與整合,並為每次執行保留可稽核的軌跡。
在 AI 生成的工作流程中,V7 Go 會將各步驟對應至快速、中等與智慧層級。GPT‑5.6 Luna 負責結構化擷取及其他大量作業;GPT‑5.6 Terra 或 Sol 則支援對話、Go Agent 路徑,以及需要更多推理或工具使用的步驟。
V7 以持續維護的基準套件測試新模型,評估範圍涵蓋引用準確度、數百種文件類型的擷取品質、答案正確性、指示遵循、延遲、成本,以及真實世界的企業工作流程。在 V7 最重視的行為表現上,OpenAI 勝過多數模型。此外,OpenAI 在數小時內便核准並完成 V7 的容量擴增需求;V7 使用的其他供應商則需數週。
「我們選擇 OpenAI 作為預設方案,因為它在 V7 Go 仰賴的多步驟工具工作流程中表現最佳。在我們的情境圖譜基準測試中,GPT-5.6 Sol 將工具呼叫錯誤率從 GPT-5.5 的 2.7% 降至 0.2%。」
在 V7 最新的任務執行框架中,包含多次外部呼叫的關鍵工作流程如今完成速度最多可提升 50%。V7 也測得 GPT‑5.6 Luna 帶來另一項效率提升:每份文件的成本比 GPT‑5.4 mini 低 78%。V7 也將 V7 Go 中以文件處理為主的工作負載,從 Chat Completions API 移至 Responses API。測試顯示,這項變更讓部分大量處理 PDF 的工作流程減少約 5% 的 Token 用量,並提升快取可靠性。
V7 也使用最困難的查詢測試了 GPT‑6 Astra。GPT‑5.6 Sol 在 V7 許多現有基準測試中的表現已趨近滿分,因此該公司運用數千份文件中更雜亂的真實資料,建立了一組更具挑戰性的圖譜查詢問題。這項測試的資料集涵蓋四個難度等級。V7 表示,在極高難度等級中,GPT‑5.6 Sol 得分為 78%,GPT‑6 Astra 的準確率則達 89%。兩個模型在簡單、中等與困難等級的得分都接近 100%。
V7 Go 已透過其 MCP 伺服器開放情境圖譜查詢與資料擷取,因此客戶可從 ChatGPT 和其他相容用戶端使用這些功能。客戶也能在 Codex 中透過 MCP 建立 V7 Go 工作流程。再加上更簡單的工作流程設計,建立中等長度工作流程所需的時間已從約一小時縮短至約 20 分鐘。
V7 的長期目標是讓這套共享記憶更加主動。團隊正致力打造能在情境圖譜中的事實變動時自動啟動、標記矛盾,並向人員指出哪些分析需要重新檢視的工作流程。例如,基金報告若經重編,V7 Go 就能標記仍以舊數據為依據的工作。
Rizzoli 表示:「我們的目標是協助企業重新整備,迎接 AI 時代;以工作流程解決關鍵任務,並打造超越人類的記憶能力。真正能從 AI 獲得價值的金融公司不會是擁有最多智慧體的公司,而會是擁有最佳情境的公司。」


