
成果
89%
GPT-6 Astra 处理最难查询时的准确率
成果
78%
使用 GPT-5.6 Luna 降低每份文档的成本
成果
+11.6 个百分点
使用 GPT-5.6 Luna 提升准确率
如今的模型能够通过推理处理复杂任务,但不会自动理解这些任务背后的业务上下文。哪一份基金报告是最新版本?同一实体在三个系统中分别叫什么?
这些上下文散落在文档、数据室、电子表格、电子邮件和内部工具中,既未经过梳理,也不为智能体所见。对于金融、保险和房地产团队,工作流中的检索准确性不容妥协。
Rizzoli 和 Edwardsson 曾共同开发一款广泛使用的计算机视觉无障碍应用。2018 年,他们创立了 V7(在新窗口中打开),帮助公司教会 AI 系统理解其业务运作方式。V7 Go 是一个用于构建关键工作流的智能体平台,可将深埋各处的上下文整理成智能体能够查询并据此行动的记忆。
V7 Go 使用 GPT‑5.6 Luna 从数百万份文件中提取信息,并将其整理到上下文图谱中。该图谱关联实体、关系和引用证据,为 MCP 搜索及可跨越数百个步骤的可重复工作流提供支持。对于工作流,V7 Go 使用 GPT‑5.6 Terra 和 Sol 进行推理和工具调用,以处理人类需要数十小时才能完成的复杂多步骤指令。V7 也开始使用 GPT‑6 Astra 处理要求最高的上下文图谱查询,包括跨数千份文档进行金融分析。
V7 表示,通过上下文、模型和工具协同工作,智能体可在数分钟内完成包含 50 至 100 个步骤的工作流,准确率达到 99.9%,同时为每项决策保留可审计记录。
“要解决金融和保险行业棘手的企业应用场景,AI 不仅要像学习互联网知识那样深入,也要同样深入地了解您的业务如何运作。”
上下文图谱解决了一个具体问题。智能体每次收到请求时都必须重新发现上下文,因而需要进行数十次搜索,耗费时间和 Token,还经常遗漏隐藏在各种关系中的关键信息。
数据到达后,V7 Go 会连接 SharePoint 和 Google Drive 等存储库,扫描其中的实体、关系、事实、属性和指标,再将其填充到图谱中。与长上下文方法相比,该图谱的遍历成本和速度均有数量级优势。
上下文图谱为智能体提供结构化且实时更新的记录,供其直接查询。新文件到达时,V7 Go 会识别公司、基金、人员或本体中的任何实体,再将每项事实关联到新记录或现有记录,并保留指向原始来源的引用证据。如果图谱中的信息不足,V7 Go 仍可通过 RAG 搜索底层文档。
V7 还测试了上下文结构的重要程度。HERB 是一项用于评估在企业系统间查找并关联分散信息的基准测试。在该测试中,V7 的纯检索系统比官方基线高出 69%,并将无法回答的查询所产生的幻觉减少了 38%。V7 Go 利用这种与来源关联的上下文,让复杂工作流始终以各公司自身的信息为依据。
V7 Go 将这些经过整理的上下文用于私募股权交易筛选和保险核保等工作流。在下方演示中,工作流会从名为“保密信息备忘录”(CIM)的交易文档中提取信息,录入关键财务数据、交易条款和管理层详情,标注风险字段的引用来源,最后由 V7 Go 生成筛选报告。
借助上下文图谱,模型无需每次重新学习,就能利用公司的历史信息开展工作。对于长期运行的智能体,V7 Go 会将近期交互保留在模型的活跃上下文中,并把更早的内容存入图谱,以便需要时检索。
这种共享上下文已在加快 V7 客户大量处理文档的工作:
资产管理公司的交易筛选速度可提升至原来的 21 倍,将一整天的流程缩短至仅 15 分钟
一家金融服务团队将审核时间从 100 多小时缩短至不到 10 小时,每项任务节省 12,000 美元的专家成本
保险团队让智能体掌握所有既往理赔和现有保单的历史信息后,与人工基线相比,理赔处理错误减少了 13.5%
“借助 GPT-5.6 Terra,我们得以移除许多中间工作流阶段。这些阶段过去存在的唯一目的,就是简化模型的任务。更强大的模型和更多可用上下文为我们节省了数天的交付工作,而且工作流往往首次构建就能正确运行。”
复杂的多步骤工作流依赖模型可靠地遵循冗长指令、运行工具、解读结果,并完成一连串步骤。一个上游错误就可能造成高昂损失,并破坏人们对 AI 系统的信任。V7 Go 可引导模型完成长周期任务,涵盖确定性代码、向较小模型交接、文件生成步骤和集成,并为每次运行保留可审计记录。
在 AI 生成的工作流中,V7 Go 会将每个步骤映射到快速、中等和智能层级。GPT‑5.6 Luna 负责结构化提取及其他大批量任务,GPT‑5.6 Terra 或 Sol 则为聊天、Go Agent 路径以及需要更多推理或工具调用的步骤提供支持。
V7 使用一套持续维护的基准测试来评估新模型,覆盖引用准确性、数百种文档类型的提取质量、答案正确性、指令遵循能力、延迟、成本以及真实的企业工作流。在 V7 最看重的行为表现上,OpenAI 优于大多数模型。此外,OpenAI 在数小时内便批准并落实了 V7 的扩容需求,而 V7 使用的其他提供商通常需要数周。
“我们选择 OpenAI 作为默认方案,是因为它在 V7 Go 所依赖的多步骤工具工作流中表现最佳。在我们的上下文图谱基准测试中,GPT-5.6 Sol 将工具调用错误率从 GPT-5.5 的 2.7% 降至 0.2%。”
在 V7 最新的执行框架中,包含多次外部调用的关键工作流如今最多可提速 50%。V7 还发现 GPT‑5.6 Luna 带来了另一项效率提升:与 GPT‑5.4 mini 相比,每份文档的成本降低了 78%。V7 还将 V7 Go 中以文档处理为主的工作负载从 Chat Completions API 迁移到了 Responses API。测试显示,这一改变让部分大量处理 PDF 的工作流减少了约 5% 的 Token 用量,并提升了缓存可靠性。
V7 还使用最困难的查询测试了 GPT‑6 Astra。GPT‑5.6 Sol 在 V7 许多现有基准测试中的表现已趋于饱和,因此该公司使用数千份文档中更杂乱的真实数据,创建了一组难度更高的图谱查询问题。测试数据集分为四个难度级别。V7 报告称,在“极难”级别中,GPT‑5.6 Sol 得分为 78%,而 GPT‑6 Astra 的准确率达到 89%。在简单、中等和困难级别中,两款模型的得分均接近 100%。
V7 Go 已通过其 MCP 服务器开放上下文图谱的查询和数据摄取功能,因此客户可从 ChatGPT 及其他兼容客户端使用这些功能。客户还可在 Codex 中通过 MCP 创建 V7 Go 工作流。再加上更简单的工作流设计,创建一个中等长度工作流所需的时间已从约一小时缩短至约 20 分钟。
V7 的长期目标是让这种共享记忆更加主动。该团队正在开发这样的工作流:当上下文图谱中的事实发生变化时自动启动、标记不一致之处,并提示用户哪些分析需要重新检查。例如,基金报告重述后,V7 Go 可以标记仍在沿用旧数据的工作。
Rizzoli 表示:“我们的目标是帮助企业重构工具体系,以适应 AI 时代,让工作流解决关键任务,并让记忆能力超越人类。”“真正能从 AI 中获得价值的金融机构,不会是拥有最多智能体的机构。而会是拥有最佳上下文的机构。”


