跳至主要内容
OpenAI

2026年8月10日

初创企业

Model ML 借助 GPT‑5.6 Sol 更高效地完成财务工作

Model ML 在创建可编辑 PowerPoint 和 Excel 文件的工作流中使用 GPT‑5.6 Sol,每份演示文稿比 Fable 5 少用 21% 的 Token。

公司规模: 初创企业
区域: 全球
行业: 金融, 科技
产品: API

成效

21%

每份 PowerPoint 演示文稿比 Fable 5 少用的 Token

成效

16.6

专业就绪率领先 Opus 5 的百分点

成效

36%

每个 Excel 工作簿比 Opus 5 少用的 Token

成效

5

制作定制单页报告所需分钟数,原本约需一小时

正在加载…

财务分析要经得起客户或高级决策者的审视,团队必须完成艰巨的最后一环:核对证据、创建文件并设置格式、检查每个数字,以及为每项论断关联来源。最终的 PowerPoint 演示文稿或 Excel 工作簿必须可编辑,并且经得起审查。

Model ML 联合创始人兼兄弟 Arnie 和 Chaz Englander 在两次成功退出后,开始通过私人家族办公室进行投资。作为开发者,他们也着手为自己构建软件,由此深刻体会到这项工作所需的投入。

Model ML 的智能体由这款软件发展而来,可帮助金融专业人士完成从接收初始请求、研究和分析,到交付最终演示文稿或工作簿的整个流程。核心智能体负责规划工作、选择合适的工具、核对证据并执行计算,同时将每个步骤交给最适合的模型处理,而这个模型通常是 GPT‑5.6 Sol。这些工具包括 Model ML 自有的文档工具,可创建来源可追溯的原生 PowerPoint 和 Excel 文件。

“早期模型可以完成分析师的工作,但用户必须清楚地拆解任务,尤其要明确希望输出呈现什么样子。借助 GPT-5.6 Sol,我们发现智能体生成的结果已非常接近最终成品。”
—Chaz Englander,Model ML 联合创始人兼首席执行官

打通财务工作的最后一环

Model ML 通过端到端自动化财务工作流来帮助财务团队。智能体可根据任务简报和源材料,完成从研究、建模到制作客户或交易团队所需最终材料的整个任务。金融专业人士会在分享成果前检查假设、来源和表达。

Model ML 称该产品“不受界面限制”。金融专业人士可以通过电子邮件或 Model ML 应用开始一项任务,再到其 Microsoft Office 插件中继续处理,无需重新说明。

这种连贯性也延续到了最终成果中。对于投资委员会演示文稿,Model ML 可将任务简报和源材料转化为可编辑的 PowerPoint。处理 Excel 任务时,智能体可以从客户模板或空白工作簿开始,收集所需数据,在多个工作表中构建公式和逻辑,然后采用金融行业专用格式,生成完整的电子表格或财务模型。

在 Model ML 用于评估金融服务 AI 的基准 Composite 中,GPT‑5.6 Sol 在 Excel 工作流中完成每个工作簿所用的 Token 比 Opus 5 少 36%。

“用户应专注于判断,例如完善假设或优化表达,而不是一味地重新构建分析。”
—Chaz Englander,Model ML 联合创始人兼首席执行官

通过完成这最后一环,智能体既能缩短单项交付成果的制作时间,也能帮助团队处理大量源材料。在一家全球资产管理公司,分析师原本需要约一小时制作的定制单页报告,现在只需约五分钟。在另一个工作流中,Model ML 智能体一次性处理了包含超过 10 万行数据和数百个文件的虚拟数据室。

GPT‑5.6 Sol 以更少 Token 交付更多可供审查的财务成果

Model ML 在一系列财务工作流中对 GPT‑5.6 Sol 和其他领先模型进行了评估。其 Composite 评估涵盖从接收初始财务简报、开展研究和计算,到生成可编辑演示文稿或电子表格的完整任务流程,随后还会检查数字、来源、公式和结构,以及演示文稿的视觉质量。

对于 PowerPoint,Model ML 的 Composite 评估采用真实工作流,涵盖数百份生成的演示文稿,并使用详细的评分标准。

GPT‑5.6 Sol 在 100% 的测试用例中完成了 PowerPoint 工作流,而 Opus 5 的完成率为 76%;此外,GPT‑5.6 Sol 有 43.3% 的用例通过了 Model ML 的专业就绪门槛,即衡量输出是否已可供实质性审查,而 Opus 5 为 26.7%。在演示文稿质量、简报遵循度、层次结构和一致性方面,它也领先于 Opus 5。

Native PowerPoint creation model benchmark, Model ML’s Composite eval
MetricGPT 5.6 SolΔ Sol–O5Opus 5Fable 5Opus 4.8GPT 5.6 TerraGPT-5.5
Deck quality — Overall score, readiness-gated59.9%+3.256.7%59.3%58.7%52.5%44.4%
Deliverability — Professional-readiness rate (gate)43.3%+16.626.7%32.0%17.3%17.3%16.0%
Deck produced — Items yielding a .pptx100.0%+24.076.0%82.0%80.0%80.0%74.0%
Brief adherence — Instruction following78.8%+0.977.9%78.5%78.4%74.1%79.6%
Visual quality — Aggregate visual judge — components below77.9%−1.479.3%78.9%75.1%74.4%68.5%
Layout — Layout & composition75.9%−2.978.8%78.7%76.2%76.1%67.8%
Hierarchy — Visual hierarchy87.2%+0.586.7%85.5%85.5%85.6%83.7%
Data viz — Chart legibility78.8%−4.383.1%79.7%73.3%74.6%68.4%
Consistency — Design coherence97.8%+4.593.3%95.8%97.5%75.0%90.0%
Efficiency — Tokens per deck (lower = better)1.10M+144K953K1.40M1.16M720K1.01M

Model ML 的原生 PowerPoint 创建基准对 GPT‑5.6 Sol、Opus 5 及其他领先模型进行了比较。

Native Excel creation model benchmark, Model ML’s Composite eval
MetricGPT 5.6 SolΔ Sol–O5Opus 5Fable 5Opus 4.8GPT 5.6 TerraGPT-5.5
Key outputs correct — Headline accuracy vs golden model83.3%+0.582.8%80.6%74.4%82.2%83.3%
Fully correct models — Items with every key output right50.0%−10.060.0%60.0%40.0%53.3%60.0%
Outputs located — Expected outputs found in workbook100.0%±0100.0%100.0%92.2%98.9%100.0%
Workbook contract — Structure / no-errors / no-placeholder gates100.0%±0100.0%100.0%100.0%100.0%100.0%
Efficiency — Tokens per workbook (lower = better)2.44M−1.40M3.83M2.59M2.91M1.64M1.16M
Wall clock — Minutes per workbook (lower = better)7.0 min−0.5 min7.5 min8.4 min11.5 min4.2 min3.9 min

Model ML 的原生 Excel 创建基准对 GPT‑5.6 Sol、Opus 5 及其他领先模型进行了比较。

综合上述 Composite 结果,Model ML 获得了在生产环境中扩大 GPT‑5.6 Sol 应用范围的依据,其中包括一些此前由 Opus 4.8 处理的工作流。在 PowerPoint 工作流中,GPT‑5.6 Sol 不仅实现了有竞争力的演示文稿质量,而且完成并达到可供审查标准的演示文稿比例高于 Opus 5 和 Fable 5,同时比 Fable 5 少用约 21% 的 Token。

Englander 表示:“能够用于实际工作,意味着用户可以直接开始真正的审查。”“数字可追溯,工作簿能重新计算,幻灯片也可编辑。”

创建经得起审查的投资演示文稿

PowerPoint 对 GPT‑5.6 Sol 是否已可用于实际工作提出了严苛考验。一份演示文稿即使外观精美,如果数字错误或无法追溯、图表被扁平化,或者分享前必须重做幻灯片,仍然无法通过审查。

Model ML 在其智能体执行框架中运行该模型,并搭配文档创建和编辑工具,让智能体能够创建含可编辑图表和表格的幻灯片。工作过程中,它会始终将原始简报保留在上下文中,并在返回文件前逐页进行视觉审查。

以下示例展示了 Model ML 的 PowerPoint 输出从 GPT‑5.5 到 GPT‑5.6 Sol 的改进,包括更清晰的层次结构和更一致的幻灯片设计。

如今,Model ML 的执行框架可向智能体提供按需加载的工具包,用于访问数据集成、文档编辑工具与技能以及代码执行环境。这样既能让智能体保持专注,也能为其提供处理用户文档所需的确切工具。

Model ML 通过与 OpenAI 开展现场协作,最终形成了这套架构。双方团队梳理了智能体规划演示文稿、选择工具和维持上下文的方式,再根据这些发现优化智能体指令,并确定各工具包的加载时机。

面向不断变化的财务工作方式进行构建

Model ML 的客户正转向基于浏览器的输出,使成果与背后的模型及源材料保持连接。

Model ML 平台可生成安全的交互式输出,既能持续更新,也能锁定在某个时间点。审查者可以打开投资摘要,点击查看某项数据背后的财务模型,并在同一页面上与智能体协作。

Englander 表示:“PowerPoint、Excel 和 Word 是为一个知识工作需由人工完成的时代设计的。AI 已经改变了这一前提。软件本身也即将改变。”

OpenAI 全方位赋能初创企业