
2.7
每位用户每周节省的小时数
1/700
每 700 条答案中遭到异议的不到 1 条
传统税务研究甚至还未开始解读资料,就要先从数百个来源中筛选信息。随后,税务专业人士要花费数小时梳理成文法、法规、裁定、判例法和专家评论,弄清各项规则如何相互作用,再提炼出答案。
根据问题的复杂程度,这一过程可能耗时数小时、数天甚至数周,但结果仍可能不一致或已过时,任何遗漏的细微之处都会带来实际代价。
Blue J 由一群意识到税务研究需要更好工具的税法教授和实务专家于 2015 年创立。团队早期曾探索如何利用 AI 预测税法案件的结果,并在此基础上继续开发了多种产品,为各种规模的税务和会计师事务所提供支持。
ChatGPT 发布后,Blue J 看到了创造新产品的机会:将针对繁复法规的高级推理与结构化检索相结合,在数秒内提供专家级税务答案,并附上文内引文和专业人士可以信赖的来源清单。
发布后的两年内,Blue J 在美国、加拿大和英国推出了采用 GPT‑4.1 的税务研究引擎。ChatGPT 问世仅六个月后,他们就推出了首款产品,随后根据反馈快速迭代,并建立起稳健的评估框架。
如今,超过 70% 的用户每周都会登录,平均每 700 条回复中遭到异议的不到 1 条。Blue J 分享了他们进军复杂领域并快速规模化的经验:信任、准确性和速度不容妥协。
“我们之所以能快速行动,是因为我们早已了解问题所在,也知道该如何解决。OpenAI 提供了我们所需的模型质量,让这份专业能力得以规模化。”
Blue J 的税务研究解决方案采用检索增强生成(RAG)系统,将 GPT‑4.1 与包含数百万份精选文档的专有资料库相结合,其中既有权威的一手资料,也有来自 Tax Notes 等来源的专家评论。
当用户提出类似这样的税务问题时:“OBBBA 造成的 SALT 鱼雷机制是什么?如何减轻其影响?”Blue J 会立即检索源材料,再由 GPT‑4.1 将其整合成清晰、引文完整的答案。读起来更像是可信赖的同事给出的建议,而非模型输出。只有同时精通税务和技术的团队,才能构建这样的系统。
“我们测试过许多模型,而 GPT‑4.1 是唯一能始终满足我们需求的模型,”Janssen 表示。“它能遵循指令、尊重上下文,而且处理边缘案例的能力优于我们见过的任何其他模型。”
在税务领域,即使是小错误也可能触发审计、延误申报,或给客户造成实际经济损失。Blue J 团队凭经验深知,即便是罕见的边缘案例,如果不能迅速发现并修复,也会削弱信任。因此,他们从第一天起就将产品设计为能够大规模收集反馈并持续改进,同时由税务研究团队提供专业指导。
为了让系统在每次使用后都变得更好,Blue J 为希望帮助改进产品的客户提供了可选的数据共享功能。Blue J 的每条答案都设有“不同意”按钮;答案被标记后,系统会按问题类型、税务主题和可能的根本原因进行分类。
这一反馈闭环既能捕捉偶发错误,也能揭示规律。如果合伙企业税务查询表现不佳,团队就会展开调查。如果某个提示词产生的结果不一致,他们就会对其进行调整。GPT‑4.1 为这一分流层提供支持:分析数千条反馈、聚类相关问题,并帮助 Blue J 的产品和税务研究团队将精力集中在最能产生影响的方面。
由于 GPT‑4.1 的回复始终保持一致,即便微小的改进也会不断累积。由此形成的系统能从每次交互中学习,从而加快迭代、提高答案质量,并让产品与用户需求同步演进。这一增长飞轮帮助 Blue J 将异议率降至平均每 700 条答案不到 1 条。
迭代式产品开发也帮助 Blue J 始终走在变化前面。2025 年美国通过一项影响广泛的税收法案时,团队已花费六周时间梳理其对整个代码库的影响。法案签署后的数小时内,用户便在生产环境中看到了更新后的答案。
在规则不断变化、精准至关重要的领域,正是这个闭环系统让 Blue J 保持敏捷、赢得信任并领先市场。
模型质量不只是一项功能,更是决定产品能否上线的门槛。Blue J 使用一套包含 350 多个提示词的基准测试,对每个新发布的模型进行评估,涵盖美国、加拿大和英国税法。每个模型都要接受指令遵循、来源一致性和答案清晰度测试,确保对提示词或检索逻辑的改进能够转化为可预测的真实应用表现。
“尽管测试了所有模型,我们从未上线过非 OpenAI 模型,”Janssen 表示。“OpenAI 模型在我们的内部基准测试中始终表现更优,尤其是在遵循指令以及提供达到我们实际应用标准的答案方面。”
客户全年都将 Blue J 作为默认税务研究工具,而非只在报税季使用。超过 70% 的用户每周都会登录,每位用户每周可在研究及客户沟通上节省 2.7 小时,并将这些时间重新投入利润率更高的规划和咨询工作。
Blue J 之所以获得如此高的用户参与度,是因为他们专注于自己最了解的独特领域:税务专业人士的实际需求。GPT‑4.1 凭借结构化输出、稳定的指令遵循能力和可靠的结果,进一步放大了他们的专业优势。这给创始人的启示很明确:将自身的特定专长作为核心优势,并借助合适的模型实现规模化。


