跳至主要內容
OpenAI

2025年8月21日

Blue J 在複雜且受到嚴格監管的領域快速擴展之道

Blue J 憑藉專注策略、深厚領域知識及合適的 OpenAI 模型,將業務擴展至三個國家及逾 3,000 家事務所。

抽象背景中央的白色 Blue J 標誌。
公司規模: 新創公司
地區: 北美洲
產業: 科技
產品: ChatGPT, API

2.7

每位使用者每週節省的時數

1/700

答案遭提出異議的比例

載入中…

傳統稅務研究在開始解讀資料前,往往得先從數百項來源中篩選資訊。接著,稅務專業人士要花數小時解析成文法、法規、裁定、判例法及專家評論,釐清各項規則如何交互作用,再歸納出答案。

視問題的複雜程度而定,這個過程可能耗時數小時、數天甚至數週,結果仍可能前後不一或已經過時;任何遺漏的細節都可能造成實際損失。

Blue J 由一群看見稅務研究需要更好工具的稅法教授與實務工作者於 2015 年創立。團隊早期曾探索如何運用 AI 預測稅法案件結果,並以此為基礎,進一步開發多種產品,支援各種規模的稅務與會計事務所。

ChatGPT 推出後,Blue J 看見了創新的機會:結合針對繁複法規的進階推理與結構化檢索,在數秒內提供專家級稅務解答,並附上文內引註及專業人士可信賴的來源清單。

推出後不到兩年,Blue J 便在美國、加拿大及英國推出採用 GPT‑4.1 的稅務研究引擎。他們在 ChatGPT 問世僅六個月後就推出首項產品,之後根據回饋快速反覆改進,並建立健全的評估架構。

如今,超過 70% 的使用者每週都會登入,且每 700 則回覆中,不到 1 則會遭提出異議。Blue J 分享了進軍複雜領域並快速擴展的心得:信任、準確度與速度都不容妥協。

「我們能快速推進,是因為早已瞭解問題,也知道如何解決。OpenAI 提供了我們所需的模型品質,讓這份專業得以規模化。」
—Brett Janssen,Blue J 技術長

善用領域專業,打造別人做不到的解決方案

Blue J 的稅務研究解決方案採用檢索增強生成 (RAG) 系統,將 GPT‑4.1 與專有資料庫結合;資料庫收錄數百萬份經過篩選的文件,包括權威的一手資料和 Tax Notes 等來源的專家評論。

當使用者提出「OBBBA 所造成的 SALT 魚雷是什麼?又該如何減輕其影響?」這類稅務問題時,Blue J 會立即檢索來源資料,再由 GPT‑4.1 統整成清楚且引註完整的答案;讀起來更像可信賴同事提供的指引,而非模型輸出。這套系統只有同時精通稅務與科技的團隊才能打造。

Janssen 表示:「我們測試過許多模型,而 GPT‑4.1 始終都能完成我們需要的工作。GPT‑4.1 會遵循指示、理解前後脈絡,處理邊緣案例的能力也勝過我們見過的任何其他模型。」

運用使用者回饋,在擴展規模的同時建立信任

在稅務領域,即使是小錯誤,也可能引發稽核、延誤申報,或讓客戶蒙受實際金錢損失。Blue J 團隊憑經驗深知,即使是罕見的邊緣案例,若未能迅速發現並修正,也可能侵蝕信任。因此從第一天起,他們就在稅務研究團隊的專業指導下,將產品設計成能大規模收集回饋並持續改善。

為了讓系統每次使用後都能進步,Blue J 為有意協助改善產品的客戶提供選擇性資料分享功能。Blue J 的每則答案都設有「不同意」按鈕;答案一旦遭到標記,系統就會依問題類型、稅務主題及可能的根本原因,有系統地加以分類。

這套回饋循環既能找出單次錯誤,也能揭示問題模式。如果合夥企業稅務查詢的表現不佳,團隊就會展開調查;如果某個提示詞產生的回應不一致,團隊就會加以調整。GPT‑4.1 負責問題分流,分析數千筆回饋、將相關問題分群,並協助 Blue J 的產品與稅務研究團隊把心力投入最能產生影響的地方。

淺色背景上的長條圖,標題為「BlueJ」。圖中以藍色和灰色長條呈現多個類別的效能指標。

由於 GPT‑4.1 的回覆穩定一致,即使微小的改善也能持續累積。因此,這套系統能從每次互動中學習,加快產品迭代、提高答案品質,並隨著使用者需求同步演進。這個正向循環協助 Blue J 將異議率降至每 700 則答案不到 1 則。

反覆迭代的產品開發方式,也協助 Blue J 搶先因應變化。2025 年美國通過一項影響深遠的稅務法案時,團隊已花了六週盤點法案對整個程式碼庫的影響。法案簽署後數小時內,使用者就在正式環境中看到更新後的答案。

在規則不斷變動、精準度攸關一切的領域,正是這套完整的回饋循環系統讓 Blue J 能迅速應變、贏得信任,並領先市場。

設計能提高標準,而非只驗證標準的評估

模型品質不只是一項功能,更是決定能否上線的關卡。Blue J 會使用一套基準測試評估每次新發布的模型;這套測試包含逾 350 個提示詞,涵蓋美國、加拿大及英國稅法。每個模型都會接受指示遵循度、來源一致性及答案清晰度測試,確保提示詞或檢索邏輯的改善能反映在可預測的實際表現上。

Janssen 表示:「儘管所有模型都測試過,我們從未推出過採用非 OpenAI 模型的產品。OpenAI 模型在我們的內部基準測試中始終表現更出色,尤其擅長遵循指示,並能提供符合我們實際應用標準的答案。」

善用領域專業,打造競爭優勢

客戶全年都將 Blue J 作為預設的稅務研究工具,而非只在報稅季使用。超過 70% 的使用者每週都會登入,每位使用者每週可在研究及客戶溝通上節省 2.7 小時,再將這些時間投入利潤較高的規劃與顧問工作。

Blue J 能獲得如此高的使用率,是因為團隊專注於自己最熟悉、也最有獨到見解的主題:稅務專業人士的實務需求。GPT‑4.1 能提供結構化輸出、穩定遵循指示,並產出可靠結果,讓團隊的專業發揮更大效益。對創辦人而言,啟示很明確:善用自身的專業作為核心優勢,並選用合適的模型來擴展規模。