跳到主要內容
OpenAI

2025年8月21日

Blue J 在複雜受規管領域快速擴展的方法

Blue J 憑藉專注策略、深厚領域知識和合適的 OpenAI 模型,業務擴展至三個國家及逾 3,000 間公司。

抽象背景中央的白色 Blue J 標誌。
公司規模: 初創公司
地區: 北美洲
行業: 科技
產品: ChatGPT, API

2.7

每名用戶每週節省的時數

1/700

每 700 個答案中少於 1 個受到質疑

正在載入...

傳統稅務研究需要先從數以百計的資料來源中篩選內容,然後才能開始解讀。稅務專業人員繼而花上數小時,分析法例、規例、裁決、案例法和專家評論,梳理各項規則如何互相影響,最後歸納出答案。

視乎問題的複雜程度,這個過程可能需時數小時、數天甚至數星期,但結果仍可能不一致或已過時;任何遺漏的細節都可能帶來實際損失。

Blue J 由一群認為稅務研究需要更佳工具的稅法教授和從業人員於 2015 年創立。團隊早期曾探索利用 AI 預測稅法案件的結果,其後再開發多種產品,為各種規模的稅務及會計公司提供支援。

ChatGPT 推出後,Blue J 看到了創新的機會:結合對繁複規例的進階推理與結構化檢索,在數秒內提供專業級稅務答案,並附上行內引用和專業人員可信賴的來源清單。

推出後兩年內,Blue J 已在美國、加拿大和英國推出採用 GPT‑4.1 的稅務研究引擎。他們在 ChatGPT 面世僅六個月後便推出首項產品,隨即根據意見迅速反覆改良,並建立穩健的評估框架。

目前,超過 70% 的用戶每週登入,而每 700 個回應中,表示不同意的不足 1 個。Blue J 分享了進軍複雜領域並快速擴展的心得:信任、準確度和速度都不容妥協。

「我們能迅速行動,是因為早已了解問題及其解決方法。OpenAI 提供了我們所需的模型質素,讓這些專業知識得以大規模應用。」
—Brett Janssen,Blue J 技術總監

善用領域專業知識,打造無可取代的解決方案

Blue J 的稅務研究解決方案採用檢索增強生成(RAG)系統,結合 GPT‑4.1 與專有資料庫。資料庫收錄數百萬份經篩選的文件,包括權威的一手資料,以及 Tax Notes 等來源的專家評論。

當用戶提出「OBBBA 造成的 SALT 稅務陷阱是甚麼?可如何緩解?」之類的稅務問題時,Blue J 會立即檢索來源資料,再由 GPT‑4.1 綜合整理成清晰且附有完整引用的答案,感覺更像可信賴的同事提供指引,而非模型輸出。這套系統只有精通稅務和科技的團隊才能建成。

Janssen 表示:「我們測試過很多模型,而 GPT‑4.1 始終能做到我們所需的事情。它能遵循指示、妥善理解語境,處理邊緣情況的能力亦勝過我們見過的任何其他模型。」

透過用戶意見擴大信任

在稅務領域,即使是小錯誤,也可能觸發審計、延誤報稅,或令客戶蒙受實際金錢損失。Blue J 團隊憑經驗深知,即使罕見的邊緣情況,若未能迅速發現和修正,亦可能削弱信任。因此,他們從第一天起便在稅務研究團隊的專業知識指導下,將產品設計成可大規模收集意見並持續改進。

為了讓系統每次使用後都能改善,Blue J 為有意協助改良產品的客戶提供自願數據分享選項。Blue J 的每個答案都設有「不同意」按鈕;回應一旦被標記,系統便會按問題類型、稅務主題和可能的根本原因有系統地分類。

這個循環既能找出偶發錯誤,也能揭示規律。如果合夥企業稅務查詢的表現未如理想,團隊便會調查。如果某個提示詞產生不一致的結果,他們便會加以調整。GPT‑4.1 驅動這個分流層,分析數以千計的意見、將相關問題分組,並協助 Blue J 的產品及稅務研究團隊集中處理最具影響力的範疇。

淺色背景上的棒形圖,標題為「BlueJ」,以藍色和灰色棒顯示多個類別的表現指標。

由於 GPT‑4.1 的回應穩定一致,即使細微改進亦可累積成顯著成效。最終,系統可從每次互動中學習,從而加快反覆改良、提升答案質素,並讓產品與用戶需要同步演進。這個良性循環令 Blue J 將不同意率降至每 700 個答案不足 1 個。

這種反覆改良的產品開發方式,亦有助 Blue J 時刻領先變革。2025 年美國通過一項影響深遠的稅務法案時,團隊早已花了六星期,梳理法案對整個程式碼庫的影響。法案簽署後數小時內,用戶便已在正式上線系統中看到更新後的答案。

在規則不斷變動、而準確度至關重要的領域,正是這個閉環系統讓 Blue J 保持迅速、可信,並領先市場。

設計能提高標準、而非只作測試的評估

模型質素不只是一項功能,更是能否推出產品的先決條件。Blue J 使用涵蓋美國、加拿大和英國稅法、包含逾 350 個提示詞的基準測試套件,評估每個新發佈的模型。每個模型都會接受指示遵循程度、來源一致性和答案清晰度測試,確保提示詞或檢索邏輯的改進,能透過可預測的實際表現得到鞏固。

Janssen 表示:「儘管我們測試過所有模型,但從未推出過非 OpenAI 模型。OpenAI 模型在我們的內部基準測試中一直表現更佳,尤其擅長遵循指示,以及提供符合我們實際應用標準的答案。」

善用領域專業知識,化為自身優勢

客戶全年都以 Blue J 作為預設稅務研究工具,而非只在報稅季節使用。超過 70% 的用戶每週登入,每名用戶每週可在研究和客戶溝通方面節省 2.7 小時,並將這些時間重新投放於利潤較高的規劃和顧問工作。

Blue J 專注於其最熟悉的獨有範疇,也就是稅務專業人員的實際需要,因而取得如此高的用戶參與度。GPT‑4.1 憑藉結構化輸出內容、穩定遵循指示的能力和可靠結果,進一步發揮他們的專業知識。對創辦人而言,啟示十分明確:以自身的專門知識為核心優勢,並運用合適的模型擴展規模。