複雑な規制分野で急成長する Blue J のアプローチ
Blue J は、明確な焦点、深い専門知識、適切な OpenAI モデルにより、3 か国、3,000 社超へ事業を拡大しました。

2.7
ユーザー 1 人当たりの週間削減時間
1/700
異議が寄せられた回答は 700 件に 1 件未満
従来の税務調査では、内容の解釈に入る前に、まず何百もの情報源を精査します。その後、税務の専門家は、法令、規則、裁定、判例、専門家の解説を何時間もかけて読み解き、各規定の関係を整理して回答にまとめます。
質問の複雑さによっては、この作業に数時間、数日、場合によっては数週間を要します。それでも結果にばらつきが生じたり、情報が古かったりすることがあり、わずかな見落としも実際の損失につながります。
Blue J は、税務調査により優れたツールが必要だと考えた税法学の教授と実務家によって、2015 年に設立されました。税法関連訴訟の結果予測に AI を活用する初期の研究を基に、チームはあらゆる規模の税務・会計事務所を支援する多様な製品を開発しました。
ChatGPT の登場を受け、Blue J は新たな製品の可能性を見いだしました。複雑な規制を読み解く高度な推論と構造化検索を組み合わせ、専門家が信頼できる文中引用や情報源一覧を備えた専門家水準の税務回答を、数秒で提供する製品です。
Blue J はリリースから 2 年以内に、GPT‑4.1 を搭載した税務調査エンジンを米国、カナダ、英国で展開しました。ChatGPT の登場からわずか 6 か月後に最初の製品をリリースし、フィードバックから学びながら迅速に改善を重ね、堅牢な評価フレームワークを構築しました。
現在はユーザーの 70% 以上が毎週ログインし、回答に対する異議の割合は 700 件に 1 件未満です。Blue J は、信頼性、正確性、スピードに妥協せず、複雑な分野へ参入して急成長するために得た教訓を紹介しました。
「課題と解決方法をすでに理解していたため、迅速に進めることができました。OpenAI は、その専門知識を大規模に活用するために必要なモデル品質を提供してくれました」
Blue J の税務調査ソリューションは、GPT‑4.1 と、権威ある一次資料や Tax Notes などの専門家による解説を含む、精選された数百万件の独自文書ライブラリを組み合わせた検索拡張生成(RAG)システムで構築されています。
ユーザーが「OBBBA によって生じた SALT トルピードとは何で、どう軽減できますか?」といった税務上の質問をすると、Blue J は関連資料を即座に検索し、GPT‑4.1 が内容を統合して、出典を完全に明記した明快な回答を生成します。モデルの出力というより、信頼できる同僚からの助言のような回答です。税務とテクノロジーの両方に精通したチームだからこそ構築できたシステムです。
「多くのモデルをテストしましたが、必要な処理を常に実現できるのは GPT‑4.1 です」とヤンセン氏は述べます。「指示に従い、文脈を尊重し、これまで試したどのモデルよりもエッジケースを適切に処理します」
税務では、わずかなミスでも監査を招き、申告を遅らせ、顧客に実害を与える可能性があります。Blue J のチームは、まれなエッジケースでも、迅速に発見して修正しなければ信頼を損なうことを経験から理解していました。そこで当初から、税務調査チームの専門知識を生かし、フィードバックを収集して大規模な改善につなげられる製品を設計しました。
利用のたびにシステムを改善できるよう、Blue J は製品改善への協力を希望する顧客向けに、任意のデータ共有機能を導入しました。Blue J のすべての回答には「同意しない」ボタンがあり、指摘された回答は問題の種類、税務分野、推定される根本原因別に体系的に分類されます。
この循環によって単発のエラーを捉え、傾向を明らかにできます。パートナーシップ税制に関するクエリの性能が低ければ、チームが調査します。プロンプトから一貫性のない生成結果が出れば、プロンプトを調整します。このトリアージ層には GPT‑4.1 が活用され、数千件のフィードバックを分析し、関連する問題をグループ化します。これにより、Blue J の製品チームと税務調査チームは、最大の効果を生む領域に注力できます。
GPT‑4.1 は一貫した応答を返すため、小さな改善でも積み重なれば大きな効果を生みます。その結果、やり取りのたびに学習し、改善サイクルの高速化、回答品質の向上、ユーザーニーズと歩調を合わせた製品の進化を実現するシステムが生まれました。この好循環により、Blue J は回答への異議の割合を 700 件に 1 件未満まで減らしました。
反復的な製品開発は、Blue J が変化を先取りするうえでも役立っています。2025 年に米国で大規模な税制法案が可決された際、チームはすでに 6 週間をかけ、コードベース全体への影響を整理していました。法案への署名から数時間以内に、本番環境の回答は更新され、ユーザーに提供されました。
規則が変化し、精度が何より重要な分野で、このクローズドループシステムが Blue J のスピードと信頼を支え、市場の先頭を走り続ける原動力となっています。
モデルの品質は単なる機能ではなく、採用可否を決める条件です。Blue J は、米国、カナダ、英国の税法を網羅する 350 件超のプロンプトからなるベンチマークスイートで、新しくリリースされたモデルを毎回評価しています。各モデルについて、指示への準拠、情報源との整合性、回答の明瞭さを検証し、プロンプトや検索ロジックの改善が、予測可能な実環境での動作によって裏付けられることを確認します。
「すべてテストしてきましたが、OpenAI 以外のモデルを製品に採用したことはありません」とヤンセン氏は述べます。「OpenAI のモデルは、社内ベンチマークで一貫して他を上回っています。特に、指示への準拠と、実環境で求める基準を満たす回答の生成に優れています」
顧客は確定申告期だけでなく、年間を通じて Blue J を標準の税務調査ツールとして利用しています。ユーザーの 70% 以上が毎週ログインし、調査や顧客とのコミュニケーションにかかる時間を 1 人当たり週 2.7 時間削減しています。創出した時間は、より収益性の高い企画・助言業務に充てられています。
Blue J がこれほど高い利用率を実現できたのは、自社が最も深く理解する、税務専門家の現実的なニーズに注力したからです。GPT‑4.1 は、構造化出力、一貫した指示への準拠、信頼性の高い結果によって、Blue J の専門知識をさらに強化します。創業者への示唆は明快です。独自の専門知識を中核的な強みとして生かし、適切なモデルによって事業を拡大することです。


