메인 콘텐츠로 건너뛰기
OpenAI

2025년 8월 21일

복잡한 규제 분야에서 빠르게 확장한 Blue J의 전략

Blue J는 집중력과 깊이 있는 도메인 전문성, 적합한 OpenAI 모델을 바탕으로 3개국 3,000여 개 기업으로 확장했습니다.

추상적인 배경 중앙에 흰색 Blue J 로고가 있습니다.
회사 규모: 스타트업
지역: 북미
산업: 기술
제품: ChatGPT, API

2.7

사용자당 매주 절약되는 시간

1/700

이의가 제기된 답변 700개당 1개 미만

로딩 중...

기존의 세무 리서치는 수백 개의 자료를 일일이 검토한 뒤에야 해석을 시작할 수 있습니다. 그런 다음 세무 전문가는 법령, 규정, 유권해석, 판례, 전문가 논평을 몇 시간씩 분석해 규칙 간의 상호작용을 파악하고 하나의 답변으로 정리합니다.

질문의 복잡성에 따라 이 과정은 몇 시간, 며칠, 심지어 몇 주까지 걸릴 수 있습니다. 그럼에도 결과가 일관되지 않거나 최신 정보가 아닐 수 있으며, 사소한 맥락 하나를 놓쳐도 실질적인 비용이 발생합니다.

Blue J는 더 나은 세무 리서치 도구의 필요성을 느낀 세법 교수와 실무자들이 2015년에 설립했습니다. 세법 사건의 결과를 예측하는 데 AI를 활용한 초기 연구를 바탕으로, 팀은 모든 규모의 세무·회계 법인을 지원하는 다양한 제품을 개발했습니다.

ChatGPT가 출시되자 Blue J는 새로운 기회를 포착했습니다. 방대한 규정에 대한 고급 추론과 구조화된 검색을 결합해, 전문가가 신뢰할 수 있는 본문 내 인용과 출처 목록을 갖춘 전문가 수준의 세무 답변을 몇 초 만에 제공하는 것이었습니다.

Blue J는 출시 후 2년 만에 GPT‑4.1을 기반으로 한 세무 리서치 엔진을 미국, 캐나다, 영국에 선보였습니다. ChatGPT가 공개된 지 불과 6개월 만에 첫 제품을 출시한 뒤, 피드백을 바탕으로 빠르게 개선하며 탄탄한 평가 프레임워크를 구축했습니다.

현재 사용자의 70% 이상이 매주 로그인하며, 답변 700개당 이의가 제기되는 답변은 1개 미만입니다. Blue J는 신뢰성, 정확성, 속도를 타협할 수 없는 원칙으로 삼아 복잡한 분야에 진출하고 빠르게 확장하며 얻은 교훈을 공유했습니다.

“우리는 문제와 해결 방법을 이미 알고 있었기에 빠르게 움직일 수 있었습니다. OpenAI는 그 전문성을 확장하는 데 필요한 수준의 모델 품질을 제공했습니다.”
—Brett Janssen, Blue J CTO

도메인 전문성을 활용해 누구도 만들 수 없는 솔루션 구축하기

Blue J의 세무 리서치 솔루션은 검색 증강 생성(RAG) 시스템을 기반으로 합니다. GPT‑4.1에 권위 있는 1차 자료와 Tax Notes 같은 출처의 전문가 논평을 포함해 엄선한 수백만 건의 독점 문서 라이브러리를 결합했습니다.

사용자가 “OBBBA가 만든 SALT 어뢰란 무엇이며 어떻게 완화할 수 있나요?”와 같은 세금 질문을 하면 Blue J가 즉시 관련 자료를 검색하고, GPT‑4.1이 이를 종합해 출처가 빠짐없이 인용된 명확한 답변을 생성합니다. 모델의 출력이라기보다 신뢰하는 동료의 조언처럼 느껴지는 답변입니다. 세무와 기술을 모두 깊이 이해하는 팀만이 구축할 수 있는 시스템입니다.

Janssen은 “많은 모델을 테스트했지만, 우리가 필요로 하는 작업을 일관되게 수행하는 모델은 GPT‑4.1입니다”라고 말합니다. “지시를 따르고 맥락을 존중하며, 지금까지 본 어떤 모델보다 예외적인 사례를 잘 처리합니다.”

사용자 피드백을 통해 신뢰를 확장하기

세무 분야에서는 작은 실수 하나도 세무조사를 촉발하거나 신고를 지연시키고 고객에게 실질적인 금전 손실을 입힐 수 있습니다. Blue J 팀은 드문 예외 사례라도 신속하게 발견하고 수정하지 않으면 신뢰를 무너뜨릴 수 있다는 사실을 경험으로 알고 있었습니다. 그래서 첫날부터 세무 리서치 팀의 전문성을 바탕으로 피드백을 수집하고 대규모로 개선할 수 있도록 제품을 설계했습니다.

사용할 때마다 시스템이 개선되도록, Blue J는 제품 개선에 기여하려는 고객이 선택할 수 있는 데이터 공유 기능을 도입했습니다. Blue J의 모든 답변에는 ‘동의하지 않음’ 버튼이 있습니다. 이 버튼이 눌리면 해당 답변은 문제 유형, 세무 주제, 추정 근본 원인에 따라 체계적으로 분류됩니다.

이 피드백 루프는 일회성 오류를 포착하고 반복되는 패턴을 찾아냅니다. 파트너십 과세 관련 쿼리의 성능이 낮으면 팀이 원인을 조사합니다. 프롬프트가 일관되지 않은 완성 결과를 생성하면 이를 조정합니다. GPT‑4.1은 이러한 분류 계층을 구동합니다. 수천 건의 피드백을 분석하고 관련 문제를 군집화해 Blue J의 제품 및 세무 리서치 팀이 가장 큰 효과를 낼 수 있는 영역에 역량을 집중하도록 돕습니다.

밝은 배경에 ‘BlueJ’라는 제목이 표시된 막대 차트로, 여러 범주의 성능 지표를 파란색과 회색 막대로 보여줍니다.

GPT‑4.1이 일관되게 응답하기 때문에 작은 개선도 쌓이면 큰 효과를 냅니다. 그 결과 모든 상호작용에서 학습하고, 더 빠른 개선과 더 우수한 답변을 이끌며, 사용자 요구에 발맞춰 발전하는 시스템이 탄생했습니다. 이러한 선순환 덕분에 Blue J는 이의 제기율을 답변 700개당 1개 미만으로 낮췄습니다.

반복적인 제품 개발 방식은 Blue J가 변화에 앞서 나가는 데도 도움이 됩니다. 2025년 미국에서 대대적인 세법 개정안이 통과됐을 때, 팀은 이미 6주에 걸쳐 코드베이스 전반에 미칠 영향을 파악한 상태였습니다. 법안이 서명된 지 몇 시간 만에 사용자는 운영 환경에서 업데이트된 답변을 확인할 수 있었습니다.

규칙이 계속 바뀌고 정밀성이 무엇보다 중요한 분야에서, 이 폐쇄 루프 시스템은 Blue J가 빠른 속도와 신뢰를 유지하며 시장을 선도하는 원동력입니다.

기준을 단순히 시험하는 데 그치지 않고 높이는 평가 설계하기

모델 품질은 단순한 기능이 아니라 반드시 통과해야 하는 관문입니다. Blue J는 미국, 캐나다, 영국의 세법을 아우르는 350개 이상의 프롬프트로 구성된 벤치마크 모음을 사용해 모든 신규 모델 릴리스를 평가합니다. 각 모델은 지시 준수, 출처와의 일치성, 답변의 명확성을 기준으로 테스트됩니다. 이를 통해 프롬프트나 검색 로직의 개선이 예측 가능한 실제 환경의 동작으로 이어지는지 확인합니다.

Janssen은 “모든 모델을 테스트했지만 OpenAI가 아닌 모델을 출시한 적은 한 번도 없습니다”라고 말합니다. “OpenAI 모델은 내부 벤치마크에서 꾸준히 더 우수한 성능을 보였습니다. 특히 지시를 따르고 실제 사용 기준을 충족하는 답변을 제공하는 능력이 뛰어났습니다.”

도메인 전문성을 경쟁 우위로 활용하기

고객들은 세금 신고 기간뿐 아니라 연중 내내 Blue J를 기본 세무 리서치 도구로 사용합니다. 사용자의 70% 이상이 매주 로그인하며, 리서치와 고객 커뮤니케이션에서 사용자당 매주 2.7시간을 절약합니다. 이렇게 확보한 시간은 수익성이 더 높은 기획 및 자문 업무에 다시 투자됩니다.

Blue J는 자신들이 누구보다 잘 아는 세무 전문가의 실제 요구에 집중해 이처럼 높은 참여도를 달성했습니다. GPT‑4.1은 구조화된 출력값, 일관된 지시 준수, 신뢰할 수 있는 결과를 통해 Blue J의 전문성을 한층 강화합니다. 창업자가 얻을 교훈은 분명합니다. 자신만의 전문성을 핵심 경쟁 우위로 활용하고 적합한 모델로 확장해야 합니다.