Zo schaalt Blue J snel op in complexe, gereguleerde domeinen
Blue J groeide dankzij focus, diepgaande domeinkennis en het juiste OpenAI-model uit naar drie landen en ruim 3000 bedrijven.

2,7
Uren die elke gebruiker wekelijks bespaart
1/700
Minder dan 1 op de 700 antwoorden betwist
Traditioneel belastingonderzoek begint met het doorspitten van honderden bronnen, nog voordat de interpretatie ervan kan beginnen. Fiscalisten besteden vervolgens uren aan het analyseren van wetten, regelgeving, besluiten, jurisprudentie en deskundig commentaar om te doorgronden hoe de regels op elkaar inwerken en daaruit een antwoord te formuleren.
Afhankelijk van de complexiteit van de vraag kan dit proces uren, dagen of zelfs weken duren en toch inconsistente of verouderde resultaten opleveren, waarbij elke gemiste nuance reële kosten met zich meebrengt.
Blue J werd in 2015 opgericht door hoogleraren belastingrecht en fiscalisten die behoefte zagen aan betere hulpmiddelen voor belastingonderzoek. Voortbouwend op vroege experimenten met AI om de uitkomst van belastingzaken te voorspellen, ontwikkelde het team verschillende producten ter ondersteuning van belasting- en accountantskantoren van elke omvang.
Toen ChatGPT werd gelanceerd, zag Blue J een kans om iets nieuws te creëren: geavanceerde redenering over complexe regelgeving combineren met gestructureerde informatieontsluiting om binnen enkele seconden fiscale antwoorden van expertniveau te leveren, compleet met bronverwijzingen in de tekst en bronnenlijsten waarop professionals kunnen vertrouwen.
Binnen twee jaar na de lancering rolde Blue J in de VS, Canada en het VK een onderzoeksplatform voor belastingen met GPT‑4.1 uit. Het eerste product werd slechts zes maanden na het debuut van ChatGPT gelanceerd. Daarna volgden snelle verbeteringen op basis van feedback en bouwde het team een robuust evaluatiekader.
Tegenwoordig logt meer dan 70% van de gebruikers wekelijks in en wordt minder dan 1 op de 700 antwoorden betwist. Blue J deelde de lessen die het bedrijf leerde over doorbreken in een complex domein en snel opschalen door vertrouwen, nauwkeurigheid en snelheid als absolute voorwaarden te stellen.
"We konden snel handelen omdat we het probleem en de oplossing al kenden. OpenAI bood ons de modelkwaliteit die we nodig hadden om die expertise schaalbaar te maken."
De oplossing van Blue J voor belastingonderzoek is gebouwd met een Retrieval-Augmented Generation-systeem (RAG), dat GPT‑4.1 combineert met een eigen bibliotheek van miljoenen zorgvuldig geselecteerde documenten, waaronder gezaghebbende primaire bronnen en deskundig commentaar van onder meer Tax Notes.
Wanneer een gebruiker een belastingvraag stelt, zoals: "Wat is de door OBBBA gecreëerde SALT-torpedo en hoe kan die worden beperkt?" haalt Blue J onmiddellijk het bronmateriaal op en verwerkt GPT‑4.1 dit tot een helder antwoord met volledige bronvermelding. Het voelt eerder als advies van een vertrouwde collega dan als output van een model. Dit systeem kon alleen worden gebouwd door een team dat zowel belastingen als technologie door en door kent.
"We hebben veel modellen getest en GPT‑4.1 is het model dat consequent doet wat we nodig hebben", zegt Janssen. "Het volgt instructies, houdt rekening met de context en verwerkt uitzonderingssituaties beter dan alles wat we tot nu toe hebben gezien."
Bij belastingen kunnen zelfs kleine fouten leiden tot controles, vertraagde aangiften of concrete financiële schade voor klanten. Het team van Blue J wist uit ervaring dat zelfs zeldzame uitzonderingssituaties het vertrouwen konden ondermijnen als ze niet snel werden ontdekt en opgelost. Daarom ontwierp het team het product vanaf dag één om feedback te verzamelen en op grote schaal verbeteringen door te voeren, onder begeleiding van de experts van het belastingonderzoeksteam.
Om het systeem bij elk gebruik te verbeteren, introduceerde Blue J optionele gegevensdeling voor klanten die wilden bijdragen aan productverbetering. Elk antwoord van Blue J bevat een knop 'oneens'. Als daarop wordt geklikt, wordt het antwoord systematisch ingedeeld naar soort probleem, fiscaal onderwerp en waarschijnlijke hoofdoorzaak.
Deze feedbackcyclus spoort eenmalige fouten op en brengt patronen aan het licht. Als vragen over de belastingheffing van personenvennootschappen ondermaats presteren, onderzoekt het team waarom. Als een prompt inconsistente antwoorden oplevert, wordt die bijgesteld. GPT‑4.1 vormt de basis van deze triagelaag: het analyseert duizenden feedbackpunten, groepeert gerelateerde problemen en helpt de product- en belastingonderzoeksteams van Blue J hun inspanningen te richten op gebieden waar ze de meeste impact hebben.
Omdat GPT‑4.1 consistent reageert, stapelen zelfs kleine verbeteringen zich op. Het resultaat is een systeem dat van elke interactie leert, waardoor sneller kan worden geïtereerd, antwoorden van hogere kwaliteit ontstaan en het product gelijke tred houdt met de behoeften van gebruikers. Dankzij dit vliegwieleffect wist Blue J het percentage betwiste antwoorden terug te brengen tot minder dan 1 op de 700.
De iteratieve productontwikkeling helpt Blue J ook om veranderingen voor te blijven. Toen in 2025 een ingrijpende Amerikaanse belastingwet werd aangenomen, had het team al zes weken besteed aan het in kaart brengen van de gevolgen voor de codebase. Binnen enkele uren na de ondertekening van de wet zagen gebruikers bijgewerkte antwoorden in de productieomgeving.
In een vakgebied waarin regels voortdurend veranderen en precisie essentieel is, zorgt dit systeem met een gesloten feedbacklus ervoor dat Blue J snel en betrouwbaar blijft en de markt vooroploopt.
De kwaliteit van een model is niet zomaar een functie, maar een doorslaggevende voorwaarde. Blue J beoordeelt elke nieuwe modelversie met een benchmarkset van ruim 350 prompts voor het Amerikaanse, Canadese en Britse belastingrecht. Elk model wordt getest op het volgen van instructies, aansluiting op bronnen en helderheid van antwoorden. Zo worden verbeteringen aan prompts of de logica voor informatieontsluiting ondersteund door voorspelbaar gedrag in praktijksituaties.
"Hoewel we ze allemaal hebben getest, hebben we nog nooit een model van een andere aanbieder dan OpenAI uitgebracht", zegt Janssen. "OpenAI-modellen hebben bij onze interne benchmarks consequent beter gepresteerd, vooral wat betreft het volgen van instructies en het leveren van antwoorden die aan onze eisen voor praktisch gebruik voldoen."
Klanten vertrouwen het hele jaar door op Blue J als hun vaste hulpmiddel voor belastingonderzoek, niet alleen tijdens het aangifteseizoen. Meer dan 70% van de gebruikers logt wekelijks in en bespaart per gebruiker 2,7 uur per week op onderzoek en klantcommunicatie. Die tijd investeren ze opnieuw in rendabelere planning en advieswerkzaamheden.
Blue J bereikte die hoge betrokkenheid door zich te richten op wat het bedrijf als geen ander kent: de behoeften van fiscalisten in de praktijk. GPT‑4.1 versterkt hun expertise met gestructureerde output, het consequent volgen van instructies en betrouwbare resultaten. Voor oprichters is de conclusie duidelijk: maak van je specifieke expertise je belangrijkste voordeel en gebruik de juiste modellen om op te schalen.


