Hopp til hovedinnhold
OpenAI

21. august 2025

Slik skalerer Blue J raskt i komplekse, regulerte bransjer

Blue J skalerte til tre land og over 3000 firmaer takket være tydelig fokus, dyp fagkompetanse og riktig modell fra OpenAI.

Blue J-logo i hvitt, midtstilt på en abstrakt bakgrunn.
Bedriftsstørrelse: Oppstartsbedrift
Region: Nord-Amerika
Bransje: Teknologi
Produkter: ChatGPT, API

2,7

Timer spart per bruker hver uke

1/700

Færre enn 1 av 700 svar bestrides

Laster inn …

Tradisjonell skatteforskning begynner med å gå gjennom hundrevis av kilder før man i det hele tatt kan begynne å tolke dem. Deretter bruker skatteeksperter timevis på å analysere lover, forskrifter, avgjørelser, rettspraksis og ekspertkommentarer for å forstå hvordan reglene virker sammen, og sammenfatte dette til et svar.

Avhengig av hvor komplekst spørsmålet er, kan prosessen ta timer, dager eller til og med uker – og likevel gi sprikende eller utdaterte resultater, der hver oversette nyanse kan få reelle kostnader.

Blue J ble grunnlagt i 2015 av professorer og praktikere innen skatterett som så behovet for bedre verktøy til skatteforskning. Med utgangspunkt i tidlige forsøk på å bruke KI til å forutsi utfallet av skatterettslige saker utviklet teamet etter hvert en rekke produkter for skatte- og regnskapsfirmaer i alle størrelser.

Da ChatGPT ble lansert, så Blue J en mulighet til å skape noe nytt: å kombinere avansert resonnering på tvers av omfattende regelverk med strukturert innhenting for å levere skattesvar på ekspertnivå på få sekunder, komplett med kildehenvisninger i teksten og kildelister fagfolk kan stole på.

Mindre enn to år etter lanseringen hadde Blue J rullet ut en søkemotor for skatteforskning med GPT‑4.1 i USA, Canada og Storbritannia. De lanserte sitt første produkt bare seks måneder etter at ChatGPT kom, og videreutviklet det deretter raskt ved å lære av tilbakemeldinger og bygge et robust rammeverk for evaluering.

I dag logger over 70 % av brukerne inn hver uke, og færre enn ett av 700 svar blir bestridt. Blue J delte erfaringene sine med å etablere seg på et komplekst fagområde og skalere raskt ved å gjøre tillit, nøyaktighet og hastighet ufravikelige krav.

«Vi kunne gå raskt frem fordi vi allerede kjente problemet og visste hvordan vi skulle løse det. OpenAI ga oss modellkvaliteten vi trengte for å gjøre denne ekspertisen skalerbar.»
– Brett Janssen, teknologidirektør i Blue J

Bruk fagkompetanse til å bygge løsningen ingen andre kan lage

Blue Js løsning for skatteforskning er bygget med et system for Retrieval-Augmented Generation (RAG), som kombinerer GPT‑4.1 med et egenutviklet bibliotek med millioner av kvalitetssikrede dokumenter, inkludert autoritative primærkilder og ekspertkommentarer fra kilder som Tax Notes.

Når en bruker stiller et skattespørsmål som «Hva er SALT-torpedoen som OBBBA har skapt, og hvordan kan den avverges?», henter Blue J umiddelbart frem kildematerialet, og GPT‑4.1 sammenfatter det til et tydelig svar med fullstendige kildehenvisninger. Det oppleves mer som veiledning fra en betrodd kollega enn som utdata fra en modell. Dette er et system bare et team med inngående kunnskap om både skatt og teknologi kunne ha bygget.

«Vi har testet mange modeller, og GPT‑4.1 er den eneste som konsekvent gjør det vi trenger», sier Janssen. «Den følger instruksjoner, tar hensyn til konteksten og håndterer spesialtilfeller bedre enn noe annet vi har sett.»

Bygg tillit i stor skala med tilbakemeldinger fra brukerne

På skatteområdet kan selv små feil utløse kontroller, forsinke innleveringer eller koste kundene betydelige beløp. Blue J-teamet visste av erfaring at selv sjeldne spesialtilfeller kunne svekke tilliten hvis de ikke ble oppdaget og rettet raskt. Derfor utformet de helt fra starten produktet slik at det kunne samle inn tilbakemeldinger og forbedres i stor skala, med støtte fra ekspertisen i teamet for skatteforskning.

For at systemet skulle bli bedre for hver gangs bruk, innførte Blue J valgfri datadeling for kunder som ønsket å bidra til produktforbedringer. Hvert svar fra Blue J har en «uenig»-knapp. Når et svar markeres, kategoriseres det systematisk etter problemtype, skattetema og sannsynlig grunnårsak.

Denne kretsen fanger opp enkeltfeil og avdekker mønstre. Hvis spørsmål om skattlegging av partnerskap gir svakere resultater, undersøker teamet saken. Hvis en prompt gir sprikende fullføringer, finjusterer de den. GPT‑4.1 driver dette prioriteringslaget ved å analysere tusenvis av tilbakemeldinger, gruppere relaterte problemer og hjelpe Blue Js produkt- og skatteforskningsteam med å rette innsatsen dit den får størst effekt.

Stolpediagram med tittelen «Blue J» på lys bakgrunn, som viser ytelsesmålinger med blå og grå stolper i flere kategorier.

Fordi GPT‑4.1 svarer konsekvent, får selv små forbedringer stadig større effekt. Resultatet er et system som lærer av hver interaksjon. Det gir raskere videreutvikling, bedre svar og et produkt som utvikler seg i takt med brukernes behov. Denne selvforsterkende prosessen hjalp Blue J med å redusere andelen bestridte svar til færre enn ett av 700.

Den iterative produktutviklingen hjelper også Blue J med å ligge i forkant av endringer. Da en omfattende amerikansk skattelov ble vedtatt i 2025, hadde teamet allerede brukt seks uker på å kartlegge konsekvensene for kodebasen. Få timer etter at loven var signert, fikk brukerne oppdaterte svar i produksjon.

På et felt der reglene stadig endres og presisjon er avgjørende, er det denne lukkede tilbakekoblingssløyfen som gjør at Blue J kan være rask, pålitelig og i forkant av markedet.

Utform evalueringer som hever standarden, ikke bare måler den

Modellkvalitet er ikke bare en funksjon – det er et absolutt krav. Blue J evaluerer hver nye modellversjon med en referansetest som omfatter over 350 prompter innen amerikansk, kanadisk og britisk skatterett. Hver modell testes for hvor godt den følger instruksjoner, samsvarer med kildene og gir tydelige svar. Slik sikres det at forbedringer i prompter eller innhentingslogikk underbygges av forutsigbar atferd i praksis.

«Selv om vi har testet dem alle, har vi aldri lansert en modell som ikke er fra OpenAI», sier Janssen. «OpenAI-modeller har konsekvent gjort det bedre på våre interne referansetester, særlig når det gjelder å følge instruksjoner og levere svar som oppfyller kravene våre til praktisk bruk.»

Gjør fagkompetansen til konkurransefortrinnet ditt

Kundene bruker Blue J som sitt foretrukne verktøy for skatteforskning hele året, ikke bare i skattesesongen. Over 70 % av brukerne logger inn hver uke og sparer 2,7 timer per bruker i uken på skatteforskning og kundekommunikasjon – tid de i stedet bruker på planlegging og rådgivning med høyere marginer.

Blue J oppnådde dette engasjementet ved å konsentrere seg om det de kjenner bedre enn noen andre: skatteekspertenes reelle behov. GPT‑4.1 forsterker ekspertisen deres med strukturerte utdata, konsekvent etterlevelse av instruksjoner og pålitelige resultater. For gründere er lærdommen klar: Gjør spesialkompetansen til det viktigste konkurransefortrinnet, og bruk de rette modellene til å skalere.