Gå direkt till huvudinnehåll
OpenAI

21 augusti 2025

Så skalar Blue J snabbt i komplexa, reglerade branscher

Med fokus, djup domänkunskap och rätt Modell från OpenAI växte Blue J till tre länder och över 3 000 byråer.

Blue J:s vita logotyp centrerad mot en abstrakt bakgrund.
Företagets storlek: Startupföretag
Region: Nordamerika
Bransch: Teknik
Produkter: ChatGPT, API

2,7

Sparade timmar per användare och vecka

1/700

Färre än 1 av 700 svar ifrågasätts

Laddar …

Traditionell skatteutredning börjar med att man går igenom hundratals källor innan man ens kan börja tolka dem. Skatteexperter ägnar sedan timmar åt att tolka lagar, föreskrifter, myndighetsbeslut, rättspraxis och expertkommentarer för att förstå hur reglerna samverkar och sammanfatta dem till ett svar.

Beroende på frågans komplexitet kan processen ta timmar, dagar eller till och med veckor – och ändå ge inkonsekventa eller inaktuella resultat, där varje missad nyans kan få verkliga kostnader.

Blue J grundades 2015 av professorer och praktiker inom skatterätt som såg behovet av bättre verktyg för skatteutredning. Efter tidiga försök att använda AI för att förutsäga utgången i skatterättsliga mål utvecklade teamet flera produkter som stöd för skatte- och redovisningsbyråer av alla storlekar.

När ChatGPT lanserades såg Blue J en möjlighet att skapa något nytt: att kombinera avancerat Resonemang kring omfattande regelverk med strukturerad informationshämtning och på några sekunder ge skattesvar på expertnivå, med källhänvisningar i texten och källförteckningar som yrkesverksamma kan lita på.

Inom två år efter lanseringen hade Blue J lanserat en skatteutredningsmotor med GPT‑4.1 i USA, Kanada och Storbritannien. Den första produkten lanserades bara sex månader efter ChatGPT:s debut. Därefter vidareutvecklades den snabbt utifrån återkoppling, samtidigt som teamet byggde ett robust ramverk för utvärdering.

I dag loggar över 70 % av användarna in varje vecka, och färre än 1 av 700 svar får en invändning. Blue J berättade om sina lärdomar från att etablera sig på ett komplext område och skala snabbt genom att aldrig kompromissa med förtroende, precision eller snabbhet.

”Vi kunde arbeta snabbt eftersom vi redan förstod problemet och visste hur det skulle lösas. OpenAI gav oss den Modellkvalitet vi behövde för att kunna skala vår expertis.”
– Brett Janssen, teknikchef på Blue J

Använd domänexpertis för att bygga lösningen ingen annan kan skapa

Blue J:s lösning för skatteutredning bygger på ett system för hämtningsförstärkt generering (RAG), som kombinerar GPT‑4.1 med ett eget bibliotek med miljontals kvalitetssäkrade dokument, däribland auktoritativa primärkällor och expertkommentarer från källor som Tax Notes.

När en användare ställer en skattefråga som ”Vad är den SALT torpedo som skapats av OBBBA och hur kan den mildras?” hämtar Blue J omedelbart källmaterialet, och GPT‑4.1 sammanställer det till ett tydligt svar med fullständiga källhänvisningar – mer som vägledning från en betrodd kollega än utdata från en Modell. Det är ett system som bara ett team med djup kunskap om både skatt och teknik hade kunnat bygga.

”Vi har testat många modeller, och GPT‑4.1 är den som konsekvent gör det vi behöver”, säger Janssen. ”Den följer instruktioner, tar hänsyn till sammanhanget och hanterar specialfall bättre än något annat vi har sett.”

Stärk förtroendet genom användaråterkoppling

Inom skatt kan även små misstag utlösa revisioner, försena deklarationer eller kosta kunderna stora summor. Blue J:s team visste av erfarenhet att även sällsynta specialfall kunde undergräva förtroendet om de inte upptäcktes och åtgärdades snabbt. Därför utformade de redan från början produkten för att samla in återkoppling och förbättras i stor skala, med vägledning från företagets skatteutredningsteam.

För att systemet skulle bli bättre vid varje användning införde Blue J frivillig datadelning för kunder som ville bidra till produktutvecklingen. Varje svar från Blue J har en knapp med texten ”Håller inte med”. När ett svar flaggas kategoriseras det systematiskt efter problemtyp, skatteområde och trolig grundorsak.

Återkopplingscykeln fångar upp enstaka fel och synliggör mönster. Om frågor om beskattning av handelsbolag ger sämre resultat undersöker teamet varför. Om en Prompt ger inkonsekventa slutföranden finjusterar de den. GPT‑4.1 driver detta prioriteringslager genom att analysera tusentals återkopplingspunkter, gruppera relaterade problem och hjälpa Blue J:s produkt- och skatteutredningsteam att rikta insatserna dit de får störst effekt.

Stapeldiagram med rubriken ”BlueJ” mot en ljus bakgrund, med prestandamått i blå och grå staplar för flera kategorier.

Eftersom GPT‑4.1 svarar konsekvent byggs även små förbättringar på över tid. Resultatet är ett system som lär sig av varje interaktion, möjliggör snabbare iterationer och svar av högre kvalitet samt utvecklas i takt med användarnas behov. Denna självförstärkande process hjälpte Blue J att sänka andelen invändningar till färre än 1 av 700 svar.

Den iterativa produktutvecklingen hjälper också Blue J att ligga steget före förändringar. När ett omfattande amerikanskt skatteförslag antogs 2025 hade teamet redan ägnat sex veckor åt att kartlägga hur det påverkade kodbasen. Inom några timmar efter att lagen undertecknats fick användarna uppdaterade svar i produktionssystemet.

På ett område där reglerna förändras och precision är avgörande är det detta slutna återkopplingssystem som gör att Blue J förblir snabbt, pålitligt och steget före marknaden.

Utforma utvärderingar som höjer ribban, inte bara testar den

Modellkvalitet är inte bara en funktion, utan ett grundkrav. Blue J utvärderar varje ny Modellversion med en referenssvit på över 350 Prompter inom amerikansk, kanadensisk och brittisk skatterätt. Varje Modell testas utifrån hur väl den följer instruktioner och källor samt hur tydliga svaren är. Det säkerställer att förbättringar av Prompter eller hämtningslogik stöds av ett förutsägbart beteende i praktiken.

”Trots att vi har testat dem alla har vi aldrig lanserat en Modell som inte kommer från OpenAI”, säger Janssen. ”OpenAI:s modeller har konsekvent överträffat våra interna referensvärden, särskilt när det gäller att följa instruktioner och leverera svar som uppfyller våra krav för praktisk användning.”

Gör din domänexpertis till en konkurrensfördel

Kunderna använder Blue J som sitt huvudsakliga verktyg för skatteutredning året runt, inte bara under deklarationsperioden. Över 70 % av användarna loggar in varje vecka och sparar 2,7 timmar per användare och vecka på utredning och kundkommunikation – tid som de i stället lägger på planering och rådgivning med högre marginaler.

Blue J uppnådde detta engagemang genom att fokusera på det som teamet har unik kunskap om: skatteexperters verkliga behov. GPT‑4.1 förstärker deras expertis med Strukturerade utdata, konsekvent instruktionsföljning och tillförlitliga resultat. För grundare är lärdomen tydlig: gör er specifika expertis till er främsta konkurrensfördel och använd rätt modeller för att skala.