Basis vult fiscale werkmap 2x sneller in met GPT‑6 Astra
GPT‑6 Astra had 50% minder tijd nodig om complexe taken af te ronden dan GPT‑5.6 Sol en toonde een beter begrip van de intentie van gebruikers.
Werkmaptest
50%
Minder tijd nodig om een fiscale werkmap met 50 tabbladen in te vullen dan Sol in de test van Basis.
Interne evaluaties
20%
Verbetering bij benadering van de interne evaluatiescores van Basis.
Basis(opent in een nieuw venster) bouwt AI-agents die veel van het dagelijkse handmatige werk van accountants automatiseren. Zo kunnen zij hun tijd besteden aan strategisch werk in plaats van aan repetitieve taken. Het bedrijf doet onderzoek naar agents die langdurige taken betrouwbaar kunnen uitvoeren. Met GPT‑6 Astra ziet het een beter begrip van wat accountants willen bereiken.
"GPT-6 Astra begrijpt beter wat de gebruiker echt wil en wat het probleem is."
Basis vergeleek GPT‑6 Astra en GPT‑5.6 Sol aan de hand van een complexe fiscale werkmap met 50 tabbladen. De opdracht was om de werkmap nauwkeurig en betrouwbaar in te vullen. GPT‑6 Astra was daarbij aanzienlijk sneller.
"GPT-6 Astra kan die werkmap invullen in de helft van de tijd die GPT-5.6 Sol nodig heeft."
Basis merkte ook op dat GPT‑6 Astra aan het begin van een taak betere beslissingen neemt. Daardoor kunnen de agents van Basis het werk directer aanpakken en zijn ze minder tijd kwijt aan het herstellen van fouten. Volgens Troyanovsky gaat het model daardoor ook efficiënter om met tokens.
Basis laat GPT‑6 Astra ook de diepgang van zijn redenering aanpassen naarmate een taak vordert. Bij een moeilijke stap zet het meer rekenkracht in, bij een eenvoudigere stap minder. Het model kan deze aanpassingen doorvoeren zonder de inhoud van zijn cache te verliezen. Volgens Troyanovsky helpt dit de kosten en de responstijd te verlagen, waardoor langdurige taken voordeliger worden voor Basis en zijn klanten.
Met GPT‑6 Astra zag Basis zijn interne evaluatiescores met ongeveer 20% verbeteren. Dat kwam door een beter begrip van de intentie van gebruikers, waaronder wanneer het model vragen moet stellen, aannames moet benoemen en instructies moet opvolgen.
Basis beoordeelt de werkwijze en de uiteindelijke antwoorden van zijn agents. Daarbij kijkt het onder meer of ze sjablonen volgen, primaire bronnen raadplegen bij fiscale vragen en hun eigen werk controleren. GPT‑6 Astra kan deze verwachtingen uit een bredere context afleiden en heeft daarvoor minder expliciete instructies nodig.
Daardoor hoeft Basis minder regels voor afzonderlijke situaties te schrijven. Het geeft het team ook meer vertrouwen dat zijn agents situaties aankunnen die niet in interne tests aan bod zijn gekomen.


