Overslaan naar hoofdinhoud
OpenAI

7 mei 2026

Start-up

Parloa bouwt serviceagents waarmee klanten willen praten

Parloa gebruikt OpenAI-modellen om spraakgestuurde klantenservicesystemen voor ondernemingen te simuleren, evalueren en beheren.

Parloa
Grootte van de onderneming: Start-up
Regio: Europa en het VK, Wereldwijd
Sector: Technologie
Producten: API
Bezig met laden...

In de beginjaren van Parloa bracht medeoprichter Stefan Ostwald een dag door in een callcenter van een verzekeraar, waar zijn team werkte aan de eerste spraakervaringen. Terwijl hij naast medewerkers zat, hoorde hij steeds weer dezelfde gesprekken: wachtwoorden opnieuw instellen, vragen over polissen en routinematige wijzigingen. Hij besefte dat een groot deel van dat werk kon worden geautomatiseerd.

Na die ervaring begon het in Berlijn gevestigde Parloa(opent in een nieuw venster) regelgebaseerde spraakagents te bouwen om grote aantallen klantinteracties te automatiseren.

Met de opkomst van ChatGPT ging het bedrijf verder met de ontwikkeling van wat nu zijn AI Agent Management Platform (AMP) is, gebaseerd op een nieuwe generatie modellen, waaronder GPT‑5.4.

Met AMP kunnen ondernemingen klantservice-interacties op grote schaal ontwerpen, implementeren en beheren. In plaats van starre intenties en flows uit te werken, definiëren teams gedrag in natuurlijke taal, koppelen ze interne systemen en voeren ze snel verbeteringen door met ingebouwde simulaties en evaluaties.

Parloa verzorgt deze interacties van begin tot eind, van eenvoudige routering tot complexe verzoeken met meerdere stappen. De focus ligt op consistente prestaties in productie, waar prestaties, latentie en uitzonderingssituaties allemaal van belang zijn. Om dat te bereiken, test Parloa modellen voortdurend aan de hand van echte klantscenario's voordat ze worden geïmplementeerd.

"De modellen doen er alleen toe als ze in productie werken. We werken nauw samen met OpenAI om de modellen snel en betrouwbaar genoeg te maken voor realtimegesprekken."
—Ciaran O’Reilly Ibañez, Engineering Manager bij Parloa

AMP ontwerpen voor zakelijke ontwikkelaars

Parloa's Agent Management Platform (AMP) is zo ontworpen dat zakelijke gebruikers en inhoudsdeskundigen zonder code te schrijven AI-agents kunnen bouwen.

"Met AMP kunnen inhoudsdeskundigen uit verschillende bedrijfsonderdelen zelf de agents bouwen en de API's veel efficiënter en eenvoudiger koppelen", aldus O’Reilly.

Op hoofdlijnen stelt AMP merken in staat de volledige levenscyclus van AI-agents te beheren. Daarvoor biedt het niet-technische teams een eenvoudigere manier om te bepalen hoe een agent zich moet gedragen voordat die live gaat. In plaats van code te schrijven of starre intentiestructuren uit te werken, leggen inhoudsdeskundigen de rol, instructies, tools en grenzen van de agent vast in natuurlijke taal. Die configuratie vormt de basis voor de prompt die het model krijgt en voor het gedrag van het systeem in productie.

Zodra de agent is geconfigureerd, wordt deze vóór de implementatie getest. Parloa simuleert klantgesprekken met modellen zoals GPT‑5.4, waarbij het ene model optreedt als beller en het andere de geconfigureerde agent aanstuurt. Teams kunnen deze interacties rechtstreeks bekijken, wijzigingen aan realistische scenario's toetsen en verbeteringen doorvoeren voordat ze live gaan.

Dezelfde modellen evalueren die gesprekken vervolgens met een combinatie van deterministische controles en LLM-as-a-judge-scores. Zo wordt duidelijk of de agent de instructies heeft gevolgd, tools correct heeft gebruikt en de taak volgens verwachting heeft voltooid.

Tijdens een livegesprek geeft de orchestratielaag van AMP een OpenAI-model een prompt met de agentconfiguratie en gesprekscontext om een antwoord te genereren, via RAG informatie op te halen of tools te activeren die met back-ends van klanten communiceren. Parloa werkt deze laag voortdurend bij met de nieuwste generatie modellen zodra die aantoonbaar beter presteren in praktijksituaties.

Na het gesprek vatten afzonderlijke, door OpenAI aangestuurde workflows de interactie samen, classificeren ze de intentie van de klant en beoordelen ze de prestaties aan de hand van vastgelegde regels.

Naarmate agents complexer werden, werd het moeilijker om één monolithische prompt te onderhouden. Kleine wijzigingen konden onbedoelde neveneffecten veroorzaken. Om dit probleem aan te pakken, introduceerde Parloa een modulaire aanpak. Taken zoals authenticatie, wijzigingen in boekingen of updates van accounts kunnen worden verdeeld over afzonderlijke subagents. Daardoor worden instructies beter opgevolgd en kunnen systemen eenvoudiger worden doorontwikkeld.

Tegelijkertijd gebruikt het platform deterministische controles op de punten waar betrouwbaarheid het belangrijkst is. Ondernemingen kunnen gestructureerde API-ketens en gebeurtenisgestuurde logica definiëren om kritieke stappen in de juiste volgorde te laten plaatsvinden. Zo combineren ze flexibele gesprekken met voorspelbare uitvoering.

Parloa gebruikt modellen zoals GPT‑4.1 en GPT‑5‑mini om realistische klantinteracties te simuleren voordat een agent live gaat. Daarna worden die interacties geëvalueerd met een combinatie van LLM-as-a-judge en deterministische regels. Zo kunnen teams uitzonderingssituaties testen, snel verbeteringen doorvoeren en de prestaties valideren voordat klanten met fouten worden geconfronteerd.

Evaluatie als uitgangspunt

Parloa werkt voornamelijk met grote ondernemingen, waar consistentie net zo belangrijk is als functionaliteit.

"Wanneer er een nieuw model uitkomt, testen we het met onze benchmarksuite", zegt Matthäus Deutsch, Senior Applied Scientist. "Voor ons is het heel belangrijk dat iets niet alleen in theoretische benchmarks werkt, maar ook in echte praktijksituaties."

In plaats van op abstracte benchmarks te vertrouwen, bootst Parloa echte productieagents na en laat het die simulatie- en evaluatietrajecten doorlopen. Deze tests meten onder realistische omstandigheden hoe betrouwbaar instructies worden opgevolgd, hoe consistent API's worden aangeroepen, wat de latentie is en hoe het systeem in het algemeen presteert.

Deze evaluaties bepalen welke modellen klaar zijn voor productie. Alleen modellen die in echte klantscenario's betrouwbaar presteren, worden geïmplementeerd.

"Migratie brengt voor zakelijke klanten reële kosten met zich mee", zegt Deutsch. "Zodra een systeem in productie werkt, houden ze het stabiel en stappen ze alleen over als de voordelen duidelijk zijn."

Daardoor gedragen systemen zich voorspelbaar in productie, zelfs op grote schaal. Bij miljoenen klantinteracties worden de meeste gesprekken probleemloos afgehandeld. Zelfs wanneer gesprekken naar menselijke medewerkers worden doorgeschakeld, komt dat zelden door een fout. Bij één implementatie verminderde een internationaal reisbedrijf het aantal verzoeken om een menselijke medewerker met 80%.

Deze aanpak, waarin evaluatie vooropstaat, is een belangrijk onderscheidend kenmerk geworden. Hierdoor kan Parloa snel handelen zonder de betrouwbaarheid in productie op te offeren.

Spraakoplossingen bouwen voor wereldwijd gebruik

Spraak brengt andere beperkingen met zich mee dan tekstgebaseerde chat. Elke interactie doorloopt een pijplijn met lage latentie: spraak-naar-tekst, redenering door het model en tekst-naar-spraak.

Door deze pijplijn is een lage latentie essentieel. Zelfs kleine vertragingen in de modellaag stapelen zich op tot merkbare stiltes voor de beller. Dit bepaalt mede hoe modellen worden geselecteerd en geoptimaliseerd.

Parloa werkt nauw samen met OpenAI om de prestaties voor realtimegebruik te optimaliseren, met bijzondere aandacht voor latentie, antwoordkwaliteit en het opvolgen van instructies. Het team evalueert nieuwe modelversies voortdurend en voert stresstests uit in productieachtige omgevingen voordat ze worden ingezet voor live klantinteracties.

Parloa evalueert elk onderdeel van de spraakstack afzonderlijk:

  • Spraak-naar-tekstsystemen worden getest op hun woordfoutpercentage, met name bij gevoelige invoer zoals polisnummers of account-ID's.
  • Tekst-naar-spraakmodellen worden met blinde luistertests geëvalueerd om te beoordelen hoe natuurlijk de stem voor echte gebruikers klinkt. Die resultaten worden vervolgens vergeleken met echte klantinteracties om consistente prestaties in productieomgevingen te waarborgen.
  • Spraak-naar-spraakmodellen worden momenteel beoordeeld op hun geschiktheid voor productie, met de nadruk op latentie, nauwkeurigheid en kosten.

Deze systemen zijn vanaf het begin ontworpen voor wereldwijde implementatie. De benchmarks omvatten meerdere talen en klanten zijn actief in regio's over de hele wereld. Deze grondige meertalige aanpak weerspiegelt zowel Parloa's Europese wortels als de verwachtingen van zakelijke klanten. Zij verlangen consistente prestaties in verschillende markten, niet slechts in één taal of regio.

Tegenwoordig verwerken Parloa's agents miljoenen gesprekken in sectoren zoals retail, reizen en verzekeringen. De toepassingen lopen uiteen van geautomatiseerde ondersteuning tot omzetgenererende flows zoals telewinkelen.

Veranderende technologie voor veranderende klantreizen

Parloa ziet klantenservice zich ontwikkelen tot een volledig multimodale ervaring.

Een gesprek kan telefonisch beginnen, via chat worden voortgezet en onderweg links of interactieve elementen bevatten. AMP behandelt deze stappen niet als afzonderlijke flows, maar is ontworpen om ze als één interactie af te handelen. Op termijn kunnen AI-agents net zo'n centrale rol in klantreizen krijgen als websites en mobiele apps.

Nu ondernemingen een steeds groter deel van hun klantinteracties automatiseren, richt Parloa zich erop AI-agents betrouwbaar en flexibel genoeg te maken en voldoende vertrouwen te geven om wereldwijd te kunnen worden ingezet.