Parloa bygger serviceagenter, kunderne gerne vil tale med
Parloa bruger OpenAI-modeller til at simulere, evaluere og drive stemmestyrede kundeservicesystemer til virksomheder.

I Parloas tidlige år tilbragte medstifter Stefan Ostwald en dag i et forsikringsselskabs callcenter, hvor hans team havde udviklet de første stemmebaserede løsninger. Siddende ved siden af medarbejderne hørte han de samme samtaler udspille sig igen og igen: nulstilling af adgangskoder, spørgsmål om policer og rutinemæssige ændringer. Han indså, at en stor del af arbejdet kunne automatiseres.
Efter den oplevelse begyndte den Berlin-baserede virksomhed Parloa(åbner i et nyt vindue) at udvikle regelbaserede stemmeagenter til at automatisere store mængder kundeinteraktioner.
Med fremkomsten af ChatGPT udviklede virksomheden det, der i dag er dens AI Agent Management Platform (AMP), bygget på en ny generation af modeller, herunder GPT‑5.4.
AMP gør det muligt for virksomheder at designe, implementere og administrere kundeserviceinteraktioner i stor skala. I stedet for at kortlægge faste hensigter og forløb definerer teams adfærd i naturligt sprog, opretter forbindelse til interne systemer og gentager hurtigt processen ved hjælp af indbyggede simuleringer og evalueringer.
Parloa håndterer disse interaktioner fra start til slut – lige fra enkel viderestilling til komplekse anmodninger i flere trin. Fokus er på stabilitet i produktion, hvor ydeevne, latenstid og særtilfælde alle spiller en rolle. For at opnå det tester Parloa løbende modellerne mod virkelige kundescenarier, før de implementeres.
»Modellerne har kun betydning, hvis de fungerer i produktion. Vi arbejder tæt sammen med OpenAI om at gøre modellerne hurtige og pålidelige nok til samtaler i realtid.«
Parloas Agent Management Platform (AMP) er udviklet, så forretningsbrugere og fageksperter kan bygge AI-agenter uden at skrive kode.
»Med AMP kan fageksperter fra forskellige forretningsenheder selv bygge agenterne og forbinde API'erne på en langt mere enkel og effektiv måde,« siger O’Reilly.
Overordnet set gør AMP det muligt for brands at administrere hele AI-agentens livscyklus. Det sker ved at give ikke-tekniske teams en enklere måde at definere, hvordan en agent skal opføre sig, før den sættes i drift. I stedet for at skrive kode eller kortlægge faste hensigtstræer angiver fageksperter agentens rolle, instruktioner, værktøjer og grænser i naturligt sprog. Denne konfiguration danner grundlag for, hvordan modellen promptes, og hvordan systemet opfører sig i produktion.
Når agenten er defineret, testes den før implementering. Parloa simulerer kundesamtaler med modeller som GPT‑5.4, hvor én model spiller rollen som den, der ringer, mens en anden kører den konfigurerede agent. Teams kan gennemgå interaktionerne direkte, teste ændringer i realistiske scenarier og finjustere dem, før de sættes i drift.
De samme modeller bruges derefter til at evaluere samtalerne ved hjælp af en kombination af deterministiske kontroller og LLM-as-a-judge-bedømmelse. Det viser, om agenten fulgte instruktionerne, brugte værktøjerne korrekt og løste opgaven som forventet.




Under en live-samtale prompter AMP's orkestreringslag en OpenAI-model med agentkonfigurationen og samtalekonteksten for at generere et svar, hente oplysninger via RAG eller aktivere værktøjer, der interagerer med kundens backend-systemer. Parloa opdaterer løbende dette lag med den nyeste generation af modeller, når de viser tydelige forbedringer i praktisk anvendelse.
Efter samtalen opsummerer separate OpenAI-drevne arbejdsgange interaktionen, klassificerer kundens hensigt og evaluerer ydeevnen ud fra definerede regler.
Efterhånden som agenterne blev mere komplekse, blev det sværere at vedligeholde én samlet, monolitisk prompt. Små ændringer kunne medføre utilsigtede bivirkninger. For at løse problemet indførte Parloa en modulær tilgang. Opgaver som godkendelse, ændring af bookinger eller opdatering af konti kan opdeles i særskilte underagenter. Det forbedrer evnen til at følge instruktioner og gør systemerne nemmere at videreudvikle.
Samtidig indeholder platformen deterministiske kontroller på de områder, hvor pålidelighed er vigtigst. Virksomheder kan definere strukturerede API-kæder og hændelsesbaseret logik for at sikre, at kritiske trin udføres i den rigtige rækkefølge, så fleksible samtaler kombineres med forudsigelig afvikling.
Parloa bruger modeller som GPT‑4.1, GPT‑5‑mini og andre til at simulere realistiske kundeinteraktioner, før en agent sættes i drift. Derefter evalueres interaktionerne med en kombination af LLM-as-a-judge og deterministiske regler. Det giver teams mulighed for at teste særtilfælde, gentage processen hurtigt og validere ydeevnen, før kunderne risikerer at opleve fejl.
Parloa arbejder primært med store virksomheder, hvor stabilitet er lige så vigtig som funktionalitet.
»Når der kommer en ny model, kører vi vores benchmarkpakke på den,« siger Matthäus Deutsch, Senior Applied Scientist. »Det er meget vigtigt for os, at tingene ikke kun fungerer i teoretiske benchmarks, men også i virkelige anvendelser.«
I stedet for at stole på abstrakte benchmarks genskaber Parloa virkelige produktionsagenter og kører dem gennem pipelines til simulering og evaluering. Testene måler, hvor pålideligt instruktioner følges, hvor stabilt API-kald udføres, latenstid og den samlede ydeevne under realistiske forhold.
Evalueringerne afgør, hvilke modeller der er klar til produktion. Kun modeller, der fungerer pålideligt på tværs af virkelige kundescenarier, implementeres.
»Virksomhedskunder har reelle omkostninger ved migrering,« siger Deutsch. »Når et system først fungerer i produktion, holder de det stabilt og skifter kun, når fordelene er tydelige.«
Derfor opfører systemerne sig forudsigeligt i produktion, selv i stor skala. På tværs af millioner af kundeinteraktioner bliver de fleste samtaler løst uden problemer. Selv når opkald viderestilles til menneskelige medarbejdere, skyldes eskaleringen sjældent fejl. Ved én implementering reducerede et globalt rejseselskab anmodningerne om en menneskelig medarbejder med 80 %.
Denne tilgang med evaluering først er blevet en central konkurrencefordel, som gør det muligt for Parloa at arbejde hurtigt uden at gå på kompromis med driftssikkerheden.
Stemme medfører andre begrænsninger end tekstbaseret chat. Hver interaktion kører gennem en pipeline med lav latenstid: tale-til-tekst, modelræsonnering og tekst-til-tale.
Denne pipeline gør latenstiden afgørende. Selv små forsinkelser i modellaget bliver samlet til mærkbare pauser for den, der ringer, og påvirker derfor valget og optimeringen af modeller.
Parloa arbejder tæt sammen med OpenAI om at optimere ydeevnen til realtidsbrug med fokus på latenstid, svarkvalitet og evnen til at følge instruktioner. Teamet evaluerer og stresstester løbende nye modelversioner i produktionslignende miljøer, før de tages i brug i live-kundeinteraktioner.
Parloa evaluerer hver komponent i stemmeløsningen separat:
- Tale-til-tekst-systemer testes for ordfejlrate, især ved følsomme oplysninger som policenumre eller konto-id'er.
- Tekst-til-tale-modeller evalueres gennem blinde lyttetests for at vurdere, hvor naturlig stemmen lyder for virkelige brugere. Resultaterne sammenholdes derefter med virkelige kundeinteraktioner for at sikre stabil ydeevne i produktionsmiljøer.
- Tale-til-tale-modeller evalueres i øjeblikket for at afgøre, om de er klar til produktion, med fokus på latenstid, nøjagtighed og omkostninger.
Fra begyndelsen er disse systemer blevet udviklet til global implementering. Benchmarks omfatter flere sprog, og kunderne opererer i regioner verden over. Denne grundige flersprogede tilgang afspejler både Parloas europæiske rødder og virksomhedskundernes forventninger om ensartet ydeevne på tværs af markeder – ikke kun på ét sprog eller i én region.
I dag håndterer Parloas agenter millioner af samtaler på tværs af brancher som detailhandel, rejser og forsikring. Anvendelserne spænder fra automatiseret support til indtægtsskabende forløb som telefonsalg.
Parloa forventer, at kundeservice udvikler sig til en fuldt multimodal oplevelse.
En samtale kan begynde i telefonen, fortsætte i en chat og undervejs indeholde links eller interaktive elementer. I stedet for at behandle hvert trin som et separat forløb er AMP designet til at håndtere det som én samlet interaktion. Med tiden kan AI-agenter blive lige så centrale for kunderejsen som websites og mobilapps.
Efterhånden som virksomheder automatiserer en stadig større del af kundeinteraktionerne, fokuserer Parloa på at gøre AI-agenter pålidelige, fleksible og tillidsvækkende nok til at fungere globalt.


