Inleiding
De meeste bedrijven die AI testen voor klantenservice lopen tegen dezelfde muur aan. Het systeem werkt wekenlang prima. Dan geeft het aan één klant een zelfverzekerd en volkomen verkeerd antwoord. Misschien over een terugbetalingstermijn. Misschien over een beleid dat vorig kwartaal is gewijzigd. Iemand in een leidinggevende functie merkt dit op en de uitrol, die bedoeld was om het grootste deel van de wachtrij af te handelen, stagneert stilletjes bij een fractie daarvan.
Branchegegevens bevestigen hoe vaak dit patroon voorkomt. Uit het 2025 World Quality Report van OpenText, Capgemini en Sogeti bleek dat zorgen over betrouwbaarheid en ‘hallucinaties’ voor 60% van de ondervraagde organisaties een belangrijke belemmering vormden voor de invoering van AI. Uit afzonderlijk onderzoek van Gong bleek dat 58% van de bedrijven AI-projecten had stilgelegd en dat bijna de helft van de geplande AI-investeringen werd tegengehouden door vertrouwenskwesties in plaats van door het budget. De tools zijn capabel. Het vertrouwen erin blijft achter.
De wiskunde achter één fout antwoord
Supportwerk is asymmetrisch, in die zin dat het gemiddelde nauwkeurigheidscijfer als maatstaf nadelig uitpakt. Een juist antwoord bespaart een paar minuten. Een fout antwoord kan leiden tot het goedkeuren van een terugbetaling die nooit had mogen plaatsvinden, het verzinnen van een beleid dat nooit heeft bestaan, of het aangaan van een verbintenis waarvoor niemand toestemming heeft gegeven. Wanneer de nadelen van één fout zwaarder wegen dan de voordelen van honderd juiste antwoorden, is optimaliseren voor het gemiddelde geval volstrekt het verkeerde doel.
Er zijn ook verborgen kosten. Een supportmedewerker die één keer merkt dat de AI het bij het verkeerde eind heeft, gaat daarna alles dubbel controleren, waardoor het grootste deel van de tijd die het systeem had moeten besparen, teniet wordt gedaan. Vertrouwen wordt niet per gesprek gemeten. Het bouwt zich op of het stort in, en zodra het instort, vertrouwen teams het systeem niet meer, zelfs als het meestal gelijk heeft.
Hallucinaties verdwijnen niet, ze worden beheerd
Zelfs de sterkste taalmodellen verzinnen dingen onder de juiste omstandigheden, en de werkelijke cijfers liggen hoger dan de meeste mensen aannemen. Bij ‘grounded summarization’ – in wezen dezelfde taak als het beantwoorden van vragen op basis van je eigen helpdocumenten – plaatst het hallucinatie-klassement van Vectara de beste modellen rond de 3% en laat het zien dat bekende toonaangevende modellen zich clusteren tussen 6% en 15%. Sommige modellen die zwaar leunen op redenering komen bij diezelfde taak boven de 20% uit, omdat diepgaandere redenering hen meer ruimte geeft om beweringen te introduceren die de brontekst nooit heeft gedaan. Stel een model bloot aan open vragen zonder enige basis om op terug te vallen, en de cijfers worden veel slechter. Onderzoekers van Stanford ontdekten dat toonaangevende modellen bij een grote meerderheid van specifieke juridische vragen hallucineerden wanneer er geen brondocument werd verstrekt.
Dit betekent niet dat een bepaald model slecht is. Het betekent dat geen enkel model, op zichzelf gebruikt, betrouwbaar genoeg is om aan betalende klanten te worden aangeboden zonder dat er toezicht op wordt gehouden.
Intelligentie en controle trekken in tegengestelde richtingen
Er is een structurele reden waarom één enkel model dit niet op eigen kracht kan oplossen. Naarmate een systeem beter wordt in het afhandelen van dubbelzinnige of onbekende gevallen, wordt het ook moeilijker om het volledig te voorspellen, omdat dezelfde redenering die het in staat stelt een geval af te handelen waarvoor niemand een script heeft geschreven, ook de redenering is die het af en toe ergens naartoe leidt waar het niet heen zou moeten gaan. Een capabeler model is niet automatisch een veiliger model. Die afweging is de reden waarom betrouwbaarheid moet worden ingebouwd als een laag rondom het model, in plaats van dat deze van het model zelf wordt verwacht.
Aissist pakt dit aan met vier gelaagde technieken in plaats van één. Prompt engineering stelt de basisregels vast waaraan elke taak zich houdt, wat vooral van belang is in een agentisch systeem waar één klantverzoek kan uitgroeien tot meer dan een dozijn subtaken die allemaal dezelfde veiligheidsregels moeten respecteren. Een ‘booster’-stap voert onzekere beslissingen meer dan eens uit en behoudt het antwoord waar de meeste agents het over eens zijn, ten koste van extra rekenkracht. Een zelfinspectieronde zorgt ervoor dat het systeem zijn eigen output beoordeelt, of deze doorgeeft aan een tweede model in een andere rol, voordat er iets de klant bereikt. En boven dit alles bevindt zich een gestapelde governance-laag, die controleert of een output of actie voldoet aan het beleid voordat deze wordt vrijgegeven; deze fungeert minder als een filter en meer als een toezichthouder voor het hele systeem.
Dankzij die combinatie houdt het platform zijn AI-foutpercentage onder de 1%, een cijfer dat vooral het vermelden waard is omdat zo weinig leveranciers in deze sector er überhaupt een publiceren.
Beoordelen wanneer niet te antwoorden
Het meest waardevolle gedrag van een supportmedewerker is niet het correct beantwoorden van meer vragen. Het is herkennen welke vragen hij niet in zijn eentje moet proberen te beantwoorden. Een systeem dat een lastig factureringsgeschil vroegtijdig escaleert, met de volledige context erbij, richt veel minder schade aan dan een systeem dat doorgaat en gokt. Dit is ook wat het verschil maakt tussen een medewerker die een oplossing beschrijft en een medewerker die deze daadwerkelijk toepast: de bestelling opzoeken, de wijziging doorvoeren en dit terugbevestigen aan de klant.
Betrouwbaarheid moet worden gehandhaafd, niet alleen opgebouwd
Een systeem dat op de lanceringsdag nauwkeurig is, blijft dat niet zonder toezicht. Producten veranderen, het beleid wordt bijgewerkt en de vragen die klanten stellen, veranderen mee. Door voortdurend te meten wordt die verschuiving als data vastgelegd in plaats van als een golf van klachten, en een gedisciplineerde cyclus van evalueren, testen en uitrollen blijft de gevonden hiaten dichten, waarbij een mens nog steeds zijn goedkeuring geeft voordat er daadwerkelijk iets verandert.
Wat je daadwerkelijk moet controleren voordat je een leverancier vertrouwt
Elke leverancier die beweert dat zijn AI nooit fouten maakt, moet met argwaan worden bekeken, omdat dit meestal betekent dat niemand nauwkeurig genoeg meet om het tegendeel te weten. De leveranciers die het waard zijn om serieus te nemen, publiceren een foutenpercentage, leggen precies uit hoe ze fouten opsporen voordat klanten ze zien, en zijn openhartig over wanneer het systeem het overneemt aan een mens in plaats van te gissen. Dat is een heel andere benadering dan ‘vertrouw op de AI’, en het is degene die daadwerkelijk standhoudt zodra het echte ticketvolume binnenkomt.

