Waarom een AI-stem gaat mompelen

Een AI-telefonist zegt het laatste woord van een zin vaker verkeerd dan de rest, en na zo'n twee minuten gesprek wordt dat ineens veel erger. We zochten uit waarom.

Sep 28, 2026 · 4 min read

‘Waarmee kan ik u helpen?’ Het is de zin die onze AI-telefonist het vaakst zegt. En juist het laatste woord gaat soms mis: ‘helpen’ klinkt dan als ‘lopen’, ‘noken’ of ‘melken’. We hebben gemeten hoe vaak dat gebeurt en waar het door komt. Een deel van wat we vonden verraste ons zelf.

Denken en praten in één adem

Onze AI-telefonist gebruikt een speech-to-speech-model. Zo'n model maakt direct geluid: het bedenkt wat het zegt en spreekt het in één adem uit, zonder tussenstap via tekst. Dat is precies waarom een gesprek ermee zo natuurlijk klinkt. Het model hoort hoe iemand iets zegt, reageert met de juiste toon en valt niet stil terwijl een aparte stem eerst een zin voorleest.

Er zit alleen een eigenaardigheid in. Aan het eind van een zin lijkt het model soms haast te hebben: de laatste lettergreep wordt ingeslikt, of het woord klinkt als een ander woord. Dat zien we bij alle speech-to-speech-modellen die we hebben getest. Het is dus geen probleem van één leverancier, maar van deze manier van spraak maken.

Het laatste woord

Om te meten hoe vaak het gebeurt, laten we een tweede AI-model elk laatste woord van elke zin beoordelen: klinkt het als het woord dat bedoeld was? Hetzelfde doen we voor een steekproef van woorden midden in een zin, als vergelijking.

In een selectie uit ons productieverkeer, ruim 1.900 gesprekken op één dag, ging 8,0% van de laatste woorden mis, tegen 1,5% midden in een zin. Het woord dat het vaakst misging was ‘helpen’, precies het woord waar de vaste openingsvraag op eindigt. Het beoordelingsmodel hoorde onder meer ‘lopen’, ‘open’, ‘noken’, ‘melden’ en ‘melken’.

Opvallend: ‘natuurlijk’ en ‘doorverbinden’ gingen vrijwel nooit mis, terwijl ‘doorverbinden’ net als ‘helpen’ op -en eindigt. Het is dus geen simpele regel voor één uitgang.

‘Helpen’ is het woord dat het vaakst wegzakt, precies aan het eind van de vaste openingsvraag.
‘Helpen’ is het woord dat het vaakst wegzakt, precies aan het eind van de vaste openingsvraag.

Na twee minuten wordt het anders

De grootste verrassing zat in de tijd. In testgesprekken blijft het percentage twee minuten lang rond de 1 à 2%. Daarna springt het vijf tot acht keer omhoog. Hoe langer het gesprek duurt, hoe vaker het laatste woord wegzakt.

De eerste twee minuten gaat het vrijwel altijd goed. Daarna zakt het laatste woord vaker weg.
De eerste twee minuten gaat het vrijwel altijd goed. Daarna zakt het laatste woord vaker weg.

Dat zie je ook binnen één gesprek. Zegt de telefonist ‘helpen’ meerdere keren, dan gaat de laatste keer ongeveer anderhalf keer zo vaak mis als de eerste keer.

Wat het níét was

We hadden verdachten. Om ze uit elkaar te halen voerden we 560 testgesprekken met zes varianten van dezelfde telefonist. De varianten wisselden elkaar om de beurt af, zodat het tijdstip geen rol speelde. Per variant veranderden we één ding:

  • zonder de achtergrondkennis over het bedrijf die de telefonist vooraf meekrijgt: geen verschil
  • zonder de extra regels voor uitspraak, onze hoofdverdachte: geen verschil
  • met een andere stem: geen verschil
  • met instructies in een andere taal dan Engels, de basistaal van het model: geen verbetering, eerder iets slechter

Dat laatste bevestigt meteen iets wat we al deden: de instructies voor de telefonist schrijven we in het Engels, ook als het gesprek in het Nederlands is.

Wat wél verschil maakte

Eén variant maakte echt verschil: de telefonist zonder de hulpmiddelen die hij tijdens een gesprek gebruikt, zoals informatie opzoeken of doorverbinden. Laat in het gesprek zakte het aantal fouten met ongeveer 37%. Het patroon bleef wel hetzelfde: na twee minuten nog steeds een sprong, alleen minder hoog.

Zonder hulpmiddelen kan een telefonist natuurlijk niet doorverbinden, dus dit is geen oplossing. Wel een aanwijzing: alles wat zich in een gesprek opstapelt, lijkt het model zwaarder te maken.

Ligt het aan het model of aan de lijn?

Tot slot vergeleken we dezelfde woorden in twee opnames: het geluid zoals het model het maakte, en het geluid zoals het via de telefoonlijn bij de beller aankwam. Ongeveer 72% van de fouten zit al in het geluid van het model zelf. De rest ontstaat onderweg, tussen ons platform en de telefoonlijn.

Waarom we toch voor speech-to-speech kiezen

Je zou kunnen zeggen: kies dan de ouderwetse route, eerst tekst en dan een aparte stem. Maar daarmee lever je in op wat bellers het meest merken. Een gesprek met een speech-to-speech-model is veel natuurlijker: sneller, met de juiste intonatie, en de telefonist laat zich gewoon onderbreken. Die winst is een stuk groter dan een ingeslikte lettergreep.

Dus werken we eromheen. Het deel dat onderweg ontstaat, pakken we zelf aan. Voor het deel in het model zoeken we manieren om het laatste woord overeind te houden, ook als een gesprek langer duurt.

En de tijd werkt in ons voordeel. Speech-to-speech-modellen worden in hoog tempo beter, en elke nieuwe generatie gaat hier sowieso verbetering in brengen. Omdat we nu precies weten hoe vaak het laatste woord misgaat, hebben we meteen een meetlat. Komt er een nieuw model uit, dan draaien we dezelfde test en zien we binnen een dag of het beter is, en hoeveel. Zo kiezen we niet op gevoel, maar op cijfers.

Net als bij de paradox van de rode kater: een goede AI-telefonist is niet één knop die je goed zet. Het is meten, één ding veranderen en opnieuw meten. Hoe dat klinkt, hoor je zelf op onze website.

van de laatste woorden gaat mis
8,0%
meer fouten na twee minuten
5-8×
van de fouten zit al in het model
72%