Alle Stories

Einblick

Warum eine KI-Stimme nuschelt

Ein KI-Telefonassistent spricht das letzte Wort eines Satzes öfter falsch aus als den Rest, und nach etwa zwei Minuten Gespräch wird das plötzlich deutlich schlimmer. Wir haben untersucht, warum.

28 Sept. 2026 · 4 Min. Lesezeit

‘Waarmee kan ik u helpen?’ (Womit kann ich Ihnen helfen?) Unser KI-Telefonassistent führt seine Gespräche auf Niederländisch, und diesen Satz sagt er am häufigsten. Ausgerechnet das letzte Wort geht manchmal schief: ‘helpen’ (helfen) klingt dann wie ‘lopen’ (laufen), ‘noken’ oder ‘melken’ (melken). Wir haben gemessen, wie oft das passiert und woran es liegt. Ein Teil dessen, was wir gefunden haben, hat uns selbst überrascht.

Denken und Sprechen in einem Atemzug

Unser KI-Telefonassistent nutzt ein Speech-to-Speech-Modell. Ein solches Modell erzeugt direkt Klang: Es überlegt, was es sagt, und spricht es in einem Zug aus, ohne Zwischenschritt über Text. Genau deshalb klingt ein Gespräch damit so natürlich. Das Modell hört, wie jemand etwas sagt, antwortet im richtigen Ton und verstummt nicht, während eine separate Stimme erst einen Satz vorliest.

Es gibt allerdings eine Eigenart. Am Ende eines Satzes scheint das Modell manchmal in Eile zu sein: Die letzte Silbe wird verschluckt, oder das Wort klingt wie ein anderes Wort. Das beobachten wir bei allen Speech-to-Speech-Modellen, die wir getestet haben. Es ist also kein Problem eines einzelnen Anbieters, sondern dieser Art, Sprache zu erzeugen.

Das letzte Wort

Um zu messen, wie oft das passiert, lassen wir ein zweites KI-Modell jedes letzte Wort jedes Satzes beurteilen: Klingt es wie das Wort, das gemeint war? Dasselbe machen wir zum Vergleich für eine Stichprobe von Wörtern mitten im Satz.

In einer Auswahl aus unserem Produktivverkehr, gut 1.900 Gespräche an einem einzigen Tag, gingen 8,0 % der letzten Wörter schief, gegenüber 1,5 % mitten im Satz. Das Wort, das am häufigsten danebenging, war ‘helpen’ (helfen), genau das Wort, auf das die feste Eröffnungsfrage endet. Das Bewertungsmodell hörte unter anderem ‘lopen’ (laufen), ‘open’ (offen), ‘noken’, ‘melden’ (melden) und ‘melken’ (melken).

Auffällig: ‘natuurlijk’ (natürlich) und ‘doorverbinden’ (durchstellen) gingen fast nie schief, obwohl ‘doorverbinden’ wie ‘helpen’ auf -en endet. Es ist also keine einfache Regel für eine bestimmte Endung.

‘Helpen’ (helfen) ist das Wort, das am häufigsten wegsackt, genau am Ende der festen Eröffnungsfrage.
‘Helpen’ (helfen) ist das Wort, das am häufigsten wegsackt, genau am Ende der festen Eröffnungsfrage.

Nach zwei Minuten wird es anders

Die größte Überraschung lag in der Zeit. In Testgesprächen bleibt der Anteil zwei Minuten lang bei etwa 1 bis 2 %. Danach steigt er auf das Fünf- bis Achtfache. Je länger das Gespräch dauert, desto öfter sackt das letzte Wort weg.

In den ersten zwei Minuten geht es fast immer gut. Danach sackt das letzte Wort öfter weg.
In den ersten zwei Minuten geht es fast immer gut. Danach sackt das letzte Wort öfter weg.

Das sieht man auch innerhalb eines einzelnen Gesprächs. Sagt der Assistent mehrmals ‘helpen’, geht das letzte Mal etwa anderthalbmal so oft schief wie das erste Mal.

Woran es nicht lag

Wir hatten Verdächtige. Um sie auseinanderzuhalten, führten wir 560 Testgespräche mit sechs Varianten desselben Assistenten. Die Varianten wechselten sich reihum ab, sodass die Tageszeit keine Rolle spielte. Pro Variante änderten wir eine Sache:

  • ohne das Hintergrundwissen über das Unternehmen, das der Assistent vorab mitbekommt: kein Unterschied
  • ohne die zusätzlichen Ausspracheregeln, unseren Hauptverdächtigen: kein Unterschied
  • mit einer anderen Stimme: kein Unterschied
  • mit Anweisungen in einer anderen Sprache als Englisch, der Basissprache des Modells: keine Verbesserung, eher etwas schlechter

Der letzte Punkt bestätigt gleich etwas, das wir ohnehin schon so machen: Die Anweisungen für den Assistenten schreiben wir auf Englisch, auch wenn das Gespräch auf Niederländisch geführt wird.

Was sehr wohl einen Unterschied machte

Eine Variante machte wirklich einen Unterschied: der Assistent ohne die Werkzeuge, die er während eines Gesprächs nutzt, etwa Informationen nachschlagen oder durchstellen. Spät im Gespräch sank die Zahl der Fehler um etwa 37 %. Das Muster blieb aber gleich: nach zwei Minuten weiterhin ein Sprung, nur ein kleinerer.

Ohne Werkzeuge kann ein Telefonassistent natürlich niemanden durchstellen, das ist also keine Lösung. Aber ein Hinweis: Alles, was sich in einem Gespräch ansammelt, scheint dem Modell die Arbeit schwerer zu machen.

Liegt es am Modell oder an der Leitung?

Zum Schluss verglichen wir dieselben Wörter in zwei Aufnahmen: den Klang, wie das Modell ihn erzeugt hat, und den Klang, wie er über die Telefonleitung beim Anrufer ankam. Etwa 72 % der Fehler stecken bereits im Klang des Modells selbst. Der Rest entsteht unterwegs, zwischen unserer Plattform und der Telefonleitung.

Warum wir trotzdem auf Speech-to-Speech setzen

Man könnte sagen: Dann nehmen Sie doch den klassischen Weg, erst Text und dann eine separate Stimme. Damit verzichten Sie aber auf das, was Anrufer am meisten merken. Ein Gespräch mit einem Speech-to-Speech-Modell ist viel natürlicher: schneller, mit der richtigen Betonung, und der Assistent lässt sich einfach unterbrechen. Dieser Gewinn ist deutlich größer als eine verschluckte Silbe.

Also arbeiten wir darum herum. Den Teil, der unterwegs entsteht, gehen wir selbst an. Für den Teil im Modell suchen wir Wege, das letzte Wort stabil zu halten, auch wenn ein Gespräch länger dauert.

Und die Zeit arbeitet für uns. Speech-to-Speech-Modelle werden in hohem Tempo besser, und jede neue Generation wird hier ohnehin Verbesserungen bringen. Weil wir jetzt genau wissen, wie oft das letzte Wort schiefgeht, haben wir gleich einen Maßstab. Kommt ein neues Modell heraus, führen wir denselben Test durch und sehen innerhalb eines Tages, ob es besser ist und um wie viel. So entscheiden wir nicht nach Gefühl, sondern nach Zahlen.

Wie beim Paradox des roten Katers: Ein guter KI-Telefonassistent ist nicht ein einzelner Regler, den man richtig einstellt. Es heißt messen, eine Sache ändern und erneut messen. Wie das klingt, hören Sie selbst auf unserer Website.

der letzten Wörter falsch
8,0 %
öfter nach 2 Minuten
5-8×
vom Modell selbst
72 %