• Technologie

Warum KI-Unterstützung für Piloten an mangelndem Vertrauen scheitert – und nicht an mangelnder Leistungsfähigkeit

  • Felix Rose-Collins
  • 4 min read

Einleitung

Die meisten Unternehmen, die KI für den Kundensupport testen, stoßen auf dieselbe Hürde. Das System funktioniert wochenlang einwandfrei. Dann gibt es einem Kunden eine selbstbewusste und völlig falsche Antwort. Vielleicht geht es um eine Rückerstattungsfrist. Vielleicht um eine Richtlinie, die sich im letzten Quartal geändert hat. Ein leitender Mitarbeiter bemerkt dies, und die Einführung, die eigentlich den Großteil der Warteschlange abdecken sollte, kommt still und leise bei einem Bruchteil davon zum Stillstand.

Branchendaten belegen, wie häufig dieses Muster auftritt. Der „2025 World Quality Report“ von OpenText, Capgemini und Sogeti ergab, dass Bedenken hinsichtlich Zuverlässigkeit und Fehlentscheidungen für 60 % der befragten Unternehmen ein Haupthindernis für die Einführung von KI darstellten. Eine separate Studie von Gong ergab, dass 58 % der Unternehmen KI-Projekte auf Eis gelegt hatten und fast die Hälfte der geplanten KI-Investitionen eher durch Vertrauensbedenken als durch Budgetengpässe gebremst wurde. Die Tools sind leistungsfähig. Was hinterherhinkt, ist das Vertrauen in sie.

Die Mathematik hinter einer falschen Antwort

Die Supportarbeit ist insofern asymmetrisch, als sie eine durchschnittliche Genauigkeit als Kennzahl benachteiligt. Eine richtige Antwort spart ein paar Minuten. Eine falsche Antwort kann eine Rückerstattung genehmigen, die niemals hätte erfolgen dürfen, eine Richtlinie erfinden, die es nie gab, oder eine Verpflichtung eingehen, die niemand genehmigt hat. Wenn der Nachteil eines einzigen Fehlers den Vorteil von hundert richtigen Antworten überwiegt, ist die Optimierung für den Durchschnittsfall völlig das falsche Ziel.

Es gibt auch versteckte Kosten. Ein Support-Mitarbeiter, der einmal feststellt, dass die KI falsch liegt, beginnt danach, alles doppelt zu überprüfen, wodurch der größte Teil der Zeit, die eigentlich eingespart werden sollte, wieder zunichte gemacht wird. Vertrauen wird nicht pro Gespräch bewertet. Es baut sich auf oder bricht zusammen, und sobald es zusammenbricht, hören Teams auf, dem System zu vertrauen, selbst wenn es die meiste Zeit richtig liegt.

Halluzinationen verschwinden nicht, sie lassen sich nur in den Griff bekommen

Selbst die leistungsstärksten Sprachmodelle erfinden unter den richtigen Bedingungen Dinge, und die tatsächlichen Zahlen liegen höher, als die meisten Menschen annehmen. Bei der fundierten Zusammenfassung – im Wesentlichen dieselbe Aufgabe wie das Beantworten von Fragen anhand der eigenen Hilfe-Dokumente – liegt laut Vectaras Halluzinations-Rangliste der Wert der besten Modelle bei etwa 3 %, während bekannte Flaggschiff-Modelle zwischen 6 % und 15 % liegen. Einige Modelle mit hohem Schlussfolgerungsaufwand steigen bei derselben Aufgabe über 20 % hinaus, da tiefgreifendere Schlussfolgerungen ihnen mehr Spielraum geben, Behauptungen einzuführen, die der Quelltext nie aufgestellt hat. Setzt man ein Modell auf offene Fragen an, ohne dass es sich an etwas orientieren kann, verschlechtern sich die Zahlen erheblich. Forscher der Stanford University stellten fest, dass führende Modelle bei einer großen Mehrheit spezifischer rechtlicher Fragen Halluzinationen erzeugten, wenn kein Quelldokument bereitgestellt wurde.

Das bedeutet keineswegs, dass ein bestimmtes Modell schlecht ist. Es bedeutet vielmehr, dass kein einzelnes Modell, wenn es allein eingesetzt wird, zuverlässig genug ist, um es zahlenden Kunden ohne Aufsicht zur Verfügung zu stellen.

Intelligenz und Kontrolle ziehen in entgegengesetzte Richtungen

Es gibt einen strukturellen Grund, warum ein einzelnes Modell dieses Problem nicht aus eigener Kraft lösen kann. Je besser ein System darin wird, mehrdeutige oder unbekannte Fälle zu bearbeiten, desto schwieriger wird es auch, sein Verhalten vollständig vorherzusagen; denn genau die gleiche Argumentation, die es befähigt, einen Fall zu bearbeiten, für den niemand ein Skript geschrieben hat, ist auch die Argumentation, die es gelegentlich an einen Ort führt, an den es nicht gelangen sollte. Ein leistungsfähigeres Modell ist nicht automatisch auch ein sichereres. Dieser Zielkonflikt ist der Grund, warum Zuverlässigkeit als eine Ebene um das Modell herum entwickelt werden muss, anstatt sie vom Modell selbst zu erwarten.

Aissist geht dieses Problem mit vier aufeinander aufbauenden Techniken an, statt mit nur einer. Das „Prompt Engineering“ legt die Grundregeln fest, denen jede Aufgabe folgt – was in einem agentenbasierten System umso wichtiger ist, in dem sich eine einzelne Kundenanfrage auf mehr als ein Dutzend Teilaufgaben ausweiten kann, die alle dieselben Leitplanken einhalten müssen. Ein „Booster“-Schritt führt unsichere Entscheidungen mehrmals durch und behält die Antwort bei, auf die sich die meisten Agenten einigen – auf Kosten zusätzlicher Rechenleistung. Bei einem Selbstüberprüfungsdurchlauf überprüft das System seine eigene Ausgabe oder übergibt sie an ein zweites Modell in einer anderen Rolle, bevor irgendetwas den Kunden erreicht. Und über all dem befindet sich eine gestapelte Governance-Ebene, die prüft, ob eine Ausgabe oder Aktion den Richtlinien entspricht, bevor sie ausgegeben wird – sie fungiert weniger als Filter, sondern eher als Aufseher für das gesamte System.

Durch diese Kombination hält die Plattform ihre KI-Fehlerquote unter 1 % – eine Zahl, die vor allem deshalb bemerkenswert ist, weil so wenige Anbieter in diesem Bereich überhaupt eine solche veröffentlichen.

Einschätzen, wann man nicht antworten sollte

Das wertvollste Verhalten eines Support-Mitarbeiters besteht nicht darin, mehr Fragen richtig zu beantworten. Es besteht darin, zu erkennen, welche Fragen er nicht versuchen sollte, allein zu beantworten. Ein System, das einen kniffligen Abrechnungsstreit frühzeitig eskaliert und dabei den vollständigen Kontext mitliefert, richtet weitaus weniger Schaden an als eines, das einfach weitermacht und Vermutungen anstellt. Das ist auch der Unterschied zwischen einem Mitarbeiter, der eine Lösung beschreibt, und einem, der sie tatsächlich umsetzt, indem er den Auftrag aufruft, die Änderung vornimmt und sie dem Kunden bestätigt.

Zuverlässigkeit muss aufrechterhalten, nicht nur aufgebaut werden

Ein System, das am Tag der Einführung präzise arbeitet, bleibt nicht von selbst so, wenn es nicht überwacht wird. Produkte ändern sich, Richtlinien werden aktualisiert, und die Fragen der Kunden verschieben sich entsprechend. Kontinuierliche Messungen erfassen diese Verschiebungen als Daten statt als Welle von Beschwerden, und ein disziplinierter Zyklus aus Bewertung, Test und Freigabe schließt die gefundenen Lücken nach und nach, wobei immer noch ein Mensch die Freigabe erteilt, bevor tatsächlich etwas geändert wird.

Was man tatsächlich prüfen sollte, bevor man einem Anbieter vertraut

Jeder Anbieter, der behauptet, seine KI mache niemals Fehler, sollte mit Misstrauen betrachtet werden, denn das bedeutet in der Regel, dass niemand genau genug misst, um das Gegenteil zu wissen. Diejenigen, die es wert sind, ernst genommen zu werden, veröffentlichen eine Fehlerquote, erklären genau, wie sie Fehler erkennen, bevor Kunden sie bemerken, und legen offen dar, wann das System an einen Menschen übergibt, anstatt zu raten. Das ist ein ganz anderer Ansatz als „Vertrauen Sie der KI“ – und es ist der Ansatz, der sich tatsächlich bewährt, sobald das tatsächliche Ticketvolumen einsetzt.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Starten Sie mit Ranktracker... kostenlos!

Finden Sie heraus, was Ihre Website vom Ranking abhält.

Ein kostenloses Konto erstellen

Oder melden Sie sich mit Ihren Anmeldedaten an

Different views of Ranktracker app