Das Telefon ist in vielen Unternehmen ein bemerkenswerter Sonderfall der Digitalisierung. Termine werden online gebucht, Kundendaten im CRM verwaltet und interne Abläufe über digitale Workflows gesteuert. Wenn ein Kunde, Patient oder Geschäftspartner anruft, hängt die Bearbeitung dagegen häufig noch davon ab, ob gerade ein Mitarbeiter Zeit hat.
Das führt besonders bei hohem Anrufaufkommen zu einem bekannten Muster. Leitungen sind besetzt, Anrufer versuchen es mehrfach und Mitarbeiter werden für immer wiederkehrende Fragen aus anderen Aufgaben gerissen. Klassische Warteschleifen verteilen dieses Problem lediglich über die Zeit.
Voicebots verfolgen einen anderen Ansatz. Sie nehmen Gespräche automatisiert entgegen und versuchen, das gesprochene Anliegen zu verstehen, statt Anrufer ausschließlich durch starre Menüs zu führen. Fortschritte bei Spracherkennung, Sprachmodellen und Sprachsynthese haben solche Systeme in den vergangenen Jahren deutlich leistungsfähiger gemacht.
Das bedeutet allerdings nicht, dass künstliche Intelligenz jedes Telefongespräch sinnvoll führen kann. Gerade bei komplexen, sensiblen oder mehrdeutigen Anliegen ist entscheidend, dass Automatisierung rechtzeitig endet und ein Mensch übernimmt.
Vom Sprachmenü zum dialogorientierten System
Automatisierte Telefonie ist keine neue Erfindung. Schon lange setzen Unternehmen sogenannte IVR-Systeme ein. Die Abkürzung steht für Interactive Voice Response.
Bekannt sind vor allem Ansagen wie „Drücken Sie die 1 für Bestellungen, die 2 für Rechnungsfragen“. Teilweise können Anrufer auch einzelne Schlüsselbegriffe nennen. Dahinter stehen meist fest definierte Entscheidungsbäume.
Diese Systeme können bei klar strukturierten Abläufen durchaus zweckmäßig sein. Ihr entscheidender Nachteil liegt jedoch darin, dass der Anrufer der Logik des Systems folgen muss. Ein Anliegen muss in eine der vorgegebenen Kategorien passen.
Moderne Voicebots drehen dieses Prinzip teilweise um. Sie können mit einer offenen Frage beginnen, beispielsweise: „Was können wir für Sie tun?“ Anschließend versucht das System zu erkennen, welche Absicht hinter der Antwort steckt.
Sagt jemand etwa „Ich schaffe meinen Termin am Donnerstag nicht und müsste nächste Woche kommen“, sollte ein entsprechend eingerichtetes System erkennen, dass ein bestehender Termin geändert werden soll. Für die weitere Bearbeitung reicht die reine Transkription des Satzes nicht aus. Benötigt wird zusätzlich eine inhaltliche Einordnung.
Gerade darin liegt ein wesentlicher Unterschied zwischen einfacher Spracherkennung und einem dialogfähigen Voicebot.
Ein Voicebot besteht aus mehreren technischen Ebenen
Der Begriff Sprach-KI kann den Eindruck erwecken, hinter einem Voicebot arbeite ein einziges intelligentes System. In der Praxis handelt es sich meist um mehrere miteinander verbundene Komponenten.
Am Anfang steht die automatische Spracherkennung, auch Automatic Speech Recognition oder Speech-to-Text genannt. Sie überträgt das eingehende Audiosignal in maschinenlesbaren Text.
Danach muss das System bestimmen, was mit der Aussage gemeint ist. Je nach technischer Architektur kommen dafür Verfahren aus Natural Language Processing, Natural Language Understanding, spezialisierte Klassifikationsmodelle oder große Sprachmodelle zum Einsatz.
Dabei können sogenannte Intents identifiziert werden. Ein Intent beschreibt vereinfacht das Ziel einer Äußerung, beispielsweise „Termin absagen“, „Lieferstatus erfragen“ oder „Rückruf wünschen“.
Zusätzlich müssen häufig konkrete Informationen aus dem Gespräch herausgefiltert werden. Bei einer Terminänderung könnten dies Datum, Uhrzeit und Name sein. Bei einer Schadensmeldung wären möglicherweise Adresse, Art des Schadens und Erreichbarkeit relevant.
Erst danach kann entschieden werden, welche Aktion folgt. Das System könnte eine Frage stellen, Informationen aus einer Datenquelle abrufen, einen Workflow auslösen oder das Gespräch an einen Menschen übergeben.
Die gesprochene Antwort entsteht schließlich über Sprachsynthese, häufig als Text-to-Speech bezeichnet.
Ein typischer Ablauf besteht damit vereinfacht aus vier Schritten:
Gesprochene Sprache wird erkannt, ihr Inhalt interpretiert, eine passende Aktion bestimmt und die Antwort anschließend wieder als Sprache ausgegeben.
Diese Verarbeitung muss bei einem Telefongespräch mit möglichst geringer Verzögerung stattfinden. Lange Pausen wirken unnatürlich und können dazu führen, dass Anrufer erneut sprechen, weil sie nicht wissen, ob das System sie verstanden hat.
Was KI am Telefon heute sinnvoll übernehmen kann
Für Voicebots eignen sich vor allem Anliegen, die häufig auftreten und nach nachvollziehbaren Regeln bearbeitet werden können.
Ein klassischer Anwendungsfall sind Auskünfte zu Öffnungs- oder Geschäftszeiten. Ebenso lassen sich Rückrufwünsche erfassen, Ansprechpartner bestimmen oder bestimmte Informationen für einen Vorgang aufnehmen.
Auch Terminprozesse können automatisiert werden, sofern das Telefonsystem auf die erforderlichen Daten zugreifen und Änderungen sicher in das verwendete System übertragen kann.
Weitere typische Einsatzfelder sind Statusanfragen, Reservierungen, die Erfassung von Störungsmeldungen oder eine erste Kategorisierung von Serviceanliegen.
In spezialisierten Bereichen können solche Systeme noch stärker an bestehende Arbeitsabläufe angepasst werden. Ein KI Telefonassistent kann im medizinischen Umfeld beispielsweise natürliche Sprache entgegennehmen, wiederkehrende Anliegen erkennen und Fälle, die persönliche Bearbeitung benötigen, strukturiert an das Praxisteam übergeben.
Gerade dieser letzte Schritt ist wichtig. Ein Voicebot entfaltet seinen Nutzen nicht allein dadurch, dass er sprechen und zuhören kann. Entscheidend ist, was anschließend mit den erfassten Informationen geschieht.
Die eigentliche Herausforderung beginnt hinter dem Telefonat
Ein Unternehmen gewinnt wenig, wenn ein Voicebot einen Terminwunsch korrekt erkennt, dieser anschließend aber von einem Mitarbeiter manuell in eine andere Software übertragen werden muss.
Professionelle Sprachautomatisierung ist deshalb vor allem eine Frage der Prozessintegration.
Je nach Einsatzgebiet können Schnittstellen zu unterschiedlichen Systemen erforderlich sein:
CRM-Systeme verwalten Kundenbeziehungen und Kontaktdaten. Ticketsysteme steuern Servicefälle. Terminsoftware kennt freie Zeitfenster. Warenwirtschaftssysteme enthalten Informationen über Bestellungen. In anderen Branchen kommen Fachanwendungen hinzu.
Der Voicebot bildet damit idealerweise nicht einen isolierten Kommunikationskanal, sondern den sprachlichen Zugang zu vorhandenen Prozessen.
Genau hier entstehen allerdings auch neue Fehlerquellen. Erkennt das Sprachsystem das Anliegen richtig, überträgt aber falsche Informationen in das Zielsystem, ist der Prozess insgesamt trotzdem fehlerhaft. Dasselbe gilt für veraltete Schnittstellen, doppelte Datensätze oder nicht eindeutig definierte Zuständigkeiten.
Vor einer Einführung sollte deshalb nicht nur getestet werden, wie natürlich die Stimme klingt. Wichtiger ist ein Ende-zu-Ende-Test: Was passiert von der ersten Äußerung des Anrufers bis zur tatsächlichen Erledigung des Vorgangs?
Gleichzeitige Anrufe sind ein Vorteil, aber kein Qualitätsmerkmal
Menschliche Mitarbeiter können normalerweise jeweils nur ein Telefongespräch zur gleichen Zeit führen. Softwarebasierte Systeme können technisch so ausgelegt werden, dass mehrere Gesprächssitzungen parallel verarbeitet werden.
Das kann insbesondere bei stark schwankendem Anrufaufkommen hilfreich sein.
Typische Situationen sind der Beginn eines Arbeitstages, Terminspitzen, Störungen oder saisonale Ereignisse. Eine Arztpraxis kann morgens besonders viele organisatorische Anfragen erhalten. Nach einem technischen Ausfall kann der Kundendienst eines Unternehmens innerhalb kurzer Zeit mit zahlreichen identischen Fragen konfrontiert sein.
Ein automatisiertes System kann solche Lastspitzen abfangen, sofern Infrastruktur und Anwendung dafür ausgelegt sind.
Die Zahl gleichzeitig angenommener Anrufe sagt jedoch wenig über die Qualität der Bearbeitung aus.
Hundert automatisch angenommene Gespräche sind kein Fortschritt, wenn ein erheblicher Teil anschließend korrigiert werden muss. Eine sinnvollere Betrachtung richtet sich darauf, wie viele Anliegen korrekt erkannt, abgeschlossen oder so vorbereitet werden, dass die weitere Bearbeitung ohne erneute Datenerfassung möglich ist.
Für Unternehmen ist deshalb nicht die maximale Gesprächskapazität die wichtigste Kennzahl, sondern die Qualität des gesamten Prozesses.
Vorqualifizierung kann wertvoller sein als Vollautomatisierung
Beim Einsatz von KI wird Automatisierungsgrad häufig mit Erfolg gleichgesetzt. Ein Prozess erscheint demnach besonders effizient, wenn möglichst wenig menschliche Beteiligung erforderlich ist.
Für Telefonie ist diese Sichtweise zu einfach.
Ein Voicebot kann bereits dann einen erheblichen organisatorischen Nutzen haben, wenn er ein Anliegen lediglich qualifiziert und strukturiert weitergibt.
Statt dass ein Mitarbeiter zunächst Name, Telefonnummer, Kundennummer und Grund des Anrufs erfragen muss, können diese Angaben bereits vorliegen. Der Mitarbeiter steigt dann dort in den Vorgang ein, wo tatsächlich Fachwissen oder eine Entscheidung erforderlich ist.
Das ist vor allem in Bereichen relevant, in denen qualifizierte Arbeitszeit knapp ist. Ärzte, medizinische Fachangestellte, Techniker oder spezialisierte Servicemitarbeiter müssen dann weniger Zeit für immer gleiche Basisabfragen verwenden.
Ein gutes Automatisierungskonzept fragt deshalb nicht nur: „Kann die KI dieses Gespräch vollständig übernehmen?“
Die sinnvollere Frage lautet häufig: „Welchen Teil des Gesprächs kann das System zuverlässig bearbeiten, bevor menschliche Kompetenz notwendig wird?“
Sprachverständnis ist nicht gleich Sprachverständnis
Menschen kommen mit erstaunlich unvollständiger Sprache zurecht. Sie verstehen Versprecher, Ironie, abgebrochene Sätze und Informationen, die nur indirekt ausgesprochen werden.
Maschinelle Systeme haben es damit schwieriger.
Bereits die erste technische Ebene, die automatische Spracherkennung, arbeitet nicht fehlerfrei. Hintergrundgeräusche, schlechte Verbindungen, Sprechtempo, Akzente, Dialekte und seltene Fachbegriffe können die Erkennung beeinflussen.
Hinzu kommt eine zweite Fehlerquelle. Selbst wenn jedes Wort korrekt transkribiert wurde, kann die Absicht des Sprechers falsch interpretiert werden.
Der Satz „Ich wollte eigentlich meinen Termin morgen absagen, aber vielleicht kann ich doch kommen“ enthält beispielsweise keine eindeutige Handlungsanweisung. Ein Mensch würde vermutlich nachfragen. Ein gutes Dialogsystem muss ebenfalls erkennen, dass noch keine sichere Aktion ausgelöst werden sollte.
Genau deshalb sind Konfidenzwerte, Rückfragen und Abbruchregeln wichtige Bestandteile professioneller Sprachsysteme.
Ein Voicebot sollte bei Unsicherheit nicht einfach die wahrscheinlichste Aktion ausführen. Je nach Prozess ist es sicherer, eine Information bestätigen zu lassen oder an einen Menschen zu übergeben.
Fehlerfolgen sind wichtiger als reine Erkennungsquoten
Bei der Bewertung eines Voicebots genügt es nicht, allein die technische Erkennungsrate zu betrachten.
Entscheidend ist, welche Konsequenz ein Fehler hat.
Wird eine Frage nach Öffnungszeiten einmal falsch verstanden, ist das ärgerlich. Wird dagegen ein Termin versehentlich storniert, eine dringliche Anfrage falsch eingestuft oder eine vertrauliche Information dem falschen Vorgang zugeordnet, können die Auswirkungen erheblich größer sein.
Unternehmen sollten Prozesse deshalb nach ihrem Fehlerrisiko klassifizieren.
Je größer die möglichen Folgen einer Fehlinterpretation, desto wichtiger werden Bestätigungsschritte, menschliche Kontrolle oder eine vollständige Übergabe.
Dieses Prinzip ist besonders in sensiblen Bereichen relevant. Ein Sprachsystem in einer Arztpraxis kann organisatorische Informationen aufnehmen. Medizinische Diagnosen, Therapieentscheidungen oder die Einschätzung akuter Beschwerden sind dagegen völlig andere Aufgaben und dürfen nicht einfach mit administrativer Telefonautomatisierung gleichgesetzt werden.
Die Qualität eines Voicebots zeigt sich deshalb auch darin, was er ausdrücklich nicht selbst erledigt.
Ein guter Übergang zum Menschen gehört zum Systemdesign
In der Praxis wird häufig viel Aufwand in den automatisierten Gesprächsfluss investiert. Ebenso wichtig ist jedoch die Eskalation.
Anrufer benötigen einen funktionierenden Ausweg, wenn das System ihr Anliegen nicht versteht oder nicht bearbeiten darf.
Dieser Übergang sollte möglichst ohne Informationsverlust erfolgen. Es ist wenig nutzerfreundlich, wenn jemand zunächst mehrere Minuten mit einem Voicebot spricht und anschließend einem Mitarbeiter den gesamten Sachverhalt erneut schildern muss.
Idealerweise erhält der Mitarbeiter die bereits erfassten Informationen zusammen mit dem Kontext des Anliegens.
Dabei muss nicht zwangsläufig das gesamte Gespräch gespeichert oder weitergegeben werden. Welche Daten dafür erforderlich und zulässig sind, hängt vom jeweiligen Prozess und den datenschutzrechtlichen Rahmenbedingungen ab.
Auch organisatorisch muss geklärt werden, wohin eskalierte Fälle gelangen. Eine Übergabe funktioniert nur dann, wenn anschließend tatsächlich ein zuständiger Mitarbeiter oder ein definierter Folgeprozess existiert.
Datenschutz muss Teil der Architektur sein
Voicebots verarbeiten zwangsläufig Informationen, sobald Menschen mit ihnen sprechen. Ob und in welchem Umfang personenbezogene Daten betroffen sind, hängt vom konkreten Einsatz ab.
Bei einem Terminwunsch können bereits Name und Telefonnummer verarbeitet werden. Im Kundenservice kommen möglicherweise Vertrags-, Bestell- oder Kontodaten hinzu. Im medizinischen Umfeld können Gesundheitsinformationen betroffen sein.
Gesundheitsdaten gehören nach der Datenschutz-Grundverordnung zu den besonders geschützten Kategorien personenbezogener Daten. Ihre Verarbeitung unterliegt zusätzlichen Anforderungen.
Für Unternehmen reicht es deshalb nicht, lediglich zu klären, ob ein Anbieter allgemein „DSGVO-konform“ arbeitet.
Relevant sind unter anderem die konkrete Rechtsgrundlage der Datenverarbeitung, die beteiligten Dienstleister, Speicherorte, Löschfristen, Zugriffsrechte und technische Schutzmaßnahmen. Auch muss geprüft werden, welche Daten für einen Prozess tatsächlich benötigt werden.
Das Prinzip der Datenminimierung ist hier besonders praktisch. Ein Voicebot sollte nicht vorsorglich möglichst viele Informationen erfragen, sondern nur diejenigen, die für den vorgesehenen Vorgang erforderlich sind.
Hinzu kommen Fragen zur Protokollierung. Zwischen einer technischen Transkription für die unmittelbare Verarbeitung, einem dauerhaft gespeicherten Gesprächsprotokoll und einer Audioaufzeichnung bestehen erhebliche Unterschiede.
Diese Entscheidungen sollten bereits bei der Konzeption getroffen werden und nicht erst dann, wenn das System produktiv eingesetzt wird.
Seit August 2026 gelten zusätzliche Transparenzanforderungen für KI
Neben dem Datenschutz ist inzwischen auch der europäische AI Act für die Gestaltung solcher Systeme relevant.
Seit dem 2. August 2026 gelten unter anderem Transparenzpflichten für bestimmte KI-Systeme, die direkt mit natürlichen Personen interagieren. Grundsätzlich muss für die betroffene Person erkennbar sein, dass sie mit einem KI-System interagiert, sofern dies aufgrund der Umstände und des Nutzungskontexts nicht ohnehin offensichtlich ist. Für einzelne Anwendungsfälle gelten gesetzliche Besonderheiten und Ausnahmen.
Für Voicebots bedeutet das in der Praxis: Die Gestaltung eines automatisierten Telefongesprächs sollte nicht darauf abzielen, einen menschlichen Gesprächspartner vorzutäuschen.
Transparenz ist dabei nicht nur eine regulatorische Frage. Sie beeinflusst auch die Erwartungen des Anrufers. Wer weiß, dass er mit einem automatisierten System spricht, kann sein Anliegen anders formulieren und erwartet nicht dieselben sozialen Fähigkeiten wie bei einem Menschen.
Gerade eine besonders natürlich klingende synthetische Stimme macht diese Klarheit wichtiger und nicht weniger wichtig.
Für welche Prozesse eignet sich ein Voicebot?
Die wichtigste Entscheidung fällt eigentlich vor der Auswahl einer Technologie.
Unternehmen sollten zunächst ihre eingehenden Telefonate untersuchen.
Welche Anliegen treten häufig auf? Welche davon folgen klaren Regeln? Welche Daten werden regelmäßig abgefragt? Wo entstehen Warteschlangen? Welche Gespräche benötigen zwingend einen fachkundigen Mitarbeiter?
Ein geeigneter Prozess zeichnet sich häufig durch drei Eigenschaften aus: Er kommt oft vor, die notwendigen Informationen sind klar definierbar und der zulässige Ablauf lässt sich eindeutig beschreiben.
Schlechter geeignet sind Prozesse mit vielen Ausnahmen, hohem Interpretationsbedarf oder schwer vorhersehbaren Konsequenzen.
Ein interessanter Kandidat könnte beispielsweise die Aufnahme eines Rückrufwunsches sein. Der Ablauf ist überschaubar: Identität beziehungsweise Kontaktdaten erfassen, Anliegen einordnen und die Information zuständig weitergeben.
Eine eskalierende Beschwerde ist dagegen deutlich schwieriger zu standardisieren. Hier können Empathie, Kulanzentscheidungen, rechtliche Fragen und individuelle Vorgeschichten gleichzeitig eine Rolle spielen.
Fünf Fragen vor der Einführung
Vor einem produktiven Einsatz sollten Verantwortliche mindestens fünf Punkte beantworten können.
Was soll tatsächlich automatisiert werden?
„Telefonie automatisieren“ ist kein ausreichend definierter Prozess. Benötigt werden konkrete Anwendungsfälle.
Was passiert bei Unsicherheit?
Das System braucht Regeln für unklare Äußerungen, fehlende Informationen und technische Fehler.
Welche Systeme müssen angebunden werden?
Ohne funktionierende Schnittstellen endet Automatisierung häufig dort, wo die eigentliche Arbeit beginnt.
Welche Daten werden benötigt?
Erhebung, Speicherung, Zugriff und Löschung sollten für jeden Prozess nachvollziehbar geregelt sein.
Wann übernimmt ein Mensch?
Die Eskalation darf keine Ausnahme sein, die nachträglich improvisiert wird. Sie gehört zum ursprünglichen Prozessdesign.
Gute Sprachautomatisierung erkennt auch ihre Grenzen
Voicebots haben sich von starren Telefonmenüs deutlich weiterentwickelt. Moderne Spracherkennung, Sprachverarbeitung und Sprachsynthese ermöglichen Dialoge, bei denen Menschen ihr Anliegen wesentlich freier formulieren können als früher.
Das eröffnet sinnvolle Möglichkeiten. Wiederkehrende Fragen lassen sich beantworten, Informationen strukturiert erfassen, Anrufe vorsortieren und standardisierte Abläufe anstoßen. Bei hohem Anrufaufkommen können entsprechende Systeme außerdem helfen, Kapazitätsengpässe abzufedern.
Die Technologie beseitigt jedoch nicht die Komplexität des zugrunde liegenden Prozesses.
Ein falsch verstandenes Anliegen bleibt falsch verstanden, auch wenn die Stimme des Systems vollkommen natürlich klingt. Eine fehlende Schnittstelle bleibt ein Medienbruch. Und ein Gespräch, das menschliches Urteilsvermögen, Empathie oder fachliche Verantwortung benötigt, wird durch zusätzliche Automatisierung nicht automatisch besser.
Der entscheidende Qualitätsmaßstab ist deshalb nicht, wie menschlich ein Voicebot klingt oder wie viele Anrufe er gleichzeitig entgegennimmt. Wichtiger ist, ob er klar definierte Aufgaben verlässlich erledigt, Unsicherheit erkennt und komplexe Fälle mit den notwendigen Informationen an einen Menschen übergibt.
Gerade darin liegt der praktische Fortschritt gegenüber der klassischen Warteschleife: Nicht jedes Gespräch muss automatisiert werden. Aber nicht jedes Gespräch muss vollständig bei einem Menschen beginnen.
