Voice Agents

Was kostet ein KI-Telefonassistent? Kostenbestandteile im Überblick

Die Kosten eines KI-Telefonassistenten setzen sich aus Telefonie, Sprachmodell, Entwicklung und Betrieb zusammen. Ein Blick auf die einzelnen Posten zeigt, worauf es bei einem Angebot ankommt.

Kosten-Überblick

Warum die Kostenfrage schwer pauschal zu beantworten ist

Wer nach dem Preis für einen KI-Telefonassistenten sucht, stößt schnell auf sehr unterschiedliche Zahlen: Manche Anbieter nennen Minutenpreise im Cent-Bereich, andere sprechen von Projekten im fünfstelligen Bereich. Beide Angaben können zutreffen, weil sie unterschiedliche Dinge beschreiben – reine Infrastrukturkosten auf der einen Seite, ein vollständig entwickeltes und betriebenes System auf der anderen.

Sinnvoller als eine pauschale Zahl ist deshalb ein Blick auf die einzelnen Kostenbestandteile. Wer diese kennt, kann ein Angebot besser einordnen und erkennt, welche Posten in einem konkreten Fall tatsächlich anfallen.

Hinzu kommt, dass sich Preise für Sprachmodelle und Telefonie-Infrastruktur regelmäßig ändern, meist nach unten. Ein Angebot, das heute kalkuliert wird, kann in einem Jahr günstiger umsetzbar sein, weil sich die zugrunde liegenden Tarife der Infrastruktur-Anbieter verändert haben. Das spricht dafür, Verträge nicht zu lange festzuschreiben und die Kostenstruktur regelmäßig zu überprüfen, statt sich einmalig auf eine Zahl zu verlassen.

Die Kostenbestandteile im Einzelnen

Ein KI-Telefonassistent besteht technisch aus mehreren Schichten, die jeweils eigene Kosten verursachen. Die Telefonie-Infrastruktur stellt die Rufnummer bereit und verbindet den Anruf; das Sprachmodell versteht die gesprochene Sprache und formuliert Antworten; dazu kommen die Anbindung an bestehende Systeme sowie der laufende Betrieb.

  • Telefonie und Rufnummern: Grundgebühr für die Nummer plus Minutenpreis für eingehende und ausgehende Gespräche
  • Sprachmodell pro Minute: Kosten für Spracherkennung, Sprachausgabe und das zugrunde liegende KI-Modell, meist nach Gesprächsminuten abgerechnet
  • Entwicklung und Konfiguration: Gesprächsführung, Anbindung an die Datenbasis der Praxis oder des Unternehmens, Formulierung der Notfall- und Eskalationsregeln
  • Anbindung an Kalender oder CRM: Schnittstellen zur bestehenden Termin- oder Kundenverwaltung, damit der Assistent mit aktuellen Daten arbeitet
  • Betrieb: Überwachung, Fehlerbehebung, Anpassung der Inhalte, wenn sich Öffnungszeiten, Preise oder Angebote ändern
  • Tests: Prüfung verschiedener Gesprächsverläufe und Dialekte vor dem Live-Betrieb sowie stichprobenhaft danach

Übliche Abrechnungsmodelle

Anbieter von Telefonie- und Sprachmodell-Infrastruktur rechnen in aller Regel nutzungsabhängig ab, meist pro Gesprächsminute. Twilio etwa berechnet für eingehende Ortsgespräche in Deutschland 0,01 US-Dollar pro Minute zuzüglich einer monatlichen Grundgebühr von 1,35 US-Dollar für die Rufnummer; für eingehende Mobilfunkgespräche liegt die monatliche Grundgebühr der Nummer bei 30 US-Dollar.

Für das Sprachmodell selbst gibt es ebenfalls nutzungsabhängige Modelle. ElevenLabs bietet für seine Conversational-AI-Minuten gestaffelte Pakete mit enthaltenen Freiminuten und berechnet darüber hinausgehende Minuten mit rund 0,08 US-Dollar. Wird stattdessen ein Modell wie OpenAIs Realtime API direkt eingebunden, erfolgt die Abrechnung nicht nach Minuten, sondern nach verarbeiteten Audio-Token – daraus lässt sich ein Minutenpreis näherungsweise berechnen, wie das folgende Beispiel zeigt.

Für die Entwicklung und Konfiguration selbst ist dagegen meist ein Festpreis oder ein Stundensatz üblich, da dieser Teil einmalig anfällt und sich nicht direkt an der Anrufmenge bemisst. Der laufende Betrieb wird häufig als monatliche Pauschale oder als Teil eines Wartungsvertrags abgerechnet.

Welches Modell im Einzelfall passt, hängt auch von der Planungssicherheit ab, die ein Unternehmen braucht. Eine reine Minutenabrechnung ist bei schwankendem Anrufvolumen fair, macht die monatlichen Kosten aber schwerer vorhersehbar. Eine Pauschale mit enthaltenem Kontingent erleichtert die Budgetplanung, kann sich bei sehr geringer oder sehr hoher Nutzung aber ungünstig auswirken. Es lohnt sich, beide Varianten anhand der eigenen, tatsächlichen Anrufzahlen durchzurechnen, statt sich auf die Einschätzung eines einzelnen Anbieters zu verlassen.

Ein Rechenbeispiel auf Basis öffentlicher Preislisten

Um eine Größenordnung für die reinen Infrastrukturkosten zu bekommen, lässt sich ein Beispiel mit den öffentlich genannten Tarifen von Twilio und OpenAI durchrechnen. Für die Telefonie fallen bei einem eingehenden Ortsgespräch 0,01 US-Dollar pro Minute an. Für das Sprachmodell nennt OpenAI für sein gpt-realtime-Modell 32 US-Dollar pro Million Audio-Input-Token und 64 US-Dollar pro Million Audio-Output-Token; legt man die verbreitete Faustregel zugrunde, dass ein Token im Eingabe-Audio etwa 100 Millisekunden und im Ausgabe-Audio etwa 50 Millisekunden entspricht (eine Schätzung, keine Herstellerangabe), ergeben sich daraus rechnerisch etwa 0,0192 US-Dollar pro Minute für die Spracheingabe und etwa 0,0768 US-Dollar pro Minute für die Sprachausgabe des Assistenten.

Addiert man Telefonie und Sprachmodell für eine Minute, in der überwiegend der Assistent spricht, kommt man auf einen Betrag im niedrigen zweistelligen Cent-Bereich pro Gesprächsminute – deutlich unter dem, was viele bei dem Begriff „KI-Telefonassistent“ erwarten. Diese Rechnung bildet aber nur die technische Infrastruktur ab, nicht die Entwicklung, die Anbindung an die eigenen Systeme oder den laufenden Betrieb.

Die reine Gesprächsminute kostet oft nur Cent-Beträge – die eigentlichen Kosten entstehen bei Entwicklung, Anbindung und Pflege des Systems.

Worauf Sie in einem Angebot achten sollten

Ein seriöses Angebot für einen KI-Telefonassistenten trennt die Kostenarten klar und benennt, was einmalig und was laufend anfällt. Fehlt diese Trennung, lohnt es sich nachzufragen, bevor ein Vertrag unterschrieben wird.

  • Sind Entwicklungskosten (einmalig) und Betriebskosten (laufend) getrennt ausgewiesen?
  • Ist der Minutenpreis für Telefonie und für das Sprachmodell jeweils einzeln genannt oder nur als Pauschale verschleiert?
  • Was passiert bei Mindestnutzung oder Nichtnutzung – fallen Grundgebühren auch bei wenigen Anrufen an?
  • Wer trägt die Kosten für Anpassungen, etwa bei neuen Öffnungszeiten oder Produkten?
  • Welche Partei schließt mit welchem Infrastruktur-Anbieter den Vertrag, und wer ist datenschutzrechtlich Auftragsverarbeiter?
  • Gibt es eine Testphase oder eine Kündigungsmöglichkeit, falls das System die Erwartungen nicht erfüllt?

Die Nutzenseite: verpasste Anrufe und gebundene Zeit

Kosten lassen sich nur sinnvoll einordnen, wenn man sie der Nutzenseite gegenüberstellt. Ein wichtiger Faktor ist die Zahl der Anrufe, die heute unbeantwortet bleiben, weil das Team gerade mit anderen Aufgaben beschäftigt ist. Wie viele Anrufe das in Ihrem Betrieb sind, lässt sich nur durch Zählen herausfinden: eine Woche lang verpasste Anrufe, Rückrufe und Unterbrechungen notieren, dann auf den Monat hochrechnen.

Solche Angaben stammen vom Anbieter selbst und sollten als Orientierung, nicht als Garantie verstanden werden. Für die eigene Kalkulation lohnt sich stattdessen ein Blick auf die tatsächliche Anrufstatistik: Wie viele Anrufe gehen täglich ein, wie viele davon betreffen wiederkehrende, automatisierbare Anliegen, und wie viel Arbeitszeit bindet das Telefon aktuell am Empfang oder in der Verwaltung?

Beispiel: Dr.Kalla Cosmetics

Für Dr.Kalla Cosmetics in Berlin ist seit dem 13. Juni 2026 ein deutschsprachiger KI-Telefonassistent live. Er beantwortet Fragen zu Produkten, Preisen und Verfügbarkeit aus dem Shop-Katalog, nennt Öffnungszeiten und Adresse und schickt nach Zustimmung der anrufenden Person einen passenden Produktlink per SMS. Eine ausführlichere Beschreibung findet sich in der Case Study unter /case-studies/telefon-assistent/.

Dieses Beispiel zeigt eine andere Ausrichtung als der reine Terminassistent einer Arztpraxis: Hier steht die Produktauskunft im Vordergrund, verbunden mit einer einfachen Zusatzfunktion. Die Kostenstruktur folgt aber demselben Muster aus Telefonie, Sprachmodell, Anbindung an den Produktkatalog und laufender Pflege.

Die MindrAils-Einordnung

Ein KI-Telefonassistent lohnt sich finanziell vor allem dann, wenn heute regelmäßig Anrufe unbeantwortet bleiben oder Mitarbeitende durch Telefonate von anderen Aufgaben abgehalten werden. In diesen Fällen stehen den laufenden, meist überschaubaren Infrastrukturkosten ein konkreter Zeitgewinn oder zusätzlich erreichte Kundschaft gegenüber.

Wenig sinnvoll ist die Investition, wenn das Anrufvolumen gering ist oder die Anliegen überwiegend individuell und beratungsintensiv sind – dann lohnt sich der Entwicklungs- und Pflegeaufwand selten. Vor einer Entscheidung empfiehlt sich deshalb, zunächst die eigene Anrufstruktur ehrlich zu analysieren, statt sich allein an Minutenpreisen aus Preislisten zu orientieren.

Leistung: KI-Telefonassistent Kostenloses Analysegespräch vereinbaren
Transparent belegt

Quellen und weiterführende Informationen

Die Quellen wurden zu den jeweils angegebenen Zeitpunkten abgerufen. Externe Inhalte können sich danach ändern.

  1. Programmable Voice Pricing in GermanyTwilio · abgerufen am
    Quelle öffnen
  2. API Pricing – Realtime models (gpt-realtime)OpenAI · abgerufen am
    Quelle öffnen
  3. ElevenLabs API PricingElevenLabs · abgerufen am
    Quelle öffnen
Redaktioneller Hinweis

Dieser Beitrag wurde von Hassieb Kalla (MindrAils) quellenbasiert eingeordnet. Er dient der allgemeinen Information und ersetzt keine Rechts-, Datenschutz- oder Fachberatung für einen konkreten Einzelfall.

Zurück zu allen Insights
Vom Wissen zur Anwendung

Wo kann KI in Ihrem Unternehmen konkret entlasten?

In der kostenlosen Business-Analyse betrachten wir Ihre Abläufe, Engpässe und realistischen Automatisierungspotenziale.