Textbasierte Chatbots erlebten ihren Durchbruch Ende 2022 mit ChatGPT. Sprache dagegen ist überall und nirgends: Sie steckt in Telefonen, Autos und Call-Centern, doch kein einzelnes Produkt hat das Gespräch mit Software unvermeidlich wirken lassen. Das ist die Einschätzung mehrerer Branchenmanager gegenüber TechCrunch — Sprach-KI hat ihren entsprechenden Moment noch nicht gefunden.
Die Lücke liegt nicht in der Modellqualität. Moderne Spracherkennung, Sprachsynthese und Dialogmodelle sind für sich genommen für viele Aufgaben gut genug. Das Problem ist strukturell. Eine Sprachinteraktion ist eine Kette — Spracherkennung, Sprachmodell, Sprachausgabe — und jedes Glied kostet Zeit. Sobald die gesamte Runde etwa eine Sekunde überschreitet, fühlt sich ein Gespräch nicht mehr wie ein Gespräch an, sondern wie Funkverkehr.
Über der Latenz liegen zwei schwierigere Probleme. Das erste ist der Gesprächswechsel: zu erkennen, wann jemand wirklich fertig gesprochen hat, und Unterbrechungen zu meistern, ohne dazwischenzureden. Das zweite ist die Fehlerbehebung. Ein Sprachagent, der in fünf Prozent der Fälle scheitert, ist im Chatfenster nur lästig; am Telefon kann er einen Anrufer ohne offensichtlichen Ausweg zurücklassen.
Wo Sprache heute funktioniert, sind es enge, aber volumenstarke Felder: Triage im Call-Center, Bestellannahme, klinische Dokumentation und Assistenten im Auto. Diese Einsätze gelingen, weil der Wortschatz begrenzt ist, der Fehlerpfad meist bei einem Menschen endet und der Nutzen — eingesparte Minuten pro Anruf — leicht messbar ist.
Der Durchbruch, so die Manager, kommt aus Zuverlässigkeit und Kosten, nicht aus einer weiteren polierten Demo. Latenz unter einer Sekunde, verlässliche Unterbrechungsbehandlung, sinnvolle Übergabe an einen Menschen und eine Preisgestaltung pro Minute, die sich skalieren lässt, machen aus einem Laborergebnis Infrastruktur. Bis dahin bleibt Sprache ein Feature, das an Produkte geschraubt wird, statt eine Plattform eigenen Rechts.




