Die TechCrunch-Reporterin Dominic-Madori Davis beschreibt, wie Synthesia ihr nach einem kurzen Studiobesuch mit Fotos und einer zweiminütigen Sprachaufnahme ein interaktives Avatar erstellt hat. Sie sagt, das Avatar sei kein generischer Chatbot gewesen, sondern ein deterministisches System, das nur mit einem einzigen Artikel über Betrug bei venture-finanzierten Startups trainiert wurde, weshalb es Fragen stets wieder auf diesen Bericht zurücklenkte.
Davis schreibt, das persönliche Avatar klang ziemlich nah an ihrer echten Stimme, während die interaktive Version etwas weniger genau wirkte, aber dennoch unheimlich genug, um bei Freunden und der Familie Reaktionen auszulösen. Die eigentliche Frage sei Vertrauen: Selbst wenn die Technik besser wird, hänge Journalismus von menschlicher Verantwortung ab, die ein KI-Klon nicht vollständig ersetzen könne.
Der Artikel zeigt auch, wie weit Unternehmens-Avatar-Tools über einfaches Synthese-Video hinausgegangen sind. Synthesia kombiniert nun Spracherkennung, agentische Sprachmodelle, Text-to-Speech und Echtzeit-Videogeneration in Produkten für Training, Rollenspiel und Unternehmens-APIs. Für Leser liegt die Bedeutung weniger in einem einzelnen Gerät als darin, wie digitale Zwillinge in Arbeit, Medien und Kundenschnittstellen auftauchen könnten.
Davis schließt mit einer Warnung: nondeterministische Versionen dieser Avatare könnten deutlich manipulativer wirken, und sie vermutet, dass viele Menschen selbst dann skeptisch bleiben würden, wenn Unternehmen KI-Klone zu Standardwerkzeugen machen.


