Jahrelang hatte KI-Erkennungssoftware ein Glaubwürdigkeitsproblem. Frühe Werkzeuge basierten auf einfachen statistischen Maßen – Perplexity und Burstiness – und markierten menschlich geschriebene Texte häufig fälschlicherweise als maschinell erzeugt, was Wissenschaftler und Verlage gleichermaßen frustrierte. Jetzt schreibt eine neue Generation von Erkennungssoftware die Regeln neu.
Pangram Labs, ein New Yorker Startup, gegründet von den Stanford-Absolventen Max Spero und Bradley Emi, hat ein Tool entwickelt, das bei englischsprachigen Texten eine Genauigkeit von 99,98 % behauptet. Anstatt sprachliche Merkmale zu zählen, trainiert Pangram ein maschinelles Lernmodell auf Millionen von menschlich geschriebenen Texten und deren KI-generierten Spiegeln und lernt, die beiden auf einer Ebene zu unterscheiden, die menschlich lesbare Beschreibungen sprengt. Ein unabhängiger Test von Epoch AI ergab null Falsch-positiv-Ergebnisse bei 495 menschlich geschriebenen Texten. Das Tool verändert bereits die akademische Verlagslandschaft. NeurIPS lehnte 18 % seiner Einreichungen nach einer Prüfung mit Pangram ab. Der Preprint-Server arXiv zeigt nun Pangram-Bewertungen über eine Spiegelwebsite namens alphaXiv. Die University of Chicago hat begonnen, das Tool zur Überprüfung von studentischen Arbeiten einzusetzen. Und in einem denkwürdigen Fall gab ein Peer-Reviewer – konfrontiert mit dem AACR-Journal-Operationsdirektor Daniel Evanko – zu, ein LLM verwendet zu haben, nach ihm die Zeit ausgegangen war, und antwortete: Wow, ihr seid gut!
Der Konkurrent GPTZero, ebenfalls in New York ansässig, verfolgt einen ähnlichen Ansatz und berichtet von 99 % Genauigkeit. Fünf Informatikkonferenzen und drei Universitäten haben sich bisher angemeldet.
Aber die größte Herausforderung liegt noch vor den Werkzeugen. Wenn KI-unterstütztes Schreiben zur Norm wird – ein Mensch entwirft, eine KI poliert, oder umgekehrt – wird Erkennung zu einem Spektrum, nicht zu einer binären Entscheidung. Pangrams neuestes Modell, Pangram 4, das im Juli 2026 erschien, unterteilt Text in feinere Abschnitte ab 30 bis 40 Wörtern und versucht, Segmente als menschlich, KI oder gemischt einzuordnen. Es meldet eine Falsch-negativ-Rate von nur 0,34 %.
Trotzdem bleibt der Graubereich dornig. Als Nature einen Blog-Post der Scholarly Kitchen durch Pangram laufen ließ, markierte das Tool ihn zunächst als 100 % KI. Der Autor bestand darauf, dass die Ideen und der Entwurf völlig menschlich erstellt waren und KI nur zum Polieren diente – eine Praxis, die die meisten als akzeptabel betrachten. Nach der Veröffentlichung von Pangram 4 sank die Bewertung auf 96 % KI, aber die Spannung bleibt.
Es gibt noch viel Raum für Verbesserungen bei der Beurteilung realer Fälle, in denen KI- und menschliches Schreiben homogen verschmelzen, gibt Spero zu. Kleine Änderungen können Bewertungen drastisch verschieben – ein als Jitter bekanntes Problem. Und wenn KI von Verbrauchern verwendet wird, um menschlich verfasste Aufsätze erheblich zu verändern, stuft Pangram immer noch 41 % der Ergebnisse als vollständig menschlich ein.
Die Einsätze steigen. Spero hat persönlich Journalisten gerügt und sogar die sozialen Medien des Papstes als KI-geschrieben markiert. Substack integrierte Pangram im Juli in seine gesamte Plattform und ermöglicht es Lesern zu sehen, ob Beiträge als KI-generiert eingestuft werden. Wenn es tabu ist, darauf hinzuweisen, dass jemand KI zum Schreiben benutzt, dann denke ich, dass wir viel mehr Leute sehen werden, die ihre Arbeit scheuen, sagt Spero.
Unabhängige Forscher mahnen zur Vorsicht. Tim Requarth von NYU Langone sagt, die Werkzeuge seien gut darin, Stellen auszusortieren, die Schrott produzieren, aber ihre Prozentwerte für KI-unterstützten Text sollten nicht zu wörtlich genommen werden. Die Priorität sollte beiden Firmen zufolge darin bestehen, vollständig KI-generierte Inhalte zu erkennen – den klarsten Fall von Fehlverhalten – anstatt das Kontinuum menschlich-KI-Zusammenarbeit zu überwachen.
Der Erkennungswettlauf ist noch lange nicht vorbei. Sowohl Pangram als auch GPTZero veröffentlichen jedes Jahr Dutzende Modell-Updates, wenn neue LLMs erscheinen. Drittanbieter-Bewertungen werden immer hinter den neuesten Erkennern hinterherhinken. Vorerst funktionieren die Werkzeuge am besten als Ausgangspunkt für Untersuchungen, nicht als endgültiges Urteil.




