Googles medizinische KI AMIE hat einen Meilenstein erreicht, den Schlagzeilen auf eine einzige Zahl zusammengeschmolzen haben. In einer prospektiven Studie am Beth Israel Deaconess Medical Center (BIDMC), veröffentlicht in The Lancet, befragte das dialogbasierte Diagnosesystem 100 echte Patienten — unter ärztlicher Aufsicht — und seine Vorschläge wurden mit der Diagnose verglichen, die die Patienten letztlich erhielten.

Genau an diesem Vergleich wird die Berichterstattung unscharf. AMIE nannte die spätere Diagnose in 90 % der Fälle unter ihren sieben wahrscheinlichsten Möglichkeiten, in 75 % unter den ersten drei und in 56 % der 98 auswertbaren Fälle als erste Wahl. Die "90 % Diagnosegenauigkeit" sind also der Top-7-Wert, keine Trefferquote für die führende Antwort der KI. Kliniker, die die Studie geprüft haben, benennen die Lücke deutlich: Ein Assistent, der die Gegend grob richtig trifft, ist nützlich — aber nicht dasselbe wie einer, der die Antwort beim ersten Versuch richtig hat.

Der Unterschied zählt, weil dies die erste prospektive Bewertung von AMIE in einer echten Klinik statt in einer Simulation oder einem retrospektiven Benchmark ist — die bislang gewichtigste Evidenz dazu, ob eine arztseitige KI im Alltagsbetrieb helfen kann. AMIEs Rolle war hier die Vorbereitung: Anamnese erheben und eine Differenzialdiagnose erzeugen, bevor der Kliniker den Patienten sah — genau die Art risikoarmer, wirkungsvoller Aufgabe, die Kliniken zuerst erproben.

Google Research formulierte die Schlussfolgerungen vorsichtig. Die Studie lege nahe, dass AMIE "das diagnostische Denken und die Genauigkeit von Klinikern in schwierigen Fällen verbessern könnte und weitere reale Evaluation verdient" — eine Aussage über Unterstützung, nicht Ersatz. Die Einschränkungen sind erheblich: ein Standort, hundert Patienten, durchgehende ärztliche Aufsicht und eine Momentaufnahme statt eines ausgerollten klinischen Workflows.

Der weitere Kontext ist ein dichtes Rennen darum, KI vor Kliniker zu bringen. Googles eigene frühere Arbeiten zeigten AMIE in Live-Videokonsultationen, die in simulierten Umgebungen mit Ärzten mithielten; dieselben Firmen veröffentlichen heute routinemäßig Studien, die Benchmark-Ergebnisse mit realen Pilotprojekten mischen. Für Kliniken, die eine Einführung abwägen, lautet die praktische Frage dieser Lancet-Arbeit nicht, ob ein Modell die richtige Krankheit in einer Liste nennen kann, sondern ob es verändert, was ein Arzt tut, weniger übersieht und keinen Schaden anrichtet — Fragen, die nur Evidenz aus dem Einsatzmaßstab beantworten kann.