Googles AMIE-Studie erschien am 8. Oktober 2026 im Hauptjournal von The Lancet – eine Premiere für Google in dieser Zeitschrift. AMIE ist Googles dialogisches Diagnose-Forschungssystem, und diesmal legte es keine simulierte Prüfung ab: In der Ambulanz für Primärversorgung des Beth Israel Deaconess Medical Center führte es vor echten Terminen die Anamnese bei echten Patienten.
So lief die Studie
98 Patienten chatteten vor ihren dringenden Terminen mit AMIE, während Aufsichtsärzte jede Interaktion in Echtzeit überwachten – mit vorab festgelegten Kriterien, ein Gespräch sofort zu stoppen. Kein einziges Gespräch musste unterbrochen werden. AMIEs Differenzialdiagnoselisten enthielten, geprüft an der späteren Aktenlage, in 90 Prozent der Fälle die endgültige Diagnose der Patienten; auf die ersten drei Einträge verengt lag die Trefferquote noch bei 75 Prozent. Für die behandelnden Ärzte waren die Zusammenfassungen mehr als Dekoration: Sie berichteten, AMIE habe sie in 75 Prozent der Fälle bei der Vorbereitung geholfen und in mehr als der Hälfte ihren Behandlungsansatz beeinflusst.
Die Schwächen stehen ebenfalls im Papier
Die Studie stellt AMIE nicht als Arztersatz dar. In der verblindeten Bewertung unterlagen seine Managementpläne denen der Hausärzte bei Praktikabilität und Kosteneffizienz: Plausible Krankheiten aufzulisten ist der leichtere Teil; erschwingliche, umsetzbare nächste Schritte für einen konkreten Patienten zu ordnen ist schwerer. Auch die Grenzen der Studie sind offen benannt – ein einziges Zentrum, nur Text, rund hundert Patienten, keine Kontrollgruppe. Google selbst betont, dass größere klinische Studien nötig sind, bevor sich patientenzugewandte KI im großen Maßstab beurteilen lässt.
Warum dieser Schritt herausragt
Die meisten Zeugnisse medizinischer KI der letzten Jahre stammen aus Fragenkatalogen und simulierten Gesprächen. So hoch diese Werte auch sind, auf Fragen der echten Ambulanz geben sie keine Antwort: Patienten beschreiben Symptome vage, widersprechen sich, und für jede Empfehlung haftet ein namentlich bekannter Arzt. Der Wert dieser Arbeit liegt nicht in den 90 Prozent selbst, sondern darin, dass Aufsicht, Abbruchkriterien und echtes ärztliches Feedback gemeinsam in einer prospektiven Studie eines Spitzenjournals veröffentlicht wurden. Für Klinikentscheider kommt damit eine scharfe Frage zu jeder Medizin-KI-Präsentation hinzu: Wurde dieses System in einem echten Arbeitsablauf getestet, mit einem Menschen, der jederzeit den Stecker ziehen konnte? Ohne diesen Schritt bleibt ein schöner Benchmark-Wert ein reines Laborergebnis.