KI in der Medizin · Diagnose
KI-Diagnose — was Diagnose-Apps und klinische KI können und wo ihre Grenzen liegen
Kurz gesagt: Eine KI-Diagnose durch eine App ist kein Arztersatz. Symptom-Checker, Diagnose-Apps und Chatbots liefern eine grobe Orientierung, keine ärztliche Diagnose. Studien zeigen bei Consumer-Tools eher niedrige Trefferraten und eine bei der Dringlichkeit etwas höhere, aber schwankende Triage-Quote. Im Zweifel gehen Sie immer zum Arzt. Bei Warnzeichen wie akuter Atemnot oder Brustschmerz zählt der Notruf, nicht die App. Klinische KI, die Ärzte nutzen, ist eine andere Ebene: Dort entscheidet der Arzt.
Wichtiger Hinweis: Dieser Beitrag ordnet Technik, Studienlage und Recht ein, ist aber kein medizinischer Rat, keine Diagnose und keine Handlungsanleitung für Beschwerden. Genannte Zahlen stammen aus einzelnen Studien und gelten für deren Setting, nicht für Ihren Einzelfall. Ob eine Beschwerde harmlos oder ernst ist, klärt allein ein Arzt.
Was KI-Diagnose bedeutet
Wenn Sie selbst Beschwerden haben oder sich um einen Angehörigen sorgen, begegnet Ihnen der Begriff KI-Diagnose für zwei sehr verschiedene Dinge. Einmal Software, die Ärzten bei der Auswertung von Befunden hilft, und einmal Apps, in die Laien ihre Symptome eintippen. Bei einem solchen Symptom-Checker geben Sie Beschwerden ein, ein Algorithmus nennt Verdachtsdiagnosen und einen Dringlichkeitshinweis, und das beschreibt schon die Semigran-Studie (BMJ 2015) als Grundprinzip.
Eine App stellt keine Diagnose, sie liefert eine Selbsteinschätzung. Die eigentliche Diagnose bleibt eine ärztliche Aufgabe, weil sie Untersuchung, Verlauf und Verantwortung verbindet, und eine App ersetzt keinen dieser Teile.
Eine „Diagnose aus der Hosentasche“ versprechen wir Ihnen nicht. Wir zeigen, was Studien wirklich belegen und wo die Grenzen liegen. Wie sich das Feld in die restliche Medizin einordnet, zeigt der Überblick zu KI in der Medizin.
Klinische KI und Diagnose-Apps unterscheiden

Der häufigste Denkfehler ist, beide Ebenen in einen Topf zu werfen. Auf der einen Seite steht klinische Entscheidungsunterstützung, kurz CDSS, also Software, die ein approbierter Arzt nutzt und deren Vorschläge er prüft. Auf der anderen Seite steht der Consumer-Symptom-Checker, den ein Laie allein bedient. Was KI jenseits der Diagnose in der Praxisorganisation übernimmt, vom Telefon bis zur Dokumentation, beschreibt der Beitrag zu KI in der Arztpraxis.
Diese Trennung ist nicht akademisch, sie entscheidet über Recht und Verantwortung, denn Software mit medizinischer Zweckbestimmung gilt als Medizinprodukt nach der MDR 2017/745. Diagnose-Software liegt dabei meist ab Klasse IIa aufwärts, je nach Entscheidungsrelevanz (MDR, Regel 11). Ein bewusst als „Wellness“ oder „Info“ positioniertes Tool umgeht diese Einstufung teils ganz.
Studienbefunde darf man deshalb nie zwischen den Ebenen verschieben. Ein Wert zu Laien-Apps sagt nichts über ärztliche CDSS und umgekehrt.
| Kriterium | Klinische KI (CDSS) | Consumer-App (Symptom-Checker) |
|---|---|---|
| Wer bedient | approbierter Arzt | Laie / Patient selbst |
| Zweck | Entscheidungsunterstützung | Selbsteinschätzung, Orientierung |
| Ergebnis | Vorschlag für den Arzt | Verdacht + Dringlichkeitshinweis |
| Recht | meist Medizinprodukt, CE/MDR | teils niedrige Klasse, teils „Info“ |
| Verantwortung | beim Arzt | beim Nutzer, auf eigenes Risiko |
Wie zuverlässig Symptom-Checker sind
Zur Zuverlässigkeit gibt es keine Pauschalantwort, nur Studienlage. Die Semigran-Studie (BMJ 2015) testete 23 englischsprachige Symptom-Checker mit 45 standardisierten Fall-Vignetten, und die richtige Diagnose stand nur in rund 34 % der Fälle an erster Stelle.
Etwas freundlicher wird das Bild, wenn man die Trefferliste weiter fasst, denn in derselben Studie tauchte die korrekte Diagnose in gut 58 % der Fälle unter den Top-20-Vorschlägen auf. Bei der Triage, also der Dringlichkeit, lag die Trefferquote zwischen 33–78 %, mit klarer Tendenz zur Übervorsicht. Die Autoren schlossen daraus, dass die Daten einen Einsatz zur Diagnose oder Triage nicht stützen.
Ein systematischer Review (Wallace, npj Digital Medicine 2022) bestätigt die Richtung über zehn Studien. Die Genauigkeit der Erstdiagnose lag dort im Bereich 19–37,9 %. Die Triage schnitt mit 48,8–90,1 % besser ab, schwankte aber stark je Tool und Fallschwere, und beide Studien nutzen Vignetten statt echter Patienten, also Momentaufnahmen mit begrenzter Übertragbarkeit.
Was die Studien zeigen
Acht Symptom-Assessment-Apps traten in einer Vignetten-Studie (Gilbert, BMJ Open 2020) gegen Allgemeinmediziner an. Die Ärzte schnitten insgesamt besser ab, nur einzelne Apps kamen nah heran. Das beste Tool nannte die richtige Erkrankung in rund 71 % unter den Top-3-Vorschlägen.
Diese 71 % gelten nur für dieses Studien- und Vignetten-Setting, nicht als allgemeine „App-Genauigkeit“. Einige der Autoren standen einem App-Anbieter nahe, was Sie bei der Einordnung mitdenken sollten. Zwischen den Apps lag zudem eine deutliche Streuung.
Auch für Spezialbereiche gibt es Einzelbefunde. In einer Vergleichsstudie mit Psychotherapie-Patienten (2022) traf der erste App-Vorschlag in rund 51 % die Therapeuten-Diagnose, und einer der ersten fünf Vorschläge passte in rund 69 % der Fälle. Das ist ein kleines Setting und keine Regel, sondern eine einzelne Studie unter vielen.
Wenn ChatGPT eine Diagnose stellt
Viele fragen inzwischen einen Chatbot statt einer klassischen App. Das ist heikler, als es wirkt. Große Sprachmodelle können selbstbewusst klingen und trotzdem falsch liegen. Dieses „Halluzinieren“ ist in Reviews zu medizinischen Sprachmodellen (2024/25) dokumentiert.
Modelle neigen zu häufigen statt seltenen, aber gefährlichen Diagnosen, sie schwächeln bei Zahlen und Zeitbezug und wirken sicherer, als die Datenlage erlaubt. In einer Auswertung klinischer Fall-Vignetten (2024) löste ChatGPT nur rund 40 % der Fälle mit dem Erstvorschlag, doch das ist ein Einzelbefund, stark abhängig von Prompt und Setting.
Rechtlich ist die Lage eindeutig, denn ein Allzweck-Chatbot hat keine medizinische Zweckbestimmung und ist damit kein Medizinprodukt (MDR 2017/745). Er darf keine Diagnose-Instanz sein, egal wie überzeugend die Antwort klingt. Nehmen Sie eine solche Auskunft als Anstoß für ein Arztgespräch, nicht als Ergebnis.
Wo klinische KI hilft
Auf der ärztlichen Ebene sieht die Bilanz anders aus. Hier arbeitet KI als Entscheidungsunterstützung im Hintergrund, und sie liefert dem Arzt Befunde, Vorschläge oder Auffälligkeiten, die er dann bewertet. Ein Fachmensch prüft jeden Vorschlag, bevor er zählt.
Ein reifes Beispiel ist die Bildbefundung, etwa im Röntgen oder CT. Wie das konkret läuft, vertieft der Beitrag zur KI in der Radiologie. Ein anderes Feld ist die Überwachung von Vitalwerten und die Frühwarnung bei Verschlechterung. Das schaut sich der Beitrag zur KI im Krankenhaus näher an.
Der Nutzen liegt vor allem in Tempo und Priorisierung, denn KI kann dringende Fälle vorziehen und Routine entlasten. Die KI schlägt vor, der Arzt entscheidet. Die Verantwortung wandert nicht in die Software.
Warum die App kein Arztersatz ist

Die individuelle Diagnose ist eine ärztliche Vorbehaltsaufgabe. Sie verlangt Untersuchung, Anamnese und die Einordnung in Ihren Verlauf, doch eine App sieht davon nur, was Sie eintippen, ohne Sie zu untersuchen. Das ist der strukturelle Grund, warum sie keinen Arzt ersetzt.
Auch die reine Fernbehandlung ist eng geregelt. Nach § 7 Abs. 4 MBO-Ä ist die ausschließliche ärztliche Fernbehandlung nur unter Voraussetzungen erlaubt, und maßgeblich ist dabei die Berufsordnung der jeweiligen Landesärztekammer, das Muster gibt nur den Rahmen. Eine App ist ohnehin keine ärztliche Behandlung, sondern ein Werkzeug.
Betrachten Sie den App-Hinweis als Frage, nicht als Antwort. Bei Warnzeichen wie akutem Brustschmerz, Atemnot oder Lähmung warten Sie keine App-„Freigabe“ ab. Dann zählt sofort ärztliche Hilfe oder der Notruf.
Datenschutz bei Gesundheitsdaten
Diagnose-Apps leben von sehr sensiblen Daten. Gesundheitsdaten sind eine besondere Kategorie nach Art. 9 DSGVO, und ihre Verarbeitung braucht eine strenge Rechtsgrundlage, meist Ihre ausdrückliche Einwilligung. Dazu kommen erhöhte Anforderungen an Zweckbindung und Datensparsamkeit.
Bei Consumer-Apps und Chatbots lohnt deshalb ein prüfender Blick. Wer ist der Anbieter, wozu werden die Daten genutzt und wo stehen die Server. Ein Transfer in Drittländer kann den Schutz schwächen. Geben Sie sensible Details nicht leichtfertig ein, nur weil ein Chat danach fragt.
Die WHO warnt in ihrer Leitlinie zu großen KI-Modellen (2024) mit über 40 Empfehlungen unter anderem vor Einwilligungs- und Verzerrungsrisiken. Datenschutz gehört bei KI-Diagnose damit in die Bewertung und in jede Kaufentscheidung.
Wann eine App eine DiGA ist
Am Markt sind unzählige Symptom-Checker frei im Verkauf, geprüft ist nur ein kleiner Teil davon. Der geprüfte Weg heißt DiGA, digitale Gesundheitsanwendung nach § 33a SGB V, und das BfArM prüft solche Anwendungen und führt ein öffentliches Verzeichnis. Mitte 2025 waren dort rund 56–58 DiGA gelistet, die Zahl ändert sich laufend.
Für eine diagnostische Komponente verlangt das BfArM Studien, die die diagnostische Güte belegen. Ein reiner Selbsttest-Symptom-Checker ist also nicht automatisch eine DiGA. Seit dem 01.01.2025 müssen Hersteller zudem die Datensicherheit per Zertifikat nachweisen.
Über der DiGA-Ebene liegt noch der EU AI Act (VO 2024/1689). Durch das Zusammenspiel mit der MDR gelten die meisten kommerziellen KI-Medizinprodukte als Hochrisiko-Systeme. Die zugehörigen Pflichten greifen gestaffelt in den Jahren 2026 und 2027. „Geprüft“ beschreibt damit einen Prozess.
Wer haftet bei Fehldiagnosen
Die Haftungsfrage folgt der Ebene. Nutzt ein Arzt KI als Unterstützung, bleibt die Diagnose seine Verantwortung, denn die Software ist rechtlich ein Werkzeug, kein eigenständiger Akteur. Auch ein KI-Vorschlag entbindet den Arzt nicht von der Prüfung. Wie sich Behandlungsfehler und Produktfehler als getrennte Haftungsspuren auseinanderhalten lassen, zeigt der Beitrag Wer haftet, wenn ein Roboter Schaden anrichtet?.
Bei der Selbstnutzung einer App liegt der Fall anders. Wer allein einer App folgt und den Arzt meidet, handelt auf eigenes Risiko. Es gibt keinen behandelnden Arzt, der die Diagnose verantwortet. Genau das macht die Selbstdiagnose so heikel.
Eine App darf Sie informieren und sensibilisieren — sie darf Ihnen aber keine Entwarnung geben und keinen Arztbesuch ersparen. Im Zweifel entscheidet immer der Arzt, nicht der Bildschirm.
Was das für Sie heißt
Nutzen Sie eine Diagnose-App als grobe Orientierung, nicht als Urteil. Sie kann Ihnen helfen, Fragen für das Arztgespräch zu sortieren. Sie kann Ihnen aber nicht sagen, ob etwas wirklich harmlos ist.
Die Studienwerte von 34 % bis 71 % stammen aus Vignetten und schwanken stark, und kein einziger davon heißt „zuverlässig genug für eine Selbstdiagnose“. Sie zeigen eher, wie oft solche Tools danebenliegen.
Bei anhaltenden, starken oder plötzlichen Beschwerden gehen Sie zum Arzt. Bei Warnzeichen wählen Sie den Notruf, ohne eine App zu befragen. Die KI-Diagnose ist ein Zusatz, Ihre Sicherheit hängt am ärztlichen Urteil.
Fazit
KI kann Ärzten bei der Diagnose helfen, eine App ersetzt den Arzt aber nicht. Auf der ärztlichen Ebene ist KI eine geprüfte Unterstützung, bei der der Mensch entscheidet. Auf der Consumer-Ebene liefern Symptom-Checker nur eine Selbsteinschätzung, und die Studien dazu zeigen eher niedrige Diagnose-Treffer und eine bei der Dringlichkeit etwas höhere, aber schwankende Triage-Quote.
Der rote Faden bleibt derselbe wie am Anfang. Jede Genauigkeitszahl gilt für ihre Studie, nicht für Ihren Fall. Recht wie DiGA, MDR, AI Act und DSGVO steckt den Rahmen ab, in dem seriöse Anwendungen laufen. Und im Zweifel gehen Sie zum Arzt, bei Warnzeichen zum Notruf.
Kann eine KI eine Diagnose stellen?
Sie kann Ärzte unterstützen, aber keine ärztliche Diagnose ersetzen. Eine App liefert nur eine Selbsteinschätzung aus dem, was Sie eintippen, ohne Untersuchung. Die individuelle Diagnose bleibt eine ärztliche Vorbehaltsaufgabe. Im Zweifel entscheidet immer ein Arzt, nicht die Software.
Wie zuverlässig sind Symptom-Checker?
Das lässt sich nur als Studienlage sagen. In der Semigran-Studie (BMJ 2015) stand die richtige Diagnose nur in rund 34 % der Fälle an erster Stelle. Ein Review (Wallace, npj Digital Medicine 2022) fand eine Erstdiagnose-Genauigkeit von 19–37,9 %. Diese Werte stammen aus Vignetten und gelten nicht für Ihren Einzelfall.
Ersetzt eine Diagnose-App den Arzt?
Nein. Die Diagnose ist eine ärztliche Vorbehaltsaufgabe, weil sie Untersuchung, Verlauf und Verantwortung verbindet. Eine App sieht nur Ihre Eingaben und kann keine Entwarnung geben. Bei Warnzeichen wie akuter Atemnot oder Brustschmerz zählt sofort ärztliche Hilfe oder der Notruf.
Darf ich ChatGPT nach einer Diagnose fragen?
Vorsicht: Ein Allzweck-Chatbot kann selbstbewusst falsch liegen, das nennt man Halluzination. In einer Vignetten-Auswertung (2024) löste ChatGPT nur rund 40 % der Fälle mit dem Erstvorschlag. Er hat keine medizinische Zweckbestimmung und ist damit kein Medizinprodukt. Nehmen Sie die Antwort als Anstoß fürs Arztgespräch, nicht als Ergebnis.
Sind KI-Diagnose-Apps geprüft?
Nicht automatisch. Geprüft sind Anwendungen, die als DiGA nach § 33a SGB V im BfArM-Verzeichnis stehen. Ein frei verfügbarer Symptom-Checker ist nicht automatisch eine DiGA. Für eine diagnostische Komponente verlangt das BfArM sogar Studien zur diagnostischen Güte.
Was ist eine DiGA?
Eine DiGA ist eine digitale Gesundheitsanwendung nach § 33a SGB V. Das BfArM prüft sie und führt ein öffentliches Verzeichnis, die Kosten kann die Krankenkasse erstatten. Mitte 2025 waren rund 56–58 DiGA gelistet, die Zahl ändert sich laufend. Seit dem 01.01.2025 müssen Hersteller zusätzlich die Datensicherheit per Zertifikat nachweisen.
Was passiert mit meinen Gesundheitsdaten?
Gesundheitsdaten sind eine besondere Kategorie nach Art. 9 DSGVO und besonders geschützt. Ihre Verarbeitung braucht in der Regel Ihre ausdrückliche Einwilligung. Prüfen Sie bei Apps und Chatbots Anbieter, Zweck und Serverstandort. Geben Sie sensible Details nicht leichtfertig ein, nur weil ein Chat danach fragt.
Nutzen Ärzte selbst KI zur Diagnose?
Ja, als Entscheidungsunterstützung, kurz CDSS. Solche Software liefert dem Arzt Befunde oder Vorschläge, die er dann bewertet. Der entscheidende Unterschied zur Consumer-App: Ein approbierter Arzt prüft jeden Vorschlag und trägt die Verantwortung. Die KI schlägt vor, der Arzt entscheidet.
Wer haftet bei einer falschen KI-Diagnose?
Nutzt ein Arzt KI als Werkzeug, bleibt die Diagnose seine Verantwortung. Die Software ist rechtlich kein eigenständiger Akteur. Wer dagegen allein einer App folgt und den Arzt meidet, handelt auf eigenes Risiko. Deshalb sollte eine App nie eine Entwarnung ersetzen.
Quellen & Stand: Semigran et al., BMJ 2015;351:h3480 (23 Symptom-Checker, 45 Vignetten; Erstdiagnose ~34 %, Top 20 ~58 %, Triage 33–78 %), Wallace et al., npj Digital Medicine 2022 (systematischer Review, 10 Studien; Diagnose 19–37,9 %, Triage 48,8–90,1 %), Gilbert et al., BMJ Open 2020 (8 Apps vs. Allgemeinmediziner; bestes Tool Top-3 ~71 %, Autoren teils anbieternah), Vergleichsstudie Psychotherapie-Patienten 2022 (Erstvorschlag ~51 %, Top-5 ~69 %; kleines Setting, Einzelstudie), LLM-Vignetten-Auswertung 2024 (ChatGPT ~40 % Erstnennung; Einzelbefund, prompt-/setting-abhängig) und Reviews zu medizinischen Sprachmodellen 2024/25 (Halluzination), MDR 2017/745 (Regel 11, Diagnose-Software ≥ Klasse IIa), § 33a SGB V / BfArM (DiGA-Verzeichnis, ~56–58 gelistet Mitte 2025, Datensicherheitszertifikat ab 01.01.2025), EU AI Act (VO 2024/1689, meist Hochrisiko, Pflichten gestaffelt 2026/2027), § 7 Abs. 4 MBO-Ä (Fernbehandlung, Landesärztekammer-abhängig), Art. 9 DSGVO (Gesundheitsdaten), WHO-Leitlinie zu großen KI-Modellen 2024 (über 40 Empfehlungen). Alle Genauigkeitszahlen stammen aus einzelnen, meist Vignetten-basierten Studien und gelten für deren Setting, nicht als Pauschalurteil. Kein medizinischer Rat, keine Diagnose. Stand: 31. Juli 2026.