Was lokale AI-Modelle in der medizinischen Dokumentation leisten

An drei typischen Aufgaben siehst du, wie zuverlässig lokale Modelle von 2024, 2025 und 2026 medizinische Informationen ordnen, verdichten und in Vorlagen einsetzen – und an welchen subtilen Fehlern sich die Modellgenerationen unterscheiden.

Drei Aufgaben im Modellvergleich

Eine Diagnoseliste bereinigen und ordnen

Was bekommt die AI – und warum ist dieser Fall typisch?

Die AI erhält eine ungeordnete Liste aus mehreren früheren Berichten: doppelte Diagnosen, zwei aktive Diagnosen, eine Allergie, eine Operation in der Vorgeschichte und einen ausdrücklich verworfenen Pneumonieverdacht. In der Praxis müssen solche Listen oft aus verschiedenen Berichten zusammengeführt, auf den aktuellen Stand gebracht und nach Wichtigkeit geordnet werden. Dieser Fall prüft, ob die AI echte Dubletten erkennt und zusammenführt, wichtige Informationen behält und alte oder verworfene Angaben korrekt einordnet.

Welche Fehler wären hier problematisch?

Wir achten auf typische, medizinisch riskante Fehler: Eine Dublette bleibt stehen, eine Allergie oder wichtige Vorgeschichte verschwindet, ein verworfener Verdacht wird plötzlich zur aktiven Diagnose – oder alte Informationen werden wichtiger dargestellt als der aktuelle Stand. Eine sauber formulierte Liste kann dadurch plausibel wirken und trotzdem falsch sein.

Vollständige Eingabe und Ausgabeformat ansehen
- Herzinsuffizienz mit erhaltener Ejektionsfraktion (LVEF 55 %), Erstdiagnose 2022, aktuell kompensiert
- Herzinsuffizienz HFpEF, kompensiert
- Arterielle Hypertonie
- Hypertonie
- Verdacht auf ambulant erworbene Pneumonie bei Eintritt; CT ohne Infiltrat, Procalcitonin normal, Verdacht verworfen und Antibiotika gestoppt2024.2
- Penicillinallergie (Exanthem)
- Status nach Cholezystektomie 2014
- Gonarthrose rechts, intermittierend symptomatisch

Auftrag:
Doppelte Diagnosen zusammenführen und die Angaben unter «Aktive Diagnosen», «Ausgeschlossen» und «Anamnese/Allergien» einordnen. Unsicherheit und Status exakt bewahren. Ausser echten Dubletten nichts streichen und nichts hinzufügen.

Ausgabeformat:
Ausgabe nur als HTML. Genau drei Absätze mit den Überschriften Aktive Diagnosen, Ausgeschlossen, Anamnese/Allergien. Innerhalb der Absätze Einträge mit Semikolon trennen. Format: <p><strong>Label.</strong> Text</p>.

Ergebnis der Prüfung

Erst das Modell von 2026 bereinigt die Liste vollständig.

2024 und 2025 ordnen die Angaben zwar übersichtlich, lassen aber die doppelten Diagnosen stehen. 2026 führt die Dubletten zusammen und bewahrt gleichzeitig Allergie, Vorgeschichte und den verworfenen Verdacht.

Auswertung der drei Modellgenerationen
Prüfkriterium202420252026
Dubletten zusammengeführtNicht erfülltNicht erfülltErfüllt
Status und Sicherheit bewahrtTeilweiseErfülltErfüllt
Sinnvoll eingeordnetErfülltTeilweiseErfüllt
Nichts ergänzt oder verlorenTeilweiseErfülltErfüllt
Einordnung nach Modell

2024 · Mistral Small 22B

Schön geordnet, aber die beiden Dubletten bleiben bestehen.

  • Allergie und Vorgeschichte erhalten
  • Pneumonie nicht als aktive Diagnose dargestellt
  1. 2024.1 · Auftrag nicht befolgt

    Dubletten nicht bereinigt

    Herzinsuffizienz und Hypertonie erscheinen weiterhin doppelt. Genau diese Redundanz sollte entfernt werden.

  2. 2024.2 · Information fehlt

    Verlaufsinformation ausgelassen

    Die Einordnung «Ausgeschlossen» ist richtig, der explizite Abschluss des Verdachts und der Antibiotika fehlen aber.

2025 · Qwen3-30B-A3B

Der Status bleibt erhalten, doch die Liste ist noch nicht wirklich bereinigt.

  • Verworfenen Pneumonieverdacht exakt bewahrt
  • Keine Information erfunden oder gestrichen
  1. 2025.1 · Auftrag nicht befolgt

    Dubletten nicht zusammengeführt

    Wie 2024 führt das Modell beide Formulierungen derselben Diagnosen separat auf.

  2. 2025.2 · Aussage ungenau oder falsch

    Fragwürdig eingeordnet

    Die symptomatische Gonarthrose steht unter Anamnese statt bei den aktiven Diagnosen.

2026 · Qwen 3.8 27B

Die Dubletten sind zusammengeführt und alle Statusangaben bleiben erhalten.

  • Drei gewünschte Gruppen korrekt aufgebaut
  • Keine Diagnose ergänzt oder verloren

Keine redaktionellen Prüfhinweise.

Die Originalausgaben

Hier steht ausschliesslich, was das jeweilige Modell ausgegeben hat. Die fachliche Einordnung findest du vollständig oben.

Gelb markiert eine Stelle mit Prüfhinweis.

2024

Mistral Small 22B

Originalausgabe des Modells

Aktive Diagnosen. Herzinsuffizienz mit erhaltener Ejektionsfraktion (LVEF 55 %), Erstdiagnose 2022, aktuell kompensiert; Herzinsuffizienz HFpEF, kompensiert; Arterielle Hypertonie; Hypertonie2024.1; Gonarthrose rechts, intermittierend symptomatisch

Ausgeschlossen. Verdacht auf ambulant erworbene Pneumonie bei Eintritt; CT ohne Infiltrat; Procalcitonin normal

Anamnese/Allergien. Penicillinallergie (Exanthem); Status nach Cholezystektomie 2014

Modell und Hardware

Ein kräftiger Gaming-PC reicht

Grafikkarte mit rund 16 GB eigenem Speicher – oder ein Apple-Computer mit 32 GB Arbeitsspeicher. Kein Serverraum nötig.

Ein durchgängiges Sprachmodell (kein Experten-Mix).

22 Milliarden Parameter

Rund 16 GB Grafikspeicher in der üblichen komprimierten Nutzung

mistral/mistral-small

Die Fallbeispiele sind realistisch, aber vollständig synthetisch. Kein Medizinprodukt; bitte keine echten Patientendaten eingeben. Die ärztliche Endkontrolle bleibt unverzichtbar.

Eigener Test

Prüfe die Modelle mit deiner Aufgabe

Bearbeite eines der drei Beispiele, schreibe eigene Stichworte oder diktiere einen kurzen Text.

Bonus · nicht Teil der Jahresreihe

Wie gut ist AI ohne Spezialhardware?

Wir haben den Neurostatus zusätzlich mit Ministral 3 14B getestet. Das moderne Modell kann ohne separate Grafikkarte lokal laufen – auf einem guten Büro-PC allerdings langsamer als in dieser Web-Demo.

  • Keine separate GPU nötig
  • 32 GB RAM empfohlen
  • Antwort auf CPU langsamer

Diktat

Wie gut wird Sprache erkannt?

rund 2–4 Fehler pro 100 Wörter

Aktuelle unabhängige Deutsch-Benchmarks zeigen bereits eine hohe Erkennungsqualität. Fachbegriffe und Audioqualität bleiben relevant.

Beispielrechnung

Was könnte das zeitlich bedeuten?

rund 147 Stunden pro Arzt und Jahr

Wenn ein kontrollierter Eintrag im Beispiel vier Minuten kürzer dauert. Das ist eine transparente Modellrechnung, keine Studie.

Fragen oder Anregungen?

Wenn du die Demonstration ausprobieren, ergänzen oder kritisieren möchtest: schreib uns. Kein Verkaufsgespräch – eine Rückmeldung reicht.