# Studie: Klinikpersonal nutzt KI anders als in Benchmarks

> Die Analyse von 127.833 Anfragen zeigt: Im klinischen Alltag geht es meist um Dokumentation und Informationssuche – Aufgaben, die Benchmarks weitgehend übersehen.

Oossa · 2026-10-09 · https://oossa.com/de/study-finds-clinicians-use-ai-assistants-differently-than-benchmark-tests

Forschende untersuchten 127,833 Anfragen, die 6,342 Ärztinnen und Ärzte, Pflegekräfte und andere Beschäftigte im Gesundheitswesen innerhalb von acht Monaten an den Large-Language-Model-Assistenten (LLM) eines Krankenhauses richteten. Dabei zeigte sich: 36 % der Anfragen betrafen Dokumentation und Verwaltung, 29 % dienten der Informationsbeschaffung und nur 4 % fragten nach Diagnosen. Mehr als ein Drittel der Anfragen ließ sich in der vorliegenden Form nicht gut beantworten. Beim Vergleich dieser Aufgaben aus dem klinischen Alltag mit 58 öffentlich zugänglichen Benchmarks stellten die Forschenden fest, dass diese nur etwa ein Drittel des Aufgabenspektrums abdeckten und Dokumentationsarbeit ganz ausließen.

## Die Fakten

- 127,833 Anfragen von 6,342 Beschäftigten im Gesundheitswesen aus 35 Fachgebieten
- Benchmarks deckten nur 31 % des Aufgabenspektrums aus dem klinischen Alltag ab

## Warum es wichtig ist

Krankenhäuser müssen die Bewertung von KI möglicherweise neu ausrichten, damit sie die alltäglichen Dokumentations- und Informationssuchaufgaben widerspiegelt, auf die sich Beschäftigte im Gesundheitswesen tatsächlich verlassen.

## Quellen und Referenzen

1. [Clinician use of language models diverges from how the models are evaluated](https://arxiv.org/abs/2610.11069) – arXiv, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
