# 研究发现：临床人员使用AI助手的方式与基准测试不同

> 对127,833条查询的分析显示，现实中的使用主要用于文档处理和信息检索，而基准测试很少涵盖这些任务。

Oossa · 2026-10-09 · https://oossa.com/zh/study-finds-clinicians-use-ai-assistants-differently-than-benchmark-tests

研究人员分析了6,342名医生、护士及其他医务人员在八个月内向一家医院的大语言模型（LLM）助手发出的127,833条请求。结果发现，36 %的查询涉及文档处理和行政事务，29 %用于检索知识，只有4 %询问诊断。超过三分之一的请求按原本的提问方式难以得到理想回答。研究人员将这些现实任务与58项公开基准测试进行比较后发现，基准测试仅覆盖约三分之一的任务类型，完全没有涉及文档处理工作。

## 事实

- 来自35个专业领域的6,342名临床人员共发出127,833条查询
- 基准测试与现实任务类型的重合度仅为31 %

## 为什么重要

医院可能需要重新设计AI评估方式，使其能够反映临床人员日常依赖的文档处理和信息检索任务。

## 来源与参考

1. [Clinician use of language models diverges from how the models are evaluated](https://arxiv.org/abs/2610.11069) – arXiv, 2026-10-09

最后更新: 2026-10-09
