# 医療従事者のAI利用、ベンチマークでは実態を捉えきれず

> 127,833件の質問を分析したところ、実際の利用の大半は文書作成や情報検索で、ベンチマークテストではほとんど評価されていないことが分かった。

Oossa · 2026-10-09 · https://oossa.com/ja/study-finds-clinicians-use-ai-assistants-differently-than-benchmark-tests

研究者らは、6,342人の医師、看護師などが8カ月間にわたり、ある病院の大規模言語モデル（LLM）アシスタントに送った127,833件のリクエストを調べた。その結果、36％は文書作成や事務作業に関するもので、29％は知識の検索を目的としていた一方、診断を求めるものはわずか4％だった。3分の1を超えるリクエストは、質問の仕方のままでは十分に回答できなかった。こうした実際の業務を58件の公開ベンチマークと比較すると、ベンチマークが対象としていたのは業務全体の約3分の1にすぎず、文書作成業務はまったく含まれていなかった。

## 事実

- 35の専門分野にわたる6,342人の医療従事者から、127,833件の質問を収集
- ベンチマークが実際の業務内容と重なる割合は31％にとどまった

## なぜ重要か

医療機関は、医療従事者が日常的に頼る文書作成や情報検索の業務を反映するよう、AIの評価方法を見直す必要があるかもしれない。

## 出典と参考資料

1. [Clinician use of language models diverges from how the models are evaluated](https://arxiv.org/abs/2610.11069) – arXiv, 2026-10-09

最終更新: 2026-10-09
