研究者らは、6,342人の医師、看護師などが8カ月間にわたり、ある病院の大規模言語モデル(LLM)アシスタントに送った127,833件のリクエストを調べた。その結果、36%は文書作成や事務作業に関するもので、29%は知識の検索を目的としていた一方、診断を求めるものはわずか4%だった。3分の1を超えるリクエストは、質問の仕方のままでは十分に回答できなかった。こうした実際の業務を58件の公開ベンチマークと比較すると、ベンチマークが対象としていたのは業務全体の約3分の1にすぎず、文書作成業務はまったく含まれていなかった。
なぜ重要か
医療機関は、医療従事者が日常的に頼る文書作成や情報検索の業務を反映するよう、AIの評価方法を見直す必要があるかもしれない。