研究人员分析了6,342名医生、护士及其他医务人员在八个月内向一家医院的大语言模型(LLM)助手发出的127,833条请求。结果发现,36 %的查询涉及文档处理和行政事务,29 %用于检索知识,只有4 %询问诊断。超过三分之一的请求按原本的提问方式难以得到理想回答。研究人员将这些现实任务与58项公开基准测试进行比较后发现,基准测试仅覆盖约三分之一的任务类型,完全没有涉及文档处理工作。
为什么重要
医院可能需要重新设计AI评估方式,使其能够反映临床人员日常依赖的文档处理和信息检索任务。
对127,833条查询的分析显示,现实中的使用主要用于文档处理和信息检索,而基准测试很少涵盖这些任务。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
研究人员分析了6,342名医生、护士及其他医务人员在八个月内向一家医院的大语言模型(LLM)助手发出的127,833条请求。结果发现,36 %的查询涉及文档处理和行政事务,29 %用于检索知识,只有4 %询问诊断。超过三分之一的请求按原本的提问方式难以得到理想回答。研究人员将这些现实任务与58项公开基准测试进行比较后发现,基准测试仅覆盖约三分之一的任务类型,完全没有涉及文档处理工作。
医院可能需要重新设计AI评估方式,使其能够反映临床人员日常依赖的文档处理和信息检索任务。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。