Oossa

研究发现:临床人员使用AI助手的方式与基准测试不同

对127,833条查询的分析显示,现实中的使用主要用于文档处理和信息检索,而基准测试很少涵盖这些任务。

简讯作者: Oossa 发布日期: 1 分钟阅读

研究人员分析了6,342名医生、护士及其他医务人员在八个月内向一家医院的大语言模型(LLM)助手发出的127,833条请求。结果发现,36 %的查询涉及文档处理和行政事务,29 %用于检索知识,只有4 %询问诊断。超过三分之一的请求按原本的提问方式难以得到理想回答。研究人员将这些现实任务与58项公开基准测试进行比较后发现,基准测试仅覆盖约三分之一的任务类型,完全没有涉及文档处理工作。

为什么重要

医院可能需要重新设计AI评估方式,使其能够反映临床人员日常依赖的文档处理和信息检索任务。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。