Los investigadores analizaron 127,833 consultas que 6,342 médicos, enfermeros y otros profesionales hicieron durante ocho meses al asistente de lenguaje de gran tamaño (LLM) de un hospital. Descubrieron que el 36 % de las consultas se refería a documentación y tareas administrativas, y el 29 % a la búsqueda de información; solo el 4 % pedía diagnósticos. Más de un tercio de las consultas no podía responderse bien tal como estaba formulada. Al comparar estas tareas del mundo real con 58 pruebas comparativas públicas, comprobaron que estas solo cubrían alrededor de un tercio de las tareas y omitían por completo el trabajo de documentación.
Por qué importa
Es posible que los hospitales deban replantear la evaluación de la IA para que refleje las tareas cotidianas de documentación y búsqueda de información en las que realmente se apoyan los profesionales clínicos.