연구진은 8개월 동안 의사와 간호사 등 의료진 6,342명이 병원의 대규모 언어 모델(LLM) 비서에 보낸 요청 127,833건을 분석했다. 질의의 36%는 문서 작성과 행정 업무에 관한 것이었고, 29%는 지식 검색을 위한 것이었다. 진단을 요청한 질의는 4%에 그쳤다. 요청의 3분의 1 이상은 질문의 형태 그대로는 제대로 답변하기 어려웠다. 연구진은 이러한 실제 업무를 공개 벤치마크 58개와 비교한 결과, 벤치마크가 실제 업무 구성의 약 3분의 1만 다루며 문서 작성 업무는 전혀 포함하지 않는다는 사실을 확인했다.
왜 중요한가
병원은 의료진이 실제로 의존하는 일상적인 문서 작성과 정보 검색 업무를 반영하도록 AI 평가 방식을 재설계해야 할 수 있다.