# 의료진, 벤치마크 시험과 다르게 AI 비서 활용

> 의료진의 질의 127,833건을 분석한 결과, 실제 활용은 대부분 문서 작성과 정보 검색에 집중됐으며 벤치마크는 이를 대체로 반영하지 못했다.

Oossa · 2026-10-09 · https://oossa.com/ko/study-finds-clinicians-use-ai-assistants-differently-than-benchmark-tests

연구진은 8개월 동안 의사와 간호사 등 의료진 6,342명이 병원의 대규모 언어 모델(LLM) 비서에 보낸 요청 127,833건을 분석했다. 질의의 36%는 문서 작성과 행정 업무에 관한 것이었고, 29%는 지식 검색을 위한 것이었다. 진단을 요청한 질의는 4%에 그쳤다. 요청의 3분의 1 이상은 질문의 형태 그대로는 제대로 답변하기 어려웠다. 연구진은 이러한 실제 업무를 공개 벤치마크 58개와 비교한 결과, 벤치마크가 실제 업무 구성의 약 3분의 1만 다루며 문서 작성 업무는 전혀 포함하지 않는다는 사실을 확인했다.

## 팩트

- 35개 전문 분야 의료진 6,342명이 보낸 질의 127,833건
- 벤치마크가 실제 업무 구성과 겹치는 비율은 31%에 그쳤다

## 왜 중요한가

병원은 의료진이 실제로 의존하는 일상적인 문서 작성과 정보 검색 업무를 반영하도록 AI 평가 방식을 재설계해야 할 수 있다.

## 출처 및 참고 자료

1. [Clinician use of language models diverges from how the models are evaluated](https://arxiv.org/abs/2610.11069) – arXiv, 2026-10-09

최종 업데이트: 2026-10-09
