فحص باحثون 127,833 طلبًا قدّمها 6,342 طبيبًا وممرضًا وغيرهم من العاملين في الرعاية الصحية إلى مساعد يعمل بنموذج لغوي كبير (LLM) في أحد المستشفيات، على مدى ثمانية أشهر. ووجدوا أن 36 % من الطلبات تعلقت بالتوثيق والأعمال الإدارية، و29 % باسترجاع المعلومات، فيما لم تتجاوز الطلبات المتعلقة بالتشخيص 4 %. كما تعذّر تقديم إجابة جيدة عن أكثر من ثلث الطلبات بصيغتها المطروحة. وعند مقارنة هذه المهام الفعلية بـ58 اختبارًا معياريًا متاحًا للعامة، تبيّن أن الاختبارات غطّت نحو ثلث أنواع المهام فقط، ولم تشمل أعمال التوثيق مطلقًا.
لماذا يهم
قد تحتاج المستشفيات إلى إعادة تصميم تقييمات الذكاء الاصطناعي لتشمل مهام التوثيق والبحث عن المعلومات اليومية التي يعتمد عليها العاملون في الرعاية الصحية فعليًا.