Исследователи изучили 127,833 запроса к помощнику на базе большой языковой модели (LLM), которые за восемь месяцев отправили 6,342 врача, медсестры и других медицинских специалистов. Выяснилось, что 36 % запросов касались документации и административной работы, а 29 % — поиска информации; лишь в 4 % случаев просили поставить диагноз. Более трети запросов нельзя было качественно обработать в том виде, в котором они были сформулированы. Сравнив эти задачи из реальной практики с 58 открытыми тестами, исследователи обнаружили, что тесты охватывают лишь около трети всего спектра задач и вовсе не учитывают работу с документацией.
Почему это важно
Больницам, возможно, придется пересмотреть методы оценки ИИ, чтобы они учитывали повседневную работу с документацией и поиск информации — задачи, для которых специалисты действительно используют такие системы.