Проект llama.cpp выпустил версию b11554 2026‑10‑11. В обновлении появились специальные для Vulkan исправления: библиотека выявляет повторяющиеся идентификаторы строк при умножении матриц и обрабатывает их на предварительном этапе, не перебирая по очереди. Также улучшена оптимизация «hoist row ids»: теперь она запускается всегда и может формировать несколько компактных тайлов. Благодаря этим изменениям GPU запускает меньше рабочих групп и, когда это возможно, завершает работу раньше.
Почему это важно
На GPU inference в llama.cpp может выполняться быстрее, поскольку библиотека больше не повторяет одни и те же вычисления.