Oossa

llama.cpp ускоряет Vulkan за счёт обработки повторяющихся строк

Библиотека llama.cpp с открытым исходным кодом теперь пропускает лишние вычисления при повторении строк на GPU, ускоряя работу на устройствах с Vulkan.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил версию b11554 2026‑10‑11. В обновлении появились специальные для Vulkan исправления: библиотека выявляет повторяющиеся идентификаторы строк при умножении матриц и обрабатывает их на предварительном этапе, не перебирая по очереди. Также улучшена оптимизация «hoist row ids»: теперь она запускается всегда и может формировать несколько компактных тайлов. Благодаря этим изменениям GPU запускает меньше рабочих групп и, когда это возможно, завершает работу раньше.

Почему это важно

На GPU inference в llama.cpp может выполняться быстрее, поскольку библиотека больше не повторяет одни и те же вычисления.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.