Команда ggml‑org выпустила llama.cpp версии b11487. В ней появилась поддержка GET_ROWS для tiled Q4_K и Q6_K на процессорах Hexagon, а также улучшена обработка представлений Q4_K. Доступны готовые сборки для Apple Silicon, Intel macOS, iOS и нескольких версий Ubuntu (CPU и Vulkan). Обновление можно скачать со страницы релиза на GitHub.
Почему это важно
Разработчики теперь могут запускать более эффективные модели Llama на устройствах с Hexagon, например на чипах Qualcomm, повышая производительность на совместимом мобильном и встраиваемом оборудовании.