Команда ggml-org выпустила llama.cpp версии b11528 2026-10-09. Теперь библиотека обрабатывает представления тензоров, размещённых в памяти хоста, как обычные узлы. Это устраняет ошибку assert, которая возникала при использовании параметра –split-mode tensor. Кроме того, восстановлена поддержка тензоров SM для ускорителя K2 Horizon. Изменения вошли в официальный релиз на GitHub и доступны для всех перечисленных платформ — от macOS до Windows и Linux.
Почему это важно
Разработчики смогут использовать llama.cpp с разделением KV-кэша на большем числе устройств без сбоев, расширив выбор конфигураций для локального запуска LLM.