Команда ggml‑org выпустила llama.cpp версии b11391 4 октября 2026 года. В обновлении переменная CUDA blocks_per_col перенесена туда, где она используется. Изменение одобрил Adrien Gallouët. В релиз также вошли новые предварительно скомпилированные сборки для macOS на Apple Silicon, macOS на Intel, iOS и нескольких вариантов Ubuntu (CPU, Vulkan и CUDA 12). Все файлы можно скачать со страницы релиза на GitHub.
Почему это важно
Теперь разработчики могут запускать llama.cpp на большем количестве устройств без дополнительной настройки — особенно это актуально для тех, кто использует видеокарты с поддержкой CUDA.