Команда ggml-org выпустила llama.cpp версии b11534 2026-10-09. В обновлении копирование снимков состояния объединено с копированием в рекуррентный кэш, а при K = 1 — в режиме декодирования без спекулятивной обработки — удалены лишние копирования в CUDA. Изменения затрагивают только бэкенд CUDA, поэтому сборки для CPU и Vulkan не изменились. Для скачивания доступны готовые сборки для macOS, iOS и нескольких вариантов Ubuntu.
В версии с CUDA пользователи должны заметить небольшое сокращение объёма передаваемых данных в памяти GPU, что может повысить скорость на поддерживаемом оборудовании.
Почему это важно
Пользователи CUDA могут получить более высокую скорость инференса, поскольку библиотека теперь перемещает меньше данных на GPU.