Проект ggml‑org/llama.cpp выпустил версию b11372 3 октября 2026 года. В обновлении переработан индексатор Qwen4exp: теперь каждая голова отдельно вычисляет свою оценку и записывает результат на месте. Благодаря этому память, необходимая для буферов оценок индексатора, сокращается вдвое. Именно эти буферы потребляли больше всего памяти в графах с длинным контекстом. Изменение не влияет на скорость вычислений; кроме того, добавлена поддержка нового lightning-индексатора в бэкендах CUDA, Metal и Vulkan.
Почему это важно
Разработчики, запускающие большие языковые модели с длинным контекстом, смогут обрабатывать более объёмные запросы на том же оборудовании.