# Обновление llama.cpp вдвое снижает расход памяти индексатора

> В версии b11372 индексатор Qwen4exp использует гораздо меньше ОЗУ без потери скорости при работе с длинным контекстом.

Oossa · 2026-10-03 · https://oossa.com/ru/llama-cpp-update-cuts-indexer-memory-use-in-half

Проект ggml‑org/llama.cpp выпустил версию b11372 3 октября 2026 года. В обновлении переработан индексатор Qwen4exp: теперь каждая голова отдельно вычисляет свою оценку и записывает результат на месте. Благодаря этому память, необходимая для буферов оценок индексатора, сокращается вдвое. Именно эти буферы потребляли больше всего памяти в графах с длинным контекстом. Изменение не влияет на скорость вычислений; кроме того, добавлена поддержка нового lightning-индексатора в бэкендах CUDA, Metal и Vulkan.

## Факты

- Тег релиза b11372 опубликован в субботу, 3 октября 2026 года
- Потребление памяти для оценок индексатора снизилось примерно на 50 %

## Почему это важно

Разработчики, запускающие большие языковые модели с длинным контекстом, смогут обрабатывать более объёмные запросы на том же оборудовании.

## Источники и ссылки

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Обновлено: 2026-10-03
