Oossa

Обновление llama.cpp вдвое снижает расход памяти индексатора

В версии b11372 индексатор Qwen4exp использует гораздо меньше ОЗУ без потери скорости при работе с длинным контекстом.

ЗаметкаOossaОпубликовано Oossa: 1 мин чтения

Проект ggml‑org/llama.cpp выпустил версию b11372 3 октября 2026 года. В обновлении переработан индексатор Qwen4exp: теперь каждая голова отдельно вычисляет свою оценку и записывает результат на месте. Благодаря этому память, необходимая для буферов оценок индексатора, сокращается вдвое. Именно эти буферы потребляли больше всего памяти в графах с длинным контекстом. Изменение не влияет на скорость вычислений; кроме того, добавлена поддержка нового lightning-индексатора в бэкендах CUDA, Metal и Vulkan.

Почему это важно

Разработчики, запускающие большие языковые модели с длинным контекстом, смогут обрабатывать более объёмные запросы на том же оборудовании.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.