# llama.cpp reduce a la mitad la memoria del indexador

> La versión b11372 modifica el indexador de Qwen4exp para usar mucha menos RAM, sin perder velocidad, en ejecuciones con contextos largos.

Oossa · 2026-10-03 · https://oossa.com/es/llama-cpp-update-cuts-indexer-memory-use-in-half

El proyecto ggml‑org/llama.cpp publicó la versión b11372 el Oct 3 2026. La actualización reescribe el indexador de Qwen4exp para que cada cabeza calcule su puntuación por separado y escriba los resultados directamente. Así, reduce a la mitad la memoria necesaria para los búferes de puntuación del indexador, que eran los que más memoria consumían en los gráficos de contextos largos. El cambio no afecta la velocidad de cálculo y también añade compatibilidad con el nuevo indexador lightning en los backends CUDA, Metal y Vulkan.

## Los hechos

- La etiqueta de la versión b11372 se publicó el Sat Oct 03 2026
- La memoria destinada a las puntuaciones del indexador se redujo alrededor de un 50 %

## Por qué importa

Los desarrolladores que ejecutan modelos de lenguaje grandes con contextos largos podrán procesar indicaciones más extensas con el mismo hardware.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Última actualización: 2026-10-03
