# llama.cpp dimezza la memoria usata dall’indexer

> La versione b11372 modifica l’indexer di Qwen4exp per ridurre drasticamente l’uso di RAM, senza rallentare l’elaborazione dei contesti lunghi.

Oossa · 2026-10-03 · https://oossa.com/it/llama-cpp-update-cuts-indexer-memory-use-in-half

Il progetto ggml‑org/llama.cpp ha rilasciato la versione b11372 il 3 ottobre 2026. L’aggiornamento riscrive l’indexer di Qwen4exp, in modo che ogni head calcoli il proprio punteggio separatamente e scriva i risultati direttamente in memoria. Così si dimezza la memoria necessaria per i buffer dei punteggi dell’indexer, che nei grafi con contesti lunghi erano quelli che ne consumavano di più. La modifica non incide sulla velocità di calcolo e aggiunge anche il supporto al nuovo lightning indexer sui backend CUDA, Metal e Vulkan.

## I fatti

- Tag di rilascio b11372 pubblicato sabato 3 ottobre 2026
- Memoria usata per i punteggi dell’indexer ridotta di circa il 50%

## Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni con contesti lunghi potranno gestire prompt più ampi sullo stesso hardware.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Ultimo aggiornamento: 2026-10-03
