# llama.cpp divise par deux la mémoire de l’indexeur

> La version b11372 réduit fortement la RAM utilisée par l’indexeur Qwen4exp, sans ralentissement, pour les contextes longs.

Oossa · 2026-10-03 · https://oossa.com/fr/llama-cpp-update-cuts-indexer-memory-use-in-half

Le projet ggml‑org/llama.cpp a publié la version b11372 le 3 octobre 2026. Cette mise à jour remanie l’indexeur Qwen4exp : chaque tête calcule son score séparément et écrit les résultats directement en mémoire. La mémoire nécessaire aux tampons de scores de l’indexeur — les principaux consommateurs de mémoire dans les graphes à contexte long — est ainsi divisée par deux. Ce changement n’a aucun effet sur la vitesse de calcul et ajoute également la prise en charge du nouvel indexeur lightning sur les backends CUDA, Metal et Vulkan.

## Les faits

- Version b11372 publiée le samedi 3 octobre 2026
- Mémoire utilisée pour les scores de l’indexeur réduite d’environ 50 %

## Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage avec un long contexte pourront traiter des invites plus longues sur le même matériel.

## Sources et références

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Dernière mise à jour: 2026-10-03
