# llama.cpp halbiert Speicherbedarf des Indexers

> Version b11372 senkt den RAM-Bedarf des Qwen4exp-Indexers bei langen Kontexten deutlich – ohne Geschwindigkeitsverlust.

Oossa · 2026-10-03 · https://oossa.com/de/llama-cpp-update-cuts-indexer-memory-use-in-half

Das Projekt ggml-org/llama.cpp hat am 3. Okt. 2026 Version b11372 veröffentlicht. Das Update schreibt den Qwen4exp-Indexer so um, dass jeder Kopf seinen Score separat berechnet und die Ergebnisse direkt an Ort und Stelle speichert. Dadurch halbiert sich der Speicherbedarf der Score-Puffer des Indexers, die in Berechnungsgraphen mit langem Kontext den größten Speicherverbrauch verursachten. Die Änderung wirkt sich nicht auf die Rechengeschwindigkeit aus und ergänzt außerdem die Unterstützung für den neuen Lightning-Indexer in den CUDA-, Metal- und Vulkan-Back-Ends.

## Die Fakten

- Release-Tag b11372 am Samstag, dem 3. Okt. 2026, veröffentlicht
- Speicherbedarf der Indexer-Scores um etwa 50 % reduziert

## Warum es wichtig ist

Entwickler, die große Sprachmodelle mit langem Kontext ausführen, können auf derselben Hardware größere Prompts verarbeiten.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Zuletzt aktualisiert: 2026-10-03
