Das Projekt ggml-org/llama.cpp hat am 3. Okt. 2026 Version b11372 veröffentlicht. Das Update schreibt den Qwen4exp-Indexer so um, dass jeder Kopf seinen Score separat berechnet und die Ergebnisse direkt an Ort und Stelle speichert. Dadurch halbiert sich der Speicherbedarf der Score-Puffer des Indexers, die in Berechnungsgraphen mit langem Kontext den größten Speicherverbrauch verursachten. Die Änderung wirkt sich nicht auf die Rechengeschwindigkeit aus und ergänzt außerdem die Unterstützung für den neuen Lightning-Indexer in den CUDA-, Metal- und Vulkan-Back-Ends.
Warum es wichtig ist
Entwickler, die große Sprachmodelle mit langem Kontext ausführen, können auf derselben Hardware größere Prompts verarbeiten.