Das llama.cpp-Projekt hat am 2026‑10‑08 Version b11490 veröffentlicht. Sie unterstützt die Hexagon-API „alloc_buffer_n“, sodass große Tensoren auf mehrere Puffer verteilt werden können. Die Größe des standardmäßigen dynamischen Puffers steigt von 128 MB auf 512 MB, um Leistungseinbußen bei großen Modellen zu vermeiden. Das neue Flag „--no-embd-offload“ vereinfacht die Befehlszeilen für Geräte, die Embeddings nicht auslagern können. An den Änderungen hat auch Jhen‑Jie Hong mitgewirkt.
Warum es wichtig ist
Entwickler können auf Geräten mit Hexagon-Hardware größere Sprachmodelle effizienter ausführen, ohne die Puffergröße manuell anpassen zu müssen.