# llama.cpp unterstützt Hexagon-Puffer und erhöht Standardgröße

> Die Open-Source-Bibliothek llama.cpp kann große Tensoren jetzt auf mehrere Puffer verteilen. Außerdem wächst der standardmäßige dynamische Puffer auf 512 MB.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-adds-hexagon-buffer-support-and-larger-default-allocation

Das llama.cpp-Projekt hat am 2026‑10‑08 Version b11490 veröffentlicht. Sie unterstützt die Hexagon-API „alloc_buffer_n“, sodass große Tensoren auf mehrere Puffer verteilt werden können. Die Größe des standardmäßigen dynamischen Puffers steigt von 128 MB auf 512 MB, um Leistungseinbußen bei großen Modellen zu vermeiden. Das neue Flag „--no-embd-offload“ vereinfacht die Befehlszeilen für Geräte, die Embeddings nicht auslagern können. An den Änderungen hat auch Jhen‑Jie Hong mitgewirkt.

## Die Fakten

- Veröffentlichungsdatum: 2026‑10‑08 („Thu Oct 08 2026 06:58:59 GMT+0200“)
- Der standardmäßige dynamische Puffer wurde auf 512 MB erhöht

## Warum es wichtig ist

Entwickler können auf Geräten mit Hexagon-Hardware größere Sprachmodelle effizienter ausführen, ohne die Puffergröße manuell anpassen zu müssen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11490](https://github.com/ggml-org/llama.cpp/releases/tag/b11490) – llama.cpp, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
