Oossa

llama.cpp unterstützt Hexagon-Puffer und erhöht Standardgröße

Die Open-Source-Bibliothek llama.cpp kann große Tensoren jetzt auf mehrere Puffer verteilen. Außerdem wächst der standardmäßige dynamische Puffer auf 512 MB.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das llama.cpp-Projekt hat am 2026‑10‑08 Version b11490 veröffentlicht. Sie unterstützt die Hexagon-API „alloc_buffer_n“, sodass große Tensoren auf mehrere Puffer verteilt werden können. Die Größe des standardmäßigen dynamischen Puffers steigt von 128 MB auf 512 MB, um Leistungseinbußen bei großen Modellen zu vermeiden. Das neue Flag „--no-embd-offload“ vereinfacht die Befehlszeilen für Geräte, die Embeddings nicht auslagern können. An den Änderungen hat auch Jhen‑Jie Hong mitgewirkt.

Warum es wichtig ist

Entwickler können auf Geräten mit Hexagon-Hardware größere Sprachmodelle effizienter ausführen, ohne die Puffergröße manuell anpassen zu müssen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.