# llama.cpp v0.2.0: Vorabversion optimiert Hexagon-CPU

> Der Open-Source-LLM-Runner aktualisiert sein Hexagon-Backend und beschleunigt so Concat-Operationen auf Snapdragon-Chips.

Oossa · 2026-09-30 · https://oossa.com/de/llama-cpp-v0-2-0-pre-release-adds-hexagon-cpu-optimizations

Das Projekt ggml-org/llama.cpp hat am 30. September 2026 eine Vorabversion (Tag b11272) veröffentlicht. Sie enthält eine speziell für Hexagon entwickelte Optimierung der Concat-Operation, die bei der Inferenz von Sprachmodellen häufig zum Einsatz kommt. Die Änderung verringert den Paketaufwand und nutzt eine schnellere Divisionsroutine. Dadurch wird die Hot Loop beschleunigt, in der Daten verschoben werden. Das Update ist Teil einer umfassenderen Reihe von Builds für zahlreiche Plattformen, darunter Android-Geräte mit Snapdragon-Chips und Hexagon-NPUs.

## Die Fakten

- Release-Tag: b11272 (Commit 7fee178), veröffentlicht am 30. September 2026
- Die Hexagon-Optimierung für Concat senkt die Paketanzahl und nutzt eine schnelle Divisionsinstruktion.

## Warum es wichtig ist

Damit laufen LLMs auf Snapdragon-Smartphones spürbar schneller. Das senkt die Latenz bei KI-Aufgaben direkt auf dem Gerät.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11272](https://github.com/ggml-org/llama.cpp/releases/tag/b11272) – llama.cpp, 2026-09-30

Zuletzt aktualisiert: 2026-09-30
