OossaKI entwickelt sich schnell. Wir erklären es einfach.

llama.cpp v0.2.0: Vorabversion optimiert Hexagon-CPU

Der Open-Source-LLM-Runner aktualisiert sein Hexagon-Backend und beschleunigt so Concat-Operationen auf Snapdragon-Chips.

KurzmeldungOossa1 Min. Lesezeit

Das Projekt ggml-org/llama.cpp hat am 30. September 2026 eine Vorabversion (Tag b11272) veröffentlicht. Sie enthält eine speziell für Hexagon entwickelte Optimierung der Concat-Operation, die bei der Inferenz von Sprachmodellen häufig zum Einsatz kommt. Die Änderung verringert den Paketaufwand und nutzt eine schnellere Divisionsroutine. Dadurch wird die Hot Loop beschleunigt, in der Daten verschoben werden. Das Update ist Teil einer umfassenderen Reihe von Builds für zahlreiche Plattformen, darunter Android-Geräte mit Snapdragon-Chips und Hexagon-NPUs.

Warum es wichtig ist

Damit laufen LLMs auf Snapdragon-Smartphones spürbar schneller. Das senkt die Latenz bei KI-Aufgaben direkt auf dem Gerät.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1ggml-org/llama.cpp b11272 ↗llama.cpp30.09.2026<details open> hexagon: optimize concat op (#29673) * hex-concat: reduce pkts in gather/transpose hot loop gather directly into dst buffer,

1 Quellen

Zuletzt aktualisiert: ·Markdown·llms.txt