ggml-org/llama.cppプロジェクトは2026年9月30日、先行リリース版(タグ:b11272)を公開した。言語モデルの推論でよく使われるconcat(連結)処理に、Hexagon向けの最適化が加わった。パケットのオーバーヘッドを減らし、より高速な除算処理を使うことで、データを移動させるホットループを高速化する。この更新は、Hexagon NPUを搭載したAndroidのSnapdragon端末を含む、幅広いプラットフォーム向けビルドの一環だ。
なぜ重要か
Snapdragon搭載スマートフォンでLLMを実行する際の速度が大幅に向上し、オンデバイスAIタスクの遅延が短くなる。