llama.cppプロジェクトは2026‑10‑08にバージョンb11490をリリースしました。Hexagonの「alloc_buffer_n」APIに対応し、大きなテンソルを複数のバッファに分割できるようになりました。大規模モデルで性能が低下するのを避けるため、動的バッファの既定サイズを128 MBから512 MBに拡大しました。また、埋め込みのオフロードに対応しないデバイスでコマンドラインを簡潔にできる、新しい「--no-embd-offload」フラグも追加されました。これらの変更はJhen‑Jie Hongとの共同開発です。
なぜ重要か
Hexagonベースのハードウェアを使う開発者は、バッファを手動で調整しなくても、より大きな言語モデルを効率よく実行できます。