ggml-orgチームは2026年10月9日、llama.cpp(リリース b11518)を更新しました。今回の更新ではMetal向けに128ビットおよび96ビットのFlash Attentionカーネルが追加され、Apple Silicon搭載Macでの推論が高速化します。macOS(arm64)、macOS(Intel)、iOS、および複数のLinux構成向けのビルド済みバイナリをダウンロードできます。
なぜ重要か
Apple Silicon搭載機のユーザーは、GPUハードウェアを追加購入せずにLLMをより高速に実行できます。