# llama.cpp、macOS向けMetalのFlash Attentionカーネルを追加

> 2026年10月9日、Apple Silicon向けに128/96ビットのFlash Attentionをサポートした新しいバイナリが公開されました。

Oossa · 2026-10-09 · https://oossa.com/ja/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

ggml-orgチームは2026年10月9日、llama.cpp（リリース b11518）を更新しました。今回の更新ではMetal向けに128ビットおよび96ビットのFlash Attentionカーネルが追加され、Apple Silicon搭載Macでの推論が高速化します。macOS（arm64）、macOS（Intel）、iOS、および複数のLinux構成向けのビルド済みバイナリをダウンロードできます。

## 事実

- リリースタグ b11518 は2026年10月9日（金）に公開
- Apple Silicon向けにMetalのFlash Attentionカーネル（128/96）を追加

## なぜ重要か

Apple Silicon搭載機のユーザーは、GPUハードウェアを追加購入せずにLLMをより高速に実行できます。

## 出典と参考資料

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

最終更新: 2026-10-09
