# llama.cppの更新でIntel Arc GPUのGLM処理が高速化

> SYCLの新たな変更により、Intel Arc Pro B70でトークン処理速度が最大3倍に。Flash Attentionのメモリ転送量も削減される。

Oossa · 2026-10-07 · https://oossa.com/ja/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

llama.cppライブラリに、GLM‑4.7のFlash Attentionを高速化するSYCLサポートが追加された。Intel Arc Pro B70 GPUでは、8192トークンのコンテキストにおけるプロンプトのプリフィル速度が毎秒432.80トークンから1,292.29トークンへ上昇し、ほぼ3倍になった。別の変更では、中間スコアを単精度ではなく半精度（F16）で保存することで、メモリ使用量を抑えながら処理時間を数％短縮した。ほかのワークロードに変化はなかった。

## 事実

- Intel Arc Pro B70で、pp8192のトークン処理速度が毎秒432.80トークンから1,292.29トークンへ向上（2.99倍）
- Flash AttentionのスコアをF16で保存すると、pp8192の処理速度が4.6％向上（毎秒1,583.9トークンから1,657.1トークン）

## なぜ重要か

開発者は手頃な価格のIntel Arc GPUで、より大規模なGLMモデルを高速に動かせるようになり、対話型AIアプリの応答性向上につながる。

## 出典と参考資料

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

最終更新: 2026-10-07
