# llama.cpp、Intel VulkanビルドでF32の2要素アライン読み込みに対応

> Intel GPUで一度に2つの浮動小数点数を読み込むことで、行列乗算を高速化する。

Oossa · 2026-09-30 · https://oossa.com/ja/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

llama.cppプロジェクトは、Vulkanコードにおける32ビット浮動小数点数（F32）の読み込み方法を変更するパッチを公開した。Intel GPUでは、浮動小数点数を1つずつ読み込むより、2つまとめて読み込むほうが高速なため、新しい処理ではmul_mat_vecルーチンで2要素アラインの読み込みを使う。また、不足していたアラインメントチェックも追加した。B60テストボードでのベンチマークでは、特定の行列サイズで最大1.63 TFLOPSを記録し、前バージョンから大幅に向上した。

## 事実

- パッチは2026年9月30日に公開（b11266）
- 4096×8×14336の行列で最大1.63 TFLOPSに高速化

## なぜ重要か

GPU演算の高速化により、Intel製ハードウェアでllama.cppを使うユーザーはLLMの推論をより速く実行できる。

## 出典と参考資料

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

最終更新: 2026-09-30
