OossaAIは急速に進化しています。私たちがわかりやすく解説します。

llama.cpp、Intel VulkanビルドでF32の2要素アライン読み込みに対応

Intel GPUで一度に2つの浮動小数点数を読み込むことで、行列乗算を高速化する。

短信Oossa1 分で読める

llama.cppプロジェクトは、Vulkanコードにおける32ビット浮動小数点数(F32)の読み込み方法を変更するパッチを公開した。Intel GPUでは、浮動小数点数を1つずつ読み込むより、2つまとめて読み込むほうが高速なため、新しい処理ではmul_mat_vecルーチンで2要素アラインの読み込みを使う。また、不足していたアラインメントチェックも追加した。B60テストボードでのベンチマークでは、特定の行列サイズで最大1.63 TFLOPSを記録し、前バージョンから大幅に向上した。

なぜ重要か

GPU演算の高速化により、Intel製ハードウェアでllama.cppを使うユーザーはLLMの推論をより速く実行できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。

出典と参考資料

#出典媒体日付要点
1ggml-org/llama.cpp b11266 ↗llama.cpp2026/09/29<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp2026/09/30<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 件の出典

最終更新: ·Markdown·llms.txt