llama.cppプロジェクトは、Vulkanコードにおける32ビット浮動小数点数(F32)の読み込み方法を変更するパッチを公開した。Intel GPUでは、浮動小数点数を1つずつ読み込むより、2つまとめて読み込むほうが高速なため、新しい処理ではmul_mat_vecルーチンで2要素アラインの読み込みを使う。また、不足していたアラインメントチェックも追加した。B60テストボードでのベンチマークでは、特定の行列サイズで最大1.63 TFLOPSを記録し、前バージョンから大幅に向上した。
なぜ重要か
GPU演算の高速化により、Intel製ハードウェアでllama.cppを使うユーザーはLLMの推論をより速く実行できる。