llama.cppライブラリに、GLM‑4.7のFlash Attentionを高速化するSYCLサポートが追加された。Intel Arc Pro B70 GPUでは、8192トークンのコンテキストにおけるプロンプトのプリフィル速度が毎秒432.80トークンから1,292.29トークンへ上昇し、ほぼ3倍になった。別の変更では、中間スコアを単精度ではなく半精度(F16)で保存することで、メモリ使用量を抑えながら処理時間を数%短縮した。ほかのワークロードに変化はなかった。
なぜ重要か
開発者は手頃な価格のIntel Arc GPUで、より大規模なGLMモデルを高速に動かせるようになり、対話型AIアプリの応答性向上につながる。