Oossa

llama.cppの更新でIntel Arc GPUのGLM処理が高速化

SYCLの新たな変更により、Intel Arc Pro B70でトークン処理速度が最大3倍に。Flash Attentionのメモリ転送量も削減される。

短信著者: Oossa公開日: 1 分で読める

llama.cppライブラリに、GLM‑4.7のFlash Attentionを高速化するSYCLサポートが追加された。Intel Arc Pro B70 GPUでは、8192トークンのコンテキストにおけるプロンプトのプリフィル速度が毎秒432.80トークンから1,292.29トークンへ上昇し、ほぼ3倍になった。別の変更では、中間スコアを単精度ではなく半精度(F16)で保存することで、メモリ使用量を抑えながら処理時間を数%短縮した。ほかのワークロードに変化はなかった。

なぜ重要か

開発者は手頃な価格のIntel Arc GPUで、より大規模なGLMモデルを高速に動かせるようになり、対話型AIアプリの応答性向上につながる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。