llama.cpp 库新增了 SYCL 支持,可加速 GLM‑4.7 的 Flash Attention。在 Intel Arc Pro B70 GPU 上,处理 8192-token 上下文时的提示词预填充速度从每秒 432.80 个 token 提升至 1,292.29 个,接近原来的 3 倍。另一项改动将中间分数从单精度改为半精度(F16)存储,在减少内存占用的同时,让处理时间缩短了几个百分点。其他工作负载表现不变。
为什么重要
开发者可以在价格亲民的 Intel Arc GPU 上更快运行更大的 GLM 模型,让交互式 AI 应用响应更迅速。