# llama.cpp versnelt GLM-prompts op Intel Arc-GPU

> De nieuwe SYCL-aanpassingen verhogen de tokensnelheid op een Intel Arc Pro B70 tot 3× en verminderen het geheugengebruik van flash attention.

Oossa · 2026-10-07 · https://oossa.com/nl/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

De llama.cpp-bibliotheek heeft SYCL-ondersteuning toegevoegd die de flash attention van GLM‑4.7 versnelt. Op een Intel Arc Pro B70-GPU steeg de snelheid waarmee prompts worden verwerkt bij een context van 8192 tokens van 432.80 naar 1,292.29 tokens per seconde – bijna drie keer zo snel. Een tweede aanpassing slaat tussentijdse scores op in halfprecisie (F16) in plaats van enkelprecisie. Dat scheelt enkele procenten verwerkingstijd en vermindert het geheugengebruik. Andere workloads bleven gelijk.

## De feiten

- De tokensnelheid bij pp8192 steeg op de Intel Arc Pro B70 van 432.80 naar 1,292.29 tok/s (2.99×)
- Het opslaan van flash-attention-scores in F16 leverde bij pp8192 een snelheidswinst van 4.6% op (1,583.9 → 1,657.1 tok/s)

## Waarom het ertoe doet

Ontwikkelaars kunnen grotere GLM-modellen sneller draaien op betaalbare Intel Arc-GPU’s, waardoor interactieve AI-apps sneller reageren.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Laatst bijgewerkt: 2026-10-07
