De llama.cpp-bibliotheek heeft SYCL-ondersteuning toegevoegd die de flash attention van GLM‑4.7 versnelt. Op een Intel Arc Pro B70-GPU steeg de snelheid waarmee prompts worden verwerkt bij een context van 8192 tokens van 432.80 naar 1,292.29 tokens per seconde – bijna drie keer zo snel. Een tweede aanpassing slaat tussentijdse scores op in halfprecisie (F16) in plaats van enkelprecisie. Dat scheelt enkele procenten verwerkingstijd en vermindert het geheugengebruik. Andere workloads bleven gelijk.
Waarom het ertoe doet
Ontwikkelaars kunnen grotere GLM-modellen sneller draaien op betaalbare Intel Arc-GPU’s, waardoor interactieve AI-apps sneller reageren.