Oossa

llama.cpp versnelt GLM-prompts op Intel Arc-GPU

De nieuwe SYCL-aanpassingen verhogen de tokensnelheid op een Intel Arc Pro B70 tot 3× en verminderen het geheugengebruik van flash attention.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

De llama.cpp-bibliotheek heeft SYCL-ondersteuning toegevoegd die de flash attention van GLM‑4.7 versnelt. Op een Intel Arc Pro B70-GPU steeg de snelheid waarmee prompts worden verwerkt bij een context van 8192 tokens van 432.80 naar 1,292.29 tokens per seconde – bijna drie keer zo snel. Een tweede aanpassing slaat tussentijdse scores op in halfprecisie (F16) in plaats van enkelprecisie. Dat scheelt enkele procenten verwerkingstijd en vermindert het geheugengebruik. Andere workloads bleven gelijk.

Waarom het ertoe doet

Ontwikkelaars kunnen grotere GLM-modellen sneller draaien op betaalbare Intel Arc-GPU’s, waardoor interactieve AI-apps sneller reageren.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.