# llama.cpp snabbar upp GLM-prompter på Intel Arc

> De nya SYCL-ändringarna ökar tokengenomströmningen med upp till 3× på ett Intel Arc Pro B70 och minskar minnestrafiken för flash attention.

Oossa · 2026-10-07 · https://oossa.com/sv/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

Biblioteket llama.cpp har fått stöd för SYCL, vilket snabbar upp flash attention i GLM‑4.7. På ett Intel Arc Pro B70-grafikkort ökade hastigheten för promptförbearbetning med en kontext på 8192 token från 432.80 till 1,292.29 token per sekund – nästan tre gånger snabbare. En annan justering lagrar mellanliggande poäng med halv precision (F16) i stället för enkel precision, vilket kapar bearbetningstiden med några procent och samtidigt minskar minnesanvändningen. Övriga arbetsbelastningar förblev oförändrade.

## Fakta

- Tokentakten för pp8192 ökade från 432.80 till 1,292.29 tok/s (2.99×) på Intel Arc Pro B70
- Lagring av flash-attention-poäng i F16 gav en ökning på 4.6% för pp8192 (1,583.9 → 1,657.1 tok/s)

## Varför det spelar roll

Utvecklare kan köra större GLM-modeller snabbare på prisvärda Intel Arc-grafikkort, vilket gör AI-appar med interaktiva funktioner mer responsiva.

## Källor och referenser

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Senast uppdaterad: 2026-10-07
