# llama.cpp beschleunigt GLM-Prompts auf Intel-Arc-GPUs

> Neue SYCL-Änderungen steigern den Token-Durchsatz auf einer Intel Arc Pro B70 um bis zu das Dreifache und verringern den Speicherverkehr bei Flash Attention.

Oossa · 2026-10-07 · https://oossa.com/de/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

Die llama.cpp-Bibliothek hat SYCL-Unterstützung erhalten, die Flash Attention in GLM‑4.7 beschleunigt. Auf einer Intel Arc Pro B70 stieg die Prompt-Prefill-Geschwindigkeit bei einem Kontext mit 8192 Tokens von 432.80 auf 1,292.29 Tokens pro Sekunde – fast auf das Dreifache. Eine weitere Änderung speichert Zwischenergebnisse in halber Genauigkeit (F16) statt in einfacher Genauigkeit. Das verkürzt die Verarbeitung um einige Prozent und senkt zugleich den Speicherbedarf. Bei anderen Workloads blieb die Leistung unverändert.

## Die Fakten

- Die Tokenrate bei pp8192 stieg auf einer Intel Arc Pro B70 von 432.80 auf 1,292.29 tok/s (2.99×).
- Die Speicherung der Flash-Attention-Scores in F16 brachte bei pp8192 einen Leistungszuwachs von 4.6 % (1,583.9 → 1,657.1 tok/s).

## Warum es wichtig ist

Entwickler können größere GLM-Modelle auf erschwinglichen Intel-Arc-GPUs schneller ausführen. Das macht interaktive KI-Anwendungen reaktionsschneller.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Zuletzt aktualisiert: 2026-10-07
