Die llama.cpp-Bibliothek hat SYCL-Unterstützung erhalten, die Flash Attention in GLM‑4.7 beschleunigt. Auf einer Intel Arc Pro B70 stieg die Prompt-Prefill-Geschwindigkeit bei einem Kontext mit 8192 Tokens von 432.80 auf 1,292.29 Tokens pro Sekunde – fast auf das Dreifache. Eine weitere Änderung speichert Zwischenergebnisse in halber Genauigkeit (F16) statt in einfacher Genauigkeit. Das verkürzt die Verarbeitung um einige Prozent und senkt zugleich den Speicherbedarf. Bei anderen Workloads blieb die Leistung unverändert.
Warum es wichtig ist
Entwickler können größere GLM-Modelle auf erschwinglichen Intel-Arc-GPUs schneller ausführen. Das macht interaktive KI-Anwendungen reaktionsschneller.