Oossa

llama.cpp beschleunigt GLM-Prompts auf Intel-Arc-GPUs

Neue SYCL-Änderungen steigern den Token-Durchsatz auf einer Intel Arc Pro B70 um bis zu das Dreifache und verringern den Speicherverkehr bei Flash Attention.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Die llama.cpp-Bibliothek hat SYCL-Unterstützung erhalten, die Flash Attention in GLM‑4.7 beschleunigt. Auf einer Intel Arc Pro B70 stieg die Prompt-Prefill-Geschwindigkeit bei einem Kontext mit 8192 Tokens von 432.80 auf 1,292.29 Tokens pro Sekunde – fast auf das Dreifache. Eine weitere Änderung speichert Zwischenergebnisse in halber Genauigkeit (F16) statt in einfacher Genauigkeit. Das verkürzt die Verarbeitung um einige Prozent und senkt zugleich den Speicherbedarf. Bei anderen Workloads blieb die Leistung unverändert.

Warum es wichtig ist

Entwickler können größere GLM-Modelle auf erschwinglichen Intel-Arc-GPUs schneller ausführen. Das macht interaktive KI-Anwendungen reaktionsschneller.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.