# llama.cpp accelera i prompt di GLM sulle GPU Intel Arc

> Le nuove modifiche SYCL aumentano fino a 3× la velocità di elaborazione dei token su una Intel Arc Pro B70 e riducono il traffico di memoria per la flash attention.

Oossa · 2026-10-07 · https://oossa.com/it/llama-cpp-update-speeds-glm-prompts-on-intel-arc-gpu

La libreria llama.cpp ha aggiunto il supporto SYCL, che accelera la flash attention di GLM‑4.7. Su una GPU Intel Arc Pro B70, la velocità di prefill del prompt con un contesto di 8192 token è passata da 432.80 a 1,292.29 token al secondo, quasi triplicando. Un’altra modifica memorizza i punteggi intermedi in precisione dimezzata (F16) invece che in precisione singola, riducendo di qualche punto percentuale i tempi di elaborazione e limitando l’uso della memoria. Le prestazioni negli altri carichi di lavoro sono rimaste invariate.

## I fatti

- La velocità per pp8192 è passata da 432.80 a 1,292.29 tok/s (2.99×) su Intel Arc Pro B70
- La memorizzazione dei punteggi della flash attention in F16 ha aumentato del 4.6% le prestazioni per pp8192 (da 1,583.9 a 1,657.1 tok/s)

## Perché conta

Gli sviluppatori possono eseguire più rapidamente modelli GLM più grandi su GPU Intel Arc a prezzi accessibili, rendendo più reattive le app di IA interattive.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11463](https://github.com/ggml-org/llama.cpp/releases/tag/b11463) – llama.cpp, 2026-10-07

Ultimo aggiornamento: 2026-10-07
