La libreria llama.cpp ha aggiunto il supporto SYCL, che accelera la flash attention di GLM‑4.7. Su una GPU Intel Arc Pro B70, la velocità di prefill del prompt con un contesto di 8192 token è passata da 432.80 a 1,292.29 token al secondo, quasi triplicando. Un’altra modifica memorizza i punteggi intermedi in precisione dimezzata (F16) invece che in precisione singola, riducendo di qualche punto percentuale i tempi di elaborazione e limitando l’uso della memoria. Le prestazioni negli altri carichi di lavoro sono rimaste invariate.
Perché conta
Gli sviluppatori possono eseguire più rapidamente modelli GLM più grandi su GPU Intel Arc a prezzi accessibili, rendendo più reattive le app di IA interattive.