Oossa

llama.cpp accelera i prompt di GLM sulle GPU Intel Arc

Le nuove modifiche SYCL aumentano fino a 3× la velocità di elaborazione dei token su una Intel Arc Pro B70 e riducono il traffico di memoria per la flash attention.

BreveDi Pubblicato da Oossa: 1 min di lettura

La libreria llama.cpp ha aggiunto il supporto SYCL, che accelera la flash attention di GLM‑4.7. Su una GPU Intel Arc Pro B70, la velocità di prefill del prompt con un contesto di 8192 token è passata da 432.80 a 1,292.29 token al secondo, quasi triplicando. Un’altra modifica memorizza i punteggi intermedi in precisione dimezzata (F16) invece che in precisione singola, riducendo di qualche punto percentuale i tempi di elaborazione e limitando l’uso della memoria. Le prestazioni negli altri carichi di lavoro sono rimaste invariate.

Perché conta

Gli sviluppatori possono eseguire più rapidamente modelli GLM più grandi su GPU Intel Arc a prezzi accessibili, rendendo più reattive le app di IA interattive.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.