OossaL'IA evolve in fretta. Noi la spieghiamo in modo semplice.

llama.cpp introduce caricamenti F32 allineati a 2 per Intel Vulkan

L’aggiornamento accelera la moltiplicazione di matrici sulle GPU Intel caricando due valori float alla volta.

BreveOossa1 min di lettura

Il progetto llama.cpp ha rilasciato una patch che modifica il modo in cui il codice Vulkan carica i valori float a 32 bit (F32). Sulle GPU Intel, caricare due valori float insieme è più veloce che caricarne uno alla volta, quindi la nuova logica usa un caricamento allineato a 2 nella routine mul_mat_vec. La modifica aggiunge anche un controllo di allineamento che mancava. I benchmark su una scheda di test B60 mostrano fino a 1.63 TFLOPS per determinate dimensioni di matrice, un aumento significativo rispetto alla versione precedente.

Perché conta

Calcoli GPU più veloci consentono inferenze LLM più rapide per chi usa llama.cpp su hardware Intel.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.

Fonti e riferimenti

#FonteTestataDataPunto chiave
1ggml-org/llama.cpp b11266 ↗llama.cpp29 set 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 set 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 fonti

Ultimo aggiornamento: ·Markdown·llms.txt