# llama.cpp introduce caricamenti F32 allineati a 2 per Intel Vulkan

> L’aggiornamento accelera la moltiplicazione di matrici sulle GPU Intel caricando due valori float alla volta.

Oossa · 2026-09-30 · https://oossa.com/it/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Il progetto llama.cpp ha rilasciato una patch che modifica il modo in cui il codice Vulkan carica i valori float a 32 bit (F32). Sulle GPU Intel, caricare due valori float insieme è più veloce che caricarne uno alla volta, quindi la nuova logica usa un caricamento allineato a 2 nella routine mul_mat_vec. La modifica aggiunge anche un controllo di allineamento che mancava. I benchmark su una scheda di test B60 mostrano fino a 1.63 TFLOPS per determinate dimensioni di matrice, un aumento significativo rispetto alla versione precedente.

## I fatti

- Patch rilasciata il 30 settembre 2026 (b11266)
- Velocità fino a 1.63 TFLOPS su una matrice 4096×8×14336

## Perché conta

Calcoli GPU più veloci consentono inferenze LLM più rapide per chi usa llama.cpp su hardware Intel.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Ultimo aggiornamento: 2026-09-30
