Il progetto llama.cpp ha rilasciato una patch che modifica il modo in cui il codice Vulkan carica i valori float a 32 bit (F32). Sulle GPU Intel, caricare due valori float insieme è più veloce che caricarne uno alla volta, quindi la nuova logica usa un caricamento allineato a 2 nella routine mul_mat_vec. La modifica aggiunge anche un controllo di allineamento che mancava. I benchmark su una scheda di test B60 mostrano fino a 1.63 TFLOPS per determinate dimensioni di matrice, un aumento significativo rispetto alla versione precedente.
Perché conta
Calcoli GPU più veloci consentono inferenze LLM più rapide per chi usa llama.cpp su hardware Intel.