Il progetto llama.cpp ha pubblicato la versione b11482 l’8 ottobre 2026. Aggiunge kernel CUDA FWHT compatibili con larghezze dei blocchi superiori a 512, estendendo il supporto da 1,024 a 8,192 per i dati FP32 e FP16. La modifica riutilizza l’infrastruttura F16 esistente e supera i test su una GPU A10. I kernel esistenti per larghezze di warp (64-512) restano invariati.
Perché conta
Gli utenti GPU possono ora eseguire moltiplicazioni di matrici con larghezze maggiori e più velocemente con llama.cpp.