Le projet llama.cpp a publié la version b11482 le 8 oct. 2026. Elle ajoute des noyaux CUDA FWHT prenant en charge les blocs de plus de 512 éléments, avec des tailles allant de 1 024 à 8 192 pour les données FP32 et FP16. Cette évolution réutilise l’infrastructure F16 existante et a passé les tests sur un GPU A10. Les noyaux existants pour les tailles de warp (64 à 512) restent inchangés.
Pourquoi c'est important
Les utilisateurs de GPU peuvent désormais effectuer plus rapidement de plus grandes multiplications matricielles avec llama.cpp.