Het llama.cpp-project bracht op 8 okt 2026 versie b11482 uit. Deze voegt CUDA-FWHT-kernels toe voor blokbreedtes boven 512 en breidt de ondersteuning uit naar 1.024–8.192 voor zowel FP32- als FP16-data. De wijziging hergebruikt de bestaande F16-infrastructuur en is getest op een A10-GPU. De bestaande kernels voor warpbreedtes (64–512) blijven ongewijzigd.
Waarom het ertoe doet
GPU-gebruikers kunnen nu met llama.cpp sneller matrixvermenigvuldigingen met grotere breedtes uitvoeren.