O projeto llama.cpp lançou a versão b11482 em 8 de outubro de 2026. Ela adiciona kernels CUDA FWHT compatíveis com larguras de bloco acima de 512, ampliando o suporte para 1.024 a 8.192 em dados FP32 e FP16. A mudança reaproveita a infraestrutura F16 existente e passou nos testes em uma GPU A10. Os kernels existentes para larguras de warp (64 a 512) permanecem inalterados.
Por que importa
Usuários de GPU agora podem executar multiplicações de matrizes com larguras maiores e mais rapidez no llama.cpp.