El proyecto llama.cpp publicó la versión b11482 el 8 de octubre de 2026. Añade kernels CUDA FWHT compatibles con bloques de más de 512 elementos y amplía el soporte a tamaños de 1.024 a 8.192, tanto para datos FP32 como FP16. El cambio reutiliza la infraestructura F16 existente y supera las pruebas en una GPU A10. Los kernels existentes para tamaños de warp (64-512) no cambian.
Por qué importa
Ahora, quienes usan GPU pueden ejecutar multiplicaciones de matrices con bloques más grandes y mayor rapidez en llama.cpp.