# llama.cpp añade kernels CUDA para bloques de más de 512

> La versión del 8 de octubre de 2026 incorpora nuevos kernels de transformada rápida de Fourier-Hadamard, compatibles con bloques de 1.024 a 8.192 elementos en GPU NVIDIA.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

El proyecto llama.cpp publicó la versión b11482 el 8 de octubre de 2026. Añade kernels CUDA FWHT compatibles con bloques de más de 512 elementos y amplía el soporte a tamaños de 1.024 a 8.192, tanto para datos FP32 como FP16. El cambio reutiliza la infraestructura F16 existente y supera las pruebas en una GPU A10. Los kernels existentes para tamaños de warp (64-512) no cambian.

## Los hechos

- Etiqueta de versión b11482, publicada el 8 de octubre de 2026
- Los nuevos kernels admiten tamaños de 1.024 a 8.192 para FP32 y FP16

## Por qué importa

Ahora, quienes usan GPU pueden ejecutar multiplicaciones de matrices con bloques más grandes y mayor rapidez en llama.cpp.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

Última actualización: 2026-10-08
