Oossa

llama.cpp añade kernels CUDA para bloques de más de 512

La versión del 8 de octubre de 2026 incorpora nuevos kernels de transformada rápida de Fourier-Hadamard, compatibles con bloques de 1.024 a 8.192 elementos en GPU NVIDIA.

BrevePor Publicado por Oossa: 1 min de lectura

El proyecto llama.cpp publicó la versión b11482 el 8 de octubre de 2026. Añade kernels CUDA FWHT compatibles con bloques de más de 512 elementos y amplía el soporte a tamaños de 1.024 a 8.192, tanto para datos FP32 como FP16. El cambio reutiliza la infraestructura F16 existente y supera las pruebas en una GPU A10. Los kernels existentes para tamaños de warp (64-512) no cambian.

Por qué importa

Ahora, quienes usan GPU pueden ejecutar multiplicaciones de matrices con bloques más grandes y mayor rapidez en llama.cpp.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.