Das llama.cpp-Projekt hat am 8. Okt. 2026 Version b11482 veröffentlicht. Sie ergänzt CUDA-FWHT-Kernels für Blockbreiten über 512 und erweitert die Unterstützung auf 1.024 bis 8.192 für FP32- und FP16-Daten. Die Änderung nutzt die bestehende F16-Infrastruktur weiter und besteht die Tests auf einer A10-GPU. Die bisherigen Kernels für Warp-Breiten (64–512) bleiben unverändert.
Warum es wichtig ist
GPU-Nutzer können mit llama.cpp jetzt Matrixmultiplikationen mit größeren Blockbreiten schneller ausführen.