# llama.cpp ergänzt CUDA-Kernels für Blockbreiten über 512

> Die am 8. Okt. 2026 veröffentlichte Version bringt neue schnelle Fast-Fourier-Hadamard-Kernels für NVIDIA-GPUs mit Breiten von 1.024 bis 8.192.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

Das llama.cpp-Projekt hat am 8. Okt. 2026 Version b11482 veröffentlicht. Sie ergänzt CUDA-FWHT-Kernels für Blockbreiten über 512 und erweitert die Unterstützung auf 1.024 bis 8.192 für FP32- und FP16-Daten. Die Änderung nutzt die bestehende F16-Infrastruktur weiter und besteht die Tests auf einer A10-GPU. Die bisherigen Kernels für Warp-Breiten (64–512) bleiben unverändert.

## Die Fakten

- Release-Tag b11482, veröffentlicht am 8. Okt. 2026
- Neue Kernels unterstützen Breiten von 1.024 bis 8.192 für FP32 und FP16

## Warum es wichtig ist

GPU-Nutzer können mit llama.cpp jetzt Matrixmultiplikationen mit größeren Blockbreiten schneller ausführen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
