Oossa

llama.cpp ergänzt CUDA-Kernels für Blockbreiten über 512

Die am 8. Okt. 2026 veröffentlichte Version bringt neue schnelle Fast-Fourier-Hadamard-Kernels für NVIDIA-GPUs mit Breiten von 1.024 bis 8.192.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das llama.cpp-Projekt hat am 8. Okt. 2026 Version b11482 veröffentlicht. Sie ergänzt CUDA-FWHT-Kernels für Blockbreiten über 512 und erweitert die Unterstützung auf 1.024 bis 8.192 für FP32- und FP16-Daten. Die Änderung nutzt die bestehende F16-Infrastruktur weiter und besteht die Tests auf einer A10-GPU. Die bisherigen Kernels für Warp-Breiten (64–512) bleiben unverändert.

Warum es wichtig ist

GPU-Nutzer können mit llama.cpp jetzt Matrixmultiplikationen mit größeren Blockbreiten schneller ausführen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.