Oossa

llama.cpp voegt CUDA-kernels toe voor blokbreedtes boven 512

De release van 8 okt 2026 introduceert nieuwe fast-Fourier-Hadamard-kernels voor breedtes van 1.024 tot 8.192 op NVIDIA-GPU’s.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht op 8 okt 2026 versie b11482 uit. Deze voegt CUDA-FWHT-kernels toe voor blokbreedtes boven 512 en breidt de ondersteuning uit naar 1.024–8.192 voor zowel FP32- als FP16-data. De wijziging hergebruikt de bestaande F16-infrastructuur en is getest op een A10-GPU. De bestaande kernels voor warpbreedtes (64–512) blijven ongewijzigd.

Waarom het ertoe doet

GPU-gebruikers kunnen nu met llama.cpp sneller matrixvermenigvuldigingen met grotere breedtes uitvoeren.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.