Projektet llama.cpp släppte version b11482 den 8 okt. 2026. Den innehåller CUDA FWHT-kärnor som klarar blockbredder över 512 och utökar stödet till 1 024–8 192 för både FP32- och FP16-data. Ändringen återanvänder den befintliga F16-infrastrukturen och har klarat tester på en A10-GPU. De befintliga kärnorna för warp-bredder (64–512) är oförändrade.
Varför det spelar roll
GPU-användare kan nu köra matris multiplikationer med större bredder snabbare i llama.cpp.