Oossa

llama.cpp får CUDA-kärnor för blockbredder över 512

Versionen från 8 okt. 2026 innehåller nya snabba Fourier–Hadamard-kärnor för bredder på 1 024–8 192 på NVIDIA-GPU:er.

NotisAv Publicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte version b11482 den 8 okt. 2026. Den innehåller CUDA FWHT-kärnor som klarar blockbredder över 512 och utökar stödet till 1 024–8 192 för både FP32- och FP16-data. Ändringen återanvänder den befintliga F16-infrastrukturen och har klarat tester på en A10-GPU. De befintliga kärnorna för warp-bredder (64–512) är oförändrade.

Varför det spelar roll

GPU-användare kan nu köra matris multiplikationer med större bredder snabbare i llama.cpp.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.