llama.cpp-projektet publicerade en ny förhandsversion, b11517, den 9 Oct 2026. Uppdateringen lägger till ett CUDA-alternativ som låter användare ange precisionen för källa 1 till MMQ-hjälpfunktionerna, en lågnivådel av GPU-koden. Ändringen har signerats av en NVIDIA-medarbetare och gäller CUDA 12- och 13-versionerna för Linux och Windows. Utgåvan innehåller också byggmål för många andra plattformar, från Apple Silicon-baserade Mac-datorer till Android med Snapdragon.
Uppdateringen finns på projektets GitHub-sida och webbplatsen llama.app.
Varför det spelar roll
Utvecklare kan nu styra GPU-precisionen i llama.cpp, vilket kan förbättra prestandan eller minnesanvändningen när LLaMA-modeller körs.