Het team van ggml-org heeft op 30 september 2026 een nieuwe versie van llama.cpp uitgebracht. Die verhelpt een probleem waarbij het MUSA-gpu-stuurprogramma CUDA_ARCH niet definieerde, waardoor sommige kernels leeg werden gecompileerd. De patch voegt correcte detectie van de architectuur toe en verwijdert overbodige controles. De release bevat ook een groot aantal voorgebouwde binaries, nu ook voor CUDA 12.8 en 13.4 op Linux en Windows, plus ondersteuning voor verschillende ARM- en Apple Silicon-doelen.
Waarom het ertoe doet
Ontwikkelaars kunnen llama.cpp nu zonder handmatige patches gebruiken op MUSA-gpu’s en met nieuwere CUDA-versies.