A equipe ggml-org lançou uma nova versão do llama.cpp em 30 de setembro de 2026. Ela corrige um problema pelo qual o driver de GPU MUSA não definia CUDA_ARCH, fazendo com que alguns kernels fossem compilados vazios. O patch adiciona a detecção adequada da arquitetura e elimina verificações redundantes. A versão também lista diversos binários pré-compilados, agora compatíveis com CUDA 12.8 e 13.4 no Linux e no Windows, além de oferecer suporte a vários alvos ARM e Apple Silicon.
Por que importa
Desenvolvedores agora podem executar o Llama.cpp em GPUs MUSA e com versões mais recentes do CUDA, sem precisar aplicar patches manualmente.