Il team ggml‑org ha rilasciato una nuova versione di llama.cpp il 30 settembre 2026. La release corregge un problema per cui il driver GPU MUSA non definiva CUDA_ARCH, facendo sì che alcuni kernel venissero compilati senza contenuto. La patch aggiunge il corretto rilevamento dell’architettura ed elimina controlli ridondanti. La release include inoltre numerosi binari precompilati, ora disponibili anche per CUDA 12.8 e 13.4 su Linux e Windows, oltre al supporto per varie piattaforme ARM e Apple Silicon.
Perché conta
Gli sviluppatori possono ora usare Llama.cpp con le GPU MUSA e le versioni più recenti di CUDA senza applicare patch manuali.