Il team ggml-org ha pubblicato llama.cpp versione b11498 il 2026-10-08. L’aggiornamento corregge un problema del kernel CUDA che si verificava quando le dimensioni di alcuni tensori superavano i limiti della griglia GPU. Include inoltre nuovi binari precompilati per Apple Silicon, macOS Intel, iOS e diverse configurazioni Ubuntu, con build per CPU, Vulkan e CUDA 12.8.
Perché conta
Gli sviluppatori possono ora usare llama.cpp su più configurazioni GPU senza arresti anomali e scaricare binari già pronti per la propria piattaforma.