Il team ggml-org ha rilasciato llama.cpp versione b11391 il 4 ottobre 2026. L’aggiornamento sposta una variabile CUDA chiamata blocks_per_col nel punto in cui viene utilizzata; la modifica è stata approvata da Adrien Gallouët. La versione include anche nuovi binari precompilati per macOS con Apple Silicon, macOS con processori Intel, iOS e diverse build di Ubuntu (CPU, Vulkan e CUDA 12). Tutti i file sono disponibili per il download nella pagina della release su GitHub.
Perché conta
Gli sviluppatori possono ora usare llama.cpp su più dispositivi senza doverlo compilare, in particolare con GPU compatibili con CUDA.