Il team ggml-org ha pubblicato la versione b11499 di llama.cpp l’8 ottobre 2026. L’aggiornamento modifica il backend CUDA, che ora usa stride in byte per l’operazione roll, consentendo alla GPU di gestire correttamente i dati non contigui. La versione include anche nuovi binari per Apple Silicon, Mac con processori Intel, iOS e diverse build di Ubuntu (CPU, Vulkan e CUDA 12). Tutti i file sono disponibili per il download dalla pagina della release su GitHub.
Perché conta
Gli sviluppatori possono eseguire llama.cpp su una gamma più ampia di configurazioni GPU senza errori, ampliando le possibilità di usare LLM in locale su desktop e server.