Il team ggml-org ha pubblicato la versione b11515 di llama.cpp il 9 ottobre 2026. L’aggiornamento aggiunge una moltiplicazione matrice-vettore quantizzata (MMVQ) con layout riordinato Q5_K basata su SYCL e un operatore GLU fuso, migliorando le prestazioni sull’hardware compatibile. La release include anche binari pronti all’uso per Apple Silicon, Mac Intel, iOS, Ubuntu (CPU, Vulkan, CUDA 12.8) e IBM s390x. Gli utenti possono scaricare l’archivio adatto dalla pagina GitHub.
Perché conta
Gli sviluppatori possono ora eseguire llama.cpp più velocemente sulle GPU compatibili con SYCL senza dover compilare il software dal codice sorgente.