Il team ggml-org ha pubblicato la versione b11493 di llama.cpp l’8 ottobre 2026. L’aggiornamento aggiunge un’implementazione SYCL di GEMM XMX per Mixture-of-Experts (MoE) raggruppati, un’operazione di moltiplicazione di matrici usata nei modelli linguistici di grandi dimensioni. La release include anche binari precompilati per macOS, iOS e Ubuntu (CPU, Vulkan e CUDA).
Perché conta
Gli sviluppatori possono ora eseguire modelli basati su MoE su GPU compatibili con SYCL, ampliando le opzioni hardware per i carichi di lavoro LLM open source.