Il team ggml-org ha pubblicato llama.cpp versione b11540 il 10 ottobre 2026. L’aggiornamento aggiunge il supporto SYCL per velocizzare i modelli mixture-of-experts (MoE) MXFP4 tramite decodifica aritmetica e riordino dei pesi. Include inoltre binari precompilati per Apple Silicon e Intel su macOS, per iOS e per diverse versioni di Ubuntu (CPU, Vulkan e CUDA). Le modifiche sono elencate su GitHub sotto il tag b11540.
Perché conta
Gli sviluppatori possono ora eseguire più velocemente modelli MoE più grandi su GPU compatibili con SYCL, ampliando le opzioni hardware per chi usa llama.cpp.