Das Team von ggml-org hat am 10.10.2026 llama.cpp in Version b11540 veröffentlicht. Das Update ergänzt SYCL-Unterstützung, um MXFP4-Mixture-of-Experts-Modelle (MoE) mithilfe von arithmetischem Decoding und einer Neuordnung der Gewichte zu beschleunigen. Außerdem gibt es vorgefertigte Binärdateien für Apple-Silicon- und Intel-Macs, iOS sowie verschiedene Ubuntu-Varianten (CPU, Vulkan und CUDA). Die Änderungen sind auf GitHub unter dem Tag b11540 aufgeführt.
Warum es wichtig ist
Entwickler können größere MoE-Modelle nun schneller auf GPUs mit SYCL-Unterstützung ausführen. Damit stehen llama.cpp-Nutzern mehr Hardwareoptionen zur Verfügung.