Das Team von ggml-org hat am 8. Oktober 2026 llama.cpp in Version b11493 veröffentlicht. Das Update ergänzt eine SYCL-Implementierung für gruppiertes Mixture-of-Experts-XMX-GEMM (MoE), eine Matrixmultiplikation, die in großen Sprachmodellen verwendet wird. Ebenfalls enthalten sind vorgefertigte Binärdateien für macOS, iOS und Ubuntu (CPU, Vulkan und CUDA).
Warum es wichtig ist
Entwickler können MoE-basierte Modelle nun auf SYCL-kompatiblen GPUs ausführen. Damit stehen für Open-Source-LLM-Anwendungen mehr Hardwareoptionen zur Verfügung.