Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11507 veröffentlicht. Das Update unterstützt einen Mixture-of-Experts- (MoE-)Cache, der auf mehrere GPUs verteilt werden kann. So können Entwickler größere MoE-Modelle ausführen, ohne alles auf einer einzigen Grafikkarte unterbringen zu müssen. Die Veröffentlichung umfasst außerdem neue Binärpakete für macOS, iOS und verschiedene Linux-Konfigurationen, darunter Unterstützung für CUDA 12.8.
Warum es wichtig ist
Entwickler können damit größere und leistungsfähigere KI-Modelle auf Systemen mit mehreren GPUs ausführen und so mehr mit eigener Hardware umsetzen.