Das Team von ggml-org hat am 2026-10-08 llama.cpp in Version b11480 veröffentlicht. Das Update ergänzt einen GPU-Cache für MoE-Experten, der im Host-Speicher liegt und große Modelle auf GPUs schneller laufen lassen soll. Die Änderung ist als von Claude unterstützt gekennzeichnet und nutzt eine neue API namens llama_moe_cache_ptr. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Konfigurationen stehen zum Download bereit.
Warum es wichtig ist
Entwickler können MoE-Modelle jetzt effizienter auf Consumer-GPUs ausführen und so die Hardwarekosten für KI-Projekte senken.