Het team van ggml-org bracht op 2026-10-08 versie b11480 van llama.cpp uit. De update voegt een GPU-cache voor MoE-experts toe die in het hostgeheugen wordt bewaard, zodat grote modellen sneller op GPU's kunnen draaien. Bij de wijziging staat vermeld dat Claude heeft geholpen; ook maakt die gebruik van de nieuwe API llama_moe_cache_ptr. Voor macOS, iOS en verschillende Ubuntu-configuraties zijn vooraf gebouwde binaries te downloaden.
Waarom het ertoe doet
Ontwikkelaars kunnen MoE-modellen nu efficiënter draaien op consumentengpu's, waardoor AI-projecten minder krachtige hardware vereisen.