Het team van ggml-org heeft op 8 oktober 2026 versie b11507 van llama.cpp uitgebracht. De update voegt ondersteuning toe voor een mixture-of-experts-cache (MoE) die over meerdere GPU’s kan worden verdeeld. Zo kunnen ontwikkelaars grotere MoE-modellen draaien zonder dat alles op één kaart hoeft te passen. De release bevat ook nieuwe binaire pakketten voor macOS, iOS en verschillende Linux-configuraties, waaronder ondersteuning voor CUDA 12.8.
Waarom het ertoe doet
Ontwikkelaars kunnen nu grotere en krachtigere AI-modellen draaien op systemen met meerdere GPU’s. Dat vergroot de mogelijkheden van hardware voor persoonlijk gebruik.