Teamet ggml-org släppte llama.cpp version b11507 den 8 oktober 2026. Uppdateringen lägger till stöd för en mixture-of-experts-cache (MoE-cache) som kan fördelas över flera GPU:er. Det gör att utvecklare kan köra större MoE-modeller utan att allt behöver rymmas på ett enda kort. Uppdateringen innehåller också nya binärpaket för macOS, iOS och flera Linux-konfigurationer, däribland stöd för CUDA 12.8.
Varför det spelar roll
Utvecklare kan nu köra större och mer avancerade AI-modeller på system med flera GPU:er, vilket utökar möjligheterna med egen hårdvara.