Teamet ggml-org släppte llama.cpp version b11480 den 2026-10-08. Uppdateringen lägger till en GPU-cache för MoE-experter i värdminnet, vilket hjälper stora modeller att köras snabbare på GPU:er. Ändringen är markerad som assisterad av Claude och använder det nya API:et llama_moe_cache_ptr. Förkompilerade binärfiler för macOS, iOS och flera Ubuntu-konfigurationer finns att ladda ner.
Varför det spelar roll
Utvecklare kan nu köra MoE-modeller effektivare på konsument-GPU:er, vilket sänker hårdvarukostnaden för AI-projekt.