El equipo de ggml-org publicó la versión b11480 de llama.cpp el 2026-10-08. La actualización añade una caché de GPU para expertos MoE ubicada en la memoria del host, lo que ayuda a ejecutar modelos grandes más rápido en GPU. El cambio figura como asistido por Claude y utiliza una nueva API, llama_moe_cache_ptr. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias configuraciones de Ubuntu.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos MoE de forma más eficiente en GPU de consumo, lo que reduce el costo del hardware para proyectos de IA.