El equipo de ggml-org publicó la versión b11507 de llama.cpp el 8 de octubre de 2026. La actualización añade compatibilidad con una caché de mezcla de expertos (MoE) que puede distribuirse entre varias GPU. Esto permite a los desarrolladores ejecutar modelos MoE más grandes sin tener que alojarlo todo en una sola tarjeta. El lanzamiento también incluye nuevos paquetes binarios para macOS, iOS y varias configuraciones de Linux, incluida la compatibilidad con CUDA 12.8.
Por qué importa
Ahora los desarrolladores pueden ejecutar modelos de IA más grandes y capaces en equipos con varias GPU, lo que amplía las posibilidades del hardware personal.