# llama.cpp añade caché MoE para varias GPU

> La biblioteca de código abierto llama.cpp ya permite ejecutar modelos de mezcla de expertos en varias GPU.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-adds-multi-gpu-moe-cache-support

El equipo de ggml-org publicó la versión b11507 de llama.cpp el 8 de octubre de 2026. La actualización añade compatibilidad con una caché de mezcla de expertos (MoE) que puede distribuirse entre varias GPU. Esto permite a los desarrolladores ejecutar modelos MoE más grandes sin tener que alojarlo todo en una sola tarjeta. El lanzamiento también incluye nuevos paquetes binarios para macOS, iOS y varias configuraciones de Linux, incluida la compatibilidad con CUDA 12.8.

## Los hechos

- La versión b11507 se publicó el 2026-10-08
- Añade una caché MoE distribuida entre varias GPU

## Por qué importa

Ahora los desarrolladores pueden ejecutar modelos de IA más grandes y capaces en equipos con varias GPU, lo que amplía las posibilidades del hardware personal.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Última actualización: 2026-10-08
