# llama.cpp añade una caché de GPU para expertos MoE

> La biblioteca de código abierto llama.cpp ahora guarda datos de mezcla de expertos (MoE) en una caché de GPU ubicada en la memoria del host.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-adds-gpu-cache-for-moe-experts

El equipo de ggml-org publicó la versión b11480 de llama.cpp el 2026-10-08. La actualización añade una caché de GPU para expertos MoE ubicada en la memoria del host, lo que ayuda a ejecutar modelos grandes más rápido en GPU. El cambio figura como asistido por Claude y utiliza una nueva API, llama_moe_cache_ptr. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias configuraciones de Ubuntu.

## Los hechos

- Versión de lanzamiento: b11480
- Fecha de lanzamiento: 2026-10-08

## Por qué importa

Los desarrolladores ahora pueden ejecutar modelos MoE de forma más eficiente en GPU de consumo, lo que reduce el costo del hardware para proyectos de IA.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Última actualización: 2026-10-08
