Oossa

llama.cpp añade una caché de GPU para expertos MoE

La biblioteca de código abierto llama.cpp ahora guarda datos de mezcla de expertos (MoE) en una caché de GPU ubicada en la memoria del host.

BrevePor Publicado por Oossa: Última actualización: 1 min de lectura

El equipo de ggml-org publicó la versión b11480 de llama.cpp el 2026-10-08. La actualización añade una caché de GPU para expertos MoE ubicada en la memoria del host, lo que ayuda a ejecutar modelos grandes más rápido en GPU. El cambio figura como asistido por Claude y utiliza una nueva API, llama_moe_cache_ptr. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias configuraciones de Ubuntu.

Por qué importa

Los desarrolladores ahora pueden ejecutar modelos MoE de forma más eficiente en GPU de consumo, lo que reduce el costo del hardware para proyectos de IA.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.