Oossa

llama.cpp añade caché MoE para varias GPU

La biblioteca de código abierto llama.cpp ya permite ejecutar modelos de mezcla de expertos en varias GPU.

BrevePor Publicado por Oossa: 1 min de lectura

El equipo de ggml-org publicó la versión b11507 de llama.cpp el 8 de octubre de 2026. La actualización añade compatibilidad con una caché de mezcla de expertos (MoE) que puede distribuirse entre varias GPU. Esto permite a los desarrolladores ejecutar modelos MoE más grandes sin tener que alojarlo todo en una sola tarjeta. El lanzamiento también incluye nuevos paquetes binarios para macOS, iOS y varias configuraciones de Linux, incluida la compatibilidad con CUDA 12.8.

Por qué importa

Ahora los desarrolladores pueden ejecutar modelos de IA más grandes y capaces en equipos con varias GPU, lo que amplía las posibilidades del hardware personal.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.