L’équipe ggml‑org a publié la version b11480 de llama.cpp le 2026‑10‑08. Cette mise à jour ajoute un cache GPU pour les experts MoE, hébergé en mémoire hôte, afin d’accélérer l’exécution des grands modèles sur GPU. La modification est signalée comme ayant été réalisée avec l’aide de Claude et utilise une nouvelle API, llama_moe_cache_ptr. Des binaires précompilés pour macOS, iOS et plusieurs configurations Ubuntu sont disponibles au téléchargement.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter plus efficacement des modèles MoE sur des GPU grand public, ce qui réduit le coût matériel des projets d’IA.