# llama.cpp ajoute un cache GPU pour les experts MoE

> La bibliothèque open source llama.cpp stocke désormais les données des modèles à mélange d’experts (MoE) dans un cache GPU situé en mémoire hôte.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-adds-gpu-cache-for-moe-experts

L’équipe ggml‑org a publié la version b11480 de llama.cpp le 2026‑10‑08. Cette mise à jour ajoute un cache GPU pour les experts MoE, hébergé en mémoire hôte, afin d’accélérer l’exécution des grands modèles sur GPU. La modification est signalée comme ayant été réalisée avec l’aide de Claude et utilise une nouvelle API, llama_moe_cache_ptr. Des binaires précompilés pour macOS, iOS et plusieurs configurations Ubuntu sont disponibles au téléchargement.

## Les faits

- Version publiée : b11480
- Date de publication : 2026‑10‑08

## Pourquoi c'est important

Les développeurs peuvent désormais exécuter plus efficacement des modèles MoE sur des GPU grand public, ce qui réduit le coût matériel des projets d’IA.

## Sources et références

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Dernière mise à jour: 2026-10-08
