# llama.cpp prend en charge le cache MoE multi-GPU

> La bibliothèque open source llama.cpp permet désormais de répartir des modèles à mélange d’experts sur plusieurs GPU.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-adds-multi-gpu-moe-cache-support

L’équipe ggml-org a publié la version b11507 de llama.cpp le 8 octobre 2026. Cette mise à jour prend en charge un cache pour les modèles à mélange d’experts (MoE), qui peut être réparti sur plusieurs GPU. Les développeurs peuvent ainsi exécuter des modèles MoE plus volumineux sans devoir tout faire tenir sur une seule carte. Cette version comprend aussi de nouveaux paquets binaires pour macOS, iOS et plusieurs configurations Linux, dont la prise en charge de CUDA 12.8.

## Les faits

- Version b11507 publiée le 2026-10-08
- Ajout de la prise en charge d’un cache MoE réparti sur plusieurs GPU

## Pourquoi c'est important

Les développeurs peuvent désormais exécuter des modèles d’IA plus volumineux et plus performants sur des configurations équipées de plusieurs GPU, ce qui élargit les possibilités du matériel personnel.

## Sources et références

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Dernière mise à jour: 2026-10-08
