Oossa

llama.cpp prend en charge le cache MoE multi-GPU

La bibliothèque open source llama.cpp permet désormais de répartir des modèles à mélange d’experts sur plusieurs GPU.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml-org a publié la version b11507 de llama.cpp le 8 octobre 2026. Cette mise à jour prend en charge un cache pour les modèles à mélange d’experts (MoE), qui peut être réparti sur plusieurs GPU. Les développeurs peuvent ainsi exécuter des modèles MoE plus volumineux sans devoir tout faire tenir sur une seule carte. Cette version comprend aussi de nouveaux paquets binaires pour macOS, iOS et plusieurs configurations Linux, dont la prise en charge de CUDA 12.8.

Pourquoi c'est important

Les développeurs peuvent désormais exécuter des modèles d’IA plus volumineux et plus performants sur des configurations équipées de plusieurs GPU, ce qui élargit les possibilités du matériel personnel.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.