L’équipe ggml-org a publié la version b11507 de llama.cpp le 8 octobre 2026. Cette mise à jour prend en charge un cache pour les modèles à mélange d’experts (MoE), qui peut être réparti sur plusieurs GPU. Les développeurs peuvent ainsi exécuter des modèles MoE plus volumineux sans devoir tout faire tenir sur une seule carte. Cette version comprend aussi de nouveaux paquets binaires pour macOS, iOS et plusieurs configurations Linux, dont la prise en charge de CUDA 12.8.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter des modèles d’IA plus volumineux et plus performants sur des configurations équipées de plusieurs GPU, ce qui élargit les possibilités du matériel personnel.