Oossa

llama.cpp ajoute un cache GPU pour les experts MoE

La bibliothèque open source llama.cpp stocke désormais les données des modèles à mélange d’experts (MoE) dans un cache GPU situé en mémoire hôte.

BrèvePar Publié par Oossa: Dernière mise à jour: 1 min de lecture

L’équipe ggml‑org a publié la version b11480 de llama.cpp le 2026‑10‑08. Cette mise à jour ajoute un cache GPU pour les experts MoE, hébergé en mémoire hôte, afin d’accélérer l’exécution des grands modèles sur GPU. La modification est signalée comme ayant été réalisée avec l’aide de Claude et utilise une nouvelle API, llama_moe_cache_ptr. Des binaires précompilés pour macOS, iOS et plusieurs configurations Ubuntu sont disponibles au téléchargement.

Pourquoi c'est important

Les développeurs peuvent désormais exécuter plus efficacement des modèles MoE sur des GPU grand public, ce qui réduit le coût matériel des projets d’IA.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.