L’équipe ggml-org a publié la version b11324 de llama.cpp. Cette mise à jour ajoute un mode de mémoire mappée qui évite de créer une seconde copie complète de chaque tenseur au chargement des modèles. La nouveauté est disponible dans les nouveaux paquets binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu. La publication mentionne également les contributions de Claude et de Pranesh Gonegandla, ingénieur chez NVIDIA.
Pourquoi c'est important
Les développeurs peuvent exécuter des modèles de langage plus volumineux sur le même matériel, ce qui est utile aux passionnés et aux petites équipes disposant de peu de mémoire.