Oossa

llama.cpp ajoute une option mémoire mappée pour réduire les copies de tenseurs

Le moteur LLM open source permet désormais de mapper directement les données du modèle, afin d’économiser de la RAM sur macOS, iOS et Linux.

BrèveOossaPublié par Oossa: 1 min de lecture

L’équipe ggml-org a publié la version b11324 de llama.cpp. Cette mise à jour ajoute un mode de mémoire mappée qui évite de créer une seconde copie complète de chaque tenseur au chargement des modèles. La nouveauté est disponible dans les nouveaux paquets binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu. La publication mentionne également les contributions de Claude et de Pranesh Gonegandla, ingénieur chez NVIDIA.

Pourquoi c'est important

Les développeurs peuvent exécuter des modèles de langage plus volumineux sur le même matériel, ce qui est utile aux passionnés et aux petites équipes disposant de peu de mémoire.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.