Oossa

llama.cpp divise par deux la mémoire de l’indexeur

La version b11372 réduit fortement la RAM utilisée par l’indexeur Qwen4exp, sans ralentissement, pour les contextes longs.

BrèveOossaPublié par Oossa: 1 min de lecture

Le projet ggml‑org/llama.cpp a publié la version b11372 le 3 octobre 2026. Cette mise à jour remanie l’indexeur Qwen4exp : chaque tête calcule son score séparément et écrit les résultats directement en mémoire. La mémoire nécessaire aux tampons de scores de l’indexeur — les principaux consommateurs de mémoire dans les graphes à contexte long — est ainsi divisée par deux. Ce changement n’a aucun effet sur la vitesse de calcul et ajoute également la prise en charge du nouvel indexeur lightning sur les backends CUDA, Metal et Vulkan.

Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage avec un long contexte pourront traiter des invites plus longues sur le même matériel.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.