Le projet ggml‑org/llama.cpp a publié la version b11372 le 3 octobre 2026. Cette mise à jour remanie l’indexeur Qwen4exp : chaque tête calcule son score séparément et écrit les résultats directement en mémoire. La mémoire nécessaire aux tampons de scores de l’indexeur — les principaux consommateurs de mémoire dans les graphes à contexte long — est ainsi divisée par deux. Ce changement n’a aucun effet sur la vitesse de calcul et ajoute également la prise en charge du nouvel indexeur lightning sur les backends CUDA, Metal et Vulkan.
Pourquoi c'est important
Les développeurs qui exécutent de grands modèles de langage avec un long contexte pourront traiter des invites plus longues sur le même matériel.