L’équipe ggml-org a publié la version b11528 de llama.cpp le 2026-10-09. Cette mise à jour permet à la bibliothèque de traiter les vues de tenseurs alloués sur l’hôte comme des nœuds ordinaires, évitant ainsi une erreur d’assertion qui survenait avec l’option –split-mode tensor. Elle rétablit également la prise en charge des tenseurs SM pour l’accélérateur K2 Horizon. Ce changement figure dans la version officielle sur GitHub et concerne toutes les plateformes répertoriées, de macOS à Windows et Linux.
Pourquoi c'est important
Les développeurs peuvent désormais utiliser llama.cpp avec le cache KV en mode fractionné sur davantage de matériel sans plantage, ce qui élargit les configurations possibles pour l’inférence de LLM en local.