Le projet llama.cpp a publié la version b11554 le 2026‑10‑11. Cette mise à jour apporte des correctifs propres à Vulkan : elle détecte les ID de lignes en double dans les multiplications matricielles et les traite lors d’une étape préliminaire, plutôt que de les parcourir en boucle. Elle améliore aussi l’optimisation « hoist row ids », qui s’exécute désormais systématiquement et peut générer plusieurs tuiles compactes. Ces changements permettent au GPU de lancer moins de groupes de travail et, si possible, de s’arrêter plus tôt.
Pourquoi c'est important
Les utilisateurs de llama.cpp sur GPU peuvent bénéficier d’une inférence plus rapide, car la bibliothèque évite désormais de répéter les mêmes calculs.