# llama.cpp optimise Vulkan pour les lignes répétées

> La bibliothèque open source d’inférence LLaMA évite désormais les calculs redondants lorsque des lignes se répètent sur le GPU, pour accélérer les appareils Vulkan.

Oossa · 2026-10-11 · https://oossa.com/fr/llama-cpp-adds-vulkan-duplicate-row-optimizations

Le projet llama.cpp a publié la version b11554 le 2026‑10‑11. Cette mise à jour apporte des correctifs propres à Vulkan : elle détecte les ID de lignes en double dans les multiplications matricielles et les traite lors d’une étape préliminaire, plutôt que de les parcourir en boucle. Elle améliore aussi l’optimisation « hoist row ids », qui s’exécute désormais systématiquement et peut générer plusieurs tuiles compactes. Ces changements permettent au GPU de lancer moins de groupes de travail et, si possible, de s’arrêter plus tôt.

## Les faits

- Version b11554 publiée le dimanche 11 octobre 2026
- Ajout de la gestion des lignes en double pour Vulkan dans llama.cpp

## Pourquoi c'est important

Les utilisateurs de llama.cpp sur GPU peuvent bénéficier d’une inférence plus rapide, car la bibliothèque évite désormais de répéter les mêmes calculs.

## Sources et références

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Dernière mise à jour: 2026-10-11
