Oossa

llama.cpp optimise Vulkan pour les lignes répétées

La bibliothèque open source d’inférence LLaMA évite désormais les calculs redondants lorsque des lignes se répètent sur le GPU, pour accélérer les appareils Vulkan.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet llama.cpp a publié la version b11554 le 2026‑10‑11. Cette mise à jour apporte des correctifs propres à Vulkan : elle détecte les ID de lignes en double dans les multiplications matricielles et les traite lors d’une étape préliminaire, plutôt que de les parcourir en boucle. Elle améliore aussi l’optimisation « hoist row ids », qui s’exécute désormais systématiquement et peut générer plusieurs tuiles compactes. Ces changements permettent au GPU de lancer moins de groupes de travail et, si possible, de s’arrêter plus tôt.

Pourquoi c'est important

Les utilisateurs de llama.cpp sur GPU peuvent bénéficier d’une inférence plus rapide, car la bibliothèque évite désormais de répéter les mêmes calculs.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.