Le projet llama.cpp a publié un correctif qui modifie le chargement des nombres flottants 32 bits (F32) dans le code Vulkan. Sur les GPU Intel, charger deux nombres flottants simultanément est plus rapide que de les charger un par un. La nouvelle logique effectue donc un chargement aligné sur 2 dans la routine mul_mat_vec. La modification ajoute également une vérification d’alignement qui manquait. Des benchmarks réalisés sur une carte de test B60 affichent jusqu’à 1,63 TFLOPS pour certaines tailles de matrices, soit un gain notable par rapport à la version précédente.
Pourquoi c'est important
Des calculs GPU plus rapides permettent d’accélérer l’inférence des LLM pour les utilisateurs de llama.cpp sur du matériel Intel.