OossaL'IA évolue vite. Nous l'expliquons simplement.

llama.cpp accélère les chargements F32 sur Vulkan avec Intel

La mise à jour accélère les multiplications matricielles sur les GPU Intel en chargeant deux nombres flottants à la fois.

BrèveOossa1 min de lecture

Le projet llama.cpp a publié un correctif qui modifie le chargement des nombres flottants 32 bits (F32) dans le code Vulkan. Sur les GPU Intel, charger deux nombres flottants simultanément est plus rapide que de les charger un par un. La nouvelle logique effectue donc un chargement aligné sur 2 dans la routine mul_mat_vec. La modification ajoute également une vérification d’alignement qui manquait. Des benchmarks réalisés sur une carte de test B60 affichent jusqu’à 1,63 TFLOPS pour certaines tailles de matrices, soit un gain notable par rapport à la version précédente.

Pourquoi c'est important

Des calculs GPU plus rapides permettent d’accélérer l’inférence des LLM pour les utilisateurs de llama.cpp sur du matériel Intel.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

Sources et références

#SourceMédiaDateÀ retenir
1ggml-org/llama.cpp b11266 ↗llama.cpp29 sept. 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 sept. 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 sources

Dernière mise à jour: ·Markdown·llms.txt