# llama.cpp accélère les chargements F32 sur Vulkan avec Intel

> La mise à jour accélère les multiplications matricielles sur les GPU Intel en chargeant deux nombres flottants à la fois.

Oossa · 2026-09-30 · https://oossa.com/fr/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Le projet llama.cpp a publié un correctif qui modifie le chargement des nombres flottants 32 bits (F32) dans le code Vulkan. Sur les GPU Intel, charger deux nombres flottants simultanément est plus rapide que de les charger un par un. La nouvelle logique effectue donc un chargement aligné sur 2 dans la routine mul_mat_vec. La modification ajoute également une vérification d’alignement qui manquait. Des benchmarks réalisés sur une carte de test B60 affichent jusqu’à 1,63 TFLOPS pour certaines tailles de matrices, soit un gain notable par rapport à la version précédente.

## Les faits

- Correctif publié le 30 septembre 2026 (b11266)
- Accélération jusqu’à 1,63 TFLOPS sur une matrice 4096×8×14336

## Pourquoi c'est important

Des calculs GPU plus rapides permettent d’accélérer l’inférence des LLM pour les utilisateurs de llama.cpp sur du matériel Intel.

## Sources et références

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Dernière mise à jour: 2026-09-30
