# llama.cpp corrige la prise en charge CPU des entrées matricielles BF16

> La version b11292 ajoute la prise en charge CPU d’une entrée matricielle BF16 utilisée pour la convolution en profondeur et renforce les vérifications de compatibilité de Vulkan.

Oossa · 2026-09-30 · https://oossa.com/fr/llama-cpp-fixes-cpu-handling-for-bf16-matrix-inputs

Créé et traduit avec l’aide de l’IA. Consultez les sources originales ci-dessous.

La version b11292 de llama.cpp corrige une limitation du backend CPU qui affectait la convolution 1D en profondeur lorsque son noyau utilise le format numérique BF16 sur 16 bits. Le backend CPU convertit désormais cette entrée en flottant 32 bits pour effectuer le calcul, comme le fait le noyau Metal de multiplication matrice-vecteur.

La version modifie également les vérifications de Vulkan : BF16 est accepté comme seconde entrée matricielle uniquement si la première est elle aussi en BF16. Les autres combinaisons sont considérées comme non prises en charge, afin que l’ordonnanceur les exécute sur le CPU. Les notes mentionnent l’ajout de tests, mais ne précisent pas quand ces changements seront intégrés à une application distribuée ni quels utilisateurs en bénéficieront.

## Les faits

- La version publiée le 30 septembre 2026 est llama.cpp b11292.
- Les notes portent sur un test de convolution en profondeur avec des noyaux F32, F16 et BF16, ainsi que sur trois cas de multiplication matricielle où la seconde entrée est en BF16.

## Pourquoi c'est important

Les développeurs qui exécutent des convolutions en profondeur en BF16 peuvent désormais utiliser le backend CPU pour une combinaison qu’il rejetait auparavant ; les notes ne précisent pas quand le correctif sera intégré aux applications en aval.

## Sources et références

1. [ggml-org/llama.cpp b11292](https://github.com/ggml-org/llama.cpp/releases/tag/b11292) – llama.cpp, 2026-09-30

Dernière mise à jour: 2026-09-30
