# llama.cpp prend en charge OpenVINO 2026.4.1 et corrige des bugs MoE

> La mise à jour du 3 octobre 2026 actualise le backend OpenVINO, améliore les performances et corrige la gestion des modèles MoE dans llama.cpp.

Oossa · 2026-10-03 · https://oossa.com/fr/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

La bibliothèque llama.cpp a publié une nouvelle version (b11374) le 3 octobre 2026. Celle-ci met à jour le backend OpenVINO vers la version 2026.4.1, ajoute une nouvelle fusion d’opérations de convolution, corrige des erreurs de mémoire tampon GPU et rectifie la gestion des axes pour les modèles à experts mixtes (MoE). Ces changements accélèrent la génération de jetons pour les modèles MoE fusionnés et évitent des plantages sur certains GPU Intel.

## Les faits

- Date de publication : 3 octobre 2026 (« Sat Oct 03 2026 13:51:21 GMT+0200 »)
- OpenVINO passe à la version 2026.4.1 ; la vitesse de génération de jetons de gemma-4-26B passe de 66 t/s à 1 609 t/s avec la fusion

## Pourquoi c'est important

Les développeurs qui utilisent llama.cpp sur des GPU Intel peuvent désormais profiter d’OpenVINO avec de meilleures performances et moins de plantages.

## Sources et références

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

Dernière mise à jour: 2026-10-03
