La bibliothèque llama.cpp a publié une nouvelle version (b11374) le 3 octobre 2026. Celle-ci met à jour le backend OpenVINO vers la version 2026.4.1, ajoute une nouvelle fusion d’opérations de convolution, corrige des erreurs de mémoire tampon GPU et rectifie la gestion des axes pour les modèles à experts mixtes (MoE). Ces changements accélèrent la génération de jetons pour les modèles MoE fusionnés et évitent des plantages sur certains GPU Intel.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur des GPU Intel peuvent désormais profiter d’OpenVINO avec de meilleures performances et moins de plantages.