La bibliothèque llama.cpp est passée à la version b11559 le 11 oct. 2026. Cette version améliore OpenCL pour accélérer l’allocation des facteurs et prend en charge le décodage de Gemma‑4 sur les GPU Qualcomm E4B et E2B. Elle optimise également les chemins de décodage DK64 et DK128 pour différents paramètres de quantification. Les modifications ont été coécrites par Hongqiang Wang, de Qualcomm.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter plus rapidement les modèles Gemma‑4 sur les GPU Qualcomm compatibles, ce qui élargit les possibilités de l’IA en périphérie.