Le projet open source llama.cpp a publié la version b11558 le 11 oct. 2026. Cette mise à jour corrige un bug qui faisait dépasser aux kernels OpenCL les limites d’image des appareils lors de l’utilisation de poids quantifiés Q4_K. Elle ajoute également une solution de repli pour les appareils qui atteignent ces limites et corrige les calculs de diffusion et de normalisation RMS dans les kernels Q4_0. Hongqiang Wang, de Qualcomm, a coécrit ces modifications.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp sur GPU peuvent désormais exécuter des modèles quantifiés Q4_K sur davantage de matériel sans plantage.