L’équipe ggml-org a publié la version b11268 de llama.cpp. Cette mise à jour corrige un bogue du pilote OpenCL qui affectait la gestion des tenseurs par le noyau GPU Adreno q5_K. De nouveaux binaires précompilés sont proposés pour les Mac Apple Silicon, les Mac Intel, iOS et plusieurs configurations Linux, notamment CPU, Vulkan et CUDA 12.8.
Pourquoi c'est important
Ce correctif améliore les performances et la stabilité pour les développeurs qui exécutent des LLM sur des appareils Android équipés de GPU Adreno.