El equipo de ggml-org publicó la versión b11268 de llama.cpp. La actualización corrige un error del controlador OpenCL que afectaba el manejo de tensores en el kernel q5_K para GPU Adreno. También incluye nuevos binarios precompilados para macOS con Apple Silicon, Mac con Intel, iOS y varias configuraciones de Linux, incluidas CPU, Vulkan y CUDA 12.8.
Por qué importa
La corrección mejora el rendimiento y la estabilidad para quienes ejecutan LLM en dispositivos Android con GPU Adreno.