A equipe ggml-org lançou a versão b11268 do llama.cpp. A atualização corrige um bug no driver OpenCL que afetava o tratamento de tensores no kernel q5_K para GPUs Adreno. Também foram disponibilizados novos binários pré-compilados para Apple Silicon, Macs com Intel, iOS e várias configurações do Linux, incluindo CPU, Vulkan e CUDA 12.8.
Por que importa
A correção melhora o desempenho e a estabilidade para desenvolvedores que executam LLMs em dispositivos Android com GPUs Adreno.