Het ggml-org-team heeft versie b11268 van llama.cpp uitgebracht. De update verhelpt een bug in de OpenCL-driver, die tensoren verwerkte voor de q5_K-kernel op Adreno-GPU’s. Er zijn nieuwe kant-en-klare binaries beschikbaar voor Apple Silicon-Macs, Intel-Macs, iOS en verschillende Linux-configuraties, waaronder CPU, Vulkan en CUDA 12.8.
Waarom het ertoe doet
De oplossing verbetert de prestaties en stabiliteit voor ontwikkelaars die LLM’s draaien op Android-apparaten met Adreno-GPU’s.