ggml‑org bracht op 7 oktober 2026 versie b11466 van llama.cpp uit. De update verhelpt een probleem met de supports_op-controle van flash_attn bij overlappende key-valueparen. Ook zijn er kant-en-klare binaries voor macOS met Apple Silicon, macOS met Intel, iOS en diverse Ubuntu-configuraties (CPU, Vulkan en CUDA 12.8). De bestanden zijn te downloaden via de GitHub-releasepagina.
Waarom het ertoe doet
Ontwikkelaars kunnen de nieuwste llama.cpp-code op meer platforms gebruiken zonder die zelf vanaf de broncode te hoeven bouwen.