O ggml‑org lançou a versão b11466 do llama.cpp em 7 de outubro de 2026. A atualização corrige a verificação supports_op do flash_attn para pares de chave e valor sobrepostos. Também inclui binários prontos para uso no macOS com Apple Silicon, no macOS com Intel, no iOS e em várias versões do Ubuntu (CPU, Vulkan e CUDA 12.8). Os arquivos podem ser baixados na página de lançamentos do GitHub.
Por que importa
Desenvolvedores podem usar a versão mais recente do llama.cpp em mais plataformas sem precisar compilar o código-fonte.