A equipe ggml‑org lançou a versão b11391 do llama.cpp em 4 de outubro de 2026. A atualização move uma variável CUDA chamada blocks_per_col para o local onde ela é usada. A alteração foi aprovada por Adrien Gallouët. A versão também inclui novos binários pré-compilados para macOS com Apple Silicon, macOS com Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12). Todos os arquivos estão disponíveis para download na página da versão no GitHub.
Por que importa
Desenvolvedores podem executar o llama.cpp em mais tipos de hardware sem precisar compilar o programa, especialmente quem usa GPUs compatíveis com CUDA.