A equipe ggml-org publicou o llama.cpp b11499 em 8 de outubro de 2026. A atualização altera o backend CUDA para usar strides em bytes na operação roll, permitindo que a GPU processe corretamente dados não contíguos. A versão também inclui novos binários para Apple Silicon, macOS com processadores Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12). Todos os arquivos estão disponíveis para download na página da versão no GitHub.
Por que importa
Desenvolvedores podem executar o llama.cpp em mais configurações de GPU sem erros, ampliando o uso local de LLMs em desktops e servidores.