A equipe ggml-org lançou a versão b11498 do llama.cpp em 2026-10-08. A atualização corrige um problema no kernel CUDA que ocorria quando certas dimensões de tensores excediam os limites da grade da GPU. Ela também inclui novos binários pré-compilados para Apple Silicon, macOS com processadores Intel, iOS e várias configurações do Ubuntu, incluindo versões para CPU, Vulkan e CUDA 12.8.
Por que importa
Agora, os desenvolvedores podem executar o llama.cpp em mais configurações de GPU sem que o programa trave e contar com binários prontos para sua plataforma.