A equipe ggml-org publicou o llama.cpp versão b11510 em 8 de outubro de 2026. A atualização adiciona um kernel PAD em loop para CUDA, permitindo que a biblioteca processe tensores com mais de 65.000 linhas ou fatias. A versão também inclui binários pré-compilados para Apple Silicon, macOS com Intel, iOS e várias versões do Ubuntu (CPU, Vulkan e CUDA 12.8). O código e as atestações estão disponíveis na página do GitHub.
Por que importa
Desenvolvedores agora podem executar modelos de linguagem maiores em GPUs NVIDIA sem esbarrar no limite anterior de linhas.