A equipe ggml-org lançou a versão b11528 do llama.cpp em 2026-10-09. A atualização permite que a biblioteca trate visualizações de tensores alocados na memória do host como nós normais, eliminando um erro de assert que ocorria com a opção –split-mode tensor. Também restaura o suporte a tensores SM para o acelerador K2 Horizon. A alteração está incluída na versão oficial do GitHub e se aplica a todas as plataformas listadas, de macOS a Windows e Linux.
Por que importa
Agora, desenvolvedores podem executar o llama.cpp com o cache KV dividido em mais tipos de hardware, sem falhas, ampliando as configurações disponíveis para inferência local de LLMs.