O projeto llama.cpp lançou a versão b11554 em 2026‑10‑11. A atualização inclui correções específicas para Vulkan que detectam IDs de linha duplicados em multiplicações de matrizes e os processam em uma etapa prévia, em vez de percorrê-los em loop. Também aprimora a otimização “hoist row ids”, que passa a ser executada sempre e pode gerar vários blocos compactos. Com as mudanças, a GPU inicia menos grupos de trabalho e encerra o processamento mais cedo quando possível.
Por que importa
Quem usa llama.cpp na GPU pode ter inferência mais rápida, pois a biblioteca agora evita repetir os mesmos cálculos.