# llama.cpp otimiza linhas duplicadas no Vulkan

> A biblioteca de inferência LLaMA de código aberto agora evita trabalho redundante quando há linhas repetidas na GPU, acelerando o processamento em dispositivos Vulkan.

Oossa · 2026-10-11 · https://oossa.com/pt/llama-cpp-adds-vulkan-duplicate-row-optimizations

O projeto llama.cpp lançou a versão b11554 em 2026‑10‑11. A atualização inclui correções específicas para Vulkan que detectam IDs de linha duplicados em multiplicações de matrizes e os processam em uma etapa prévia, em vez de percorrê-los em loop. Também aprimora a otimização “hoist row ids”, que passa a ser executada sempre e pode gerar vários blocos compactos. Com as mudanças, a GPU inicia menos grupos de trabalho e encerra o processamento mais cedo quando possível.

## Os fatos

- Versão b11554 lançada no domingo, 11 de outubro de 2026
- O llama.cpp ganhou tratamento de linhas duplicadas no Vulkan

## Por que importa

Quem usa llama.cpp na GPU pode ter inferência mais rápida, pois a biblioteca agora evita repetir os mesmos cálculos.

## Fontes e referências

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Última atualização: 2026-10-11
