Oossa

llama.cpp otimiza linhas duplicadas no Vulkan

A biblioteca de inferência LLaMA de código aberto agora evita trabalho redundante quando há linhas repetidas na GPU, acelerando o processamento em dispositivos Vulkan.

NotaPor Publicado pelo Oossa: 1 min de leitura

O projeto llama.cpp lançou a versão b11554 em 2026‑10‑11. A atualização inclui correções específicas para Vulkan que detectam IDs de linha duplicados em multiplicações de matrizes e os processam em uma etapa prévia, em vez de percorrê-los em loop. Também aprimora a otimização “hoist row ids”, que passa a ser executada sempre e pode gerar vários blocos compactos. Com as mudanças, a GPU inicia menos grupos de trabalho e encerra o processamento mais cedo quando possível.

Por que importa

Quem usa llama.cpp na GPU pode ter inferência mais rápida, pois a biblioteca agora evita repetir os mesmos cálculos.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.