# llama.cpp ottimizza le righe duplicate su Vulkan

> La libreria open source per l’inferenza LLaMA evita calcoli ridondanti quando le righe sulla GPU si ripetono, migliorando le prestazioni sui dispositivi Vulkan.

Oossa · 2026-10-11 · https://oossa.com/it/llama-cpp-adds-vulkan-duplicate-row-optimizations

Il progetto llama.cpp ha rilasciato la versione b11554 il 2026‑10‑11. L’aggiornamento introduce correzioni specifiche per Vulkan che rilevano gli ID di riga duplicati nelle moltiplicazioni di matrici e li gestiscono in una fase preliminare, anziché elaborarli in un ciclo. Migliora inoltre l’ottimizzazione «hoist row ids», che ora viene sempre eseguita e può generare più tile compatti. Queste modifiche consentono alla GPU di avviare meno gruppi di lavoro e, quando possibile, di interrompere l’elaborazione in anticipo.

## I fatti

- La versione b11554 è stata pubblicata dom 11 ott 2026
- Aggiunta a llama.cpp la gestione delle righe duplicate su Vulkan

## Perché conta

Chi usa llama.cpp su GPU può ottenere un’inferenza più veloce, perché la libreria evita di ripetere gli stessi calcoli.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Ultimo aggiornamento: 2026-10-11
