Il progetto llama.cpp ha rilasciato la versione b11554 il 2026‑10‑11. L’aggiornamento introduce correzioni specifiche per Vulkan che rilevano gli ID di riga duplicati nelle moltiplicazioni di matrici e li gestiscono in una fase preliminare, anziché elaborarli in un ciclo. Migliora inoltre l’ottimizzazione «hoist row ids», che ora viene sempre eseguita e può generare più tile compatti. Queste modifiche consentono alla GPU di avviare meno gruppi di lavoro e, quando possibile, di interrompere l’elaborazione in anticipo.
Perché conta
Chi usa llama.cpp su GPU può ottenere un’inferenza più veloce, perché la libreria evita di ripetere gli stessi calcoli.