Oossa

llama.cpp ottimizza le righe duplicate su Vulkan

La libreria open source per l’inferenza LLaMA evita calcoli ridondanti quando le righe sulla GPU si ripetono, migliorando le prestazioni sui dispositivi Vulkan.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il progetto llama.cpp ha rilasciato la versione b11554 il 2026‑10‑11. L’aggiornamento introduce correzioni specifiche per Vulkan che rilevano gli ID di riga duplicati nelle moltiplicazioni di matrici e li gestiscono in una fase preliminare, anziché elaborarli in un ciclo. Migliora inoltre l’ottimizzazione «hoist row ids», che ora viene sempre eseguita e può generare più tile compatti. Queste modifiche consentono alla GPU di avviare meno gruppi di lavoro e, quando possibile, di interrompere l’elaborazione in anticipo.

Perché conta

Chi usa llama.cpp su GPU può ottenere un’inferenza più veloce, perché la libreria evita di ripetere gli stessi calcoli.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.