Oossa

llama.cpp migliora l’efficienza delle moltiplicazioni MoE

L’aggiornamento del 30 settembre 2026 ottimizza la scelta delle tile Vulkan, riducendo il lavoro sprecato nei modelli Mixture-of-Experts.

BreveOossaPubblicato da Oossa: 1 min di lettura

La libreria open source llama.cpp ha introdotto una correzione Vulkan per le moltiplicazioni di matrici ottimizzate per MoE. La modifica adegua il modo in cui il codice sceglie le dimensioni delle tile per l’operazione mat_mul_id, così da corrispondere al numero effettivo di righe attive per esperto. In un test su un modello da 30 miliardi di parametri, la correzione ha ridotto il lavoro inutile della GPU, che prima occupava il 55% del tempo di esecuzione.

Perché conta

Meno tempo della GPU sprecato significa inferenza più rapida per i grandi modelli MoE eseguiti su hardware compatibile con Vulkan.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.