La libreria open source llama.cpp ha introdotto una correzione Vulkan per le moltiplicazioni di matrici ottimizzate per MoE. La modifica adegua il modo in cui il codice sceglie le dimensioni delle tile per l’operazione mat_mul_id, così da corrispondere al numero effettivo di righe attive per esperto. In un test su un modello da 30 miliardi di parametri, la correzione ha ridotto il lavoro inutile della GPU, che prima occupava il 55% del tempo di esecuzione.
Perché conta
Meno tempo della GPU sprecato significa inferenza più rapida per i grandi modelli MoE eseguiti su hardware compatibile con Vulkan.