# llama.cpp migliora l’efficienza delle moltiplicazioni MoE

> L’aggiornamento del 30 settembre 2026 ottimizza la scelta delle tile Vulkan, riducendo il lavoro sprecato nei modelli Mixture-of-Experts.

Oossa · 2026-09-29 · https://oossa.com/it/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

Prodotto e tradotto con l’aiuto dell’IA. Consulta le fonti originali qui sotto.

La libreria open source llama.cpp ha introdotto una correzione Vulkan per le moltiplicazioni di matrici ottimizzate per MoE. La modifica adegua il modo in cui il codice sceglie le dimensioni delle tile per l’operazione mat_mul_id, così da corrispondere al numero effettivo di righe attive per esperto. In un test su un modello da 30 miliardi di parametri, la correzione ha ridotto il lavoro inutile della GPU, che prima occupava il 55% del tempo di esecuzione.

## I fatti

- La versione b11265 è stata pubblicata il 30 settembre 2026
- Nel test con Sarvam 30B, il lavoro sprecato è sceso dal 55% a quasi zero

## Perché conta

Meno tempo della GPU sprecato significa inferenza più rapida per i grandi modelli MoE eseguiti su hardware compatibile con Vulkan.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Ultimo aggiornamento: 2026-09-29
