Oossa

llama.cpp supporta la cache MoE su più GPU

La libreria open source llama.cpp consente ora di eseguire modelli mixture-of-experts su più GPU.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team ggml-org ha pubblicato la versione b11507 di llama.cpp l'8 ottobre 2026. L'aggiornamento aggiunge il supporto per una cache mixture-of-experts (MoE) distribuita su più GPU. Gli sviluppatori possono così eseguire modelli MoE più grandi senza doverli caricare interamente su una sola scheda. La versione include anche nuovi pacchetti binari per macOS, iOS e diverse configurazioni Linux, tra cui il supporto per CUDA 12.8.

Perché conta

Gli sviluppatori possono ora eseguire modelli di IA più grandi e capaci su sistemi con più GPU, ampliando ciò che è possibile fare con l'hardware personale.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.