# llama.cpp supporta la cache MoE su più GPU

> La libreria open source llama.cpp consente ora di eseguire modelli mixture-of-experts su più GPU.

Oossa · 2026-10-08 · https://oossa.com/it/llama-cpp-adds-multi-gpu-moe-cache-support

Il team ggml-org ha pubblicato la versione b11507 di llama.cpp l'8 ottobre 2026. L'aggiornamento aggiunge il supporto per una cache mixture-of-experts (MoE) distribuita su più GPU. Gli sviluppatori possono così eseguire modelli MoE più grandi senza doverli caricare interamente su una sola scheda. La versione include anche nuovi pacchetti binari per macOS, iOS e diverse configurazioni Linux, tra cui il supporto per CUDA 12.8.

## I fatti

- Versione b11507 pubblicata il 2026-10-08
- Aggiunge una cache MoE distribuita su più GPU

## Perché conta

Gli sviluppatori possono ora eseguire modelli di IA più grandi e capaci su sistemi con più GPU, ampliando ciò che è possibile fare con l'hardware personale.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Ultimo aggiornamento: 2026-10-08
