# llama.cpp aggiunge una cache GPU per gli esperti MoE

> La libreria open source llama.cpp ora archivia i dati del mixture of experts (MoE) in una cache GPU mantenuta nella memoria host.

Oossa · 2026-10-08 · https://oossa.com/it/llama-cpp-adds-gpu-cache-for-moe-experts

Il team ggml-org ha rilasciato la versione b11480 di llama.cpp il 2026-10-08. L’aggiornamento aggiunge una cache GPU per gli esperti MoE, collocata nella memoria host, che aiuta a eseguire più velocemente i modelli di grandi dimensioni sulle GPU. La modifica è contrassegnata come assistita da Claude e utilizza una nuova API, llama_moe_cache_ptr. Sono disponibili per il download binari precompilati per macOS, iOS e diverse configurazioni di Ubuntu.

## I fatti

- Versione rilasciata: b11480
- Data di rilascio: 2026-10-08

## Perché conta

Gli sviluppatori possono ora eseguire i modelli MoE in modo più efficiente sulle GPU consumer, riducendo i costi hardware dei progetti di IA.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Ultimo aggiornamento: 2026-10-08
