Oossa

llama.cpp aggiunge una cache GPU per gli esperti MoE

La libreria open source llama.cpp ora archivia i dati del mixture of experts (MoE) in una cache GPU mantenuta nella memoria host.

BreveDi Pubblicato da Oossa: Ultimo aggiornamento: 1 min di lettura

Il team ggml-org ha rilasciato la versione b11480 di llama.cpp il 2026-10-08. L’aggiornamento aggiunge una cache GPU per gli esperti MoE, collocata nella memoria host, che aiuta a eseguire più velocemente i modelli di grandi dimensioni sulle GPU. La modifica è contrassegnata come assistita da Claude e utilizza una nuova API, llama_moe_cache_ptr. Sono disponibili per il download binari precompilati per macOS, iOS e diverse configurazioni di Ubuntu.

Perché conta

Gli sviluppatori possono ora eseguire i modelli MoE in modo più efficiente sulle GPU consumer, riducendo i costi hardware dei progetti di IA.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.