Il team ggml-org ha rilasciato la versione b11480 di llama.cpp il 2026-10-08. L’aggiornamento aggiunge una cache GPU per gli esperti MoE, collocata nella memoria host, che aiuta a eseguire più velocemente i modelli di grandi dimensioni sulle GPU. La modifica è contrassegnata come assistita da Claude e utilizza una nuova API, llama_moe_cache_ptr. Sono disponibili per il download binari precompilati per macOS, iOS e diverse configurazioni di Ubuntu.
Perché conta
Gli sviluppatori possono ora eseguire i modelli MoE in modo più efficiente sulle GPU consumer, riducendo i costi hardware dei progetti di IA.